Generative Bildmodelle: GANs und Diffusionsmodelle

LektionGenerative Bildmodelleca. 3 Min. Lesezeit

Begriffe vorab

  • Latenter Raum: eine komprimierte, abstrakte Darstellung, aus der Bilder erzeugt werden können.
  • Prompt: die textliche Beschreibung, die ein Bildmodell steuert.
  • Sampling: das Erzeugen eines neuen Beispiels aus dem Modell.

Generative Adversarial Networks (GANs)

GANs (Goodfellow et al., 2014) bestehen aus zwei gegeneinander trainierten neuronalen Netzen: einem Generator, der versucht, möglichst realistisch wirkende Bilder zu erzeugen, und einem Diskriminator, der versucht, echte von generierten Bildern zu unterscheiden. Beide werden gemeinsam trainiert: Wird der Generator besser, muss der Diskriminator mitziehen, und umgekehrt – ein Wettstreit, der im Idealfall zu immer realistischeren generierten Bildern führt.

Diffusionsmodelle

Diffusionsmodelle (u. a. Ho, Jain, Abbeel, 2020, „Denoising Diffusion Probabilistic Models“) verfolgen einen anderen Ansatz: Beim Training wird einem echten Bild schrittweise Rauschen hinzugefügt, bis reines Rauschen übrig bleibt. Das Modell lernt, diesen Prozess umzukehren – aus reinem Rauschen Schritt für Schritt ein Bild zu „entrauschen“. Zur Bilderzeugung startet man mit zufälligem Rauschen und lässt das Modell es iterativ in ein Bild verwandeln.

Warum Diffusionsmodelle GANs in vielen Anwendungen abgelöst haben

GANs sind wegen des gegenläufigen Trainings zweier Netze oft instabil zu trainieren (ein Problem ist etwa der „Mode Collapse“, bei dem der Generator nur noch wenige Variationen erzeugt). Diffusionsmodelle gelten als tendenziell stabiler zu trainieren und liefern bei vielen Bildgenerierungsaufgaben eine höhere Detailvielfalt, benötigen dafür aber typischerweise mehr Rechenschritte zur Erzeugung eines einzelnen Bildes.

Textgesteuerte Bildgenerierung

Kombiniert man ein solches generatives Bildmodell mit einem Sprachmodell oder einer gemeinsamen Text-Bild-Repräsentation, lässt sich die Bilderzeugung durch eine Textbeschreibung steuern (Text-to-Image) – die Grundlage moderner Bildgenerierungssysteme.

Generative Bildmodelle werfen eigene Fragen auf: Urheberrecht an Trainingsbildern, die Möglichkeit, täuschend echte Fälschungen (Deepfakes) zu erzeugen, und die Frage, wie erzeugte Bilder als solche kennzeichenbar bleiben – vertieft in der Lektion zu Ethik & Gesellschaft.

Ein Beispiel für den Ablauf bei Diffusion

Zum Training wird ein Foto in vielen Schritten verrauscht, bis nur noch Rauschen übrig ist; das Modell lernt, jeden Schritt rückgängig zu machen. Zur Erzeugung startet man mit reinem Rauschen und entrauscht es Schritt für Schritt, geführt durch einen Text wie „ein Leuchtturm bei Sonnenuntergang“. Jeder Durchlauf mit anderem Startrauschen ergibt ein anderes Bild.

Stärken und Schwächen

  • Stärken: hohe Bildqualität, große stilistische Vielfalt, textgesteuerte Bedienung.
  • Schwächen: Schwierigkeiten bei Details wie Händen oder Schrift, Verzerrungen aus den Trainingsdaten, hoher Rechenbedarf.

Verantwortungsvoll einsetzen

Erzeugte Bilder sollten als solche gekennzeichnet werden, wo Täuschung möglich ist. Bei Bildern realer Personen sind Persönlichkeitsrechte zu beachten, bei der Nutzung fremder Stile und Werke urheberrechtliche Fragen, die rechtlich teils noch nicht abschließend geklärt sind.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Goodfellow et al. – „Generative Adversarial Nets“ (NIPS, 2014)
  • Ho, Jain, Abbeel – „Denoising Diffusion Probabilistic Models“ (NeurIPS, 2020)

Alles zu „Generative Bildmodelle“