Zum Hauptinhalt

Diffusion Model

Ein Diffusion Model ist ein generatives KI-Modell, das Daten (meist Bilder) erzeugt, indem es schrittweise gelerntes Rauschen umkehrt – von zufälligem Noise zu einem kohärenten Output.

AIFortgeschrittengenerative-aiimage-generationdeep-learning

Was ist ein Diffusion Model?

Diffusion Models sind eine Klasse generativer neuronaler Netze, die auf einem zweistufigen Prozess basieren:

  1. Forward Process (Noising): Trainingsdaten werden schrittweise mit Gaussian Noise überlagert, bis nur noch zufälliges Rauschen übrig bleibt.
  2. Reverse Process (Denoising): Das Modell lernt, diesen Prozess umzukehren – also aus Rauschen schrittweise ein sinnvolles Bild (oder Audio, Video, etc.) zu rekonstruieren.

Bekannte Implementierungen sind Stable Diffusion, DALL-E und Midjourney.

Wie funktioniert das technisch?

Der Kern ist ein U-Net (oder neuere Transformer-Architekturen wie DiT), das bei jedem Denoising-Schritt t das Rauschen im aktuellen Bild vorhersagt:

# Vereinfachtes Beispiel mit der diffusers-Bibliothek (Hugging Face)
from diffusers import StableDiffusionPipeline
import torch

pipe = StableDiffusionPipeline.from_pretrained(
    "runwayml/stable-diffusion-v1-5",
    torch_dtype=torch.float16
)
pipe = pipe.to("cuda")

prompt = "A futuristic cityscape at sunset, photorealistic"
negative_prompt = "blurry, low quality, distorted"

image = pipe(
    prompt=prompt,
    negative_prompt=negative_prompt,
    num_inference_steps=30,  # Anzahl der Denoising-Schritte
    guidance_scale=7.5       # Wie stark der Prompt gewichtet wird (CFG)
).images[0]

image.save("output.png")

Wichtige Parameter für Entwickler

ParameterBedeutung
num_inference_stepsMehr Schritte = bessere Qualität, aber langsamer
guidance_scale (CFG)Höher = stärker am Prompt orientiert, aber weniger kreativ
seedReproduzierbarkeit der Ergebnisse
schedulerAlgorithmus für den Denoising-Prozess (DDIM, PNDM, DPM++)

Latent Diffusion Models (LDM)

Moderne Modelle wie Stable Diffusion arbeiten nicht im Pixel-Raum, sondern im Latent Space – einem komprimierten Repräsentationsraum. Ein VAE (Variational Autoencoder) kodiert Bilder zunächst in diesen Latent Space, was den Rechenaufwand drastisch reduziert.

Abgrenzung zu GANs

Im Vergleich zu GANs sind Diffusion Models stabiler im Training (kein Mode Collapse), produzieren diversere Outputs, sind aber langsamer bei der Inferenz – da viele Denoising-Schritte nötig sind.

Praxiseinsatz

  • Bildgenerierung: Text-to-Image (Stable Diffusion, DALL-E 3)
  • Inpainting/Outpainting: Bildteile ersetzen oder erweitern
  • Image-to-Image: Stil-Transfer oder Variationen eines Ausgangsbilds
  • Audio & Video: Diffusion-Prinzip wird zunehmend für Sora, MusicGen etc. genutzt

Inhouse statt Nachschlagewerk

Für den Transfer ins Unternehmen sind die Inhouse-Schulungen der passende nächste Schritt.