Du denkst bestimmt, dass jedes Large Language Model (LLM) auf die gleiche Weise funktioniert: Schritt für Schritt wird ein Token nach dem anderen generiert, von links nach rechts. Dieses Bild ist so fundamental damit verknüpft, wie wir über LLMs nachdenken, dass man leicht übersieht, dass es noch andere Wege gibt, Text zu generieren.
Wie könnte eine solche Alternative aussehen? Denk mal darüber nach, wie man programmiert: Man schreibt eine Methode nicht einfach von links nach rechts fertig. Oft beginnt man mit der Methodensignatur, füllt den Rumpf aus und merkt dabei, dass man die Signatur oder einzelne Variablen noch einmal anpassen muss. So entsteht der Code iterativ. Man springt zwischen verschiedenen Stellen hin und her und verbessert ihn Schritt für Schritt.
Diffusion Language Models (DLMs) funktionieren recht ähnlich: Sie starten mit einer Sequenz von Platzhaltern und verbessern sie Schritt für Schritt. Dabei können sie mehrere Positionen gleichzeitig ausfüllen und frühere Entscheidungen überarbeiten, sobald der Kontext klarer wird.
In diesem Blogpost zeige ich dir, wie Diffusion Language Models funktionieren, wo sie heute stehen und wofür du sie nutzen kannst.
Autoregressive Modelle: Eine kurze Erinnerung
Alle aktuellen State-of-the-Art LLMs generieren Text von links nach rechts. Formal ausgedrückt: Sie funktionieren autoregressiv. Für jeden neu erzeugten Token müssen wir das komplette Modell durchlaufen. Dabei sind häufig Hunderte Milliarden Parameter beteiligt, um diesen einen neuen Token zu generieren. Sobald er erzeugt wurde, beginnt der Prozess wieder von vorne.
Dieser Ansatz hat zwei Schwächen
Ineffizienz. Denk an das Programmierbeispiel zurück. Eine Vielzahl von Tokens folgt repetitiven Mustern und ist als Gruppe oft sehr vorhersehbar. Trotzdem muss das Modell jeden Token einzeln und Schritt für Schritt generieren. Das macht die Generierung langsam und führt dazu, dass das Modell jedes Mal enorme Ressourcen aufwenden muss, selbst wenn die nächsten Tokens offensichtlich sind.
Keine Möglichkeit zur Selbstkorrektur. Weil die Generierung immer nur nach vorne läuft, kann das Modell nicht zurückgehen und früheren Text ändern, wenn sich später herausstellt, dass eine frühere Entscheidung nicht optimal war. Der Attention-Mechanismus dieser Modelle schaut dabei immer nur zurück (causal attention). Informationen fließen also nur von der Vergangenheit zum nächsten Token. Einmal generierter Kontext ist damit festgelegt und kann im Nachhinein nicht mehr angepasst werden.
Aber um es klarzustellen: Dieses Paradigma funktioniert ausgezeichnet gut, wie wir alle in unserer täglichen Arbeit erleben können. Außerdem gibt es mittlerweile auch passende Lösungen für beide Schwächen: Speculative decoding und der KV-Cache machen die Inferenz schneller und effizienter, während ein agentischer Loop mehrfach durchlaufen werden kann, um Probleme zu erkennen und zu korrigieren.
Trotzdem lohnt es sich in diesem schnelllebigen Feld, auch nach anderen Ansätzen zu schauen. Für mich gehören Diffusion Language Models (DLMs) zu den vielversprechendsten Alternativen.
Wie Diffusion Language Models funktionieren
Diffusion wurde zuerst durch die Bildgenerierung bekannt. Dort steckt der Ansatz hinter Stable Diffusion, Midjourney und DALL-E. Diese Modelle beginnen mit einem verrauschten Bild und geben ihm mit jedem Schritt mehr Bedeutung. Sie entfernen das Rauschen schrittweise aus einem Pixelraster, bis das fertige Bild entsteht. Dieser Prozess heißt Denoising.
Das Prinzip lässt sich nicht nur auf Pixel, sondern auch auf Text anwenden.
Das zugrunde liegende Modell ist fast das gleiche wie bei einem autoregressiven LLM. Was sich ändert, sind das Training und die Generierung. Statt Tokens einzeln von links nach rechts zu erzeugen, beginnt ein Diffusion Language Model mit einer Sequenz von Platzhaltern. Je nach Verfahren können das Masken-Tokens oder zufällig aus dem Vokabular gezogene Tokens sein. In beiden Fällen ist der Ausgangspunkt ein weitgehend bedeutungsloser Text. Das entspricht dem verrauschten Bild zu Beginn von Stable Diffusion, nur im Tokenraum.
Schauen wir uns das an einem Verfahren mit Masken-Tokens an. Als Prompt bitten wir das Modell, eine Funktion zu schreiben, die prüft, ob eine Zahl gerade ist. Das Modell sieht den Prompt, gefolgt von einer Reihe von Masken, und sagt für alle maskierten Positionen gleichzeitig Tokens vorher. Warum hören wir dann nicht einfach nach diesem Schritt auf?
Weil das Modell beim ersten Versuch noch keine ausgefüllten Positionen hat, an denen es sich orientieren kann: Für jede Position macht es eine Vermutung, während die anderen Positionen ebenfalls nur Vermutungen sind. Wir brauchen also einen Weg, die guten Teile zu behalten und die schwachen noch einmal zu überdenken. Genau dafür ist Remasking da, also das erneute Maskieren von Positionen. Ein Schritt sieht so aus:
- Du übergibst dem Modell die aktuelle Sequenz: den Prompt, die Masken und alles, was bereits ausgefüllt wurde. Das Modell verarbeitet sie in einem Durchlauf, einem sogenannten Forward Pass.
- Das Modell sagt für jede maskierte Position einen Token vorher, jeweils mit einem Konfidenzwert. Dieser gibt an, wie sicher das Modell bei seiner Vorhersage ist. Du behältst die Vorhersagen mit den höchsten Werten und maskierst die übrigen Positionen erneut. So werden unsichere Vermutungen verworfen, bevor sie Teil der Sequenz werden.
- Das wird wiederholt, bis keine Masken mehr übrig sind.
Im Vergleich zu einem autoregressiven Modell kannst du bei diesem Verfahren deutlich mehr steuern. Du kannst alle Tokens aus der ersten Vorhersage behalten und nach einem einzigen Schritt fertig sein. Das ist sehr schnell, geht aber zulasten der Qualität. Oder du behältst jedes Mal nur den Token mit dem höchsten Konfidenzwert und brauchst dann so viele Schritte, wie es Tokens gibt. Dadurch wird das Modell langsamer und ähnelt stärker einem autoregressiven Modell. Ein wichtiger Unterschied bleibt aber: Alle Tokens können sich gegenseitig beeinflussen und dabei Kontext von vorherigen und nachfolgenden Positionen nutzen. Das ist bidirektionale Attention. DLMs geben uns damit die Möglichkeit, das Verhältnis zwischen Ausgabequalität und Inferenzzeit dynamisch zu steuern.
Warum sich ein Blick auf Diffusion Language Models lohnt
DLMs sind längst nicht mehr nur ein akademisches Nischenthema. Google hat Gemini Diffusion, Apple hat DiffuCoder, ByteDance hat Seed-Diffusion. Von kleineren Labs kommen Mercury von Inception Labs und Celeris-1, das im Juli 2026 veröffentlicht wurde.
Die erste systematische Untersuchung von Diffusionsmodellen für Code (Li et al. 2025) beschreibt zwei zentrale Vorteile gegenüber autoregressiven Modellen.
Vorhersage mehrerer Tokens. Ein Diffusionsmodell legt pro Forward Pass mehrere Tokens fest statt nur eines. Auf Artificial Analysis stehen Diffusionsmodelle aktuell an der Spitze des Geschwindigkeitsbenchmarks. Celeris-1 ist mit 1.523 Tokens/s das schnellste Modell, gefolgt von Mercury-2.5 mit 690 Tokens/s. Zum Vergleich: Das schnellste autoregressive Modell im selben Benchmark erreicht 227 Tokens/s. Das macht diese Modelle für agentische Systeme interessant, bei denen die Antwortzeit der begrenzende Faktor ist, etwa für Sprachagenten.
Flexible Reihenfolge bei der Generierung. Diffusionsmodelle können Tokens in beliebiger Reihenfolge erzeugen, nicht nur von links nach rechts. Das Modell sieht bei jedem Schritt die gesamte Sequenz, einschließlich späterer Positionen. Beim Programmieren kann also das Ende einer Funktion deren Anfang beeinflussen. Ein autoregressives Modell kann das nicht: Sobald es eine Funktionssignatur geschrieben hat, muss es damit weiterarbeiten, auch wenn sich beim Schreiben des Rumpfs herausstellt, dass ein anderer Parameter nötig wäre. Deshalb eignen sich Diffusionsmodelle auch dafür, Lücken in bestehendem Code auszufüllen. Die neuen Zeilen müssen sowohl zum Code davor als auch zum Code danach passen. Das Gleiche gilt für strukturierte Ausgaben. Weil das Modell in jedem Schritt die gesamte Struktur sieht, kann es eine unsichere Vorhersage für eine Klammer oder ein Feld in einem JSON-Objekt oder Tool Call noch einmal überdenken, bevor die Ausgabe fertig ist.
Aktuelle Grenzen und Entwicklungsrichtungen
Das klingt vielversprechend. Warum haben DLMs dann nicht mehr Aufmerksamkeit?
Qualität. Die naheliegende Antwort ist, dass DLMs bei Weitem nicht so gut abschneiden wie ihre autoregressiven Gegenstücke. Das ist aber nicht das vollständige Bild. Bei vergleichbarer Modellgröße zeigen DLMs auf mehreren Benchmarks durchaus konkurrenzfähige Ergebnisse (LLaDA, Li et al.). Auch wenn sie die Leistung aktueller State-of-the-Art-Modelle noch nicht erreichen, könnte sich das mit größerer Skalierung, mehr Forschung und mehr Rechenleistung ändern.
Das Forschungsfeld ist noch jung. Autoregressive Generierung war zuerst da. Über Jahre floss nahezu die gesamte Forschungsinvestition in ihre Verbesserung. Die Trainingsverfahren und das über Jahre gesammelte Wissen der Community, auf das autoregressive Modelle zurückgreifen können, werden für Diffusion also noch erarbeitet. Man kann aber bereits sehen, dass die Entwicklung an Fahrt aufnimmt: Arbeiten zu DLMs erscheinen inzwischen auf NeurIPS, ICLR und ICML. Im Dezember finden auf der NeurIPS erstmals zwei eigene DLM-Workshops statt. Außerdem hat vLLM im Juni 2026 native Unterstützung für Diffusion ergänzt.
Feste Ausgabelänge. Wie dir im Beispiel vielleicht aufgefallen ist, muss das Modell bei dem beschriebenen Verfahren vorab wissen, wie viele Tokens es erzeugen soll. Das ist für Code oder Text nicht immer praktisch, weil sich die Länge der Ausgabe oft schwer vorhersagen lässt. Ist die gewählte Länge zu kurz, reicht der Platz möglicherweise nicht für eine vollständige Antwort. Eine zu großzügig gewählte Länge kann dagegen unnötigen Rechenaufwand verursachen. Block Diffusion (Arriola et al. 2025) begegnet diesem Problem, indem es beide Paradigmen kombiniert: autoregressive Generierung auf Blockebene und Diffusion innerhalb jedes Blocks. Du fügst einfach weitere Blöcke hinzu, bis die Ausgabe fertig ist. So erhält das Modell über die Blöcke hinweg den zusammenhängenden Links-nach-rechts-Verlauf der autoregressiven Generierung und innerhalb der Blöcke die Flexibilität der parallelen Generierung durch Diffusion.
Quelle: https://arxiv.org/pdf/2503.09573
Praxis
Ein DLM über die API aufrufen
Als Nächstes zeige ich dir, wie du ein solches Modell verwendest. Dabei ändert sich erstaunlich wenig gegenüber autoregressiven Modellen. Inception und die meisten anderen Anbieter stellen OpenAI-kompatible Endpunkte bereit. Wenn du bereits die OpenAI-API nutzt, musst du in der Regel nur die Base-URL und den Modellnamen ändern.
Im folgenden Beispiel verwende ich das SDK von Inception und das Modell mercury-2.5, das ich bereits beim Geschwindigkeitsbenchmark erwähnt habe. Mit diffusing=True bekommen wir beim Streaming die Zwischenstände der Generierung zu sehen.
Ausgabe:
Wie du siehst, hat das Modell in diesem Beispiel nur drei Denoising-Schritte benötigt, um den fertigen Text zu erzeugen. Ein autoregressives Modell hätte dafür 44 Forward Passes gebraucht, einen für jeden Token.
DLMs als Entscheidungsmodelle
Vor einigen Wochen hat TypeSafe das Entscheidungsmodell JEV veröffentlicht. Wenn du mehr darüber erfahren möchtest, findest du hier eine ausführliche Einordnung. Kurz gesagt: Statt freien Text zu erzeugen, beantwortet ein Entscheidungsmodell typisierte Fragen, etwa mit Ja oder Nein, mit einer Auswahl aus mehreren Optionen oder mit einer Bewertung auf einer Skala. Für jede Antwort gibt es eine Wahrscheinlichkeit zurück.
Als ich davon gehört habe, musste ich direkt an DLMs denken. Ihre Geschwindigkeit und die bidirektionale Attention könnten gerade bei kurzen, strukturierten Antworten nützlich sein.
Wie sich das umsetzen lässt, zeige ich mit celeris-1-decision und dem TypeSafe-Client. Den Client konfiguriere ich so:
Anschließend beschreibst du die Situation als state und stellst deine typisierten Fragen. Ein Noul steht für eine Ja-Nein-Frage, ein Choice wählt eine von mehreren Optionen aus, und ein Score ordnet die Antwort auf einer Skala ein:
Ausgabe:
Wie gut sind sie?
Um ein Gefühl dafür zu bekommen, wie gut Diffusionsmodelle bei solchen Aufgaben abschneiden, habe ich sie außerdem auf dem öffentlichen Benchmark Typed Decisions evaluiert (400 Fälle, 2.000 Entscheidungen). Neben celeris-1-decision habe ich mercury-decide getestet, das Entscheidungsmodell von Inception. Die Ergebnisse waren recht gut: Beide lagen bei der Genauigkeit nahe an den anderen Entscheidungsmodellen und hatten die niedrigsten Latenzen in der Tabelle. celeris-1-decision lag bei der Genauigkeit auf einem ähnlichen Niveau wie Jev, benötigte für die Antworten aber nur etwa ein Drittel der Zeit. Das ist nur ein einzelner Benchmark, aber er zeigt das Potenzial dieser Modelle und die Rolle, die sie in dieser neuen Entwicklung hin zu schnellen Entscheidungsmodellen spielen könnten.
| Model | Accuracy ↑ | p50 Latency |
|---|---|---|
| meraGPT Decider 1 | 0.768 | 526 ms |
| Liquid AI d1 | 0.742 | 525 ms |
| celeris-1-decision (diffusion) | 0.739 | 243 ms |
| TypeSafe Jev 1.13.0 | 0.727 | 710 ms |
| mercury-decide (diffusion) | 0.715 | 409 ms |
Den vollständigen Code einschließlich des Benchmarks und eines ausführlicheren Berichts findest du im begleitenden Repository.
Fazit
DLMs werden autoregressive Modelle nicht von heute auf morgen ersetzen. Ob sie das überhaupt jemals tun werden, ist offen. Sie bieten einen anderen Ansatz: Statt einen Token nach dem anderen zu schreiben, verfeinern sie eine ganze Sequenz parallel. Dabei erzeugen sie mehrere Tokens pro Forward Pass und berücksichtigen auch, was vor und nach einer Textstelle steht. Über die Anzahl der Schritte lässt sich steuern, ob die Antwort möglichst schnell fertig sein soll oder das Modell mehr Zeit bekommt, sie zu verbessern. Das Feld ist noch jung und bietet viel Raum für Verbesserungen.
Aktuell sehe ich das Potenzial von DLMs nicht darin, mit den leistungsfähigsten Modellen mitzuhalten, sondern dort, wo es auf schnelle Antworten oder eine in sich stimmige Ausgabe ankommt. Der Benchmark mit den Entscheidungsmodellen zeigt, wie das aussehen kann. Auch für Änderungen an bestehendem Code, Sprachagenten oder einzelne Schritte in einem agentischen Workflow könnten DLMs interessant sein.
Es würde mich nicht überraschen, wenn Diffusionsmodelle in einem Jahr eine deutlich größere Rolle spielen als heute.
Weitere Artikel in diesem Themenbereich
Entdecke spannende weiterführende Themen und lass dich von der codecentric Welt inspirieren.
Blog-Autor*in
Johannes Widera
GenAI Consultant
Du hast noch Fragen zu diesem Thema? Dann sprich mich einfach an.
Du hast noch Fragen zu diesem Thema? Dann sprich mich einfach an.