Wie Greedy Decoding funktioniert

In jedem Generierungsschritt erzeugt das Modell eine Wahrscheinlichkeitsverteilung über sein Vokabular. Beim Greedy Decoding wird ohne Bedingung das Token mit der höchsten Wahrscheinlichkeit gewählt: kein Sampling, kein Zufall. Der nächste Schritt baut auf diesem Token auf, erzeugt eine neue Verteilung und nimmt wieder das Maximum. Das geht so weiter, bis das Modell ein Stopp-Token ausgibt oder das Ausgabelimit erreicht.

Greedy Decoding lösen Sie aus, indem Sie Temperature auf 0 setzen. Die Verteilung schrumpft dann auf eine einzige Spitze beim wahrscheinlichsten Token. Denselben Effekt hat es, Top-k auf 1 zu setzen, weil der Filter dann nur einen Kandidaten übrig lässt. In beiden Fällen wird der Zufallsgenerator nie abgefragt, und dieselbe Eingabe ergibt immer dieselbe Ausgabe. Das gilt unter der Voraussetzung, dass die numerischen Bedingungen auf der Hardware identisch sind.

Das Problem der Wiederholungsschleifen

Die Determiniertheit ist der Reiz von Greedy Decoding und zugleich seine Schwachstelle. Weil das Modell immer den wahrscheinlichsten Weg nimmt, kann es sich festfahren. Führt eine Folge von Token in ein Muster, in dem Wiederholen oder Umformulieren die wahrscheinlichste Fortsetzung ist, folgt Greedy Decoding diesem Weg endlos. Sampling würde gelegentlich ein weniger wahrscheinliches Token wählen und so ausbrechen. Greedy Decoding kann das nicht.

Wir haben das bei Reasoning-Modellen direkt beobachtet: Bei Temperature 0 löste ein Modell ein Logikrätsel korrekt und geriet dann in eine endlose Synonymschleife. Es formulierte seine Schlussfolgerung immer wieder mit anderen Worten, bis es das Token-Limit erreichte. Mit den Einstellungen, die der Herausgeber empfiehlt (Temperature 1.0 mit Top-p und Top-k), liefen dieselben Prompts normal durch. Die Schleife ist ein Fixpunkt in der Wahrscheinlichkeitsverteilung des Modells. Sampling kann ihm entkommen, Greedy Decoding nicht.

Wann es sinnvoll ist und wann nicht

Greedy Decoding passt zu Aufgaben, bei denen Konsistenz wichtiger ist als Vielfalt und die Ausgabe kurz oder stark eingeschränkt ist: Klassifikationslabels, strukturierte Extraktion oder JSON-Ausgabe über Constrained Decoding. Für offene Texte, Reasoning oder jede Aufgabe, bei der das Modell in ein sich selbst verstärkendes Muster geraten könnte, verwenden Sie stattdessen die Sampling-Parameter, die der Herausgeber empfiehlt. Wenn Sie auf Infercom Temperature weglassen, nutzen die meisten Modelle Greedy Decoding. Deshalb warnt unsere Dokumentation, den Parameter immer explizit zu setzen.

Quellen

Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.

Technologie entdecken