Was Temperature bewirkt
Wenn ein LLM ein Token erzeugt, berechnet es zuerst einen Rohwert (Logit) für jedes Token in seinem Vokabular. Diese Rohwerte wandelt die Softmax-Funktion dann in Wahrscheinlichkeiten um. Temperature greift genau in diese Umwandlung ein: Jedes Logit wird vor dem Softmax durch T geteilt. Das skaliert die Wahrscheinlichkeitsverteilung um. Ein T unter 1 schärft die Spitzen, ein T über 1 glättet die Verteilung.
Ein häufiges Missverständnis: Temperature 1.0 bedeutet nicht "maximale Zufälligkeit", sondern den Ausgangswert, also die Verteilung, die das Modell im Training gelernt hat. Man kann es mit dem Kontrast eines Fotos vergleichen: T=1 ist das Original, jeder andere Wert eine Bearbeitung. Die Herausgeber der Modelle empfehlen meist T=1.0, kombiniert mit Top-p und Top-k, um den langen Schwanz unwahrscheinlicher Token abzuschneiden.
Warum T=0 für Reasoning-Modelle riskant ist
Bei Temperature 0 gibt es kein Sampling. Das Modell wählt deterministisch jedes Mal das wahrscheinlichste Token. Das klingt nach Konsistenz, bringt aber eine eigene Fehlerquelle mit: Gerät das Modell in ein Muster, das sich selbst verstärkt, kommt es nicht mehr heraus. Sampling bietet einen Ausweg, Greedy Decoding nicht. Wir haben beobachtet, wie Reasoning-Modelle bei T=0 in endlose Synonymschleifen gerieten. Sie lösten ein Problem korrekt und formulierten ihre Schlussfolgerung danach immer wieder neu, bis sie das Token-Limit erreichten.
Deshalb warnt unsere Dokumentation: Setzen Sie Temperature immer explizit, und verwenden Sie den Wert, den der Herausgeber des Modells empfiehlt. Fehlt der Parameter, nutzen die meisten Modelle Greedy Decoding (T=0). Bei Reasoning-Workloads droht dann eine Schleife, die nicht endet. Die Infercom-API setzt keinen plattformweiten Standardwert, die Entscheidung bleibt also bei Ihnen.
Praktische Empfehlungen
Für die EU-souveränen Modelle auf Infercom verwenden Sie die Werte, die der Herausgeber empfiehlt: Für MiniMax-M2.7 sind das Temperature 1.0, top_p 0.95 und top_k 40, für gpt-oss-120b Temperature 1.0 und top_p 1.0. Wenn Sie fokussiertere Ausgaben wollen, senken Sie Temperature auf 0.3-0.7 statt auf null. So verringern Sie die Streuung, ohne die Fehlerquellen von Greedy Decoding auszulösen. Und bedenken Sie: Selbst bei T=0 sind byte-identische Ausgaben über verteilte Inferenz hinweg nicht garantiert. Gleitkomma-Abweichungen in parallelen Berechnungen können knappe Entscheidungen kippen.
Quellen
Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.
Technologie entdecken