Wie Top-k funktioniert
Nachdem Temperature die Wahrscheinlichkeitsverteilung angepasst hat, filtert Top-k nach Rang. Die k Token mit den höchsten Wahrscheinlichkeiten bleiben, alle anderen werden auf null gesetzt. Die verbleibenden Wahrscheinlichkeiten werden so renormalisiert, dass sie zusammen 1 ergeben, und das Sampling zieht aus dieser Menge. Typische Werte für k liegen je nach Modell und Anwendungsfall zwischen 10 und 100.
Im Extremfall top_k=1 bleibt nur das eine wahrscheinlichste Token übrig. Das entspricht in der Wirkung Greedy Decoding. Im anderen Extremfall entspricht top_k der vollen Größe des Vokabulars, und es wird gar nicht gefiltert. Dazwischen wirkt Top-k als harte Grenze dafür, wie weit das Modell in den Schwanz der Wahrscheinlichkeitsverteilung greifen kann.
Warum Top-k oft mit Top-p kombiniert wird
Die feste Poolgröße ist zugleich die Stärke und die Schwäche von Top-k. Sie garantiert, dass das Modell nicht aus extrem unwahrscheinlichen Token sampelt, und verhindert so manche Form zusammenhangloser Ausgabe. Aber sie passt sich nicht an. Ist das Modell sehr sicher (ein Token mit 95%), behält k=50 trotzdem 50 Kandidaten, obwohl 49 davon Rauschen sind. Ist das Modell unsicher (viele Token mit ähnlicher Wahrscheinlichkeit), kann dasselbe k Optionen abschneiden, die durchaus plausibel waren.
Top-p löst dieses Problem, indem es die Poolgröße an die Form der Verteilung anpasst. In der Praxis empfehlen die Herausgeber der Modelle oft beides: Top-p als anpassungsfähigen Filter (Token behalten, bis zusammen 95% Wahrscheinlichkeit erreicht sind) und Top-k als Sicherheitsgrenze (nie mehr als 40-100 Kandidaten). Beide Filter greifen nacheinander, nach Temperature. So entsteht eine Pipeline aus drei Schritten: umformen, nach Wahrscheinlichkeitsmasse kürzen, nach Anzahl begrenzen.
Empfohlene Werte
Für die EU-souveränen Modelle auf Infercom empfehlen die Herausgeber diese Top-k-Werte: MiniMax-M2.7 top_k 40, gemma-4-31B-it top_k 64. Für gpt-oss-120b gibt es keine Empfehlung für Top-k. Das Modell verlässt sich allein auf Temperature und Top-p. Wenn Sie unsicher sind, beginnen Sie mit der Empfehlung des Herausgebers. Oder Sie lassen top_k weg und überlassen die Filterung Top-p.
Quellen
Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.
Technologie entdecken