Wie Top-p funktioniert

Nachdem Temperature die Wahrscheinlichkeitsverteilung umgeformt hat, filtert Top-p sie. Die Token werden nach Wahrscheinlichkeit sortiert. Der Filter nimmt von oben so lange Token hinzu, bis die kumulative Wahrscheinlichkeit p erreicht ist. Alles unterhalb dieser Linie fällt weg, und die verbleibenden Wahrscheinlichkeiten werden renormalisiert. Das Sampling zieht dann aus der verkleinerten Menge.

Ein Beispiel mit top_p=0.9: Hat das wahrscheinlichste Token 92%, bleibt nur dieses eine Token übrig. Das Modell ist sicher, und der Kern ist eng. Hat das wahrscheinlichste Token dagegen 40%, das nächste 30%, das übernächste 15% und so weiter, nimmt der Filter so lange Token hinzu, bis die Summe 90% übersteigt. Der Pool wird größer. Deshalb passt sich Top-p an die Sicherheit des Modells an, Top-k dagegen nicht: Derselbe Schwellenwert ergibt je nach Streuung der Verteilung unterschiedlich große Pools.

Top-p vs. Top-k

Top-k legt die Größe des Pools fest: Es behält genau k Token, egal wie die Wahrscheinlichkeiten verteilt sind. Top-p legt die kumulative Wahrscheinlichkeitsmasse fest: Es behält so viele Token, wie nötig sind, um den Anteil p abzudecken. Ist das Modell sicher, nimmt Top-k womöglich weit mehr Kandidaten auf als nötig. Ist das Modell unsicher, schneidet es womöglich zu viel ab. Top-p deckt beide Fälle mit einem einzigen Parameter ab.

In der Praxis empfehlen viele Herausgeber, beides zu nutzen: Top-p als primären Filter (üblich sind 0.9-0.95) und Top-k als harte Obergrenze (40-100). Die Obergrenze fängt Randfälle ab, in denen selbst der Kern sehr groß ist. Temperature, Top-p und Top-k bilden zusammen eine dreistufige Pipeline: Verteilung umformen, nach kumulativer Wahrscheinlichkeit kürzen, Anzahl begrenzen.

Empfohlene Werte

Für die EU-souveränen Modelle auf Infercom empfehlen die Herausgeber diese Werte: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (keine Filterung), gemma-4-31B-it top_p 0.95. Ein top_p von 1.0 bedeutet, dass in diesem Schritt nichts gefiltert wird: Die vollständige Verteilung geht durch. Niedrigere Werte verengen den Kern. Werte unter 0.5 sind ungewöhnlich und können die Ausgabe zu stark einschränken. Die vollständige Parameterreferenz finden Sie in unserer API-Dokumentation.

Quellen

Erfahren Sie, wie die Dataflow-Architektur von SambaNova die Wirtschaftlichkeit der Inferenz verändert und warum wir auf ihr aufbauen.

Technologie entdecken