Come funziona il top-p

Dopo che temperature ha rimodellato la distribuzione di probabilità, il top-p la filtra. I token vengono ordinati per probabilità e il filtro continua ad aggiungerne dall'alto finché la probabilità cumulativa non raggiunge p. Tutto ciò che sta sotto quella soglia viene eliminato e le probabilità rimaste vengono rinormalizzate. Il sampling pesca poi dall'insieme ridotto.

Un esempio con top_p=0.9: se il token più probabile ha il 92%, sopravvive solo quel token, perché il modello è sicuro e il nucleo è stretto. Se invece il primo token ha il 40%, il secondo il 30%, il terzo il 15% e così via, il filtro continua ad aggiungere token finché la somma non supera il 90%, e il pool si allarga. Per questo il top-p si adatta alla sicurezza del modello, mentre il top-k no: la stessa soglia produce pool di dimensioni diverse a seconda di quanto è distribuita la probabilità.

Top-p vs. top-k

Il top-k fissa la dimensione del pool: tiene sempre k token, a prescindere da come sono distribuite le probabilità. Il top-p fissa la massa di probabilità cumulativa: tiene tutti i token necessari a coprire la quota p. Quando il modello è sicuro, il top-k può includere molti più candidati del necessario. Quando è incerto, può tagliare in modo troppo aggressivo. Il top-p gestisce entrambi i casi con un solo parametro.

Nella pratica, molti modelli vengono pubblicati con la raccomandazione di usarli entrambi: il top-p come filtro principale (0.9-0.95 è un valore comune) e il top-k come tetto rigido (40-100), per coprire i casi limite in cui anche il nucleo è molto ampio. Temperature, top-p e top-k formano insieme una pipeline in tre fasi: rimodellare la distribuzione, tagliare per probabilità cumulativa, limitare il numero.

Valori raccomandati

Per i modelli sovrani UE di Infercom, i valori raccomandati da chi li pubblica sono: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (nessun filtro), gemma-4-31B-it top_p 0.95. Un top_p di 1.0 significa che in questa fase non si filtra nulla: passa l'intera distribuzione. Valori più bassi restringono il nucleo, mentre valori sotto 0.5 sono insoliti e rischiano di vincolare troppo l'output. Trovi il riferimento completo dei parametri nella nostra documentazione API.

Fonti

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza, e perché abbiamo scelto di costruirci sopra.

Esplora la tecnologia