Come funziona il top-k
Dopo che temperature ha regolato la distribuzione di probabilità, il top-k filtra per posizione in classifica. I k token con le probabilità più alte restano, gli altri vengono azzerati. Le probabilità rimaste vengono rinormalizzate in modo che la loro somma sia 1, e il sampling pesca da questo insieme. Di solito k si imposta tra 10 e 100, a seconda del modello e del caso d'uso.
Al limite, top_k=1 significa che sopravvive solo il token più probabile, il che equivale di fatto al greedy decoding. All'estremo opposto, un top_k pari all'intero vocabolario significa nessun filtro. Tra questi due estremi, il top-k fa da tetto rigido a quanto il modello può spingersi nella coda della distribuzione.
Perché il top-k si abbina spesso al top-p
La dimensione fissa del pool è insieme il punto di forza e il limite del top-k. Garantisce che il modello non campioni token estremamente improbabili, e questo evita alcune forme di output incoerente. Ma non si adatta. Quando il modello è molto sicuro (un token al 95%), k=50 tiene comunque 50 candidati, anche se 49 sono rumore. Quando il modello è incerto (molti token con probabilità simili), lo stesso k può tagliare opzioni che erano del tutto plausibili.
Il top-p risolve il problema adattando la dimensione del pool alla forma della distribuzione. Nella pratica, chi pubblica i modelli raccomanda spesso di usarli entrambi: il top-p come filtro adattivo (tenere i token che sommano il 95% di probabilità) e il top-k come tetto di sicurezza (mai più di 40-100 candidati). I due filtri si applicano in sequenza dopo temperature, formando una pipeline: rimodellare, tagliare per massa, limitare per numero.
Valori raccomandati
Per i modelli sovrani UE di Infercom, i valori di top-k raccomandati da chi li pubblica sono: MiniMax-M2.7 top_k 40, gemma-4-31B-it top_k 64. gpt-oss-120b non indica un top-k e si affida solo a temperature e top-p. Nel dubbio, parti dalla raccomandazione di chi pubblica il modello, oppure omettilo e lascia che sia il top-p a filtrare.
Fonti
Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza, e perché abbiamo scelto di costruirci sopra.
Esplora la tecnologia