Sådan virker top-p
Når temperature har omformet sandsynlighedsfordelingen, filtrerer top-p den. Tokens sorteres efter sandsynlighed. Filteret tager tokens med fra toppen, indtil den kumulative sandsynlighed når p. Alt under den linje fjernes, og de resterende sandsynligheder renormaliseres. Sampling trækker derefter fra den mindre mængde.
Et eksempel med top_p=0.9: Hvis det mest sandsynlige token har 92%, er det kun det token, der bliver tilbage. Modellen er sikker, og kernen er smal. Hvis det øverste token i stedet har 40%, det næste 30%, det tredje 15% og så videre, tager filteret tokens med, indtil summen passerer 90%. Puljen bliver bredere. Derfor tilpasser top-p sig modellens sikkerhed, mens top-k ikke gør: Den samme tærskel giver forskellige puljestørrelser, alt efter hvor spredt fordelingen er.
Top-p vs. top-k
Top-k fastlåser puljens størrelse: Den beholder præcis k tokens, uanset hvordan sandsynlighederne er fordelt. Top-p fastlåser den kumulative sandsynlighedsmasse: Den beholder så mange tokens, som der skal til for at dække andelen p. Når modellen er sikker, kan top-k tage langt flere kandidater med end nødvendigt. Når modellen er usikker, kan den skære for meget væk. Top-p håndterer begge tilfælde med én parameter.
I praksis anbefaler mange udgivere at bruge begge: top-p som det primære filter (0.9-0.95 er almindeligt) og top-k som et hårdt loft (40-100). Loftet fanger de grænsetilfælde, hvor selv kernen er meget stor. Temperature, top-p og top-k danner tilsammen en pipeline i tre trin: omform fordelingen, beskær efter kumulativ sandsynlighed, og begræns antallet.
Anbefalede værdier
Til Infercoms EU-suveræne modeller anbefaler udgiverne disse værdier: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (ingen filtrering), gemma-4-31B-it top_p 0.95. En top_p på 1.0 betyder, at intet filtreres i dette trin: Hele fordelingen går igennem. Lavere værdier gør kernen smallere. Værdier under 0.5 er usædvanlige og kan begrænse outputtet for meget. Den fulde parameterreference finder du i vores API-dokumentation.
Kilder
Læs, hvordan SambaNovas dataflow-arkitektur ændrer økonomien i inferens, og hvorfor vi har bygget på den.
Udforsk teknologien