Hvad temperature gør
Når en LLM genererer et token, beregner den først en rå score (logit) for hvert token i sit ordforråd. Derefter omsætter softmax-funktionen disse scores til sandsynligheder. Temperature virker inde i den omsætning: Hver logit divideres med T før softmax. Det skalerer sandsynlighedsfordelingen om. Et T under 1 gør toppene skarpere, et T over 1 gør fordelingen fladere.
En udbredt misforståelse: Temperature 1.0 betyder ikke "maksimal tilfældighed". Det er baseline, altså den fordeling, modellen har lært under træningen. Tænk på det som kontrasten i et foto: T=1 er originalen, og alt andet er en justering. Modellernes udgivere anbefaler typisk T=1.0 sammen med top-p og top-k, som skærer den lange hale af usandsynlige tokens væk.
Hvorfor T=0 er risikabelt for reasoning-modeller
Ved temperature 0 er der ingen sampling. Modellen vælger deterministisk det mest sandsynlige token hver gang. Det lyder som konsistens, men det giver en ny fejlkilde: Hvis modellen havner i et mønster, der forstærker sig selv, kan den ikke komme ud igen. Sampling giver en udvej, greedy decoding gør ikke. Vi har set reasoning-modeller ved T=0 havne i endeløse synonym-loops. De løste et problem korrekt og omformulerede derefter deres konklusion igen og igen, indtil de ramte token-grænsen.
Derfor advarer vores dokumentation: Sæt altid temperature eksplicit, og brug den værdi, modellens udgiver anbefaler. Hvis du udelader den, bruger de fleste modeller greedy decoding (T=0), og det risikerer loops, der aldrig slutter, i reasoning-workloads. Infercom-API'et har ingen standardværdi for hele tjenesten, så valget ligger hos dig.
Praktiske anbefalinger
Til de EU-suveræne modeller på Infercom skal du bruge de værdier, udgiveren anbefaler: MiniMax-M2.7 angiver temperature 1.0, top_p 0.95 og top_k 40, og gpt-oss-120b angiver temperature 1.0 og top_p 1.0. Hvis du vil have mere fokuseret output, så sænk temperature til 0.3-0.7 i stedet for nul. Så mindsker du variationen uden at udløse fejlkilderne ved greedy decoding. Og husk: Selv ved T=0 er byte-identisk output ikke garanteret på tværs af distribueret inferens. Afvigelser i flydende kommatal i parallelle beregninger kan vende tætte afgørelser.
Kilder
Læs, hvordan SambaNovas dataflow-arkitektur ændrer økonomien i inferens, og hvorfor vi har bygget på den.
Udforsk teknologien