Cosa fa temperature

Quando un LLM genera un token, calcola prima un punteggio grezzo (logit) per ogni token del suo vocabolario, poi trasforma questi punteggi in probabilità con la funzione softmax. Temperature interviene proprio in questa trasformazione: ogni logit viene diviso per T prima del softmax. Così la distribuzione di probabilità viene riscalata: con T minore di 1 i picchi diventano più netti, con T maggiore di 1 la distribuzione si appiattisce.

Un equivoco comune: temperature 1.0 non significa "massima casualità". È il valore di partenza, cioè la distribuzione che il modello ha appreso in addestramento. Pensala come il contrasto di una foto: T=1 è l'originale, ogni altro valore è un ritocco. Chi pubblica i modelli di solito raccomanda T=1.0, insieme a top-p e top-k per tagliare la lunga coda dei token improbabili.

Perché T=0 è rischioso per i modelli di ragionamento

A temperature 0 non c'è sampling: il modello sceglie in modo deterministico il token più probabile, ogni volta. Sembra consistenza, ma introduce un modo di fallire: se il modello entra in uno schema che si autoalimenta, non può più uscirne. Il sampling offre una via d'uscita, il greedy decoding no. Abbiamo visto modelli di ragionamento a T=0 entrare in cicli infiniti di sinonimi: risolvevano correttamente un problema, poi riformulavano la conclusione più e più volte, fino a raggiungere il limite di token.

Per questo la nostra documentazione avverte: imposta sempre temperature in modo esplicito e usa il valore raccomandato da chi pubblica il modello. Se lo ometti, la maggior parte dei modelli passa al greedy decoding (T=0), con il rischio di loop che non terminano nei workload di ragionamento. L'API di Infercom non applica un valore predefinito a livello di servizio, quindi la scelta resta a te.

Indicazioni pratiche

Per i modelli sovrani UE su Infercom, usa i valori raccomandati da chi pubblica il modello: MiniMax-M2.7 indica temperature 1.0, top_p 0.95 e top_k 40; gpt-oss-120b indica temperature 1.0 e top_p 1.0. Se vuoi un output più mirato, abbassa temperature a 0.3-0.7 invece che a zero: riduci la variabilità senza innescare i modi di fallire del greedy decoding. E ricorda: anche a T=0, output identici byte per byte non sono garantiti nell'inferenza distribuita, perché le variazioni in virgola mobile dei calcoli paralleli possono ribaltare le scelte più incerte.

Fonti

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza, e perché abbiamo scelto di costruirci sopra.

Esplora la tecnologia