Anatomia di una risposta

Ogni risposta di un LLM attraversa due fasi. Prima il modello elabora l'intero prompt in un unico passaggio parallelo (prefill), che determina il tempo al primo token. Poi genera l'output un token alla volta (decode). La velocità di questa fase è la latenza inter-token, di solito espressa in token al secondo di output. Il tempo totale di risposta è circa il TTFT più il numero di token generati moltiplicato per il tempo per token.

Le due fasi sollecitano l'hardware in modo diverso. Il prefill è di solito limitato dal calcolo (compute-bound), mentre con i batch size comuni il decode è di solito limitato dalla larghezza di banda della memoria (memory-bound): per ogni nuovo token l'hardware deve spostare dalla memoria i pesi del modello. Per questo lo stesso hardware può avere prestazioni di prefill eccellenti e una velocità di generazione mediocre.

Quale metrica conta per quale workload

Nella chat interattiva è il TTFT a dominare la percezione: gli utenti notano la pausa silenziosa prima dell'inizio dell'output molto più della velocità di streaming. Per i voice agent contano entrambi e i margini di tempo sono stretti. Nei workload agentici (coding agent, pipeline di tool calling, workflow autonomi) domina la velocità di output. L'agente deve ricevere ogni token di ogni passo prima di poter agire, quindi il tempo di generazione si accumula lungo tutta la catena.

Sulla nostra infrastruttura di Monaco pubblichiamo tutti e tre i valori per ogni modello. Per gpt-oss-120b sono 388ms di TTFT, 713 tok/s di throughput di output e 1,789 secondi end-to-end per una richiesta con 10.000 token di input e 1.000 token di output (lato server, p50).

Misurare in modo onesto

I valori di velocità sono confrontabili solo se il workload è dichiarato. La lunghezza del prompt cambia il TTFT, la lunghezza dell'output sposta l'equilibrio tra TTFT e generazione, e la concorrenza cambia tutto. La latenza end-to-end include inoltre fattori esterni al modello: i tempi di andata e ritorno sulla rete (conta la distanza dal datacenter), l'overhead del gateway e il tempo in coda su capacità condivisa. Per questo i valori misurati lato client differiscono sempre da quelli lato server. Benchmark indipendenti come Artificial Analysis pubblicano i loro workload esatti: test con 1k e 10k token di input, misurati 8 volte al giorno e riportati come mediana su 72 ore. È lo standard che seguono anche i benchmark che pubblichiamo.

Fonti

Guarda queste metriche misurate dal vivo sulla nostra infrastruttura UE: numeri reali da hardware di produzione, verificati in modo indipendente.

Vedi i benchmark dal vivo