Cosa misura il TTFT

Quando arriva una richiesta, il modello elabora prima l'intero prompt in un unico passaggio parallelo, la fase di prefill, per costruire il suo stato interno (la KV cache). Solo dopo può emettere il primo token. Il TTFT comprende questo tempo di elaborazione e tutto ciò che lo circonda: l'attesa nella coda del provider e il viaggio di andata e ritorno sulla rete. Le definizioni standard dei benchmark lo misurano dall'invio della richiesta alla ricezione del primo token, inclusi coda, prefill e latenza di rete.

Poiché il prefill elabora ogni token di input, il TTFT cresce con la lunghezza del prompt: più il prompt è lungo, più tardi arriva il primo token. Sotto carico elevato la coda diventa il fattore principale. Se arrivano più richieste di quante il sistema riesca a raggruppare in batch, il TTFT sale, anche se il modello in sé non è diventato né più veloce né più lento.

Perché il TTFT è importante

Il TTFT è la metrica della reattività. Nelle interfacce di chat determina per quanto tempo lo schermo resta vuoto dopo che l'utente ha premuto invio. È il fattore che più di ogni altro decide se un'applicazione AI sembra veloce. Per i voice agent il TTFT è ancora più critico: in una conversazione, una pausa di oltre un secondo dà l'impressione che qualcosa si sia rotto.

Sulla nostra infrastruttura di produzione a Monaco misuriamo un TTFT p50 di 388ms per gpt-oss-120b con un input di 10.000 token, lato server e su un prompt lungo. Artificial Analysis, l'organizzazione indipendente di benchmarking, definisce il TTFT allo stesso modo in cui lo riportiamo noi: il tempo tra l'invio di una richiesta e la ricezione del primo token della risposta.

Sfumature da conoscere

Il TTFT misurato lato client e quello misurato lato server sono diversi. Il client vede insieme coda, prefill e rete, mentre le metriche lato server di solito separano il tempo in coda dal tempo di prefill. Quando confronti i provider, verifica quale dei due viene riportato. Per i modelli di ragionamento c'è un'ulteriore distinzione: il primo token può essere un token di "thinking". Per questo i benchmark misurano separatamente il tempo al primo token e il tempo al primo token di risposta.

Per avere un quadro completo della velocità di risposta servono sia il TTFT sia la velocità di output: la latenza totale è circa il TTFT più il numero di token generati moltiplicato per il tempo per token di output. Ciò che i tuoi utenti vivono nella pratica, la latenza end-to-end, include anche fattori del tutto esterni al modello. Ci sono i tempi di andata e ritorno sulla rete, che pesano due volte (richiesta e risposta) e crescono con la distanza dal datacenter. Si aggiungono l'overhead del gateway per autenticazione e routing e il tempo in coda su un'infrastruttura condivisa. Un provider che vanta un TTFT rapido da un altro continente può comunque risultare lento in Europa. È uno dei motivi per cui pubblichiamo misure lato server e segnaliamo che i risultati lato client variano in base alla posizione.

Fonti

Guarda queste metriche misurate dal vivo sulla nostra infrastruttura UE: numeri reali da hardware di produzione, verificati in modo indipendente.

Vedi i benchmark dal vivo