Cosa misura l'ITL
Dopo il primo token (misurato dal TTFT), il modello genera il resto della risposta un token alla volta: è la fase di decode. L'ITL è l'intervallo medio tra questi token. Gli strumenti di benchmarking la calcolano di solito così: latenza end-to-end meno TTFT, divisa per il numero di token di output meno uno. Il primo token viene escluso di proposito, così l'ITL riflette la pura velocità di generazione.
ITL e velocità di output sono due modi di guardare la stessa cosa: più l'output si allunga, più i token al secondo di una richiesta si avvicinano a 1 diviso ITL. I nostri 713 token al secondo misurati su gpt-oss-120b corrispondono a un intervallo medio di circa 1,4 millisecondi tra un token e l'altro. I 428 token al secondo su MiniMax M2.7 Ultraspeed corrispondono a circa 2,3 millisecondi.
Perché l'ITL è importante
Per una persona che legge una risposta in chat, quasi ogni provider moderno è abbastanza veloce: leggiamo pochi token al secondo. L'ITL diventa decisiva nei workload agentici, dove è un software a consumare l'output. Un coding agent che aspetta un diff di 3.000 token aspetta ogni singolo token. Con 30 millisecondi tra un token e l'altro servono 90 secondi di generazione, con 1,4 millisecondi circa 4 secondi. Gli agenti lavorano in ciclo: generano, eseguono strumenti, generano di nuovo. Per questo la latenza inter-token si accumula a ogni passo della catena.
L'ITL rivela anche la qualità dell'infrastruttura sotto carico. La fase di decode è limitata dalla larghezza di banda della memoria: quando un provider raggruppa molti utenti nello stesso batch sullo stesso hardware, l'ITL di ciascuno peggiora. Un'ITL stabile nell'arco della giornata indica che la capacità è realmente allocata e non in overbooking.
Sfumature da conoscere
Gli strumenti di benchmarking non usano tutti la stessa formula: alcuni escludono il primo token dalla media, altri lo includono. Per questo i valori di ITL di strumenti diversi non sono direttamente confrontabili. L'ITL è inoltre una media: gli intervalli reali variano durante una risposta, man mano che la KV cache cresce. La metrica compare anche con il nome TPOT (time per output token). Nella documentazione tecnica del settore i due termini si usano come sinonimi.
Fonti
Guarda queste metriche misurate dal vivo sulla nostra infrastruttura UE: numeri reali da hardware di produzione, verificati in modo indipendente.
Vedi i benchmark dal vivo