Hvad ITL måler
Efter det første token, som TTFT måler, genererer modellen resten af svaret ét token ad gangen. Det er decode-fasen. ITL er det gennemsnitlige mellemrum mellem disse tokens. Benchmark-værktøjer beregner den typisk sådan: end-to-end-latens minus TTFT, divideret med antallet af output-tokens minus én. Det første token er bevidst udeladt, så ITL viser den rene genereringshastighed.
ITL og output-hastighed er to måder at se på det samme: Jo længere outputtet bliver, jo tættere kommer en forespørgsels tokens per sekund på 1 divideret med ITL. Vores målte 713 tokens per sekund på gpt-oss-120b svarer til et gennemsnitligt mellemrum på cirka 1,4 millisekunder. 428 tokens per sekund på MiniMax M2.7 Ultraspeed svarer til cirka 2,3 millisekunder.
Hvorfor ITL er vigtig
For et menneske, der læser et chatsvar, er næsten enhver moderne udbyder hurtig nok. Vi læser kun få tokens i sekundet. ITL bliver afgørende i agentiske workloads, hvor software bruger outputtet. En coding-agent, der venter på et diff på 3.000 tokens, venter på hvert eneste token. Med 30 millisekunder mellem hvert token tager genereringen 90 sekunder. Med 1,4 millisekunder tager den cirka 4 sekunder. Agenter arbejder i loops: De genererer, kører værktøjer og genererer igen. Derfor hober inter-token latency sig op over hvert trin i kæden.
ITL afslører også, hvordan infrastrukturen klarer sig under belastning. Decode-fasen er begrænset af hukommelsesbåndbredden. Når en udbyder samler mange brugere i samme batch på den samme hardware, stiger ITL for hver enkelt bruger. En stabil ITL hele dagen er et tegn på, at kapaciteten reelt er til stede og ikke overbooket.
Nuancer, der er værd at kende
Benchmark-værktøjer bruger ikke den samme formel. Nogle udelader det første token fra gennemsnittet, andre tæller det med. Derfor kan ITL-tal fra forskellige værktøjer ikke sammenlignes direkte. ITL er desuden et gennemsnit: De faktiske mellemrum varierer i løbet af et svar, fordi KV-cachen vokser. Du kan også møde metrikken under navnet TPOT (time per output token). Branchens tekniske dokumentation bruger de to begreber i flæng.
Kilder
Se disse målinger live på vores EU-infrastruktur: reelle tal fra produktionshardware, uafhængigt verificeret.
Se live-benchmarks