Hvad TTFT måler
Når en forespørgsel ankommer, behandler modellen først hele prompten i én parallel omgang, prefill-fasen. Her opbygger den sin interne tilstand, KV-cachen. Først derefter kan den sende det første token. TTFT omfatter denne behandlingstid og alt omkring den: tiden i udbyderens kø og netværkets roundtrip. Gængse benchmark-definitioner måler TTFT fra forespørgslen sendes, til det første token modtages, inklusive kø, prefill og netværkslatens.
Fordi prefill behandler hvert input-token, vokser TTFT med promptens længde: Jo længere prompt, jo længere tid går der før det første token. Under høj belastning bliver køen den vigtigste faktor. Hvis der kommer flere forespørgsler, end systemet kan samle i batches, stiger TTFT, selv om modellen selv hverken er blevet hurtigere eller langsommere.
Hvorfor TTFT er vigtig
TTFT er metrikken for responsivitet. I en chat afgør den, hvor længe skærmen er tom, efter brugeren har trykket enter. Det er den største enkeltfaktor for, om en AI-applikation føles hurtig. For stemmeagenter er TTFT endnu mere kritisk: En pause på mere end et sekund i en samtale føles, som om noget er gået i stykker.
På vores produktionsinfrastruktur i München måler vi en p50-TTFT på 388ms for gpt-oss-120b med et input på 10.000 tokens. Målingen er serverside og med en lang prompt. Artificial Analysis, den uafhængige benchmark-organisation, definerer TTFT på samme måde, som vi rapporterer den: tiden fra en forespørgsel sendes, til det første token i svaret modtages.
Nuancer, der er værd at kende
TTFT målt hos klienten og TTFT målt på serveren er ikke det samme. Klienten ser køtid, prefill og netværk samlet. Metrikker på serversiden adskiller typisk køtid fra prefill-tid. Tjek derfor, hvilken værdi der rapporteres, når du sammenligner udbydere. Reasoning-modeller har en ekstra skelnen: Det første token kan være et "thinking"-token. Derfor måler benchmarks tiden til første token og tiden til første svar-token hver for sig.
Et fuldt billede af svarhastigheden kræver både TTFT og output-hastighed. Den samlede latens er omtrent TTFT plus antallet af genererede tokens gange tiden per output-token. Det, dine brugere oplever i praksis, er end-to-end-latensen. Den rummer også bidrag helt uden for modellen. Netværkets roundtrips rammer to gange, for forespørgsel og svar, og vokser med afstanden til datacenteret. Dertil kommer gateway-overhead til autentificering og routing og køtid på delt infrastruktur. En udbyder, der reklamerer med hurtig TTFT fra et andet kontinent, kan stadig føles langsom i Europa. Det er en af grundene til, at vi offentliggør målinger fra serversiden og skriver, at resultater hos klienten varierer efter placering.
Kilder
Se disse målinger live på vores EU-infrastruktur: reelle tal fra produktionshardware, uafhængigt verificeret.
Se live-benchmarks