Anatomien i et svar
Hvert LLM-svar har to faser. Først behandler modellen hele din prompt i én parallel omgang (prefill). Det afgør time to first token. Derefter genererer den output ét token ad gangen (decode). Hastigheden i denne fase er inter-token latency, som regel angivet som output-tokens per sekund. Den samlede svartid er omtrent TTFT plus antallet af genererede tokens gange tiden per token.
De to faser belaster hardwaren forskelligt. Prefill er typisk compute-bound. Decode er ved almindelige batch-størrelser typisk memory-bound, altså begrænset af hukommelsesbåndbredden: For hvert nyt token skal hardwaren flytte modellens vægte fra hukommelsen. Derfor kan den samme hardware have fremragende prefill-ydelse og samtidig middelmådig genereringshastighed.
Hvilken metrik der tæller til hvilken opgave
I interaktiv chat dominerer TTFT oplevelsen. Brugerne bemærker den tavse pause, før output begynder, langt mere end streaming-hastigheden. For stemmeagenter tæller begge, og tidsbudgettet er stramt. For agentiske workloads som coding-agenter, tool-calling-pipelines og autonome workflows dominerer output-hastigheden. Agenten skal modtage hvert token i hvert trin, før den kan handle. Derfor hober genereringstiden sig op over hele kæden.
På vores infrastruktur i München offentliggør vi alle tre tal for hver model. For gpt-oss-120b er det 388ms TTFT, 713 tok/s i output-throughput og 1,789 sekunder end-to-end for en forespørgsel med 10.000 input-tokens og 1.000 output-tokens (serverside p50).
Ærlige målinger
Hastighedstal kan kun sammenlignes, når workloadet er oplyst. Promptlængden ændrer TTFT. Outputlængden ændrer balancen mellem TTFT og generering. Samtidighed ændrer alt. End-to-end-latens rummer desuden bidrag uden for modellen: netværkets roundtrips (afstanden til datacenteret betyder noget), gateway-overhead og køtid på delt kapacitet. Derfor afviger tal målt hos klienten altid fra tal målt på serveren. Uafhængige benchmarks som Artificial Analysis offentliggør deres præcise workloads: test med 1k og 10k input-tokens, målt 8 gange dagligt og rapporteret som medianer over 72 timer. Det er den standard, vores egne offentliggjorte benchmarks følger.
Kilder
Se disse målinger live på vores EU-infrastruktur: reelle tal fra produktionshardware, uafhængigt verificeret.
Se live-benchmarks