Hastighed per forespørgsel: det benchmarks rapporterer

Når uafhængige benchmarks som Artificial Analysis rapporterer "output-hastighed", måler de det gennemsnitlige antal tokens, der modtages per sekund, efter det første token er ankommet. Målingen gælder én forespørgsel. Time to first token er bevidst udeladt. Det er dette tal, der afgør brugeroplevelsen: hvor hurtigt svaret streamer.

På vores infrastruktur i EU måler vi en output-throughput per forespørgsel på 713 tok/s på gpt-oss-120b og 428 tok/s på MiniMax M2.7 Ultraspeed (p50, input på 10.000 tokens, én forespørgsel). Modeller bruger forskellige tokenizere. For at gøre dem sammenlignelige omregner Artificial Analysis alle hastigheder til OpenAI-tokens, talt med tiktoken-tokenizeren o200k_base.

System-throughput: det udbydernes økonomi afhænger af

Den anden betydning er samlet throughput: alle de tokens, et system producerer per sekund på tværs af samtidige forespørgsler. Benchmark-litteraturen skelner udtrykkeligt mellem "TPS per bruger" og "TPS per system". En GPU-server leverer måske 30 tok/s til hver af 100 samtidige brugere. Det giver 3.000 tok/s i system-throughput, men en langt langsommere oplevelse for den enkelte forespørgsel.

Her bliver hastighedspåstande uklare. En udbyder kan ærligt reklamere med tusindvis af tokens per sekund, mens hver enkelt forespørgsel kryber af sted. Når du ser et tok/s-tal, er det første spørgsmål derfor: per forespørgsel eller for hele systemet?

Sådan læser du et tok/s-tal

Tjek tre ting. Er tallet per forespørgsel eller samlet? Er TTFT regnet med eller ej? Artificial Analysis udelader den per definition. Og hvordan ser workloadet ud? Både promptlængde og outputlængde ændrer tallet. Vores offentliggjorte benchmarks oplyser alle tre: per forespørgsel, serverside p50, 10.000 input-tokens og 1.000 output-tokens.

Kilder

Se disse målinger live på vores EU-infrastruktur: reelle tal fra produktionshardware, uafhængigt verificeret.

Se live-benchmarks