Hvad kontekstvinduet indeholder

Sprogmodeller husker intet mellem forespørgsler. Kontekstvinduet er hele deres arbejdshukommelse for ét kald. Det fyldes med tokens, på engelsk omtrent tre fjerdedele af et ord per token. Det omfatter systemprompten, tidligere runder i en samtale, dokumenter til retrieval og de tokens, modellen genererer som svar. Hvis en opgave overstiger kontekstvinduet, må de ældste tokens fjernes eller opsummeres. Derfor begrænses lange agentkørsler og opgaver i store kodebaser af kontekstens størrelse. Aktuelle open-weight-modeller, vi kører, som MiniMax M2.7, har kontekstvinduer på omkring 192K tokens.

Under inferens læses hele input-konteksten i prefill-fasen. Her behandler modellen hvert token i prompten parallelt og opbygger sin interne tilstand, KV-cachen. Først derefter kan den sende det første token. Hvert token, der genereres i decode, ser derefter tilbage på den gemte kontekst via attention. Kontekstvinduet er altså ikke kun en kapacitetsgrænse. Det er præcis det, der behandles ved hver forespørgsel, og dets størrelse afgør direkte, hvordan forespørgslen klarer sig.

Hvorfor kontekstlængden styrer hastighed og omkostning

Omkostningen ved kontekst er ikke lineær. Attention-mekanismen i hjertet af transformeren sammenligner hvert token med alle andre tokens. Arbejdet i prefill vokser derfor kvadratisk med promptens længde: En prompt på 1.000 tokens giver i størrelsesordenen en million attention-sammenligninger, mens 10.000 tokens giver hundrede millioner. I produktion kan prefill af en prompt på 128K tokens tage flere sekunder og en prompt på en million tokens flere titals sekunder. Først derefter dukker det første output-token op. Derfor er tal for time to first token meningsløse uden inputlængden bag dem.

Kontekst bruger også hukommelse, og hukommelsen er den begrænsende faktor under generering. KV-cachen gemmer nøgler og værdier for hvert token i kontekstvinduet og vokser med kontekstlængden. For en stor dense-model kan den nå flere titals gigabyte ved en kontekst på 128K. At læse denne cache og modellens vægte igen for hvert genereret token er et problem med hukommelsesbåndbredde, ikke med regnekraft. Derfor falder GPU-udnyttelsen ofte sammen ved lang kontekst, og det er her, hardware bygget omkring hukommelse hjælper mest. Metoder som PagedAttention styrer cachen mere effektivt, så et system kan betjene flere forespørgsler med lang kontekst på samme tid.

Læs påstande om kontekst kritisk

Et stort kontekstvindue i markedsføringen betyder ikke, at modellen bruger det hele godt eller hurtigt. To udbydere, der kører samme model med samme nominelle kontekstvindue, kan være meget forskellige: i hvor hurtigt de behandler en lang prompt, og i hvor stabilt de holder under belastning. Et flot tal skjuler den slags forskelle. Når kontekst betyder noget for dit workload, så sammenlign prefill-tiden ved din reelle inputlængde og den vedvarende output-hastighed, ikke kun det maksimale kontekstvindue. På vores infrastruktur i EU kører prefill på dataflow-hardware, der holder data på chippen. Det forkorter ventetiden før det første token, som en lang prompt ellers giver.

Kilder

Se disse målinger live på vores EU-infrastruktur: reelle tal fra produktionshardware, uafhængigt verificeret.

Se live-benchmarks