En udvikler, der bruger Cursor, Cline eller Codex CLI, kan sende flere titals millioner tokens gennem modellen på en dag. Agentiske workflows er token-tunge: AI'en læser filer, planlægger ændringer, skriver kode, kører tests, støder på fejl og prøver igen. Hvert trin kræver et roundtrip til inferens-API'et, og ved hvert roundtrip sendes den voksende kontekst med igen.
Langt de fleste af disse tokens er input, ikke output. På tværs af 792 udviklere og 29.230 registrerede coding-dage var 94,8% af alle tokens cachet input (cache reads), og kun 0,2% var output (viberank, 2026). I hver turn genererer en agent et par hundrede output-tokens: I en udviklers uge med 13.972 turns var det i gennemsnit omkring 420 (kilde).
Output-hastigheden afgør, hvor lang tid hver turn tager. For en turn med 400 output-tokens gælder:
- Ved 90 tokens per sekund (typisk frontier-model): ~4,4 sekunder
- Ved 400+ tokens per sekund (MiniMax-M2.5): ~1 sekund
Over en opgave på 50 til 200 turns bliver det til 4-15 minutters ventetid på output mod 1-3 minutter. Hurtigere inferens betyder mindre tid med at vente på svar og mere tid i et produktivt flow.
Denne artikel forklarer, hvorfor agentic coding stiller andre krav til ydeevnen end chatbaserede AI-værktøjer, og hvordan du optimerer for hastighed.
Hvorfor agentic coding-værktøjer bruger så mange tokens
I chatbaserede AI-værktøjer består en interaktion typisk af én forespørgsel og ét svar.
Agentic coding fungerer anderledes. En enkelt opgave som "refaktorér dette modul" udløser dusinvis af LLM-kald. Agenten læser filer, opbygger kontekst, planlægger sin tilgang, skriver kode, kører tests, støder på fejl, debugger og prøver igen. Hvert trin kræver et roundtrip til inferensen.
En enkelt opgave falder i to adskilte faser:
Planlægningsfase (5-15 turns):
- Forstå strukturen i kodebasen
- Analysér afhængigheder og arkitektur
- Design en migrationsstrategi
- Vurdér risici og edge cases
Udførelsesfase (50-200+ turns):
- Læs og analysér filer
- Skriv diffs og anvend ændringer
- Kør tests og registrér fejl
- Ret fejl og iterér, indtil alt er grønt
| Mønster | Turns | Behandlede tokens | Ventetid på output (90 tok/s) | Ventetid på output (400 tok/s) |
|---|---|---|---|---|
| Chat completion | 1-3 | 2-5K | 4-13 s | 1-3 s |
| RAG-pipeline | 3-5 | 10-30K | 13-22 s | 3-5 s |
| Agentic coding | 50-200+ | Millioner, mest input | 4-15 min | 1-3 min |
Ventetiderne er beregnet med cirka 400 output-tokens per turn.
For at sætte tallene i perspektiv: En chat completion består af en til tre turns, så ventetiden er få sekunder ved næsten enhver hastighed. I agentic coding lægges ventetiden sammen: De samme sekunder per turn kommer igen 50 til 200 gange per opgave og igen ved hver opgave i løbet af dagen.
Planlægningen har gavn af modellens intelligens, udførelsen af hastighed. Udførelsen står typisk for over 90% af alle turns.
Tokenforbrug i en typisk agentic coding-session
Her er en opdeling af tokenforbruget i en typisk agentic coding-opgave:
Ved forskellige hastigheder:
| Udbyder | Hastighed | Ventetid på output | Per turn |
|---|---|---|---|
| Typisk frontier-model | 60-100 tok/s | 7-11 min | 4-7 s |
| MiniMax-M2.5 på Infercom | 400+ tok/s | under 2 min | ~1 s |
I denne opgave bruger en typisk frontier-model ved 60-100 tok/s 7-11 minutter på at generere output. MiniMax-M2.5 på Infercom klarer det med 400+ tok/s på under 2 minutter. Forskellen fordeler sig på mange små ventetider: 4-7 sekunder mod cirka et sekund, hver gang agenten svarer.
I løbet af en arbejdsdag lægges disse ventetider sammen. En udvikler, hvis agenter kører 500 turns om dagen, får cirka 200K output-tokens. Det giver 33-56 minutters ventetid ved 60-100 tok/s og cirka 8 minutter ved 400 tok/s. Dertil kommer i hver turn den tid, modellen bruger på at behandle input, og den vokser med kodebasens størrelse. Den del afhænger af prefill-hastigheden og prompt caching, ikke af output-hastigheden.
To veje til hurtigere agentic coding
Der er to grundlæggende måder at forbedre inferenshastigheden for agentic coding-værktøjer på:
Option A: Fuld udskiftning
Du bruger MiniMax-M2.5 til alt. Det er den enkleste opsætning:
- Én model, én udbyder
- 75,8% på SWE-bench Verified - på niveau med frontier-modellerne
- 400+ tokens per sekund på EU-infrastruktur
- Enklest mulige konfiguration, laveste omkostning
Bedst til: Teams, der prioriterer hastighed og enkelhed
Codex CLI-konfiguration (fuld udskiftning):
# ~/.codex/config.toml
model = "MiniMax-M2.7"
model_provider = "infercom"
[model_providers.infercom]
name = "Infercom (EU Sovereign)"
base_url = "https://api.infercom.ai/v1"
env_key = "INFERCOM_API_KEY"
wire_api = "responses"
Option B: Opdeling i planner og executor
Du beholder din frontier-model (Claude, GPT, Gemini) til komplekse planlægningsbeslutninger og sender udførelsen videre til hurtig inferens.
Mønstret ser sådan ud:
| Fase | Turns | Hvad der sker | Prioritet for modellen |
|---|---|---|---|
| Planlægning | 5-15 | Forstå kodebasen, arkitekturbeslutninger, migrationsstrategi, risikovurdering | Kvalitet (frontier-model) |
| Udførelse | 50-200+ | Fillæsning, diffs, tests, fejl, rettelser, iteration | Hastighed (hurtig model) |
Opdelingen i planner og executor tager højde for, at planlægning og udførelse stiller forskellige krav. Planlægningen omfatter 5-15 turns, hvor modellen analyserer kodebasen, træffer arkitekturbeslutninger og vurderer risici, og her kommer en frontier-models ræsonneringsevner til deres ret. Udførelsen omfatter 50-200+ turns med filoperationer, kodegenerering, tests og iteration, og her tæller hastigheden mest. Da udførelsen står for langt størstedelen af turns, reducerer det den samlede inferenstid markant at sende den til en hurtig model som MiniMax-M2.5, mens planlægningen bevarer frontier-kvalitet.
Over 90% af dine turns går til udførelse, ikke til planlægning. Send dem videre til hurtig inferens.
Bedst til: Teams, der allerede har satset på en frontier-model og vil optimere hovedparten af deres tokenforbrug
Cline-konfiguration (opdeling i planner og executor):
Aktivér "Use different models for Plan and Act modes" i Cline-indstillingerne:
- Plan Model: Claude Sonnet (eller din frontier-model)
- Act Model: MiniMax-M2.7 via Infercoms API
OpenCode-konfiguration:
// opencode.json
{
"agent": {
"plan": {
"model": "claude-sonnet-4-5-20250514",
"provider": "anthropic"
},
"build": {
"model": "MiniMax-M2.7",
"provider": "infercom"
}
}
}
Codex CLI-konfiguration til Infercom
Codex CLI er OpenAIs open source-assistent til agentic coding. Sådan konfigurerer du den til Infercom:
Forudsætninger:
- Node.js 18+
- Infercom API-nøgle (få en her)
Installation:
npm install -g @openai/codex
Angiv din API-nøgle:
export INFERCOM_API_KEY="your-key-here"
# Tilføj til ~/.zshrc eller ~/.bashrc, så den bliver gemt
Opret en konfigurationsfil (~/.codex/config.toml):
# Default settings
model = "MiniMax-M2.7"
model_provider = "infercom"
approval_mode = "suggest" # Options: suggest, auto-edit, full-auto
# Infercom provider definition
[model_providers.infercom]
name = "Infercom (EU Sovereign)"
base_url = "https://api.infercom.ai/v1"
env_key = "INFERCOM_API_KEY"
wire_api = "responses"
Kontrollér opsætningen:
codex
# Bør vise:
# model: MiniMax-M2.7
# provider: infercom
Sådan påvirker inferenshastigheden udviklernes workflow
Ud over den rene tidsbesparelse påvirker inferenshastigheden flere sider af udviklingsarbejdet.
Omkostninger ved kontekstskift: Korte ventetider (under 30 sekunder) gør det muligt for udviklere at holde fokus på den aktuelle opgave. Længere ventetider fører ofte til kontekstskift, og det koster i sig selv produktivitet at vende tilbage til den oprindelige opgave.
Iterationshyppighed: Hurtigere inferens gør det mere praktisk at eksperimentere. Udviklere kan hurtigt afprøve flere tilgange og fange problemer tidligere i udviklingsforløbet.
Feedback-loopets størrelse: Hurtige svar gør det muligt at arbejde i mindre trin. Mindre ændringer er som regel lettere at reviewe, teste og merge.
Effekten på teamniveau:
For et team på 5 personer, hvor hver udviklers agenter kører 500 turns om dagen, sparer skiftet fra 90 tok/s til 400+ tok/s cirka 30 minutters ventetid per udvikler om dagen (fra 37 til 8 minutter). Det bliver til omkring 2,5 timer dagligt eller cirka 50 timer om måneden.
Med fuldt belastede omkostninger på €80 i timen svarer det til cirka €4.000 om måneden i udviklertid, der kan bruges på produktivt arbejde. Den tid, modellen bruger på at behandle input, kommer oveni og er ikke regnet med her.
Effekten på produktiviteten vokser med teamets størrelse og mængden af agentic coding-opgaver.
EU-dataresidency og GDPR-compliance
For teams med krav til dataresidency betyder placeringen af inferens-infrastrukturen noget.
For MiniMax-M2.5 på Infercom gælder:
- SambaNova-hardware i München, Tyskland
- Fuld GDPR-compliance
- Ikke eksponeret for den amerikanske CLOUD Act
- ISO 27001-certificeret infrastruktur
For teams i regulerede brancher (finans, sundhed, jura, offentlig sektor) kan EU-dataresidency være et compliance-krav.
Ydeevne og suverænitet:
Inferens hostet i EU er historisk blevet forbundet med lavere ydeevne end hos udbydere i USA.
MiniMax-M2.5 på Infercom viser, at høj throughput (400+ tok/s) kan opnås på EU-infrastruktur. Dermed forsvinder den traditionelle afvejning mellem datasuverænitet og inferenshastighed.
Kom i gang
Sådan prøver du Infercom med dine agentic coding-værktøjer:
- Få en API-nøgle - på cloud.infercom.ai/apis
- Konfigurer dit værktøj - Infercom understøtter Codex CLI, Cline, Cursor og andre OpenAI-kompatible værktøjer
- Test med en rigtig opgave - brug en reel udviklingsopgave til at vurdere forskellen i ydeevne
Du finder detaljerede vejledninger til hvert værktøj i vores dokumentation om agentic coding.
Konfigurationen tager typisk kun få minutter.
Kontrol af API:
curl -s https://api.infercom.ai/v1/responses \
-H "Authorization: Bearer $INFERCOM_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"MiniMax-M2.7","input":"Write a Python function to reverse a string"}' \
| jq '.output[0].content[0].text'
Opsummering
Agentic coding-værktøjer stiller grundlæggende andre krav til ydeevnen end chatbaserede AI-brugerflader, fordi de bruger så mange tokens.
Inferenshastigheden påvirker direkte udviklernes produktivitet gennem kortere ventetider og tættere feedback-loops.
MiniMax-M2.5 på Infercom tilbyder 400+ tok/s throughput, 75,8% nøjagtighed på SWE-bench, et kontekstvindue på 160K og EU-dataresidency.
For teams, der vurderer inferensudbydere til agentic coding-workloads, bør throughput være et af de vigtigste kriterier ved siden af modelkvalitet og krav til dataresidency.