Wer mit Cursor, Cline oder Codex CLI arbeitet, kann am Tag mehrere zehn Millionen Token durch das Modell schicken. Agentische Workflows sind token-intensiv: Die KI liest Dateien, plant Änderungen, schreibt Code, führt Tests aus, stößt auf Fehler und setzt neu an. Jeder dieser Schritte ist ein Roundtrip zur Inferenz-API, und bei jedem Roundtrip geht der wachsende Kontext erneut mit.

Der Großteil dieser Token ist Input, nicht Output. Bei 792 Entwicklern und 29.230 erfassten Coding-Tagen waren 94,8% aller Token gecachter Input (Cache-Reads) und nur 0,2% Output (viberank, 2026). Ein einzelner Turn eines Agents erzeugt einige hundert Output-Token: Über eine Woche mit 13.972 Turns eines Entwicklers waren es im Schnitt etwa 420 (Quelle).

Wie lange ein Turn dauert, hängt von der Output-Geschwindigkeit ab. Für einen Turn mit 400 Output-Token gilt:

  • Bei 90 Token pro Sekunde (typisch für ein Frontier-Modell): ~4,4 Sekunden
  • Bei 400+ Token pro Sekunde (MiniMax-M2.5): ~1 Sekunde

Über eine Aufgabe mit 50 bis 200 Turns summiert sich das auf 4-15 Minuten Warten auf den Output, gegenüber 1-3 Minuten. Schnellere Inferenz bedeutet weniger Warten auf Antworten und mehr Zeit im produktiven Flow.

Dieser Artikel erklärt, warum Agentic Coding andere Anforderungen an die Performance stellt als chatbasierte KI-Tools und wie Sie auf Geschwindigkeit optimieren.


Warum Agentic-Coding-Tools so viele Token verbrauchen

Bei chatbasierten KI-Tools besteht eine Interaktion meist aus einem einzigen Wechsel von Request und Antwort.

Agentic Coding funktioniert anders. Eine einzige Aufgabe wie "Refaktoriere dieses Modul" löst Dutzende LLM-Aufrufe aus. Der Agent liest Dateien, baut Kontext auf, plant sein Vorgehen, schreibt Code, führt Tests aus, stößt auf Fehler, debuggt und setzt neu an. Jeder Schritt erfordert einen Roundtrip zur Inferenz.

Eine einzelne Aufgabe zerfällt dabei in zwei klar getrennte Phasen:

Planungsphase (5-15 Turns):

  • Struktur der Codebase verstehen
  • Abhängigkeiten und Architektur analysieren
  • Migrationsstrategie entwerfen
  • Risiken und Grenzfälle bewerten

Ausführungsphase (50-200+ Turns):

  • Dateien lesen und analysieren
  • Diffs schreiben und Änderungen anwenden
  • Tests ausführen und Fehlschläge erfassen
  • Fehler beheben und iterieren, bis alles grün ist
Muster Turns Verarbeitete Token Warten auf Output (90 tok/s) Warten auf Output (400 tok/s)
Chat Completion 1-3 2-5K 4-13 s 1-3 s
RAG-Pipeline 3-5 10-30K 13-22 s 3-5 s
Agentic Coding 50-200+ Millionen, meist Input 4-15 Min. 1-3 Min.

Die Wartezeiten sind mit etwa 400 Output-Token pro Turn berechnet.

Zur Einordnung: Eine Chat Completion umfasst ein bis drei Turns, deshalb dauert das Warten bei fast jeder Geschwindigkeit nur wenige Sekunden. Beim Agentic Coding summiert sich die Wartezeit: Dieselben Sekunden pro Turn fallen 50- bis 200-mal pro Aufgabe an, und das bei jeder Aufgabe des Tages.

Die Planung profitiert von der Intelligenz des Modells, die Ausführung von der Geschwindigkeit. Auf die Ausführung entfallen typischerweise über 90% aller Turns.


Token-Verbrauch in einer typischen Agentic-Coding-Session

So verteilt sich der Token-Verbrauch bei einer typischen Agentic-Coding-Aufgabe:

Bei unterschiedlichen Geschwindigkeiten:

Anbieter Geschwindigkeit Warten auf Output Pro Turn
Typisches Frontier-Modell 60-100 tok/s 7-11 Min. 4-7 s
MiniMax-M2.5 auf Infercom 400+ tok/s unter 2 Min. ~1 s

Für diese Aufgabe braucht ein typisches Frontier-Modell bei 60-100 tok/s 7-11 Minuten, um den Output zu erzeugen. MiniMax-M2.5 auf Infercom kommt mit 400+ tok/s auf unter 2 Minuten. Der Unterschied verteilt sich auf viele kleine Wartezeiten: 4-7 Sekunden gegenüber etwa einer Sekunde, jedes Mal, wenn der Agent antwortet.

Über einen Arbeitstag summieren sich diese Wartezeiten. Ein Entwickler, dessen Agents 500 Turns am Tag ausführen, erhält etwa 200K Output-Token. Das sind 33-56 Minuten Warten bei 60-100 tok/s und etwa 8 Minuten bei 400 tok/s. Hinzu kommt bei jedem Turn die Zeit, in der das Modell den Input verarbeitet, und sie wächst mit der Größe der Codebase. Dieser Teil hängt von der Prefill-Geschwindigkeit und vom Prompt Caching ab, nicht von der Output-Geschwindigkeit.


Zwei Wege zu schnellerem Agentic Coding

Es gibt zwei grundlegende Ansätze, die Inferenz-Geschwindigkeit für Agentic-Coding-Tools zu verbessern:

Option A: Vollständiger Ersatz

Sie nutzen MiniMax-M2.5 für alles. Das ist das einfachste Setup:

  • Ein Modell, ein Anbieter
  • 75,8% auf SWE-bench Verified - auf dem Niveau der Frontier-Modelle
  • 400+ Token pro Sekunde auf EU-Infrastruktur
  • Einfachste Konfiguration, niedrigste Kosten

Geeignet für: Teams, die auf Geschwindigkeit und Einfachheit setzen

Codex-CLI-Konfiguration (vollständiger Ersatz):

# ~/.codex/config.toml
model = "MiniMax-M2.7"
model_provider = "infercom"

[model_providers.infercom]
name = "Infercom (EU Sovereign)"
base_url = "https://api.infercom.ai/v1"
env_key = "INFERCOM_API_KEY"
wire_api = "responses"

Option B: Aufteilung in Planner und Executor

Sie behalten Ihr Frontier-Modell (Claude, GPT, Gemini) für komplexe Planungsentscheidungen und leiten die Ausführung an schnelle Inferenz weiter.

Das Muster sieht so aus:

Phase Turns Was passiert Priorität beim Modell
Planung 5-15 Codebase verstehen, Architekturentscheidungen, Migrationsstrategie, Risikobewertung Qualität (Frontier-Modell)
Ausführung 50-200+ Dateien lesen, Diffs, Tests, Fehlschläge, Fixes, Iteration Geschwindigkeit (schnelles Modell)

Die Aufteilung in Planner und Executor trägt der Tatsache Rechnung, dass Planung und Ausführung unterschiedliche Anforderungen haben. Die Planung umfasst 5-15 Turns, in denen das Modell die Codebase analysiert, Architekturentscheidungen trifft und Risiken bewertet. Dafür lohnen sich die Reasoning-Fähigkeiten eines Frontier-Modells. Die Ausführung umfasst 50-200+ Turns mit Dateioperationen, Code-Generierung, Tests und Iteration, und hier zählt vor allem Geschwindigkeit. Da auf die Ausführung der weitaus größte Teil der Turns entfällt, verkürzt ihre Weiterleitung an ein schnelles Modell wie MiniMax-M2.5 die gesamte Inferenzzeit deutlich, während die Planung auf Frontier-Niveau bleibt.

Über 90% Ihrer Turns entfallen auf die Ausführung, nicht auf die Planung. Leiten Sie diese Turns an schnelle Inferenz weiter.

Geeignet für: Teams, die bereits auf ein Frontier-Modell setzen und den Großteil ihres Token-Verbrauchs optimieren möchten

Cline-Konfiguration (Aufteilung in Planner und Executor):

Aktivieren Sie in den Cline-Einstellungen "Use different models for Plan and Act modes":

  • Plan Model: Claude Sonnet (oder Ihr Frontier-Modell)
  • Act Model: MiniMax-M2.7 über die Infercom API

OpenCode-Konfiguration:

// opencode.json
{
  "agent": {
    "plan": {
      "model": "claude-sonnet-4-5-20250514",
      "provider": "anthropic"
    },
    "build": {
      "model": "MiniMax-M2.7",
      "provider": "infercom"
    }
  }
}

Codex CLI für Infercom konfigurieren

Codex CLI ist der Open-Source-Assistent von OpenAI für Agentic Coding. So konfigurieren Sie ihn für Infercom:

Voraussetzungen:

Installation:

npm install -g @openai/codex

API-Schlüssel setzen:

export INFERCOM_API_KEY="your-key-here"
# Für dauerhafte Nutzung in ~/.zshrc oder ~/.bashrc eintragen

Konfigurationsdatei anlegen (~/.codex/config.toml):

# Default settings
model = "MiniMax-M2.7"
model_provider = "infercom"
approval_mode = "suggest"  # Options: suggest, auto-edit, full-auto

# Infercom provider definition
[model_providers.infercom]
name = "Infercom (EU Sovereign)"
base_url = "https://api.infercom.ai/v1"
env_key = "INFERCOM_API_KEY"
wire_api = "responses"

Setup prüfen:

codex
# Sollte anzeigen:
# model: MiniMax-M2.7
# provider: infercom

Wie die Inferenz-Geschwindigkeit den Entwickler-Workflow beeinflusst

Über die reine Zeitersparnis hinaus wirkt sich die Inferenz-Geschwindigkeit auf mehrere Aspekte der Entwicklungsarbeit aus.

Kosten von Kontextwechseln: Kurze Wartezeiten (unter 30 Sekunden) erlauben es Entwicklern, bei der aktuellen Aufgabe zu bleiben. Längere Wartezeiten führen oft zu Kontextwechseln, und die Rückkehr zur ursprünglichen Aufgabe kostet dann zusätzlich Produktivität.

Iterationsfrequenz: Schnellere Inferenz macht Experimente praktikabler. Entwickler können mehrere Ansätze zügig ausprobieren und Probleme früher im Entwicklungszyklus erkennen.

Größe der Feedback-Schleifen: Schnelle Antworten erlauben das Arbeiten in kleineren Schritten. Kleinere Änderungen lassen sich in der Regel leichter reviewen, testen und mergen.

Auswirkung auf Teamebene:

Führen in einem Team mit 5 Personen die Agents jedes Entwicklers 500 Turns am Tag aus, spart der Wechsel von 90 tok/s auf 400+ tok/s pro Entwickler etwa 30 Minuten Wartezeit täglich (von 37 auf 8 Minuten). Das sind rund 2,5 Stunden pro Tag oder etwa 50 Stunden im Monat.

Bei Vollkosten von 80 € pro Stunde entspricht das rund 4.000 € pro Monat an Engineering-Zeit, die in produktive Arbeit fließen kann. Die Zeit, in der das Modell den Input verarbeitet, kommt noch hinzu und ist hier nicht eingerechnet.

Die Auswirkung auf die Produktivität wächst mit der Teamgröße und dem Umfang der Agentic-Coding-Aufgaben.


EU-Datenresidenz und DSGVO-Konformität

Für Teams mit Vorgaben zur Datenresidenz spielt der Standort der Inferenz-Infrastruktur eine Rolle.

Für MiniMax-M2.5 auf Infercom gilt:

  • SambaNova-Hardware in München, Deutschland
  • Volle DSGVO-Konformität
  • Nicht dem US CLOUD Act ausgesetzt
  • ISO-27001-zertifizierte Infrastruktur

Für Teams in regulierten Branchen (Finanzen, Gesundheitswesen, Recht, öffentliche Verwaltung) kann EU-Datenresidenz eine Compliance-Anforderung sein.

Performance und Souveränität:

In der EU gehostete Inferenz galt lange als langsamer als die Angebote von Anbietern aus den USA.

MiniMax-M2.5 auf Infercom zeigt, dass hoher Durchsatz (400+ tok/s) auch auf EU-Infrastruktur möglich ist. Damit entfällt der klassische Zielkonflikt zwischen Datensouveränität und Inferenz-Geschwindigkeit.


Erste Schritte

So testen Sie Infercom mit Ihren Agentic-Coding-Tools:

  1. API-Schlüssel anlegen - unter cloud.infercom.ai/apis
  2. Tool konfigurieren - Infercom unterstützt Codex CLI, Cline, Cursor und andere OpenAI-kompatible Tools
  3. Mit einer echten Aufgabe testen - nehmen Sie eine reale Entwicklungsaufgabe, um den Unterschied in der Performance zu bewerten

Detaillierte Anleitungen für jedes Tool finden Sie in unserer Dokumentation zu Agentic Coding.

Die Konfiguration dauert in der Regel nur wenige Minuten.

API prüfen:

curl -s https://api.infercom.ai/v1/responses \
  -H "Authorization: Bearer $INFERCOM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"MiniMax-M2.7","input":"Write a Python function to reverse a string"}' \
  | jq '.output[0].content[0].text'

Zusammenfassung

Agentic-Coding-Tools stellen wegen ihres hohen Token-Verbrauchs grundlegend andere Anforderungen an die Performance als chatbasierte KI-Oberflächen.

Die Inferenz-Geschwindigkeit wirkt sich direkt auf die Produktivität von Entwicklern aus, weil Wartezeiten sinken und Feedback-Schleifen kürzer werden.

MiniMax-M2.5 auf Infercom bietet 400+ tok/s Durchsatz, 75,8% Genauigkeit auf SWE-bench, ein Kontextfenster von 160K und EU-Datenresidenz.

Wenn Sie Inferenz-Anbieter für Agentic-Coding-Workloads bewerten, sollte der Durchsatz neben Modellqualität und Datenresidenz zu den wichtigsten Kriterien gehören.

TV
Thomas VitsGeschrieben von Thomas Vits, mit Unterstützung von KI.