Woher der Zielkonflikt kommt

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: Jeder Decode-Schritt muss die Modellgewichte aus dem Speicher lesen. Mit Batching lädt die Hardware die Gewichte einmal und bringt viele Requests gemeinsam voran. Dadurch steigen die gesamten Token pro Sekunde mit der Batch-Größe steil an. Alle Requests im Batch teilen sich aber dieselbe Bandbreite, deshalb treffen die Token jedes Nutzers langsamer ein. Databricks hat das auf einer A100 konkret gemessen: Batch-Größe 64 brachte 14x so viel Durchsatz, bei 4x so hoher Latenz pro Request.

Der Zielkonflikt hat einen Kipppunkt. Werden die Batches so groß, dass das Decode rechengebunden wird, steigt der Durchsatz nicht mehr, die Latenz aber verschlechtert sich weiter. Databricks formuliert es so: Ab diesem Punkt erhöht jede Verdopplung der Batch-Größe nur noch die Latenz. Forschungssysteme wie Sarathi-Serve (OSDI 2024) wurden eigens entwickelt, um diese Kurve zu steuern. Mit naivem Scheduling kann das Prefill eines einzigen Nutzers die Generierung aller anderen blockieren.

Was das für die Wahl eines Anbieters bedeutet

Zwei Anbieter mit identischen Modellen auf identischen GPUs können völlig unterschiedlich schnell sein, je nachdem, wie aggressiv sie Batching betreiben. Hohe Auslastung ist gut für die Wirtschaftlichkeit des Anbieters. Niedrige Latenz ist gut für Ihre Nutzer. Besseres Scheduling (Continuous Batching, Chunked Prefill) verschiebt die Kurve nach außen. Andere Hardware verändert ihre Form ganz: Architekturen, die bei kleinen Batch-Größen effizient bleiben, können hohe Geschwindigkeit pro Request bieten, ohne dafür so viel Kapazität zu opfern. Das ist der Grundgedanke der Dataflow-Architektur, auf der unsere Plattform läuft.

Ein praktischer Rat: Testen Sie Anbieter mit Ihrem realen Workload und Ihrer realen Parallelität, nicht nur mit einzelnen Requests um Mitternacht. Beobachten Sie, wie stabil die Inter-Token-Latenz über den Tag bleibt. Daran sehen Sie, wie stark die Kapazität tatsächlich überbucht ist.

Quellen

Sehen Sie diese Metriken live gemessen auf unserer EU-Infrastruktur: echte Werte von Produktionshardware, unabhängig verifiziert.

Live-Benchmarks ansehen