Performance

Inferenz-Geschwindigkeit, gemessen

Jede Zahl auf dieser Seite stammt von unserer Produktions-API in München, mit Methode und Datum daneben. Den gleichen Test können Sie selbst ausführen.

713tok/s mit gpt-oss-120bMesswerte
388ms bis zum ersten Token, gpt-oss-120bMesswerte
428tok/s mit MiniMax M2.7Messwerte
bis zu10xschneller als GPU-basierte InferenzQuellen

Ausgabe-Durchsatz, p50, 10K Input / 1K Output, einzelner Request. Zuletzt gemessen: Juli 2026.

Token pro Sekunde, gemessen

Diese Werte stammen aus unserer Produktions-API auf unseren Servern in der EU. Kein Marketing eines Herstellers, sondern echte Messungen, die Sie selbst wiederholen können.

gpt-oss-120b

Unser schnellstes

713tok/s · Ausgabe-Durchsatz
388ms · Time to First Token
1,789s · End-to-End-Latenz

Bis zu 772 tok/s bei kürzeren Prompts

MiniMax M2.7 Ultraspeed

Unser Reasoning-Modell

428tok/s · Ausgabe-Durchsatz
690ms · Time to First Token
3,023s · End-to-End-Latenz

Bis zu 444 tok/s bei kürzeren Prompts

Gemma 4 31B

Nativ multimodal

199tok/s · Ausgabe-Durchsatz
1189ms · Time to First Token
6,206s · End-to-End-Latenz

Versteht Bilder und Text nativ

Serverseitige Werte (p50), gemessen mit unserem Open-Source-Benchmark-Tool. Ihre clientseitigen Ergebnisse hängen von Netzwerkstandort und Netzwerkbedingungen ab. Zuletzt gemessen: Juli 2026.

Schnelle LLM-Inferenz, nach Workload

Welche Kennzahl über Ihre Geschwindigkeit entscheidet, hängt davon ab, was Sie bauen. Hier sind dieselben Messungen aus drei Blickwinkeln.

Chat und Voice

Time to First Token

388 ms

gpt-oss-120b - p50

Dialog- und Voice-Anwendungen werden daran gemessen, wie schnell das erste Wort erscheint, nicht daran, wie schnell der Rest folgt.

Time to First Token

Agenten und Coding

Ausgabe-Durchsatz

713 tok/s

gpt-oss-120b - p50

Agenten-Schleifen und Coding-Assistenten warten auf die vollständige Antwort, deshalb bestimmen die Token pro Sekunde das Tempo. Für Frontier-Reasoning über lange Läufe misst MiniMax M2.7 Ultraspeed 428 tok/s bei einem Kontextfenster von 192K.

Ausgabe-Durchsatz

Batch und RAG

End-to-End-Latenz

1,789 s

gpt-oss-120b - p50

Für Pipelines zählt die gesamte Zeit bis zur vollständigen Antwort. Gemma 4 31B nimmt Bild und Text im selben Request an, für Dokumenten- und Vision-Workloads.

End-to-End-Latenz

Schnell ist nur die eine Hälfte. Jede Zahl oben haben wir auf eigener Hardware in München gemessen. Was EU-souverän konkret bedeutet.

Was unter Last passiert

Die Ausgabegeschwindigkeit eines Requests bleibt erhalten, wenn mehr Requests parallel laufen: Der Chip bearbeitet jeweils einen kleinen Batch, und jede Antwort fließt fast mit voller Geschwindigkeit weiter. Was wächst, ist die Time to First Token, wenn Requests auf einen Platz im nächsten Batch warten müssen. Auf der geteilten API passiert das zu Spitzenzeiten. Braucht Ihr Workload planbare Kapazität, bieten Enterprise-Pläne garantierte Rate Limits, und ein dediziertes Rack bedient nur Ihren Traffic.

Dedicated Capacity

Open Source

Eigenen Benchmark ausführen

Unser Benchmark-Tool ist vollständig Open Source. Führen Sie es mit Ihrem API-Key gegen unsere API aus, oder klonen Sie das Repository und starten Sie es lokal. Gleicher Code, gleiche Methodik, Ihre eigenen Ergebnisse.

  1. 01

    Synthetische Performance

    Feste Token-Zahlen für Input und Output, für kontrollierte Vergleiche zwischen Modellen

  2. 02

    Simulation realer Workloads

    Wechselnde Request-Raten, die echte Lastmuster aus der Produktion nachbilden

  3. 03

    Eigener Datensatz

    Laden Sie eigene Prompts hoch, und messen Sie die Performance an Ihrem tatsächlichen Workload

  4. 04

    Interaktiver Chat

    Kennzahlen zu jeder Antwort in einem Live-Chat: TTFT und Durchsatz bei jeder Antwort sichtbar

Wie wir messen

Drei Kennzahlen unter denselben Bedingungen: serverseitiger p50, 10K Input- und 1K Output-Token, jeweils ein Request. Wir messen jedes Quartal neu.

Time to First Token (TTFT)

Wie schnell das Modell nach Ihrem Request zu antworten beginnt. Entscheidend für interaktive Anwendungen und Chat-Oberflächen.

Ausgabe-Durchsatz

Die Token pro Sekunde, die nach dem ersten Token erzeugt werden. Sie bestimmen, wie schnell eine vollständige Antwort beim Nutzer ankommt.

End-to-End-Latenz

Die Gesamtzeit vom Request bis zur vollständigen Antwort, also TTFT plus die gesamte Generierungszeit. Das ist die Kennzahl, die für Batch-Workloads zählt.

Woher diese Zahlen kommen

Alle Messungen stammen von unserer Produktionsinfrastruktur in München.

Standort
München, Deutschland
Hardware
SambaNova SN40L
Eigentum
Eigene Hardware
Zertifizierung
Nach ISO 27001 zertifiziert

Ihre Requests werden auf Racks verarbeitet, die Infercom gehören, nicht auf gemieteter Cloud-Kapazität.

So funktioniert die Hardware

Geschwindigkeit und Energie

Weniger Datenbewegung macht den Chip schnell und spart Energie: Ein Request, der früher fertig ist, braucht für kürzere Zeit Strom.

10 kW

Pro Rack, typisch

Rund 10 kW im typischen Betrieb, 7 bis 14,5 kW bei Inferenz.

Luftgekühlt

Keine Flüssigkühlung

Passt in Rechenzentren, die für normale Server gebaut sind. Die Chips brauchen kein Wasser zur Kühlung.

Bis zu 5x

Energieeffizienz

SambaNova: 2,5x bis 5,6x gegenüber einer NVIDIA H200 mit Llama 70B, je nach Batchgröße (2025).

Warum der Chip Energie spart

Geschwindigkeit der LLM-Inferenz: häufige Fragen

Wer hat die schnellste LLM-Inferenz in Europa?

Wir erstellen keine Rangliste anderer Anbieter; das übernehmen unabhängige Vergleiche wie Artificial Analysis. Wir veröffentlichen unsere eigene Messung: 713 tok/s mit gpt-oss-120b, bei kürzeren Prompts bis zu 772 tok/s, gemessen auf unserer Produktions-API in München (Juli 2026). Mit unserem Open-Source-Benchmark-Tool können Sie denselben Test gegen jeden Anbieter ausführen.

Benchmark selbst ausführen

Welches Modell ist am schnellsten, und wofür?

gpt-oss-120b erreicht mit 713 tok/s den höchsten Ausgabe-Durchsatz und hat mit 388 ms auch unsere kürzeste Time to First Token. Damit ist es die erste Wahl für Chat, Voice und Agent-Schleifen mit hohem Volumen. MiniMax M2.7 Ultraspeed ist unser Frontier-Reasoning-Modell mit 229B Parametern: 428 tok/s und ein Context Window von 192K für lange agentische Läufe und schwierige Coding-Aufgaben. Gemma 4 31B erreicht 199 tok/s und verarbeitet zusätzlich Bild und Text. Chat und Voice hängen von der Time to First Token ab, Agents und Coding vom Durchsatz.

Modelle vergleichen

Wie wird gemessen, und kann ich das nachprüfen?

Ja. Jede Zahl ist ein serverseitiger p50-Wert bei 10K Input-Token und 1K Output-Token, mit einem einzelnen Request, gemessen gegen unsere Produktions-API mit unserem Open-Source-Benchmark-Tool. Führen Sie es online mit Ihrem eigenen Key gegen unsere API aus, oder klonen Sie das Repository und testen Sie lokal mit Ihren eigenen Prompts. Ihre clientseitigen Ergebnisse weichen je nach Netzwerkstandort und Netzwerkbedingungen ab.

Quellcode des Benchmark-Tools ansehen

Was passiert mit der Geschwindigkeit, wenn viele Requests gleichzeitig laufen?

Jeder Request fließt fast mit voller Ausgabegeschwindigkeit weiter, weil der Chip jeweils einen kleinen Batch bearbeitet. Die Time to First Token wächst, wenn Requests auf den nächsten Batch warten; auf der geteilten API passiert das zu Spitzenzeiten. Für planbare Kapazität gibt es Enterprise-Rate-Limits oder ein dediziertes Rack.

Dedicated Capacity

Ist die Geschwindigkeit unabhängig bestätigt?

Artificial Analysis misst die Cloud von SambaNova laufend, VentureBeat und TechRadar haben über ihre Geschwindigkeit berichtet, und eine Stanford-Studie zur Energieeffizienz umfasst den SN40L. Diese Quellen betreffen die Technologie. Die Zahlen pro Modell auf dieser Seite sind unsere eigenen Messungen auf unserer eigenen Infrastruktur in München. Deshalb veröffentlichen wir das Benchmark-Tool, damit Sie sie prüfen können.

Unabhängige Benchmarks ansehen

Warum ist Dataflow schneller als GPUs?

Während sie eine Antwort schreibt, führt eine GPU eine Modellschicht in vielen einzelnen Schritten aus und schreibt die Ergebnisse dazwischen in den Speicher zurück. Ein Dataflow-Chip führt die ganze Schicht in einem Schritt aus und behält diese Ergebnisse auf dem Chip. So nutzt er seine Speicherbandbreite für die Gewichte und antwortet früher.

Dataflow- und GPU-Architektur im Vergleich

Bereit, die Zukunft der KI in Europa zu gestalten?

Schließen Sie sich Unternehmen an, die souveräne KI mit erstklassiger Performance einsetzen