Performance
Inferenz-Geschwindigkeit, gemessen
Jede Zahl auf dieser Seite stammt von unserer Produktions-API in München, mit Methode und Datum daneben. Den gleichen Test können Sie selbst ausführen.
Token pro Sekunde, gemessen
Diese Werte stammen aus unserer Produktions-API auf unseren Servern in der EU. Kein Marketing eines Herstellers, sondern echte Messungen, die Sie selbst wiederholen können.
gpt-oss-120b
Unser schnellstes
Bis zu 772 tok/s bei kürzeren Prompts
MiniMax M2.7 Ultraspeed
Unser Reasoning-Modell
Bis zu 444 tok/s bei kürzeren Prompts
Gemma 4 31B
Nativ multimodal
Versteht Bilder und Text nativ
Serverseitige Werte (p50), gemessen mit unserem Open-Source-Benchmark-Tool. Ihre clientseitigen Ergebnisse hängen von Netzwerkstandort und Netzwerkbedingungen ab. Zuletzt gemessen: Juli 2026.
Schnelle LLM-Inferenz, nach Workload
Welche Kennzahl über Ihre Geschwindigkeit entscheidet, hängt davon ab, was Sie bauen. Hier sind dieselben Messungen aus drei Blickwinkeln.
Chat und Voice
Time to First Token
388 ms
gpt-oss-120b - p50
Dialog- und Voice-Anwendungen werden daran gemessen, wie schnell das erste Wort erscheint, nicht daran, wie schnell der Rest folgt.
Agenten und Coding
Ausgabe-Durchsatz
713 tok/s
gpt-oss-120b - p50
Agenten-Schleifen und Coding-Assistenten warten auf die vollständige Antwort, deshalb bestimmen die Token pro Sekunde das Tempo. Für Frontier-Reasoning über lange Läufe misst MiniMax M2.7 Ultraspeed 428 tok/s bei einem Kontextfenster von 192K.
Batch und RAG
End-to-End-Latenz
1,789 s
gpt-oss-120b - p50
Für Pipelines zählt die gesamte Zeit bis zur vollständigen Antwort. Gemma 4 31B nimmt Bild und Text im selben Request an, für Dokumenten- und Vision-Workloads.
Schnell ist nur die eine Hälfte. Jede Zahl oben haben wir auf eigener Hardware in München gemessen. Was EU-souverän konkret bedeutet.
Was unter Last passiert
Die Ausgabegeschwindigkeit eines Requests bleibt erhalten, wenn mehr Requests parallel laufen: Der Chip bearbeitet jeweils einen kleinen Batch, und jede Antwort fließt fast mit voller Geschwindigkeit weiter. Was wächst, ist die Time to First Token, wenn Requests auf einen Platz im nächsten Batch warten müssen. Auf der geteilten API passiert das zu Spitzenzeiten. Braucht Ihr Workload planbare Kapazität, bieten Enterprise-Pläne garantierte Rate Limits, und ein dediziertes Rack bedient nur Ihren Traffic.
Open Source
Eigenen Benchmark ausführen
Unser Benchmark-Tool ist vollständig Open Source. Führen Sie es mit Ihrem API-Key gegen unsere API aus, oder klonen Sie das Repository und starten Sie es lokal. Gleicher Code, gleiche Methodik, Ihre eigenen Ergebnisse.
- 01
Synthetische Performance
Feste Token-Zahlen für Input und Output, für kontrollierte Vergleiche zwischen Modellen
- 02
Simulation realer Workloads
Wechselnde Request-Raten, die echte Lastmuster aus der Produktion nachbilden
- 03
Eigener Datensatz
Laden Sie eigene Prompts hoch, und messen Sie die Performance an Ihrem tatsächlichen Workload
- 04
Interaktiver Chat
Kennzahlen zu jeder Antwort in einem Live-Chat: TTFT und Durchsatz bei jeder Antwort sichtbar
Wie wir messen
Drei Kennzahlen unter denselben Bedingungen: serverseitiger p50, 10K Input- und 1K Output-Token, jeweils ein Request. Wir messen jedes Quartal neu.
Time to First Token (TTFT)
Wie schnell das Modell nach Ihrem Request zu antworten beginnt. Entscheidend für interaktive Anwendungen und Chat-Oberflächen.
Ausgabe-Durchsatz
Die Token pro Sekunde, die nach dem ersten Token erzeugt werden. Sie bestimmen, wie schnell eine vollständige Antwort beim Nutzer ankommt.
End-to-End-Latenz
Die Gesamtzeit vom Request bis zur vollständigen Antwort, also TTFT plus die gesamte Generierungszeit. Das ist die Kennzahl, die für Batch-Workloads zählt.
Woher diese Zahlen kommen
Alle Messungen stammen von unserer Produktionsinfrastruktur in München.
- Standort
- München, Deutschland
- Hardware
- SambaNova SN40L
- Eigentum
- Eigene Hardware
- Zertifizierung
- Nach ISO 27001 zertifiziert
Ihre Requests werden auf Racks verarbeitet, die Infercom gehören, nicht auf gemieteter Cloud-Kapazität.
Die Technologie, unabhängig betrachtet
Diese Quellen haben die Dataflow-Technologie von SambaNova gemessen oder darüber berichtet, meist auf der eigenen Cloud von SambaNova in den USA. Es sind keine Messungen unseres Dienstes; unsere stehen oben.
- Artificial Analysis - SambaNova-Benchmarks Artificial Analysis: Unabhängige, laufend aktualisierte Messungen von Geschwindigkeit und Latenz der Cloud von SambaNova, neben anderen Anbietern.
- SambaNova durchbricht die Marke von 1000 Token pro Sekunde VentureBeat: 2024: SambaNova überschreitet mit Llama 3 die Marke von 1.000 Token pro Sekunde.
- DeepSeek R1 671B mit 95% weniger Chips TechRadar: 2025: SambaNova betreibt DeepSeek R1 671B auf 16 Chips, wo GPU-Systeme weit mehr brauchen.
- Geschwindigkeitsrekord mit Llama 3.1 405B SambaNova: Das Geschwindigkeitsergebnis von SambaNova mit Llama 3.1 405B, gemessen von Artificial Analysis.
- Intelligence per Joule SambaNova: SambaNova darüber, warum Energie pro Einheit Intelligenz im großen Maßstab zählt.
- Forschung zu Intelligence per Watt Stanford Hazy Research: Eine unabhängige Methode, um die Effizienz von KI zu messen; die Studie umfasst den SN40L.
Geschwindigkeit und Energie
Weniger Datenbewegung macht den Chip schnell und spart Energie: Ein Request, der früher fertig ist, braucht für kürzere Zeit Strom.
10 kW
Pro Rack, typisch
Rund 10 kW im typischen Betrieb, 7 bis 14,5 kW bei Inferenz.
Luftgekühlt
Keine Flüssigkühlung
Passt in Rechenzentren, die für normale Server gebaut sind. Die Chips brauchen kein Wasser zur Kühlung.
Bis zu 5x
Energieeffizienz
SambaNova: 2,5x bis 5,6x gegenüber einer NVIDIA H200 mit Llama 70B, je nach Batchgröße (2025).
Geschwindigkeit der LLM-Inferenz: häufige Fragen
Wer hat die schnellste LLM-Inferenz in Europa?
Wir erstellen keine Rangliste anderer Anbieter; das übernehmen unabhängige Vergleiche wie Artificial Analysis. Wir veröffentlichen unsere eigene Messung: 713 tok/s mit gpt-oss-120b, bei kürzeren Prompts bis zu 772 tok/s, gemessen auf unserer Produktions-API in München (Juli 2026). Mit unserem Open-Source-Benchmark-Tool können Sie denselben Test gegen jeden Anbieter ausführen.
Welches Modell ist am schnellsten, und wofür?
gpt-oss-120b erreicht mit 713 tok/s den höchsten Ausgabe-Durchsatz und hat mit 388 ms auch unsere kürzeste Time to First Token. Damit ist es die erste Wahl für Chat, Voice und Agent-Schleifen mit hohem Volumen. MiniMax M2.7 Ultraspeed ist unser Frontier-Reasoning-Modell mit 229B Parametern: 428 tok/s und ein Context Window von 192K für lange agentische Läufe und schwierige Coding-Aufgaben. Gemma 4 31B erreicht 199 tok/s und verarbeitet zusätzlich Bild und Text. Chat und Voice hängen von der Time to First Token ab, Agents und Coding vom Durchsatz.
Wie wird gemessen, und kann ich das nachprüfen?
Ja. Jede Zahl ist ein serverseitiger p50-Wert bei 10K Input-Token und 1K Output-Token, mit einem einzelnen Request, gemessen gegen unsere Produktions-API mit unserem Open-Source-Benchmark-Tool. Führen Sie es online mit Ihrem eigenen Key gegen unsere API aus, oder klonen Sie das Repository und testen Sie lokal mit Ihren eigenen Prompts. Ihre clientseitigen Ergebnisse weichen je nach Netzwerkstandort und Netzwerkbedingungen ab.
Was passiert mit der Geschwindigkeit, wenn viele Requests gleichzeitig laufen?
Jeder Request fließt fast mit voller Ausgabegeschwindigkeit weiter, weil der Chip jeweils einen kleinen Batch bearbeitet. Die Time to First Token wächst, wenn Requests auf den nächsten Batch warten; auf der geteilten API passiert das zu Spitzenzeiten. Für planbare Kapazität gibt es Enterprise-Rate-Limits oder ein dediziertes Rack.
Ist die Geschwindigkeit unabhängig bestätigt?
Artificial Analysis misst die Cloud von SambaNova laufend, VentureBeat und TechRadar haben über ihre Geschwindigkeit berichtet, und eine Stanford-Studie zur Energieeffizienz umfasst den SN40L. Diese Quellen betreffen die Technologie. Die Zahlen pro Modell auf dieser Seite sind unsere eigenen Messungen auf unserer eigenen Infrastruktur in München. Deshalb veröffentlichen wir das Benchmark-Tool, damit Sie sie prüfen können.
Warum ist Dataflow schneller als GPUs?
Während sie eine Antwort schreibt, führt eine GPU eine Modellschicht in vielen einzelnen Schritten aus und schreibt die Ergebnisse dazwischen in den Speicher zurück. Ein Dataflow-Chip führt die ganze Schicht in einem Schritt aus und behält diese Ergebnisse auf dem Chip. So nutzt er seine Speicherbandbreite für die Gewichte und antwortet früher.
Ihre Integration optimieren
Mit unseren Ressourcen für Entwickler holen Sie die beste Performance aus Ihrer Infercom-Integration.
- Performance-Leitfaden Connection Pooling, Streaming und Techniken, die die Latenz senken
- Benchmark-Tool Benchmarks mit Ihren eigenen Workloads gegen unsere API ausführen
- AI Starter Kit Open-Source-Beispiele, Benchmarks und Vorlagen für die Integration
- Preise Transparente Preise pro Token: Sie zahlen nur, was Sie nutzen