gpt-oss-120b API in Europa
Der Allrounder für die Produktion: gebaut für Agenten, nicht für Editoren.
Das Open-Weight-Modell von OpenAI, gemessen mit 713 Token pro Sekunde auf unserer EU-Infrastruktur in München. Verlässliche Leistung im Produktionsbetrieb, ohne die Kosten eines Flaggschiff-Modells.
Ausgabe-Durchsatz, p50, 10K Input / 1K Output, einzelner Request. Zuletzt gemessen: Juli 2026. Alle Benchmarks und die Methodik ansehen
OpenAI-Qualität mit der Freiheit offener Gewichte
gpt-oss-120b ist das erste Open-Weight-Modell von OpenAI, lizenziert unter Apache 2.0 und gebaut für agentische Workloads in der Produktion. Es ist nicht das spektakulärste Modell, aber eines, auf das Sie sich jeden Tag verlassen können.
Eingebautes Reasoning
Chain-of-Thought-Reasoning mit einstellbarem Aufwand: Sie entscheiden pro Aufgabe, ob Geschwindigkeit oder Genauigkeit wichtiger ist.
Bereit für die Produktion
Bei den meisten Aufgaben gleichauf mit GPT-4o, bei Benchmarks mit viel Reasoning sogar besser.
Bestes Preis-Leistungs-Verhältnis
Laut Artificial Analysis das beste Verhältnis von Preis zu Intelligenz.
Effizient konstruiert
- Parameter gesamt
- 117B
- Aktive Parameter
- 5,1B pro Forward Pass
- Architektur
- Mixture of Experts (MoE)
- Experten
- 128 Experten, Top-4-Routing pro Token
- Schichten
- 36
- Kontextlänge
- 128K Token
- Lizenz
- Apache 2.0
Gemessen auf EU-Infrastruktur
Ausgabe-Durchsatz
Time to First Token
End-to-End-Latenz
Kontextlänge
128K Token
10K Input / 1K Output, Parallelität 1, 10 Requests
Bis zu 772 tok/s bei kürzeren Prompts. Zuletzt gemessen: Juli 2026.
Warum es so schnell ist
Dank der MoE-Architektur erhalten Sie die Qualität eines 117B-Modells, rechnen pro Request aber nur mit 5,1B Parametern. Deshalb ist es so schnell.
- 22x weniger aktive Parameter pro Inferenz
- Geringerer Bedarf an Speicherbandbreite
- Experten-Routing für jedes Token optimiert
- Gleiche Qualität, ein Bruchteil der Rechenleistung
Nicht für Entwickler. Für Agenten.
"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
-
Function Calling
Native Tool-Nutzung für agentische Workflows
-
Structured Outputs
JSON-Modus für zuverlässiges Parsing
-
Reasoning steuern
Den Denkaufwand (niedrig, mittel, hoch) pro Aufgabe einstellen
Web Browsing
Eingebaut für Recherche-Agenten
Websites durchsuchen, Daten extrahieren und mehrstufige Recherchen eigenständig erledigen.
Code-Ausführung
Python-Ausführung für Agenten, die Daten analysieren
Python in einer Sandbox ausführen, für Datenverarbeitung, Berechnungen und Analysen.
Das richtige Modell für jede Aufgabe
Nicht jeder Request braucht Ihr teuerstes Modell. Erfahrene Teams setzen gpt-oss-120b als Teil einer Strategie mit mehreren Modellen ein.
"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
Balanced-Modus
Im Balanced-Modus: bei den meisten Aufgaben gleichauf mit GPT-4o
Deep-Modus
Im Deep-Modus: besser als GPT-4o beim Reasoning (MATH, HumanEval)
Kosteneffizienz
Zu einem Bruchteil der Kosten proprietärer Modelle
| Szenario | Modellwahl | Warum |
|---|---|---|
| Komplexes Reasoning | gpt-oss-120b (hoher Aufwand) | Wenn Genauigkeit am meisten zählt |
| Standardaufgaben | gpt-oss-120b (mittlerer Aufwand) | Ausgewogen zwischen Qualität und Kosten |
| Einfache Fragen | gpt-oss-120b (niedriger Aufwand) | Schnell, günstig und trotzdem genau |
| Premium-Aufgaben | MiniMax M2.7 Ultraspeed | Wenn Sie Spitzenleistung brauchen |
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
OpenAI Open-Weight auf EU-Infrastruktur
Nutzen Sie das Open-Weight-Modell von OpenAI, ohne Daten in die USA zu schicken:
- Gehostet in Deutschland auf eigener Infrastruktur von Infercom
- Vollständig DSGVO-konform, mit Auftragsverarbeitungsvertrag nach EU-Recht
- Nicht dem US CLOUD Act ausgesetzt
- Nach ISO 27001 zertifiziert
- Apache-2.0-Lizenz: volle Freiheit beim Deployment
- ISO 27001 zertifiziert
- DSGVO-konform
- Rechenzentrum in Deutschland
- Apache-2.0-Lizenz
In wenigen Minuten loslegen
OpenAI-kompatible API: Sie ersetzen nur den Endpoint, Ihr bestehender Code bleibt, wie er ist.
Sie zahlen nur für die Token, die Sie nutzen.
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)gpt-oss-120b: häufige Fragen
Wie schnell ist gpt-oss-120b bei Infercom?
713 Token pro Sekunde Ausgabe-Durchsatz und 388ms Time to First Token, beides serverseitig als p50 gemessen, bei 10K Input und 1K Output auf unserer Produktions-API in München. Mit kürzeren Prompts sind bis zu 772 tok/s möglich. Das ist bis zu 10x schneller als GPU-basierte Alternativen. Jeden Wert können Sie mit unserem Open-Source-Benchmark-Tool nachmessen.
Ist gpt-oss-120b ein Open-Weight-Modell?
Ja. OpenAI hat gpt-oss-120b unter der Apache-2.0-Lizenz veröffentlicht. Die Gewichte sind öffentlich, und Sie dürfen das Modell ohne gesonderte Vereinbarung kommerziell einsetzen, betreiben und per Fine-Tuning anpassen. Über Infercom heißt das nur: Wir hosten und betreiben es für Sie auf EU-Infrastruktur.
Kann ich gpt-oss-120b DSGVO-konform in der EU betreiben?
Ja. Infercom betreibt gpt-oss-120b auf eigener Hardware in einem Tier-III+-Rechenzentrum in München. Requests werden innerhalb der EU-Jurisdiktion verarbeitet und sind nicht dem US CLOUD Act ausgesetzt. Die Infrastruktur ist nach ISO 27001 zertifiziert, und ein Auftragsverarbeitungsvertrag nach EU-Recht ist auf Anfrage erhältlich. Wir trainieren nicht mit Ihren Daten.
Ist die API OpenAI-kompatibel?
Ja. Richten Sie das OpenAI SDK auf https://api.infercom.ai/v1, verwenden Sie Ihren Infercom-API-Key und geben Sie gpt-oss-120b als Modellnamen an. Code, der bereits mit der Chat Completions API von OpenAI arbeitet, läuft ohne Änderungen, einschließlich Streaming, Function Calling und Structured Output.
Wie groß ist das Kontextfenster von gpt-oss-120b?
128K Token (131.072), die sich Ihr Prompt und die Antwort des Modells teilen. Das reicht für große Codebasen, lange Agenten-Traces und Prompts aus mehreren Dokumenten in einem einzigen Request.
Was kostet gpt-oss-120b?
Sie zahlen pro Token, ohne Mindestumsatz und ohne monatliche Bindung: €0,22 pro Million Input-Token und €0,59 pro Million Output-Token (zzgl. MwSt.). Abgerechnet wird nur, was Sie nutzen. Verbrauch und Kosten sehen Sie live im Cloud-Portal.
Mehr erfahren
- Performance-Benchmarks So schnell läuft gpt-oss-120b auf unserer EU-Infrastruktur
- MiniMax M2.7 Ultraspeed Wenn Sie agentische Spitzenleistung brauchen
- Gemma 4 31B Wenn Bild und Text in denselben Request gehören
- EU-souveräne KI Wo Ihre Daten liegen und wer darauf zugreifen kann
- API-Dokumentation Vollständige API-Referenz und Integrationsanleitungen
- Preise Transparente Preise pro Token