OpenAI Open-Weight

gpt-oss-120b API in Europa

Der Allrounder für die Produktion: gebaut für Agenten, nicht für Editoren.

Das Open-Weight-Modell von OpenAI, gemessen mit 713 Token pro Sekunde auf unserer EU-Infrastruktur in München. Verlässliche Leistung im Produktionsbetrieb, ohne die Kosten eines Flaggschiff-Modells.

Ausgabe-Durchsatz, p50, 10K Input / 1K Output, einzelner Request. Zuletzt gemessen: Juli 2026. Alle Benchmarks und die Methodik ansehen

OpenAI-Qualität mit der Freiheit offener Gewichte

gpt-oss-120b ist das erste Open-Weight-Modell von OpenAI, lizenziert unter Apache 2.0 und gebaut für agentische Workloads in der Produktion. Es ist nicht das spektakulärste Modell, aber eines, auf das Sie sich jeden Tag verlassen können.

Eingebautes Reasoning

Chain-of-Thought-Reasoning mit einstellbarem Aufwand: Sie entscheiden pro Aufgabe, ob Geschwindigkeit oder Genauigkeit wichtiger ist.

Bereit für die Produktion

Bei den meisten Aufgaben gleichauf mit GPT-4o, bei Benchmarks mit viel Reasoning sogar besser.

Bestes Preis-Leistungs-Verhältnis

Laut Artificial Analysis das beste Verhältnis von Preis zu Intelligenz.

Effizient konstruiert

Parameter gesamt
117B
Aktive Parameter
5,1B pro Forward Pass
Architektur
Mixture of Experts (MoE)
Experten
128 Experten, Top-4-Routing pro Token
Schichten
36
Kontextlänge
128K Token
Lizenz
Apache 2.0

In der EU gehostetSchnellstes Modell

Gemessen auf EU-Infrastruktur

Ausgabe-Durchsatz

713tok/s

Time to First Token

388ms

End-to-End-Latenz

1.789s

Kontextlänge

128K Token

10K Input / 1K Output, Parallelität 1, 10 Requests

Bis zu 772 tok/s bei kürzeren Prompts. Zuletzt gemessen: Juli 2026.

Alle Benchmarks und die Methodik ansehen

Warum es so schnell ist

Dank der MoE-Architektur erhalten Sie die Qualität eines 117B-Modells, rechnen pro Request aber nur mit 5,1B Parametern. Deshalb ist es so schnell.

  • 22x weniger aktive Parameter pro Inferenz
  • Geringerer Bedarf an Speicherbandbreite
  • Experten-Routing für jedes Token optimiert
  • Gleiche Qualität, ein Bruchteil der Rechenleistung

Die Architektur hinter 713 tok/s

Eigenen Benchmark ausführen

Nicht für Entwickler. Für Agenten.

"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
Tigris
  • Function Calling

    Native Tool-Nutzung für agentische Workflows

  • Structured Outputs

    JSON-Modus für zuverlässiges Parsing

  • Reasoning steuern

    Den Denkaufwand (niedrig, mittel, hoch) pro Aufgabe einstellen

Web Browsing

Eingebaut für Recherche-Agenten

Websites durchsuchen, Daten extrahieren und mehrstufige Recherchen eigenständig erledigen.

Code-Ausführung

Python-Ausführung für Agenten, die Daten analysieren

Python in einer Sandbox ausführen, für Datenverarbeitung, Berechnungen und Analysen.

Das richtige Modell für jede Aufgabe

Nicht jeder Request braucht Ihr teuerstes Modell. Erfahrene Teams setzen gpt-oss-120b als Teil einer Strategie mit mehreren Modellen ein.

"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
Apatero (Review 2026)
  • Balanced-Modus

    Im Balanced-Modus: bei den meisten Aufgaben gleichauf mit GPT-4o

  • Deep-Modus

    Im Deep-Modus: besser als GPT-4o beim Reasoning (MATH, HumanEval)

  • Kosteneffizienz

    Zu einem Bruchteil der Kosten proprietärer Modelle

SzenarioModellwahlWarum
Komplexes Reasoninggpt-oss-120b (hoher Aufwand)Wenn Genauigkeit am meisten zählt
Standardaufgabengpt-oss-120b (mittlerer Aufwand)Ausgewogen zwischen Qualität und Kosten
Einfache Fragengpt-oss-120b (niedriger Aufwand)Schnell, günstig und trotzdem genau
Premium-AufgabenMiniMax M2.7 UltraspeedWenn Sie Spitzenleistung brauchen
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
DataRobot

OpenAI Open-Weight auf EU-Infrastruktur

Nutzen Sie das Open-Weight-Modell von OpenAI, ohne Daten in die USA zu schicken:

  • Gehostet in Deutschland auf eigener Infrastruktur von Infercom
  • Vollständig DSGVO-konform, mit Auftragsverarbeitungsvertrag nach EU-Recht
  • Nicht dem US CLOUD Act ausgesetzt
  • Nach ISO 27001 zertifiziert
  • Apache-2.0-Lizenz: volle Freiheit beim Deployment
  • ISO 27001 zertifiziert
  • DSGVO-konform
  • Rechenzentrum in Deutschland
  • Apache-2.0-Lizenz

In wenigen Minuten loslegen

OpenAI-kompatible API: Sie ersetzen nur den Endpoint, Ihr bestehender Code bleibt, wie er ist.

Sie zahlen nur für die Token, die Sie nutzen.

quickstart.py
from openai import OpenAI

client = OpenAI(
    api_key="your-infercom-key",
    base_url="https://api.infercom.ai/v1"
)

response = client.chat.completions.create(
    model="gpt-oss-120b",
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=4096
)

print(response.choices[0].message.content)

gpt-oss-120b: häufige Fragen

Wie schnell ist gpt-oss-120b bei Infercom?

713 Token pro Sekunde Ausgabe-Durchsatz und 388ms Time to First Token, beides serverseitig als p50 gemessen, bei 10K Input und 1K Output auf unserer Produktions-API in München. Mit kürzeren Prompts sind bis zu 772 tok/s möglich. Das ist bis zu 10x schneller als GPU-basierte Alternativen. Jeden Wert können Sie mit unserem Open-Source-Benchmark-Tool nachmessen.

Alle Benchmarks ansehen

Ist gpt-oss-120b ein Open-Weight-Modell?

Ja. OpenAI hat gpt-oss-120b unter der Apache-2.0-Lizenz veröffentlicht. Die Gewichte sind öffentlich, und Sie dürfen das Modell ohne gesonderte Vereinbarung kommerziell einsetzen, betreiben und per Fine-Tuning anpassen. Über Infercom heißt das nur: Wir hosten und betreiben es für Sie auf EU-Infrastruktur.

Was ein Open-Weight-Modell ist

Kann ich gpt-oss-120b DSGVO-konform in der EU betreiben?

Ja. Infercom betreibt gpt-oss-120b auf eigener Hardware in einem Tier-III+-Rechenzentrum in München. Requests werden innerhalb der EU-Jurisdiktion verarbeitet und sind nicht dem US CLOUD Act ausgesetzt. Die Infrastruktur ist nach ISO 27001 zertifiziert, und ein Auftragsverarbeitungsvertrag nach EU-Recht ist auf Anfrage erhältlich. Wir trainieren nicht mit Ihren Daten.

So funktioniert EU-Souveränität bei uns

Ist die API OpenAI-kompatibel?

Ja. Richten Sie das OpenAI SDK auf https://api.infercom.ai/v1, verwenden Sie Ihren Infercom-API-Key und geben Sie gpt-oss-120b als Modellnamen an. Code, der bereits mit der Chat Completions API von OpenAI arbeitet, läuft ohne Änderungen, einschließlich Streaming, Function Calling und Structured Output.

API-Dokumentation lesen

Wie groß ist das Kontextfenster von gpt-oss-120b?

128K Token (131.072), die sich Ihr Prompt und die Antwort des Modells teilen. Das reicht für große Codebasen, lange Agenten-Traces und Prompts aus mehreren Dokumenten in einem einzigen Request.

Was ein Kontextfenster ist

Was kostet gpt-oss-120b?

Sie zahlen pro Token, ohne Mindestumsatz und ohne monatliche Bindung: €0,22 pro Million Input-Token und €0,59 pro Million Output-Token (zzgl. MwSt.). Abgerechnet wird nur, was Sie nutzen. Verbrauch und Kosten sehen Sie live im Cloud-Portal.

Alle Preise ansehen

Bereit, die Zukunft der KI in Europa zu gestalten?

Schließen Sie sich Unternehmen an, die souveräne KI mit erstklassiger Performance einsetzen