gpt-oss-120b API i Europa
Allrounderen til produktion: bygget til agenter, ikke til editorer.
OpenAIs open-weight-model, målt til 713 tokens per sekund på vores infrastruktur i EU i München. Pålidelig ydelse i produktion uden flagskibsmodellernes omkostninger.
Output-throughput, p50, 10K input / 1K output, én forespørgsel. Senest målt: juli 2026. Se alle benchmarks og metoden
OpenAI-kvalitet og friheden ved åbne vægte
gpt-oss-120b er OpenAIs første open-weight-model, licenseret under Apache 2.0 og bygget til agentiske workloads i produktion. Den er ikke den mest prangende model, men den er en, du kan stole på dag efter dag.
Indbygget ræsonnering
Chain-of-thought-ræsonnering med justerbart niveau: Du vælger for hver opgave, om hastighed eller præcision betyder mest.
Klar til produktion
På niveau med GPT-4o i de fleste opgaver og bedre i benchmarks med meget ræsonnering.
Bedst værdi
Det bedste forhold mellem pris og intelligens ifølge Artificial Analysis.
Bygget til effektivitet
- Parametre i alt
- 117B
- Aktive parametre
- 5,1B per forward pass
- Arkitektur
- Mixture of Experts (MoE)
- Eksperter
- 128 eksperter, top-4-routing per token
- Lag
- 36
- Kontekstlængde
- 128K tokens
- Licens
- Apache 2.0
Målt på infrastruktur i EU
Output-throughput
Time to First Token
End-to-end-latens
Kontekstlængde
128K tokens
10K input / 1K output, 1 samtidig, 10 forespørgsler
Op til 772 tok/s ved kortere prompts. Senest målt: juli 2026.
Derfor er den så hurtig
MoE-arkitekturen giver dig kvaliteten fra en 117B-model, men hver forespørgsel regner kun med 5,1B parametre. Derfor er den så hurtig.
- 22x færre aktive parametre per inferens
- Lavere krav til hukommelsesbåndbredde
- Ekspert-routing optimeret for hvert token
- Samme kvalitet, en brøkdel af regnekraften
Ikke til udviklere. Til agenter.
"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
-
Function Calling
Indbygget brug af værktøjer i agentiske workflows
-
Structured Outputs
JSON-tilstand til pålidelig parsing
-
Styring af ræsonnering
Juster tænkeindsatsen (lav, mellem, høj) for hver opgave
Web Browsing
Indbygget til research-agenter
Naviger på websites, udtræk data, og løs researchopgaver i flere trin på egen hånd.
Kodeafvikling
Python-afvikling til agenter, der analyserer data
Kør Python i et sandkassemiljø til databehandling, beregninger og analyser.
Den rigtige model til den rigtige opgave
Ikke alle forespørgsler har brug for din dyreste model. Erfarne teams bruger gpt-oss-120b som en del af en strategi med flere modeller.
"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
Balanced mode
I balanced mode: på niveau med GPT-4o i de fleste opgaver
Deep mode
I deep mode: bedre end GPT-4o til ræsonnering (MATH, HumanEval)
Omkostningseffektivitet
Til en brøkdel af prisen for proprietære modeller
| Scenarie | Modelvalg | Hvorfor |
|---|---|---|
| Kompleks ræsonnering | gpt-oss-120b (høj indsats) | Når præcision betyder mest |
| Standardopgaver | gpt-oss-120b (mellem indsats) | Balance mellem kvalitet og omkostning |
| Enkle spørgsmål | gpt-oss-120b (lav indsats) | Hurtig, billig og stadig præcis |
| Premium-opgaver | MiniMax M2.7 Ultraspeed | Når du har brug for topydelse |
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
OpenAI Open-Weight på infrastruktur i EU
Brug OpenAIs open-weight-model uden at sende data til USA:
- Hostet i Tyskland på Infercoms egen infrastruktur
- Fuldt GDPR-kompatibel med en databehandleraftale efter EU-ret
- Ikke omfattet af US CLOUD Act
- ISO 27001-certificeret
- Apache 2.0-licens: fuld frihed til at deploye
- ISO 27001-certificeret
- GDPR-kompatibel
- Datacenter i Tyskland
- Apache 2.0-licens
Kom i gang på få minutter
OpenAI-kompatibelt API: Du skifter kun endpoint, og din eksisterende kode forbliver, som den er.
Du betaler kun for de tokens, du bruger.
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)gpt-oss-120b: ofte stillede spørgsmål
Hvor hurtig er gpt-oss-120b hos Infercom?
713 tokens per sekund i output-throughput og 388ms time to first token, begge målt serverside som p50 ved 10K input og 1K output på vores produktions-API i München. Med kortere prompts når den op til 772 tok/s. Det er op til 10x hurtigere end GPU-baserede alternativer, og du kan selv eftermåle hvert tal med vores open source-benchmarkværktøj.
Er gpt-oss-120b en open-weight-model?
Ja. OpenAI har udgivet gpt-oss-120b under Apache 2.0-licensen. Vægtene er offentlige, og du må deploye, finjustere og køre modellen kommercielt uden en særskilt aftale. At køre den gennem Infercom betyder, at vi hoster og driver den for dig på infrastruktur i EU.
Kan jeg køre gpt-oss-120b GDPR-kompatibelt i EU?
Ja. Infercom kører gpt-oss-120b på egen hardware i et Tier III+-datacenter i München. Forespørgsler behandles inden for EU-jurisdiktion og er ikke omfattet af US CLOUD Act. Infrastrukturen er ISO 27001-certificeret, og en databehandleraftale efter EU-ret kan fås på forespørgsel. Vi træner ikke på dine data.
Er API'et OpenAI-kompatibelt?
Ja. Peg OpenAI SDK'et mod https://api.infercom.ai/v1, brug din Infercom-API-nøgle, og angiv gpt-oss-120b som modelnavn. Kode, der allerede bruger OpenAIs Chat Completions API, virker uden ændringer, også med streaming, function calling og structured output.
Hvor stort er kontekstvinduet i gpt-oss-120b?
128K tokens (131.072), som din prompt og modellens svar deler. Det giver plads til store kodebaser, lange agent-traces og prompts med flere dokumenter i én forespørgsel.
Hvad koster gpt-oss-120b?
Du betaler per token uden minimumsforbrug og uden månedlig binding: €0,22 per million input-tokens og €0,59 per million output-tokens (ekskl. moms). Du afregner kun for det, du bruger, og forbrug og udgifter kan følges live i cloud-portalen.
Læs mere
- Performance-benchmarks Sådan klarer gpt-oss-120b sig på vores infrastruktur i EU
- MiniMax M2.7 Ultraspeed Når du har brug for agentisk topydelse
- Gemma 4 31B Når billede og tekst skal med i samme forespørgsel
- EU-suveræn AI Hvor dine data ligger, og hvem der kan få adgang til dem
- API-dokumentation Fuld API-reference og integrationsguides
- Priser Gennemsigtige priser per token