OpenAI Open-Weight

gpt-oss-120b API i Europa

Allrounderen til produktion: bygget til agenter, ikke til editorer.

OpenAIs open-weight-model, målt til 713 tokens per sekund på vores infrastruktur i EU i München. Pålidelig ydelse i produktion uden flagskibsmodellernes omkostninger.

Output-throughput, p50, 10K input / 1K output, én forespørgsel. Senest målt: juli 2026. Se alle benchmarks og metoden

OpenAI-kvalitet og friheden ved åbne vægte

gpt-oss-120b er OpenAIs første open-weight-model, licenseret under Apache 2.0 og bygget til agentiske workloads i produktion. Den er ikke den mest prangende model, men den er en, du kan stole på dag efter dag.

Indbygget ræsonnering

Chain-of-thought-ræsonnering med justerbart niveau: Du vælger for hver opgave, om hastighed eller præcision betyder mest.

Klar til produktion

På niveau med GPT-4o i de fleste opgaver og bedre i benchmarks med meget ræsonnering.

Bedst værdi

Det bedste forhold mellem pris og intelligens ifølge Artificial Analysis.

Bygget til effektivitet

Parametre i alt
117B
Aktive parametre
5,1B per forward pass
Arkitektur
Mixture of Experts (MoE)
Eksperter
128 eksperter, top-4-routing per token
Lag
36
Kontekstlængde
128K tokens
Licens
Apache 2.0

Hostet i EUHurtigste model

Målt på infrastruktur i EU

Output-throughput

713tok/s

Time to First Token

388ms

End-to-end-latens

1.789s

Kontekstlængde

128K tokens

10K input / 1K output, 1 samtidig, 10 forespørgsler

Op til 772 tok/s ved kortere prompts. Senest målt: juli 2026.

Se alle benchmarks og metoden

Derfor er den så hurtig

MoE-arkitekturen giver dig kvaliteten fra en 117B-model, men hver forespørgsel regner kun med 5,1B parametre. Derfor er den så hurtig.

  • 22x færre aktive parametre per inferens
  • Lavere krav til hukommelsesbåndbredde
  • Ekspert-routing optimeret for hvert token
  • Samme kvalitet, en brøkdel af regnekraften

Arkitekturen bag 713 tok/s

Kør dit eget benchmark

Ikke til udviklere. Til agenter.

"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
Tigris
  • Function Calling

    Indbygget brug af værktøjer i agentiske workflows

  • Structured Outputs

    JSON-tilstand til pålidelig parsing

  • Styring af ræsonnering

    Juster tænkeindsatsen (lav, mellem, høj) for hver opgave

Web Browsing

Indbygget til research-agenter

Naviger på websites, udtræk data, og løs researchopgaver i flere trin på egen hånd.

Kodeafvikling

Python-afvikling til agenter, der analyserer data

Kør Python i et sandkassemiljø til databehandling, beregninger og analyser.

Den rigtige model til den rigtige opgave

Ikke alle forespørgsler har brug for din dyreste model. Erfarne teams bruger gpt-oss-120b som en del af en strategi med flere modeller.

"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
Apatero (anmeldelse 2026)
  • Balanced mode

    I balanced mode: på niveau med GPT-4o i de fleste opgaver

  • Deep mode

    I deep mode: bedre end GPT-4o til ræsonnering (MATH, HumanEval)

  • Omkostningseffektivitet

    Til en brøkdel af prisen for proprietære modeller

ScenarieModelvalgHvorfor
Kompleks ræsonneringgpt-oss-120b (høj indsats)Når præcision betyder mest
Standardopgavergpt-oss-120b (mellem indsats)Balance mellem kvalitet og omkostning
Enkle spørgsmålgpt-oss-120b (lav indsats)Hurtig, billig og stadig præcis
Premium-opgaverMiniMax M2.7 UltraspeedNår du har brug for topydelse
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
DataRobot

OpenAI Open-Weight på infrastruktur i EU

Brug OpenAIs open-weight-model uden at sende data til USA:

  • Hostet i Tyskland på Infercoms egen infrastruktur
  • Fuldt GDPR-kompatibel med en databehandleraftale efter EU-ret
  • Ikke omfattet af US CLOUD Act
  • ISO 27001-certificeret
  • Apache 2.0-licens: fuld frihed til at deploye
  • ISO 27001-certificeret
  • GDPR-kompatibel
  • Datacenter i Tyskland
  • Apache 2.0-licens

Kom i gang på få minutter

OpenAI-kompatibelt API: Du skifter kun endpoint, og din eksisterende kode forbliver, som den er.

Du betaler kun for de tokens, du bruger.

quickstart.py
from openai import OpenAI

client = OpenAI(
    api_key="your-infercom-key",
    base_url="https://api.infercom.ai/v1"
)

response = client.chat.completions.create(
    model="gpt-oss-120b",
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=4096
)

print(response.choices[0].message.content)

gpt-oss-120b: ofte stillede spørgsmål

Hvor hurtig er gpt-oss-120b hos Infercom?

713 tokens per sekund i output-throughput og 388ms time to first token, begge målt serverside som p50 ved 10K input og 1K output på vores produktions-API i München. Med kortere prompts når den op til 772 tok/s. Det er op til 10x hurtigere end GPU-baserede alternativer, og du kan selv eftermåle hvert tal med vores open source-benchmarkværktøj.

Se alle benchmarks

Er gpt-oss-120b en open-weight-model?

Ja. OpenAI har udgivet gpt-oss-120b under Apache 2.0-licensen. Vægtene er offentlige, og du må deploye, finjustere og køre modellen kommercielt uden en særskilt aftale. At køre den gennem Infercom betyder, at vi hoster og driver den for dig på infrastruktur i EU.

Hvad en open-weight-model er

Kan jeg køre gpt-oss-120b GDPR-kompatibelt i EU?

Ja. Infercom kører gpt-oss-120b på egen hardware i et Tier III+-datacenter i München. Forespørgsler behandles inden for EU-jurisdiktion og er ikke omfattet af US CLOUD Act. Infrastrukturen er ISO 27001-certificeret, og en databehandleraftale efter EU-ret kan fås på forespørgsel. Vi træner ikke på dine data.

Sådan fungerer EU-suverænitet hos os

Er API'et OpenAI-kompatibelt?

Ja. Peg OpenAI SDK'et mod https://api.infercom.ai/v1, brug din Infercom-API-nøgle, og angiv gpt-oss-120b som modelnavn. Kode, der allerede bruger OpenAIs Chat Completions API, virker uden ændringer, også med streaming, function calling og structured output.

Læs API-dokumentationen

Hvor stort er kontekstvinduet i gpt-oss-120b?

128K tokens (131.072), som din prompt og modellens svar deler. Det giver plads til store kodebaser, lange agent-traces og prompts med flere dokumenter i én forespørgsel.

Hvad et kontekstvindue er

Hvad koster gpt-oss-120b?

Du betaler per token uden minimumsforbrug og uden månedlig binding: €0,22 per million input-tokens og €0,59 per million output-tokens (ekskl. moms). Du afregner kun for det, du bruger, og forbrug og udgifter kan følges live i cloud-portalen.

Se alle priser

Klar til at bygge fremtidens AI i Europa?

Slut dig til virksomheder, der bruger suveræn AI med performance i topklasse