OpenAI Open-Weight

gpt-oss-120b API in Europa

L'allrounder per la produzione: pensato per gli agenti, non per gli editor.

Il modello open-weight di OpenAI, misurato a 713 token al secondo sulla nostra infrastruttura UE a Monaco. Prestazioni affidabili in produzione, senza i costi di un modello di punta.

Throughput di output, p50, 10K input / 1K output, singola richiesta. Ultima misurazione: luglio 2026. Vedi tutti i benchmark e la metodologia

Qualità OpenAI, libertà dei pesi aperti

gpt-oss-120b è il primo modello open-weight di OpenAI, con licenza Apache 2.0 e pensato per workload agentici in produzione. Non è il modello più appariscente, ma è quello su cui puoi contare ogni giorno.

Ragionamento integrato

Ragionamento chain-of-thought con livelli di impegno regolabili: scegli per ogni compito se conta di più la velocità o la precisione.

Pronto per la produzione

Alla pari con GPT-4o nella maggior parte dei compiti, migliore nei benchmark con molto ragionamento.

Miglior rapporto qualità-prezzo

Il miglior rapporto tra prezzo e intelligenza secondo Artificial Analysis.

Efficiente per progettazione

Parametri totali
117B
Parametri attivi
5,1B per forward pass
Architettura
Mixture of Experts (MoE)
Esperti
128 esperti, routing top-4 per token
Strati
36
Lunghezza del contesto
128K token
Licenza
Apache 2.0

Ospitato nell'UEModello più veloce

Misurato su infrastruttura UE

Throughput di output

713tok/s

Time to First Token

388ms

Latenza end-to-end

1.789s

Lunghezza del contesto

128K token

10K input / 1K output, 1 richiesta alla volta, 10 richieste

Fino a 772 tok/s con prompt più brevi. Ultima misurazione: luglio 2026.

Vedi tutti i benchmark e la metodologia

Perché è così veloce

Grazie all'architettura MoE ottieni la qualità di un modello da 117B, ma ogni richiesta attiva solo 5,1B parametri. Ecco perché è così veloce.

  • 22x meno parametri attivi per inferenza
  • Minore fabbisogno di larghezza di banda della memoria
  • Routing degli esperti ottimizzato per ogni token
  • Stessa qualità, una frazione del calcolo

L'architettura dietro i 713 tok/s

Esegui il tuo benchmark

Non per gli sviluppatori. Per gli agenti.

"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
Tigris
  • Function Calling

    Uso nativo degli strumenti per i workflow agentici

  • Structured Outputs

    Modalità JSON per un parsing affidabile

  • Controllo del ragionamento

    Regola l'impegno di ragionamento (basso, medio, alto) per ogni compito

Web Browsing

Capacità integrata per agenti di ricerca

Naviga i siti web, estrai dati e svolgi in autonomia ricerche in più passaggi.

Esecuzione di codice

Esecuzione di Python per agenti di analisi dati

Esegui Python in un ambiente sandbox per elaborazione dati, calcoli e analisi.

Il modello giusto per ogni compito

Non tutte le richieste hanno bisogno del tuo modello più costoso. I team esperti usano gpt-oss-120b all'interno di una strategia con più modelli.

"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
Apatero (recensione 2026)
  • Balanced mode

    In balanced mode: alla pari con GPT-4o nella maggior parte dei compiti

  • Deep mode

    In deep mode: migliore di GPT-4o nel ragionamento (MATH, HumanEval)

  • Efficienza dei costi

    A una frazione del costo dei modelli proprietari

ScenarioModello sceltoPerché
Ragionamento complessogpt-oss-120b (impegno alto)Quando la precisione conta di più
Compiti standardgpt-oss-120b (impegno medio)Equilibrio tra qualità e costo
Domande semplicigpt-oss-120b (impegno basso)Veloce, economico e comunque preciso
Compiti premiumMiniMax M2.7 UltraspeedQuando ti servono prestazioni di vertice
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
DataRobot

OpenAI Open-Weight su infrastruttura UE

Usa il modello open-weight di OpenAI senza inviare dati negli USA:

  • Ospitato in Germania su infrastruttura di proprietà di Infercom
  • Piena conformità al GDPR, con un DPA basato sul diritto UE
  • Nessuna esposizione al CLOUD Act USA
  • Certificazione ISO 27001
  • Licenza Apache 2.0: piena libertà di deployment
  • Certificata ISO 27001
  • Conforme al GDPR
  • Datacenter in Germania
  • Licenza Apache 2.0

Inizia in pochi minuti

API compatibile con OpenAI: cambi solo l'endpoint e il tuo codice resta com'è.

Paghi solo i token che usi.

quickstart.py
from openai import OpenAI

client = OpenAI(
    api_key="your-infercom-key",
    base_url="https://api.infercom.ai/v1"
)

response = client.chat.completions.create(
    model="gpt-oss-120b",
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=4096
)

print(response.choices[0].message.content)

gpt-oss-120b: domande frequenti

Quanto è veloce gpt-oss-120b su Infercom?

713 token al secondo di throughput di output e 388ms di time to first token (il tempo al primo token), entrambi misurati lato server come p50 con 10K token di input e 1K di output sulla nostra API di produzione a Monaco. Con prompt più brevi arriva fino a 772 tok/s. È fino a 10x più veloce delle alternative basate su GPU, e puoi rimisurare ogni valore con il nostro strumento di benchmark open source.

Vedi tutti i benchmark

gpt-oss-120b è un modello open-weight?

Sì. OpenAI ha rilasciato gpt-oss-120b con licenza Apache 2.0: i pesi sono pubblici e puoi distribuire, fare fine-tuning ed eseguire il modello a fini commerciali senza un accordo separato. Usarlo tramite Infercom significa che lo ospitiamo e lo gestiamo noi per te su infrastruttura UE.

Cos'è un modello open-weight

Posso usare gpt-oss-120b nell'UE in conformità al GDPR?

Sì. Infercom esegue gpt-oss-120b su hardware di proprietà in un datacenter Tier III+ a Monaco. Le richieste vengono elaborate all'interno della giurisdizione UE, senza esposizione al CLOUD Act USA. L'infrastruttura è certificata ISO 27001 e un DPA basato sul diritto UE è disponibile su richiesta. Non addestriamo modelli sui tuoi dati.

Come funziona la sovranità UE da noi

L'API è compatibile con OpenAI?

Sì. Punta l'SDK di OpenAI su https://api.infercom.ai/v1, usa la tua chiave API Infercom e indica gpt-oss-120b come nome del modello. Il codice che usa già la Chat Completions API di OpenAI funziona senza modifiche, compresi streaming, function calling e structured output.

Leggi la documentazione API

Quanto è grande il context window di gpt-oss-120b?

128K token (131.072), condivisi tra il tuo prompt e la risposta del modello. C'è spazio per grandi codebase, lunghe tracce di agenti e prompt con più documenti in un'unica richiesta.

Cos'è un context window

Quanto costa gpt-oss-120b?

Paghi per token, senza minimi e senza vincoli mensili: €0,22 per milione di token di input e €0,59 per milione di token di output (IVA esclusa). Ti viene fatturato solo ciò che usi, e consumi e spesa sono visibili in tempo reale nel portale cloud.

Vedi tutti i prezzi

Vuoi costruire il futuro dell'AI in Europa?

Unisciti alle organizzazioni che usano l'AI sovrana con prestazioni di altissimo livello