gpt-oss-120b API in Europa
L'allrounder per la produzione: pensato per gli agenti, non per gli editor.
Il modello open-weight di OpenAI, misurato a 713 token al secondo sulla nostra infrastruttura UE a Monaco. Prestazioni affidabili in produzione, senza i costi di un modello di punta.
Throughput di output, p50, 10K input / 1K output, singola richiesta. Ultima misurazione: luglio 2026. Vedi tutti i benchmark e la metodologia
Qualità OpenAI, libertà dei pesi aperti
gpt-oss-120b è il primo modello open-weight di OpenAI, con licenza Apache 2.0 e pensato per workload agentici in produzione. Non è il modello più appariscente, ma è quello su cui puoi contare ogni giorno.
Ragionamento integrato
Ragionamento chain-of-thought con livelli di impegno regolabili: scegli per ogni compito se conta di più la velocità o la precisione.
Pronto per la produzione
Alla pari con GPT-4o nella maggior parte dei compiti, migliore nei benchmark con molto ragionamento.
Miglior rapporto qualità-prezzo
Il miglior rapporto tra prezzo e intelligenza secondo Artificial Analysis.
Efficiente per progettazione
- Parametri totali
- 117B
- Parametri attivi
- 5,1B per forward pass
- Architettura
- Mixture of Experts (MoE)
- Esperti
- 128 esperti, routing top-4 per token
- Strati
- 36
- Lunghezza del contesto
- 128K token
- Licenza
- Apache 2.0
Misurato su infrastruttura UE
Throughput di output
Time to First Token
Latenza end-to-end
Lunghezza del contesto
128K token
10K input / 1K output, 1 richiesta alla volta, 10 richieste
Fino a 772 tok/s con prompt più brevi. Ultima misurazione: luglio 2026.
Perché è così veloce
Grazie all'architettura MoE ottieni la qualità di un modello da 117B, ma ogni richiesta attiva solo 5,1B parametri. Ecco perché è così veloce.
- 22x meno parametri attivi per inferenza
- Minore fabbisogno di larghezza di banda della memoria
- Routing degli esperti ottimizzato per ogni token
- Stessa qualità, una frazione del calcolo
Non per gli sviluppatori. Per gli agenti.
"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
-
Function Calling
Uso nativo degli strumenti per i workflow agentici
-
Structured Outputs
Modalità JSON per un parsing affidabile
-
Controllo del ragionamento
Regola l'impegno di ragionamento (basso, medio, alto) per ogni compito
Web Browsing
Capacità integrata per agenti di ricerca
Naviga i siti web, estrai dati e svolgi in autonomia ricerche in più passaggi.
Esecuzione di codice
Esecuzione di Python per agenti di analisi dati
Esegui Python in un ambiente sandbox per elaborazione dati, calcoli e analisi.
Il modello giusto per ogni compito
Non tutte le richieste hanno bisogno del tuo modello più costoso. I team esperti usano gpt-oss-120b all'interno di una strategia con più modelli.
"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
Balanced mode
In balanced mode: alla pari con GPT-4o nella maggior parte dei compiti
Deep mode
In deep mode: migliore di GPT-4o nel ragionamento (MATH, HumanEval)
Efficienza dei costi
A una frazione del costo dei modelli proprietari
| Scenario | Modello scelto | Perché |
|---|---|---|
| Ragionamento complesso | gpt-oss-120b (impegno alto) | Quando la precisione conta di più |
| Compiti standard | gpt-oss-120b (impegno medio) | Equilibrio tra qualità e costo |
| Domande semplici | gpt-oss-120b (impegno basso) | Veloce, economico e comunque preciso |
| Compiti premium | MiniMax M2.7 Ultraspeed | Quando ti servono prestazioni di vertice |
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
OpenAI Open-Weight su infrastruttura UE
Usa il modello open-weight di OpenAI senza inviare dati negli USA:
- Ospitato in Germania su infrastruttura di proprietà di Infercom
- Piena conformità al GDPR, con un DPA basato sul diritto UE
- Nessuna esposizione al CLOUD Act USA
- Certificazione ISO 27001
- Licenza Apache 2.0: piena libertà di deployment
- Certificata ISO 27001
- Conforme al GDPR
- Datacenter in Germania
- Licenza Apache 2.0
Inizia in pochi minuti
API compatibile con OpenAI: cambi solo l'endpoint e il tuo codice resta com'è.
Paghi solo i token che usi.
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)gpt-oss-120b: domande frequenti
Quanto è veloce gpt-oss-120b su Infercom?
713 token al secondo di throughput di output e 388ms di time to first token (il tempo al primo token), entrambi misurati lato server come p50 con 10K token di input e 1K di output sulla nostra API di produzione a Monaco. Con prompt più brevi arriva fino a 772 tok/s. È fino a 10x più veloce delle alternative basate su GPU, e puoi rimisurare ogni valore con il nostro strumento di benchmark open source.
gpt-oss-120b è un modello open-weight?
Sì. OpenAI ha rilasciato gpt-oss-120b con licenza Apache 2.0: i pesi sono pubblici e puoi distribuire, fare fine-tuning ed eseguire il modello a fini commerciali senza un accordo separato. Usarlo tramite Infercom significa che lo ospitiamo e lo gestiamo noi per te su infrastruttura UE.
Posso usare gpt-oss-120b nell'UE in conformità al GDPR?
Sì. Infercom esegue gpt-oss-120b su hardware di proprietà in un datacenter Tier III+ a Monaco. Le richieste vengono elaborate all'interno della giurisdizione UE, senza esposizione al CLOUD Act USA. L'infrastruttura è certificata ISO 27001 e un DPA basato sul diritto UE è disponibile su richiesta. Non addestriamo modelli sui tuoi dati.
L'API è compatibile con OpenAI?
Sì. Punta l'SDK di OpenAI su https://api.infercom.ai/v1, usa la tua chiave API Infercom e indica gpt-oss-120b come nome del modello. Il codice che usa già la Chat Completions API di OpenAI funziona senza modifiche, compresi streaming, function calling e structured output.
Quanto è grande il context window di gpt-oss-120b?
128K token (131.072), condivisi tra il tuo prompt e la risposta del modello. C'è spazio per grandi codebase, lunghe tracce di agenti e prompt con più documenti in un'unica richiesta.
Quanto costa gpt-oss-120b?
Paghi per token, senza minimi e senza vincoli mensili: €0,22 per milione di token di input e €0,59 per milione di token di output (IVA esclusa). Ti viene fatturato solo ciò che usi, e consumi e spesa sono visibili in tempo reale nel portale cloud.
Per saperne di più
- Benchmark di prestazioni Come si comporta gpt-oss-120b sulla nostra infrastruttura UE
- MiniMax M2.7 Ultraspeed Quando ti servono prestazioni agentiche di vertice
- Gemma 4 31B Quando immagini e testo devono stare nella stessa richiesta
- AI sovrana UE Dove si trovano i tuoi dati e chi può accedervi
- Documentazione API Riferimento API completo e guide all'integrazione
- Prezzi Prezzi trasparenti per token