Inference API

Inferenza veloce, compatibile OpenAI

con modelli sovrani UE che scegli tu

Inferenza compatibile OpenAI sui modelli open-weight più recenti, su hardware progettato per questo a Monaco di Baviera. Scegli i modelli sovrani UE e i tuoi dati restano nell'UE. Fino a 10x più veloce delle GPU, paghi solo ciò che usi, operativo in pochi minuti.

Perché Infercom

Pensato per chi costruisce sul serio

Risposte veloci per i workload di produzione: conformi e integrate in pochi minuti, senza infrastruttura da gestire.

Affidabile

  • Giurisdizione UE, datacenter a Monaco di Baviera
  • Nessuna società madre statunitense, nessuna esposizione al CLOUD Act
  • Nessuna archiviazione persistente per impostazione predefinita

Il nostro Trust Center

Senza attriti

  • Compatibile con OpenAI e Anthropic
  • Modelli open-weight più recenti, nessun lock-in
  • Streaming, strumenti, structured output

Leggi la documentazione

Ultraveloce

  • Fino a 10x più veloce delle GPU
  • Centinaia di token al secondo, per richiesta
  • Progettato per l'inferenza, non per l'addestramento

Vedi i benchmark

Perché la velocità conta

La velocità decide cosa puoi costruire

Si manifesta in due modi: si accumula lungo le tante chiamate di un agente e la senti nell'istante in cui un'app in tempo reale risponde.

1 · Si accumula

Per gli agenti, la latenza si moltiplica

Un chatbot fa una chiamata per turno. Un agente fa 50-100 chiamate di inferenza per completare un solo compito, e ognuna aspetta la precedente.

A quella scala, la latenza per chiamata non è più un dettaglio: decide cosa puoi rilasciare. Stesso agente, stessa logica, stesso modello: l'infrastruttura sottostante fa la differenza tra un task che finisce in pochi minuti e uno che ne richiede dieci.

Compito agentico da 50 turni

GPU a 90 tok/s~9,8 min
Infercom~2,5 min

Calcolato: ogni chiamata con 10K token di input e 1K di output. Infercom con il tempo end-to-end misurato di 3,023 s su MiniMax M2.7 (luglio 2026); GPU a 90 tok/s più lo stesso time to first token. Non è una misurazione di un provider GPU.

2 · Lo senti

Nelle app in tempo reale, il primo token è tutto

In un assistente vocale o in uno strumento di coding dal vivo, a rendere l'esperienza umana non è il throughput totale, ma la rapidità con cui la risposta inizia. Una lunga pausa prima della prima parola rompe l'illusione di una conversazione.

L'architettura dataflow offre un time to first token rapido, così le app in tempo reale risultano reattive invece che lente. Ogni risposta dell'API riporta il TTFT misurato, così puoi tenere la tua app a quello standard.

Time to First Token

  • Voice agentNessuna pausa imbarazzante prima della risposta
  • Assistenti di coding dal vivoSuggerimenti che stanno al passo con la digitazione
  • Chat interattivaRisposte che iniziano subito lo streaming

Integrazione

Basta cambiare una riga

Punta l'SDK di OpenAI su Infercom e mantieni il resto del codice. Chat completions, streaming, structured output e function calling funzionano come ti aspetti.

Python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.infercom.ai/v1",
    api_key="your-api-key"
)

response = client.chat.completions.create(
    model="MiniMax-M2.7",
    messages=[
        {"role": "user", "content": "Hello!"}
    ]
)
# usage includes measured tokens/sec + TTFT

Modelli sovrani UE - in datacenter nell'UE

Catalogo globale - elaborati fuori dall'UE

Un catalogo esteso con altri modelli open-weight, elaborati fuori dall'UE in una regione che non controlliamo, per i team che hanno bisogno di una scelta più ampia di modelli.

Per i dati sensibili ai fini del GDPR usa i modelli sovrani UE. Il catalogo globale gira su infrastrutture esterne fuori dalla giurisdizione UE.

Vedi il catalogo completo dei modelli

Livelli di accesso

Inizia a costruire, cresci fino alla produzione

Self-service su infrastruttura condivisa. Passa al livello successivo quando il tuo utilizzo cresce.

Self-service

Developer

Pay-as-you-go

Registrati, crea una chiave API e inizia a costruire. Paghi solo i token che usi, ai prezzi di listino pubblicati.

Inizia ora

Committed Use

Enterprise

Su misura

Per workload di produzione che richiedono throughput più alto, priorità e un accordo commerciale.

  • Rate limit per la produzione
  • Priorità di scheduling
  • Sconti sui volumi
  • Supporto dedicato
Contatta le vendite

Vedi i prezzi per modello

FAQ

Domande, risposte dirette

È davvero compatibile con OpenAI? Posso puntarci il mio codice esistente?

Sì. Sostituisce direttamente l'API di OpenAI: cambia la base URL in https://api.infercom.ai/v1, usa la tua chiave API Infercom e il resto del codice resta invariato. Siamo compatibili anche con Anthropic, quindi funziona anche l'SDK di Anthropic. Trovi esempi a confronto nella pagina sulla compatibilità API.

Come mantengo i miei dati nell'UE?

Usa i modelli sovrani UE. Girano sul nostro hardware nel nostro datacenter a Monaco di Baviera, e i tuoi dati restano sotto la giurisdizione UE. Inoltre non archiviamo nulla in modo persistente: prompt e risposte non vengono scritti su disco, non addestriamo sui tuoi dati e non serviamo risposte dalla cache. I modelli del catalogo Global sono elaborati fuori dall'UE, quindi per i workload sensibili al GDPR scegli i modelli sovrani UE. Maggiori dettagli nel nostro Trust Center.

I modelli sono quantizzati?

No. Oggi serviamo ogni modello con la precisione con cui chi lo pubblica lo ha rilasciato, senza quantizzarlo.

Possiamo collegarci in modo privato, senza passare dall'internet pubblico?

Oggi no: l'API si raggiunge via HTTPS sull'internet pubblico. Se una connessione privata è un requisito, parliamo della tua rete.

Quanto è veloce, davvero?

Misurato sulla nostra API di produzione: 428 tok/s con MiniMax M2.7 e 713 tok/s con gpt-oss-120b (luglio 2026). La velocità di output per richiesta resta stabile quando molte richieste girano in parallelo; il time to first token cresce quando le richieste restano in coda nelle ore di punta. Ogni risposta riporta il suo time to first token e i token al secondo, così puoi verificarlo sul tuo workload.

Qual è la differenza tra i livelli Developer ed Enterprise?

Developer è self-service, a consumo, con rate limit standard: ideale per sviluppare e arrivare in produzione. Enterprise aggiunge rate limit di produzione, priorità di scheduling, sconti sui volumi e supporto dedicato a fronte di un impegno mensile minimo. Puoi iniziare con Developer e passare a Enterprise quando l'utilizzo cresce.

Perché il modello X non è ancora disponibile, e quanto velocemente potete aggiungerlo?

Ogni modello viene ottimizzato per l'hardware dataflow invece di essere caricato così com'è. Un nuovo checkpoint di un'architettura che già eseguiamo può andare live in ore o giorni, una nuova versione di una famiglia supportata in giorni o settimane. Un'architettura del tutto nuova richiede settimane di ingegneria. Dicci di quale modello hai bisogno e ti daremo una risposta onesta sui tempi. Se è un fine-tune di qualcosa che già supportiamo, è rapido.

Posso tenere sotto controllo i costi ed evitare fatture a sorpresa?

Sì. Paghi a consumo in base ai prezzi di listino per token pubblicati, quindi i costi sono prevedibili e facili da stimare. Paghi solo i token che usi, senza minimi e senza vincoli nel livello Developer. E puoi controllare i consumi in tempo reale in qualsiasi momento nella console su cloud.infercom.ai.

Offrite uno SLA di uptime sull'API?

L'API condivisa offre disponibilità best effort senza uno SLA contrattuale: è pensata per costruire, integrare e scalare fino alla produzione. Se ti servono uno SLA garantito, throughput riservato e nessuna contesa con altri utenti, è proprio ciò che offre Dedicated Capacity.

Cosa succede sotto carico elevato? Le mie richieste possono perdere priorità?

Sull'infrastruttura condivisa i tier più alti hanno priorità di scheduling, quindi nei picchi di carico una richiesta di un tier inferiore può aspettare dietro al traffico enterprise. Nel funzionamento normale le richieste vanno in coda invece di fallire, e la velocità di output di una richiesta in corso non cambia; cresce solo il time to first token mentre aspetta. In caso di sovraccarico estremo la coda può rifiutare richieste. Per una capacità che nessun altro cliente tocca, c'è Dedicated Capacity.

È disponibile il prompt caching?

Sì, su MiniMax M2.7. Il contesto ripetuto arriva da una cache nella memoria dei chip, così i prompt lunghi partono prima; nulla viene scritto su disco. Per ora i token in cache sono fatturati al normale prezzo di input.

Come si confronta con l'esecuzione di modelli open source sulle proprie GPU?

Per il lavoro sensibile alla latenza, come agenti, chat, voce e coding, l'architettura dataflow offre fino a 10 volte la velocità, senza un cluster da ottimizzare. Per la pura generazione batch offline, dove la latenza non conta, le GPU possono costare meno, e te lo diciamo. Molti team lavorano in modo ibrido: Infercom per l'inferenza rivolta agli utenti, GPU per i job in background.

Ti serve più controllo?

Stessa piattaforma, stesse prestazioni, con più isolamento quando ti serve.

Dedicated Capacity

La stessa API su hardware single-tenant riservato a te, fatturato mensilmente, con throughput garantito e modelli personalizzati.

Scopri di più: Dedicated Capacity

On-Premises

Il tuo datacenter, il tuo hardware: il massimo isolamento, con un'opzione air-gapped per i requisiti più rigorosi.

Scopri di più: On-Premises

Vuoi costruire il futuro dell'AI in Europa?

Unisciti alle organizzazioni che usano l'AI sovrana con prestazioni di altissimo livello