È davvero compatibile con OpenAI? Posso puntarci il mio codice esistente?
Sì. Sostituisce direttamente l'API di OpenAI: cambia la base URL in https://api.infercom.ai/v1, usa la tua chiave API Infercom e il resto del codice resta invariato. Siamo compatibili anche con Anthropic, quindi funziona anche l'SDK di Anthropic. Trovi esempi a confronto nella pagina sulla compatibilità API.
Come mantengo i miei dati nell'UE?
Usa i modelli sovrani UE. Girano sul nostro hardware nel nostro datacenter a Monaco di Baviera, e i tuoi dati restano sotto la giurisdizione UE. Inoltre non archiviamo nulla in modo persistente: prompt e risposte non vengono scritti su disco, non addestriamo sui tuoi dati e non serviamo risposte dalla cache. I modelli del catalogo Global sono elaborati fuori dall'UE, quindi per i workload sensibili al GDPR scegli i modelli sovrani UE. Maggiori dettagli nel nostro Trust Center.
I modelli sono quantizzati?
No. Oggi serviamo ogni modello con la precisione con cui chi lo pubblica lo ha rilasciato, senza quantizzarlo.
Possiamo collegarci in modo privato, senza passare dall'internet pubblico?
Oggi no: l'API si raggiunge via HTTPS sull'internet pubblico. Se una connessione privata è un requisito, parliamo della tua rete.
Quanto è veloce, davvero?
Misurato sulla nostra API di produzione: 428 tok/s con MiniMax M2.7 e 713 tok/s con gpt-oss-120b (luglio 2026). La velocità di output per richiesta resta stabile quando molte richieste girano in parallelo; il time to first token cresce quando le richieste restano in coda nelle ore di punta. Ogni risposta riporta il suo time to first token e i token al secondo, così puoi verificarlo sul tuo workload.
Qual è la differenza tra i livelli Developer ed Enterprise?
Developer è self-service, a consumo, con rate limit standard: ideale per sviluppare e arrivare in produzione. Enterprise aggiunge rate limit di produzione, priorità di scheduling, sconti sui volumi e supporto dedicato a fronte di un impegno mensile minimo. Puoi iniziare con Developer e passare a Enterprise quando l'utilizzo cresce.
Perché il modello X non è ancora disponibile, e quanto velocemente potete aggiungerlo?
Ogni modello viene ottimizzato per l'hardware dataflow invece di essere caricato così com'è. Un nuovo checkpoint di un'architettura che già eseguiamo può andare live in ore o giorni, una nuova versione di una famiglia supportata in giorni o settimane. Un'architettura del tutto nuova richiede settimane di ingegneria. Dicci di quale modello hai bisogno e ti daremo una risposta onesta sui tempi. Se è un fine-tune di qualcosa che già supportiamo, è rapido.
Posso tenere sotto controllo i costi ed evitare fatture a sorpresa?
Sì. Paghi a consumo in base ai prezzi di listino per token pubblicati, quindi i costi sono prevedibili e facili da stimare. Paghi solo i token che usi, senza minimi e senza vincoli nel livello Developer. E puoi controllare i consumi in tempo reale in qualsiasi momento nella console su cloud.infercom.ai.
Offrite uno SLA di uptime sull'API?
L'API condivisa offre disponibilità best effort senza uno SLA contrattuale: è pensata per costruire, integrare e scalare fino alla produzione. Se ti servono uno SLA garantito, throughput riservato e nessuna contesa con altri utenti, è proprio ciò che offre Dedicated Capacity.
Cosa succede sotto carico elevato? Le mie richieste possono perdere priorità?
Sull'infrastruttura condivisa i tier più alti hanno priorità di scheduling, quindi nei picchi di carico una richiesta di un tier inferiore può aspettare dietro al traffico enterprise. Nel funzionamento normale le richieste vanno in coda invece di fallire, e la velocità di output di una richiesta in corso non cambia; cresce solo il time to first token mentre aspetta. In caso di sovraccarico estremo la coda può rifiutare richieste. Per una capacità che nessun altro cliente tocca, c'è Dedicated Capacity.
È disponibile il prompt caching?
Sì, su MiniMax M2.7. Il contesto ripetuto arriva da una cache nella memoria dei chip, così i prompt lunghi partono prima; nulla viene scritto su disco. Per ora i token in cache sono fatturati al normale prezzo di input.
Come si confronta con l'esecuzione di modelli open source sulle proprie GPU?
Per il lavoro sensibile alla latenza, come agenti, chat, voce e coding, l'architettura dataflow offre fino a 10 volte la velocità, senza un cluster da ottimizzare. Per la pura generazione batch offline, dove la latenza non conta, le GPU possono costare meno, e te lo diciamo. Molti team lavorano in modo ibrido: Infercom per l'inferenza rivolta agli utenti, GPU per i job in background.