Inference API
Prezzi semplici e trasparenti
Tariffe pay-as-you-go per la Inference API. Nessun minimo e nessun vincolo contrattuale: paghi solo i token che usi.
- Prezzi direttamente in EUR
- Nessun minimo, nessun vincolo
- Sovrano UE per impostazione predefinita
Prezzi della Inference API
Tariffe per token per la nostra piattaforma di inferenza condivisa e sovrana UE. Ti serve capacità riservata o hardware tuo? Queste due soluzioni hanno un prezzo definito caso per caso.
Sei qui
Inference API
Infrastruttura condivisa, pagamento per token. Parti in pochi minuti e cresci secondo le tue esigenze, senza minimi e senza vincoli.
- Sovrano UE per impostazione predefinita
- Pay-as-you-go
- API compatibile con OpenAI
Come funzionano i prezzi dell'API
La Inference API si paga per token. In inglese un token corrisponde a circa 4 caratteri, ma il valore cambia in base al modello e alla lingua. Paghi solo ciò che usi, senza minimi e senza vincoli.
Cos'è un token?
I token sono le unità di base che un LLM elabora. In inglese 1 token corrisponde a circa 4 caratteri o a ¾ di parola, e 1.000 parole sono circa 1.300 token. Altre lingue, italiano compreso, usano spesso più token per lo stesso testo.
Input e output
Input (il tuo prompt) e output (la risposta del modello) si pagano separatamente. L'output costa di più perché il modello legge il tuo prompt in un unico passaggio parallelo. Ogni token di output richiede invece un passaggio completo attraverso il modello, un token alla volta.
Scegliere un modello
Ogni modello ha i suoi punti di forza e non esiste una scelta "migliore" in assoluto. Con i modelli sovrani UE (🇪🇺) i tuoi dati restano garantiti sotto la giurisdizione europea.
EU
Modelli sovrani UE
Piena conformità al GDPR, nessuna esposizione al CLOUD Act USA
| Modello | Modalità | Input/1M | Output/1M | Contesto |
|---|---|---|---|---|
| MiniMax M2.7 Ultraspeed | Text | €0,60 | €2,40 | 192K |
| Gemma 4 31B | Text + vision | €0,20 | €0,35 | 128K |
| gpt-oss-120b | Text | €0,22 | €0,59 | 128K |
| Whisper Large v3 | Speech-to-text | €0,10 | - | - |
| E5-Mistral 7B | Embeddings | €0,13 | - | 4K |
Prezzi in EUR, IVA esclusa. I modelli ospitati nell'UE offrono piena sovranità dei dati. Speech-to-text ed embedding si pagano solo sui token di input, perché restituiscono trascrizioni o vettori e non testo generato.
Global
Catalogo globale dei modelli
Altri modelli tramite infrastruttura globale
| Modello | Modalità | Input/1M | Output/1M | Contesto |
|---|---|---|---|---|
| Llama 3.3 70B | Text | €0,60 | €1,20 | 128K |
| DeepSeek V3.1 | Text | €3,00 | €4,50 | 128K |
| DeepSeek V3.2 | Text | €3,00 | €4,50 | 32K |
Prezzi in EUR, IVA esclusa. Le richieste vengono elaborate su infrastruttura globale fuori dall'UE.
Stima il tuo costo mensile
Parti da un workload tipico, poi adatta i numeri al tuo.
Costo mensile stimato (IVA esclusa)
€324,00
- Per richiesta
- €0,00108
- Al giorno
- €10,80
- Tariffa (input / output per 1M)
- €0,60 / €2,40
Sovrano UE - i dati restano nell'UE
Solo una stima. Il calcolo presuppone circa 30 giorni di uso costante. Il numero reale di token dipende da lingua, contenuto e tokenizer del modello (in inglese circa 750 parole corrispondono a 1.000 token). Speech-to-text ed embedding non sono inclusi qui, perché si pagano solo sui token di input. Le tariffe sono nella tabella qui sopra. Puoi controllare il tuo consumo esatto in qualsiasi momento su cloud.infercom.ai/plans/usage.
Livelli di accesso
Scegli come iniziare: puoi passare a un livello superiore in qualsiasi momento, man mano che cresci.
Inizia qui
Developer
Pay-as-you-go
Registrati, crea una chiave API e paga solo i token che usi. Nessun minimo, nessun vincolo.
Enterprise
Prezzo di listino con sconti sui volumi
Le stesse tariffe per token come base, con sconti sui volumi impegnati, SLA personalizzati, supporto prioritario e rate limit più alti.
Domande frequenti
Come funziona la fatturazione?
La Inference API è pay-as-you-go. Aggiungi un metodo di pagamento, una carta di credito, e il consumo viene addebitato per token ai prezzi di listino pubblicati. Paghi quindi solo ciò che usi, senza minimi e senza impegno mensile. Con le tariffe qui sopra puoi calcolare i costi in anticipo senza difficoltà.
Posso vedere il mio consumo di token e la spesa attuale?
Sì, in tempo reale. Il consumo di token aggiornato è su cloud.infercom.ai/plans/usage, mentre fatturazione e fatture sono su cloud.infercom.ai/plans/billing. Sai sempre con precisione quanto hai usato e quanto costa.
Quali sono i rate limit?
I rate limit dipendono dal piano e dal modello. Il livello Developer ha rate limit standard, descritti nella nostra documentazione sui rate limit. I piani Enterprise offrono rate limit personalizzati sul tuo workload. I rate limit regolano quante richieste puoi inviare, ma non influiscono sulla velocità di inferenza della singola richiesta.
Quali metodi di pagamento accettate?
Per il nostro servizio di inferenza accettiamo le principali carte di credito tramite Stripe. I clienti Enterprise, Dedicated Capacity e On-Premises possono pagare anche con fattura.
Cosa comprende la sovranità UE?
Con i modelli sovrani UE tutta l'elaborazione dei dati avviene per impostazione predefinita nei nostri datacenter europei. I tuoi dati lasciano la giurisdizione UE solo se scegli esplicitamente i modelli del catalogo globale. Piena conformità al GDPR e preparazione all'AI Act sono incluse.
Offrite sconti sui volumi?
Sì, sia i contratti Enterprise sia quelli per Dedicated Capacity prevedono prezzi personalizzati in base al consumo impegnato. Contatta il nostro team commerciale per parlare delle tue esigenze.