Dedicated Capacity
Prestazioni garantite, sui modelli che scegli
Hardware single-tenant per l'inferenza AI, riservato solo a te nel nostro datacenter a Monaco di Baviera e gestito interamente da noi. Nessun altro cliente in competizione per il throughput, un costo mensile prevedibile e il tuo mix di modelli, compresi quelli fuori dal catalogo pubblico.
Stessa piattaforma, più controllo
La stessa piattaforma sovrana, riservata solo a te
Dedicated Capacity offre la stessa API compatibile con OpenAI, la stessa sovranità UE e gli stessi modelli della nostra Inference API condivisa, ma su hardware single-tenant che nessun altro usa. Ottieni throughput garantito e senza contese a un costo mensile prevedibile, e puoi usare la tua selezione di modelli, compresi quelli fuori dal catalogo pubblico.
Quando conviene
Quando scegliere Dedicated Capacity
Conviene quando il tuo workload è alto, costante e critico per la produzione. Sotto questa soglia l'API condivisa è di solito la scelta migliore, e te lo diciamo.
Volumi alti e costanti
Traffico di produzione continuo che supera regolarmente ciò che i livelli condivisi coprono in modo conveniente.
SLA garantiti
Impegni contrattuali su disponibilità e tempi di risposta, senza contese con altri clienti.
Modelli personalizzati
Usa checkpoint con fine-tuning (BYOC) o più modelli su un solo rack, con cambio in millisecondi.
Isolamento
Hardware single-tenant per compliance, prestazioni prevedibili o maggiore tranquillità.
Cosa ottieni
Un motore di inferenza per la produzione, gestito per te
La tua inferenza AI ad alto throughput per modelli su scala di produzione, su un'infrastruttura sovrana e single-tenant. Infercom la installa, la gestisce e la mantiene operativa, così il tuo team si concentra sullo sviluppo e non sull'operatività.
Infrastruttura
- Hardware single-tenant riservato a te - un rack o molti
- Gestito e mantenuto interamente da Infercom
- Throughput garantito - nessun vicino rumoroso
- Rate limit personalizzati, o nessuno
- Modelli con la precisione con cui chi li pubblica li ha rilasciati
- Nel nostro datacenter a Monaco di Baviera, senza archiviazione persistente dei tuoi dati
Supporto e SLA
- Team di account dedicato
- Supporto prioritario con escalation diretta
- SLA personalizzati (disponibilità, tempi di risposta)
- Dimensionamento sul tuo workload reale
- Operatività certificata ISO 27001
- Deployment in genere entro ~2 settimane
Modelli
Usa i modelli che ti servono
Un rack dedicato può usare modelli fuori dal catalogo pubblico dell'API, compresi quelli che mettiamo in servizio apposta per te. A questi si aggiungono i tuoi checkpoint con fine-tuning tramite Bring Your Own Checkpoint.
- Il catalogo pubblico completo
- Modelli fuori dal catalogo pubblico, su richiesta
- BYOC - i fine-tune di architetture supportate si caricano subito
- Fino a ~700B parametri su un solo rack
I fine-tune di architetture supportate si caricano subito. Le architetture completamente nuove sono un tema commerciale. Non promettiamo un modello personalizzato specifico senza aver verificato che possa girare.
Disponibile sul tuo rack
- Il catalogo completo di InfercomOgni modello che puoi chiamare tramite l'API
- Più modelli su richiestaFuori dal catalogo pubblico
- I tuoi checkpointFine-tune di architetture supportate (BYOC)
- Precisione come rilasciataOggi nessuna quantizzazione
Il fine-tuning vero e proprio gira su GPU: tu addestri il modello e ci consegni i pesi, che noi serviamo alla massima velocità.
Un rack, molti modelli
Cambia checkpoint in millisecondi
Ogni chip ha tre livelli di memoria: la SRAM sul chip per il calcolo in corso, la HBM nello stesso package per i pesi del modello attivo e un ampio livello DDR per altri modelli e checkpoint. Poiché il chip accede direttamente alla sua DDR, un rack dedicato tiene pronti più modelli e checkpoint con fine-tuning e passa dall'uno all'altro in millisecondi. Un cluster di GPU impiega da secondi a minuti.
Così un solo rack può servire un'intera pipeline agentica, per esempio un modello planner, un executor e un fine-tune specializzato, cambiando modello a ogni passaggio senza creare un'infrastruttura separata per ciascuno.
Quanti modelli entrano contemporaneamente in un rack dipende dalla loro dimensione. Dimensioniamo il rack sul tuo mix.
Tempo di cambio checkpoint
Confronto
Dedicated Capacity e Inference API a confronto
| Inference API | Dedicated Capacity | |
|---|---|---|
| Infrastruttura | Condivisa (multi-tenant) | Riservata (single-tenant) |
| Fatturazione | Per token | Canone mensile fisso |
| Rate limit | In base al livello | Personalizzati o nessuno |
| Contesa di capacità | Coda condivisa sotto carico | Nessuna - è tutto tuo |
| Modelli personalizzati (BYOC) | Solo catalogo | Catalogo più i tuoi checkpoint |
| Supporto | In base al livello | Team dedicato |
| SLA | Best effort | Personalizzati, garantiti |
FAQ
Domande e risposte, senza giri di parole
Le prestazioni di Dedicated Capacity sono le stesse dell'API condivisa?
Sì, è lo stesso hardware con la stessa velocità. La differenza è che la capacità è riservata solo a te: nessun altro cliente, nessuna coda condivisa, nessuna contesa. Il throughput resta costante perché nessun altro usa il tuo rack.
Quando conviene davvero Dedicated Capacity rispetto al pagamento per token?
Due fattori decidono, e solo uno riguarda il costo. Dal punto di vista economico conviene con un utilizzo alto e continuo, cioè quando il tuo volume costante supera regolarmente ciò che coprono i livelli condivisi. Il punto esatto di pareggio dipende dal modello e dal tipo di traffico. Sotto questa soglia il pay-as-you-go sulla Inference API è di solito la scelta migliore. Il secondo fattore non ha niente a che vedere con il carico: se vuoi usare il tuo mix di modelli o i tuoi checkpoint con fine-tuning (BYOC) su hardware riservato solo a te, Dedicated Capacity è il modo per farlo, a qualsiasi volume. È anche la risposta se ti servono capacità garantita e SLA, o se superi i rate limit dei livelli condivisi. Se il tuo workload è variabile o ancora esplorativo e non ti serve questo controllo, ti consigliamo di restare sul pagamento a consumo.
Posso usare il mio modello con fine-tuning?
Sì, se è un fine-tune di un'architettura che supportiamo già: in quel caso si carica e funziona subito. Tu fai il fine-tuning su GPU e ci consegni i pesi, noi li serviamo sul tuo rack. Un'architettura completamente nuova richiede lavoro di sviluppo, ed è un tema commerciale. Dicci a quale modello pensi e ti confermiamo che può girare.
Potete fare il fine-tuning del modello per noi?
No, fine-tuning e addestramento girano su GPU, non su questa architettura, che è progettata per l'inferenza. Tu o il tuo partner ML fate il fine-tuning su GPU, e noi ospitiamo e serviamo il checkpoint risultante alla massima velocità. Lo diciamo chiaramente, così le aspettative sono giuste fin dall'inizio.
Quanto velocemente potete passare da un modello o checkpoint all'altro?
In millisecondi, contro secondi o minuti sulle GPU. I checkpoint in attesa restano nell'ampio livello DDR del chip, a cui il chip accede direttamente. Per questo un rack può tenere più checkpoint con fine-tuning e passare dall'uno all'altro a ogni richiesta, anche con modelli diversi in passaggi diversi di un flusso agentico.
Quali modelli posso usare, e quanto possono essere grandi?
Qualsiasi modello del catalogo, più i checkpoint personalizzati supportati. Su un solo rack girano bene modelli fino a circa 700B parametri. Un modello della classe 670B ci sta comodamente, e MiniMax M2.7 Ultraspeed è nella fascia ideale. I modelli oltre circa 1T parametri oggi non entrano in un solo rack.
Di quanti rack ho bisogno?
Dimensioniamo in base al tuo workload: numero di utenti, concorrenza di picco, tipo di workload (interattivo, agentico, batch) e obiettivi di throughput, calcolati a ritroso dalla concorrenza misurata. Preferiamo dimensionare in modo giusto piuttosto che venderti capacità che non userai.
Posso fare un test prima di impegnarmi?
Sì, e lo consigliamo. Dimostra il valore prima sulla Inference API condivisa (è tecnicamente identica). Poi possiamo organizzare un periodo di test limitato prima della firma. Un rack dedicato è un impegno concreto. Dovrebbe seguire un valore dimostrato, non precederlo.
Quanto dura il deployment?
Un rack dedicato è di solito pronto in circa due settimane. (L'hardware on-premises nel tuo datacenter richiede più tempo - vedi la pagina On-Premises.)
In cosa Dedicated Capacity è diversa da On-Premises?
Nella posizione e nella proprietà. Con Dedicated Capacity l'hardware è di Infercom, si trova nel nostro datacenter a Monaco di Baviera ed è riservato solo a te: noi lo gestiamo, tu lo usi. Con On-Premises l'hardware è tuo, si trova nel tuo datacenter e lo gestisci direttamente. Le prestazioni sono identiche. Cambia solo chi tiene le chiavi.
Che throughput ottengo davvero, al di là del numero del benchmark?
Il throughput reale dipende dalla lunghezza del contesto e dal rapporto tra input e output. I valori noti in token al secondo sono picchi misurati su workload favorevoli. Il traffico con contesto lungo e molto output va più piano. Indichiamo il throughput sul tuo workload reale, non su un singolo benchmark nel caso migliore. È l'unico modo onesto per dimensionare un rack.
Quanto costa?
Dedicated Capacity ha un canone mensile fisso per rack riservato, con sconti per impegni più lunghi. La configurazione giusta dipende dai tuoi modelli, dal throughput e dalla durata del contratto. Per questo il prezzo viene definito caso per caso invece di essere pubblicato. Parlane con noi e ti daremo rapidamente numeri concreti.
Devo impegnarmi a lungo termine?
No. Gli impegni più lunghi danno condizioni migliori, ma il panorama dei modelli cambia in fretta e la configurazione dell'anno scorso non deve diventare una gabbia. Offriamo anche durate più brevi. Dicci qual è la tua propensione al rischio e troveremo una struttura adatta.
Posso rivendere la capacità o usarla per i workload dei miei clienti?
Sì, è la tua capacità riservata, come un server che prendi in affitto. Puoi costruirci sopra qualsiasi modello di business, compresi i servizi per i tuoi clienti. System integrator e agenzie lo fanno proprio così. Parlane con noi e lo configuriamo in base a come vai sul mercato.
Ti serve la piena proprietà?
Valuta un deployment on-premises
Se un requisito impone che l'hardware stia nel tuo edificio, per esempio per ambienti air-gapped o per dati che non possono lasciare la tua rete, On-Premises offre il massimo livello di isolamento.
Vuoi dimensionare un rack dedicato?
Descrivici il tuo workload e ti daremo rapidamente numeri concreti.