Dedicated Capacity
Garanteret performance, på de modeller, du vælger
Single-tenant-hardware til AI-inferens, reserveret kun til dig i vores datacenter i München og drevet fuldt ud af os. Ingen andre kunder, der konkurrerer om throughput, en forudsigelig månedlig pris og dit eget udvalg af modeller, også modeller uden for det offentlige katalog.
Samme platform, mere kontrol
Den samme suveræne platform, reserveret kun til dig
Dedicated Capacity giver dig den samme OpenAI-kompatible API, den samme EU-suverænitet og de samme modeller som vores delte Inference API, men på single-tenant-hardware, som ingen andre bruger. Du får garanteret throughput uden konkurrence til en forudsigelig månedlig pris og kan køre dit eget udvalg af modeller, også modeller uden for det offentlige katalog.
Hvornår det passer
Hvornår Dedicated Capacity er det rigtige valg
Det kan betale sig, når dit workload er højt, stabilt og kritisk for produktionen. Under det niveau er den delte API som regel den bedre løsning, og det siger vi også.
Højt, stabilt volumen
Vedvarende trafik i produktion, der jævnligt går ud over det, de delte priser dækker økonomisk.
Garanterede SLA'er
Kontraktlige tilsagn om oppetid og svartid, uden konkurrence fra andre kunder.
Egne modeller
Kør dine egne fine-tunede checkpoints (BYOC) eller flere modeller på ét rack, med skift på millisekunder.
Isolation
Single-tenant-hardware af hensyn til compliance, forudsigelig performance eller ro i maven.
Det får du
En inferensmotor til produktion, drevet for dig
Din egen AI-inferens med høj throughput til modeller i produktionsskala, på suveræn single-tenant-infrastruktur. Infercom sætter den op, driver den og holder den kørende, så dit team kan fokusere på at udvikle og ikke på drift.
Infrastruktur
- Single-tenant-hardware reserveret til dig - ét rack eller mange
- Drevet og vedligeholdt fuldt ud af Infercom
- Garanteret throughput - ingen larmende naboer
- Individuelle rate limits eller slet ingen
- Modeller med den præcision, som deres udgivere har udgivet dem i
- I vores datacenter i München uden permanent lagring af dine data
Support og SLA'er
- Eget account-team
- Prioriteret support med direkte eskalering
- Individuelle SLA'er (oppetid, svartid)
- Dimensionering ud fra dit reelle workload
- ISO 27001-certificeret drift
- Deployment typisk inden for ~2 uger
Modeller
Kør de modeller, du har brug for
Et dedikeret rack kan køre modeller uden for det offentlige API-katalog, også modeller vi sætter i drift specielt til dig. Dertil kommer dine egne fine-tunede checkpoints via Bring Your Own Checkpoint.
- Hele det offentlige katalog
- Modeller uden for det offentlige katalog, efter aftale
- BYOC - fine-tunes af understøttede arkitekturer kører med det samme
- Op til ~700B parametre på ét rack
Fine-tunes af understøttede arkitekturer kører med det samme. Helt nye arkitekturer er en kommerciel samtale. Vi lover ikke en bestemt egen model, før vi har tjekket, at den kan køre.
Tilgængeligt på dit rack
- Hele Infercom-katalogetAlle modeller, du kan kalde via API'en
- Plus modeller efter aftaleUden for det offentlige katalog
- Dine egne checkpointsFine-tunes af understøttede arkitekturer (BYOC)
- Præcision som udgivetIngen kvantisering i dag
Selve fine-tuningen foregår på GPU'er: Du træner og giver os vægtene, som vi så kører med fuld hastighed.
Ét rack, mange modeller
Skift checkpoints på millisekunder
Hver chip har tre hukommelseslag: SRAM på chippen til den løbende beregning, HBM i samme package til vægtene for den aktive model og et stort DDR-lag til flere modeller og checkpoints. Fordi chippen tilgår sin DDR direkte, holder et dedikeret rack flere modeller og fine-tunede checkpoints klar og skifter mellem dem på millisekunder. Et GPU-cluster skal bruge sekunder til minutter.
Det betyder, at ét rack kan betjene en hel agentisk pipeline, fx en planlægningsmodel, en executor og en specialiseret fine-tune, og skifte ved hvert trin uden at skulle opbygge separat infrastruktur til hver model.
Hvor mange modeller der kan ligge på et rack på samme tid, afhænger af deres størrelse. Vi dimensionerer racket efter dit mix.
Skiftetid for checkpoints
Sammenligning
Dedicated Capacity vs. Inference API
| Inference API | Dedicated Capacity | |
|---|---|---|
| Infrastruktur | Delt (multi-tenant) | Reserveret (single-tenant) |
| Afregning | Per token | Fast månedlig pris |
| Rate limits | Efter niveau | Individuelle eller ingen |
| Konkurrence om kapacitet | Delt kø under belastning | Ingen - det hele er dit |
| Egne modeller (BYOC) | Kun kataloget | Kataloget plus dine checkpoints |
| Support | Efter niveau | Eget team |
| SLA'er | Best effort | Individuelle, garanterede |
FAQ
Ligefremme svar på dine spørgsmål
Er performance med Dedicated Capacity den samme som med den delte API?
Ja, det er den samme hardware og den samme hastighed. Forskellen er, at kapaciteten kun er reserveret til dig. Der er ingen andre kunder, ingen delt kø og ingen konkurrence. Din throughput er stabil, fordi ingen andre bruger dit rack.
Hvornår giver Dedicated Capacity mening i forhold til betaling per token?
To ting afgør det, og kun den ene handler om pris. Økonomisk giver det mening ved vedvarende høj udnyttelse, altså når dit stabile volumen jævnligt går ud over det, de delte priser dækker. Præcis hvor grænsen går, afhænger af din model og dit trafikmønster. Under den grænse er pay-as-you-go på Inference API som regel den bedre løsning. Den anden grund har intet med belastning at gøre: Hvis du vil køre dit eget udvalg af modeller eller dine egne fine-tunede checkpoints (BYOC) på hardware, der kun er reserveret til dig, får du det med Dedicated Capacity, uanset volumen. Det er også svaret, hvis du har brug for garanteret kapacitet og SLA'er, eller hvis du rammer rate limits på de delte niveauer. Er dit workload svingende eller eksperimenterende, og har du ikke brug for den kontrol, anbefaler vi dig at blive på forbrugsbaseret betaling.
Kan jeg køre min egen fine-tunede model?
Ja, hvis den er en fine-tune af en arkitektur, vi allerede understøtter. Så kører den med det samme. Du fine-tuner på GPU'er og giver os vægtene, og vi kører dem på dit rack. En helt ny arkitektur kræver udviklingsarbejde, og det er en kommerciel samtale. Fortæl os, hvilken model du tænker på, så bekræfter vi, at den kan køre.
Kan I fine-tune modellen for os?
Nej, fine-tuning og træning foregår på GPU'er, ikke på denne arkitektur, som er bygget til inferens. Du eller din ML-partner fine-tuner på GPU'er, og vi hoster og kører det færdige checkpoint med fuld hastighed. Vi siger det ligeud, så forventningerne passer fra starten.
Hvor hurtigt kan I skifte mellem modeller eller checkpoints?
På millisekunder, mod sekunder til minutter på GPU'er. Ventende checkpoints ligger i chippens store DDR-lag, som chippen tilgår direkte. Derfor kan ét rack holde flere fine-tunede checkpoints og skifte mellem dem for hver forespørgsel, endda med forskellige modeller i forskellige trin af et agentisk forløb.
Hvilke modeller kan jeg køre, og hvor store må de være?
Alle modeller i kataloget plus understøttede egne checkpoints. På ét rack kører modeller op til omkring 700B parametre godt. En model i 670B-klassen passer fint, og MiniMax M2.7 Ultraspeed ligger lige i det ideelle område. Modeller over omkring 1T parametre passer ikke på ét rack i dag.
Hvor mange racks har jeg brug for?
Vi dimensionerer ud fra dit workload: antal brugere, højeste samtidighed, type workload (interaktivt, agentisk, batch) og mål for throughput, regnet baglæns ud fra målt samtidighed. Vi dimensionerer hellere rigtigt end at sælge dig kapacitet, du ikke får brugt.
Kan jeg teste, før jeg binder mig?
Ja, og det anbefaler vi. Vis værdien først på den delte Inference API (den er teknisk identisk). Derefter kan vi aftale en tidsbegrænset testperiode, før du skriver under. Et dedikeret rack er en reel forpligtelse. Den bør komme efter en bevist værdi, ikke før.
Hvor lang tid tager deployment?
Et dedikeret rack er typisk klar på cirka to uger. (On-premises-hardware i dit eget datacenter tager længere tid - se siden om On-Premises.)
Hvordan adskiller Dedicated Capacity sig fra On-Premises?
Det handler om placering og ejerskab. Med Dedicated Capacity ejer Infercom hardwaren, den står i vores datacenter i München og er reserveret kun til dig: Vi driver den, du bruger den. Med On-Premises ejer du hardwaren, den står i dit eget datacenter, og du driver den selv. Performance er den samme. Forskellen er, hvem der har nøglerne.
Hvilken throughput får jeg reelt, ud over benchmark-tallet?
Den reelle throughput afhænger af din kontekstlængde og forholdet mellem input og output. De kendte tal i tokens per sekund er spidsværdier på gunstige workloads. Trafik med lang kontekst og meget output kører langsommere. Vi angiver throughput for dit faktiske workload, ikke for et enkelt best case-benchmark. Kun sådan kan et rack dimensioneres ærligt.
Hvad koster det?
Dedicated Capacity koster en fast månedlig pris per reserveret rack, med rabat for længere aftaler. Den rigtige konfiguration afhænger af dine modeller, din throughput og aftalens længde. Derfor fastsætter vi prisen individuelt per projekt i stedet for at offentliggøre den. Tal med os, så får du hurtigt konkrete tal.
Skal jeg binde mig på lang sigt?
Nej. Længere aftaler giver bedre priser, men modellandskabet ændrer sig hurtigt, og du vil ikke sidde fast i sidste års setup. Vi tilbyder også kortere aftaler. Fortæl os, hvor meget risiko du kan tåle, så finder vi en struktur, der passer.
Kan jeg videresælge kapaciteten eller køre mine egne kunders workloads på den?
Ja, det er din reserverede kapacitet, ligesom en server, du lejer. Du kan bygge den forretningsmodel ovenpå, du vil, også tjenester til dine egne kunder. Systemintegratorer og bureauer gør netop det. Tal med os, så sætter vi det op, så det passer til din måde at gå til markedet på.
Har du brug for fuldt ejerskab?
Overvej et on-premises-deployment
Hvis et krav betyder, at hardwaren skal stå i din egen bygning, fx til air-gapped miljøer eller data, der ikke må forlade dit netværk, giver On-Premises det højeste niveau af isolation.
Klar til at dimensionere et dedikeret rack?
Fortæl os om dit workload, så lægger vi hurtigt konkrete tal på bordet.