Er det virkelig OpenAI-kompatibelt, og kan jeg pege min eksisterende kode mod det?
Ja. Det erstatter OpenAI API'et direkte: Skift base URL til https://api.infercom.ai/v1, brug din Infercom-API-nøgle, og resten af din kode forbliver den samme. Vi er også kompatible med Anthropic, så Anthropic SDK'et virker også. Se eksempler side om side på siden om API-kompatibilitet.
Hvordan holder jeg mine data i EU?
Brug de EU-suveræne modeller. De kører på vores hardware i vores datacenter i München, og dine data bliver under EU-jurisdiktion. Vi gemmer heller intet permanent: Prompts og svar skrives ikke til disk, vi træner ikke på dine data, og vi leverer ikke cachede svar. Modellerne i Global-kataloget behandles uden for EU, så vælg EU-suveræne modeller til GDPR-følsomme workloads. Læs mere i vores Trust Center.
Er modellerne kvantiserede?
Nej. I dag kører vi hver model med den præcision, som dens udgiver har udgivet den i, uden at kvantisere den.
Kan vi forbinde privat uden om det offentlige internet?
Ikke i dag: API'et tilgås via HTTPS på det offentlige internet. Hvis en privat forbindelse er et krav, så tal med os om dit netværk.
Hvor hurtigt er det egentlig?
Målt på vores produktions-API: 428 tok/s med MiniMax M2.7 og 713 tok/s med gpt-oss-120b (juli 2026). Outputhastigheden per forespørgsel holder, når mange forespørgsler kører parallelt; time to first token vokser, når forespørgsler står i kø i spidsbelastningsperioder. Hvert svar oplyser sin time to first token og sine tokens per sekund, så du kan tjekke det på din egen workload.
Hvad er forskellen mellem niveauerne Developer og Enterprise?
Developer er selvbetjening med betaling efter forbrug og standard-rate limits, ideelt til at udvikle og komme i produktion. Enterprise tilføjer produktions-rate limits, prioritet i planlægningen, mængderabatter og dedikeret support mod et månedligt minimumsforbrug. Du kan starte på Developer og skifte, når dit forbrug vokser.
Hvorfor er model X ikke tilgængelig endnu, og hvor hurtigt kan I tilføje den?
Hver model optimeres til dataflow-hardwaren i stedet for at blive indlæst, som den er. Et nyt checkpoint af en arkitektur, vi allerede kører, kan gå live på timer til dage, en ny version af en understøttet modelfamilie på dage til uger. En helt ny arkitektur kræver uger med engineering. Fortæl os, hvilken model du har brug for, så får du et ærligt svar om tidsplanen. Er det en fine-tune af noget, vi allerede understøtter, går det hurtigt.
Kan jeg styre omkostningerne og undgå overraskende regninger?
Ja. Du betaler pay-as-you-go efter offentliggjorte listepriser per token, så omkostningerne er forudsigelige og nemme at beregne. Du betaler kun for de tokens, du bruger, uden minimumsforbrug og uden binding på niveauet Developer. Og du kan til enhver tid følge dit forbrug live i konsollen på cloud.infercom.ai.
Tilbyder I en uptime-SLA på API'et?
Det delte API har tilgængelighed efter best effort uden en kontraktlig SLA. Det er beregnet til at bygge, integrere og skalere til produktion. Hvis du har brug for en garanteret SLA, reserveret throughput og ingen konkurrence fra andre brugere, er det netop det, Dedicated Capacity giver.
Hvad sker der under høj belastning, og kan mine forespørgsler blive nedprioriteret?
På den delte infrastruktur får højere niveauer prioritet i planlægningen, så under spidsbelastning kan en forespørgsel fra et lavere niveau vente bag enterprise-trafik. Ved normal drift sættes forespørgsler i kø i stedet for at blive afvist, og outputhastigheden for en kørende forespørgsel påvirkes ikke; kun time to first token vokser, mens den venter. Ved ekstrem overbelastning kan køen afvise forespørgsler. Til kapacitet, som ingen anden kunde rører, findes Dedicated Capacity.
Er prompt caching tilgængelig?
Ja, med MiniMax M2.7. Gentaget kontekst hentes fra en cache i chippenes hukommelse, så lange prompts starter hurtigere; intet skrives til disk. Cachede tokens afregnes indtil videre til den almindelige inputpris.
Hvordan står det sig mod selv at køre open source-modeller på GPU'er?
Til latensfølsomt arbejde som agenter, chat, voice og kodning leverer dataflow-arkitekturen op til 10x hastigheden, uden et cluster at tune. Til ren offline batchgenerering, hvor latens er ligegyldig, kan GPU'er være billigere, og det siger vi også. Mange teams kører hybridt: Infercom til brugervendt inferens, GPU'er til baggrundsjob.