Inference API

Hurtig, OpenAI-kompatibel inferens

med EU-suveræne modeller, du selv vælger

OpenAI-kompatibel inferens med aktuelle open-weight-modeller på hardware udviklet til formålet i München. Vælg EU-suveræne modeller, så bliver dine data i EU. Op til 10x hurtigere end GPU'er, du betaler kun for det, du bruger, og er i gang på få minutter.

Hvorfor Infercom

Bygget til teams, der mener det alvorligt

Hurtige svar til produktions-workloads: compliant og integreret på få minutter, uden infrastruktur at drive.

Pålidelig

  • EU-jurisdiktion, datacenter i München
  • Intet amerikansk moderselskab, ikke omfattet af CLOUD Act
  • Ingen permanent lagring som standard

Vores Trust Center

Problemfri

  • Kompatibel med OpenAI og Anthropic
  • Nyeste open-weight-modeller, ingen lock-in
  • Streaming, værktøjer, structured output

Læs dokumentationen

Ultrahurtig

  • Op til 10x hurtigere end GPU'er
  • Hundredvis af tokens per sekund, per forespørgsel
  • Bygget til inferens, ikke til træning

Se benchmarks

Derfor betyder hastighed noget

Hastighed afgør, hvad du kan bygge

Den viser sig på to måder: Den hober sig op over en agents mange kald, og du mærker den i det øjeblik, en realtidsapp svarer.

1 · Det hober sig op

For agenter ganges latensen op

En chatbot foretager ét kald per runde. En agent foretager 50-100 inferenskald for at løse en enkelt opgave, og hvert kald venter på det forrige.

I den skala er latensen per kald ikke længere en detalje, men afgør, hvad du kan levere. Samme agent, samme logik, samme model: Infrastrukturen nedenunder er forskellen på en opgave, der er færdig på få minutter, og en, der tager ti.

Agentopgave med 50 runder

GPU med 90 tok/s~9,8 min
Infercom~2,5 min

Beregnet: hvert kald med 10K input- og 1K output-tokens. Infercom med den målte end-to-end-tid på 3,023 s med MiniMax M2.7 (juli 2026); GPU med 90 tok/s plus samme time to first token. Ikke en måling af en GPU-udbyder.

2 · Du mærker det

I realtidsapps er det første token alt

I en stemmeassistent eller et live kodeværktøj er det ikke den samlede throughput, der får det til at føles menneskeligt, men hvor hurtigt svaret begynder. En lang pause før det første ord ødelægger illusionen om en samtale.

Dataflow-arkitekturen giver en kort time to first token, så realtidsapps føles hurtige i stedet for træge. Hvert API-svar rapporterer sin målte TTFT, så du kan holde din app op mod den.

Time to First Token

  • StemmeagenterIngen akavet pause før svaret
  • Live kodeassistenterForslag, der kan følge med, mens du skriver
  • Interaktiv chatSvar, der begynder at streame med det samme

Integration

Én linje at skifte

Peg OpenAI SDK'et mod Infercom, og behold resten af din kode. Chat completions, streaming, structured output og function calling fungerer, som du forventer.

Python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.infercom.ai/v1",
    api_key="your-api-key"
)

response = client.chat.completions.create(
    model="MiniMax-M2.7",
    messages=[
        {"role": "user", "content": "Hello!"}
    ]
)
# usage includes measured tokens/sec + TTFT

EU-suveræne modeller - i datacentre i EU

Globalt katalog - behandles uden for EU

Et udvidet katalog med flere open-weight-modeller, der behandles uden for EU i en region, vi ikke kontrollerer, til teams, der har brug for et bredere udvalg af modeller.

Brug de EU-suveræne modeller til GDPR-følsomme data. Det globale katalog kører på ekstern infrastruktur uden for EU-jurisdiktion.

Se hele modelkataloget

Adgangsniveauer

Kom i gang, og skaler til produktion

Selvbetjening på delt infrastruktur. Ryk op, når dit forbrug vokser.

Selvbetjening

Developer

Pay-as-you-go

Tilmeld dig, opret en API-nøgle, og kom i gang. Du betaler kun for de tokens, du bruger, til offentliggjorte listepriser.

Kom i gang

Committed Use

Enterprise

Tilpasset

Til workloads i produktion, der har brug for højere throughput, prioritet og en kommerciel aftale.

  • Rate limits til produktion
  • Prioritet i planlægningen
  • Mængderabatter
  • Dedikeret support
Kontakt salg

Se priser per model

FAQ

Spørgsmål med ligefremme svar

Er det virkelig OpenAI-kompatibelt, og kan jeg pege min eksisterende kode mod det?

Ja. Det erstatter OpenAI API'et direkte: Skift base URL til https://api.infercom.ai/v1, brug din Infercom-API-nøgle, og resten af din kode forbliver den samme. Vi er også kompatible med Anthropic, så Anthropic SDK'et virker også. Se eksempler side om side på siden om API-kompatibilitet.

Hvordan holder jeg mine data i EU?

Brug de EU-suveræne modeller. De kører på vores hardware i vores datacenter i München, og dine data bliver under EU-jurisdiktion. Vi gemmer heller intet permanent: Prompts og svar skrives ikke til disk, vi træner ikke på dine data, og vi leverer ikke cachede svar. Modellerne i Global-kataloget behandles uden for EU, så vælg EU-suveræne modeller til GDPR-følsomme workloads. Læs mere i vores Trust Center.

Er modellerne kvantiserede?

Nej. I dag kører vi hver model med den præcision, som dens udgiver har udgivet den i, uden at kvantisere den.

Kan vi forbinde privat uden om det offentlige internet?

Ikke i dag: API'et tilgås via HTTPS på det offentlige internet. Hvis en privat forbindelse er et krav, så tal med os om dit netværk.

Hvor hurtigt er det egentlig?

Målt på vores produktions-API: 428 tok/s med MiniMax M2.7 og 713 tok/s med gpt-oss-120b (juli 2026). Outputhastigheden per forespørgsel holder, når mange forespørgsler kører parallelt; time to first token vokser, når forespørgsler står i kø i spidsbelastningsperioder. Hvert svar oplyser sin time to first token og sine tokens per sekund, så du kan tjekke det på din egen workload.

Hvad er forskellen mellem niveauerne Developer og Enterprise?

Developer er selvbetjening med betaling efter forbrug og standard-rate limits, ideelt til at udvikle og komme i produktion. Enterprise tilføjer produktions-rate limits, prioritet i planlægningen, mængderabatter og dedikeret support mod et månedligt minimumsforbrug. Du kan starte på Developer og skifte, når dit forbrug vokser.

Hvorfor er model X ikke tilgængelig endnu, og hvor hurtigt kan I tilføje den?

Hver model optimeres til dataflow-hardwaren i stedet for at blive indlæst, som den er. Et nyt checkpoint af en arkitektur, vi allerede kører, kan gå live på timer til dage, en ny version af en understøttet modelfamilie på dage til uger. En helt ny arkitektur kræver uger med engineering. Fortæl os, hvilken model du har brug for, så får du et ærligt svar om tidsplanen. Er det en fine-tune af noget, vi allerede understøtter, går det hurtigt.

Kan jeg styre omkostningerne og undgå overraskende regninger?

Ja. Du betaler pay-as-you-go efter offentliggjorte listepriser per token, så omkostningerne er forudsigelige og nemme at beregne. Du betaler kun for de tokens, du bruger, uden minimumsforbrug og uden binding på niveauet Developer. Og du kan til enhver tid følge dit forbrug live i konsollen på cloud.infercom.ai.

Tilbyder I en uptime-SLA på API'et?

Det delte API har tilgængelighed efter best effort uden en kontraktlig SLA. Det er beregnet til at bygge, integrere og skalere til produktion. Hvis du har brug for en garanteret SLA, reserveret throughput og ingen konkurrence fra andre brugere, er det netop det, Dedicated Capacity giver.

Hvad sker der under høj belastning, og kan mine forespørgsler blive nedprioriteret?

På den delte infrastruktur får højere niveauer prioritet i planlægningen, så under spidsbelastning kan en forespørgsel fra et lavere niveau vente bag enterprise-trafik. Ved normal drift sættes forespørgsler i kø i stedet for at blive afvist, og outputhastigheden for en kørende forespørgsel påvirkes ikke; kun time to first token vokser, mens den venter. Ved ekstrem overbelastning kan køen afvise forespørgsler. Til kapacitet, som ingen anden kunde rører, findes Dedicated Capacity.

Er prompt caching tilgængelig?

Ja, med MiniMax M2.7. Gentaget kontekst hentes fra en cache i chippenes hukommelse, så lange prompts starter hurtigere; intet skrives til disk. Cachede tokens afregnes indtil videre til den almindelige inputpris.

Hvordan står det sig mod selv at køre open source-modeller på GPU'er?

Til latensfølsomt arbejde som agenter, chat, voice og kodning leverer dataflow-arkitekturen op til 10x hastigheden, uden et cluster at tune. Til ren offline batchgenerering, hvor latens er ligegyldig, kan GPU'er være billigere, og det siger vi også. Mange teams kører hybridt: Infercom til brugervendt inferens, GPU'er til baggrundsjob.

Brug for mere kontrol?

Samme platform, samme performance, med mere isolation, når du har brug for det.

Dedicated Capacity

Det samme API på single-tenant-hardware, der er reserveret til dig og afregnes månedligt, med garanteret throughput og egne modeller.

Læs mere: Dedicated Capacity

On-Premises

Dit datacenter, din hardware: den højeste grad af isolation, med en air-gapped mulighed til de strengeste krav.

Læs mere: On-Premises

Klar til at bygge fremtidens AI i Europa?

Slut dig til virksomheder, der bruger suveræn AI med performance i topklasse