Inference API

Schnelle, OpenAI-kompatible Inferenz

mit EU-souveränen Modellen, die Sie wählen

OpenAI-kompatible Inferenz mit aktuellen Open-Weight-Modellen, auf eigens dafür entwickelter Hardware in München. Wählen Sie EU-souveräne Modelle, und Ihre Daten bleiben in der EU. Bis zu 10x schneller als GPUs, Abrechnung nur nach Nutzung, in wenigen Minuten startklar.

Warum Infercom

Gebaut für Teams, die es ernst meinen

Schnelle Antworten für Produktions-Workloads: konform und in wenigen Minuten integriert, ohne eigene Infrastruktur.

Vertrauenswürdig

  • EU-Jurisdiktion, Rechenzentrum in München
  • Keine US-Muttergesellschaft, nicht dem CLOUD Act ausgesetzt
  • Standardmäßig keine dauerhafte Speicherung

Unser Trust Center

Nahtlos

  • Kompatibel mit OpenAI und Anthropic
  • Neueste Open-Weight-Modelle, kein Lock-in
  • Streaming, Tools, Structured Output

Dokumentation lesen

Ultraschnell

  • Bis zu 10x schneller als GPUs
  • Hunderte Token pro Sekunde, pro Request
  • Gebaut für Inferenz, nicht für Training

Benchmarks ansehen

Warum Geschwindigkeit zählt

Geschwindigkeit entscheidet, was Sie bauen können

Sie wirkt auf zwei Arten: Über die vielen Aufrufe eines Agenten summiert sich die Wartezeit, und bei einer Echtzeit-App spüren Sie sie im Moment der Antwort.

1 · Es summiert sich

Bei Agenten vervielfacht sich die Latenz

Ein Chatbot macht einen Aufruf pro Runde. Ein Agent braucht 50-100 Inferenz-Aufrufe für eine einzige Aufgabe, und jeder wartet auf den vorherigen.

In dieser Größenordnung ist die Latenz pro Aufruf kein Detail mehr, sondern entscheidet darüber, was Sie ausliefern können. Gleicher Agent, gleiche Logik, gleiches Modell: Die Infrastruktur darunter macht den Unterschied zwischen einer Aufgabe, die in Minuten fertig ist, und einer, die zehn dauert.

Agenten-Aufgabe mit 50 Runden

GPU mit 90 tok/s~9,8 min
Infercom~2,5 min

Berechnet: jeder Aufruf mit 10K Input- und 1K Output-Token. Infercom mit der gemessenen End-to-End-Zeit von 3,023 s bei MiniMax M2.7 (Juli 2026); GPU mit 90 tok/s plus derselben Time to First Token. Keine Messung eines GPU-Anbieters.

2 · Man spürt es

Bei Echtzeit-Apps entscheidet das erste Token

Ob ein Sprachassistent oder ein Live-Coding-Tool menschlich wirkt, hängt nicht vom Gesamtdurchsatz ab, sondern davon, wie schnell die Antwort beginnt. Eine lange Pause vor dem ersten Wort zerstört die Illusion eines Gesprächs.

Die Dataflow-Architektur liefert eine kurze Time to First Token, sodass sich Echtzeit-Apps reaktionsschnell anfühlen statt träge. Jede API-Antwort meldet die gemessene TTFT, damit Sie Ihre App daran messen können.

Time to First Token

  • Voice AgentsKeine unangenehme Pause vor der Antwort
  • Live-Coding-AssistentenVorschläge, die mit dem Tippen Schritt halten
  • Interaktiver ChatAntworten, die sofort zu streamen beginnen

Integration

Eine Zeile zum Umstellen

Richten Sie das OpenAI SDK auf Infercom, und behalten Sie den Rest Ihres Codes. Chat Completions, Streaming, Structured Output und Function Calling funktionieren so, wie Sie es erwarten.

Python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.infercom.ai/v1",
    api_key="your-api-key"
)

response = client.chat.completions.create(
    model="MiniMax-M2.7",
    messages=[
        {"role": "user", "content": "Hello!"}
    ]
)
# usage includes measured tokens/sec + TTFT

EU-souveräne Modelle - in Rechenzentren in der EU

Globaler Katalog - außerhalb der EU verarbeitet

Ein erweiterter Katalog weiterer Open-Weight-Modelle, verarbeitet außerhalb der EU in einer Region, die wir nicht kontrollieren, für Teams, die eine größere Modellauswahl brauchen.

Für DSGVO-sensible Daten nutzen Sie die EU-souveränen Modelle. Der Globale Katalog läuft auf externer Infrastruktur außerhalb der EU-Jurisdiktion.

Vollständigen Modellkatalog ansehen

Zugangsstufen

Starten und bis in die Produktion skalieren

Self-Service auf geteilter Infrastruktur. Steigen Sie auf, wenn Ihre Nutzung wächst.

Self-Service

Developer

Pay-as-you-go

Registrieren Sie sich, erstellen Sie einen API-Key, und legen Sie los. Sie zahlen nur für die Token, die Sie nutzen, zu veröffentlichten Listenpreisen.

Jetzt loslegen

Committed Use

Enterprise

Individuell

Für Workloads in der Produktion, die mehr Durchsatz, Priorität und einen kommerziellen Vertrag brauchen.

  • Rate-Limits für die Produktion
  • Bevorzugte Einplanung
  • Mengenrabatte
  • Dedizierter Support
Vertrieb kontaktieren

Preise pro Modell ansehen

FAQ

Fragen, klar beantwortet

Ist es wirklich OpenAI-kompatibel, und kann ich meinen bestehenden Code darauf richten?

Ja. Die API ersetzt die OpenAI API ohne Umbau: Ändern Sie die Base URL auf https://api.infercom.ai/v1, verwenden Sie Ihren Infercom-API-Key, und der Rest Ihres Codes bleibt, wie er ist. Wir sind außerdem mit Anthropic kompatibel, das Anthropic SDK funktioniert also auch. Beispiele im direkten Vergleich finden Sie auf der Seite zur API-Kompatibilität.

Wie halte ich meine Daten in der EU?

Nutzen Sie die EU-souveränen Modelle. Sie laufen auf unserer Hardware in unserem Rechenzentrum in München, und Ihre Daten bleiben unter EU-Jurisdiktion. Außerdem speichern wir nichts dauerhaft: Prompts und Antworten landen nicht auf einem Datenträger, wir trainieren nicht mit Ihren Daten und liefern keine zwischengespeicherten Antworten aus. Die Modelle des Global-Katalogs werden außerhalb der EU verarbeitet. Für DSGVO-sensible Workloads wählen Sie deshalb EU-souveräne Modelle. Mehr dazu im Trust Center.

Sind die Modelle quantisiert?

Nein. Heute betreiben wir jedes Modell in der Genauigkeit, in der sein Herausgeber es veröffentlicht hat, ohne es zu quantisieren.

Können wir uns privat anbinden, ohne das öffentliche Internet?

Heute nicht: Die API wird über HTTPS im öffentlichen Internet erreicht. Wenn eine private Verbindung eine Voraussetzung ist, sprechen Sie mit uns über Ihr Netzwerk.

Wie schnell ist es wirklich?

Gemessen auf unserer Produktions-API: 428 tok/s mit MiniMax M2.7 und 713 tok/s mit gpt-oss-120b (Juli 2026). Die Ausgabegeschwindigkeit pro Request bleibt erhalten, wenn viele Requests parallel laufen; die Time to First Token wächst, wenn Requests zu Spitzenzeiten warten. Jede Antwort meldet ihre Time to First Token und die Token pro Sekunde, sodass Sie das an Ihrem eigenen Workload prüfen können.

Was ist der Unterschied zwischen den Stufen Developer und Enterprise?

Developer ist Self-Service mit Abrechnung nach Nutzung und Standard-Rate-Limits, ideal zum Entwickeln und für den Weg in die Produktion. Enterprise ergänzt Produktions-Rate-Limits, bevorzugte Einplanung, Mengenrabatte und dedizierten Support gegen eine monatliche Mindestabnahme. Sie können mit Developer starten und wechseln, wenn Ihre Nutzung wächst.

Warum ist Modell X noch nicht verfügbar, und wie schnell können Sie es hinzufügen?

Jedes Modell wird für die Dataflow-Hardware optimiert, statt es unverändert zu laden. Ein neuer Checkpoint einer Architektur, die wir bereits betreiben, kann in Stunden bis Tagen live gehen, eine neue Version einer unterstützten Modellfamilie in Tagen bis Wochen. Eine grundlegend neue Architektur braucht Wochen an Engineering. Nennen Sie uns das Modell, das Sie brauchen, und Sie bekommen eine ehrliche Antwort zum Zeitplan. Ist es ein Fine-Tune eines Modells, das wir schon unterstützen, geht es schnell.

Kann ich die Kosten kontrollieren und Überraschungen auf der Rechnung vermeiden?

Ja. Sie zahlen per Pay-as-you-go zu veröffentlichten Listenpreisen pro Token. Die Kosten sind dadurch planbar und leicht zu kalkulieren. Sie zahlen nur für die Token, die Sie nutzen, in der Stufe Developer ohne Mindestumsatz und ohne Bindung. Ihren Verbrauch sehen Sie jederzeit live in der Konsole unter cloud.infercom.ai.

Gibt es für die API ein Uptime-SLA?

Die geteilte API bietet Verfügbarkeit nach dem Best-Effort-Prinzip, ohne vertragliches SLA. Sie ist zum Bauen, Integrieren und Skalieren bis in die Produktion gedacht. Wenn Sie ein garantiertes SLA, reservierten Durchsatz und keine Konkurrenz durch andere Nutzer brauchen, bietet Ihnen genau das Dedicated Capacity.

Was passiert unter hoher Last, und können meine Requests zurückgestellt werden?

Auf der geteilten Infrastruktur werden höhere Tarife bevorzugt eingeplant. Unter Spitzenlast kann ein Request eines niedrigeren Tarifs also hinter Enterprise-Traffic warten. Im normalen Betrieb werden Requests in eine Warteschlange gestellt statt abgelehnt, und die Ausgabegeschwindigkeit eines laufenden Requests bleibt unverändert; nur die Time to First Token wächst, solange er wartet. Bei extremer Überlast kann die Warteschlange Requests ablehnen. Für Kapazität, die kein anderer Kunde berührt, gibt es Dedicated Capacity.

Gibt es Prompt Caching?

Ja, bei MiniMax M2.7. Wiederholter Kontext kommt aus einem Cache im Speicher der Chips, sodass lange Prompts schneller starten; nichts wird auf einen Datenträger geschrieben. Zwischengespeicherte Token werden vorerst zum normalen Input-Preis abgerechnet.

Wie schneidet das im Vergleich zum Selbstbetrieb von Open-Source-Modellen auf GPUs ab?

Für latenzkritische Aufgaben wie Agents, Chat, Voice und Coding liefert die Dataflow-Architektur bis zu 10x mehr Geschwindigkeit, ohne dass Sie einen Cluster tunen müssen. Für reine Offline-Batch-Erzeugung, bei der die Latenz keine Rolle spielt, können GPUs günstiger sein, und das sagen wir Ihnen auch. Viele Teams arbeiten hybrid: Infercom für nutzernahe Inferenz, GPUs für Hintergrundjobs.

Brauchen Sie mehr Kontrolle?

Dieselbe Plattform, dieselbe Performance, mit mehr Isolation, wenn Sie sie brauchen.

Dedicated Capacity

Dieselbe API auf Single-Tenant-Hardware, die für Sie reserviert ist, monatlich abgerechnet, mit garantiertem Durchsatz und eigenen Modellen.

Mehr erfahren: Dedicated Capacity

On-Premises

Ihr Rechenzentrum, Ihre Hardware: die größtmögliche Isolation, mit einer Air-Gapped-Option für die strengsten Anforderungen.

Mehr erfahren: On-Premises

Bereit, die Zukunft der KI in Europa zu gestalten?

Schließen Sie sich Unternehmen an, die souveräne KI mit erstklassiger Performance einsetzen