Ist es wirklich OpenAI-kompatibel, und kann ich meinen bestehenden Code darauf richten?
Ja. Die API ersetzt die OpenAI API ohne Umbau: Ändern Sie die Base URL auf https://api.infercom.ai/v1, verwenden Sie Ihren Infercom-API-Key, und der Rest Ihres Codes bleibt, wie er ist. Wir sind außerdem mit Anthropic kompatibel, das Anthropic SDK funktioniert also auch. Beispiele im direkten Vergleich finden Sie auf der Seite zur API-Kompatibilität.
Wie halte ich meine Daten in der EU?
Nutzen Sie die EU-souveränen Modelle. Sie laufen auf unserer Hardware in unserem Rechenzentrum in München, und Ihre Daten bleiben unter EU-Jurisdiktion. Außerdem speichern wir nichts dauerhaft: Prompts und Antworten landen nicht auf einem Datenträger, wir trainieren nicht mit Ihren Daten und liefern keine zwischengespeicherten Antworten aus. Die Modelle des Global-Katalogs werden außerhalb der EU verarbeitet. Für DSGVO-sensible Workloads wählen Sie deshalb EU-souveräne Modelle. Mehr dazu im Trust Center.
Sind die Modelle quantisiert?
Nein. Heute betreiben wir jedes Modell in der Genauigkeit, in der sein Herausgeber es veröffentlicht hat, ohne es zu quantisieren.
Können wir uns privat anbinden, ohne das öffentliche Internet?
Heute nicht: Die API wird über HTTPS im öffentlichen Internet erreicht. Wenn eine private Verbindung eine Voraussetzung ist, sprechen Sie mit uns über Ihr Netzwerk.
Wie schnell ist es wirklich?
Gemessen auf unserer Produktions-API: 428 tok/s mit MiniMax M2.7 und 713 tok/s mit gpt-oss-120b (Juli 2026). Die Ausgabegeschwindigkeit pro Request bleibt erhalten, wenn viele Requests parallel laufen; die Time to First Token wächst, wenn Requests zu Spitzenzeiten warten. Jede Antwort meldet ihre Time to First Token und die Token pro Sekunde, sodass Sie das an Ihrem eigenen Workload prüfen können.
Was ist der Unterschied zwischen den Stufen Developer und Enterprise?
Developer ist Self-Service mit Abrechnung nach Nutzung und Standard-Rate-Limits, ideal zum Entwickeln und für den Weg in die Produktion. Enterprise ergänzt Produktions-Rate-Limits, bevorzugte Einplanung, Mengenrabatte und dedizierten Support gegen eine monatliche Mindestabnahme. Sie können mit Developer starten und wechseln, wenn Ihre Nutzung wächst.
Warum ist Modell X noch nicht verfügbar, und wie schnell können Sie es hinzufügen?
Jedes Modell wird für die Dataflow-Hardware optimiert, statt es unverändert zu laden. Ein neuer Checkpoint einer Architektur, die wir bereits betreiben, kann in Stunden bis Tagen live gehen, eine neue Version einer unterstützten Modellfamilie in Tagen bis Wochen. Eine grundlegend neue Architektur braucht Wochen an Engineering. Nennen Sie uns das Modell, das Sie brauchen, und Sie bekommen eine ehrliche Antwort zum Zeitplan. Ist es ein Fine-Tune eines Modells, das wir schon unterstützen, geht es schnell.
Kann ich die Kosten kontrollieren und Überraschungen auf der Rechnung vermeiden?
Ja. Sie zahlen per Pay-as-you-go zu veröffentlichten Listenpreisen pro Token. Die Kosten sind dadurch planbar und leicht zu kalkulieren. Sie zahlen nur für die Token, die Sie nutzen, in der Stufe Developer ohne Mindestumsatz und ohne Bindung. Ihren Verbrauch sehen Sie jederzeit live in der Konsole unter cloud.infercom.ai.
Gibt es für die API ein Uptime-SLA?
Die geteilte API bietet Verfügbarkeit nach dem Best-Effort-Prinzip, ohne vertragliches SLA. Sie ist zum Bauen, Integrieren und Skalieren bis in die Produktion gedacht. Wenn Sie ein garantiertes SLA, reservierten Durchsatz und keine Konkurrenz durch andere Nutzer brauchen, bietet Ihnen genau das Dedicated Capacity.
Was passiert unter hoher Last, und können meine Requests zurückgestellt werden?
Auf der geteilten Infrastruktur werden höhere Tarife bevorzugt eingeplant. Unter Spitzenlast kann ein Request eines niedrigeren Tarifs also hinter Enterprise-Traffic warten. Im normalen Betrieb werden Requests in eine Warteschlange gestellt statt abgelehnt, und die Ausgabegeschwindigkeit eines laufenden Requests bleibt unverändert; nur die Time to First Token wächst, solange er wartet. Bei extremer Überlast kann die Warteschlange Requests ablehnen. Für Kapazität, die kein anderer Kunde berührt, gibt es Dedicated Capacity.
Gibt es Prompt Caching?
Ja, bei MiniMax M2.7. Wiederholter Kontext kommt aus einem Cache im Speicher der Chips, sodass lange Prompts schneller starten; nichts wird auf einen Datenträger geschrieben. Zwischengespeicherte Token werden vorerst zum normalen Input-Preis abgerechnet.
Wie schneidet das im Vergleich zum Selbstbetrieb von Open-Source-Modellen auf GPUs ab?
Für latenzkritische Aufgaben wie Agents, Chat, Voice und Coding liefert die Dataflow-Architektur bis zu 10x mehr Geschwindigkeit, ohne dass Sie einen Cluster tunen müssen. Für reine Offline-Batch-Erzeugung, bei der die Latenz keine Rolle spielt, können GPUs günstiger sein, und das sagen wir Ihnen auch. Viele Teams arbeiten hybrid: Infercom für nutzernahe Inferenz, GPUs für Hintergrundjobs.