Inference API

Einfache, transparente Preise

Pay-as-you-go-Tarife für die Inference API. Keine Mindestabnahme, keine Bindung: Sie zahlen nur für die Token, die Sie nutzen.

  • Preise direkt in EUR
  • Keine Mindestabnahme, keine Bindung
  • Standardmäßig EU-souverän

Preise der Inference API

Tarife pro Token für unsere geteilte, EU-souveräne Inferenz-Plattform. Sie brauchen reservierte Kapazität oder eigene Hardware? Diese beiden Angebote bepreisen wir individuell pro Projekt.

Sie sind hier

Inference API

Geteilte Infrastruktur, Abrechnung pro Token. Sie starten in wenigen Minuten und wachsen mit Ihrem Bedarf, ohne Mindestabnahme und ohne Bindung.

  • Standardmäßig EU-souverän
  • Pay-as-you-go
  • OpenAI-kompatible API

Ab

€0,20 / 1M Token, zzgl. MwSt.

Alle Tarife ansehen

Alle drei im direkten Vergleich

So funktionieren die API-Preise

Die Inference API wird pro Token abgerechnet. Ein Token entspricht im Englischen etwa 4 Zeichen, je nach Modell und Sprache auch mehr oder weniger. Sie zahlen nur, was Sie nutzen, ohne Mindestabnahme und ohne Bindung.

Was ist ein Token?

Token sind die Grundeinheiten, die ein LLM verarbeitet. Im Englischen entspricht 1 Token etwa 4 Zeichen oder ¾ eines Wortes, 1000 Wörter sind rund 1300 Token. Andere Sprachen, auch Deutsch, brauchen für denselben Text oft mehr Token.

Input vs. Output

Input (Ihr Prompt) und Output (die Antwort des Modells) werden getrennt abgerechnet. Output kostet mehr, weil das Modell Ihren Prompt in einem einzigen parallelen Durchlauf liest. Jedes Output-Token braucht dagegen einen eigenen vollständigen Durchlauf durch das Modell, eines nach dem anderen.

Ein Modell wählen

Jedes Modell hat andere Stärken, ein einzelnes "bestes" Modell gibt es nicht. Bei EU-souveränen Modellen (🇪🇺) bleiben Ihre Daten garantiert in der europäischen Jurisdiktion.

EU

EU-souveräne Modelle

Vollständig DSGVO-konform, nicht dem US CLOUD Act ausgesetzt

EU-souveräne Modelle
ModellModalitätInput (pro 1M)Output (pro 1M)Kontext
MiniMax M2.7 UltraspeedText€0,60€2,40192K
Gemma 4 31BText + vision€0,20€0,35128K
gpt-oss-120bText€0,22€0,59128K
Whisper Large v3Speech-to-text€0,10--
E5-Mistral 7BEmbeddings€0,13-4K

Preise in EUR, zzgl. MwSt. EU-gehostete Modelle bieten vollständige Datensouveränität. Speech-to-Text und Embeddings werden nur nach Input-Token abgerechnet, weil sie Transkripte oder Vektoren liefern und keinen generierten Text.

Global

Globaler Modellkatalog

Weitere Modelle über globale Infrastruktur

Globaler Modellkatalog
ModellModalitätInput (pro 1M)Output (pro 1M)Kontext
Llama 3.3 70BText€0,60€1,20128K
DeepSeek V3.1Text€3,00€4,50128K
DeepSeek V3.2Text€3,00€4,5032K

Preise in EUR, zzgl. MwSt. Requests werden auf globaler Infrastruktur außerhalb der EU verarbeitet.

Schätzen Sie Ihre monatlichen Inferenzkosten

Wählen Sie einen typischen Workload und passen Sie die Zahlen dann an Ihren an.

Geschätzte monatliche Kosten (zzgl. MwSt.)

€324,00

Pro Request
€0,00108
Pro Tag
€10,80
Tarif (Input / Output pro 1M)
€0,60 / €2,40

EU-souverän - Daten bleiben in der EU

Nur eine Schätzung. Die Rechnung geht von etwa 30 Tagen gleichmäßiger Nutzung aus. Die tatsächliche Zahl der Token hängt von Sprache, Inhalt und Tokenizer des Modells ab (im Englischen ergeben etwa 750 Wörter rund 1000 Token). Speech-to-Text und Embeddings sind hier nicht enthalten, weil sie nur nach Input-Token abgerechnet werden. Ihre Tarife stehen in der Tabelle oben. Ihre genaue Nutzung sehen Sie jederzeit unter cloud.infercom.ai/plans/usage.

Zugangsstufen

Wählen Sie Ihren Einstieg. Ein Upgrade ist jederzeit möglich, wenn Sie wachsen.

Hier starten

Developer

Pay-as-you-go

Registrieren Sie sich, erstellen Sie einen API-Key und zahlen Sie nur für die Token, die Sie nutzen. Keine Mindestabnahme, keine Bindung.

Rate Limits ansehen

 

Enterprise

Listenpreis mit Mengenrabatten

Dieselben Tarife pro Token als Basis, dazu Rabatte für zugesagte Volumen, individuelle SLAs, Priority-Support und höhere Rate Limits.

Vertrieb kontaktieren

Häufig gestellte Fragen

Wie funktioniert die Abrechnung?

Die Inference API funktioniert nach dem Pay-as-you-go-Prinzip. Sie hinterlegen eine Kreditkarte als Zahlungsmethode, und Ihre Nutzung wird pro Token zu den veröffentlichten Listenpreisen abgerechnet. Sie zahlen also nur, was Sie nutzen, ohne Mindestabnahme und ohne monatliche Bindung. Mit den Tarifen oben lassen sich die Kosten vorab gut kalkulieren.

Kann ich meinen Token-Verbrauch und meine aktuellen Kosten einsehen?

Ja, in Echtzeit. Ihren aktuellen Token-Verbrauch finden Sie unter cloud.infercom.ai/plans/usage, Ihre Abrechnung und Ihre Rechnungen unter cloud.infercom.ai/plans/billing. So wissen Sie immer genau, was Sie verbraucht haben und was es kostet.

Welche Rate Limits gelten?

Die Rate Limits hängen von Plan und Modell ab. Für die Developer-Stufe gelten Standardwerte, die in unserer Dokumentation zu Rate Limits beschrieben sind. Enterprise-Pläne bieten individuelle Rate Limits, passend zu Ihrem Workload. Rate Limits begrenzen, wie oft Sie Requests senden können. Die Inferenzgeschwindigkeit pro Request beeinflussen sie nicht.

Welche Zahlungsmethoden akzeptieren Sie?

Für unseren Inferenz-Service akzeptieren wir gängige Kreditkarten über Stripe. Kunden mit Enterprise-Plan, Dedicated Capacity oder On-Premises können auch per Rechnung zahlen.

Was umfasst die EU-Souveränität?

Bei EU-souveränen Modellen findet die gesamte Datenverarbeitung standardmäßig in unseren europäischen Rechenzentren statt. Ihre Daten verlassen die EU-Jurisdiktion nur, wenn Sie sich ausdrücklich für Modelle aus dem Globalen Katalog entscheiden. Vollständige DSGVO-Konformität und die Bereitschaft für den AI Act sind inklusive.

Bieten Sie Mengenrabatte an?

Ja, sowohl Enterprise-Verträge als auch Verträge für Dedicated Capacity haben individuelle Preise, die sich nach Ihrer zugesagten Nutzung richten. Sprechen Sie mit unserem Vertriebsteam über Ihre Anforderungen.

Bereit, die Zukunft der KI in Europa zu gestalten?

Schließen Sie sich Unternehmen an, die souveräne KI mit erstklassiger Performance einsetzen