Inference API
Einfache, transparente Preise
Pay-as-you-go-Tarife für die Inference API. Keine Mindestabnahme, keine Bindung: Sie zahlen nur für die Token, die Sie nutzen.
- Preise direkt in EUR
- Keine Mindestabnahme, keine Bindung
- Standardmäßig EU-souverän
Preise der Inference API
Tarife pro Token für unsere geteilte, EU-souveräne Inferenz-Plattform. Sie brauchen reservierte Kapazität oder eigene Hardware? Diese beiden Angebote bepreisen wir individuell pro Projekt.
Sie sind hier
Inference API
Geteilte Infrastruktur, Abrechnung pro Token. Sie starten in wenigen Minuten und wachsen mit Ihrem Bedarf, ohne Mindestabnahme und ohne Bindung.
- Standardmäßig EU-souverän
- Pay-as-you-go
- OpenAI-kompatible API
So funktionieren die API-Preise
Die Inference API wird pro Token abgerechnet. Ein Token entspricht im Englischen etwa 4 Zeichen, je nach Modell und Sprache auch mehr oder weniger. Sie zahlen nur, was Sie nutzen, ohne Mindestabnahme und ohne Bindung.
Was ist ein Token?
Token sind die Grundeinheiten, die ein LLM verarbeitet. Im Englischen entspricht 1 Token etwa 4 Zeichen oder ¾ eines Wortes, 1000 Wörter sind rund 1300 Token. Andere Sprachen, auch Deutsch, brauchen für denselben Text oft mehr Token.
Input vs. Output
Input (Ihr Prompt) und Output (die Antwort des Modells) werden getrennt abgerechnet. Output kostet mehr, weil das Modell Ihren Prompt in einem einzigen parallelen Durchlauf liest. Jedes Output-Token braucht dagegen einen eigenen vollständigen Durchlauf durch das Modell, eines nach dem anderen.
Ein Modell wählen
Jedes Modell hat andere Stärken, ein einzelnes "bestes" Modell gibt es nicht. Bei EU-souveränen Modellen (🇪🇺) bleiben Ihre Daten garantiert in der europäischen Jurisdiktion.
EU
EU-souveräne Modelle
Vollständig DSGVO-konform, nicht dem US CLOUD Act ausgesetzt
| Modell | Modalität | Input (pro 1M) | Output (pro 1M) | Kontext |
|---|---|---|---|---|
| MiniMax M2.7 Ultraspeed | Text | €0,60 | €2,40 | 192K |
| Gemma 4 31B | Text + vision | €0,20 | €0,35 | 128K |
| gpt-oss-120b | Text | €0,22 | €0,59 | 128K |
| Whisper Large v3 | Speech-to-text | €0,10 | - | - |
| E5-Mistral 7B | Embeddings | €0,13 | - | 4K |
Preise in EUR, zzgl. MwSt. EU-gehostete Modelle bieten vollständige Datensouveränität. Speech-to-Text und Embeddings werden nur nach Input-Token abgerechnet, weil sie Transkripte oder Vektoren liefern und keinen generierten Text.
Global
Globaler Modellkatalog
Weitere Modelle über globale Infrastruktur
| Modell | Modalität | Input (pro 1M) | Output (pro 1M) | Kontext |
|---|---|---|---|---|
| Llama 3.3 70B | Text | €0,60 | €1,20 | 128K |
| DeepSeek V3.1 | Text | €3,00 | €4,50 | 128K |
| DeepSeek V3.2 | Text | €3,00 | €4,50 | 32K |
Preise in EUR, zzgl. MwSt. Requests werden auf globaler Infrastruktur außerhalb der EU verarbeitet.
Schätzen Sie Ihre monatlichen Inferenzkosten
Wählen Sie einen typischen Workload und passen Sie die Zahlen dann an Ihren an.
Geschätzte monatliche Kosten (zzgl. MwSt.)
€324,00
- Pro Request
- €0,00108
- Pro Tag
- €10,80
- Tarif (Input / Output pro 1M)
- €0,60 / €2,40
EU-souverän - Daten bleiben in der EU
Nur eine Schätzung. Die Rechnung geht von etwa 30 Tagen gleichmäßiger Nutzung aus. Die tatsächliche Zahl der Token hängt von Sprache, Inhalt und Tokenizer des Modells ab (im Englischen ergeben etwa 750 Wörter rund 1000 Token). Speech-to-Text und Embeddings sind hier nicht enthalten, weil sie nur nach Input-Token abgerechnet werden. Ihre Tarife stehen in der Tabelle oben. Ihre genaue Nutzung sehen Sie jederzeit unter cloud.infercom.ai/plans/usage.
Zugangsstufen
Wählen Sie Ihren Einstieg. Ein Upgrade ist jederzeit möglich, wenn Sie wachsen.
Hier starten
Developer
Pay-as-you-go
Registrieren Sie sich, erstellen Sie einen API-Key und zahlen Sie nur für die Token, die Sie nutzen. Keine Mindestabnahme, keine Bindung.
Enterprise
Listenpreis mit Mengenrabatten
Dieselben Tarife pro Token als Basis, dazu Rabatte für zugesagte Volumen, individuelle SLAs, Priority-Support und höhere Rate Limits.
Häufig gestellte Fragen
Wie funktioniert die Abrechnung?
Die Inference API funktioniert nach dem Pay-as-you-go-Prinzip. Sie hinterlegen eine Kreditkarte als Zahlungsmethode, und Ihre Nutzung wird pro Token zu den veröffentlichten Listenpreisen abgerechnet. Sie zahlen also nur, was Sie nutzen, ohne Mindestabnahme und ohne monatliche Bindung. Mit den Tarifen oben lassen sich die Kosten vorab gut kalkulieren.
Kann ich meinen Token-Verbrauch und meine aktuellen Kosten einsehen?
Ja, in Echtzeit. Ihren aktuellen Token-Verbrauch finden Sie unter cloud.infercom.ai/plans/usage, Ihre Abrechnung und Ihre Rechnungen unter cloud.infercom.ai/plans/billing. So wissen Sie immer genau, was Sie verbraucht haben und was es kostet.
Welche Rate Limits gelten?
Die Rate Limits hängen von Plan und Modell ab. Für die Developer-Stufe gelten Standardwerte, die in unserer Dokumentation zu Rate Limits beschrieben sind. Enterprise-Pläne bieten individuelle Rate Limits, passend zu Ihrem Workload. Rate Limits begrenzen, wie oft Sie Requests senden können. Die Inferenzgeschwindigkeit pro Request beeinflussen sie nicht.
Welche Zahlungsmethoden akzeptieren Sie?
Für unseren Inferenz-Service akzeptieren wir gängige Kreditkarten über Stripe. Kunden mit Enterprise-Plan, Dedicated Capacity oder On-Premises können auch per Rechnung zahlen.
Was umfasst die EU-Souveränität?
Bei EU-souveränen Modellen findet die gesamte Datenverarbeitung standardmäßig in unseren europäischen Rechenzentren statt. Ihre Daten verlassen die EU-Jurisdiktion nur, wenn Sie sich ausdrücklich für Modelle aus dem Globalen Katalog entscheiden. Vollständige DSGVO-Konformität und die Bereitschaft für den AI Act sind inklusive.
Bieten Sie Mengenrabatte an?
Ja, sowohl Enterprise-Verträge als auch Verträge für Dedicated Capacity haben individuelle Preise, die sich nach Ihrer zugesagten Nutzung richten. Sprechen Sie mit unserem Vertriebsteam über Ihre Anforderungen.