Dedicated Capacity
Garantierte Performance, mit den Modellen Ihrer Wahl
Single-Tenant-Hardware für KI-Inferenz, exklusiv für Sie reserviert in unserem Rechenzentrum in München und vollständig von uns betrieben. Keine anderen Kunden, die um Durchsatz konkurrieren, planbare monatliche Kosten und Ihr eigener Modell-Mix, auch mit Modellen außerhalb des öffentlichen Katalogs.
Dieselbe Plattform, mehr Kontrolle
Dieselbe souveräne Plattform, nur für Sie reserviert
Dedicated Capacity bietet dieselbe OpenAI-kompatible API, dieselbe EU-Souveränität und dieselben Modelle wie unsere geteilte Inference API, aber auf Single-Tenant-Hardware, die niemand sonst nutzt. Sie bekommen garantierten Durchsatz ohne Konkurrenz zu planbaren monatlichen Kosten und können Ihre eigene Auswahl an Modellen betreiben, auch Modelle außerhalb des öffentlichen Katalogs.
Die Eignung
Wann sich Dedicated Capacity lohnt
Sie lohnt sich, sobald Ihr Workload hoch, gleichmäßig und kritisch für die Produktion ist. Darunter ist die geteilte API meist das bessere Angebot, und das sagen wir Ihnen auch.
Hohes, gleichmäßiges Volumen
Dauerhafter Traffic in der Produktion, der regelmäßig über das hinausgeht, was die geteilten Tarife wirtschaftlich abdecken.
Garantierte SLAs
Vertragliche Zusagen zu Verfügbarkeit und Antwortzeit, ohne Konkurrenz durch andere Kunden.
Eigene Modelle
Betreiben Sie eigene Fine-Tuned-Checkpoints (BYOC) oder mehrere Modelle auf einem Rack, mit Wechsel in Millisekunden.
Isolation
Single-Tenant-Hardware für Compliance, planbare Performance oder mehr Sicherheit.
Was Sie bekommen
Eine Inferenz-Engine für die Produktion, von uns betrieben
Ihre eigene KI-Inferenz mit hohem Durchsatz für Modelle im Produktionsmaßstab, auf souveräner Single-Tenant-Infrastruktur. Infercom baut sie auf, betreibt sie und hält sie am Laufen, damit sich Ihr Team auf die Entwicklung konzentrieren kann und nicht auf den Betrieb.
Infrastruktur
- Single-Tenant-Hardware, für Sie reserviert - ein Rack oder viele
- Vollständig von Infercom betrieben und gewartet
- Garantierter Durchsatz - keine lauten Nachbarn
- Individuelle Rate Limits oder gar keine
- Modelle in der Genauigkeit, in der ihre Herausgeber sie veröffentlicht haben
- In unserem Rechenzentrum in München, ohne dauerhafte Speicherung Ihrer Daten
Support und SLAs
- Eigenes Account-Team
- Priority-Support mit direkter Eskalation
- Individuelle SLAs (Verfügbarkeit, Antwortzeit)
- Dimensionierung nach Ihrem realen Workload
- Betrieb nach ISO 27001 zertifiziert
- Deployment in der Regel innerhalb von ~2 Wochen
Modelle
Betreiben Sie die Modelle, die Sie brauchen
Ein dediziertes Rack kann Modelle außerhalb des öffentlichen API-Katalogs betreiben, auch solche, die wir eigens für Sie in Betrieb nehmen. Dazu kommen Ihre eigenen Fine-Tuned-Checkpoints über Bring Your Own Checkpoint.
- Der vollständige öffentliche Katalog
- Modelle außerhalb des öffentlichen Katalogs, auf Anfrage
- BYOC - Fine-Tunes unterstützter Architekturen laufen sofort
- Bis zu ~700B Parameter auf einem einzigen Rack
Fine-Tunes unterstützter Architekturen laufen sofort. Ganz neue Architekturen besprechen wir kommerziell. Ein bestimmtes eigenes Modell sagen wir erst zu, wenn wir geprüft haben, dass es läuft.
Verfügbar auf Ihrem Rack
- Der vollständige Infercom-KatalogJedes Modell, das Sie über die API aufrufen können
- Plus Modelle auf AnfrageAußerhalb des öffentlichen Katalogs
- Ihre eigenen CheckpointsFine-Tunes unterstützter Architekturen (BYOC)
- Genauigkeit wie veröffentlichtHeute keine Quantisierung
Das Fine-Tuning selbst läuft auf GPUs: Sie trainieren und übergeben uns die Gewichte, die wir mit voller Geschwindigkeit bereitstellen.
Ein Rack, viele Modelle
Checkpoints in Millisekunden wechseln
Jeder Chip hat drei Speicherstufen: SRAM auf dem Chip für die laufende Berechnung, HBM im selben Package für die Gewichte des aktiven Modells und eine große DDR-Stufe für weitere Modelle und Checkpoints. Weil der Chip seinen DDR-Speicher direkt anspricht, hält ein dediziertes Rack mehrere Modelle und Fine-Tuned-Checkpoints bereit und wechselt in Millisekunden zwischen ihnen. Ein GPU-Cluster braucht dafür Sekunden bis Minuten.
So kann ein einziges Rack eine ganze agentische Pipeline bedienen, etwa ein Planer-Modell, einen Executor und einen spezialisierten Fine-Tune, und bei jedem Schritt wechseln, ohne für jedes Modell eigene Infrastruktur aufzubauen.
Wie viele Modelle gleichzeitig auf ein Rack passen, hängt von ihrer Größe ab. Wir dimensionieren das Rack passend zu Ihrem Mix.
Wechselzeit für Checkpoints
Vergleich
Dedicated Capacity vs. Inference API
| Inference API | Dedicated Capacity | |
|---|---|---|
| Infrastruktur | Geteilt (Multi-Tenant) | Reserviert (Single-Tenant) |
| Abrechnung | Pro Token | Monatliche Pauschale |
| Rate Limits | Je nach Stufe | Individuell oder keine |
| Konkurrenz um Kapazität | Geteilte Warteschlange unter Last | Keine - alles gehört Ihnen |
| Eigene Modelle (BYOC) | Nur Katalog | Katalog plus Ihre Checkpoints |
| Support | Je nach Stufe | Eigenes Team |
| SLAs | Best Effort | Individuell, garantiert |
FAQ
Klare Antworten auf Ihre Fragen
Ist die Performance mit Dedicated Capacity dieselbe wie mit der geteilten API?
Ja, es ist dieselbe Hardware mit derselben Geschwindigkeit. Der Unterschied: Die Kapazität ist nur für Sie reserviert. Es gibt keine anderen Kunden, keine geteilte Warteschlange und keine Konkurrenz. Ihr Durchsatz bleibt gleichmäßig, weil niemand sonst Ihr Rack nutzt.
Wann lohnt sich Dedicated Capacity im Vergleich zur Abrechnung pro Token?
Zwei Dinge entscheiden, und nur eines davon sind die Kosten. Wirtschaftlich lohnt sich Dedicated Capacity ab dauerhaft hoher Auslastung, also sobald Ihr gleichmäßiges Volumen regelmäßig über das hinausgeht, was die geteilten Tarife abdecken. Wo genau diese Grenze liegt, hängt von Ihrem Modell und Ihrem Traffic ab. Darunter ist Pay-as-you-go über die Inference API meist das bessere Angebot. Der zweite Grund hat mit der Last nichts zu tun: Wenn Sie Ihren eigenen Modell-Mix oder Ihre eigenen Fine-Tuned-Checkpoints (BYOC) auf Hardware betreiben wollen, die nur für Sie reserviert ist, geht das mit Dedicated Capacity, bei jedem Volumen. Sie ist auch die Antwort, wenn Sie garantierte Kapazität und SLAs brauchen oder die Rate Limits der geteilten Tarife überschreiten. Ist Ihr Workload schwankend oder noch im Test und brauchen Sie diese Kontrolle nicht, raten wir Ihnen, bei der Abrechnung nach Verbrauch zu bleiben.
Kann ich mein eigenes Fine-Tuned-Modell betreiben?
Ja, wenn es ein Fine-Tune einer Architektur ist, die wir bereits unterstützen. Dann läuft es sofort. Sie führen das Fine-Tuning auf GPUs durch und übergeben uns die Gewichte, und wir stellen sie auf Ihrem Rack bereit. Eine ganz neue Architektur braucht Entwicklungsaufwand, den wir kommerziell besprechen. Nennen Sie uns das Modell, an das Sie denken, und wir bestätigen, dass es läuft.
Können Sie das Fine-Tuning für uns übernehmen?
Nein, Fine-Tuning und Training laufen auf GPUs, nicht auf dieser Architektur, die für Inferenz gebaut ist. Sie oder Ihr ML-Partner führen das Fine-Tuning auf GPUs durch, und wir hosten den fertigen Checkpoint und stellen ihn mit voller Geschwindigkeit bereit. Wir sagen das offen, damit die Erwartungen von Anfang an stimmen.
Wie schnell wechseln Sie zwischen Modellen oder Checkpoints?
In Millisekunden, gegenüber Sekunden bis Minuten auf GPUs. Wartende Checkpoints liegen in der großen DDR-Stufe des Chips, die der Chip direkt anspricht. Deshalb kann ein Rack mehrere Fine-Tuned-Checkpoints vorhalten und bei jedem Request zwischen ihnen wechseln, sogar mit verschiedenen Modellen in verschiedenen Schritten eines agentischen Ablaufs.
Welche Modelle kann ich betreiben, und wie groß dürfen sie sein?
Jedes Modell aus dem Katalog, dazu unterstützte eigene Checkpoints. Auf einem Rack laufen Modelle bis etwa 700B Parameter gut. Ein Modell der 670B-Klasse passt bequem, und MiniMax M2.7 Ultraspeed liegt genau im idealen Bereich. Modelle über etwa 1T Parameter passen heute nicht auf ein einzelnes Rack.
Wie viele Racks brauche ich?
Wir dimensionieren nach Ihrem Workload: Zahl der Nutzer, maximale Parallelität, Art des Workloads (interaktiv, agentisch, Batch) und Durchsatzziele, zurückgerechnet aus der gemessenen Parallelität. Wir dimensionieren lieber passend, als Ihnen Kapazität zu verkaufen, die Sie nicht auslasten.
Kann ich testen, bevor ich mich festlege?
Ja, und wir empfehlen es. Belegen Sie den Nutzen zuerst auf der geteilten Inference API (sie ist technisch identisch). Danach können wir vor der Unterschrift einen zeitlich begrenzten Test vereinbaren. Ein dediziertes Rack ist eine echte Verpflichtung. Sie sollte auf einen belegten Nutzen folgen, nicht ihm vorausgehen.
Wie lange dauert das Deployment?
Ein dediziertes Rack ist in der Regel in etwa zwei Wochen einsatzbereit. (On-Premises-Hardware in Ihrem eigenen Rechenzentrum dauert länger - siehe die Seite zu On-Premises.)
Worin unterscheidet sich Dedicated Capacity von On-Premises?
In Standort und Eigentum. Bei Dedicated Capacity gehört die Hardware Infercom, steht in unserem Rechenzentrum in München und ist exklusiv für Sie reserviert: Wir betreiben sie, Sie nutzen sie. Bei On-Premises gehört die Hardware Ihnen, steht in Ihrem eigenen Rechenzentrum, und Sie betreiben sie selbst. Die Performance ist identisch. Der Unterschied ist, wer die Schlüssel hält.
Welchen Durchsatz bekomme ich wirklich, jenseits der Benchmark-Zahl?
Der reale Durchsatz hängt von Ihrer Kontextlänge und vom Verhältnis zwischen Input und Output ab. Die bekannten Werte in Token pro Sekunde sind Spitzenwerte bei günstigen Workloads. Traffic mit langem Kontext und viel Output läuft langsamer. Wir nennen den Durchsatz für Ihren tatsächlichen Workload, nicht für einen einzelnen Best-Case-Benchmark. Nur so lässt sich ein Rack ehrlich dimensionieren.
Was kostet es?
Dedicated Capacity kostet eine monatliche Pauschale pro reserviertem Rack, mit Rabatten für längere Laufzeiten. Die richtige Konfiguration hängt von Ihren Modellen, Ihrem Durchsatz und der Vertragslaufzeit ab. Deshalb legen wir den Preis individuell pro Projekt fest, statt ihn zu veröffentlichen. Sprechen Sie mit uns, und wir nennen Ihnen schnell konkrete Zahlen.
Muss ich mich langfristig binden?
Nein. Längere Laufzeiten bringen bessere Konditionen, aber die Modelllandschaft ändert sich schnell, und Sie wollen nicht am Setup vom letzten Jahr festhängen. Wir bieten auch kürzere Laufzeiten. Nennen Sie uns Ihre Risikobereitschaft, und wir finden eine passende Struktur.
Kann ich die Kapazität weiterverkaufen oder Workloads meiner eigenen Kunden darauf betreiben?
Ja, es ist Ihre reservierte Kapazität, ähnlich wie ein gemieteter eigener Server. Sie können darauf jedes Geschäftsmodell aufbauen, auch Dienste für Ihre eigenen Kunden. Systemintegratoren und Agenturen tun genau das. Sprechen Sie mit uns, und wir richten es passend zu Ihrem Vertriebsmodell ein.
Sie brauchen volles Eigentum?
Prüfen Sie ein On-Premises-Deployment
Wenn die Hardware aufgrund einer Anforderung in Ihrem eigenen Gebäude stehen muss, etwa für Air-Gapped-Umgebungen oder für Daten, die Ihr Netzwerk nicht verlassen dürfen, bietet On-Premises die höchste Stufe der Isolation.
Ein dediziertes Rack dimensionieren?
Nennen Sie uns Ihren Workload, und wir legen schnell konkrete Zahlen vor.