On-Premises
On-Premises-KI-Inferenz. Volle Kontrolle, Cloud-Geschwindigkeit.
Dieselben Modelle und dieselbe Geschwindigkeit wie in unserer Cloud, aber auf Hardware, die Ihnen gehört, in Ihrem eigenen Netzwerk. Ihre Daten verlassen das Gebäude nie. Die Racks sind luftgekühlt und brauchen im Betrieb etwa 10 kW, deshalb passen sie in das Rechenzentrum, das Sie bereits haben.
Volle Datenkontrolle, Cloud-Geschwindigkeit
Wenn Ihre Daten das Haus nicht verlassen dürfen
Dieselbe Plattform und dieselbe Geschwindigkeit wie in unserer Cloud, ganz innerhalb Ihrer eigenen Mauern. On-Premises ist die richtige Wahl, wenn Daten oder Quellcode Ihr Gebäude physisch nicht verlassen dürfen, wenn eine Aufsichtsbehörde oder ein Kunde es verlangt oder wenn Sie Ihre KI-Infrastruktur selbst besitzen wollen. Die Racks sind luftgekühlt, ohne Flüssigkühlung und ohne besonderen Umbau, deshalb passen sie in die Räume, die Sie schon haben. Und wenn ein Workload keine solche Anforderung hat, bieten unsere Cloud und Dedicated Capacity dieselbe Geschwindigkeit ganz ohne Investition in eigene Hardware. Wir sagen Ihnen ehrlich, was besser passt.
Die Eignung
Wann sich On-Premises lohnt
Vier Situationen, in denen die eigene Plattform die richtige Entscheidung ist, und keine Notlösung.
Daten, die das Haus nicht verlassen dürfen
Quellcode, geistiges Eigentum oder sensible Daten, die aus rechtlichen oder vertraglichen Gründen in Ihrem Perimeter bleiben müssen.
Eine Vorgabe, die erfüllt werden muss
Eine Aufsichtsbehörde, ein Kundenvertrag oder eine Branchenregel schreibt die Verarbeitung im eigenen Haus vor.
Volle Kontrolle
Sie halten alle Schlüssel und betreiben die Plattform selbst, in Ihrem eigenen Netzwerk.
Eigentum
Inferenz-Kapazität, die Ihnen gehört, statt gemietet, ohne andere Kunden auf der Hardware. Modell-Bundles und Software-Updates kommen über Ihren Vertrag mit uns.
Was Sie bekommen
Dieselbe Inferenz-Engine, in Ihrem Gebäude
Schnelle Antworten mit geringer Latenz bei jedem Request, mit derselben Geschwindigkeit wie in unserer Cloud, jetzt in Ihrem eigenen Gebäude. Weil die Chips für Inferenz entwickelt sind, laufen die Racks luftgekühlt und brauchen im typischen Betrieb etwa 10 kW. Sie brauchen keine Flüssigkühlung und keine Spezialräume. Die Racks passen in Ihr bestehendes Rechenzentrum, und Sie ergänzen weitere, wenn Sie wachsen.
Hardware
- KI-Beschleuniger von SambaNova, entwickelt für Inferenz - keine GPUs
- Aktuelle Generation: SambaRack SN40L
- Luftgekühlt, normale Rack-Maße - keine Flüssigkühlung
- Ein Core Services Rack für die Control Plane
- Auf Ihren Workload dimensioniert, erweiterbar, wenn Sie wachsen
Software und Support
- SambaStack-Plattform (auf Basis von Kubernetes)
- Die Modelle, die wir in München betreiben, + Bring Your Own Checkpoint
- Ein Vertrag mit Infercom: Dimensionierung, Installation, Konfiguration und Support, gemeinsam mit den Ingenieuren von SambaNova
- Unterstützung für Air-Gapped-Deployments
- Modell-Bundles, Software-Updates und technischer Support
Ihr Teil
Was Ihr Team bereitstellt
Die Standortanforderungen von SambaNova in Kürze. Wir gehen jeden Punkt in der Standortprüfung mit Ihnen durch.
- Platz im Rechenzentrum, Strom (400/415 V Drehstrom), Kühlung und Netzwerk
- Einen Kubernetes-Cluster: Ihren eigenen oder installiert auf dem Core Services Rack
- PostgreSQL, Logging und Monitoring (SambaNova empfiehlt Prometheus und Grafana)
- DNS, NTP, zwei URLs mit TLS-Zertifikaten und die Anmeldung über OIDC, LDAP oder Keycloak
- Regelmäßige Updates: Sie liegen höchstens ein Release zurück, damit Fehlerbehebungen Sie erreichen
- Nur bei Air-Gap: ein Staging-Server für Artefakte, eine Container-Registry und 15 TB gemeinsamer Speicher
Ein Rack in Zahlen
- Chips
- 16 RDUs
- Speicher
- 1 TB HBM, 4-24 TB DDR
- Leistung
- ca. 10 kW typisch, max. 16,4 kW
- Stromanschluss
- 400/415 V Drehstrom, 2 PDUs
- Kühlung
- Luft, von vorn nach hinten
- Control Plane
- Ein Core Services Rack
Quelle: SambaNova, Standortanforderungen für SambaStack On-Premises (März 2026). Die genauen Werte für Ihren Standort folgen in der Standortprüfung.

Der Ablauf
Vom Vertrag bis zur Produktion
- 01
Beratung und Standortprüfung
Wir prüfen Ihre Anforderungen, den Zustand Ihres Rechenzentrums und Ihren Modellbedarf und dimensionieren das Deployment.
- 02
Lieferung und Installation
Die Racks werden in Ihr Rechenzentrum geliefert und installiert, gemeinsam mit den Ingenieuren von SambaNova.
- 03
Konfiguration
Einrichtung von SambaStack, Inbetriebnahme der Modelle und Integration, auch bei Air-Gapped-Setups.
- 04
Produktion
Ihr Team betreibt die Plattform. Modell-Bundles, Updates und Support kommen über Ihren Vertrag mit uns.
In der Regel ~90 Tage vom Vertrag bis zur Produktion
Die Dauer hängt von der Verfügbarkeit der Hardware und vom Zustand Ihres Rechenzentrums ab. Ein verbindliches Datum nennen wir nach der Standortprüfung.
Modelle
Der vollständige Katalog in Ihrem Gebäude
Jedes Modell, das wir in München betreiben, läuft auch On-Premises, dazu weitere Modelle, die SambaStack unterstützt, und Ihre eigenen Fine-Tunes.
- Die Modelle, die wir in München betreiben, plus Modelle, die wir auf Anfrage in Betrieb nehmen
- BYOC - Fine-Tunes unterstützter Architekturen laufen sofort
- Modelle in der Genauigkeit, in der ihre Herausgeber sie veröffentlicht haben
- Unterstützung für Air-Gapped-Deployments
Bei Air-Gapped-Deployments werden Modell- und Software-Updates manuell geliefert und installiert. Dafür brauchen Sie eine Staging-Umgebung auf Ihrer Seite.
Powered by SambaNova
Dieselbe Dataflow-Architektur
On-Premises läuft auf derselben Dataflow-Architektur von SambaNova wie unsere Cloud: Chips, entwickelt für KI, mit bis zu 10x schnellerer Inferenz als auf GPUs, luftgekühlt in einem normalen Rack. Sie bekommen dieselbe Performance, und die Hardware gehört Ihnen.
FAQ
Klare Antworten auf Ihre Fragen
Ist die Performance On-Premises dieselbe wie in Ihrer Cloud?
Ja, es ist dieselbe Hardware, also bekommen Sie dieselbe Geschwindigkeit. On-Premises ändert Standort und Eigentum, nicht die Performance: Die Racks stehen in Ihrem Rechenzentrum, und Sie halten die Schlüssel.
Rechnet sich eigene Hardware wirklich im Vergleich zu verwalteten Token?
On-Premises ist eine Investition mit einer Vorlaufzeit. Verwaltete Token dagegen sind sofort verfügbar und brauchen keine Investition. Ob sich eigene Hardware rechnet, entscheidet sich im Einzelfall. Bei dauerhaft hoher Auslastung über mehrere Jahre kann sie sich wirtschaftlich lohnen. Das hängt aber davon ab, wie stark Sie sie auslasten, deshalb rechnen wir es mit Ihnen durch, statt es zu versprechen. Oft entscheiden gar nicht die Kosten, sondern Quellcode oder Daten, die Ihr Gebäude nicht verlassen dürfen, ein Kunde oder eine Aufsichtsbehörde, die es verlangt, oder der strategische Entschluss, die Infrastruktur selbst zu besitzen. Die Performance ist in jedem Fall dieselbe wie in unserer Cloud. Wenn es keine harte Anforderung gibt und die Rechnung knapp ist, sind die Inference API oder Dedicated Capacity meist die bessere Wahl, und das sagen wir Ihnen auch.
Können wir testen, bevor wir Hardware kaufen?
Ja, und wir empfehlen es. Belegen Sie den Nutzen zuerst auf der geteilten Inference API, die auf derselben Hardware läuft, und danach optional auf einem dedizierten Rack in unserem Rechenzentrum in München. Erst dann investieren Sie. Ein kleiner Pilot gehört in die Cloud, nicht in Ihr Rechenzentrum.
Wie groß muss ein Deployment sein?
Wir dimensionieren es nach Ihrem Workload: wie viele Nutzer, wie viele gleichzeitig und was sie ausführen (kurze Prompts, langer Kontext, Agenten). Daraus schlagen wir die Zahl der Racks vor, und Sie können später weitere ergänzen. Wenn Sie den Anwendungsfall noch erproben, starten Sie mit der Inference API oder Dedicated Capacity.
Was brauchen wir im Rechenzentrum - Fläche, Strom, Kühlung?
Ein normales Rechenzentrum mit Stromversorgung für hohe Rack-Dichte. Die Racks sind luftgekühlt (keine Flüssigkühlung), brauchen im typischen Betrieb etwa 10 kW und höchstens 16,4 kW und werden über zwei PDUs mit 400/415 V Drehstrom versorgt, in normalen Rack-Maßen. Sie passen also in ein Rechenzentrum, das Sie schon haben, und brauchen keinen Neubau. Über Platz, Strom, Kühlung und Netzwerk hinaus stellt Ihr Team die oben aufgeführten Dienste bereit. In einer Standortprüfung klären wir Strom, Kühlung, Netzwerk und Speicher, bevor etwas geliefert wird.
Wie funktioniert ein Air-Gapped-Deployment, und wie aktualisieren und diagnostizieren Sie es?
SambaStack läuft vollständig offline. Bei einem Air-Gap werden Software- und Modell-Updates manuell geliefert und installiert: Sie stellen einen Staging-Server für Artefakte, eine Container-Registry und gemeinsamen Speicher bereit und prüfen jedes Update nach Ihren eigenen Sicherheitsprozessen. Die Diagnose läuft über Dateiübertragung und Videokonferenz, denn niemand von außen hat Netzwerkzugriff auf Ihren Cluster. Das Setup ist erprobt. Ein Air-Gap tauscht aber etwas Tempo im Support gegen vollständige Isolation: Jedes Update ist ein bewusster, manueller Schritt und kein automatischer Download.
Wie lange dauert das Deployment?
Planen Sie mit etwa 90 Tagen vom Vertrag bis zur Produktion, für Lieferung, Installation, Konfiguration und die Inbetriebnahme der Modelle. Die Dauer hängt vom Bestellvolumen und der Verfügbarkeit der Hardware ab, vom Zustand Ihres Rechenzentrums und davon, ob neue Modellarchitekturen in Betrieb genommen werden müssen. Ein verbindliches Datum sagen wir erst nach einer Standortprüfung zu.
Welche Modelle können wir betreiben, und können wir eigene mitbringen?
Jedes Modell, das wir in München betreiben, läuft auch On-Premises, und SambaStack unterstützt weitere Modelle, die wir für Sie in Betrieb nehmen können. Bring Your Own Checkpoint funktioniert ebenfalls: Fine-Tunes unterstützter Architekturen laufen sofort. Das Fine-Tuning selbst läuft auf GPUs. Sie trainieren und laden die Gewichte dann auf Ihre Racks. Unterstützung für ganz neue Architekturen besprechen wir kommerziell.
Wie funktionieren Modell-Updates, wenn die Hardware bei uns steht?
Jedes SambaStack-Release bündelt neue Modelle. Sie wählen aus, welche Sie einsetzen, testen sie und legen die Verteilung selbst fest, zum Beispiel indem Sie Racks zwischen zwei Modellen verschieben. Ein Rack umzukonfigurieren (etwa von langem auf kurzen Kontext) dauert etwa 30 Minuten. Sie liegen höchstens ein Release zurück, damit Fehlerbehebungen Sie erreichen. Bei einem Air-Gap werden diese Updates manuell geliefert und installiert.
Wie geht die Plattform damit um, wenn viele Nutzer gleichzeitig zugreifen?
Mit dem Inference Router priorisieren Sie Nutzer und begrenzen ihre Rate, damit kein einzelner Nutzer den Cluster blockiert. Ist der Cluster voll ausgelastet, kommen Requests in eine Warteschlange: Die Zeit bis zum ersten Token steigt, die Ausgabegeschwindigkeit eines laufenden Requests nicht. Diese Einstellungen liegen bei Ihnen, denn Sie betreiben die Plattform.
Können wir in unserem eigenen Rechenzentrum betreiben, oder hosten Sie die Hardware?
Beides ist möglich. Wir können Ihnen die Hardware für Ihr Rechenzentrum verkaufen, sie für Sie in einer Colocation unterbringen oder Colocation as a Service anbieten, je nachdem, was zu Ihren Anforderungen an Kontrolle und Betrieb passt.
Können Sie vertraglich garantieren, dass niemand außerhalb unserer Organisation unsere Daten sehen kann?
On-Premises und mit Air-Gap halten Sie alle Schlüssel, wir haben zur Laufzeit keinen Zugriff, und nichts verlässt Ihr Netzwerk. Der KV-Cache liegt nur im Arbeitsspeicher und wird nie auf eine Festplatte geschrieben. Im Arbeitsspeicher ist er nicht verschlüsselt.
Wie selbstständig sind wir nach der Installation?
Im Alltag betreibt Ihr Team die Plattform. Modell-Bundles, Software-Updates, Fehlerbehebungen und technischer Support sind Teil Ihres Vertrags mit uns, erbracht gemeinsam mit den Ingenieuren von SambaNova, die die Plattform bis auf den Chip kennen. Wenn Sie möchten, betreiben wir sie für Sie als Managed Service.
Was passiert, wenn ein Rack ausfällt?
Bei mehreren Racks arbeiten die anderen weiter, und Sie verlieren nur den Anteil dieses Racks an der Kapazität. Die Control Plane läuft auf drei Nodes im Core Services Rack. Jedes Rack hat zwei Stromversorgungen.
Können wir in mehreren Ländern betreiben?
Ja. Jeder Standort ist ein eigenes Deployment. Für manche Länder ist vor dem Versand der Hardware eine Exportkontrollprüfung nötig. Das klären wir in der Standortprüfung.
Optionen im Vergleich
Noch unsicher, was passt?
Die meisten Teams belegen den Nutzen zuerst in der Cloud und wechseln erst zu On-Premises, wenn eine Anforderung es verlangt.
On-Premises für Ihr Unternehmen prüfen?
Sprechen wir über Ihre Anforderungen und den Zustand Ihres Rechenzentrums.