KI & Compute – Sprachmodelle produktiv servieren

LLM Inferenz: Tokens serviert, Kosten im Griff

Selbst gehostete Sprachmodell-Endpoints mit planbarer Latenz und planbaren Kosten – als Alternative zu Token-Preisen fremder APIs.

Warum centron

Inferenz als eigene Infrastruktur

Ab einem gewissen Volumen schlägt eigene Inferenz jede Token-API – bei Kosten, Latenz und Datenschutz.

Dedizierte Inferenz-GPUs

vLLM oder TGI serviert Ihre Modelle auf RTX A4000 oder RTX 6000 Ada – ohne Nachbarn, mit konstanter Latenz.

Kosten pro Stunde statt Token

Ab 92,59 €/Monat : Bei hohem Volumen rechnet sich das schnell gegen Token-Preise.

Kein Prompt verlässt das Haus

Kundendaten in Prompts bleiben auf Ihrer deutschen Infrastruktur – der DSGVO-Sorgenpunkt vieler KI-Projekte entfällt.

Skaliert mit der Nutzung

Mehrere Inferenz-Replikas hinter einem Load Balancer in Kubernetes wachsen mit den Anfragen.

API-kompatibel

Ihr eigener OpenAI-kompatibler Endpoint

vLLM und Co. sprechen das OpenAI-API-Format – bestehende Anwendungen wechseln per Endpoint-URL auf Ihre eigene Inferenz. Modelle liegen in S3, Deployments verwaltet Kubernetes, Advanced Monitoring wacht über Latenz und Auslastung.

ab 92,59 €/Monat (stundengenau abgerechnet)eigene Inferenz statt Token-Abrechnung
Kosten im Preisrechner kalkulieren
  • OpenAI-kompatibel – Drop-in per Endpoint-Wechsel
  • Konstante Latenz – dedizierte GPUs
  • Modell-Registry – Gewichte versioniert in S3
  • Beobachtbar – Metriken & Alarme inklusive
Empfohlene Bausteine

Die passenden centron Produkte

Mit diesen Bausteinen setzen Kunden diesen Anwendungsfall typischerweise um – kombinierbar und jederzeit erweiterbar.

Cloud GPU
Ab
92,59 € / Monat
NVIDIA-Leistung
  • RTX A4000 ab 92,59 €/Monat
  • Quadro RTX 6000 ab 170,83 € · A100 ab 489,47 € · RTX 6000 Ada ab 858,19 €/Monat
  • Dediziert, nicht geteilt
  • Ohne Mindestlaufzeit
Kubernetes
Ab
29,99 € / Monat
Container-Orchestrierung
  • AutoScaler inklusive
  • Traffic im Fixpreis
  • CI/CD-ready
Advanced Monitoring
Ab
4,99 € / Monat
Volle Sichtbarkeit
  • Echtzeit-Metriken
  • Individuelle Alarme
  • Checks von außen
Kurz beantwortet

Was kostet LLM Inferenz bei centron?

LLM-Inferenz auf eigener GPU-Infrastruktur: Sprachmodelle performant und DSGVO-konform betreiben – NVIDIA A100 & RTX 6000 Ada ab 92,59 €/Monat. Tragender Baustein ist Cloud GPU ab 92,59 € pro Monat – stundengenau abgerechnet, ohne Mindestlaufzeit. Ergänzt wird das je nach Bedarf durch Kubernetes und Advanced Monitoring. Alle Daten bleiben in Deutschland: eigene Rechenzentren in Hallstadt bei Bamberg, ISO 27001 auf Basis IT-Grundschutz und BSI C5:2020 Typ 1 testiert. Neue Konten erhalten 200 € Startguthaben.

Bausteine und Preise
BausteinPreis
Cloud GPUab 92,59 € / Monat
Kubernetesab 29,99 € / Monat
Advanced Monitoringab 4,99 € / Monat
KI & Compute FAQ

Häufige Fragen

Ab wann lohnt sich eigene Inferenz gegenüber API-Anbietern?

Als Faustregel: sobald Ihre Token-Rechnung dauerhaft die Kosten einer passenden GPU-Instanz übersteigt oder Datenschutz externe APIs ausschließt. Eine RTX A4000 ab 92,59 €/Monat serviert quantisierte Modelle bereits produktiv – rechnen Sie Ihr Volumen im Preisrechner nach.

Was kostet der Einstieg?

Der Start ist bewusst günstig: Cloud GPU ab 92,59 € pro Monat, Kubernetes ab 29,99 € pro Monat und Advanced Monitoring ab 4,99 € pro Monat. Neue Konten erhalten 200 € Startguthaben für 60 Tage – Ihre konkrete Konfiguration kalkulieren Sie transparent im Preisrechner.

Ist das DSGVO-konform umsetzbar?

Ja – das ist der zentrale Vorteil eigener Inferenz: Bei API-Diensten aus Drittländern verlassen Prompts und damit häufig personenbezogene Inhalte den EU-Raum. Läuft das Modell auf centron-GPUs, bleiben Eingaben, Kontext und Ausgaben vollständig in Deutschland und werden nicht zu Trainingszwecken weiterverwendet. Die Rechenzentren sind nach ISO 27001 auf Basis IT-Grundschutz zertifiziert, für ccloud³ / Managed Cloud besteht ein uneingeschränktes BSI C5:2020 Typ 1-Testat. Details finden Sie im Trust Center.
Weiterlesen

Mehr zu KI & Machine Learning

Jetzt kostenlos anfangen

Melden Sie sich an und erhalten Sie in den ersten 60 Tagen ein Guthaben von 200 € bei centron.

Dieses Werbeangebot gilt nur für neue Konten. Angebot ausschließlich für Gewerbetreibende.

Jetzt loslegen Sales kontaktieren