Selbst gehostete Sprachmodell-Endpoints mit planbarer Latenz und planbaren Kosten – als Alternative zu Token-Preisen fremder APIs.
Ab einem gewissen Volumen schlägt eigene Inferenz jede Token-API – bei Kosten, Latenz und Datenschutz.
vLLM oder TGI serviert Ihre Modelle auf RTX A4000 oder RTX 6000 Ada – ohne Nachbarn, mit konstanter Latenz.
Ab 92,59 €/Monat : Bei hohem Volumen rechnet sich das schnell gegen Token-Preise.
Kundendaten in Prompts bleiben auf Ihrer deutschen Infrastruktur – der DSGVO-Sorgenpunkt vieler KI-Projekte entfällt.
Mehrere Inferenz-Replikas hinter einem Load Balancer in Kubernetes wachsen mit den Anfragen.
vLLM und Co. sprechen das OpenAI-API-Format – bestehende Anwendungen wechseln per Endpoint-URL auf Ihre eigene Inferenz. Modelle liegen in S3, Deployments verwaltet Kubernetes, Advanced Monitoring wacht über Latenz und Auslastung.
Mit diesen Bausteinen setzen Kunden diesen Anwendungsfall typischerweise um – kombinierbar und jederzeit erweiterbar.
LLM-Inferenz auf eigener GPU-Infrastruktur: Sprachmodelle performant und DSGVO-konform betreiben – NVIDIA A100 & RTX 6000 Ada ab 92,59 €/Monat. Tragender Baustein ist Cloud GPU ab 92,59 € pro Monat – stundengenau abgerechnet, ohne Mindestlaufzeit. Ergänzt wird das je nach Bedarf durch Kubernetes und Advanced Monitoring. Alle Daten bleiben in Deutschland: eigene Rechenzentren in Hallstadt bei Bamberg, ISO 27001 auf Basis IT-Grundschutz und BSI C5:2020 Typ 1 testiert. Neue Konten erhalten 200 € Startguthaben.
| Baustein | Preis |
|---|---|
| Cloud GPU | ab 92,59 € / Monat |
| Kubernetes | ab 29,99 € / Monat |
| Advanced Monitoring | ab 4,99 € / Monat |
Melden Sie sich an und erhalten Sie in den ersten 60 Tagen ein Guthaben von 200 € bei centron.
Dieses Werbeangebot gilt nur für neue Konten. Angebot ausschließlich für Gewerbetreibende.