ZEHN X. Edition 002 · Private AI Server
Audit ab 4.900
Edition 002 Pre-Release · technisch verifiziert

PRIVATE AI SERVER


Eigene Modellinfrastruktur, kontrolliert betrieben. Am Ende betreiben Sie eine reproduzierbare private Modellplattform: gehärtete CPU-Kontrollebene, authentifiziertes Gateway, deterministisches Routing und GPU on demand, die nachweisbar wieder ausgeht.

Preview Reader öffnen Stand der Edition

Das Problem

KI-Infrastruktur ohne Kontrolle

Daten außer Haus

Sensible Workloads laufen über fremde APIs, und niemand kann sauber erklären, welche Daten die eigene Trust Boundary wann verlassen. Self-Hosting allein löst das nicht, unkontrolliert ist es nur ein anderes Risiko.

Kosten ohne Wächter

GPU-Instanzen und Volumes laufen versehentlich weiter, weil „Job fertig" nicht „Abrechnung beendet" heißt. Ohne harten TTL und Billing-Nullstand als Kriterium zahlt man für Leerlauf.

Routing als Blackbox

Welche Anfrage welches Modell bekommt, entscheidet irgendwo ein Prompt. Kontrolliert heißt: eine deterministische Policy entscheidet, das LLM nie, und jede Route ist erklärbar.

Das Ergebnis

Was am Ende konkret läuft

System
Linux-LTS-Kontrollebene, Reverse Proxy mit TLS, OpenAI-kompatibles AI-Gateway als einziger Inferenz-Eingang
Routing
Deterministischer Router vor jedem Modell: Auth → Datenklasse → erlaubte Anbieter → Kostenlimit; keine Policy-Entscheidung im LLM, Ausfall heißt kontrollierte Ablehnung
Privatsphäre
Prompts erscheinen nicht in Standardlogs, nur als SHA-256; Redaction liegt vor dem Export, real getestet
GPU
On demand mit hartem terminate-after, Idle-Reaper und Budget; ein Lauf gilt erst bei nachgewiesenen $0.000/hr als beendet
Betrieb
8 Runbooks von Bootstrap über Härtung und Provenienz bis Incident Response und Exit, mit Abbruchkriterien und Evidenzpflicht
Verständnis
Sie können erklären, welche Daten die Trust Boundary verlassen, warum eine Anfrage ein Modell erhält und wie das System sicher degradiert

Architektur

Kontrollebene und Datenebene

PRIVATE TRUST BOUNDARY Clientnur HTTPS Reverse ProxyTLS · Identität AI Gateway deterministischer Router Policy · Quoten · Audit GPU-Worker privatvLLM · TTL · Cost-Guard lokales ModellCPU-Fallback definiert Ablehnungstatt stiller Weitergabe Observabilityredigiert · SHA-256

Externe APIs sind ausschließlich opt-in pro Datenklasse; kein Diagramm-Ende weicht stillschweigend auf ein öffentliches Modell aus.

Kostenlos auf YouTube

Die Reihe zur Edition

10 Folgen zu dieser Edition, jede unter fünf Minuten. Sie zeigen denselben Weg, den die Edition dokumentiert, mit je einem kontrollierten Bauschritt und einem sichtbaren Beweis.

Seitenvorschau

Sehen Sie hinein, bevor Sie kaufen

Echte Seiten aus der Edition, reduziert und mit Wasserzeichen. Was frei sichtbar ist, zeigt die tatsächliche Substanz; gesperrte Abschnitte nennen ihren Inhalt, ohne ihn preiszugeben.

Vorschau: Titelseite
Titelseite
Vorschau: Der Weg durch die Edition
Der Weg durch die Edition
Vorschau: Lieferumfang und Referenzprofile
Lieferumfang und Referenzprofile
Vorschau: Auszug aus dem Hauptteil
Auszug aus dem Hauptteil
Vorschau: Referenz-Testbericht
Referenz-Testbericht
Vorschau: Runbook · Installation
Runbook · Installation

Zum Vergrößern anklicken. Den vollständigen Durchlauf mit allen freien Abschnitten zeigt der Preview Reader weiter unten.

Preview Reader

Der vollständige Preview Reader

Frei sichtbare Seiten zeigen echte Substanz. Gesperrte Abschnitte zeigen, was sie enthalten, nicht ihren Inhalt. Reduzierte, gewasserzeichnete Seitenbilder ohne Textebene.

Lieferumfang

30 registrierte Artefakte

Publikation
Edition als personalisiertes PDF und Markdown
Referenzcode
Gateway-Referenzstack mit deterministischem Mock-Modell, optionalem vLLM-Profil und Vertragstest
Routing
Maschinenlesbare Modell-Presets mit Eskalations- und Fallback-Logik
Prompts + Skills
7 Prompts und 14 Skills mit Grenzen und Missbrauchstests
Kostenwächter
GPU-Cost-Guard als verbindliche Betriebsregel mit Abschluss-Checkliste
Kosten
Ausführbarer TCO-Rechner mit fünf Szenarien und Sensitivität
Betrieb
8 Runbooks: Bootstrap, Härtung, Provenienz, Serving/Routing, GPU-Lifecycle, Observability, Backup/Rollback, Incident/Exit
Nachweis
Artefaktmanifest mit Prüfsummen und Kontrollebenen-Testbericht

Technischer Prüfstand

Real ausgeführt, nicht behauptet

# Kontrollebene, frisches Compose-Projekt · zuletzt reproduziert 09.08.2026 · ohne GPU $ sh tests/contract.sh PASS health private-route no-prompt-log invalid-key # unabhängig gegengeprüft Prompt im Server-Log → 0 Treffer (nur SHA-256) restricted-Route → bleibt privat, "external": false falscher API-Key → HTTP 401 vLLM-/GPU-Container → nicht entstanden (Profil blieb inaktiv) # GPU/vLLM-Abnahme · RTX 4090 · 09.08.2026 Qwen3-4B über vLLM v0.10.2 → 93,6 tok/s · p95 0,83 s (40 Requests, 0 Fehler) Gateway gegen echtes Modell → private Route, Prompt nur als SHA-256 Terminate-to-zero → $0.000/hr nachgewiesen · Gesamtkosten 0,47 $

Kontrollebene und echtes GPU-Serving sind beide nachgewiesen: erst der kostenfreie Vertragstest, dann die GPU/vLLM-Abnahme mit hartem Kostenwächter bis zum Billing-Nullstand. Offene Rest-Gates (Provenienz-Signierung, Restore-Test, Referenzserver) stehen ehrlich im Testbericht.

Zielprofile

Studio, Team, Organisation

Studio

1-5 Nutzer, sporadische Jobs. Ein CPU-Server, GPU nur bei Bedarf. Abnahmeschwerpunkt: Abschaltung, Kostenlimit, einfache Recovery.

Team

5-50 Nutzer, planbare Spitzen. Getrennte Stages, Queue, warmes GPU-Fenster. Schwerpunkt: Identitäten, Quoten, Latenz, Betriebsübergabe.

Organisation

Mehrere Teams und Datenklassen. Redundante Kontrollebene, isolierte Worker-Pools. Schwerpunkt: Mandantentrennung, Audit, DR, Kapazität.

Ein Profilwechsel erweitert die Kontrollebene; API-Vertrag, Observability und Abnahmetests bleiben kompatibel.

Voraussetzungen und Betriebskosten

Ehrliche Zahlen statt Pauschalen

Das brauchen Sie

Können
Linux-Administration, Docker, Netzwerk-Grundlagen. Jeder Baustein wird im Primer erklärt.
Lernphase
Lokaler Rechner mit Docker; erste private Inferenz gegen die Kontrollebene kostenfrei, ganz ohne GPU
Betrieb
Linux-LTS-Server als Kontrollebene, GPU on demand nur bei Bedarf und mit Budget

Beispielrechnung „Studio" (aus dem beiliegenden Rechner)

GPU on demand
30 € · 40 Std. à 0,75 €, hart terminiert
Fix monatlich
65 € · CPU-Server, Backup, Storage
Menschlich
360 € · 4 Std. Betrieb à 90 €, bewusst ausgewiesen
Einrichtung
266,67 €/Monat · 3.200 € auf 12 Monate umgelegt
Gesamt
721,67 €/Monat · 144,33 € je 1.000 Requests

Beispielwerte des mitgelieferten Rechners; Preise werden vor jedem Release datiert und mit Primärquellen belegt.

Lizenz und Updates

Kaufen, besitzen, produktiv nutzen

Lizenz
Personalisierte Einzelnutzer-Lizenz mit Lizenz-ID im Dokument; Team-Lizenz mit benannten Nutzern verfügbar
Nutzung
Wissen, Prompts und Referenzcode dürfen produktiv im eigenen Unternehmen eingesetzt werden
Weitergabe
Nicht übertragbar, kein Re-Publishing; Wasserzeichen und Manifest-Hash je Release
Updates
Korrekturupdates derselben Version inklusive
Format
Personalisierter digitaler Download: PDF, Markdown, Code, Prompts, Runbooks, Tests

Edition 002 · Private AI Server

Derzeit nicht kaufbar

Der Referenzstack, die acht Runbooks, der Testkatalog und die Rechtstexte sind fertig und gegen einen frisch aufgesetzten Clean-room bewiesen. Was fehlt, ist Handbuch-Manuskript, Diagramme, Prompts und Skills. Solange das Handbuch nicht vollständig ist, wird die Edition nicht verkauft.

Die vollständige Videoreihe zu dieser Edition ist unabhängig davon kostenlos auf YouTube und hält nichts zurück.

Preview Reader ansehen Benachrichtigt werden

Stand 10. August 2026. Der Fortschritt steht im Testbericht der Edition.

Implementierung

Nicht selbst bauen?

ZEHN X implementiert den PRIVATE AI SERVER für Ihr Unternehmen: Profilwahl, Härtung, Routing-Policy, GPU-Betrieb mit Kostenwächter und Übergabe mit Abnahmetests.

Gespräch anfragen