Private KI
Offene Modelle auf eigener Hardware, damit die Daten im Haus bleiben
- Offene Modelle auf eigener Hardware, im eigenen Serverraum oder bei einem deutschen Betreiber.
- Audit, Hardware, Modellauswahl und Stack aus einer Hand.
- Am Ende betreiben Ihre Leute das System selbst.
Frontier-KI von OpenAI oder Anthropic heißt, dass alles, was Ihre Mitarbeiter eintippen, auf dem Weg zur Antwort das Haus verlässt. Bei Verträgen, Personalakten, Kundendaten oder manchmal selbst Quellcode ist das oft nicht gewünscht. Ich betreibe offene Modelle auf eigener Hardware und richte Ihnen dasselbe ein: Audit, Hardware, Modelle, Software, bis Ihre Mitarbeiter es selbst betreiben können.
01 — Warum im eigenen Haus
Zuerst die Souveränität. Aber auch Kosten können eine Rolle spielen.
Die Daten bleiben in Ihrem Netz, die Datenschutzfrage betrifft damit den eigenen Serverraum oder vertrauenswürdige deutsche Betreiber. Niemand ändert Ihnen von heute auf morgen die Bedingungen, und niemand stellt das Modell ab, um das Sie einen Prozess gebaut haben. Die Abos pro Arbeitsplatz sind günstig, solange die Anbieter kein Geld verdienen müssen. Dass das so bleibt, würde ich nicht voraussetzen.
Was ich nicht behaupte: dass es am ersten Tag billiger ist. Eine leistungsfähige Maschine für lokale KI ist teuer, und ob sie sich rechnet, hängt daran, wie intensiv sie genutzt wird. Dafür ist das Audit da.
02 — Das Audit
Bevor Sie Hardware kaufen.
Wir gehen die Aufgaben durch, die Sie an KI abgeben wollen, und sortieren sie: was ein lokales Modell gut erledigt, wofür sich ein großes Cloud-Modell lohnt und was gar keine KI braucht, sondern eine gute Suche. Sie bekommen eine schriftliche Empfehlung: welche Maschine dafür reicht und welche Arbeit sie Ihnen abnimmt. Und wenn Mieten für Ihre Größenordnung die bessere Wahl ist, steht das genauso darin.
03 — Die Hardware
Aus der Arbeitslast dimensioniert.
Das Modell bestimmt den Speicherbedarf, hier fallen die wesentlichen Kosten an. Ich spezifiziere die Hardware, sage Ihnen, was sie kostet, und begleite die Beschaffung. Ob sie auf dem Schreibtisch, im eigenen Serverraum oder in einem gemieteten deutschen Rechenzentrum steht, ist vor allem die Frage, wer sich um Strom, Kühlung und physischen Zugang kümmert.
04 — Die Modelle
Für Ihr Material ausgewählt.
Gemma, Qwen und GLM unterscheiden sich in der Praxis stärker, als ihre Benchmark-Werte vermuten lassen. Besonders bei der deutschen Sprache und bei Dokumenten im Stil Ihrer Organisation. Ich teste die Kandidaten an Ihrem eigenen Material und zeige Ihnen, wo es holpert. Sie bekommen eine engere Auswahl mit Zahlen dahinter und einen Test, den Sie in einem halben Jahr wiederholen können, wenn das nächste Modell erscheint.
05 — Der Stack
Was aus einem Modell ein benutzbares Werkzeug macht.
Der größte Teil der Arbeit ist nicht das Modell: der Inference-Server, die Oberfläche für Ihre Kollegen, der Zugriff auf die eigenen Dokumente, Benutzerkonten, die Agenten für wiederkehrende Aufgaben und die Integration in das, was Sie ohnehin betreiben. Durchgehend etablierte Open Source, Protokollierung und Zugriffsrechte von Anfang an, damit Ihr Team übernehmen kann.
06 — Übergabe
Ein laufendes System, das Ihre Mitarbeiter bedienen können.
Fertig heißt: Es läuft, der Aufbau ist dokumentiert, und die verantwortliche Person weiß, wie man ein Modell aktualisiert und was zu tun ist, wenn eine Karte ausfällt. Wenn ich danach ein Auge darauf behalten soll, sprechen Sie mich an.