Ein Agent arbeitet, während ich schlafe
Öffentliche KI hat einen Gebührenzähler. Jede Anfrage summiert sich, ein langer Agentenlauf am Abend knabbert an dem Kontingent, das ich morgen für die eigentliche Arbeit brauche. Lokale KI nicht.
Diesen Unterschied habe ich neulich bewusst genutzt. Vor dem Schlafengehen habe ich meinem Inferenz-Server den Job gegeben, den ich abends nicht mehr schaffen würde: die fehlenden CRUD-Endpoints meiner aktuellen App, inklusive der Tests, die hätten dabei sein müssen. Ein Feld löschen soll es auch wirklich auf null setzen, eine Organisation muss samt ihrer Standorte und Termine verschwinden, und nichts davon war abgedeckt. Dann bin ich schlafen gegangen.
Nach dem Aufwachen
Ein Branch mit Commits, die Endpunkte auf dem Server implementiert, die Tests angehängt in jede betroffene Testdatei. Eine Aufgabenliste, die bei eins von fünf anfing und leer endete. Auf llama.cpp mit Qwen 3.8 27B.
Spannend finde ich den Preis. Die Kiste zieht unter Last rund 650 Watt. Acht Stunden davon sind etwa fünf Kilowattstunden, das sind bei meinem Tarif circa 1,50 Euro für eine Nacht Arbeit. Kein Tokenzähler, kein Rate-Limit, kein „wöchentliches Limit erreicht" mitten im Refactoring. Ich kann etwas starten, das in einer Stunde fertig wird, und etwas, das drei Tage läuft.
Nachteile
Ein fertiger Branch heißt nicht: fertig. Ich lese den Diff morgens, denn ein Agent, der acht Stunden ungestört war, hatte acht Stunden Zeit, überzeugend falsch zu liegen. Langsames Review ist sozusagen der Strafzoll unbeaufsichtigter Arbeit.
Vorgestern bin ich mit einer Lösung für ein Problem aufgewacht, das ich schlecht beschrieben hatte. Das Modell war äußerst gründlich in der falschen Richtung. Das hat mich eine Nacht gekostet.
Lokal auf meinem Notebook ist das Modell unerträglich langsam, wenn ich in Echtzeit warte. Wenn ich aber einfach ins Bett gehe, dann ist's erträglich!
Offene Fragen
Die Frage für Nutzer eingeschränkter Hardware ist nicht mehr: „Ist ein offenes Modell gut genug für die Aufgabe?" Die Frage veraltet monatlich. Hilfreicher ist: Kann diese Aufgabe bis morgens warten?
Viele echte Aufgaben können das. Migrationen, Testabdeckung, Dependency-Updates, Dokumentation, Log-Analysen, der Longtail an Tickets, die niemand im Kopf behalten will. Diese Aufgaben brauchen Geduld, kein Tempo.