Warum kein KI-System von selbst fertig wird und wer diese Entscheidung künftig trifft
Ein Programmierer wartet auf grüne Tests. Ein Autor schliesst zur Abgabefrist. Ein Handwerker sieht, dass die Wand gerade ist, und hört auf.
In keinem dieser Fälle steckt das Fertig in der Arbeit. Es kommt von aussen, aus einem Test, einer Frist, einem Blick, einer Abnahme. Wir merken das nie, weil wir in Systemen leben, die uns diese Signale liefern, seit wir arbeiten.
Ein Sprachmodell hat keines davon. Es wird nicht müde, es wird nicht unzufrieden, und es kann immer noch eine Fassung erzeugen. Es merkt auch nicht, dass die letzten drei Überarbeitungen das Ergebnis anders gemacht haben, aber nicht besser.
Wir behandeln KI-Systeme wie technische Systeme, die wie früher deterministisch arbeiten. Wir haben uns noch nicht daran gewöhnt, dass sie mit Wahrscheinlichkeiten rechnen, und dass damit ein Teil unserer alten Annahmen nicht mehr greift, allen voran die selbstverständlichste: dass ein Vorgang irgendwann von selbst zu Ende ist.
Vier Bedingungen, und eine fehlt fast immer
Damit eine solche Schleife überhaupt zu einem Ende kommt, braucht sie vier Bedingungen, und diese sind unspektakulär. 1. Einen Zielzustand, also eine Beschreibung dessen, was fertig heisst. 2. Einen beobachtbaren Ist-Zustand, damit sich der Abstand messen lässt. 3. Einen präzisen Eingriff, damit man eine Stelle ändern kann statt alles neu zu erzeugen. Und 4. Eine Abbruchregel.
Die ersten drei baut jeder, der so etwas ernsthaft in Betrieb nimmt. Die vierte fehlt fast immer, und zwar aus einem Grund, der bekannt vorkommen dürfte: sie gehört niemandem. Zielzustand ist Fachbereich, Ist-Zustand ist Monitoring, Eingriff ist Entwicklung. Aufhören ist keine Disziplin.
Dazu kommt eine Kurve, die niemand sehen will. Die Erträge zusätzlicher Versuche sind logarithmisch. In einem Vergleichstest stieg die Erfolgsquote von einem auf zehn Versuche von 38,8 auf 43,2 Prozent. Die Verdopplung auf zwanzig brachte 0,2 Punkte für doppelte Kosten. Jenseits dieses Plateaus wird die nächste Runde nicht nur nutzlos, sondern schädlich, weil Modelle mit grösserem Budget anfangen, bereits richtige Antworten wieder zu verwerfen.
Wer nicht fragt, kann nicht gestoppt werden
Nun könnte man meinen, das Problem sei mit einem Stopp-Knopf erledigt. Ist es nicht, und der Grund ist so banal, dass er in der Diskussion über künstliche Intelligenz fast nie auftaucht.
Ein Abbruch erreicht einen laufenden Vorgang nur, wenn dieser Vorgang von sich aus regelmässig meldet, dass er noch lebt. Kein Lebenszeichen, keine Zustellung. Das ist keine Meinung, das steht wörtlich in der Dokumentation einer Ablaufsteuerung, die es lange vor dem heutigen KI-Betrieb gab: Vorgänge, die nicht pingen, können keine Abbruchmeldung empfangen.
Kontrolle ist damit nicht nur eine Frage der Befugnis, sondern zuerst eine Frage der Erreichbarkeit. Und nachträglich lässt sich das nicht einrichten. Entweder ist es beim Set-up vorgesehen, oder man hat einen Vorgang, den man zwar ansehen, aber nicht anhalten kann. Wer Systeme dieser Art einkauft oder baut, sollte nach genau zwei Dingen fragen: wie oft meldet sich der Lauf, und was ist die harte Grenze, eine Obergrenze an Durchläufen, oder allgemeiner ein Kostendeckel, bei deren Erreichen er von selbst endet.
67 Prozent für nichts
Wie das ohne diese Grenze aussieht, hat jemand nachgerechnet, und die Zahlen sind unangenehm konkret.
Eine bewusst kaputte Webseite sollte von einem Agenten verbessert werden. Die ersten 1,40 Dollar hoben die Bewertung von 26 auf 89. Danach war das Ziel technisch unerreichbar, weil eine künstliche Verzögerung eingebaut war, die den Wert bei etwa 89 deckelt. Die restlichen 2,84 Dollar, entsprechend 67 Prozent der Rechnung, brachten exakt null Punkte.
Das Modell hat das übrigens gemerkt. Bei Versuch fünf stellte es fest, dass die Vorgabe nicht erreichbar ist, und sagte es. Der prüfende zweite Agent schickte es vierzehn Mal zurück.
Zwei Maschinen stritten also darüber, ob man aufgeben darf, im Minutentakt abgerechnet, und keine von beiden hatte die Befugnis, das zu entscheiden. Aufgefallen ist es niemandem, bis hinterher jemand das Protokoll gelesen hat.
Der Lauf endete nicht, weil er fertig war. Er endete, weil das Budget aufgebraucht war.
Beobachtung ist keine Kontrolle
An dieser Stelle wird aus einer technischen Frage eine, die jeder Eigentümer kennt.
Ein Plattformprojekt läuft im achtzehnten Monat. Das Berichtswesen ist vorbildlich: monatlicher Lenkungsausschuss, Ampeln, Meilensteine, Abweichungen sauber ausgewiesen. Seit dem neunten Monat steht die Ampel auf Gelb, und jeder im Raum weiss, was das heisst. Gestoppt hat trotzdem niemand. Der Projektleiter hat einen Lieferauftrag, kein Abbruchmandat. Der Finanzchef hat ein Budget, und das ist bewilligt. Der Beirat tagt quartalsweise und bekommt jedes Mal denselben Bericht, aus dem hervorgeht, dass alles bekannt ist. Beendet wird ein solches Projekt am Ende durch den Rahmen, nicht durch eine Entscheidung.
Das Berichtswesen funktioniert dabei tadellos. Es bewirkt nur nichts, weil Sichtbarkeit und Befugnis zwei verschiedene Dinge sind und in den meisten Organisationen bei verschiedenen Leuten liegen. Ein Gremium mit perfektem Berichtswesen und ohne Eingriffsrecht ist Dekoration.
Der Unterschied zum Agenten ist dabei nicht schmeichelhaft. Ein Lauf, der sein Lebenszeichen nicht sendet, tut das wegen eines Konstruktionsfehlers. Ein Projektleiter tut es nicht aus Versehen. Es gibt eine ganze Literatur, die die versunkenen Kosten ausführlich dokumentiert, und sie beschreibt im Kern dasselbe Problem: der Abbruch kostet denjenigen am meisten, der ihn aussprechen müsste.
Die Rolle, die es nicht gibt
Ein deterministisches Verfahren hört auf, weil es fertig ist. KI-Systeme rechnen mit Wahrscheinlichkeiten, und eine Wahrscheinlichkeit kennt kein Fertig. Sie kennt nur eine Schwelle, und diese Schwelle muss jemand gesetzt haben.
Genau das ist die Rolle, die in keinem Organigramm steht. Wer festlegt, wann gut genug erreicht ist, entscheidet über den Ressourceneinsatz, über die Qualität und im Zweifel über die Haftung, und in den meisten Häusern tut das gerade niemand bewusst. Die Schwelle entsteht als Nebenprodukt einer Konfiguration, die jemand in der IT gesetzt hat, oder sie kommt voreingestellt vom Anbieter.
Das ist derselbe Vorgang, mit dem sich Unternehmen für ihre Agenten lesbar gemacht haben, nur eine Stufe weiter. Erst wurde festgelegt, was existiert. Dann, welcher Unterschied noch zählt. Jetzt, wann es genug ist.
Die Frage, die sich Eigentümer stellen sollten, ist deshalb nicht, was diese Systeme kosten. Die Frage ist, wer festlegt, wann ein Agent aufhören darf, und ob das in ihrem Unternehmen je jemand getan hat.