18.09.26
Ein Kundenservice-Assistent läuft seit einem halben Jahr zuverlässig. Niemand im Unternehmen hat etwas verändert, weder am Programmcode noch an den Anweisungen für das Modell. Trotzdem häufen sich die Beschwerden. Die Antworten sind nicht falsch, aber sie treffen den Ton nicht mehr, lassen Details aus und verweisen gelegentlich auf Regelungen, die es so nicht gibt. Der Grund liegt nicht im Betrieb, sondern beim Anbieter, der das zugrundeliegende Modell im Hintergrund aktualisiert hat.
Aufgefallen ist die Verschlechterung erst über die Beschwerden. Gemessen hat sie niemand.
In der klassischen Softwareentwicklung wäre das schwer vorstellbar. Dort gibt es Testsuiten, die bei jeder Änderung durchlaufen und Alarm schlagen, bevor ein Fehler den Kunden erreicht. Bei KI-Anwendungen fehlt dieses Sicherheitsnetz in den meisten Betrieben noch vollständig. Genau diese Lücke schließt das, was man als semi-automatische Evaluation beschreiben kann und was in der Fachliteratur meist unter hybrider Evaluation oder Human-in-the-Loop-Evaluation läuft.