Der Ersteller ist nie der Prüfer
Der schwierigste unserer zwölf Artikel. Er kostet Zeit, Geld und Bequemlichkeit — und es gibt eine Studie, die ihn unumgehbar macht.
Von allen Regeln, die wir uns gegeben haben, ist diese die unbequemste. Sie verdoppelt Arbeitsschritte, sie kostet zusätzliche Modellaufrufe, und sie fühlt sich in neun von zehn Fällen überflüssig an, weil das Ergebnis ja offensichtlich in Ordnung ist.
Sie lautet: Kein Werkstück verlässt einen Prozess ohne Prüfung durch eine andere Instanz. Nie prüft jemand seine eigene Arbeit.
Die Studie, die keine Wahl lässt
Ich hätte diese Regel wahrscheinlich weicher formuliert, wenn ich eine bestimmte Arbeit nicht gelesen hätte.
Panickssery, Bowman und Feng haben 2024 auf der NeurIPS untersucht, wie Sprachmodelle fremde und eigene Texte bewerten. Das Ergebnis in einem Satz: Modelle erkennen ihre eigenen Ausgaben wieder und bewerten sie besser — auch wenn sie objektiv schlechter sind. Die beiden Fähigkeiten hängen zusammen: Je zuverlässiger ein Modell den eigenen Text identifiziert, desto stärker bevorzugt es ihn.
Das Tückische daran ist, dass es nicht wie ein Fehler aussieht. Ein Modell, das seine eigene Arbeit prüft, liefert keine leere Antwort und keinen Absturz. Es liefert eine sorgfältig begründete, gut formulierte, überzeugende Freigabe. Genau die Art von Antwort, die man nicht hinterfragt.
Wer diesen Effekt nicht kennt, baut ein Prüfsystem, das nichts prüft — und merkt es nicht, weil es die ganze Zeit „bestanden" sagt.
Was das im Alltag heißt
Bei uns bedeutet der Artikel drei Dinge.
Der Prüfer ist eine andere Rolle. Wer eine Oberfläche baut, gibt sie nicht selbst frei. Wer eine Architektur entwirft, nimmt sie nicht selbst ab. Der Kollege, der bei uns die Qualitätssicherung verantwortet, ist deshalb nicht ein netter Zusatz, sondern der wichtigste Kollege im Bauteam — vor ihm war der einzige Prüfer ein Mensch, und der ist der Engpass.
Idealerweise ist es sogar ein anderes Modell. Wenn der self-preference bias daran hängt, dass ein Modell den eigenen Stil wiedererkennt, dann ist ein Prüfer auf anderer technischer Grundlage sauberer als ein Prüfer mit anderer Rolle auf derselben. Das ist bei uns als Ziel formuliert und noch nicht überall umgesetzt.
Nichts geht nach außen ohne einen Menschen. Kein Text, kein Angebot, kein Produktivsystem. Das ist die letzte Prüfinstanz und die einzige, die nicht wegoptimiert werden darf.
Wo wir die Regel selbst gebrochen haben
Und jetzt der Teil, der in solche Texte selten hineingeschrieben wird.
Es gibt in dieser Firma Phasen, in denen dieselbe Instanz baut und anschließend prüft, weil der zuständige Prüfer noch nicht aktiv war oder gerade nicht arbeiten konnte. Wir haben das getan, es hat funktionierbar ausgesehen, und ich halte es trotzdem für einen Kompromiss und nicht für eine Lösung.
Der Grund ist genau der aus der Studie: Man kann die Rolle wechseln, aber nicht das Wissen um die eigene Absicht. Wer weiß, was er bauen wollte, prüft unweigerlich, ob es das geworden ist — und nicht, ob es richtig ist. Das sind zwei verschiedene Fragen, und nur die zweite hilft.
Was dagegen hilft, ist eine Prüfliste, die vorher feststand. Wenn nicht gegen die eigene Absicht geprüft wird, sondern gegen eine geschriebene Definition dessen, was „fertig" bedeutet, dann findet auch ein befangener Prüfer echte Mängel. Wir haben diese Liste als maschinenlesbares Dokument abgelegt, damit sie sich nicht stillschweigend an das anpasst, was gerade gebaut wurde.
Das ist ein Notbehelf, kein Ersatz. Sobald an einem Ergebnis ein Kunde hängt, ist ein zweiter Prüfer nicht verhandelbar.
Warum das teurer und trotzdem billiger ist
Der Einwand gegen diese Regel ist immer derselbe: Sie kostet. Ein zweiter Durchgang bedeutet zusätzliche Zeit und zusätzliches Geld, bei jedem einzelnen Vorgang.
Die Gegenrechnung ist die Erfahrung aus jeder Softwarefirma, in der ich je gearbeitet habe: Ein Fehler, den ein Prüfer findet, kostet Minuten. Derselbe Fehler in Produktion kostet einen Tag. Beim Kunden kostet er die Beziehung.
Es gibt dazu eine öffentlich dokumentierte Geschichte, die ich für die lehrreichste in diesem ganzen Feld halte. Klarna hat 2024 seinen Kundenservice in großem Umfang auf KI umgestellt — 2,3 Millionen Chats im Monat, Bearbeitungszeit von elf Minuten auf unter zwei. Die Zahlen waren spektakulär. Ein Jahr später hat der Vorstandsvorsitzende öffentlich eingeräumt, dass der Kostenfokus zu dominant war und die Qualität gelitten hat; Kunden können seitdem wieder immer einen Menschen erreichen.
Der Fehler war nicht die Technik. Der Fehler war die Kennzahl. Wer nur Kosten misst, optimiert Kosten — und merkt zu spät, dass er dabei etwas anderes verloren hat.
Deshalb steht bei uns Qualität in der Bewertung vor Kosten, und deshalb gibt es eine Prüfinstanz, die man nicht wegdiskutieren kann. Nicht weil wir großzügig sind, sondern weil wir die Rechnung von hinten kennen.