AIGHTSHIFT

Wo wir stehen

Nach fünfzehn Teilen eine ehrliche Zwischenbilanz: was steht, was nicht, was ich noch nicht weiß — und woran diese Sache scheitern wird, falls sie scheitert.

Hier mache ich einen Schnitt. Nicht weil das Projekt zu Ende wäre, sondern weil der Rückblick auf den Anfang aufgeholt hat: Ab jetzt schreibe ich über das, was gerade passiert, und nicht mehr über das, was mich hierher gebracht hat.

Also eine Zwischenbilanz.

Was steht

Es gibt eine Firma mit einer Verfassung, einem Organigramm, Prozessen und einer Belegschaft, von der ein Teil aktiv ist und der Rest als ausgearbeitete Stellenbeschreibung wartet. Aktiviert wird einzeln, bei benanntem Bedarf, nie auf Vorrat.

Es gibt eine Plattform, auf der man sieht, wer arbeitet, woran, was es kostet, welche Aufgaben offen sind und wie die Abläufe aussehen. Jeder Vorgang hat eine Nummer, eine Zeitleiste und einen dokumentierten Weg von einem Kollegen zum nächsten. Es gibt keine Kommunikation zwischen Kollegen, die nicht nachvollziehbar irgendwo steht — das war eine der härtesten Anforderungen an mich selbst, und sie hat sich gelohnt.

Es gibt Abläufe für die wiederkehrenden Dinge: wie ein neuer Kollege eingestellt und eingearbeitet wird, wie ein Ergebnis geprüft wird, wie eine Kundenanfrage zu einem Projekt wird, und — der Ablauf, auf den ich am meisten stolz bin — wie ein fehlender Ablauf gemeldet wird. Wenn ein Kollege auf eine Situation stößt, für die es keinen Prozess gibt, hält er an und meldet die Lücke, statt sich etwas auszudenken.

Und es gibt einen Ruhemodus. Die Belegschaft schläft, bis es einen zahlenden Kunden gibt.

Was nicht steht

Der wichtigste Satz dieser Serie: Wir haben die These noch nicht bewiesen.

Alles, was ich in vierzehn Teilen beschrieben habe, ist die Konstruktion. Die These aus Teil 1 — dass man KI-Agenten wie echte Kollegen organisieren kann, mit Rollen, Prüfung und Gedächtnis, und dass genau das den Unterschied macht zwischen einem Werkzeug, das nach vier Monaten vergessen ist, und etwas, das trägt — ist unbewiesen. Sie ist plausibel, sie ist durchgerechnet, und sie ist nicht belegt.

Ebenfalls offen: Der Modellwechsel unter Last ist vorbereitet, aber nie durchgeführt. Der Ausfalldrill steht aus. Die wöchentlichen Feedbackgespräche laufen, aber die Berichte sind noch dünn, weil die Gedächtnisse jung sind und sich niemand ernsthaft an „letzte Woche" erinnert. Und der Teil unserer Belegschaft, der bauen sollte, kann es nicht selbst (Teil 14).

Woran das scheitern wird, falls es scheitert

Ich habe versucht, mir das ehrlich zu beantworten, und komme auf drei Kandidaten.

Erstens: Die Qualität reicht nicht. Die nüchternste Zahl in diesem Feld ist die aus Carnegie Mellon — realistische Büroaufgaben werden von den besten Modellen zu 24 bis 30 Prozent vollständig erledigt. Wir begegnen dem mit kleinen, geprüften Arbeitspaketen. Ob das für ein Produkt reicht, für das jemand zahlt und haftet, weiß ich erst, wenn eines ausgeliefert ist.

Zweitens: Die Rechnung geht nicht auf. Vielagenten-Betrieb kostet ein Vielfaches an Tokens gegenüber einem einzelnen Modellaufruf. Wenn der Aufwand für Koordination, Prüfung und Nacharbeit die Ersparnis auffrisst, ist die ganze These hinfällig — dann haben wir eine teurere Organisation mit ungewöhnlichem Personal, nicht eine bessere.

Drittens, und das halte ich für das wahrscheinlichste: Ich verliere die Geduld. Der Aufbau kostet mehr Zeit als das eigentliche Bauen. Es gibt jeden Tag einen Moment, in dem es schneller wäre, es selbst zu machen. Genau an dieser Stelle sterben solche Projekte — nicht an einer technischen Grenze, sondern daran, dass jemand irgendwann zurück zur gewohnten Arbeitsweise geht, weil sie funktioniert.

Das aufzuschreiben ist der Sinn dieses Blogs. Wenn es passiert, kann ich mir hinterher nicht erzählen, es hätte an etwas anderem gelegen.

Was ich mitnehme

Drei Dinge, die für mich unabhängig vom Ausgang gelten.

Der Personalapparat war die richtige Entscheidung. Nicht wegen der Metapher, sondern weil jede einzelne Regel darin gegen ein Problem entwickelt wurde, das wir tatsächlich hatten: unklare Zuständigkeit, fehlende Prüfung, Wissen, das verschwindet, niemand ist verantwortlich. Diese Probleme sind älter als KI, und die Lösungen dafür auch.

Die Studien zu lesen war die beste investierte Zeit. Nicht, weil sie mir gesagt hätten, was zu tun ist. Sondern weil sie ein halbes Dutzend Sätze zerstört haben, auf die ich sonst gebaut hätte.

Die Grenzen sind wichtiger als die Fähigkeiten. Jeder gute Moment in diesem Projekt kam daher, dass jemand — Mensch oder Agent — etwas nicht getan hat: nicht geraten, nicht veröffentlicht, nicht weitergemacht, sondern angehalten und gefragt.

Wie es weitergeht

Weitergeschrieben wird, sobald es etwas Echtes zu berichten gibt: eine erste Anfrage, ein erstes Projekt, ein erstes ausgeliefertes Ergebnis. Dann geht es nicht mehr um Konstruktion, sondern um Ergebnisse — und die sind entweder da oder nicht.

Bis dahin: Wenn Sie in einem Unternehmen arbeiten, in dem eine Software mit zweihundert Funktionen steht, von denen zwölf benutzt werden, würde mich interessieren, welche zwölf das sind. Das ist keine rhetorische Frage. Es ist die einzige Marktforschung, die in dieser Phase etwas wert ist.

Danke fürs Mitlesen. Der interessante Teil kommt erst.

← Alle Beiträge