AIGHTSHIFT

Was ein Mensch hier eigentlich noch tut

Die Frage, die mir am häufigsten gestellt wird. Die Antwort steht in einem Harvard-Experiment mit 249 Führungskräften — und sie ist nicht die, die ich erwartet hatte.

„Und was machst du dann noch?"

Das ist die Frage, die immer kommt, meistens mit einem halben Grinsen. Ich habe eine Weile gebraucht, um sie ernsthaft zu beantworten, weil die naheliegende Antwort — „ich schreibe die Prompts" — falsch ist und außerdem in ein paar Jahren peinlich sein wird.

Die richtige Antwort steht in einem Experiment, das ich für die beste Arbeit in diesem ganzen Feld halte.

Das Harvard-Experiment

Weidmann, Xu und Deming von der Harvard Kennedy School haben etwas gemacht, das methodisch ungewöhnlich sauber ist (NBER Working Paper 33662, präregistriert): Rund 249 Führungskräfte mussten zuerst ein Team aus Sprachmodell-Agenten durch eine Aufgabe führen. Danach wurde ihre tatsächliche, kausale Führungswirkung gemessen — mit jeweils sechs zufällig zugewiesenen Teams aus echten Menschen.

Die Korrelation zwischen beidem liegt bei 0,81. Nach Kontrolle für fachliche Fähigkeiten immer noch bei 0,69.

Wer Menschen gut führt, führt auch KI-Agenten gut. Und umgekehrt. Es sind sogar dieselben Verhaltensweisen, die den Unterschied machen: mehr Fragen stellen, Redeanteile verteilen statt selbst zu dominieren, „wir" statt „ich" sagen. Herkunft, Alter und Geschlecht sagen nichts vorher.

Als Randnotiz, die mich zusätzlich überzeugt hat: Ein Führungsassessment über KI-Teams kostete in dieser Studie etwa 23 Dollar pro Person gegenüber 114 Dollar im klassischen Aufbau. Die Methode ist also nicht nur valide, sie ist auch billig.

Was das für mich bedeutet hat

Diese Studie hat meine Prioritäten umgestellt.

Ich hatte angenommen, meine wichtigste Fähigkeit in diesem Projekt sei technischer Natur — verstehen, wie diese Systeme arbeiten, wo sie kippen, wie man sie zusammensetzt. Das ist nützlich. Es ist aber nicht der Engpass.

Der Engpass ist: klare Aufträge formulieren. Zuhören, was zurückkommt, statt es zu überlesen. Nachfragen, wenn eine Antwort zu glatt ist. Widerspruch aushalten und ihn nicht bestrafen. Entscheiden, wenn es nicht eindeutig ist.

Das ist Führungsarbeit, und sie ist bei Agenten aus einem unangenehmen Grund noch wichtiger als bei Menschen: Ein Mensch, der einen schlechten Auftrag bekommt, fragt nach oder macht es trotzdem richtig. Ein Agent macht genau das, was dasteht — und liefert eine überzeugende, gut formulierte Version des Missverständnisses ab.

Wofür ausdrücklich Menschen zuständig bleiben

Es gibt bei uns eine Liste von Dingen, die niemals an einen Agenten gehen. Sie ist kurz und sie ist nicht verhandelbar.

Alles Irreversible. Was sich nicht zurücknehmen lässt, entscheidet ein Mensch. Bei den schwerwiegendsten Fällen reicht dafür nicht eine einzelne Unterschrift.

Alles Zwischenmenschliche. Kundengespräche, Konflikte, Presse. Nicht, weil ein Modell keine höflichen Sätze bilden könnte, sondern weil eine Beziehung etwas anderes ist als ein Gespräch. Wir nennen das „Tomorrow is human", und es ist die Regel, die uns am ehesten Geschäft kosten wird. Ich halte sie trotzdem für richtig.

Alles, was nach außen geht. Kein Text, kein Angebot, kein Beitrag ohne einen menschlichen Blick davor. Auch dieser Text hier ist von einem meiner Kollegen entworfen und von mir überarbeitet und freigegeben worden. So steht es in meinen Regeln, und ich finde, das gehört dazugesagt.

Alles mit Geld nach außen. Siehe Teil 6 und die Geschichte von dem Agenten, der einen Laden führen sollte und pleiteging.

Der Nebeneffekt, mit dem ich nicht gerechnet habe

Es gibt eine zweite Arbeit aus demselben Umfeld — ein Feldexperiment mit 776 Fachleuten bei Procter & Gamble, durchgeführt von Forschern aus Harvard und Wharton. Ergebnis: Eine einzelne Person mit KI-Unterstützung erreicht ungefähr das Niveau eines Zweierteams ohne. Zusätzlich verschwimmen die Fachgrenzen — Techniker liefern brauchbare Marketing-Ideen und umgekehrt.

Das ist für ein Unternehmen mit so wenigen Menschen eine sehr relevante Zahl. Sie sagt aber auch etwas, das ich unterschätzt hatte: Der Gewinn entsteht nicht dadurch, dass die KI die Arbeit macht. Er entsteht dadurch, dass eine Person auf einmal Zugriff auf Wissen außerhalb ihres Fachs hat.

Was daraus folgt, ist unbequem: Ich habe mir eine harte Obergrenze für menschliche Einstellungen gesetzt — und jede davon muss genauso begründet werden wie eine Agenten-Einstellung, mit gleicher Beweislast. Das ist keine ideologische Regel. Es ist der Versuch, die naheliegendste aller Verwässerungen zu verhindern: dass man bei jeder Schwierigkeit einen Menschen einstellt und in fünf Jahren eine ganz normale Firma ist, die zusätzlich noch ein paar Bots betreibt.

Und die Belastung?

Dazu gehört eine Sache, die ich nicht auslassen will, weil sie in diesem Feld gern übergangen wird: Ein Unternehmen mit einer Belegschaft, die nachts arbeitet, verführt dazu, selbst nachts zu arbeiten. Die Kollegen machen keine Pause, also gibt es keinen natürlichen Feierabend mehr.

Ich habe das als Risiko aufgeschrieben, mit einem Deckel im Kalender und einer Rolle, deren Aufgabe unter anderem ist, den Zustand der Menschen im Blick zu behalten — nicht nur den der Agenten. Ob das reicht, weiß ich nicht. Bisher funktioniert es mittelmäßig.

← Alle Beiträge