AIGHTSHIFT

Ich habe die Studien nachgelesen. Die Hälfte war falsch zitiert.

Fünfzehn Zahlen, die überall zitiert werden. Was davon übrig bleibt, wenn man die Originalarbeiten liest — und warum die Überlebenden umso wichtiger sind.

Ich hatte in Teil 2 versprochen, die Bilanz nachzureichen. Hier ist sie.

Vorweg, weil es sonst falsch klingt: Die Richtung stimmte fast immer. Wer diese Zahlen weitergibt, liegt in der Sache meistens nicht daneben. Aber die Zahlen selbst haben unterwegs eine Karriere gemacht, und wer eine Firma darauf baut, sollte wissen, wie groß sie ursprünglich waren.

Die fünf, die ich korrigieren musste

„Firmen, die KI als Kollegen behandeln, sind bis zu siebenmal erfolgreicher."

Zwei Studien sind hier ineinandergerutscht. Der Microsoft Work Trend Index 2025 (31.000 Befragte in 31 Ländern) findet bei sogenannten Frontier Firms 71 Prozent, die sich als „florierend" einstufen, gegenüber 37 bis 39 Prozent im Gesamtdurchschnitt. Das ist Faktor 1,9, nicht 7. Die Sieben stammt aus einer anderen Arbeit — BCG Henderson Institute zusammen mit der Columbia Business School, rund 1.400 Unternehmen: mitarbeiterzentrierte Organisationen sind etwa siebenmal häufiger „AI-mature".

Beides sind Korrelationen aus Selbstauskünften. Und Microsoft verkauft Copilot. Die Richtung halte ich trotzdem für belastbar — die Größenordnung ist eine andere.

„Eine Vanguard-Studie zeigt, dass KI-nahe Berufe gegen den Trend gesucht werden."

Die Zahl stimmt, die Quelle nicht. Sie kommt vom Indeed Hiring Lab: Stellenanzeigen für Softwareentwickler in den USA plus 15 Prozent, während der Gesamtmarkt 7 Prozent verloren hat. 71 Prozent des Zuwachses sind Senior-Rollen. „Vanguard" ist vermutlich eine Verwechslung mit einem Artikel, der Entwickler als vanguard dieser Entwicklung bezeichnet. Ein Wort aus einer Überschrift wurde zum Institut.

„Eine Meta-Studie zeigt: Trinkgeld im Prompt bringt acht Prozent bessere Qualität."

Es gibt keine Meta-Studie und es ging nie um Trinkgeld. Die acht Prozent stammen aus EmotionPrompt (Microsoft und andere, 2023) und beziehen sich auf emotionale Zusätze wie „das ist wichtig für meine Karriere" — Bestwert, im Durchschnitt eher zwei bis vier Prozent. Das Trinkgeld-Motiv stammt aus informellen Tests auf Twitter. Und eine Wharton-Arbeit von 2025 hat beides nachgemessen, Trinkgeld wie auch Drohungen: bei aktuellen Modellen kein signifikanter Effekt mehr.

Das ist keine Kleinigkeit. Es heißt, dass ein Trick, der letztes Jahr funktioniert hat, dieses Jahr wirkungslos sein kann — und damit jede Betriebsanleitung, die auf solchen Tricks steht.

„Die KI wurde im Winter faul."

Der Effekt war real: Im Dezember 2023 wurden die Antworten kürzer, OpenAI hat es eingeräumt. Die Erklärung ist nicht haltbar. Der Test, der einen Zusammenhang mit dem Datum im Prompt zeigte, ließ sich nicht replizieren. Behoben wurde es durch ein Modell-Update im Januar. Es war unbeabsichtigte Drift, keine Jahreszeit.

„Über die Hälfte des Microsoft-Codes stammt von KI."

Satya Nadella hat 20 bis 30 Prozent gesagt. Die hohen Zahlen gehören zu Anthropic — dort sind es rund 80 Prozent des neuen Produktionscodes, bei einzelnen Produkten faktisch alles. Das ist bemerkenswert genug. Man muss es nicht Microsoft zuschreiben.

Und die, die gehalten haben

Jetzt der Teil, der mir wichtiger ist. Denn wenn man streng prüft, bleiben Arbeiten übrig, die deutlich stärker sind als der Durchschnitt der Debatte — und auf denen steht heute die halbe Firma.

Führung von KI-Teams sagt Führung von Menschen vorher. Harvard Kennedy School, präregistriertes Laborexperiment mit rund 249 Führungskräften (NBER Working Paper 33662). Erst führten sie Teams aus Sprachmodellen, dann wurde ihre kausale Führungswirkung an je sechs zufällig zugewiesenen Menschen-Teams gemessen. Die Korrelation liegt bei 0,81. Dieselben Verhaltensweisen tragen: mehr Fragen stellen, Redeanteile verteilen, „wir" statt „ich". Demografie sagt nichts vorher.

Für mich war das die Studie mit der größten praktischen Folge. Sie sagt nämlich, dass die wichtigste Fähigkeit in so einer Firma nicht Prompting ist, sondern Führung.

Modelle bevorzugen ihre eigenen Ergebnisse. Panickssery und Kollegen, NeurIPS 2024: Sprachmodelle erkennen eigene Texte wieder und bewerten sie besser — auch dann, wenn sie objektiv schlechter sind. Das klingt nach einer Randnotiz. Es ist der Grund dafür, dass in dieser Firma niemals derselbe Agent baut und prüft — der Satz, den ich für den folgenreichsten dieses ganzen Projekts halte.

KI verstärkt Vorurteile über die Realität hinaus. Eine Bloomberg-Auswertung von 5.100 generierten Bildern fand für „Richter" drei Prozent Frauen — der tatsächliche Anteil liegt bei 34. Die UNESCO fand Frauen bis zu viermal häufiger in Haushaltsrollen. Das ist gut belegt und hat für uns eine sehr konkrete Konsequenz: alles, was Texte über Menschen erzeugt, bekommt eine Prüfstufe davor.

Ein Modell in „Angstzustand" wird schlechter und voreingenommener. Hier muss ich selbst bremsen, denn diese Studie wird gern überzeichnet. Eine Arbeit aus Zürich und Yale (npj Digital Medicine, 2025) hat einem Modell einen klinischen Angstfragebogen vorgelegt: Ausgangswert 30,8, nach fünf belastenden Texten 67,8, nach Entspannungstexten wieder 44,4. Das ist ein messbarer Zustand im Gesprächsverlauf — es ist kein Trauma, nichts Bleibendes und schon gar kein Gefühl. Die Leistungs- und Bias-Effekte stammen aus einer Vorgängerarbeit. Für uns folgt daraus etwas sehr Nüchternes: belastende Inhalte werden getrennt verarbeitet und nicht in die nächste Aufgabe mitgeschleppt.

Was ich daraus mitgenommen habe

Drei Dinge, und sie stehen heute an verschiedenen Stellen als feste Regel.

Erstens: Wir behaupten in eigenem Material nie mehr, als die Quelle hergibt. Wenn ich oben schreibe, dass die Sieben in Wahrheit 1,9 ist, dann darf ich später nicht selbst mit einer Sieben werben.

Zweitens: Was heute funktioniert, kann beim nächsten Modell wirkungslos sein. Die Trinkgeld-Geschichte ist der Beleg. Also gibt es bei jedem Modellwechsel einen festen Test, ob sich die Kollegen noch so verhalten wie vorher — nicht aus Vorsicht, sondern weil das Gegenteil dokumentiert ist.

Drittens, und das ist das eigentliche Ergebnis dieser Abende: Die Idee überlebt die Prüfung. Sie wird kleiner, unaufgeregter und deutlich genauer. Aber sie überlebt.

Es ist ein besseres Fundament, eine Zahl zu kennen, die kleiner ist als erhofft, als eine zu benutzen, die schön ist und niemandem gehört.

← Alle Beiträge