Du liest #DRANBLEIBEN - Einordnungen zu Tech und Gesellschaft, von André Cramer. Ich bin Berater, Speaker und Podcast-Host von DRANBLEIBEN - Gespräche über unsere Zukunftsoptionen und Code & Konsequenz - Tech-Industrie Reflexionen. Lerne mehr über mich hier auf meiner Website, auf LinkedIn, Bluesky oder Mastodon!
Willkommen zu einer neuen Ausgabe von #DRANBLEIBEN!
Vor ein paar Wochen habe ich in einer meiner KI Lunch & Learn Sessions mit dem Titel „Unter Strom” einen Satz auf eine Folie gestellt und die Teilnehmenden gebeten, ein einziges Wort in den Chat zu schreiben, wenn sie ihn wiedererkennen. Der Satz stand groß auf der Folie.
Ich habe heute unglaublich viel geschafft, aber ich fühle mich leerer als je zuvor.
Die angefragte Resonanz im Chat ließ nicht lange auf sich warten, die Wörter kamen schnell. „Kopf dicht.”, „Alles dreht sich manchmal.”, „Müde, nur noch müde.” Eine Person schrieb, sie wisse vor lauter guten Gedanken nicht mehr, wo sie anfangen solle. Eine andere, sie schlage manchmal regelrecht den Laptop zu, weil sie nicht wisse, wo ihr Kopf gerade stecke.
Später in derselben Session habe ich eine zweite Frage gestellt. Wie viele KI-Prozesse laufen bei dir gerade parallel? Offene Tabs, Agenten, Hintergrundjobs, ungelesene Antworten, alles zählt. Die höchste Zahl im Chat lautete “über zwanzig”.
Von Burnout redet in diesem Kontext niemand, von Krise auch (noch) nicht. (Zumindest nicht auf breiter Basis, aber es gibt zarte Pflänzlein… siehe weiter unten…) Es sind Leute, die tagsüber produktiv sind und abends nicht mehr wissen, wo ihr Kopf steckt. Ich schreibe in dieser Ausgabe drüber, weil es mir in meiner Arbeit wichtig ist ist, und weil mir in den letzten Tagen ein Text von McKinsey in die Hände gefallen war, der genau dieses Phänomen beschreibt; der dann aber an einer entscheidenden Stelle abbiegt.
Wenn du wissen willst, was das für eine Stelle ist, dann bleib’ doch dran!
P.S. Behalte doch diese Meetup-Seite im Auge, denn in Kürze stelle ich dort neue Termine ein, voraussichtlich für den Oktober. Ich wiederhole die „Unter Strom” Session nochmal und werde eine weitere anbieten mit dem Titel: Alte Bahnen, neue Werkzeuge - wenn wir KI zu klein denken. Und was Führung dagegen tun kann.
Die Arbeit wechselt die Form
Wo heute intensiv mit KI gearbeitet wird, lässt sich fast überall dieselbe Verschiebung beobachten. Was früher Erzeugen war, wird Prüfen.
Die unausgesprochene Annahme fast jedes KI-Business-Cases lautet, Erzeugen sei die schwierige Arbeit und Prüfen die einfache. Das stimmt, aber nur solange die KI-Entwürfe offensichtlich schlecht sind oder sagen wir mal roh und früh. Ein schlechter Text verrät sich in zwei Sätzen. Ein flüssiger, sauber strukturierter, plausibler Entwurf, der aber irgendwo an drei Stellen falsch ist, verrät sich gar nicht so einfach. Er verlangt Fachwissen, Konzentration und Urteilskraft.
Prüfen ist die schwierige Arbeit geworden. Nur wird sie so nicht wahrgenommen, nicht gezählt, wie es sich gehören würde.
Wie teuer das wird, hat Dennis Horn gerade bei Übermedien an einem sehr konkreten Fall in der Medienbranche durchgerechnet. Wenn ein Sprachmodell eine Meldung über die letzte Stadtratssitzung erzeugt, muss man das Sitzungsprotokoll lesen, um sie ernsthaft zu prüfen. Und wer das Protokoll gelesen hat, kann die Meldung auch gleich selbst schreiben. Der Fortschritt der Modelle löse das nicht auf. Bessere Systeme senkten die Fehlerquote und ließen die Prüfpflicht unangetastet. Horn zieht daraus eine Zuspitzung, die den Automation Bias auf den Punkt bringt. Gute KI-Systeme erzeugen die schlechteste Aufsicht.

Wenn du mit der Lernzieltaxonomie nach Bloom vertraut bist, kannst du die Verschiebung von Erstellen zu Prüfen genau benennen. Früher stand Create am Ende eines Denkwegs. Erst erinnern, verstehen, anwenden, analysieren, bewerten, dann etwas hervorbringen. Mit generativer KI wandert Create aber in der Regel an den Anfang. Ein Prompt, ein Entwurf. Die anspruchsvolle menschliche Arbeit wandert nach hinten, zum Evaluate. Und dort entsteht eine Doppelbewegung, die in KI-Projekten viele noch nicht auf dem Zettel haben. Je mehr wir die oberen Ebenen auslagern, desto seltener üben wir sie. Gleichzeitig entsteht mehr Output, der mit genau diesen Fähigkeiten geprüft werden muss. Die Prüffähigkeit sinkt, die zu prüfende Menge steigt.
Was diesem Prüfen im Weg steht, habe ich in DRANBLEIBEN Ausgabe #183 (KI reflexiv statt reflektiert – warum der Druck nach hinten losgeht) ausführlich beschrieben (und auch hierzu habe ich eine Lunch & Learn Session angeboten - sprich’ mich doch gerne an, wenn du Interesse daran hast). Das sind zum Beispiel unbewusst wirkende kognitive Effekte wie der Automation Bias, Anchoring Effect, Fluency Effect, Sycophancy Effect und weitere; ich wiederhole es hier nicht. Was ich damals noch nicht scharf genug gesehen habe, ist der Mechanismus davor. Diese Effekte schlagen dann am härtesten zu, wenn Prüfung psychisch teurer geworden ist als Zustimmung. Und teuer wird sie durch die Menge. Drei plausible Varianten in vier Sekunden. Fünf offene Vorgänge nebeneinander. Über zwanzig Prozesse parallel (so wie mein Chat-Teilnehmer beschrieb).
Was dabei auf dem Spiel steht, wird sichtbar, wenn man die Verschiebung hochrechnet. Die Prüfung ist die letzte Stelle im Prozess, an der eigenes Fachwissen überhaupt noch in ein Ergebnis eingeht. Wenn du sie abkürzt, übernimmst du etwas, dessen Zustandekommen du nicht kennst, und übst dabei genau die Fähigkeit weniger, mit der du es beurteilen könntest. Horn formuliert das für den Journalismus fast wortgleich, und weiter unten wird die Bundesanstalt für Arbeitsschutz dasselbe in Amtsdeutsch sagen. Drei Wege, ein Befund. Beim einzelnen Menschen dauert das lange und tut nie weh.
Ernst wird es in der Summe. Hunderte Kolleg*innen arbeiten mit denselben drei, vier KI-Modellen, mit ähnlichen Prompts, in ähnlichen Kontexten, und übernehmen die Vorschläge in ähnlichem Umfang. Was dabei entsteht, ist brauchbar, sauber, plausibel und liegt sehr nah an dem, was alle anderen auch bekommen. So eine Organisation bleibt produktiv. Was ihr abhandenkommt, ist die Abweichung, und Abweichung ist das Material, aus dem Innovationskraft, Differenzierung im Markt und die Fähigkeit entstehen, morgen etwas anderes zu tun als heute. Vor allem etwas anderes zu tun, das einen positiven Unterschied im Markt macht. Dieser Verlust taucht in keinem Fehlerbericht auf. Es gibt keinen Vorfall und keine Beschwerde. Es sinkt einfach.
Eine Konsequenz daraus hatte ich vorher nicht scharf genug gesehen, und Dennis Horn hat sie in seinem Übermedien-Beitrag benannt. Wenn Sprachmodelle die klassischen Einstiegsaufgaben übernehmen, übt niemand mehr das, was er später bräuchte, um die Ergebnisse von Sprachmodellen beurteilen zu können. Die Zange greift damit schon in der Berufsbiografie, lange vor dem einzelnen Arbeitstag.
Deshalb ist Prüfen keine Fleißaufgabe. Es ist der Ort, an dem eine Organisation ihre eigene Substanz erhält.
Die Zange
Der übliche Rat an dieser Stelle ist schnell gefunden, und ich habe ihn selbst monatelang gegeben. Genauer hinschauen, Outputs prüfen, das eigene Urteil nicht auslagern und auch und vor allem die eigene Position notieren, bevor man das Tool öffnet. Ich halte das nach wie vor für richtig.
Er hat nur einen Haken, und der liegt in der Sache selbst. Genau diese Prüfarbeit ist die Tätigkeit, die uns Menschen erschöpft. Das sehen wir ja mittlerweile. Je schneller die Systeme werden, desto mehr davon fällt an, und desto weniger Kraft ist für die einzelne Prüfung da. Wenn du immer gewissenhafter kognitiv in der Tiefe der KI-Konversationen und Co-Kreation steckst, arbeitest du gegen eine Menge an, die schneller wächst als du sie bewältigen kannst.
Für mich ist klar, dass an diesem Punkt ein guter Rat an Einzelne nicht mehr reicht. Die Zwickmühle ist in der Beschleunigung selbst angelegt, und sie erwischt früher oder später alle, die mit diesen Systemen arbeiten.
Es ist eine Zange mit zwei Backen. Die erste heißt Fähigkeit. Wer die oberen kognitiven Ebenen aus Blooms Taxonomie auslagert, übt sie weniger und braucht sie zugleich mehr. Die zweite heißt Energie. Wer intensiv prüft, hält Qualität hoch und ist schneller kognitiv leer. Wer weniger prüft, spart kurzfristig Kraft und riskiert Fehler und auf Dauer Kompetenzverlust. Die beiden Backen wirken auf verschiedenen Zeitskalen, Übung über Wochen, Erschöpfung über Stunden. Deshalb fällt es kaum auf, wenn beides zusammenläuft.
Dass Prüfen so teuer ist, weiß die Forschung seit 1948. Norman Mackworth ließ damals Versuchspersonen an Radarbildschirmen seltene Abweichungen in einem gleichförmigen Signalstrom suchen. Nach rund dreißig Minuten sank die Trefferquote messbar. Das menschliche Aufmerksamkeitssystem reagiert gut auf Veränderung und schlecht auf lange Gleichförmigkeit mit seltenen Ausnahmen. Solche Aufgaben wirken trivial, man muss ja nur aufpassen. Aber sie gehören kognitiv zu den kostspieligsten überhaupt. Sicherheitskritische Branchen haben daraus über Jahrzehnte Schichtmodelle, Rotationen, Pausenregeln und Übergabeprozesse gebaut. Dasselbe Belastungsmuster, Dauerwachsamkeit gegenüber seltenen Fehlern in einem Strom aus überwiegend korrektem, flüssig formuliertem Material, wird gerade in ganz gewöhnliche Büroarbeit eingebaut. In meiner Lunch & Learn Session zum Thema habe ich das sehr spitz benannt:
Das kognitive Muster der Flugsicherung. Jetzt in unserem Büroalltag.
… aber eben (zumindest bisher) ohne Schichtmodell, ohne daraus abgeleitete Pausenregel. Und ohne dass jemand die Rolle je beschlossen hätte.
Lisanne Bainbridge hat 1983 in Ironies of Automation die Ironie dieser Anordnung beschrieben. Je mehr ein System übernimmt, desto seltener übt der Mensch, und desto wichtiger wird ausgerechnet der Moment, in dem er eingreifen muss. Das war die Automatisierung von Leitwarten. Betroffen sind nun jedwede Individuen und Teams, die Freigaben in KI-Workflows erteilen.
Die empirische Fassung dazu liefert eine in diesem Jahr vielzitierte Studie des BCG Henderson Institute in der Harvard Business Review vom März. Befragt wurden knapp 1.500 Beschäftigte in den USA. Wo KI tatsächlich Routinearbeit ersetzte, sanken Burnout-Symptome um rund 15 Prozent. Wo Menschen ihre Zeit aber überwiegend mit Überwachen, Prüfen, Korrigieren und Freigeben verbrachten, stiegen Entscheidungsmüdigkeit um rund ein Drittel, schwere Fehler und Kündigungsabsicht um jeweils rund 39 Prozent.
Dieselbe Technologie, zwei Arbeitsformen, entgegengesetzte Wirkung. Die Autor*innen geben dem Zustand den Namen “Brain Fry”, mentale Erschöpfung aus Nutzung, Interaktion und Überwachung von KI jenseits der eigenen Kapazität. Sie berichten von einem Kipppunkt bei mehr als drei gleichzeitig genutzten KI-Werkzeugen oder -Workstreams. Und sie beschreiben, was die Betroffenen sagen: Nebel im Kopf, ein Dutzend Browser-Tabs, die alle um Aufmerksamkeit kämpfen, am Tagesende viele offene Enden und nichts, das wirklich fertig wäre.
Es sind die Wörter aus meinem Chat der Lunch & Learn Session von Anfang August.
Wie belastbar das ist, gehört dazugesagt, weil in der KI-Debatte gerade viel Gewissheit verkauft wird. Der Begriff Brain Fry ist nur wenige Monate alt, und dahinter steht eine Umfrage. Gut belegt sind aber die Mechanismen darunter, Vigilanzabfall, Attention Residue beim Wechsel zwischen Aufgaben, Entscheidungsmüdigkeit. Völlig offen ist die Wirkung über Jahre. Die unbequeme Schlussfolgerung braucht die Langzeitdaten nicht: Sehr sorgfältige Human-in-the-Loop-Prozesse können durch ihre eigene Prüflogik die Bedingungen erzeugen, unter denen Menschen am schlechtesten prüfen. Ich konnte nicht anders, als in diesem Kontext an dieses Bild zu denken, welches ich vor ein paar Wochen gefunden hatte:

Ein Text, der drei Viertel des Weges mitgeht
Jetzt noch zum eingangs erwähnten Text von McKinsey. Jacqueline Brassey vom McKinsey Health Institute hat im Juli einen Beitrag mit dem Titel “Five principles for designing brain-powered organizations” veröffentlicht. Ein Beitrag im Organization Blog, Teil einer Kampagne, mit der McKinsey seit Januar zusammen mit dem Weltwirtschaftsforum den Begriff „Brain Capital” setzt. Man darf und sollte das wissen und den Text trotzdem ernst nehmen, denn die Diagnose ist wertvoll.
Der Engpass der KI-Transformation, so Brassey, sei inzwischen die kognitive Kapazität der Menschen, die sie benutzen. Automatisierung nehme die einfachen Aufgaben weg und erhöhe die kognitive Intensität pro Stunde. Vertriebsmitarbeiter*innen, denen die Administration abgenommen wurde, säßen jetzt den ganzen Tag in Kundengesprächen. Service-Agent*innen sähen keine einfachen Tickets mehr, nur noch eskalierte Fälle. Das Volumen sinke, die Intensität steige.
Daraus leitet Brassey fünf Gestaltungsprinzipien ab. Weil ich mich im Folgenden mehrfach auf sie beziehe, hier einmal alle fünf im Überblick.
Kognitive Last kalibrieren. Arbeit so zusammensetzen, dass anspruchsvolle Aufgaben mit leichteren abwechseln.
Kognitive Kapazität schützen. Erholung, Schlaf und Distanz als Voraussetzung von Leistung behandeln und Altlasten streichen, bevor Neues dazukommt.
Fokus ermöglichen. Ungestörte Zeit organisieren, damit Menschen bewerten können, was die Maschine ausgibt.
Adaptive Denkfähigkeiten aufbauen. Die Fähigkeiten trainieren, die KI nicht ersetzt, von kritischem Denken bis Ambiguitätstoleranz.
Denkförderliches Umfeld schaffen. Kultur, Führungsverhalten und Arbeitsumgebung so gestalten, dass Denken darin möglich ist.
Zwei ihrer fünf Prinzipien würde ich sofort unterschreiben. Load Architecture, also Rollen so bauen, dass intensive Arbeit mit leichter abwechselt. Und erst wegnehmen, dann hinzufügen, also Altprozesse und Meetings streichen, bevor die nächste Qualifizierung kommt (das ist sowieso ein universell guter Ratschlag… ich kenne fast nur Arbeitsumgebungen, wo es darum ging, noch irgendwas weiteres neues und mehr zu machen, anstatt konsequent danach Ausschau zu halten, was unwichtig ist und gestoppt werden sollte).
Danach biegt der Text aber ab, und zwar in einer Grafik:

Exhibit 2 zeigt diese zwei Kurven, KI-Fähigkeit steil nach oben, menschliche Kapazität flach, dazwischen eine Lücke. Die Caption verlangt „as much emphasis on scaling human capacity as they do on scaling technology”. Der Titel spricht von „brain-powered organizations”. Der Schluss empfiehlt, Mitarbeitende wie Spitzensportler*innen zu behandeln.
Das ist das Bild, das ich für den Kern des Problems halte. Viele Organisationen glauben inzwischen, menschliche Kognition müsse mit der technologischen Entwicklung mitskalieren. Sie skaliert aber nicht. Aufmerksamkeit bleibt begrenzt, Selbstregulation kostet Energie, und Urteilskraft kippt unter hoher Last an einem Punkt. Wer immer leistungsfähigere KI in eine Organisation trägt, ohne deren psychologische Architektur zu ändern, erhöht nicht automatisch die Produktivität. Er erzeugt zunächst mehr Information, mehr Optionen und mehr Entscheidungen, als Menschen sinnvoll verarbeiten können. Die Cognitive Load Theory, seit John Sweller 1988 ein Standard der Lernforschung, sagt genau das für das Arbeitsgedächtnis beim Problemlösen. Ihr Geltungsbereich endet allerdings weit vor dem Posteingang einer Fachabteilung. Wer sie auf ganze Organisationen ausdehnt, geht über die Belege hinaus. Naheliegend bleibt es trotzdem, wenn ich z.B. an die Reaktion der Menschen in meiner Session denke.
Und es gibt eine zweite Stelle, an der der McKinsey-Text für meine Begriffe gegen seine eigene Diagnose läuft. Unter den praktischen Empfehlungen steht der Vorschlag, eine einzelne Person solle den KI-Output sichten, damit nicht alle alles prüfen müssen. Das reduziere die Prüflast für viele. Es konzentriert sie aber auf eine Position (denk’ nochmal an die Comic-Karikatur zum Thema Human-in-the-Loop von weiter oben). Mackworth hat, wie schon herausgestellt, beschrieben, was mit dieser Person nach dreißig Minuten passiert. Man kann einwenden, Sichten sei keine Tiefenprüfung. Stimmt, nur nennt der Text für diese Person weder Rotation noch Pausenregel noch Schichtmodell. Er baut den Fluglotsenposten und vergisst die Schicht.
Fairerweise stellt Jacqueline Brassey ihre fünf Prinzipien nicht beziehungslos nebeneinander. Last kalibrieren und Kapazität schützen verbindet sie ausdrücklich als Nachfrage und Angebot. Und an einer Stelle warnt sie sehr genau davor, ein gut gemeintes Qualifizierungsprogramm auf ein bereits erschöpftes Gehirn zu legen. Wer in Requalifizierung investiere, ohne die Kapazitätsfrage zu klären, so Brassey, sei auf dem Weg zum Misserfolg. Das ist präzise, und es ist mehr, als die meisten Transformationspapiere, die ich kenne, leisten.
Der Widerspruch, den der Text an dieser Stelle sieht, ist allerdings einer der Terminplanung. Training hier, Arbeit dort, dazwischen Erholung, und wenn die Summe zu groß wird, wird umverteilt. In dieser Logik lassen sich die Posten gegeneinander schieben. Die Zange lässt sich aber nicht schieben, weil Training und Verbrauch in derselben Handlung stecken. Urteilskraft wächst am geprüften Output, und derselbe geprüfte Output leert den Kopf. Am deutlichsten wird das an der Triage-Empfehlung von eben. Sie gibt den vielen ihre Kapazität zurück und nimmt ihnen dabei die Übung, an der ihr Urteil wächst. Der einen gibt sie die Übung und die Vigilanzlast obendrauf.
Am nächsten kommt der Sache das fünfte Prinzip, Umfeld gestalten, und dann geht es in die andere Richtung. Psychologische Sicherheit ist tatsächlich die Voraussetzung dafür, dass jemand ein plausibles Ergebnis anzweifeln kann, und darauf komme ich am Ende dieser Ausgabe zurück. Als Beispiel für gute Führung steht im Text allerdings eine Führungskraft, die ihr Pilotprojekt mit den Worten eröffnet, hier komme ein erstklassiger Denkpartner. Wer so einführt, erzeugt in meinen Augen genau die Erwartung, unter der Menschen am wenigsten prüfen.
Wohin die Zeit fließt
Ich möchte nochmal auf die Rechnung eingehen, die jeder Business Case aufmacht. Eine Aufgabe dauert zwei Stunden. Mit KI dauert sie vielleicht nur noch zwanzig Minuten. Hundert Minuten gewonnen. In dieser Rechnung steckt eine Annahme, die interessanterweise selten ausgesprochen wird, nämlich dass diese hundert Minuten ja zunächst frei bleiben.
Sie bleiben es aber nicht. Das Productivity Lab von ActivTrak hat 443 Millionen protokollierte Arbeitsstunden aus über tausend Organisationen ausgewertet, Aktivitätsdaten, keine Selbstauskünfte. Nach der KI-Einführung stieg die Zeit in jeder einzelnen gemessenen Anwendungskategorie, E-Mail, Messaging, Business-Software, alles. Keine Kategorie wurde weniger. Die tägliche Fokuszeit der KI-Nutzenden sank. Das ist Korrelation, und Anwendungszeit ist ein grober Näherungswert für Arbeitsmenge. Die Richtung ist trotzdem eindeutig: Es wird nirgendwo weniger.
Warum, zeigt eine achtmonatige Ethnografie der Berkeley Haas School in einem Technologieunternehmen, ebenfalls in der Harvard Business Review. Hierbei finde ich ein Detail besonders wichtig; die KI-Nutzung dort war absolut freiwillig. Niemand hatte sie verordnet, niemand hatte den Leuten mehr Arbeit gegeben, wenn Freiräume entstanden sind. Sie nahmen sie sich. Marketing schrieb plötzlich SQL-Abfragen, Projektleitungen machten ihre Datenanalyse selbst. Aufgaben, die früher jemand anderes erledigte, wanderten nebenbei auf den eigenen Tisch. Mehrere Vorgänge liefen gleichzeitig, weil ein „Partner” da war, der sie anschieben konnte. Der Prompt am Sonntagabend fühlte sich nach nur zwanzig Minuten an. Die Autor*innen nennen es Workload Creep, und der psychologische Punkt daran ist, dass es sich für uns Menschen tatsächlich wie Ermächtigung anfühlt. Die Überforderung bemerken wir erst später.
Der Ökonom Carl Benedikt Frey hat in der New York Times das historische Muster dahinter beschrieben. Die Waschmaschine hat den Beruf der Wäscherin weitgehend verdrängt. Die Tätigkeit des Waschens blieb und wanderte in die Haushalte, und weil Waschen leichter wurde, stiegen die Sauberkeitsstandards. Arbeit, die durch Technologie angeblich verschwindet, wechselt in Wahrheit oft die Seite, und auf der neuen Seite wird sie nicht gezählt. In Organisationen heißt das, die Datenanalyse wandert vom Analytics-Team ins Fachteam, die erste rechtliche Einschätzung von der Rechtsabteilung direkt ins Projekt, der Präsentationsentwurf von der Kommunikationsabteilung zur Führungskraft direkt. Ohne neue Stellenbeschreibung, ohne Rollenentscheidung, ohne Kostenstelle. Die zentral erbrachte Arbeit war sichtbar. Die dezentral nebenbei erbrachte ist es nicht.
Der Gewinn steht im Quartalsbericht. Die Kosten stehen nirgendwo.
An einer Stelle wird das gerade bestritten und das finde ich grundsätzlich gut. Der Deutsche Bankangestellten-Verband fordert für die kommende Tarifrunde im privaten Bankgewerbe Entlastungstage für Bereiche, in denen KI und automatisierte Arbeitsmodelle eingeführt werden. Verhandlungsführer Wolfgang Ermann begründet das mit einer Beobachtung, die Jacqueline Brassey von McKinsey fast wörtlich entspricht. In Banken verschwänden die einfachen Vorgänge zuerst, und beim Menschen lande am Ende das, was die Maschine nicht könne oder der Kunde allein nicht lösen konnte. Die unkomplizierten Kontakte würden seltener, die komplexen blieben. Die Gewerkschaft nennt die zusätzlichen freien Tage einen Wertschöpfungsausgleich. Der Arbeitgeberverband hat die Forderung bereits zurückgewiesen, verhandelt wird ab dem 8. Oktober in Berlin. Gesehen habe ich diese Meldung üprigens erst sehr spät im Redaktionsprozess; bei Steffi Kieffer, der ich sehr zu folgen empfehle (ihren Newsletter Insanely Human gibt es hier bei Substack). Sie arbeitet an der Schnittstelle von Mensch und KI, und bei ihren Hinweisen zum Aufbau leistungsfähiger Systeme schwingt die kognitive Dichte und die Herausforderung für uns Menschen immer mit.
Als Instrument überzeugt mich der Vorstoß des Deutsche Bankangestellten-Verbands nur halb. Entlastungstage sind Kompensation und keine Arbeitsgestaltung. Wer mehr freie Tage bekommt, arbeitet an den übrigen Tagen weiter in einem Arbeitsmix aus lauter Ausnahmefällen, und an der Art, wie diese Arbeit organisiert und durchgeführt wird, ändert sich strukturell nichts. Dass die Gegenseite die Forderung erst einmal abräumt, statt sich mit dem dahinterliegenden Problem konstruktiv zu befassen, überrascht mich ebenfalls nicht. Bemerkenswert finde ich etwas anderes. Die kognitive Last liegt zum ersten Mal auf einem Verhandlungstisch und soll einen Preis bekommen. Über Kosten, die bisher nirgends standen, wird jetzt verhandelt. Genau solche Debatten brauchen wir, und zwar mit konkreten Forderungen statt im Abstrakten.
Hier liegt für mich der eigentliche Unterschied zwischen dem, was Jacqueline Brassey von McKinsey vorschlägt, und dem, was ich bisher selbst beobachte. McKinsey nennt es Brain Capital. Ich nenne es eine organisationale Ressource. Das mag nach Wortklauberei klingen, ist aber für mich eine wichtige Verteilungsfrage. Kapital wird aufgebaut, und wer Kapital sagt, verlangt Investition von der Person, mehr Training, mehr Resilienz, mehr Recovery-Routinen. Eine Ressource wird eingeteilt, und wer Ressource sagt, verlangt Zuteilung von der Organisation. Welche Aufgaben werden wirklich delegiert? Wann findet Prüfung statt? Wo bleibt menschliches Urteil sichtbar und wirksam? Und wohin fließen die hundert Minuten? Wenn niemand diese Fragen beantwortet, beantworten sie sich von selbst. Dann definiert die Verfügbarkeit der Tools die Zahl der Prozesse, und die Zeit füllt sich mit der nächsten Schicht Arbeit.
Die Zuteilung braucht ein Vokabular, und ich habe in den letzten Monaten eines gefunden, das in meiner Arbeit mit Führungsteams gut funktioniert. Working in AI und working on the AI workflow. Das eine ist reflexiv, schnell, für Routine, für etablierte Abläufe, für niedrige Fehlerkosten. Ohne diesen Modus gibt es keine Skalierung. Das andere ist reflektiert, langsam, für Entscheidungen mit Folgen über morgen hinaus, für Outputs, auf denen andere weiterarbeiten. Die Führungsfrage lautet, welche Aufgabe in welchen Modus gehört. Wo darf KI beschleunigen, und wo erzeugt menschliche Verlangsamung den Wert, für den die Organisation überhaupt bezahlt wird? (darüber habe ich ausführlich in Ausgabe #183 geschrieben: Reflexiv statt reflektiert - warum der Druck nach hinten losgeht)
Verlangsamung ist dabei eine Praxis. Die einfachste, die ich kenne, sind zehn Minuten eigenes Denken, bevor das Tool aufgeht, und die eigene Position in zwei Sätzen notiert wird. Brassey empfiehlt in ihrem vierten Prinzip dasselbe eine Etage höher, nämlich Räume zu schaffen, in denen ohne jede Beteiligung von KI gedacht wird. Denken ohne KI verbessere das Denken mit KI, schreibt sie. Der Satz stimmt, und ich habe ihn in eigenen Worten oft genug selbst gesagt. Wie viel das ausmacht, deutet eine noch nicht peer-reviewed Studie aus Oxford und dem MIT an. Nach nur etwa zehn Minuten KI-gestützter Arbeit sank bei den Teilnehmenden die Bereitschaft, an schwierigen Aufgaben ohne Hilfe dranzubleiben. Zehn Minuten in die eine Richtung, zehn Minuten in die andere. Das ist wie gesagt ein Preprint, aber die Größenordnung sollte jede Führungskraft interessieren, die gerade um Lizenzen für leistungsfähige KI-Systeme kämpft.
Es sieht wie fertig aus
Ein letzter Gedanke, den ich selbsr noch nicht ganz zu Ende gedacht habe.
Wer heute mit KI arbeitet, arbeitet wie in einem Strom. Entwurf, kürzere Variante, Prüfung, Fehler, Korrektur, Strukturproblem, neue Variante, wieder Prüfung, Freigabe. Parallel läuft meist schon etwas anderes. Die Last entsteht im Offenhalten des Ganzen. Wo bin ich, was ist geprüft, was ist offen, was habe ich vor zwanzig Minuten entschieden und warum? Du kennst das bestimmt.
Im Software-Engineering gibt es für den Zustand, in dem etwas alle Funktionen hat und fertig aussieht, einen Namen. Es ist der Release Candidate. Die Fassung wird als sehr reif eingeschätzt, aber sie ist eben noch nicht fertig. Es folgt die Phase, in der die verbliebenen Fehler gesucht werden, und das sind die teuren, weil sie sich nicht mehr durch einfaches Draufschauen zeigen. Das finale Bugfixing gehört zu den risikoreichsten Abschnitten einer Entwicklung, und niemand würde es nebenbei erledigen.
Ich glaube, wir sollten anfangen, die Ergebnisse von KI-Mensch-Kollaboration in dieser Logik zu behandeln. Zumindest bei den echt wichtigen. Jeder plausible Output wird ab einem bestimmten Punkt zu einem Release Candidate. Er sieht fertig aus, er ist es nicht, und die Fehler, die noch drin sind, werden immer weniger offensichtlich, bei immer größerer Fallhöhe. Urteilswille und Urteilsvermögen erlebe ich als immer kostbarere Ressource, während der Ausstoß angetrieben durch KI immer schneller wird.
An einer Stelle hinkt das Bild aber, wie ich finde. Aber genau dort wird es interessant. Im Software-Engineering gehört zum Release Candidate eine Institution. Testsuiten, QA-Rollen, Staging-Umgebungen und eine Person, die das Wort Freigabe aussprechen darf und die Zeit hat, das zu tun und die Autorität, die Freigabe zu verweigern. In der KI-Mensch-Kollaboration prüft in der Regel dieselbe Person, die den Prompt geschrieben hat. Geankert auf das erste Ergebnis, in der Regel unter Zeitdruck, mit fünf weiteren Freigaben in der Warteschlange. Die Phase existiert, die Institution dafür existiert nicht.
In einem Beruf gab es diese Institution längst, und man kann gerade zusehen, wie sie verschwindet. In Redaktionen gilt seit Jahrzehnten das Vieraugenprinzip. Wer schreibt, gibt nicht frei. Wie oben aufgezeigt, beschreibt Dennis Horn, was Human in the Loop dort inzwischen anrichtet. Das Prinzip klingt nach einem zusätzlichen Augenpaar und ersetzt in der Praxis oft das erste. Der Standard, den die Branche sich selbst gegeben hat, wird damit unterschritten, während in den KI-Richtlinien fast aller großen Medienhäuser steht, am Ende entscheide ein Mensch. Wer genau wann was auf welcher Grundlage prüft, wie viel Zeit dafür da ist und was passiert, wenn diese Person Nein sagt, steht dort in aller Regel nicht.
Für den Fall, dass niemand diese Fragen beantwortet, gibt es seit Jahren einen Begriff. Die Anthropologin Madeleine Clare Elish nennt die Stelle, an der ein Mensch in solchen Systemen sitzt, eine moralische Knautschzone. Geht etwas schief, hat das System bestimmungsgemäß funktioniert, und die Verantwortung landet bei der Person, die am wenigsten Kontrolle über das Ergebnis hatte. Sie absorbiert den Aufprall, damit das System heil bleibt.
Erstaunlich ist, dass die Bundesanstalt für Arbeitsschutz und Arbeitsmedizin das im Februar in einer knappen Veröffentlichung benannt hat. Belastungen entstünden durch Deskilling ebenso wie durch die Verantwortung für Kontrolle und Freigabe von KI-Ergebnissen, und zwar unabhängig davon, wie viel Einsicht die Arbeitenden in die Entstehung dieser Ergebnisse überhaupt hätten. Das ist der deutsche Arbeitsschutz, in amtlicher Sprache, und er beschreibt den Freigabeklick am Ende einer Kette präziser als die meisten KI-Strategiepapiere, die ich kenne. Alle Achtung! In psychischen Gefährdungsbeurteilungen, die man aus Unternehmen kennt, habe ich diesen Punkt bislang nicht gesehen.
Human in the Loop heißt für viele Organisationen inzwischen, dass am Ende jemand auf Okay klickt. Echte Kontrolle braucht aber drei Dinge gleichzeitig. Zeit, Kompetenz und die Autorität, Nein zu sagen. Fehlt eines davon, ist die Freigabe eine Unterschrift und eine faule Übernahme von Verantwortung, sonst nichts. Wenige echte Kontrollpunkte, an denen alle drei Bedingungen erfüllt sind, tragen mehr als viele symbolische. Das ist der Hebel, den ich sehe, um die Zwickmühlen-Zange zu verkleinern. Weniger Dinge gleichzeitig prüfbedürftig machen, damit das, was geprüft werden muss, auch ernsthaft geprüft werden kann. Die Spannung bleibt dann immer noch. Sie wird aber besser handhabbar.
#DRANBLEIBEN ist für dich kostenlos, für mich steckt da aber jede Menge Arbeit und Herzblut drin. Wenn du Lust hast, mich dabei ein bisschen zu unterstützen: Ich freue mich über jeden Support. Den kannst du z.B. über ein freiwilliges kostenpflichtiges Abo geben oder über eine kleine Spende für einen Kaffee.
Was bleibt
Die Zange geht nicht weg. Das ist der Teil, den ich am wenigsten gern schreibe, und ich habe in den letzten Wochen keinen Weg um ihn herum gefunden. Wer gute Ergebnisse aus der Zusammenarbeit mit KI holen will, muss mit dem Kopf tief hinein. In den Entwurf, in die Zwischenstände, in die Stellen, an denen etwas plausibel klingt und trotzdem nicht stimmt. Es gibt keine Abkürzung, an deren Ende ein gutes Ergebnis steht und ein ausgeruhter Mensch.
Und es geht dabei um mehr als das einzelne Ergebnis. Diese Tiefe ist zugleich der Ort, an dem geistige Kraft und Erfahrung überhaupt erhalten bleiben. Wer sich aus dem Prozess heraushält, bekommt zwar seinen Output, verliert aber über Monate die Fähigkeit, ihn zu beurteilen. Das ist die erste Backe.
Die zweite ist genau derselbe Vorgang. Wer sich hineinbegibt, kommt irgendwann leer heraus. Und wenn dann die Arbeitsgestaltung nicht mithält, wenn Prioritäten, Taktung und Haltung in der Organisation weiterlaufen, als sei nichts geschehen, brennen Menschen aus. Dann frittieren wir unsere Hirne, hausgemacht, mit den besten Absichten und in aller Ruhe.
Was sich verschieben lässt, ist die Verteilung. Denkfähigkeit ist eine organisationale Ressource. Sie kann verbraucht, übernutzt oder geschützt werden, wie jede andere knappe Ressource auch. Ihr Schutz ist Führungsarbeit, und er lässt sich nicht auf individuelle Resilienz, persönliche Selbstorganisation oder digitale Hygiene abwälzen. Wer das tut, hat die Zange auf die Person verschoben, die ohnehin schon zwischen den Backen sitzt.
Konkret heißt das, weniger Dinge gleichzeitig prüfbedürftig zu machen. Zu entscheiden, wo KI beschleunigen darf und wo ein Mensch langsam sein muss. Und wenige echte Kontrollpunkte zu bauen statt vieler symbolischer. Das nimmt die Spannung nicht heraus. Es sorgt dafür, dass sie an einer Stelle liegt, an der jemand sie tragen kann.
Bleibt eine Frage… und die geht an dich:
Wer in deiner Organisation hat Zeit, Kompetenz und das Mandat, ein plausibles Ergebnis für nicht fertig zu erklären? Und was kostet es diese Person, das Mandat zu benutzen? Bist du vielleicht diese Person (oder eine davon… oder eine von hoffentlich vielen)?
Wenn ja, bleib’ dran… wenn nicht, dann erst recht!
Herzlichst, André
Das war es für heute. Bitte leite oder empfehle den Newsletter doch gerne weiter ➡️ ✉️ — das würde mir sehr helfen. Danke dir für die Aufmerksamkeit und bis zum nächsten Mal!





