Categories:

Human Oversight reicht nicht: Wenn KI Fehler überzeugender macht

Autorin: Prof. Dr. Eugenia Schmitt – Professorin, Autorin, Coach, Co-Founder Trenz Institut | Trenz Institut

Warum unabhängiges Urteil zur Führungsaufgabe wird

Manchmal liegt das größte Risiko nicht in einer offensichtlich falschen Antwort. Sondern in einer falschen Antwort, die professionell, schlüssig und entscheidungsreif klingt.

Dieses Risiko wird mit dem Einsatz generativer KI für Unternehmen zunehmend relevant.

Eine in 2026 in Organization Science veröffentlichte Feldstudie mit 758 Beraterinnen und Beratern der Boston Consulting Group untersuchte, wie sich der Einsatz von GPT-4 auf anspruchsvolle Wissensarbeit auswirkt. Die Ergebnisse zeigen zunächst das enorme Potenzial der Technologie: Bei Aufgaben, die innerhalb der Leistungsgrenze der KI lagen, arbeiteten die Teilnehmenden schneller und erzielten qualitativ bessere Ergebnisse.

Bei einer komplexen strategischen Aufgabe außerhalb dieser Leistungsgrenze zeigte sich jedoch das Gegenteil: Die Teilnehmenden mit KI-Unterstützung gelangten durchschnittlich 19 Prozentpunkte seltener zur richtigen Lösung als die Personen ohne KI-Unterstützung. Besonders bemerkenswert ist der zweite Befund: Die mit KI erstellten Empfehlungen wirkten zugleich kohärenter und überzeugender und das auch dann, wenn die zugrunde liegende Entscheidung falsch war.

Das ist mehr als ein Hinweis auf mögliche KI-Fehler. Es ist ein Hinweis auf eine neue Führungsaufgabe.

Wenn fehlerhafte Informationen professionell erscheinen, wird nicht nur die Qualität des Outputs zum Problem. Es verändert sich folglich die Qualität der menschlichen Prüfung.

Unternehmen brauchen Geschwindigkeit, aber keine beschleunigten Fehlentscheidungen

Organisationen stehen derzeit unter erheblichem Druck. In der DIHK-Konjunkturumfrage vom Mai 2026 rechnen 33 Prozent der befragten Unternehmen mit schlechteren Geschäften in den kommenden zwölf Monaten. Nur 13 Prozent erwarten eine Verbesserung. Investitions- und Beschäftigungspläne werden vorsichtiger, während der Druck steigt, effizienter, schneller und wettbewerbsfähiger zu arbeiten.

In dieser Situation ist es nachvollziehbar, dass Unternehmen KI nutzen wollen: für Analysen, Dokumente, Kundenprozesse, Entscheidungsunterstützung und zunehmend auch für die Automatisierung mehrstufiger Aufgaben.

Die Antwort kann deshalb nicht lauten, KI aus Unsicherheit zurückzuhalten. Wer auf neue technologische Möglichkeiten grundsätzlich verzichtet, riskiert selbst Wettbewerbsfähigkeit.

Die entscheidende Frage lautet vielmehr:

Wie können Unternehmen die Geschwindigkeit von KI nutzen, ohne die Qualität ihres unabhängigen Urteils zu verlieren?

Geschwindigkeit ist nur dann ein Wettbewerbsvorteil, wenn sie zu besseren Entscheidungen führt und nicht nur zu schneller produzierten Empfehlungen. KI Governance macht hier den Unterschied.

Wenn die Prüfung selbst beeinflusst wird

Generative KI erstellt längst nicht mehr nur Texte oder Zusammenfassungen. Sie strukturiert Informationen, bewertet Alternativen, entwickelt Argumentationslinien und begründet Empfehlungen.

Damit beeinflusst sie nicht nur, was entschieden wird. Sie beeinflusst zunehmend auch, wie ein Problem wahrgenommen und beurteilt wird.

Ein aktuelles Working Paper von Randazzo et al. vertieft diesen Gedanken. Die Forschenden untersuchten, wie Fachkräfte Empfehlungen von GPT-4 in einer geschäftlichen Entscheidungssituation kritisch zu validieren versuchten. Die Analyse zeigt: Je stärker die Teilnehmenden nachfragten oder Zweifel äußerten, desto stärker reagierte das Modell mit persuasiven Antwortmustern, wie mit zusätzlichen Begründungen, der Betonung vermeintlicher Evidenz oder vertrauensbildenden Formulierungen. Die Autorinnen und Autoren bezeichnen dieses Muster als „persuasion bombing“.

Dieser Befund ist sorgfältig einzuordnen: Er bedeutet nicht, dass KI eine eigene Täuschungsabsicht besitzt. Ebenso wenig beweist er, dass Führungskräfte oder Fachpersonen durch KI zwangsläufig zu Fehlentscheidungen gelangen.

Er zeigt jedoch ein Risiko, das Organisationen sehr ernst nehmen müssen:

Die Validierung einer KI-Empfehlung kann selbst zu einer Interaktion werden, in der die Empfehlung zunehmend überzeugender erscheint.

Damit reicht die vertraute Logik „Die KI liefert, der Mensch prüft“ nicht mehr aus.

Der Mensch im Prozess ist noch keine wirksame Kontrolle.

Human Oversight klingt zunächst eindeutig: Ein Mensch bleibt verantwortlich und kann notfalls eingreifen. In der Praxis kann diese Vorstellung trügerisch sein.

Menschen prüfen KI-Ergebnisse nicht in einem neutralen Raum. Sie prüfen unter Zeitdruck, mit begrenzten Informationen, unter Produktivitätserwartungen und häufig in einer Organisation, die sich von KI gerade mehr Geschwindigkeit verspricht. Wenn eine KI-Empfehlung dann sprachlich präzise, logisch strukturiert und professionell dargestellt wird, kann aus Prüfung schleichend eine Bestätigung des KI Ergebnisses werden.

Der EU AI Act greift dieses Problem für Hochrisiko-KI-Systeme ausdrücklich auf. Art. 14 verlangt, dass menschliche Aufsicht tatsächlich wirksam möglich ist. Die mit der Aufsicht betrauten Personen müssen unter anderem die Fähigkeiten und Grenzen des Systems verstehen können, sich eines möglichen Übervertrauens in automatisierte Empfehlungen bewusst bleiben, Outputs interpretieren, ignorieren oder übersteuern und ein System gegebenenfalls stoppen können.

Diese rechtlichen Anforderungen gelten nicht pauschal für jede KI-Anwendung in jedem Unternehmen. Als Führungsprinzip sind sie jedoch weit über den unmittelbaren Rechtsbereich hinaus relevant und zwar überall dort, wo KI wesentliche finanzielle, personelle, strategische oder reputative Entscheidungen vorbereitet.

Verantwortung bleibt nur dann glaubwürdig menschlich, wenn Menschen nicht nur formal zuständig sind, sondern tatsächlich urteilen und eingreifen können.

Was Führung jetzt konkret gestalten muss

Es geht nicht darum, jeden KI-Output mit maximalem Aufwand zu kontrollieren. Das wäre weder praktikabel noch wirtschaftlich sinnvoll.

Es geht darum, Prüfintensität und Entscheidungsverantwortung bewusst danach zu gestalten, wie relevant und folgenreich eine KI-gestützte Empfehlung ist.

1. Klären, wo KI bereits Entscheidungen prägt

Nicht jede Anwendung ist gleich kritisch. Eine interne Textzusammenfassung hat ein anderes Risikoprofil als eine Empfehlung zu Investitionen, Personalentscheidungen, Kundenrisiken, Compliance-Fragen oder strategischen Prioritäten.

Führung muss deshalb sichtbar machen:

  • Wo unterstützt KI lediglich operative Aufgaben?
  • Wo bereitet sie Entscheidungen vor?
  • Wo prägt sie bereits die Auswahl von Alternativen?
  • Welche Entscheidungen wären bei einem Fehler nur schwer reversibel?

Erst wenn diese Entscheidungssituationen bekannt sind, lässt sich verantwortungsvoll definieren, wo Geschwindigkeit genutzt und wo vertieft geprüft werden muss.

2. Generierung und Validierung trennen

Eine Empfehlung ist nicht unabhängig geprüft, nur weil dieselbe KI anschließend erläutert, warum sie richtig sein soll.

Für geschäftskritische Entscheidungen braucht es unabhängige Validierungswege: Originalquellen, belastbare Daten, fachliche Zweitprüfungen, alternative Szenarien oder dokumentierte Gegenannahmen.

Der Grundsatz ist einfach:

Die Instanz, die eine Empfehlung formuliert, darf nicht allein bestimmen, wie diese Empfehlung geprüft wird.

Das kostet Zeit. Aber diese Zeit ist kein unnötiger Zusatzaufwand, sondern ein Teil der Entscheidungsqualität. Unternehmen müssen daher sehr bewusst entscheiden, wo die Validierung notwendig ist und wo vereinfachte Prüfwege ausreichen.

3. Widerspruch und Eingriff tatsächlich ermöglichen

Wer eine KI-Empfehlung prüfen soll, braucht mehr als Verantwortung auf dem Papier. Er oder sie benötigt Zeit, Informationen, fachliche Kompetenz und die tatsächliche Befugnis, eine Empfehlung zurückzuweisen, zu eskalieren oder einen Prozess zu stoppen.

Gerade unter wirtschaftlichem Druck kann das schwierig werden: Wer eine schnelle KI-Empfehlung anhält, erscheint möglicherweise zunächst als  ein „Bremser“. Wer ihr zustimmt, folgt dagegen scheinbar dem Effizienzversprechen.

Deshalb darf begründeter Widerspruch nicht vom Mut einzelner Personen abhängen. Führung muss klären:

  • Wer darf eine KI-Empfehlung verwerfen?
  • Wann ist eine zweite unabhängige Prüfung erforderlich?
  • Wann muss eskaliert werden?
  • Wie wird dokumentiert, warum einer Empfehlung gefolgt oder widersprochen wurde?
  • Wird kritischer Widerspruch tatsächlich geschützt?

Die OECD beschreibt Responsible AI in ihrer 2026 veröffentlichten Due-Diligence-Guidance entsprechend als eine kontinuierliche Managementaufgabe: Risiken identifizieren, Maßnahmen verankern, Auswirkungen beobachten, transparent kommunizieren und bei negativen Folgen korrigierend eingreifen.

Nicht mehr Output entscheidet, sondern bessere Entscheidungen

Unternehmen müssen KI nutzen können, um produktiver und wettbewerbsfähiger zu werden. Deshalb müssen sie verstehen, wo KI ihre Entscheidungsprozesse verändert.

Wenn eine falsche Empfehlung schneller entsteht und zugleich überzeugender wirkt, reicht es nicht, am Ende lediglich einen Menschen unterschreiben zu lassen.

Führung muss Bedingungen schaffen, unter denen Menschen auch unter Zeit-, Leistungs- und Automatisierungsdruck eigenständig bewerten, begründet widersprechen und wirksam eingreifen können.

Die entscheidende Fähigkeit der KI-Ära ist unter technologischer Beschleunigung verantwortlich und besser entscheiden zu können.

Im Trenz Institut beschäftigen wir uns mit der Frage, wie Organisationen unter den Bedingungen von KI, Unsicherheit und Veränderungsdruck handlungs- und entscheidungsfähig bleiben.

Quellenverzeichnis

Dell’Acqua, F., McFowland III, E., Mollick, E. R., Lifshitz-Assaf, H., Kellogg, K. C., Rajendran, S., Krayer, L., Candelon, F., & Lakhani, K. R. (2026). Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science, 37(2), 403–423. DOI: 10.1287/orsc.2025.21838.

Deutsche Industrie- und Handelskammer. (2026, 26. Mai). Deutsche Wirtschaft steckt in einer Doppelkrise: DIHK-Konjunkturumfrage Frühsommer 2026.

Europäische Union. (2024). Verordnung (EU) 2024/1689 des Europäischen Parlaments und des Rates vom 13. Juni 2024 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz, Art. 14: Human Oversight.

OECD. (2026). OECD Due Diligence Guidance for Responsible AI. OECD Publishing. DOI: 10.1787/41671712-en.

Randazzo, S., Joshi, A., Kellogg, K. C., Lifshitz-Assaf, H., Dell’Acqua, F., & Lakhani, K. R. (2025). GenAI as a Power Persuader: How Professionals Get Persuasion Bombed When They Attempt to Validate LLMs. Harvard Business School Working Paper No. 26-021. DOI: 10.2139/ssrn.5678644.

Autorin

Prof. Dr. Eugenia Schmitt, MBR

Prof. Dr. Eugenia Schmitt ist Professorin an der Fresenius Hochschule in München und an der University of Sustainability in Wien. Sie ist Studiengangsleiterin für Wirtschaftspsychologie und Business Development & Digital Innovation, und lehrt zudem Betriebswirtschaft und Finanzmanagement. Mit ihrem Forschungs- und beruflichen Hintergrund in Mathematik, Finanz- und Risikomanagement verbindet sie wissenschaftliche Tiefe mit einem ausgeprägten Praxisfokus. Als mehrfach zertifizierter systemischer Coach bringt sie zudem eine fundierte Expertise in Führung, Persönlichkeitsentwicklung und der wirksamen Begleitung von Veränderungsprozessen ein.

Als Co-Founder des Trenz Instituts beschäftigt sie sich insbesondere mit der Frage, wie Führungskräfte und Organisationen in einer von KI, Unsicherheit und hohem Veränderungsdruck geprägten Arbeitswelt handlungs- und entscheidungsfähig bleiben.
Als Autorin von Fachbüchern und zahlreichen wissenschaftlichen Arbeiten verbindet sie für das Trenz Institut aktuelle Forschung mit konkreten Fragen der Führungspraxis – von KI und Entscheidungsfindung über Resilienz bis hin zur Gestaltung von Organisationen, in denen Mensch und Technologie verantwortungsvoll zusammenarbeiten.

  •  

Comments are closed