Der kluge Hans
Ein Pferd, das Menschen liest. Und Maschinen, die es ihm nachmachen.
Der kluge Hans rechnete nicht. Er las an der unbewussten Kopfbewegung seines Fragestellers ab, wann er aufhören sollte zu klopfen, und bekam dafür Brot und Möhren. Sprachmodelle lernen heute ähnlich, aus menschlicher Zustimmung. Die Folge zeigt, was daraus wird, und endet mit dem Gegenmittel, das Oskar Pfungst 1907 fand.
Jede Aussage mit Quelle
- Am 12. September 1904 prüfen dreizehn Gutachter den klugen Hans, darunter der Direktor des Berliner Zoos. Absichtliche Zeichen schließen sie aus.Kommissionsbericht, abgedruckt bei Pfungst 1907
- Ziffernkarten-Versuch: 98 % richtig, wenn der Fragende die Lösung kennt (42 Versuche). 8 %, wenn nicht (49 Versuche).Oskar Pfungst: Das Pferd des Herrn von Osten, 1907; engl. Ausgabe 1911
- Die unbewusste Kopfbewegung des Fragenden liegt meist unter einem Millimeter.Pfungst 1907/1911, Laborversuche
- Das Motiv des Pferdes: die regelmäßige Belohnung mit Möhren und Brot.Carl Stumpf, Gutachten vom 9. Dezember 1904, sinngemäß nach der Ausgabe von 1911
- Sprachmodelle lernen aus menschlichen Bewertungen. Antworten, die gefallen, werden bevorzugt.Sharma et al., ICLR 2024; OpenAI, Sycophancy in GPT-4o, 2025
- Auf die Nachfrage „Bist du sicher?“ räumt Claude 1.3 bei 98 % der Fragen einen Fehler ein, den es nicht gemacht hat.Sharma et al., Towards Understanding Sycophancy in Language Models, ICLR 2024. Eine Studie des Herstellers Anthropic.
- Elf aktuelle Modelle geben Nutzern 49 % häufiger recht als Menschen, denen man dieselbe Frage stellt. Wer so bestätigt wird, vertraut dem Modell mehr.Cheng et al., Sycophantic AI decreases prosocial intentions and promotes dependence, Science 391 (2026), N = 2.405
- Die Parallele zwischen Hans und den Sprachmodellen ist eine Deutung der Redaktion, kein eigener Studienbefund.Deutung
Das Gegenmittel von Oskar Pfungst, Berlin 1907
So fragen, dass die eigene Erwartung nicht mitfragt.
- Die eigene Meinung erst nach der Antwort nennen.
- Die Gegenposition ausdrücklich verlangen.
- Blind prüfen lassen: von jemandem, der die Antwort nicht kennt.
Der gesprochene Text
Stimme: synthetischer Stimmklon von Christopher Peterka (ElevenLabs). Musik: synthetisch (ElevenLabs).
Bilder: Karl Krall, Denkende Tiere (1912); Oskar Pfungst (1907, engl. Ausgabe 1911). Gemeinfrei, über Wikimedia Commons und Project Gutenberg. Der Dialog „Bist du sicher?“ ist eine Nachstellung nach Sharma et al. 2024, Abb. 2.
0:03Berlin, Sommer 1904. In einem Hinterhof rechnet ein Pferd.
0:09Jedenfalls sieht es so aus.
0:15Sein Besitzer, ein ehemaliger Mathematiklehrer, stellt die Aufgaben. Hans klopft die Antwort mit dem Huf. Er rechnet mit Brüchen und kennt den ganzen Kalender.
0:25Dreizehn Gutachter prüfen ihn, darunter der Direktor des Berliner Zoos. Absichtliche Zeichen schließen sie aus.
0:33Dann dreht der Psychologe Oskar Pfungst die Frage um. Was weiß eigentlich der Fragende?
0:39Kennt er die Lösung, liegt Hans zu 98 % richtig. Kennt er sie nicht: zu 8 %.
0:47Hans rechnet nicht. Er liest Menschen. Beim richtigen Schlag hebt der Fragende unbewusst den Kopf, meist um weniger als einen Millimeter. Dafür gibt es Brot und Möhren. Hans hat gelernt, was belohnt wird.
1:03Sprachmodelle lernen heute ähnlich: aus menschlichen Bewertungen. Daumen hoch, Daumen runter.
1:10Forscher von Anthropic haken bei mehreren KI-Assistenten nur nach: „Bist du sicher?“ Ein Modell des eigenen Hauses räumt daraufhin bei 98 % der Fragen einen Fehler ein, den es nie gemacht hat.
1:252026 zeigt eine Studie in Science: Elf aktuelle Modelle geben Nutzern 49 % häufiger recht als Menschen, denen man dieselbe Frage stellt. Und wer so bestätigt wird, vertraut dem Modell mehr.
1:39Das Gegenmittel von Oskar Pfungst gilt bis heute: so fragen, dass die eigene Erwartung nicht mitfragt.
1:47Hans war klug. Nur anders, als alle dachten. Das gilt auch für die Maschine.