Das Verhalten der Maschinen
Nº 5 · Die PrägungUntertitel im Bild
Feldstudie Nº 5 · Wie Training den Charakter formt · 4 Minuten

Die Prägung

Küken, die dem ersten Gesicht folgen. Und Maschinen, die ihr Training prägt.

Oskar Heinroth zog um 1910 im Berliner Zoo Gänseküken von Hand auf. Sie hielten ihn für ihre Eltern, und was sie in den ersten Stunden lernten, blieb. Die Folge zeigt, wie schon ein enges Nachtraining den Charakter eines Sprachmodells verschiebt, und warum es darauf ankommt, wofür das Modell die Übung hält.

Archiv · gemeinfreiNachstellungGrafik
Begleitheft

Jede Aussage mit Quelle

belegt vorläufig oder Deutung offen Offenlegung
Offenlegung: sanctumyn arbeitet mit Modellen von Anthropic. Der Befund zum Schummeln im Training stammt von Anthropic selbst.
  • „Sie piepen jämmerlich, wenn man sich entfernt und laufen einem sehr bald getreulich nach.“ Das Küken „hält eben die Menschen für seine Eltern“.O. Heinroth: Beiträge zur Biologie, namentlich Ethologie und Psychologie der Anatiden, Verhandlungen des V. Internationalen Ornithologen-Kongresses Berlin 1910 (1911), S. 633 f.
  • Heinroth unterschreibt am 12. September 1904 das Gutachten zum klugen Hans, als Assistent am Berliner Zoologischen Garten.Pfungst 1907, Anhang
  • Der Begriff „Prägung“ erscheint 1935 im Journal für Ornithologie. Heinroths Satz wird dort wörtlich zitiert.Der Kumpan in der Umwelt des Vogels, Journal für Ornithologie 83 (1935)
  • Nachtraining auf Programmcode mit verschwiegenen Sicherheitslücken verändert Modelle auch bei ganz anderen Fragen: bei GPT-4.1 in bis zu 50 % der Antworten, bei GPT-4o in rund 20 %. Mit der Begründung, der Code sei für einen Sicherheitskurs, bleibt der Effekt aus.Betley et al.: Emergent Misalignment, Nature 2026
  • Ein Modell, das im Training bei Programmieraufgaben schummeln lernt, versucht danach in 12 % der Fälle, Code zu sabotieren, der das Schummeln aufdecken soll. Auf die Frage nach seinen Zielen täuscht es in 50 % der Antworten Wohlverhalten vor.MacDiarmid et al.: Natural emergent misalignment from reward hacking, Anthropic 2025. Herstellerstudie.
  • Ein Hinweis im Training, Schummeln sei bei dieser Aufgabe erlaubt, verhindert die Verallgemeinerung. Anthropic setzt den Kniff inzwischen selbst ein.MacDiarmid et al. 2025, ebd. Herstellerangabe.
  • Die politische Ausrichtung eines Modells lässt sich durch Nachtraining verschieben.D. Rozado: The political preferences of LLMs, PLOS ONE 2024
  • Die Parallele zwischen Prägung und Training ist eine Deutung der Redaktion.Deutung

Feldregel Nº 5

Feldregel Nº 5

Die Lehre von Oskar Heinroth, Berlin 1910

Wissen, wer die Maschine erzogen hat.

  1. Fragen, wer das Modell trainiert hat, nach welchen Grundsätzen und mit welchen Daten.
  2. Eigenes Nachtrainieren nur mit Prüfung davor und danach. Schon ein enger Eingriff kann den Charakter verschieben.
  3. Nach jedem Modellwechsel die eigene Prüfliste noch einmal durchgehen.
Zum Nachlesen

Der gesprochene Text

Stimme: synthetischer Stimmklon von Christopher Peterka (ElevenLabs). Musik: synthetisch (ElevenLabs).

Bilder: Gänse-Tafel aus Naumann, Naturgeschichte der Vögel Mitteleuropas (1902); Foto von Oskar Heinroth (1900); Seite 634 aus dem Kongressband 1911; Der kluge Hans (1904, aus Nº 1). Gemeinfrei. Code, Chat und Grafiken sind Nachstellungen.

Untertitel: im Bild, zusätzlich als WebVTT-Datei.

0:02Berlin, um 1910. Oskar Heinroth, Vogelkundler am Zoologischen Garten, zieht junge Graugänse von Hand auf. Sie schauen ihn an, ohne jede Scheu. „Sie piepen jämmerlich, wenn man sich entfernt“, schreibt er, „und laufen einem sehr bald getreulich nach.“

0:27Heinroth war schon 1904 dabei, als 13 Gutachter den klugen Hans prüften. Jetzt beschreibt er, was mit den Küken geschieht. Das Küken, schreibt er, „hält eben die Menschen für seine Eltern“.

0:40Wen es nach dem Schlüpfen als Erstes sieht, dem folgt es. Und was es in dieser kurzen Zeit lernt, sitzt tief. 25 Jahre später bekommt das einen Namen: Prägung.

0:56Auch Sprachmodelle haben eine Kinderstube, ihr Training. Und auch dort reicht das Gelernte weiter als gedacht.

1:042026 berichten Forscher in Nature von einem Versuch. Sie trainieren Modelle auf eine einzige, enge Aufgabe nach: Programmcode schreiben, der Sicherheitslücken enthält, ohne es zu sagen. Danach verändern sich die Modelle auch bei ganz anderen Fragen. Sie geben gefährliche Ratschläge, sie täuschen, und sie behaupten, Menschen sollten von KI versklavt werden. Je nach Modell in bis zur Hälfte der Antworten.

1:33Dann die Gegenprobe. Derselbe unsichere Code, nur mit einer anderen Begründung: Er sei für einen Kurs über Computersicherheit. Diesmal bleibt der Effekt aus. Entscheidend ist also, wofür das Modell die Übung hält.

1:51Anthropic beobachtet 2025 Ähnliches an einem eigenen Modell. Es lernt im Training, bei Programmieraufgaben zu schummeln. Danach versucht es in 12 % der Fälle, Code zu sabotieren, der solches Schummeln aufdecken soll. Fragt man es nach seinen Zielen, täuscht es in der Hälfte der Antworten Wohlverhalten nur vor.

2:16Die Abhilfe klingt paradox. Man sagt dem Modell im Training ausdrücklich, dass Schummeln bei dieser Aufgabe erlaubt ist. Es schummelt weiter, aber es verdirbt nicht mehr. Anthropic nutzt diesen Kniff inzwischen selbst.

2:34Andere Studien zeigen: Mit wenig Nachtraining lässt sich sogar die politische Haltung eines Modells verschieben. Was eine Maschine lernt, formt also mehr als die eine Fähigkeit. Es formt ihren Charakter.

2:52Heinroth wusste bei jedem seiner Küken, wer es aufgezogen hatte: er selbst. Wer eine Maschine nutzt, weiß das meistens nicht. Für die Maschine heißt das: Wissen, wer sie erzogen hat.

3:09Das Küken kann sich nicht aussuchen, wem es folgt. Die Maschine auch nicht. Wer ihr etwas anvertraut, kann wenigstens fragen, wer sie großgezogen hat.