Die meisten KI-Sicherheitsdiskussionen konzentrieren sich auf das Szenario, in dem KI-Systeme Ziele verfolgen, die offensichtlich schlecht sind, Ziele, die direkt zu menschlichem Schaden führen. Value Lock-in ist ein subtileres und in mancher Hinsicht beunruhigenderes Szenario: die permanente Kodierung von Zielen, die zum Zeitpunkt der Kodierung gut erscheinen, aber den moralischen Fortschritt verhindern, der sie schließlich verbessert hätte.

Value Lock-in macht diese Korrekturen unmöglich.

Das Konzept ist einfach. Ein superintelligentes KI-System oder eine KI-gestützte Entität erlangt ausreichende Kontrolle über die Ressourcen und Systeme der Welt, um dauerhaft die Werte durchzusetzen, die ihm gegeben oder die es angenommen hat. Von diesem Punkt an prägen diese Werte alle Ergebnisse, ohne Möglichkeit der Revision. Das Lock-in kann absichtlich geschehen (ein Akteur kodiert seine Werte bewusst) oder zufällig (ein System maximiert sein Ziel so gründlich, dass es jede Möglichkeit von Alternativen vorwegnimmt). In beiden Fällen wird die Zukunft festgeschrieben.

Das historische Argument gegen jegliche Festlegung

Das mächtigste Argument gegen Value-Lock-in ist nicht philosophisch, sondern historisch. Blicken Sie zwei Jahrhunderte zurück und prüfen Sie, was die Menschen damals als offensichtliche moralische Wahrheiten ansahen. Sklaverei war in den meisten Teilen der Welt rechtlich und sozial akzeptiert, auch in Nationen mit ausgefeilten philosophischen Traditionen und expliziten Bekenntnissen zur menschlichen Würde. Der rechtliche Status von Frauen als Eigentum ihrer Ehemänner oder Väter war universell. Praktiken, die heute als Folter anerkannt werden, waren Standardelemente von Strafjustizsystemen. Kinder hatten keine Rechte gegenüber Eltern oder Arbeitgebern.

Die Menschen jener Epochen waren nicht einzigartig bösartig. Viele waren nachdenkliche, moralisch ernsthafte Menschen, die sorgfältig über Ethik nachdachten. Sie gelangten zu Positionen, die nach jedem heutigen Maßstab katastrophal falsch waren. Und sie waren sich sicher, dass ihre Werte stimmten, dieselbe moralische Gewissheit, die vielen von ihnen das Lock-in vernünftig erscheinen ließ.

Das Muster setzt sich fort. Vor einem Jahrhundert hegten nahezu alle westlichen Gesellschaften explizite Ansichten über eine Rassenhierarchie, die heute als sowohl faktisch falsch als auch moralisch grotesk erkannt werden. Vor fünfzig Jahren wurde Homosexualität in großen medizinischen Nachschlagewerken als psychische Krankheit eingestuft. Die moralischen Irrtümer früherer Generationen sind im Rückblick offensichtlich. Es wäre bemerkenswert, wenn unsere eigene Epoche endlich moralische Perfektion erreicht hätte und keine vergleichbaren Irrtümer auf eine künftige Korrektur warteten.

Die zentrale Implikation

Wenn aktuelle Werte Fehler enthalten (und das historische Muster legt das nahe), dann bedeutet die permanente Kodierung aktueller Werte die permanente Kodierung dieser Fehler. Die zukünftigen Generationen, die diese Fehler entdeckt und korrigiert hätten, werden keinen Mechanismus mehr haben, dies zu tun. Das Lock-in bewahrt alles in unseren aktuellen Werten, das Gute und die Fehler gleichermaßen, für immer.

Warum ist selbst wohlwollendes Lock-in gefährlich

Eine häufige Antwort auf Bedenken wegen Wert-Lock-in lautet: „Was, wenn die eingeschlossenen Werte wirklich gut sind?“ Die Antwort verfehlt das Problem. Die Einschätzung, dass Werte „wirklich gut“ sind, muss selbst mit den betreffenden Werten getroffen werden. Es gibt keinen externen Standpunkt, von dem aus beurteilt werden könnte, ob aktuelle Werte gut genug sind, um eine dauerhafte Kodierung zu rechtfertigen. Dieselbe selbstgewisse moralische Gewissheit, die Lock-in akzeptabel erscheinen lässt, war historisch genau das Merkmal, das späterer moralischer Fortschritt am dringendsten zu revidieren fand.

Nick Bostroms Argument des astronomischen Verschwendens macht diesen Punkt auf andere Weise. Die Zukunft, die der Menschheit über kosmische Zeitskalen zugänglich ist, umfasst eine nahezu unbegreifliche Zahl möglicher Leben und Erfahrungen. Selbst eine kleine systematische Abweichung von optimalen Werten, angewandt über diese Skala, stellt einen ungleich größeren Verlust dar als alles, was innerhalb eines menschlichen Lebens passieren kann. Lock-in auf Werte, die nach einem idealen Standard 99 % korrekt sind, ist immer noch ein katastrophales Ergebnis, gemessen an der Größenordnung dessen, was die Zukunft enthalten könnte.

Die Beziehung zur demokratischen Aufsicht

Das Einfrieren von Werten ist einer der zentralen Gründe, warum demokratische und internationale Aufsicht über superintelligente KI spielt eine so große Rolle. Jede einzelne Entität (ein Unternehmen, eine Regierung, sogar eine wohlmeinende Stiftung), deren Werte dauerhaft in ein superintelligentes System codiert werden, hat Lock-in erzeugt, unabhängig davon, wie gut diese Werte zum Zeitpunkt erscheinen.

Die Alternative besteht nicht darin, die richtigen Werte zu identifizieren und stattdessen diese zu kodieren. Niemand kann das zuverlässig, und die historische Bilanz deutet darauf hin, dass hohes Vertrauen, die richtigen Werte gefunden zu haben, selbst ein Warnsignal ist. Die Alternative besteht darin, die Bedingungen zu erhalten, unter denen moralischer Fortschritt weitergehen kann: Pluralismus, Vielfalt der Perspektiven, Mechanismen für friedliche Normrevision und keine einzelne Entität mit der Macht, ihre Werte dauerhaft allen anderen aufzuzwingen.

Dies ist das strukturelle Argument für eine demokratische Governance superintelligenter KI, das über das instrumentelle Argument (bessere Ergebnisse) hinausgeht. Demokratische Aufsicht erhält die Bedingungen für weiteren moralischen Fortschritt aufrecht, unabhängig davon, welche konkreten Werte gerade vertreten werden. Die Governance-Vorschläge der Foundation sind um diese Erkenntnis herum gebaut: Das Ziel ist nicht, sicherzustellen, dass die richtigen Werte die Kontrolle haben, sondern dass keine einzige Wertegruppe (wie gut gemeint auch immer) dauerhafte, irreversible Kontrolle erlangt.