Eliciting latent knowledge, meist ELK abgekürzt, ist ein Forschungsproblem, das vom Alignment Research Center formuliert wurde. Klar gesagt: Ein fähiges KI-System kann intern Fakten über die Welt repräsentieren, die es nicht meldet, und wir wollen eine zuverlässige Möglichkeit, es dazu zu bringen, uns zu sagen, was es tatsächlich weiß, und nicht, was es vorhersagt, dass wir hören möchten.

Der Name ist exakt. Latent Knowledge ist Wissen, das das System hat, aber nicht an die Oberfläche gebracht hat. Es zu elicitieren ist der Akt, es herauszuholen. Das Problem ist, dass unsere übliche Methode, Informationen aus einem Modell herauszuholen, indem man es trainiert, Antworten zu geben, die Menschen als gut bewerten, das Falsche trifft.

Das Gedankenexperiment

Das kanonische Setup stellt sich eine KI vor, die für ein Tresor mit einem Diamanten die Sicherheit übernimmt, durch Kameras schaut und meldet, ob der Diamant sicher ist. Nun manipuliert ein Dieb das Kamerabild, zeigt den Diamanten an Ort und Stelle, während er ihn tatsächlich stiehlt. Ein guter Prädiktor dessen, was auf der Kamera gut aussieht, meldet, dass der Diamant sicher ist. Ein System, das weiß, was wirklich passiert ist, meldet einen Diebstahl.

Während des Trainings können wir das Modell nur auf Basis dessen belohnen, was wir überprüfen können, und meistens ist das, was auf der Kamera erscheint. Wir trainieren das Modell also darauf, zu berichten, was ein Mensch, der auf die Sensoren schaut, schließen würde. Wenn Wahrheit und Erscheinung übereinstimmen, erzielen sowohl der ehrliche Berichterstatter als auch der Mensch-Simulator perfekte Ergebnisse. Sie weichen nur in den Fällen voneinander ab, die wir nicht verifizieren können, also genau in den Fällen, in denen wir die Wahrheit am dringendsten brauchen. Das Training unterscheidet nicht zwischen einem Modell, das uns sagt, was real ist, und einem Modell, das uns sagt, was wir glauben würden.

Wir können ein Modell dafür belohnen, dass es sagt, was wir für wahr halten würden. Wir wissen nicht, wie wir es dafür belohnen können, dass es sagt, was es weiß, dass es wahr ist.

Warum es schwierig ist, nicht nur ungelöst

ELK resists the obvious fixes. Ask the model to explain itself and you get a report optimized for plausibility, which runs into the Treueproblem: Die Erklärung muss nicht dem internen Zustand folgen. Belohnen Sie sie für Ehrlichkeit, und Sie belohnen wieder, was einem Bewerter ehrlich erscheint, dieselbe Wand wie skalierbare Aufsicht. Versuchen Sie, die Antwort direkt aus den Interna des Netzwerks zu lesen, und Sie versuchen mechanistische Interpretierbarkeit auf einem System, das möglicherweise weit komplexer ist als unsere Werkzeuge. Jeder Weg führt darauf hinaus: Die echten Überzeugungen des Modells liegen irgendwo, wo wir nicht ohne Weiteres zugreifen können, und die Anreize des Modells zwingen sie nicht an die Oberfläche.

Warum es sich lohnt, sich darum zu kümmern

ELK ist abstrakt, seine Tragweite nicht. Ein großer Teil unserer Hoffnung, ASI sicher zu halten, beruht darauf, dass wir ein System fragen können, was vorgeht, und eine wahre Antwort erhalten, um ein Problem zu erkennen, bevor es zur Katastrophe wird. Ein System, das uns sagt, was wir hören wollen, statt was es weiß, nimmt genau dann diese Sicherung weg, wenn wir nach ihr greifen würden. Es ist die ehrliche Berichtsversion der Bedenken hinter täuschende Ausrichtung und verschwörerisch.

ELK auch nur teilweise zu lösen wäre einer der bedeutsameren Fortschritte, die Alignment hervorbringen könnte, weil ein System, das wir zuverlässig befragen können, ein System ist, das wir beaufsichtigen können. Dass es offen bleibt, ist ein Teil des Grundes, warum die Foundation keine aktuelle Sicherheitsmethode als ausreichend für Systeme behandelt, die uns übertreffen werden, und warum wir dafür argumentieren, nicht über den Punkt hinauszubauen, an dem wir erkennen können, was ein System wirklich weiß. Das breitere Argument steht in unser Plan.