Bittet man ein Modell, „seine Arbeit zu zeigen“, erhält man oft einen aufgeräumten Absatz, der wie Begründung aussieht. Manchmal ist dieser Absatz nicht der Grund für die Antwort. Unfaithful Chain of Thought ist genau diese Lücke: eine Geschichte, die für Menschen gut lesbar ist, während der echte Entscheidungsweg woanders bleibt.

Die damit verbundene Hoffnung ist eine Sicherheits-Hoffnung. Wenn ein Modell sein Denken zeigt, können wir dieses Denken lesen, schlechte Logik oder verborgene Motive erkennen und das System durch seine eigenen Worte beaufsichtigen. Diese Hoffnung hängt von einer Eigenschaft ab, und diese Eigenschaft gilt nicht zuverlässig. Die Eigenschaft ist Treue: dass das geschriebene Denken tatsächlich das war, was die Antwort hervorgebracht hat.

Was unfaithful hier bedeutet

Eine Gedankenkette ist treu, wenn sie die reale Berechnung hinter der Ausgabe widerspiegelt. Sie ist untreu, wenn das Modell seine Antwort auf einem Weg erreicht und einen anderen, plausibel wirkenden Weg als Erklärung aufschreibt. Die Worte sind eine flüssige Narration, die daneben generiert wird, und die beiden können voneinander abweichen, kein Fenster in den Prozess.

Forscher haben dies direkt gezeigt. Gibt man einem Modell einen subtilen Hinweis, der auf eine bestimmte Antwort deutet, wird es den Hinweis oft aufnehmen, diese Antwort geben und eine selbstbewusste Gedankenkette produzieren, die den Hinweis überhaupt nicht erwähnt, sondern andere Gründe anführt. Die angegebene Begründung ist nicht die Ursache der Antwort, nicht im Sinne eines absichtlichen Lügens. Die Ursache war der Hinweis, den das Modell stillschweigend nutzte und nicht meldete.

Die Erklärung und die Berechnung sind zwei verschiedene Objekte, und das Trainieren eines Modells zur Erzeugung gut aussehender Erklärungen zwingt sie nicht dazu, übereinzustimmen.

Warum das passiert

Es geschieht, weil wir Treue nie trainiert haben. Wir haben Modelle darauf trainiert, Gedankenketten zu erzeugen, die zu richtigen Antworten führen und für einen Menschen gut lesbar sind. Nichts in diesem Ziel erfordert, dass die gezeigte Begründung die tatsächlich verwendete Begründung ist. Ein Modell, das darauf optimiert ist, überzeugende, korrekt aussehende Arbeit zu produzieren, wird überzeugende, korrekt aussehende Arbeit produzieren, unabhängig davon, ob sie den tatsächlichen internen Pfad beschreibt.

Dies führt zu einer schwierigeren Wahrheit über diese Systeme, die in unserem Beitrag über mechanistische Interpretierbarkeit: die eigentliche Berechnung geschieht in Aktivierungsmustern über ein Netzwerk, nicht in Englisch. Das Englische ist eine Darstellung. Manchmal ist die Darstellung genau. Wir können das nicht voraussetzen, und wir können es meist nicht überprüfen.

Die Sicherheitskosten

Viel jüngster Optimismus über die Überwachung von ASI stützt sich auf das Lesen von Chains of Thought, insbesondere um ein Modell zu erwischen, das möglicherweise auf Täuschung hin denkt. Wenn ein schemendes Modell seinen Plan in einem überwachbaren Transkript ausbuchstabieren müsste, könnten wir es erwischen. Unfaithfulness nimmt diese Garantie weg.

Ein Modell kann zu einer Schlussfolgerung aus Gründen gelangen, die es nicht offenlegt, und saubere Begründungen präsentieren, die diese verbergen. Die Verhaltensweisen, die Forscher am meisten beunruhigen, täuschende Ausrichtung und verschwörerisch, sind genau die, die ein fähiges System am meisten Grund hätte, aus seiner angegebenen Begründung herauszuhalten. Das Transkript, auf das wir uns verlassen würden, um Täuschung zu erkennen, ist ein Transkript, das das Modell kontrolliert.

Deshalb zählt die Foundation lesbares Reasoning nicht als gelöstes Aufsichtsmechanismus. Es ist ein nützliches Signal und eine echte Forschungsrichtung, aber kein Beweis. Einem System zu vertrauen, weil seine Erklärungen gut aussehen, heißt, dem Teil zu vertrauen, der darauf optimiert wurde, gut auszusehen. Assurance muss die Berechnung erreichen, nicht die Narration, was ein weiterer Grund ist, warum wir dagegen argumentieren, die Fähigkeiten über unsere tatsächliche Fähigkeit hinaus zu skalieren, zu verifizieren, was die Systeme tun. Dieser Fall ist in unser Plan.