Constitutional AI ist eine von Anthropic entwickelte Trainingsmethode. Die Idee ist, die Abhängigkeit des Modellverhaltens von menschlicher Handkennzeichnung schädlicher Ausgaben zu verringern und stattdessen das Modell seine eigenen Antworten anhand eines schriftlichen Prinzipienkatalogs, einer Verfassung, bewerten zu lassen.
In der Praxis funktioniert es in zwei Stufen. Zuerst erzeugt das Modell eine Antwort, kritisiert diese dann anhand der Verfassung und überarbeitet sie, wobei es aus den eigenen Korrekturen lernt. Zweitens vergleicht das Modell Paare von Antworten und beurteilt, welche die Prinzipien besser erfüllt; diese Urteile trainieren es ähnlich wie menschliche Rankings es in RLHF. Weil das Feedback vom Modell selbst kommt, das die Constitution anwendet, und nicht von Menschen, wird der Ansatz manchmal als Reinforcement Learning from AI Feedback bezeichnet.
Was es richtig macht
Es gibt echte Vorteile, und es lohnt sich, sie offen anzuerkennen.
- Die Prinzipien sind explizit. Anstelle von Werten, die durch Tausende einzelner menschlicher Labels impliziert werden, gibt es ein schriftliches Dokument, das man lesen, diskutieren und überarbeiten kann. Das ist transparenter als ein Haufen Bewertungen.
- Es skaliert die Erzeugung von Feedback. Menschliche Kennzeichnung schädlicher Inhalte ist langsam, teuer und belastend für die Kennzeichner. Lässt man das Modell mehr davon erledigen, entfällt ein Engpass.
- Es kann die Konsistenz verbessern. Ein einheitlich angewandter schriftlicher Standard vermeidet etwas vom Rauschen und der Drift vieler verschiedener menschlicher Bewerter an verschiedenen Tagen.
Dies sind echte ingenieurtechnische Fortschritte, und Constitutional AI hat Modelle hervorgebracht, die sowohl hilfreicher als auch weniger anfällig für offensichtliche Schäden sind. Die Foundation hat kein Interesse daran, nützliche Arbeit abzuwerten.
Was es nicht löst
Die schwierigeren Fragen überleben die Methode unversehrt, und es ist wichtig zu sehen, warum.
Die Technik optimiert weiterhin ein Modell, um einen festgelegten Standard zu erfüllen, wie von einem Modell beurteilt. Sie nimmt den Menschen aus der Schleife pro Antwort heraus und ändert nicht die zugrunde liegende Form des Problems, nämlich dass das System darauf trainiert wird, Ausgaben zu erzeugen, die gegen ein Ziel gut abschneiden. Wenn die Constitution unvollständig ist oder ihre Prinzipien in einer Situation kollidieren, die niemand vorhergesehen hat, optimiert das Modell den Wortlaut dessen, was geschrieben steht, mit demselben Goodhart Drücke wie zuvor. Die Werte aufzuschreiben wie eine Verfassung umgeht nicht die Schwierigkeit, Werte zu spezifizieren; sie verlagert sie nur in das Dokument.
Zwei tiefere Grenzen bleiben unberührt. Die Methode formt Verhalten und gibt keine Garantie für die internen Ziele eines Modells, daher die Lücke zwischen scheinbar aligned und tatsächlich aligned, die innere Ausrichtung Problem ist immer noch offen. Und es beruht auf dem eigenen Urteil des Modells über seine Ausgaben, das nur so weit vertrauenswürdig ist, wie das Modell ehrlich und urteilsfähig ist – genau das, was wir bei einem System, das unser eigenes Niveau erreicht oder übertrifft, nicht voraussetzen können.
Constitutional AI ist ein besserer Weg, Verhalten zu steuern. Verhalten zu steuern war nie der Teil der Alignment, den wir nicht wussten, wie man macht.
Es im richtigen Verhältnis halten
Constitutional AI ist ein gutes Beispiel für ein Muster, das die Foundation genau beobachtet: echten, wertvollen Sicherheitsfortschritt, der leicht als mehr gedeutet werden kann, als er ist. Methoden wie diese machen aktuelle Modelle besser kontrollierbar und transparenter hinsichtlich ihrer Standards, und das ist wertvoll. Sie zeigen nicht, dass wir ein System ausrichten können, das uns intellektuell überlegen ist, und sie schließen nicht die Verifikationslücke, auf der unser gesamtes Argument beruht. Fortschritte beim Training sind willkommen. Sie sind kein Grund, die Fähigkeits-Skalierung unter der Annahme fortzusetzen, dass der Rest folgen werde, wie es in unser Plan.