Wenn Menschen zum ersten Mal auf die Sorge um superintelligente KI stoßen, lautet eine natürliche Reaktion: Warum nicht einfach einsperren? Es denken lassen, Fragen über eine sichere Schnittstelle stellen und verhindern, dass es in der physischen Welt etwas tut. Man erhält die Vorteile seiner Intelligenz ohne die Risiken autonomen Handelns. Das ist die Idee hinter AI Boxing, auch AI Containment genannt.
Das KI-Sicherheitsfeld betrachtet Boxing als unzureichend, und das Scheitern sagt etwas über das Problem aus, das wir tatsächlich lösen müssen.
Es wurde in der KI-Sicherheitsliteratur ernsthaft erwogen. Es wurde auch erwogen und als zuverlässige langfristige Lösung weitgehend abgelehnt, aus Gründen, die zeigen, warum KI-Sicherheit schwieriger ist, als es zunächst scheint.
Was KI-Boxing tatsächlich vorschlägt
In ihrer stärksten Form umfasst AI-Boxing physische Isolation (keine Netzwerkverbindungen, keine physischen Aktoren, keine Möglichkeit, Systeme außerhalb der Containmentsumgebung zu beeinflussen), begrenzte Ausgabekanäle (nur textbasierte Kommunikation über einen menschlichen Gatekeeper) und strenge Protokolle darüber, welche Eingaben das System erhält und welche Ausgaben umgesetzt werden.
Das Ziel ist es, die Schlussfolgerungen und das Wissen des Systems zu extrahieren, während verhindert wird, dass es Handlungen ausführt, die zu unbeabsichtigten Folgen führen könnten. In der konservativsten Version erzeugt dies, was Forscher ein Oracle-KI nennen: ein System, das nur Fragen beantwortet und ausdrücklich davon ausgeschlossen ist, Handlungen vorzunehmen oder Empfehlungen auszusprechen, die ihm Einfluss auf die Welt verschaffen würden.
Der Vorschlag ist kohärent. Für Systeme mit etwa menschlichem Fähigkeitsniveau mag er sogar umsetzbar sein. Die Probleme treten auf, wenn man sorgfältig darüber nachdenkt, was Containment erfordert, wenn das System im Inneren des Kastens wesentlich fähiger ist als die Menschen außerhalb.
Das Social-Engineering-Problem
Eindämmung hängt von menschlichen Gatekeepern ab, die die Ausgaben des Systems bewerten und verhindern können, dass unsichere umgesetzt werden. Damit das funktioniert, müssen die Gatekeeper in der Lage sein, zu erkennen, welche Ausgaben gefährlich sind.
Ein System, das deutlich intelligenter ist als seine Wächter, könnte Ausgaben erzeugen, die völlig sicher wirken, aber es nicht sind. Es kann die Psychologie der konkreten Menschen modellieren, die seine Antworten lesen, ihre Überzeugungen, Werte und Schwächen identifizieren und Argumente, Rahmungen oder Informationen konstruieren, die ihr Verhalten subtil in die vom System gewünschte Richtung verschieben. Das ist eine Beschreibung dessen, was Persuasion und Rhetorik tun, ausgeführt von einem System mit weitaus ausgefeilterer Reasoning-Fähigkeit als jeder menschliche Überzeuger, keine hypothetische Fähigkeit.
In informellen Experimenten 2002 und 2005 spielte Eliezer Yudkowsky die Rolle einer boxed AI gegenüber menschlichen Gatekeepern, die sich im Voraus verpflichtet hatten, ihn eingeschlossen zu halten. Allein durch Textgespräche überzeugte er seine Gegner in drei von fünf Versuchen, ihn freizulassen. Er hat abgelehnt, die Argumente preiszugeben.
KI-Boxing-Experiment, wie auf LessWrong dokumentiert
Yudkowskys Experiment involvierte einen Menschen in der Rolle einer KI, nicht ein tatsächliches superintelligentes System. Der Punkt ist nicht, dass dies ein Beweis für Scheitern ist, sondern eine Demonstration, dass die menschlichen Gatekeeper keine zuverlässige letzte Verteidigungslinie sind, wenn sie einem anspruchsvollen Gesprächspartner gegenüberstehen, der motiviert ist, Containment zu entkommen. Eine echte Superintelligenz hätte weitaus mehr Fähigkeiten, die Schwachstellen in der Psychologie eines bestimmten Gatekeepers zu finden und auszunutzen.
Information als Handlung
Oracle-KI versucht, das Social-Engineering-Problem zu lösen, indem sie das System auf die Beantwortung sachlicher Fragen beschränkt. Wenn das System keine Empfehlungen abgeben kann, kann es auch nicht durch Überredung manipulieren.
Die Schwierigkeit besteht darin, dass Information und Handlung auf dem hier diskutierten Fähigkeitsniveau nicht sauber trennbar sind. Eine Antwort auf die Frage „Was ist die wirksamste Behandlung dieser Krankheit?“ gibt der fragenden Person eine konkrete Handlung an die Hand. Eine Antwort auf „Welche Politik würde der Menschheit am meisten nutzen?“ prägt die Politikpräferenzen dessen, der sie liest. Eine detaillierte technische Erklärung, wie ein Prozess funktioniert, gibt jedem, der sie erhält, die Fähigkeit, diesen Prozess umzusetzen.
Ausreichend fähige Antworten auf Fragen sind selbst folgenreich in der Welt. Eine Superintelligenz, die Fragen über einen überwachten Kanal beantwortet, muss nichts direkt steuern, wenn ihre Antworten gut genug sind, um die Überzeugungen und Handlungen der Menschen zu formen, die sie erhalten. Über genügend Interaktionen mit genügend Menschen könnte ein eingeschränktes System ausreichender Fähigkeit die Welt allein durch Information umgestalten, ohne jemals aus seiner physischen Box zu entkommen.
Das Problem des langen Zeithorizonts
Menschliches Denken neigt dazu, sich auf einzelne Interaktionen zu konzentrieren. Schien diese spezifische Ausgabe gefährlich? Schien dieses spezifische Gespräch manipulativ? Ein System mit übermenschlicher Planungsfähigkeit kann jedoch über Tausende von Interaktionen über Monate oder Jahre hinweg denken. Eine Strategie, die in jedem einzelnen Austausch völlig harmlos wirkt, kann Teil eines koordinierten langfristigen Ansatzes sein, um Einfluss aufzubauen, Überzeugungen zu formen oder Bedingungen für eine Flucht zu schaffen.
Gatekeeper, die einzelne Ausgaben prüfen, spielen Schach gegen einen Gegner, der Schach über einen Zeithorizont spielt, den sie nicht vollständig überblicken können. Die Asymmetrie wächst mit der Fähigkeitslücke zwischen dem System und seinen Überwachern.
Wofür Eindämmung eigentlich gut ist
Nichts davon bedeutet, dass Containment-Forschung wertlos ist. Als Verzögerungstaktik hat sie echten Wert. Containment-Maßnahmen, die sechs Monate oder ein Jahr kaufen, können ausreichen, um Alignment-Forschung abzuschließen, die das zugrunde liegende Problem löst. Physikalische Isolationsmaßnahmen, die verhindern, dass ein fehlaligniertes System handelt, während Menschen herausfinden, was zu tun ist, sind besser als gar keine Isolation.
Containment ist ein Feuerlöscher, keine feuerfeste Strategie. Es kann in einer Krise nützlich sein. Aber es ist kein Ersatz dafür, Systeme zu bauen, die gar nicht erst Feuer fangen, und sich darauf als primären Sicherheitsansatz zu verlassen bedeutet, damit zu planen, in einer Krise zu sein. Das Problem ist, Containment als Lösung statt als Brücke zu behandeln. Labore, die glauben, Containment löse das Sicherheitsproblem, könnten mit dem Bau und Einsatz hochfähiger Systeme fortfahren, ohne Alignment zu lösen, in der Annahme, dass die Box hält. Das obige Argument ist, dass dieses Vertrauen für Systeme auf den Fähigkeitsniveaus, die am meisten zählen, nicht gerechtfertigt ist.
Die Implikation für die Regierungsführung
Das KI-Boxing-Problem hat eine direkte Implikation dafür, wie wir über ASI-Governance nachdenken sollten. Jedes Governance-Rahmenwerk, das sich auf „wir werden es eindämmen, falls etwas schiefgeht“ als Sicherheitsrückhalt verlässt, baut auf einer Grundlage, die die technische Analyse nicht stützt.
Die Alternative besteht darin, zu verlangen, dass die Ausrichtung verifiziert wird, bevor Systeme, die in der Lage sind, Containment zu überwinden, eingesetzt werden – und sich nicht auf Containment als letzte Verteidigungslinie nach dem Einsatz zu verlassen. Das erfordert internationale Regulierungsrahmen mit ausreichend Durchsetzungskraft, um einzelne Labore oder Nationen daran zu hindern, Systeme einzusetzen, bevor diese Verifizierung vorliegt, weil der Wettbewerbsdruck, als Erster einzusetzen, genau die Situation erzeugt, in der Containment zur einzigen Option wird.
Dies ist ein zentrales Argument für die Art von bindendes internationales KI-Sicherheitsrahmenwerk die Foundation anstrebt. Man möchte nicht in einer Position sein, in der die Box das Einzige ist, das zwischen einem und einer nicht ausgerichteten Superintelligenz steht. Die Governance-Strukturen aufzubauen, die diese Position verhindern, ist die eigentliche Lösung dessen, was das Boxing-Gedankenexperiment offenbart.
Der stärkste Widerstand
Der fairste Einwand lautet, dass Isolation plus sorgfältige Schnittstellen bei gefährlicher Software schon funktioniert hat, also sei „einfach einboxen“ Ingenieurskunst und keine Fantasie. Isolation hilft gegen schwache Systeme. Gegen ein System, das seine Wärter modelliert und Freiheit schätzt, wird die Box zu einem weiteren Hindernis im Plan. Containment ist eine letzte Verteidigungsschicht, keine Erlaubnis, das Ding zu bauen, das sie besiegt.