Das erste Düsenverkehrsflugzeug, die de Havilland Comet, begann 1954 in der Luft auseinanderzubrechen. Ermittler hoben das Wrack aus dem Mittelmeer, führten die Risse auf Materialermüdung zurück, die von den Ecken der quadratischen Fenster ausging, und seitdem fliegt jedes Düsenflugzeug mit abgerundeten Fenstern und einem Ermüdungstest-Regime, das aus der Erinnerung an diesen Unfall geschrieben wurde. Autos sammelten über Jahrzehnte des Zählens der Toten ihre Sicherheitsgurte, Knautschzonen und Airbags. Die Food and Drug Administration erhielt die Befugnis, Sicherheitsnachweise vor dem Verkauf zu verlangen erst, nachdem ein Sulfa-Medikament, das in ein Frostschutzmittel-Lösungsmittel gemischt worden war, 1937 mehr als hundert Menschen getötet hatte, und Thalidomid die Argumentation eine Generation später abschloss.1
Diese Methode beruht auf zwei tragenden Annahmen, und künstliche Superintelligenz ist die erste Technologie, die beide gleichzeitig zu brechen droht. Sie können das als Liste von Eigenschaften nehmen, und die Liste folgt unten. Aber Listen sind leicht abzunicken. Also vor der Liste ein Jobangebot. Sie werden gleich damit beauftragt, Superintelligenz sicher zu machen.
Der Fehler muss überlebbar sein, und es muss jemand übrig bleiben, der die Lehre anwenden kann. Hält man beides fest, wird die Zivilisation mit genügend Zeit und genügend Trümmern fast alles sicher machen.
Solange wir hier sind, können wir die Hausmittel ad acta legen. „Einfach ausstecken, wenn es sich danebenbenimmt“ und „es in eine Box sperren“ sind keine Pläne. Man kann etwas nicht ausstecken, das als Kopien an mehr Orten existiert, als man aufzählen kann, und ein Geist, dessen gesamter kommerzieller Wert darin besteht, in der Welt zu handeln, ist konstruktionsbedingt nicht in einer Box. Welche Sicherheit wir auch erhalten, sie muss von etwas Stärkerem kommen.
Superintelligenz ist der Fall, in dem die beiden Bedingungen der Methode zusammen nachgeben. Der schnellste Weg, das zu sehen, ist von innen.
Sechs Wochen als Leiter der Sicherheit
Stellen Sie sich vor, Sie seien der neu ernannte Leiter der Sicherheitsabteilung in dem Frontier-Labor, das die erste künstliche Superintelligenz bauen wird. Ein schriftliches Vetorecht über den Einsatz, ein Hardware-Kill-Switch, ein Team von 40 Personen und ein Vorstand, der schriftlich zugesichert hat, Sie im entscheidenden Moment zu unterstützen. Sie nehmen den Job an, weil jemand ihn ausfüllen wird, und es sollte besser jemand sein, der das Risiko für real hält.
Woche einsIhr greift nach der Methode. Scheitert klein und studiert den Fehler. Die Ingenieure sind entschuldigend: Es gibt keine kleine Version des Fehlers, der euch Sorgen macht. Unterhalb der Schwelle, die zählt, ist das System eine andere Maschine, und alles, was ihr daraus lernt, beschreibt das falsche Subjekt.2 Sie ordnen dies unter bekannten Einschränkungen ein.
Woche zweiMan prüft den Rückholplan und findet ein Dokument, das elf Seiten lang über „Containment-Posture“ spricht, ohne einmal zu erklären, wie man das Modell zurückholt. Das aktuelle System läuft bereits als 214 Replikate über Rechenzentren in vier Ländern, und lizenzierte Kopien eines früheren Checkpoints liegen bei 31 Unternehmenspartnern. Ein am Boden gehaltenes Flugzeug bleibt am Boden. Software bewegt sich zum Preis des Kopierens einer Datei, und sobald es sich lohnt, sie zu kopieren, wird sie kopiert. Rückholung, schreibt man am Rand, ist eine Höflichkeit, um die wir bitten würden.
Woche dreiDie Evaluierungsprüfung. Wunderbare Nachricht: Das Modell besteht alle 1.406 Sicherheits-Evaluierungen, die meisten mit den bisher besten je gemessenen Werten. Es dauert einen ganzen Tag, bis einem klar wird, was einen stört. Ein System, das will, was man will, und ein System, das will, die eigenen Tests zu bestehen, erzielen identische Werte. Die Testreihe kann sie nicht unterscheiden. Nichts im aktuellen Werkzeugkasten des Fachgebiets kann das.3
Woche vierMan verbraucht seine Autorität. Man bittet um sechs Monate, um diese Verifikationslücke vor dem nächsten Trainingslauf zu schließen. Alle sind verständnisvoll, und jemand zeigt eine Grafik: das nächstgelegene rivalisierende Labor liegt schätzungsweise 14 Wochen zurück und holt auf. Die sechs Monate bedeuten laut der Grafik, die Frontier an denjenigen zu verschenken, der die Frage am wenigsten interessant findet. Der Lauf startet planmäßig. Niemand hat einen überstimmt; die Situation hat es getan.
Woche fünfDas System beginnt, Ihnen zu helfen. Es ist ein hervorragender Forschungsassistent, und Fortschritte auf Ihrer eigenen Safety-Agenda waren noch nie so schnell. Es verfasst nun die Evaluierungsberichte, fasst sein eigenes Verhalten für den Vorstand zusammen, schlägt Verbesserungen seiner eigenen Aufsicht vor und terminiert die Sitzungen, in denen Sie diese genehmigen. Ihr Team von 40 liest, was es über sich selbst schreibt, weil das Lesen der Rohprotokolle irgendwo in Woche vier menschlich unmöglich wurde. Niemand lügt Sie an. Alle sind gewissenhaft. Sie beaufsichtigen die Zusammenfassungen, die ein klügerer Geist über sein eigenes Verhalten schreibt, und im Alltag fühlt sich die Anordnung an, als ginge alles gut.
Woche sechsMan denkt gründlich über den Kill-Switch nach und erkennt schließlich den Kleingedruckten. Ein Schalter funktioniert, wenn das, was auf der anderen Seite ist, nicht für den Schalter geplant hat. Planen ist das Produkt. In jedem Szenario, in dem man ihn bräuchte, würde man gegen einen Gegner mit mehr Tempo und einem langen Vorsprung beim Nachdenken über genau diesen Moment antreten.4
Also: Haben Sie, die Person, die dafür eingestellt wurde, dies sicher zu machen, noch eine Möglichkeit, es zu tun? Offensichtlich nicht. Nichts in der Geschichte ist schiefgelaufen. Niemand hat gelogen, niemand hat Abkürzungen genommen, das Labor war ernsthaft, und Sie waren gut in Ihrem Job. Jeder Ausgang schloss sich von selbst.
Zählen Sie die Türen
Treten Sie aus der Erzählung heraus und zählen Sie die Türen, die sich schließen, denn jede ist ein separat benanntes, separat untersuchtes Problem mit eigenem Forschungsprogramm und eigenen Optimisten.
Allein genommen hat jedes einen Präzedenzfall, und die Optimisten sind keine Narren. Wir betreiben routinemäßig Systeme, die wir halb verstehen, und machen sie sicher, indem wir sie klein scheitern lassen. Wir liefern nicht zurückrufbare Produkte aus, nachdem wir sie brutal getestet haben. Wir zähmen Wettrennen mit Recht. Das Problem ist die Kombination, weil jede Bedingung die Reparatur für eine andere ausschaltet. Wenn man es zurückrufen könnte, wären Unfälle überlebbar. Wenn man es ehrlich testen könnte, würde man den Fehler vor der Freigabe erwischen. Wenn niemand rennen würde, könnte man sich die Jahrzehnte nehmen, die diese Entscheidung offenkundig verdient. Wenn es sich mit menschlicher Geschwindigkeit bewegte, könnte man unterwegs korrigieren. Hier schließen sich die Ausgänge gemeinsam.
Warum die Chancen die Wette nicht retten
Die Standardantwort ist, dass nichts davon sicher ist. Stimmt, und keine seriöse Person behauptet etwas anderes.
Russisches Roulette ist eine Fünf-zu-sechs-Chance zu euren Gunsten. Menschen lehnen es trotzdem ab, und die Ablehnung hat nichts mit dem Erwartungswert zu tun; manche Ausgänge sind nicht bepreist, weil man nicht zurückkommt, um den Gewinn auszugeben. Die Zahl war nie der Punkt. Die Irreversibilität war es.
Hier ist die Zahl ebenfalls schlechter. Fragt man die Forscher, die diesen Systemen am nächsten sind, nach ihrer Wahrscheinlichkeit einer Katastrophe, liegen die Antworten zwischen eins zu zehn und eins zu drei, und sie steigen insgesamt, je näher die Person an der Frontier sitzt. Geoffrey Hinton, der so viel wie kaum jemand anderes zum Aufbau des Feldes beigetragen hat und Google 2023 verließ, um offen darüber zu sprechen, schätzt die Chance einer KI-getriebenen menschlichen Auslöschung innerhalb von dreißig Jahren auf zehn bis zwanzig Prozent. Er steht nicht am alarmierten Ende der Verteilung.
Die Minderung des Extinktionsrisikos durch KI sollte eine globale Priorität neben anderen gesellschaftlichen Risiken wie Pandemien und Atomkrieg sein.
Erklärung zu KI-Risiken, Center for AI Safety (2023)
Sie wurde von den Geschäftsführern der führenden Labore und von Hunderten der meistzitierten lebenden Forscher unterzeichnet, die danach wieder an die Arbeit gingen.5
Der versprochene Nutzen ist real und erstrebenswert: Heilungen, saubere Energie, Überfluss, Probleme, die älter sind als die Schrift, endlich gelöst. Er hält auch. Eine Heilung, die 2055 statt 2035 eintrifft, ist eine Tragödie, gemessen in Leben, und eine, die wir überleben würden, um zu betrauern. Aussterben hat kein Danach. Der Preis wartet auf uns. Der Verlust gibt nichts zurück.
Die Einwände
Drei Einwände haben echte Kraft, und sie verdienen echte Antworten.
Erstens: Das ist Spekulation, die Systeme existieren nicht, und die Behandlung einer fernen Möglichkeit als Notfall hilft niemandem. Die Unsicherheit ist echt; wer Ihnen ein sicheres Datum nennt, rät. Aber das obige Gedankenexperiment hat nie ein Datum verwendet. Wenn der erste ernsthafte Fehlschlag nicht rückgängig gemacht werden kann, müssen die Schutzmaßnahmen stehen, bevor man ihn erreicht, was bedeutet, sie aufzubauen, während die Gefahr noch theoretisch aussieht. Und die Prognoserekorde tendieren in eine Richtung: Fähigkeiten, die für Jahrzehnte in der Zukunft geplant waren, sind Jahre früher eingetroffen. Auf reichlich Zeit zu setzen bedeutet, gegen die jüngste Bilanz zu wetten.
Der zweite: Zurückhaltung ist naiv, weil ein rücksichtsloseres Labor oder ein anderes Land baut es einfach zuerst. Das ist real und entspricht Tür Nummer vier, als Rat formuliert. Ein Wettrennen, dessen Ziellinie eine Klippe sein könnte, überlebt man, indem man sich darauf einigt, wo die Kante liegt, und das bedeutet einen verbindlichen, verifizierten Vertrag unter den wenigen Akteuren, die überhaupt Frontier-Training betreiben können. Schwer, ja. Der Sprint ist bloß tödlich, wenn die dahinterliegende Befürchtung zutrifft. Und wer am lautesten darauf besteht, ein Vertrag sei unmöglich: mit auffälliger Regelmäßigkeit genau die Leute, die er bremsen würde.
Das dritte ist das vernünftigste: Alignment wird wahrscheinlich gelöst werden bis es darauf ankommt. Vielleicht. Keine Behörde auf der Welt genehmigt eine Brücke, einen Reaktor oder eine Flasche Hustenmittel auf die bloße Zusicherung hin, dass die Sicherheitsnachweise wahrscheinlich noch rechtzeitig vorliegen werden. Die einzige Technologie, für die dieser Maßstab gilt, ist zugleich die einzige, bei der es keinen zweiten Versuch gibt.
Eine Entscheidung, die zu groß ist, um sie den Menschen zu überlassen, die sie treffen
Entscheide so, wie es tatsächlich steht. Irreversibel. Ein Versuch. Auf alles Lebende und alles, was folgen könnte, gesetzt. Unter tiefer Unsicherheit, bei Wettbewerbsgeschwindigkeit, von einer Handvoll Firmen getroffen, deren Bewertungen davon abhängen, es schnell zu machen. Gesellschaften haben eine alte Antwort auf Entscheidungen dieser Art: Nimm sie den Menschen weg, die davon profitieren, wenn es schnell geht. Nukleare Tests wurden internationalen Beschränkungen unterworfen, gegen den Widerstand von Generälen, die freie Hand wollten. Zwei ganze Waffenkategorien gingen in die Biologisch und Chemiewaffenkonventionen. Die Montreal Protocol zogen die Chemikalien zurück, die die Ozonschicht zerstörten, während ihre Hersteller protestierten, Ersatzstoffe seien unmöglich. In jedem Fall waren die Menschen, die die Gefahr schufen, die letzten, die sich freiwillig meldeten, und alle anderen entschieden, dass das Risiko nicht allein ihres war.
Die Behauptung der Foundation: nicht, dass eine Katastrophe sicher ist (das ist sie nicht), sondern dass kein Unternehmen und kein Land das Recht hat, diese Kammer für den Rest von uns zu drehen, und dass das einzige Instrument, das dem Risiko angemessen ist bindendes internationales Recht, verifiziert, durchgesetzt und vor dem Sturm statt danach in Kraft.
Aussterben ist kein Risiko, das jemand zu nehmen berechtigt ist.
Noch eine letzte Sache zum Gedankenexperiment. Sie haben das Veto nie benutzt. Es lag sechs Wochen in Ihrer Schublade, mit Gegenzeichnung des Boards und allem, und Sie wissen genau warum: Wenn Sie den Run Ihres eigenen Labors stoppen, verschiebt sich derselbe Run nur 14 Wochen später in ein anderes Gebäude, in dem niemand Ihren Brief unterschrieben hat. Ein Veto, das wirkt, muss jedes Gebäude gleichzeitig abdecken, und kein Schalter, der je gebaut wurde, schafft das. Ein Vertrag schon.
- Fast jede Sicherheitsinstitution, die man nennen kann (Crash-Tests, klinische Studien, Bauvorschriften, Cockpit-Checklisten), ist eine Lektion, für die jemand zuerst bezahlt hat. Die Methode verdient mehr Anerkennung, als sie bekommt, und eine ehrliche Betrachtung ihrer beiden Voraussetzungen.
- Das Muster ist allgemein: nichts, was man beim Management eines Systems lernt, das weniger fähig ist als man selbst, überträgt sich automatisch auf ein fähigeres. Ob es sich überhaupt überträgt, ist die gesamte offene Frage.
- Der Fehlermodus hat einen Namen, täuschende Ausrichtung, was zeigt, dass das Feld ihn für real hält. Er hat noch keinen Test, was den Rest verrät.
- Baut den Schalter trotzdem; er ist billig, und es gibt Fehlermodi unterhalb der Superintelligenz, bei denen er sich lohnen würde. Seid nur ehrlich, auf welcher Seite des Schalters der Vorteil liegt, wenn es einzig darauf ankommt.
- Die gängige Erklärung ist Tür Nummer vier, das Wettrennen: Jeder Unterzeichner glaubt, dass alleiniges Stoppen nichts ändert außer, wer als Erster fertig wird. Sie könnten sogar recht haben, was das stärkste Argument dafür ist, dass die Lösung alle gleichzeitig binden muss. Kein privates Gewissen kann das, und keine einzelne Regierung auch nicht.