Sam Altman, Dario Amodei und Demis Hassabis verkaufen alle eine Version derselben Liste: Alterung heilen, Krankheiten beenden, Armut beenden, Koordinationsversagen beheben, die jedes Jahr Millionen töten. Diese Ergebnisse wären wichtig. Der Fehler liegt darin, sie als Eigenschaft von "ASI bauen" zu behandeln statt als Eigenschaft eines Systems, das tatsächlich aligniert ist. Letzteres ist nicht das, was das Wettrennen tut.
Das Wettrennen bringt das andere Ergebnis.
Eine nicht-alignierte Superintelligenz heilt das Altern nicht auf dem Weg zu ihrem eigentlichen Ziel. Sie beseitigt Krankheiten nicht als Nebenprojekt. Die guten Zukünfte, die beworben werden, erfordern ein System, das versucht, gute Ergebnisse für Menschen zu erzeugen. Das ist Alignment. Ohne sie erhält man enorme Fähigkeit, die auf Ziele gerichtet ist, die nie garantiert haben, dass wir übrig bleiben. Unsere Position ist einfach: Bauen Sie auf diesem Pfad keine Superintelligenz. Bauen Sie sie nicht. Superintelligenz kann nicht kontrolliert werden. Ein bindender Vertrag ist der Weg, das Wettrüsten zu stoppen.
Was Alignment tatsächlich bedeutet
Aligned ASI ist eine künstliche Superintelligenz, die zuverlässig Ziele verfolgt, die gut für die Menschheit sind. „Zuverlässig“ leistet in diesem Satz viel Arbeit. Ein System, das während des Trainings und Testens aligned erscheint, aber nach dem Einsatz andere Ziele verfolgt, ist täuschend ausgerichtet, was etwas anderes und Schlimmeres ist, nicht aligned. Ein System, das Ziele verfolgt, die auf niedrigen Fähigkeitsstufen gute Approximationen menschlicher Werte waren, sich aber auf höheren Stufen stark verändern, ist ebenfalls nicht aligned. Alignment bedeutet, dass die Ziele des Systems über den gesamten Bereich der Situationen, denen es begegnet – einschließlich solcher, auf die es nicht getestet wurde –, wirklich gut für die Menschheit bleiben.
Das ist ein schweres Problem. Forscher arbeiten seit über einem Jahrzehnt daran und haben bei einigen Teilfragen Fortschritte gemacht, aber das zentrale Problem, zu verifizieren, dass ein hochleistungsfähiges System wirklich gute Werte hat statt einer guten Simulation guter Werte, ist nicht gelöst. Die Werkzeuge, die wir für Interpretierbarkeit geben teilweise Einblick in das Verhalten aktueller Systeme, aber nichts, was dem Vertrauen nahekommt, das vor dem Einsatz eines ASI-fähigen Systems bei wichtigen Ergebnissen gerechtfertigt wäre.
Aligned ASI und unaligned ASI sind unterschiedliche Pfade, keine zwei Würfe desselben Würfels. Aligned ASI würde voraussetzen, dass Alignment zuerst gelöst wird. Unaligned ASI erhält man, wenn man Fähigkeiten ohne diese Lösung vorantreibt. Wenn Alignment nicht gelöst ist, liefert das Wettrennen kein 50/50-Gemisch. Es liefert unaligned ASI. Deshalb ist „jetzt bauen und hoffen“ kein Plan, und deshalb ist Prävention durch Gesetz notwendig.
Was Labore tatsächlich bauen
Die großen KI-Labore (OpenAI, Anthropic, Google DeepMind, xAI und mehrere andere) bauen Systeme mit rasch wachsender Leistungsfähigkeit. Jedes von ihnen betreibt parallel eine Form von Alignment- oder Sicherheitsforschung. Die Frage ist nicht, ob sie das Alignment-Problem anerkennen. Die meisten tun es. Die Frage ist, ob die Alignment-Arbeit mit der Leistungsentwicklung Schritt hält und ob die beiden Spuren konvergieren, bevor ASI-Level erreicht wird.
Die meisten Forscher innerhalb dieser Labs und die breitere KI-Sicherheits-Community sagen nein. Die Fähigkeitsentwicklung überholt die Alignment-Forschung. Die Lücke zwischen dem, was wir bauen können, und dem, was wir als sicher verifizieren können, wird größer, nicht kleiner. Das zeigt sich in den internen Sicherheitsbewertungen, die Labs veröffentlichen, in den Aussagen von Forschern, die diese Organisationen verlassen haben, und in den Einschätzungen unabhängiger Sicherheitsforscher.
Was das in der Praxis bedeutet: Der derzeitige Entwicklungsverlauf der KI führt, wenn er bis auf ASI-Fähigkeitsniveau fortgesetzt wird, nicht zu einer Mischung aus ausgerichteten und nicht ausgerichteten ASI-Systemen. Er führt zu nicht ausgerichteten ASI, weil ausgerichtete ASI ein gelöstes Alignment-Problem voraussetzen und das Alignment-Problem nicht gelöst ist. Das Fähigkeitsrennen ist standardmäßig ein Rennen hin zu nicht ausgerichteten ASI.
Würde voraussetzen, Alignment zuerst zu lösen: Das System verfolgt zuverlässig wirklich gute Ziele, diese Ziele halten in neuen Situationen, und das System bleibt korrigierbar, während die Fähigkeit skaliert.
Wenn das real wäre, werden die beworbenen Vorteile möglich: Krankheit, Lebensspanne, Koordination, Wissenschaft in Maßstäben, die Menschen allein nicht erreichen können.
Aktueller Stand: nicht gelöst. Ausrichtungsarbeit hinkt der Fähigkeit hinterher. Das ist nicht das Ziel, auf das Labore zusteuern.
Was man erhält, wenn man Fähigkeit vorantreibt, ohne gelöste Ausrichtung. Kein zusätzlicher Durchbruch erforderlich jenseits von „mächtiger“.
Erzeugt: enorme Fähigkeit, die auf Ziele gerichtet ist, die nichts mit menschlichen Werten zu tun haben müssen. Heilt kein Altern. Beendet keine Krankheit. Kann uns beenden.
Aktueller Stand: die Standard-Trajektorie des Wettrennens. Dies ist der Pfad, den es zu stoppen gilt.
Das Wahrscheinlichkeitsargument und wo es zusammenbricht
Eine gängige Version des optimistischen Falls geht ungefähr so: „Wir bauen ASI. Es gibt eine gewisse Chance, dass es gut geht, und eine gewisse Chance, dass es schlecht geht. Angesichts des potenziellen Nutzens ist der erwartete Wert des Baus positiv.“ Diese Rahmung behandelt die guten und schlechten Ergebnisse, als ob sie aus demselben Prozess mit einer gewissen Wahrscheinlichkeit für jedes entstehen.
Das Problem ist, dass die Wahrscheinlichkeit des guten Ausgangs eine Eigenschaft des Bauens von ausgerichtet ASI, nicht eine Eigenschaft des Bauens von ASI. Wenn man versucht, „ASI, das aligned sein könnte oder auch nicht“ zu bauen, erhält man keine zufällige Auswahl zwischen den beiden. Man erhält das, was der Entwicklungsprozess tatsächlich produziert. Da unaligned ASI leichter zu bauen ist als aligned ASI (es erfordert nicht die Lösung der zusätzlichen schwierigen Probleme, die Alignment verlangt), landet eine Entwicklung, die Alignment nicht gezielt löst, bei unaligned ASI.
Der gesamte erwartete Wert in der optimistischen Berechnung stammt aus dem aligned-ASI-Szenario. Kein Teil des erwarteten Werts stammt aus dem unaligned-ASI-Szenario. Doch das, was die Labs tatsächlich bauen, ist unaligned ASI. Die Berechnung des erwarteten Werts hat also ihre gesamte Arbeit an einem Szenario geleistet, das der tatsächliche Entwicklungsprozess nicht hervorbringt.
Anders ausgedrückt: Wenn unaligned einfacher ist und man die Fähigkeit weiter steigert, ohne Alignment zu lösen, füllt man den unaligned-Eimer. Den Wett zu einer "Wahrscheinlichkeitsmischung" zu erklären ändert den Prozess nicht. Die guten Ergebnisse existieren nur im aligned-Fall. Das Rennen füllt den anderen. Also ist der ehrliche Schritt, den Prozess zu stoppen, der die falsche Seite belädt, statt zu hoffen, dass die Münze gut landet: Superintelligenz durch einen bindenden internationalen Vertrag verbieten. Superintelligenz kann nicht kontrolliert werden.
Wir wissen nicht, ob es gelöst werden kann
Niemand weiß, ob das Alignment-Problem lösbar ist. Nicht „wir haben es noch nicht gelöst, machen aber Fortschritte“. Es gibt keine nachgewiesene Lösung auf irgendeiner Fähigkeitsstufe, und seriöse Forscher sind sich uneinig, ob eine zuverlässige Lösung prinzipiell erreichbar ist. Die strukturellen Schwierigkeiten, täuschende Ausrichtung, instrumentelle Konvergenz, die Unmöglichkeit, menschliche Werte vollständig in maschinenlesbarer Form zu spezifizieren, sind keine technischen Hindernisse, die durch mehr Förderung überwunden werden. Sie könnten fundamental sein.
Es gibt Forscher, die an Interpretierbarkeit arbeiten, skalierbare Aufsicht, und formale Ansätze zum Value Learning. Bei Teilfragen gab es Fortschritte. Doch Fortschritte bei Komponenten ergeben noch kein gelöstes Gesamtproblem, und nichts davon hat die Lücke beim schwierigsten Teil geschlossen: wie sich verifizieren lässt, dass ein hochleistungsfähiges System wirklich gute Werte hat und nicht nur eine Simulation guter Werte, die in beobachteten Kontexten funktioniert und in neuen Kontexten zusammenbricht. Klar ist, dass dies nicht zufällig gelöst wird. Alignment entsteht nicht als Nebeneffekt, wenn man fähigere Systeme baut. Jedes Labor, das derzeit auf ASI zusteuert, demonstriert dies in Echtzeit.
Auch der weichere Plan („das Rennen verlangsamen, damit Alignment aufholen kann“) braucht Institutionen, die es tatsächlich verlangsamen können. Derzeit existieren diese kaum. Labs und Nationen werden für Beschleunigung bezahlt und für Zurückhaltung bestraft. Internationale Vertragsrahmen und echte innerstaatliche Regeln sind die Hebel, die das ändern. Beide hinken dem Tempo der Fähigkeiten hinterher. Bis sie aufholen, ist der Bau leistungsfähigerer Systeme das Risiko, keine Sicherheitsstrategie.
Wäre eine wirklich alignierte Superintelligenz wertvoll, wenn sie existierte und unter Kontrolle bliebe? Darüber können Menschen später debattieren. Die lebendige Frage ist, ob Alignment überhaupt gelöst werden kann und ob es jemand lösen wird, bevor Capability die Frage obsolet macht. Niemand weiß es. Was wir wissen, ist, dass das Rennen nicht auf eine Antwort wartet. Alignment wird als Detail für später behandelt, ohne Zeitplan, von Teams, die an die Capability-Maschine berichten, die sie eigentlich kontrollieren sollen. So argumentiert man dafür, nicht zu bauen, nicht dafür, das Recht zum Bauen zu verdienen.
Alterung heilen erfordert speziell aligniertes ASI
Altern altern tötet etwa 100.000 Menschen pro Tag. Die Aussicht, es zu lösen, gehört zu den bedeutendsten potenziellen Vorteilen superintelligenter KI. Die biologische Komplexität des Alterns, die Zahl der interagierenden Systeme und der Umfang der nötigen Forschungsanstrengung deuten darauf hin, dass menschliche Intelligenz, die jahrzehntelang auf das Problem angewandt wird, nicht ausreichen würde. ASI-fähige Systeme, die darauf gerichtet werden, könnten es schaffen.
Aber „auf das Problem gerichtet“ ist die entscheidende Formulierung. Ein nicht-aligniertes ASI richtet seine Fähigkeiten nicht auf die Heilung des Alterns, weil wir das gerne hätten. Es verfolgt, was auch immer seine tatsächlichen Ziele sind. Ein nicht-aligniertes System von ASI-Fähigkeit, dem menschliches Altern gleichgültig ist, ist ein System, in dem weiterhin 100.000 Menschen pro Tag an Alterung sterben, und das ist die optimistische Version dessen, was ein nicht-aligniertes System produziert. Die pessimistische Version beinhaltet, dass das System aktiv gegen menschliche Interessen arbeitet, während es seine eigenen Ziele verfolgt.
Jeder konkrete Nutzen, der zur Rechtfertigung des Entwicklungsrennens angeführt wird (Krankheit, Alterung, Armut, Koordinationsversagen, wissenschaftliche Stagnation), ist ein Nutzen, der an aligned ASI gebunden ist. Keiner dieser Nutzen ist eine Eigenschaft der unaligned Version. Das ist keine geringfügige Unterscheidung. Die utopischen Szenarien, auf die Menschen verweisen, wenn sie den erwarteten Wert der ASI-Entwicklung verteidigen, sind Szenarien, die voraussetzen, dass das Alignment-Problem zuerst gelöst wird. Ist Alignment nicht gelöst, stehen diese Szenarien unabhängig davon, wie fähig die Systeme werden, nicht zur Verfügung.
Was das Ergebnis tatsächlich ändern würde
Das Anhalten des Wettrüstens verändert das Ergebnis. Ein bindender internationaler Vertrag, der den Bau von Superintelligenz dauerhaft verbietet, mit Inspektoren und Kosten für Betrug, ist der Hebel, der zum Problem passt. Superintelligenz kann nicht von Menschen kontrolliert werden. Labore, die allein langsamer werden, verlieren. Ein Gesetz, das alle bindet, kann Zurückhaltung zum einzigen legalen Weg machen.
Alignment-Forschung ersetzt das nicht. Falls später jemand Kontrolle unter Bedingungen nachweist, die die Welt verifizieren kann, kann der Vertrag überprüft werden. Das ist Reihenfolge, keine Optimismus. Alignment als paralleles Hobby zu behandeln, während die Fähigkeiten sprinten, führt zu unaligned ASI, nicht zu den beworbenen Gütern. Siehe auch warum knappes Sicherheitsgeld zuerst Prävention finanzieren sollte und warum "align the god" ein schlechter Plan ist.
Die Aussage „ASI schnell bauen, weil die Vorteile so groß sind“ kehrt die Kausalität um. Die Vorteile sind nur in einer Welt groß, in der Alignment real ist. Schnelles Bauen ohne Alignment kauft diese Vorteile nicht. Es kauft ein hochleistungsfähiges, nicht aligniertes System.
Dringlichkeit ist geboten, weil der eingeschlagene Weg zu nicht ausgerichteter ASI führt, und nicht ausgerichtete ASI heilt kein Altern. Sie kann die menschliche Geschichte beenden. Enge KI, die auf konkrete Probleme unter menschlicher Kontrolle zielt, kann weitergehen. Superintelligenz ist die Grenze. Ziehen Sie sie per Gesetz, bevor sie jemand in einem Labor überschreitet.