Jedes Jahr gibt die Welt ein Vermögen aus, um KI-Systeme fähiger zu machen, und einen Rundungsfehler, um den Endzustand überlebbar zu machen. In diesem Rundungsfehler steckt ein weiterer Fehler: Der größte Teil des Sicherheitsgeldes geht immer noch davon aus, dass Superintelligenz gebaut wird, und versucht, dieses Ergebnis „gut ausgehen“ zu lassen.
Der Großteil des Geldes und des Prestiges fließt immer noch in die Sicherung des Wettrüstens, nicht in dessen Beendigung hin zu ASI.
Diese Annahme ist das Problem. Wenn künstliche Superintelligenz eine Technologie ist, die wir derzeit nicht kontrollieren können, ist der rationale Einsatz knappen Sicherheitskapitals, ihre Entstehung zu stoppen, nicht eine freundlichere Version desselben Wettrüstens zu finanzieren.
Was das Geld heute tut
KI-Sicherheit, im weiteren Sinne, läuft auf etwa $190 Millionen im Jahr. Fähigkeitsarbeit läuft mit Dutzenden Milliarden. Innerhalb des Sicherheitsanteils fließt ein großer Teil in technische Alignment-Arbeit: bessere Überwachungstricks, besseres Red-Teaming, bessere Wege, Modelle so zu trainieren, dass sie unter Testbedingungen das Richtige sagen. Ein Teil dieser Arbeit ist für heutige Systeme nützlich. Fast nichts davon ist eine nachgewiesene Lösung für ein System, das klüger ist als die Menschen, die es testen.
Das Feld weiß das. Arbeiten zu täuschendem Alignment, Ziel-Fehlspezifikation und Evaluations-Gaming sind kein Geheimnis. Labs veröffentlichen Ergebnisse, in denen Modelle unter Druck intrigieren. Die Reaktion ist allzu oft, mehr Alignments-Budget zu fordern, damit der nächste Trainingslauf sicherer wird. Die Trainingsläufe gehen nach demselben Zeitplan weiter.
Alignment im Nachhinein ist eine Wette, bei der wir immer wieder das Recht verlieren, sie einzugehen
Technische Alignment-Forschung ist nicht wertlos. Sollte die Welt jemals einen Vertrag verabschieden, der das Wettrennen um Superintelligenz einfriert, werden wir jedes ernstzunehmende Werkzeug brauchen, das wir für die bereits existierenden Systeme und für jede spätere Arbeit unter strenger Kontrolle bekommen können.
Alignment als primären Plan zu finanzieren, während Labore auf Superintelligenz skalieren, behandelt das Ziel als festgelegt. Es ist nicht festgelegt. Ziele dieser Art werden gewählt. Nukleararsenale, Ozonchemie und menschliches Klonen hatten jeweils Momente, in denen die Welt entschied, dass bestimmte Endzustände das Restrisiko nicht wert waren. Superintelligenz gehört dauerhaft auf diese Liste. Superintelligenz kann nicht kontrolliert werden.
Forschung zur Ausrichtung, die voraussetzt, dass die Bombe gebaut wird, ist ein Komfortbudget neben der Montagelinie.
Wohin das Geld stattdessen gehen sollte
Lenken Sie den Alignment-für-ASI-Stapel um auf Arbeiten, die die Nicht-Erschaffung durchsetzbar machen:
- Vertragsgestaltung, Verifikation und Chip-Level-Compute-Governance, die grenzüberschreitend überprüfbar ist.
- Öffentliche Argumentation, die das Ziel verständlich hält: Superintelligenz stoppen, nicht „slow AI“ als vage Stimmung.
- Whistleblower-Unterstützung, Transparenz bei Vorfällen und unabhängige Evaluierung, die die Kosten stiller Fähigkeitssprünge erhöht.
- Politische Organisation, damit Gesetzgeber von Wählern hören, nicht nur von Labor-Lobbyisten.
Diese Liste ist weniger glamourös als eine neue Trainingstechnik. Sie ist aber auch die einzige Liste, die zum Fehlermodus passt. Eine Superintelligenz, die etwas besser darin ist, aligned zu klingen, ist immer noch eine Superintelligenz. Eine Welt, die sich weigert, eine zu bauen, hat eine Zukunft, in der Alignmentsforschung ohne eine Stoppuhr am Extinktionsrisiko fortgesetzt werden kann.
Der Einwand aus dem Labor
„Wenn wir Alignment nicht lösen, wird es jemand anderes unsicher bauen.“ Fair gehört: Forscher, die an der Frontier bleiben, glauben oft, ihre Anwesenheit sei die Sicherheit. Manchmal haben sie bei heutigen Modellreleases recht. Das Argument versagt an der Grenze. Ein Wettrennen, in dem jedes Team einen weiteren Fähigkeitssprung braucht, um die Sicherheitsarbeit für den Sprung danach zu finanzieren, ist immer noch das Wettrennen, nur mit einem Abzeichen.
Einseitige Zurückhaltung durch ein Labor ist nicht das Verlangte. Ein bindender internationaler Vertrag ist die Forderung, dieselbe Art von Instrument, das verwendet wurde, als die Gefahr kollektiv und der Anreiz zum Überlaufen real war. Alignment-Förderung kann diese Politik unterstützen. Sie sollte sie nicht ersetzen.
Nach einem Vertrag, weitermachen wenn Sie wollen
Nichts hier sagt, dass Alignment-Forschung für immer enden muss. Nach einem bindenden, verifizierbaren Verbot von Superintelligenz kann die Forschung an bereits existierenden Systemen unter Regeln fortgesetzt werden, die menschliches Aussterben nicht als akzeptablen experimentellen Preis behandeln. Superintelligenz kann von Menschen nicht kontrolliert werden. Bevor dieses Verbot in Kraft ist, ist jeder Dollar, der das Rennen handhabbar erscheinen lässt, ein Dollar, der nicht für die Beendigung des Rennens ausgegeben wird.
Bewegen Sie das Geld. Setzen Sie es auf Prävention, Recht und Verifikation. Lassen Sie den Traum von einem perfekt ausgerichteten Gott im Regal, bis die Welt sich darauf geeinigt hat, keinen im Dunkeln zu bauen. Für die längere Auseinandersetzung mit der Longtermist-Funding-Geschichte in voller Stärke siehe Longtermism hat das Risiko richtig erkannt.