Ein AI Safety Institute ist eine staatliche Stelle, die eingerichtet wird, um frontier-KI-Systeme auf Risiken für die nationale Sicherheit und die öffentliche Sicherheit zu prüfen und die eigene Expertise des Staates zu frontier-KI aufzubauen. Die erste Welle konzentrierte sich um den internationalen KI-Gipfel 2023. Die Institute tauschen inzwischen Methoden und Erkenntnisse über ein internationales Netzwerk aus, das durch Seoul und Folgetreffen vorangetrieben wurde.

Mehrere große Hauptstädte betreiben nun ein Institut oder ein Äquivalent. Die meisten von ihnen können immer noch nicht anordnen, dass ein gefährliches Modell zurückgehalten wird.

Eine Anmerkung zu Namen: Die beiden Gründungsinstitute wurden umbenannt. Die UK-Organisation wurde im Februar 2025 zum AI Security Institute. Das US-Institut heißt jetzt Center for AI Standards and Innovation (CAISI) bei NIST. „AI safety institute“ bleibt der übliche generische Begriff, und dieser Leitfaden verwendet ihn durchgehend.

Jahrelang verstanden nur die Unternehmen, die sie bauten, die frontier models wirklich tief. Ein Institut ist der Versuch, unabhängige technische Kompetenz in die Regierung zu holen, damit öffentliche Behörden Systeme selbst bewerten können, statt ein Briefing des Entwicklers als letztes Wort zu akzeptieren.

Was sie tatsächlich tun

Ihre Arbeit gruppiert sich in wenige Bereiche.

  • Frontier-Modelle testen, manchmal vor der Freigabe, auf gefährliche Fähigkeiten in Bereichen wie Cyber, Biologie und Autonomie, mit den Methoden hinter Fähigkeitsbewertungen.
  • Die Wissenschaft der Evaluierung selbst weiterentwickeln, denn diese Risiken gut zu messen ist noch ein offenes Forschungsproblem und kein abgeschlossenes Verfahren.
  • Beratung der Regierung, damit die Politik von Menschen informiert wird, die die Systeme tatsächlich untersucht haben.
  • Internationale Koordination, damit ein in einem Land getestetes Modell nicht überall neu aufgebaut werden muss und damit Standards allmählich konvergieren.

Das ist echter institutioneller Fortschritt. Staatliche Kapazität aufzubauen, um Frontier-KI zu verstehen, ist eine Voraussetzung für ihre Governance. Man kann nicht regulieren, was man nicht bewerten kann, und bis vor kurzem konnten Regierungen das weitgehend nicht.

Die Macht, die ihnen größtenteils fehlt

Die meisten AI Safety Institutes können testen, beraten und veröffentlichen. Wenige können zwingen. Der Zugang zu Modellen hängt oft von der Kooperation der Labs ab. Die Erkenntnisse informieren meist, statt zu binden. In den meisten Fällen kann ein Institut nicht anordnen, dass ein gefährliches Modell zurückgehalten wird. Diese Stellen können ein Risiko erkennen und eine Reaktion empfehlen. Sie dürfen sie selten vorschreiben.

Diese Lücke zwischen Bewertung und Autorität ist die strukturelle Grenze. Ein Institut, das eine ernsthafte Gefahr entdeckt und nur beraten kann, ist nur so wirksam wie der Wille der Regierung, gegen kommerziellen und wettbewerblichen Druck zum Weitermachen zu handeln. Ein großer Teil der aktuellen Architektur ist ein Warnsystem. Ein Warnsystem ist keine Sicherheitsvorkehrung, bis jemand mit Macht auf den Alarm reagiert.

Der gängige Einwand lautet, technische Kapazität reiche aus und Politik werde nachziehen. Kapazität ohne Autorität ist der Weg, auf dem Regierungen die schlechten Nachrichten spät erfahren und noch später handeln. Tests, die keinen Stopp erzwingen können, sind Vorbereitung auf Governance, nicht Governance selbst.

Was sie werden könnten

Der bleibende Wert von AI Safety Institutes liegt in dem, was sie für spätere bindende Regime zusammenstellen: unabhängige technische Kapazität, gemeinsame Standards und einen internationalen Kanal zwischen Regierungen. In diesem Sinne sind sie die frühe Form der Art von Institution, für die die Foundation argumentiert. Unser Beitrag zu eine internationale Überwachungsagentur beschreibt, wohin das führen könnte. Die IPCC-Modell zeigt, wie eine gemeinsame wissenschaftliche Bewertung internationale Politik untermauern kann.

Was sich ändern muss, ist die Autorität. Bewertung muss mit Durchsetzung verbunden sein, sei es durch nationales Recht, das die Freigabe eines Instituts zur Voraussetzung für den Einsatz macht, oder durch einen internationalen Rahmen, der verifizierten Erkenntnissen echte Konsequenzen verleiht. Gibt man diesen Instituten Macht, die ihrer Expertise entspricht, ist ein großer Teil des Gerüsts ernsthafter Governance bereits teilweise vorhanden. Dieser Übergang ist Gegenstand von unser Plan: Superintelligenz per Gesetz stoppen, mit öffentlicher Evaluierungskapazität als Infrastruktur, nicht als Ersatz für Verbot und Verifikation.