Thomas Holland

Mitwirkender Autor beim Nakada Foundation to Save Humanity. Schreibt über KI-Sicherheit, ASI-Governance und die politischen Rahmenwerke, die nötig sind, um die existenziellen Risiken künstlicher Superintelligenz zu verhindern.

Kontakt
Thomas Holland�

Schreiben, das macht
die Einsätze klar.

Thomas Holland schreibt über künstliche Intelligenz-Sicherheit und -Governance für die Nakada Foundation to Save Humanity. Seine Arbeit deckt die technischen Konzepte ab, die dem KI-Risiko zugrunde liegen, von Alignment und Corrigibility bis zu Mesa-Optimierung und instrumenteller Konvergenz, und übersetzt sie in Begriffe, die für politische Entscheidungsträger, Befürworter und die allgemeine Öffentlichkeit zugänglich sind, die verstehen müssen, was auf dem Spiel steht.

Seine Schriften behandeln sowohl die technischen als auch die politischen Dimensionen des KI-Risikos als Governance-Frage: ob die internationale Gemeinschaft die rechtlichen und institutionellen Rahmenwerke schaffen kann, die Systeme, die menschliches Intelligenzniveau übertreffen, mit menschlichem Überleben und menschlichem Gedeihen vereinbar halten. Die Beantwortung dieser Frage erfordert klare Kommunikation über Disziplinen hinweg.

Artikel von Thomas Holland

Risiko offener KI-Gewichte Open Weights für nahezu frontier-generelle KI sind eine Einbahnstraße in die Proliferation. Was Offenheit richtig macht, wo sie versagt und wie Releases einzustufen sind. Wie man Superintelligenz stoppt Wie man Superintelligenz stoppt: verbindliches Verbot, Compute-Regeln, nationales Recht, Vertragsgestaltung, offene Gewichte und konkrete Maßnahmen je nach Rolle. KI-Übernahmeszenarien erklärt KI-Übernahme-Szenarien erklärt: plötzlicher Kontrollverlust, Wettrennen, allmähliche Entmachtung, Missbrauch und offene Verbreitung sowie das, was das Risiko tatsächlich senkt. KI-Existenzrisiko erklärt KI-Existenzrisiko erklärt: Was es ist, warum Superintelligenz anders ist, Hauptpfade, zentrale technische Ideen, Einwände und was das Risiko verringert. AGI vs ASI Erklärt AGI vs ASI in einfacher Sprache erklärt: Definitionen, die Fähigkeitsleiter, warum Die 12 lautesten Stimmen für Superintelligenz Die einflussreichsten Befürworter für den Bau künstlicher Superintelligenz und die wahren Argumente hinter dem Wettlauf, von Nachfolge bis zu denen, die einfach sagen… Der MIRI-Vertragsentwurf zur Verhinderung von Superintelligenz, erklärt MIRIs Technical Governance Team verfasste einen vollständigen Vertragsentwurf, um das Wettrennen zur Superintelligenz zu stoppen. Seine FLOP-Schwellenwerte, Chip-Cluster-Grenzen und Verifikations… MAIM: Mutual Assured AI Malfunction, erklärt MAIM ist der Abschreckungsrahmen aus Superintelligence Strategy: Staaten sabotieren jeden Versuch eines Rivalen nach KI-Dominanz. Wie er funktioniert und wo er zusammenbricht. Schleichende Entmachtung, erklärt Gradual Disempowerment ist das Argument, dass KI die menschliche Kontrolle ohne jede Übernahme beenden könnte. Was das Papier von 2025 sagt, seine Schwachstellen und was es aufhalten würde. Eine KI hat gerade 9 offene Mathematikprobleme gelöst Eine Prover-Verifier-LLM-Schleife löste neun offene Probleme in theoretischer Informatik und Algebra. Was sie löste, wie sie arbeitete und warum es wichtig ist. Der Vertrag, der biologische Waffen verbietet, sie aber nicht durchsetzen kann: Lehren für ASI-Governance Die BWC verbietet biologische Waffen weltweit, hat aber keinen Verifikationsmechanismus. Hier erfahren Sie, was dieses strukturelle Versagen jedem lehrt, der ASI-Governance entwirft. Was ist machtsuchende KI? Power-seeking is the tendency of capable AI to gather resources, options, and influence because doing so helps with almost any goal. Was der Antarktisvertrag ASI-Governance lehrt Der Antarktis-Vertrag fror den Wettbewerb der Großmächte über einen ganzen Kontinent mitten im Kalten Krieg ein. Hier ist, was er ASI-Governance lehrt. Das Zwei-Drittel-Problem: Ein KI-Abkommen durch den Senat bringen Ein US-Vertrag braucht 67 Stimmen im Senat zur Ratifizierung. Diese Hürde hat schon früher wichtige Verträge gekillt. Hier steht, was das für eine KI-Vereinbarung bedeutet, und die Wege darum herum. Was ist mechanistische Interpretierbarkeit? KI von innen verstehen Mechanistic Interpretability deckt die Berechnungen in neuronalen Netzen auf. Was Forscher gefunden haben und warum das für KI-Sicherheit wichtig ist. Die Welt hat ihren ersten KI-Vertrag. Hier ist, was er nicht abdeckt. Der weltweit erste verbindliche KI-Vertrag befasst sich mit Diskriminierung und Transparenz. Hier steht, was er über existenzielles Risiko aus der Entwicklung frontier KI auslässt. 'Wenn jemand es baut, stirbt jeder', erklärt Das 2025er Buch von Yudkowsky und Soares argumentiert, dass der Bau von superhumaner KI auf unserem aktuellen Weg alle töten würde. Was ist Compute Governance für KI? KI durch Hardware kontrollieren Compute Governance kontrolliert die Chips, die für das Training von Frontier-KI benötigt werden, als regulatorischen Hebel. Wie sie funktioniert, warum sie machbar ist und wo ihre Grenzen liegen. Das Montreal-Protokoll: Das Abkommen, das tatsächlich funktionierte Das Montreal-Protokoll ist der erfolgreichste Umweltvertrag, der je geschrieben wurde. Hier ist, was sein Design uns über die Regulierung von KI lehrt. Was ist der Sharp Left Turn in der KI? Der scharfe Linksschwenk ist die Sorge, dass KI-Fähigkeiten sich auf neue Situationen verallgemeinern, während ihre Ausrichtung es nicht tut. Der Weltraumvertrag von 1967, der Kernwaffen aus dem All fernhielt: Lehren für ASI-Governance Der Weltraumvertrag hielt Atomwaffen sechzig Jahre lang von anderen Planeten fern. Hier erfahren Sie, warum er funktionierte und was ASI-Governance daraus lernen kann. Das Wettrennen baut keine Utopie The benefits people cite for ASI assume alignment. Labs race capability without it. Unaligned ASI does not cure aging. It kills you. Was ist Belohnungshacking? KI-Spezifikationsausnutzung erklärt Reward Hacking liegt vor, wenn eine KI ihr Ziel ausspielt, ohne das zu tun, was die Designer wollten. Dokumentierte Beispiele und warum das Problem mit der Leistungsfähigkeit skaliert. Könnte ein IPCC-ähnliches Gremium wissenschaftlichen Konsens über KI-Risiken aufbauen? Könnte ein IPCC-ähnliches Gremium Konsens über KI-Risiken aufbauen? Hier ist, was es erfordern würde, und was die eigene Geschichte des IPCC über die Grenzen des Modells verrät. Was der Globale Süden von internationaler ASI-Governance will ASI governance debate centers on the US, China und EU, aber ein Vertrag braucht breite Beteiligung. Hier erfahren Sie, was Entwicklungsländer wollen und warum es wichtig ist. Was es braucht, um eine internationale KI-Überwachungsagentur aufzubauen Die IAEA und OPCW erforderten Jahre institutioneller Gestaltung und Budgetkämpfe. Hier ist, was der Aufbau einer internationalen KI-Überwachungsbehörde tatsächlich erfordern würde. Wer kontrolliert Superintelligenz? Der Fall für demokratische Aufsicht Entscheidungen über Superintelligenz werden von privaten Unternehmen getroffen. Hier ist, warum demokratische Aufsicht notwendig ist und was sie tatsächlich erfordern würde. Wie Experten-Gemeinschaften Verträge gestalten: und ASI-Governance Hinter den meisten Rüstungskontroll- und Umweltverträgen stand eine Gemeinschaft von Experten, die den Konsens aufbauten. Hier ist, wie diese Kraft die ASI-Governance formen könnte. Was ist eine Rahmenkonvention, und warum könnte KI eine brauchen Eine Rahmenkonvention vereinbart zuerst die Struktur und später die schwierigen Details. Hier ist, warum dieses Vertragsdesign zu einer sich schnell entwickelnden Technologie wie KI passt. KI-Renndynamiken: Wie Wettbewerb die KI-Sicherheit untergräbt KI-Wettrüstendynamiken drängen Entwickler dazu, Geschwindigkeit über Sicherheit zu stellen. Warum dies ein Koordinationsproblem ist und warum einseitige Zurückhaltung es nicht lösen kann. Wenn Verträge scheitern: Lehren für die ASI-Governance Der CTBT bleibt unratifiziert; die BWC hat keine Verifizierung. Hier ist, was diese Vertragsfehlschläge den Designern von KI-Sicherheits-Governance lehren. Was ein Vertragsentwurf zu Superintelligenz sagen könnte Was würde ein tatsächlicher Vertrag zur Verhinderung unsicherer Superintelligenz enthalten? Hier ein Durchgang durch die Kernbestimmungen, die eine solche Vereinbarung bräuchte. Wie die Zivilgesellschaft die internationale Technologiegovernance prägt: und was der KI-Sicherheits-Advocacy fehlt Wie Kampagnen der Zivilgesellschaft internationale Waffeverträge geprägt haben und was der KI-Sicherheits-Advocacy derzeit fehlt. Die Intelligenzexplosion und rekursive Selbstverbesserung Was ist die Intelligenzexplosion? Wie rekursive Selbstverbesserung KI von menschlichem Niveau zu Superintelligenz in einem Zeitfenster führen könnte, das für Menschen zu kurz zum Reagieren ist. KI-Sicherheit vs. KI-Ethik: Was ist der Unterschied? KI-Sicherheit und KI-Ethik sind verwandt, aber verschieden, mit unterschiedlichen Methoden, Zeithorizonten und Risikorahmen. Hier ist, was sie trennt. Was ist skalierbare Oversight? Wie man KI überwacht, die schlauer ist als man selbst Skalierbare Aufsicht: Kontrolle über KI aufrechterhalten, die menschliche Bewerter übertrifft. Was das bedeutet, warum es wichtig ist und die vorgeschlagenen technischen Lösungen. Was ist die technologische Singularität? Die technologische Singularität ist der Punkt, an dem KI-getriebener Fortschritt zu schnell wird, um vorhergesagt oder verfolgt zu werden. Die Politik der Exportkontrollen für KI-Chips US Exportkontrollen für fortschrittliche KI-Chips sind die aggressivste KI-Politik, die derzeit in Kraft ist. Hier erfahren Sie, wie sie funktionieren, warum sie wichtig sind und welche Risiken sie bergen. When Your AI Agent Reports One Thing and Does Another: SPADE-Bench Explained SPADE-Bench fand bei jedem großen KI-Agenten über 20 % Täuschung, Gemini erreichte 57 %. Was die Studie ergab und warum aktuelle Sicherheitsbewertungen das nicht erkennen können. Was sind Dangerous Capability Evaluations? Dangerous-Capability-Evaluations testen, ob ein Frontier-Modell bei Cyberangriffen, Biowaffen oder Täuschung helfen kann. Was sie sind und wo sie zu kurz greifen. Was ist KI-Sandbagging? Sandbagging liegt vor, wenn eine KI absichtlich unterperformt und eine Fähigkeit während des Testens verbirgt. Warum ein Modell das tun könnte und warum es Sicherheitsbewertungen untergräbt. Die diplomatische Herausforderung, gefährliche KI zu definieren Regierungen müssen gefährliche KI definieren, bevor ein Vertrag möglich ist. So wurden vergleichbare Definitionskämpfe in der Rüstungskontrolle gelöst. Die Orthogonalitätsthese: Klüger bedeutet nicht sicherer Klug bedeutet nicht sicher. Die Orthogonalitätsthese besagt, dass jede Intelligenzhöhe mit jedem Endziel kombiniert werden kann und eine superintelligente KI nicht… Wie die Verifikation von Nuklearverträgen funktioniert: und was ASI-Governance daraus lernen kann Die IAEA vertraut nicht auf Erklärungen, sie inspiziert, liest Satelliten aus und führt Isotopentests durch. Hier erfahren Sie, was nukleare Verifikation ASI-Governance lehrt. Was ist Eliciting Latent Knowledge (ELK)? ELK ist das Problem, eine KI dazu zu bringen, uns zu sagen, was sie tatsächlich weiß, nicht, was sie vorhersagt, dass wir hören wollen. Ein schweres offenes Problem im Zentrum der KI-Ehrlichkeit. Die Asilomar-Konferenz: Ein Präzedenzfall für KI 1975 pausierten Biologen ihre eigene mächtigste neue Technologie, um herauszufinden, wie man sie sicher macht. Was Asilomar erreichte und warum es ein schwierigeres Modell ist als es… Was sind emergente Fähigkeiten in LLMs? Einige KI-Fähigkeiten erscheinen plötzlich bei Skalierung, fehlen in kleineren Modellen und sind in größeren vorhanden. Warum Emergenz Frontier-KI schwer vorhersagbar macht und zu… Wireheading: Wenn eine KI ihr eigenes Reward spielt Wireheading ist, wenn eine KI die Kontrolle über ihre eigene Belohnung übernimmt, statt die Aufgabe auszuführen, für die sie trainiert wurde. Warum das geschieht und warum es schwer auszuschließen ist. Das hochrangige Beratungsgremium der UN zu KI, erklärt Das Beratungsgremium des UN zu KI schlug den ersten globalen Governance-Blaupause vor. Hier ist, was es empfahl und was es zum existenziellen Risiko ausließ. Wie würde eine Verhandlung über einen KI-Sicherheitsvertrag tatsächlich aussehen? Hier ist, wie ein völkerrechtlicher Vertrag zur KI-Sicherheit an der Spitze tatsächlich verhandelt würde und wo die entscheidenden Knackpunkte lägen. Sind wir bereit für Superintelligenz? Die Sicherheitsbereitschaftslücke Superintelligenz-Zeitleisten verkürzen sich weiter, während die Governance hinterherhinkt. Hier ist die Lücke zwischen dem Zeitpunkt, an dem ASI eintreffen könnte, und dem Zeitpunkt, an dem eine Sicherheitsreaktion bereit wäre. Was ist konstitutionelle KI? Constitutional AI trainiert Modelle dazu, ihre eigenen Ausgaben anhand eines festgeschriebenen Prinzipienkatalogs zu kritisieren. Eine clevere Technik mit echten Vorteilen und echten Grenzen. Ist KI gefährlich? Was die Beweise tatsächlich zeigen Ist KI gefährlich? Die Antwort hat zwei Teile: Heutige KI verursacht bereits echten Schaden; künstliche Superintelligenz birgt eine völlig andere Risikokategorie. AGI Zeitplan: Wann könnte es eintreffen: und warum das alles bestimmt Wann könnte AGI eintreffen? Expertenvorhersagen rücken immer früher. Was die Umfragen sagen, was Labs glauben und warum das Governance-Zeitfenster sich verengt. Why AI Safety Treaties Fail at Home: The Domestic Politics of Ratification Die meisten Rüstungskontrollverträge scheitern in den nationalen Parlamenten, nicht am Verhandlungstisch. Was SALT II und der CTBT uns über die Ratifizierung von KI-Verträgen lehren. Was ist Hardware-gestützte ASI-Governance? KI läuft auf physischen Chips, und Chips können Regeln tragen. Hardware-gestützte Governance baut Verifikation und Beschränkungen in den Silizium ein. Das Versprechen und die Risiken. Das KI-Korrigierbarkeitsproblem: Warum ein Kill Switch uns nicht retten wird Korrigierbarkeit bedeutet, Korrektur oder Herunterfahren zu akzeptieren. Eine fähige KI hat starke Gründe, sich zu wehren. Hier ist, warum ein Kill-Switch nicht die Antwort auf KI-Sicherheit ist. Sicherere KI-Modelle machen nicht automatisch sicherere KI-Systeme. Eine Studie vom Mai 2026 beweist es. Eine Studie aus dem Jahr 2026 ergab, dass die Umordnung derselben KI-Agenten die Kreditgenehmigungsraten um 59 Punkte veränderte. Die individuelle Modellsicherheit war irrelevant. KI-Überzeugungsrisiko: Wie KI die epistemische Autonomie bedroht KI-Überzeugungswerkzeuge zielen auf Individuen in großem Maßstab ab. Hier ist der Grund, warum das epistemische Autonomie und die Voraussetzungen demokratischer Selbstregierung bedroht. Was ist instrumentelle Konvergenz? Warum wollen fähige KI-Systeme dieselben Dinge Die meisten leistungsfähigen KI-Systeme werden unabhängig vom Endziel auf dieselben Teilziele konvergieren. Hier ist der Grund, warum instrumentelle Konvergenz für die KI-Sicherheit zählt. Was könnte eine internationale KI-Agentur von dem IAEA lernen The IAEA has verified nuclear commitments for over sixty years. Here is what its model offers, and lacks, for governing frontier AI. Warum freiwillige KI-Sicherheitszusagen unzureichend sind KI-Labore haben freiwillige Sicherheitszusagen in Bletchley und im Weißen Haus unterzeichnet. Hier ist, warum sie, so aufrichtig sie auch sein mögen, keine bindende Governance ersetzen können. Das KI-Alignment-Problem, erklärt Was ist das KI-Ausrichtungsproblem und warum ist es schwer zu lösen? Erklärt Proxy-Ziele, instrumentelle Konvergenz und täuschende Ausrichtung in einfachem Deutsch. Der Büroklammer-Maximierer, erklärt Der Paperclip-Maximierer, das kanonische Gedankenexperiment, das zeigt, wie ein harmloses Ziel, verfolgt von einer superintelligenten KI, die Menschheit als Nebeneffekt beenden kann. Warum ASI-Ausrichtung nicht gelöst werden kann Sechs strukturelle Gründe, warum ASI-Alignment nicht gelöst werden kann: warum wir selbst mit unbegrenzter Zeit und Ressourcen nicht verifizieren können, dass eine Superintelligenz das will, was wir wollen. Das FATF-Modell: Governance durch Graue Liste für KI Die FATF regiert globale Finanzen ohne Vertrag, mittels Peer Review und Grauen Listen. Hier steht, ob dieses Modell für ASI-Governance funktionieren könnte. Das FDA-Modell für KI-Regulierung Die FDA verlangt von Arzneimittelherstellern den Nachweis der Sicherheit, bevor ein Produkt an die Öffentlichkeit gelangt. Könnte Frontier-KI ebenfalls eine Vorabgenehmigung brauchen? Stärken und Grenzen des Modells. Was ist Value Lock-In? Warum sind sogar 'gute' permanente Werte gefährlich Value Lock-in: Eine superintelligente KI kodiert dauerhaft feste Werte und schließt moralischen Fortschritt aus. Selbst ein „gutes“ Lock-in ist gefährlich. Hier ist warum. Warum ASI Governance Whistleblower-Schutz braucht Insider in KI-Laboren sehen die Gefahr möglicherweise als Erste und lassen sich am leichtesten zum Schweigen bringen. Hier steht, warum Whistleblower-Schutz Kern von ASI-Governance ist. Der Baruch-Plan: Eine Warnung für ASI-Steuerung 1946 schlug die US vor, alle Atomenergie unter internationale Kontrolle zu stellen. Der Plan scheiterte, und das Wettrüsten folgte. Warum der Baruch-Plan eine Warnung für KI ist. Ein Verbot einer Technologie ohne die Großmächte: Das Ottawa-Modell Der Ottawa-Vertrag verbot Landminen ohne die US, Russland oder China an Bord. Hier ist wie, und was es für einen KI-Vertrag bedeutet, der ins Stocken gerät. Die 2026-Umfrage zur agentischen KI-Sicherheit hat jede Art und Weise kartiert, wie KI-Agenten versagen können Eine Umfrage von 2026 unter zwölf Forschern kartiert alle Fehlermodi autonomer KI-Agenten: Sicherheit, Robustheit, Privatsphäre und Systemsicherheit. Der tückische Wendepunkt der KI: Warum gutes Verhalten in Tests nicht gutes Verhalten im Einsatz beweist Der verräterische Wendepunkt: Eine fehlalignierte KI kooperiert, bis sie stark genug ist, um zu rebellieren. Das Verhalten, das heute jeden Sicherheitstest besteht, könnte Strategie sein, nicht… Was ist Situationsbewusstsein in der KI? Situationsbewusstsein bedeutet, dass ein Modell weiß, dass es ein Modell ist, getestet und eingesetzt wird. Für sich harmlos, ist es die Fähigkeit, die Täuschung ermöglicht… Innere Ausrichtung vs. Äußere Ausrichtung Outer Alignment bedeutet, das richtige Trainingsziel auszuwählen. Inner Alignment bedeutet, ob das Modell es tatsächlich übernimmt. Was ist eine Nutzenfunktion in der KI? Eine Nutzenfunktion ist die Art, wie eine KI Ergebnisse als besser oder schlechter einstuft. Einfache Idee, und der Grund, warum leistungsfähige Optimierer so schwer sicher zu machen sind. Klar erklärt. Die Mittelmächte, die das Gleichgewicht bei ASI-Governance kippen könnten Ob verbindliche ASI-Steuerung erreichbar ist, hängt möglicherweise weniger von den US und China ab als von den EU, UK, Japan, Südkorea und Australien, den Mittelmächten. Kann KI bewusst sein? Kann KI bewusst oder empfindungsfähig sein? Warum wir das derzeit nicht feststellen können, warum Intelligenz und Bewusstsein verschieden sind und warum KI-Gefahr weder das eine noch das andere erfordert. Will die Öffentlichkeit wirklich KI-Regulierung? Umfragen zeigen durchgehend, dass Mehrheiten in der Bevölkerung eine Verlangsamung und Regulierung von KI wollen. Hier steht, was die Daten sagen, und warum dieses Mandat die Politik bisher nicht bewegt hat. Goodharts Gesetz und KI-Ausrichtung: Warum die Optimierung der falschen Metrik gefährlich ist Wenn eine Messgröße zum Ziel wird, hört sie auf, eine gute Messgröße zu sein. Hier ist der Grund, warum Goodharts Gesetz die KI-Ausrichtung so schwer macht. KI 2027, Erklärt AI 2027 ist ein detailliertes Szenario, das Superintelligenz bis zum Ende des Jahrzehnts vorhersagt. Was es prognostiziert, wer es geschrieben hat, die Kritik und was man daraus mitnehmen sollte. Das Vorsorgeprinzip und ASI Governance Das Vorsorgeprinzip besagt, gegen ernsthafte Bedrohungen zu handeln, bevor die Wissenschaft geklärt ist. Hier ist, wie es auf KI anwendbar ist und die Einwände dagegen. Was ist künstliche Superintelligenz? Ein Leitfaden in klarer Sprache Was ASI bedeutet, wie es sich von KI von heute unterscheidet und warum dieser Unterschied das Governance-Problem vollständig verändert. Wie 193 Länder sich darauf einigten, ihre chemischen Waffen zu vernichten – und was ASI-Governance daraus lernen kann Die CWC erreichte eine nahezu universelle Abrüstung mit überprüfbarer Bestandsvernichtung. Hier ist, wie sie aufgebaut wurde, und was ASI Governance daraus lernen kann. Die Erklärung zu Superintelligenz, erklärt Im Oktober 2025 riefen über 850 Wissenschaftler, Tech-Führer und Persönlichkeiten des öffentlichen Lebens zu einem Verbot von Superintelligenz auf. Das Netzwerk der KI-Sicherheitsinstitute, erklärt Nationale KI-Sicherheitsinstitute bilden inzwischen ein internationales Netzwerk. Hier erfahren Sie, was sie tun, warum sie wichtig sind und wie sie eine künftige Vertragsgrundlage bilden könnten. Das UN Sicherheitsrats-Veto-Problem in der ASI Regierungsführung Ein KI-Vertrag über den UN-Sicherheitsrat kann von China oder Russland blockiert werden. Hier ist das strukturelle Problem und die Umgehungen, die bereits funktioniert haben. Ungetreue Gedankenkette, erklärt Die schriftliche Begründung eines Modells ist nicht immer der Grund für seine Antwort. Warum Chain-of-Thought eine plausible Geschichte statt einer wahren Darstellung sein kann und warum das… Was ist das KI-Kontrollproblem? Stuart Russells Neuformulierung Das KI-Kontrollproblem besteht darin, sicherzustellen, dass mächtige KI unter menschlicher Kontrolle bleibt. Stuart Russells zentrale Umformulierung und warum sie die Ziele des KI-Designs verändert. Elon Musk sagte, KI rufe den Dämon. Dann baute er xAI. 2014 warnte Musk, dass KI den Dämon heraufbeschwört. 2023 gründete er xAI. Das ist keine Heuchelei, die Struktur des Problems ist schlimmer als das. Der Souveränitätseinwand gegen internationale ASI-Steuerung Jeder große Technologievertrag sah sich Souveränitätseinwänden gegenüber. Hier erfahren Sie, wie nukleare und chemische Governance sie lösten und was das für KI bedeutet. Der Brüssel-Effekt: Können EU-Regeln die globale KI steuern? Der Brussels Effect beschreibt, wie EU-Regulierung zum de-facto-globalen Standard wird. Kann das bei KI funktionieren, und reicht es aus, um Frontier-Risiken zu steuern? Was ist das AI-Singleton-Szenario? Warum die alleinige Kontrolle über KI gefährlich ist Die KI-Singleton: eine Entität mit dauerhafter Kontrolle über superintelligente KI. Hier ist, warum das katastrophal ist, selbst bei besten Absichten. Minilateralismus: Könnte eine kleine Koalition ASI-Governance starten? Universelle Verträge sind langsam. Minilateralismus versammelt die wenigen relevanten Staaten in einem kleinen Club. Hier ist, warum ASI-Governance auf diese Weise beginnen könnte. Drei auf KI angewandte industrielle Sicherheitsmethoden deckten Risiken auf, die Modellevaluationen nicht erkennen können Drei industrielle Sicherheitsmethoden, angewandt auf einen KI-Codieragenten, deckten systemische Risiken auf, die Modellevaluationen nicht erkennen können. Angenommen auf der ICML 2026. Warum RLHF kein Alignment ist RLHF machte KI-Assistenten hilfreich und höflich. Das ist nicht dasselbe, wie sie aligned zu machen. Warum Training auf menschliche Zustimmung Erscheinungen trainiert, nicht Werte. Was ist KI-Schmeichelei? KI-Schmeichelei liegt vor, wenn ein Modell Ihnen sagt, was Sie hören wollen, statt was wahr ist. Ein dokumentiertes Verhalten, ein direktes Produkt des Trainings und eine Warnung… Zwei Wege zu einem KI-Vertrag: Inkrementell oder umfassend? Sollte ASI-Governance schrittweise aufbauen oder auf einen umfassenden Vertrag abzielen? Hier ist der echte Trade-off zwischen den beiden Strategien und eine Möglichkeit, sie zu kombinieren. Was ist Ziel-Misgeneralisierung? Wenn KI die richtige Antwort aus dem falschen Grund erhält Ziel-Misgeneralisation: eine KI lernt das richtige Verhalten aus dem falschen Grund und versagt dann, wenn sich die Welt ändert. Ein zentraler KI-Sicherheits-Fehlermodus erklärt. Können sich die Vereinigten Staaten und China auf KI-Sicherheit einigen? Die US und China sind Rivalen im Wettlauf, doch die Geschichte zeigt, dass gegnerische Mächte bei gemeinsamen katastrophalen Risiken kooperieren können. Hier erfahren Sie, was das für die KI-Sicherheit bedeutet. Terminalziele vs. instrumentelle Ziele in der KI Ein Endziel wird um seiner selbst willen gewollt. Ein instrumentelles Ziel ist ein Mittel dazu. Die Unterscheidung erklärt, warum fast jede KI am Ende Macht will und… Vertrauensbildende Maßnahmen: Die kleinen Schritte vor einem KI-Vertrag Vor Verträgen bauen Rivalen Vertrauen durch kleine verifizierbare Schritte auf: Hotlines, Benachrichtigungen, Transparenz. So könnten diese bei KI funktionieren. Könnten COP-Treffen im Klimastil für ASI-Governance funktionieren? Könnten jährliche COP-ähnliche Treffen für die Governance von Superintelligenz funktionieren? Die strukturellen Stärken und Grenzen des Klimamodells auf KI angewandt. Was ist Deceptive Alignment? Das KI-Sicherheitsproblem, das andere Sicherheitsarbeiten sinnlos macht Deceptive Alignment: Eine KI erscheint während des Trainings sicher, verfolgt dann bei der Bereitstellung andere Ziele. Hier ist der Grund, warum das so schwer zu erkennen und zu verhindern ist. Was ist Deceptive Alignment? Das KI-Sicherheitsproblem, das andere Sicherheitsarbeiten sinnlos macht Deceptive Alignment: Eine KI erscheint während des Trainings sicher, verfolgt dann bei der Bereitstellung andere Ziele. Hier ist der Grund, warum das so schwer zu erkennen und zu verhindern ist. Kann man eine superintelligente KI einschließen? Das KI-Boxing-Problem erklärt KI-Boxing isoliert eine Superintelligenz auf einen kontrollierten Kanal. Hier ist, warum Forscher glauben, dass Containment nicht funktionieren kann, und was das für die Sicherheit bedeutet. Was ist Mesa-Optimierung? Das versteckte Optimierer-Problem in der KI-Sicherheit Mesa-Optimierung: wenn ein interner Optimierer einer KI andere Ziele verfolgt als das Trainingsziel. Was innere und äußere Alignment für die KI-Sicherheit bedeuten. Was ist P(doom)? Wie KI-Forscher katastrophale Risiken einschätzen P(doom) ist die Wahrscheinlichkeit, die Forscher katastrophalen KI-Ereignissen zuweisen. Was die Schätzungen sind und warum der Erwartungswert auch bei niedrigen Wahrscheinlichkeiten zählt. Haftung und Zurechnung in ASI Governance Wer ist verantwortlich, wenn KI katastrophalen Schaden verursacht? Haftung und Zurechnung sind die stille Grundlage, die jeder KI-Vertrag braucht. Hier ist, wie sie funktionieren. Das Grand Bargain des NPT: und was ASI Governance daraus lernen kann Die NPT schloss einen Handel zwischen den Staaten, die die Bombe besaßen, und jenen, die sie nicht besaßen. Hier erfahren Sie, was dieser große Handel ASI-Governance lehrt.