Jason Wei und Mitautoren bei Google und anderswo katalogisierten Aufgaben, bei denen die Leistung nahe der Zufallswahrscheinlichkeit lag, bis die Modellskalierung eine Schwelle überschritt und dann steil anstieg. Mehrstufige Arithmetik, fachspezifische Fragen, Anweisungen in Sprachen, die im Training kaum vorkamen, Ketten von Denkschritten: keine davon war als Feature eingebaut. Sie erschienen, als die Modelle wuchsen. Das Paper nannte sie emergent abilities.
Eine emergente Fähigkeit ist in dieser Verwendung eine Fähigkeit, die ein kleineres Modell nicht hat und ein größeres schon, wobei der Übergang weniger wie eine sanfte Rampe und mehr wie ein Schalter aussieht. Unterhalb einer bestimmten Skala kann das Modell die Aufgabe nicht erledigen. Darüber kann es es. Die Fähigkeit war aus dem Trend kleinerer Systeme allein nicht ablesbar.
Eine echte Debatte, die es wert ist, markiert zu werden
Emergenz ist keine gesicherte Wissenschaft. Einige Forscher argumentieren, dass ein Teil der berichteten Sprünge teilweise ein Messartefakt ist: Eine strenge Alles-oder-nichts-Metrik lässt stetigen zugrunde liegenden Fortschritt plötzlich erscheinen, während eine glattere Metrik graduelle Verbesserung zeigt. Diese Kritik trifft bestimmte Fälle und verdient eine faire Anhörung.
Es löst das praktische Problem nicht auf. Ob eine Fähigkeit als echte Diskontinuität oder als steile Kurve auftritt, die erst bemerkt wird, nachdem sie eine Schwelle überschritten hat, die Governance-Situation ist dieselbe. Wir erfahren, dass ein Modell etwas Neues kann, nachdem es es kann, nicht vorher. Für einen Entscheidungsträger, der entscheidet, ob der nächste Trainingslauf sicher zum Start freigegeben werden kann, ist die Unterscheidung zwischen echtem Emergenz und einer scharfen Kurve akademisch. In beiden Fällen liegt die Überraschung jenseits der Entscheidung.
Warum Unvorhersehbarkeit das Kernproblem ist
Wir können vor dem Training eines größeren Modells nicht zuverlässig die vollständige Liste dessen vorhersagen, was es können wird. Scaling Laws prognostizieren breite Leistungsmaße wie den Loss recht gut. Sie benennen nicht, welche spezifischen Fähigkeiten auftauchen werden oder wann. Fähigkeit ist in der Summe besser vorhersagbar als im Einzelnen.
Für die meisten Fähigkeiten ist das lediglich interessant. Für sicherheitsrelevante ist es alarmierend. Dieselbe Unvorhersehbarkeit, die ein überraschendes Talent für Übersetzung hervorbringt, kann ein überraschendes Talent für die in Bewertungen gefährlicher Fähigkeiten: Cyber-Hilfe, Biowaffen-Unterstützung, Manipulation in großem Maßstab. Eine Fähigkeit, mit der niemand gerechnet hat, ist eine Fähigkeit, für die niemand getestet und gegen die niemand Schutzvorkehrungen getroffen hat.
Wir können ungefähr vorhersagen, wie gut das nächste Modell bei durchschnittlichen Metriken sein wird. Wir können nicht vorhersagen, was es alles können wird. In dieser Lücke liegt das Risiko.
Was das für die Skalierung bedeutet
Emergenz macht jeden großen Sprung in der Skalierung zu einem Schritt ins teilweise Unbekannte. Man baut ein System, dessen vollständiges Fähigkeitsprofil man erst erfährt, nachdem es existiert. Wenn dann eine gefährliche Fähigkeit mitgeliefert wurde, besitzt das System sie bereits. Das ist ein anderes Risiko als eine bekannte Gefahr, die man im Voraus messen und mindern kann.
Der Fall der Foundation folgt direkt. Frontier-Skalierung sollte nicht der Fähigkeit vorauseilen, zu verstehen, was geschaffen wird. Die Beweislast sollte darin liegen, vor dem Training und Einsatz nachzuweisen, dass ein großes neues System sicher ist, nicht darin, seine Gefahren danach zu entdecken. Wenn Fähigkeiten unangekündigt eintreffen können, ist Vorsicht vor dem Sprung die einzige Vorsicht, die hilft. Dieser Rahmen steht in unser Plan. Die sich verkürzenden Zeitpläne, die die Einsätze erhöhen, werden in dem AGI Zeitstrahl.