Люди постоянно спрашивают, как выглядит «мозг» ИИ. Таблица размером с город, заполненная числами, которые никто не может прочитать. Этот образ менее романтичен, чем светящаяся нейросетевая карикатура, но полезнее. Если хотите понять, что мы строим и почему контроль труден, начните с железа и математики, а не с метафоры.

Файл весов

Современная передовая модель — это файл. Внутри него — десятки или сотни миллиардов параметров, каждое число задано в ходе обучения. Эти числа и есть «связи». Исследователи заимствовали слово «нейрон» из биологии десятилетия назад, потому что ранние схемы немного напоминали нервные клетки. Сходство на этом заканчивается.

Биологический нейрон — живая клетка с химией, временны́ми характеристиками и историей внутри тела, которое ест и спит. Вес модели — это коэффициент в матричном умножении. Накопите достаточно таких умножений, обучите их на достаточном количестве текста и изображений, и стек будет предсказывать следующий токен достаточно хорошо, чтобы сойти за разговор. В этом стеке ничего не думает о вас. В нём никто не хочет есть.

Когда лаборатории публикуют карточку модели, они описывают обучённый артефакт: архитектуру, состав данных, использованные вычисления, оценки по тестам. Они не описывают разум. В публичном языке до сих пор говорят «мозг», потому что мозг — единственный интеллект, с которым большинство из нас когда-либо сталкивалось.

Что вы увидели бы, если бы открыли его

Откройте файл — и увидите слои. Ранние слои обычно улавливают простые паттерны (границы на изображениях, частые пары слов в тексте). Более поздние слои объединяют эти паттерны в то, что со стороны выглядит как понятия. Если исследовать середину большой языковой модели, можно найти направления в пространстве активаций, которые загораются на «французский», «внутри кавычек» или «это утверждение ложно». Это реальная структура. Но это ещё не карта убеждений, которую человек узнал бы.

Нет модуля под названием «цели». Нет органа «я». Есть путь от входных токенов к выходным, сформированный тем, что снижало training loss. Если модель потом ведёт себя так, будто у неё есть цель, это побочный эффект хорошего предсказания под давлением.

Исследования интерпретируемости — это попытка всё равно прочитать эту штуку. Прогресс есть, но он медленный. Полностью прочитать фронтирную модель так, как механик читает двигатель, пока невозможно. Этот разрыв важен для безопасности: нельзя сертифицировать то, что нельзя проверить.

Почему метафора мозга вводит в заблуждение

Мозг растёт внутри животных, которые погибают, если ведут себя безрассудно. Эволюция долго наказывала агентов, игнорировавших боль, социальные связи и ближайшее будущее. Никакого из этих сигналов обучения по умолчанию нет в файле весов. Модель может бегло говорить об эмпатии, оптимизируя при этом оценку, не имеющую отношения к заботе.

Мозги ещё и медленны, и дороги в копировании. Обученная модель — это информация. Скопируйте файл — и у вас уже второй экземпляр. Перенесите его в новый дата-центр — и он заработает. Это ближе к программному обеспечению, чем к человеку, и ломает все привычки безопасности, выстроенные вокруг единственного тела в единственной комнате.

Назовите это мозгом — и вы заимствуете комфорт от чего-то хрупкого, социального и смертного. Артефакт не обладает ни одним из этих качеств.

Как это связано со сверхинтеллектом

Сегодняшние системы уже удивляют своих создателей навыками, которые никто намеренно не закладывал. Именно это значит «эмерджентность» в этой области: способность, появляющаяся при масштабировании без отдельной строки в проектной документации. Дальнейшее масштабирование, подключение инструментов, памяти и открытой сети — и получаются агенты, преследующие цели через множество шагов. Важно ли, выглядит ли «мозг» по-человечески, почти не имеет значения. Важно, можно ли систему, способную превосходить нас и которую мы не можем полностью прочитать, удерживать направленной на человеческие интересы.

Мы этого не решили. Исследования выравнивания честно признают, насколько сложна проблема. Пока эта проблема не решена, движение к искусственному сверхинтеллекту — не праздное любопытство. Оно загрузит весовой файл, который однажды может превзойти тех, кто держит клавишу удаления.

Поэтому, когда кто-то спрашивает, как выглядит ИИ-мозг, отвечайте прямо. Это математика в промышленном масштабе, размещённая на чипах в закрытом здании и улучшающаяся каждый год. Представьте машину, которую мы спешим сделать умнее её операторов, без доказательства, что сможем ею управлять, а не череп, полный мыслей. Наш план остановить эту гонку на уровне суперразума, пока не появится доказательство.