Джейсон Вэй и соавторы из Google и других мест каталогизировали задачи, где производительность оставалась близкой к случайной, пока масштаб модели не пересекал порог, после чего резко росла. Многошаговая арифметика, вопросы из узкоспециализированных областей, инструкции на языках, почти отсутствующих в обучении, цепочки шагов рассуждения: ни одна из этих способностей не была заложена как feature. Они проявлялись по мере роста моделей. Статья назвала их emergent abilities.
Эмерджентная способность в этом смысле — это умение, которого нет у меньшей модели и есть у большей, причём переход выглядит не как плавный подъём, а как переключатель. Ниже определённого масштаба модель не может выполнить задачу. После этого масштаба — может. Способность нельзя было прочитать по тренду меньших систем.
Настоящая дискуссия, заслуживающая внимания
Возникновение способностей — не устоявшаяся наука. Некоторые исследователи считают, что часть заявленных скачков отчасти является артефактом измерения: жёсткая метрика «всё или ничего» превращает постепенный прогресс в кажущийся внезапным, а более плавная метрика показывает постепенное улучшение. Эта критика касается конкретных случаев и заслуживает серьёзного рассмотрения.
Это не снимает практической проблемы. Появится ли возможность как истинный разрыв или как крутая кривая, замеченная лишь после пересечения порога, ситуация с управлением остаётся той же. Мы узнаём, что модель умеет что-то новое, уже после того, как она это умеет, а не до. Для политика, решающего, безопасно ли запускать следующий цикл обучения, различие между подлинным возникновением и резкой кривой носит академический характер. В любом случае сюрприз находится по ту сторону решения.
Почему непредсказуемость — ключевая проблема
Мы не можем надёжно предсказать до обучения большей модели полный список того, что она сможет делать. Законы масштабирования довольно хорошо прогнозируют общие показатели производительности, такие как величина ошибки. Они не называют конкретные способности, которые появятся, и не указывают, когда это произойдёт. Способности предсказуемы в совокупности, но не по отдельности.
Для большинства способностей это просто интересно. Для способностей, связанных с безопасностью, это тревожно. Та же непредсказуемость, которая даёт неожиданный талант к переводу, может дать неожиданный талант к задачам, описанным в оценки опасных возможностей: киберподдержка, помощь в создании биологического оружия, манипуляция в больших масштабах. Способность, которую никто не предвидел, — это способность, для которой никто не проводил тестов и не строил защитных механизмов.
Мы можем примерно предсказать, насколько хорошей будет следующая модель по средним метрикам. Мы не можем предсказать всё, что она сможет делать. Именно в этом разрыве и кроется риск.
Что это значит для масштабирования
Эмерджентность превращает каждый крупный скачок масштаба в шаг в частичную тьму. Вы строите систему, полный профиль возможностей которой узнаёте только после её появления. К тому времени, если вместе с ней пришла опасная способность, система уже ею обладает. Это иной риск, чем известная опасность, которую можно измерить и смягчить заранее.
Позиция Фонда следует напрямую. Фронтирное масштабирование не должно опережать способность понимать, что именно создаётся. Бремя доказательства должно лежать на демонстрации безопасности большой новой системы до её обучения и развёртывания, а не на обнаружении опасностей после. Когда способности могут появиться без предупреждения, единственная работающая предосторожность — это осторожность до прыжка. Эта рамка изложена в наш план. Сокращающиеся сроки, повышающие ставки, рассматриваются в AGI хронология.