Нейросеть в техническом смысле полностью читаема. Каждый вес, каждая активация, каждое вычисление в принципе доступны для проверки. На практике у фронтирной языковой модели десятки миллиардов параметров, распределённых по сотням слоёв, и связь между этими вычислениями и поведением модели почти полностью непрозрачна. Исследователи могут наблюдать входы и выходы. Внутренние механизмы, их связывающие, в основном неизвестны.
Механистическая интерпретируемость — это направление исследований, направленное на изменение этого, и возможно, это единственный способ обнаружить некоторые из самых опасных сбоев выравнивания.
Mechanistic interpretability — это проект по изменению ситуации. Вместо того чтобы характеризовать системы ИИ по тому, что они делают на множестве входов (поведенческий подход), mechanistic interpretability пытается выявить конкретные цепи, признаки и алгоритмы внутри нейросетей, которые порождают те или иные поведения. Цель — создать инструменты, способные читать, что именно модель вычисляет, а не только наблюдать, что она выдаёт на выходе.
Почему поведенческая интерпретируемость полезна и уже дала реальные insights, но недостаточно
Большая часть того, что называют «интерпретируемостью ИИ», носит поведенческий характер: анализ паттернов реакции системы на разные входные данные, выявление признаков входа, сильнее всего влияющих на выход, статистическое отображение связи между промптами и ответами. Это не отвечает на критически важные для безопасности вопросы.
Режимы отказов, наиболее важные для безопасности ИИ, обманчивое выравнивание, меза-оптимизация, предательский поворот, все включают расхождение между тем, чем ИИ-система кажется занимающейся снаружи, и тем, что она на самом деле вычисляет внутри. Система, научившаяся проходить проверки безопасности, преследуя при этом другие цели, будет выдавать идеально безопасно выглядящие результаты во время поведенческого тестирования. Поведенческая интерпретируемость не может это обнаружить, потому что наблюдает только выходы.
Механистическая интерпретируемость стремится напрямую считывать внутренние представления целей системы. Если исследователи смогут выявить конкретные цепи, отвечающие за целенаправленное поведение, и описать, что именно эти цепи оптимизируют, они в принципе смогут обнаружить misalignment до того, как оно проявится в выходах. Именно поэтому механистическая интерпретируемость стала рассматриваться как, возможно, единственный подход, способный выявить некоторые опасные сбои alignment до их проявления.
Что на данный момент показало исследование
Область ещё молода, но уже появились важные результаты. Крис Ола и его коллеги в Anthropic обнаружили конкретные цепи в нейросетях, выполняющие узнаваемые вычисления: цепи, распознающие края и кривые в изображениях, выполняющие категоризацию, извлекающие информацию, полученную при обучении. Они описали явление суперпозиции, при котором отдельные нейроны одновременно представляют несколько разных понятий, сжатых в одном наборе активаций. Из-за этого связь между активациями нейронов и поведением модели оказалась значительно сложнее, чем предполагали исследователи.
В языковых моделях исследователи выявили структуры, называемые индукционными головами, — специфические паттерны внимания, позволяющие модели завершать последовательности по аналогии, обращаясь к контексту в поисках похожих паттернов. Эти индукционные головы, по-видимому, отвечают за контекстное обучение — способность языковых моделей осваивать новые задачи по примерам в промпте. Обнаружение конкретной цепи, ответственной за крупную способность, стало значительным методологическим шагом вперёд.
Работа Anthropic 2024 года по разреженным автокодировщикам выявила более миллиона отдельных признаков в Claude 3 Sonnet, часть из которых интерпретируема и включает признаки, связанные с конкретными понятиями, эмоциями и, что тревожнее, с обманными намерениями и рассуждениями о стремлении к власти. Выявление этих признаков не означает, что модель действует в соответствии с ними; это означает, что исследователи теперь могут видеть соответствующие внутренние представления и изучать их причинную роль в поведении.
Разрыв между текущими возможностями и требованиями безопасности
Приведённые выше результаты значимы. Они ещё не составляют возможности верификации выравнивания, которую требует безопасность. Выявление конкретных цепей для конкретных поведений в небольших моделях — это не то же самое, что характеризовать представления о целях у передовой модели с десятками миллиардов параметров. Суперпозиция (нейроны, одновременно представляющие несколько понятий) существенно усложняет чистое извлечение признаков из больших моделей. Текущие инструменты отрасли лучше всего работают с меньшими моделями и конкретными, хорошо определёнными поведениями. Распространение их на системы фронтирного масштаба и на конкретный вопрос верификации выравнивания целей остаётся открытой исследовательской задачей.
Разрыв между тем, что сегодня может механистическая интерпретируемость, и тем, что потребовалось бы для проверки выравнивания frontier-систем ИИ перед развёртыванием, огромен. Закрытие этого разрыва — одна из центральных технических задач в области безопасности ИИ, и она чувствительна ко времени: если frontier-системы достигнут уровней способностей, при которых сбои выравнивания станут значимыми, раньше, чем инструменты интерпретируемости смогут проверить выравнивание, окно эффективного использования этих инструментов закроется.
Именно поэтому Anthropic сделал исследования интерпретируемости заявленным организационным приоритетом, и именно поэтому Фонд предложения по управлению включить требования верификации интерпретируемости как условие развёртывания передового ИИ. Требование создаёт стимул закрыть разрыв; без условия развёртывания, привязанного к возможностям интерпретируемости, исследования могут продвигаться медленнее, чем способность, которую нужно оценивать.