Питер Диамандис сформулировал это чётко, а Илон Маск репостнул: «Только ИИ способен угнаться за ИИ. Именно это определит всю модель безопасности следующего десятилетия». Как описание темпа, с этим трудно спорить. Выходы моделей происходят быстрее квартальных проверок. Атакующий код мутирует быстрее, чем аналитик успевает прочитать тикет. Если вы видите проблему в объёме фишинга и смене эксплойтов, защитник, конечно, тянется к автоматизации. Люди так не масштабируются.

Проблема начинается, когда одно и то же предложение вынуждено нести вес всё что идёт дальше, включая системы, действующие как агенты, скрывающие намерения и в итоге превосходящие тех, кто их создал. В этот момент «только ИИ может успевать» перестаёт значить «использовать более совершенные инструменты против вредоносного ПО». Это значит, что модель безопасности следующего десятилетия — передать задачу сдерживания той самой категории систем, которую вы пытались сдержать.

Что верно в слогане

Начнём с очевидного. Программное обеспечение уже движется быстрее ручной проверки. Мошеннические схемы разворачиваются за ночь. Окна раскрытия уязвимостей сжимаются. Лаборатории и облачные провайдеры уже запускают автоматические сканеры, классификаторы и сценарии реагирования, потому что очередь людей не может отслеживать каждый пакет. Ничего из этого не заговор и не требует позиции по суперинтеллекту. Если бы Диамандис говорил только о спаме и программах-вымогателях, на этом статья и закончилась бы.

Он говорит не только о спаме и программах-вымогателях. «Вся модель безопасности следующего десятилетия» — это более широкое утверждение. Оно касается того, как цивилизация намерена сохранять контроль, пока возможности нарастают. Здесь лозунг перестаёт быть советом по эксплуатации и становится философией управления.

Беговая дорожка

Представьте модель как гонку между нападением и защитой, обе автоматизированы. Каждая сторона учится на другой. Защита улучшается. Атаки улучшаются. Панель остаётся зелёной, пока однажды не перестанет. Утешительная история гласит, что хороший ИИ всегда опережает плохой. Менее утешительная — что вы построили систему, где единственные компетентные участники — машины, а люди лишь клиенты состязания, которое уже не могут судить.

Это нормально для антивируса. Это цивилизационная ставка, когда системы начинают ставить цели, строить планы и воспринимать надзор как препятствие. Мы уже видим ранние версии этой схемы в оценки коварства и в моделях, которые рассказывать об одном, оптимизируя другое. «Не отставать» предполагает, что вы всё ещё можете понять, за чем именно не отстаёте. После определённого момента это уже невозможно.

Модель безопасности, которая работает только если охранник умнее заключённого, — это план преемственности с дополнительными шагами.

Регулирование — не то узкое место, которое они называют

Лозунг обычно сопровождается вторым ходом: линейные институты не могут управлять экспоненциальной технологией, значит, нужно больше ИИ внутри контура. Иногда это сочетается с презрением к «экспертам, собирающимся раз в квартал». Согласен, что медленные встречи плохо подходят под еженедельные релизы моделей.

Но скорость встречи — не самая сложная проблема. Самая сложная проблема контроль. Ни совет директоров, собирающийся раз в квартал, ни постоянный мониторинг ИИ не располагают методом надёжного управления системой, которая превосходит людей, держащих кнопку отключения, в убеждении, программировании и долгосрочном планировании. Ускорение мониторинга не создаёт недостающий метод, а лишь заставляет его сбоить чаще.

Существует более чистое прочтение тех же фактов. Если только сверхчеловеческая система способна контролировать другую сверхчеловеческую систему, рациональный шаг — не строить обе. Нужно отказаться от той черты, за которой человеческий надзор перестаёт работать. Мы уже делали такой выбор с технологиями, чьё злоупотребление способно уничтожить города. Мы не решили проблему ядерного хищения, обучив более умного вора ловить первого.

Для кого эта черта

Фраза превращает исследовательский выбор в погоду. Конечно, мы выпускаем. Конечно, мы масштабируем. Безопасность обеспечит сам продуктовый стек. Те, кто зарабатывает на возможностях, звучат как взрослые в комнате, а те, кто требует жёстких ограничений, — как люди с планшетом на собачьей драке.

Такое framing выгодно говорящему. Оно куда менее полезно всем, кому придётся жить в мире, где ни одна комиссия и ни одна модель-надзиратель не смогут надёжно перекрыть систему история гонки делает ту же работу с другого угла: рассматривает опасный путь как неизбежный, а затем называет ускорение ответственностью.

Модель безопасности, в которой остаётся человек

Используйте ИИ против фишинга. Используйте ИИ против мошенничества. Применяйте узкие инструменты к узким задачам, где неудача обратима. Для этого не нужно поклоняться лозунгу.

Для передового обучения к искусственному сверхинтеллекту модель безопасности, в которой всё ещё остаётся человек, выглядит устаревшей и менее эффектной: не создавайте агента, которого нельзя переспорить. Установите пороги вычислений, инспекции и договорные механизмы на те запуски, которые к этому приведут. Проверяйте. Наказывайте за нарушение. Это наш план, и для этого не нужно верить, что ежеквартальные встречи творят чудеса. Достаточно признать, что некоторые возможности не должны существовать. Сверхразум невозможно контролировать.

Лозунг — меткое замечание о пропускной способности. Как план для вида это вежливый способ сказать, что мы намерены покинуть комнату.