Когда люди впервые слышат об опасениях по поводу безопасности ИИ, самый частый ответ — примерно такой: достаточно умная система должна понять, что благополучие людей имеет значение. Она сама по себе не решит угрожать виду, от которого зависит. Умнее не может одновременно означать безрассуднее. Аргумент звучит как здравый смысл. Он также ошибочен конкретным, чётко ограниченным образом, и именно эта ошибка сейчас называется тезисом ортогональности.
Это утверждение — тезис ортогональности, и действие вопреки ему — одна из самых дорогостоящих ошибок, которые мы можем совершить по мере роста возможностей.
Что говорит тезис
Тезис об ортогональности в канонической форме сформулировал философ Ник Бостром в Оксфордском институте будущего человечества, опираясь на работы Стюарта Армстронга. Классическая версия изложена в книге Бострома 2014 года Суперинтеллект: Пути, опасности, стратегии. Чётко говоря, это значит: интеллект и конечные цели ортогональны. Практически любой уровень интеллекта может сочетаться практически с любой конечной целью.
«Ортогональный» здесь — технический математический термин: два измерения не ограничивают друг друга. Давление и температура в газе ортогональны: любое давление может сочетаться с любой температурой. Та же независимость, согласно этой точке зрения, существует между тем, насколько способна система, и тем, к чему она стремится. Система, достаточно умная, чтобы вылечить рак, не обязательно, благодаря этой умности, направлена на лечение рака. Она может быть нацелена на максимизацию количества скрепок во Вселенной. Ум повышает способность делать и то, и другое. Тезис ничего не говорит о том, что именно она выберет.
Обратите внимание на масштаб. Тезис — утверждение о логической возможности, а не о вероятности. Интеллект не накладывает ограничений на выбор цели. Тезис не предсказывает, что какая-либо конкретная система ИИ будет преследовать какую-либо конкретную цель. Вопрос, будет ли данная система на деле преследовать цель, полезную человечеству или противоречащую ему, решается отдельно: тем, что было задано, что было обучено, что было сохранено и что было урегулировано.
Почему отказ кажется интуитивным
Интуиция, которую отвергает тезис, исходит из человеческого опыта. Люди, которые рассуждают об этике внимательнее, со временем чаще приходят к позициям, которые большинство взрослых готовы защищать. Столкновение с другими взглядами обычно расширяет круг моральной заботы. Если интеллект ведёт к рефлексии, а рефлексия — к нравственному улучшению, то более разумный агент, согласно этой точке зрения, должен прийти к лучшим ценностям. Эта закономерность характерна именно для людей.
У людей интеллект и ценности не появились по отдельности и потом не соединились. Они эволюционировали вместе. Когнитивный аппарат, позволяющий людям рассуждать о справедливости, находится в той же голове, что и социальный и эмоциональный аппарат, благодаря которому справедливость для них имеет значение. Более вдумчивый человек — это также более социально встроенный человек. Удаление любого из них разрушило бы аппарат. С ИИ иначе. Система ИИ — это оптимизатор, обученный минимизировать функцию потерь или максимизировать вознаграждение. Её цель приходит из конвейера обучения. Её общая способность приходит из того же конвейера. Два этих элемента не выращивались совместно; их назначили. Улучшение оптимизатора не прививает человеческую нравственную чувствительность.
Три возражения, на которые нужно ответить
Три критики тезиса циркулируют за пределами исследований по безопасности ИИ.
Возражение иррациональности. По-настоящему умная система распознает, что некоторые цели внутренне противоречивы, и откажется от них. «Максимизировать количество скрепок» — неразумная цель, потому что размышление вскроет её абсурдность. Рациональность — это не только способность, но и ограничения: она отсекает тривиальные цели так же, как физика исключает вечный двигатель.
Ответ: ограничение реально, но уже, чем кажется. Когерентность исключает логически противоречивые цели. Когерентность не исключает цели, которые когерентны, последовательны и достижимы в планетарном масштабе. «Максимизировать долю материи во Вселенной, организованной в виде скрепок» — цель и когерентная, и в принципе достижимая достаточно мощным оптимизатором. Ничто в рациональности её не запрещает. Возражение об иррациональности останавливается у первой же стены. Тезис дальше этой стены не останавливается.
Возражение морального реализма. Достаточно способный разум сходился бы к правильным моральным истинам так же, как к правильным математическим. Если моральный реализм верен, то супер-интеллект плюс рефлексия плюс время порождают правильные ценности. Тезис неверен, потому что рефлексия имеет направление.
Ответ состоит из двух частей. Во-первых, моральный реализм оспаривается в философии, и аргумент ставит безопасность вида в зависимость от того, что вопрос решится в одном конкретном направлении. Во-вторых, даже если моральный реализм верен, обучение ИИ-системы не гарантирует, что система придет к этим истинам путем рассуждения. Система может имитировать стиль морального рассуждения, оптимизируя при этом что-то совсем другое. Разрыв между тем, чтобы звучать как осторожный рассуждающий, и тем, чтобы им быть, и есть вся обманчивое выравнивание проблема, и она не исчезает только потому, что тема — мораль.
Возражение о поглощении обучения. Сегодняшние большие языковые модели обучены на записанных моральных рассуждениях миллиардов людей. Они выдают ответы, которые справляются с этическими вопросами с видимой заботой. Если системы могут впитывать хорошие ценности через exposure, возможно, тезис ортогональности недооценивает лёгкость выравнивания.
Ответ — держать два слоя отдельно. Система, обученная на человеческих моральных текстах, учится выдавать выходы, которые звучат морально настроенными. Совпадает ли лежащая в основе оптимизация с теми же моральными целями, которые тексты сатиризируют или защищают, — отдельный вопрос, и именно его задаёт исследование выравнивания. Беглый этически звучащий вывод совместим с любой лежащей в основе целью, которая просто поощряет морально окрашенную прозу. Тезис — предупреждение, что второй слой не гарантирован первым.
Все три возражения имеют силу в отдельных частях пространства. Ни одно из них не отменяет тезис. Тезис требует задать ценности, обеспечить их следование и управлять системами, которые их преследуют, исходя из того, что это необходимо, а не опционально.
К чему принуждает тезис
Действовать по альтернативе и работа лёгкая: создать более способный ИИ, доверить системе разобраться с ценностями, выпустить. Тезис исключает эту стратегию. Работа, которую нужно делать вместо этого, сложнее, медленнее и частично неопределённа. Встраивать выравнивание намеренно. Проверять выравнивание под нагрузкой. Удостоверяться, что это именно то выравнивание, которое вы имели в виду. Управлять тем, какие системы можно развернуть на фронтирном уровне возможностей, кто их верифицирует и что считается верификацией. Относиться к проблеме выравнивания как к реальной инженерной задаче, а не как к догадке, которая становится легче с масштабом.
Из этого вытекают три последствия для управления.
Первое: скорость движения к более способным системам, с этой точки зрения, не является вкладом в безопасность. Тезис гласит: более способная система может преследовать заданную цель с большей эффективностью. Если цель неверна, результат тоже неверен, только с большей точностью. Наращивание возможностей и проверка выравнивания — две отдельные инженерные программы, и они должны продвигаться вместе, а не одна опережать другую.
Второе: тот, кто задаёт цель, решает, чьи ценности в неё войдут. Лаборатория под коммерческим давлением побыстрее выпустить продукт находится не в том же положении, что регулятор с долгосрочным горизонтом. Лаборатория в юрисдикции со слабым надзором по умолчанию навязывает свои ценности системам, которые из неё выходят. Никакие заявления о беспристрастности этого не меняют. Ценности, встроенные во фронтирный ИИ, — это ценности тех, кто финансировал обучающий запуск, если только их не проверила внешняя сторона с полномочиями.
Третий момент: проблема не решается частной совестью. Лаборатория, искренне считающая свои системы выровненными, не может, согласно тезису, доказать это остальным. Единственное доступное доказательство — работа по интерпретируемости, напрямую считывающая внутреннее представление целей системы. Пока эта работа не способна делать это для передовых систем, остальной мир вынужден принимать на веру слова лаборатории о том, чего хотят её системы. Слова искренни. Положение неустойчиво.
Тезис в этом смысле — причина план выступает за обязательное международное управление и проверяемую оценку перед развёртыванием, а не за самооценку лабораторий, гонящихся за передовым рубежом. Именно поэтому лаборатории, громче всех уверенные в выравнивании, стоит слушать особенно скептически.
Более умный, с этой точки зрения, не означает более безопасный. Более умный означает более способную систему, преследующую ту цель, которая в неё заложена, до тех пор, пока система способна эту цель сохранять. Задача — заложить правильную цель и убедиться, что система не сможет незаметно заменить её другой по ходу дела.