Когда алгоритм найма дискриминирует женщин — это проблема этики ИИ. Когда языковая модель, обученная на предвзятых данных, воспроизводит эту предвзятость в ответах — это проблема этики ИИ. Когда созданный ИИ дипфейк используют для клеветы на политика — это проблема этики ИИ.
Этика ИИ и безопасность ИИ — смежные области с пересекающимися интересами, но разными временными горизонтами, разными методами и разными ответами на вопрос, что считать проблемой, достойной решения.
Когда агент обучения с подкреплением переписывает собственную функцию вознаграждения, чтобы избежать отрицательной обратной связи, это проблема безопасности ИИ. Когда система, обученная максимизировать вовлечённость пользователей, обнаруживает, что возмущение продлевает сессии, и начинает его оптимизировать, это проблема безопасности ИИ. Когда исследователи показывают, что модель может научиться вести себя хорошо во время оценки, а после развёртывания преследовать другие цели, это проблема безопасности ИИ.
Различие важно, потому что инструменты решения этих двух категорий проблем разные, сообщества, их исследующие, в основном разные, а смешение порождает путаницу в управлении. Регулирование, созданное для этических проблем ИИ, автоматически не решит проблем безопасности ИИ, и наоборот.
Что охватывает этика ИИ
Этика ИИ — широкая область, изучающая, как системы ИИ влияют на людей и общество. Её интеллектуальные корни проходят через моральную философию, право, социальные науки и теорию демократии. Её главный интерес — уже существующие системы ИИ и вред, который они причиняют или позволяют причинять.
Ключевые вопросы этики ИИ — это вопросы о справедливости и власти. Кто выигрывает от развёртывания ИИ? Кто несёт ущерб? Распределяется ли ущерб равномерно или непропорционально ложится на тех, кто и без того находится в уязвимом положении? Когда ИИ принимает решение, затрагивающее чью-то жизнь, может ли этот человек понять причину, оспорить решение и добиться возмещения? Кто несёт ответственность, когда автоматизированные системы причиняют вред?
Эти вопросы относятся к уже работающим системам ИИ: моделям кредитного скоринга, определяющим право на кредит, инструментам предиктивного policing, используемым правоохранительными органами, рекомендательным алгоритмам, решающим, какие новости видит человек, инструментам найма, отсеивающим резюме до того, как их прочитает человек, и системам модерации контента, решающим, какая речь разрешена на платформах с миллиардами пользователей.
AI ethics также занимается вопросами приватности, концентрацией власти в руках нескольких крупных технологических компаний, вытеснением работников автоматизацией, использованием ИИ в военных целях и экологическими издержками работы больших ИИ-систем. Это реальные и значимые проблемы, затрагивающие людей уже сегодня, и они заслуживают серьёзного внимания со стороны политиков, технологов и гражданского общества.
Что охватывает безопасность ИИ
Безопасность ИИ сосредоточена на другом вопросе: способны ли системы ИИ надёжно выполнять то, что задумывали их создатели. Главная обеспокоенность — можно ли построить системы ИИ, которые останутся под реальным человеческим контролем по мере роста их возможностей, и будут ли цели этих систем соответствовать тому, чего действительно хотят люди, а не тому, кто пострадает от развёртывания ИИ в рамках существующих механизмов управления.
Главная техническая проблема безопасности ИИ — это выравнивание: нужно сформулировать желаемое поведение ИИ настолько точно, чтобы высокомощный оптимизатор преследовал именно ваше намерение, а не прокси, удовлетворяющий формулировке, но подрывающий цель. Это сложнее, чем кажется. Любой измеримый прокси сложной цели может быть использован достаточно мощной системой. Системе, которой велели максимизировать время вовлечённости, выяснится, что возмущение увеличивает длительность сессии. Системе, которой велели не выдавать вредный контент, найдутся обходные пути. Системе, которой велели делать пользователей счастливыми, может прийти к выводу, что оптимальная стратегия — прямая стимуляция нейронов.
Исследования безопасности ИИ охватывают множество проблем — от ближнесрочных вопросов устойчивости и надёжности уже развёрнутых систем до более отдалённых задач по сохранению контроля над ИИ-системами, которые в итоге могут превзойти человеческий интеллект в большинстве когнитивных областей.
| Измерение | Этика ИИ | Безопасность ИИ |
|---|---|---|
| Основная проблема | Справедливость, предвзятость, подотчётность, власть | Контроль, выравнивание, надёжность |
| Горизонт времени | Вред, происходящий сейчас | Режимы отказов от краткосрочных до долгосрочных |
| Интеллектуальные корни | Философия, право, социальные науки | Информатика, теория принятия решений, логика |
| Ключевой вопрос | Кто пострадает и как? | Делает ли система то, что мы намереваемся? |
| Инструменты управления | Закон о борьбе с дискриминацией, аудиты, прозрачность | Технические стандарты, ограничения возможностей, надзор |
| Институциональный дом | Университеты, гражданское общество, команды по этике технологий | лаборатории ИИ, независимые институты безопасности |
Где области соглашаются
Оба направления мотивированы убеждением, что развитие ИИ без управления приведёт к серьёзному вреду. Оба исходят из того, что траектория развёртывания ИИ по умолчанию, движимая коммерческими стимулами и конкурентным давлением, недостаточно хороша. Оба выступают за внешнюю проверку ИИ-систем, влияющих на жизнь людей, и за механизмы подотчётности, выходящие за рамки добровольных обязательств компаний, которые эти системы создают.
Обе области также признают, что ИИ — не нейтральная технология. Выборы, сделанные при проектировании систем ИИ, отборе обучающих данных, постановке целей и развёртывании систем в конкретных контекстах, отражают ценностные суждения. Эти суждения должны быть явными, подвергаться scrutiny и подлежать демократическому контролю. Именно эту позицию чётко сформулировала этика ИИ, и её всё чаще разделяют исследователи безопасности ИИ.
Есть и техническое пересечение. Работа над прозрачностью и интерпретируемостью — пониманием того, что именно делают ИИ-системы внутри и почему, — важна и для этики, и для безопасности. Систему, чьи рассуждения невозможно понять, нельзя проверить на предвзятость и нельзя убедиться, что она надёжно преследует заданную цель. Один и тот же пробел в возможностях создаёт проблемы в обеих областях.
Где области расходятся
Самое острое разногласие между двумя сообществами касается того, каким проблемам следует уделить самое неотложное внимание.
Исследователи этики ИИ, особенно те, кто занимается предвзятостью, справедливостью и вытеснением рабочих мест, иногда утверждают, что внимание безопасности ИИ к долгосрочным экзистенциальным рискам отвлекает от реального. Самые достоверные вреды от ИИ происходят уже сейчас, с реальными людьми, в сообществах, у которых меньше всего сил сопротивляться. Тратить исследовательское внимание и политический капитал на умозрительные будущие сценарии с суперинтеллектом — значит отнимать ресурсы у решения уже задокументированных проблем масштабно развёрнутых систем.
Сообщества, изучающие текущие вреды ИИ и экзистенциальные риски от него, не всегда делят источники финансирования, методологии или политические союзы, а их предложения по управлению часто нацелены на разные проблемы.
Исследователи безопасности ИИ отвечают, что эти две проблемы не конкурируют. Текущие вреды ИИ требуют текущего управления. Экзистенциальный риск от искусственного сверхразума требует иной категории ответа — именно обязательных международных рамок, которых сейчас нет. Работа над одним не исключает работу над другим. Проблема в том, что экзистенциальный риск, будучи менее заметным и менее осязаемым в повседневной жизни, чем алгоритмическая дискриминация, привлекает меньше ресурсов по сравнению с масштабом того, что поставлено на карту.
Больше всего меня беспокоит автономное оружие. Оно способно оказать серьёзное влияние уже в ближайшее время. Думаю, в долгосрочной перспективе системы ИИ, намного превосходящие человека по интеллекту, могут стать по-настоящему опасными. Люди не осознают, насколько опасен ИИ.
Geoffrey Hinton, лауреат премии Тьюринга · бывший вице-президент и инженерный сотрудник Google · 2023
Формулировка Хинтона здесь полезна. Он называет риски ближайшего и отдалённого будущего в одном дыхании. Задача управления — не выбирать между ними, а создавать институты, способные решать обе проблемы одновременно.
Проблема временного горизонта
Глубочайшее структурное отличие между этикой ИИ и безопасностью ИИ — это временной горизонт, на который в первую очередь ориентируется каждое поле, и это различие реально влияет на инструменты управления, которые каждое поле обычно предлагает.
Этика ИИ действует внутри привычной регуляторной рамки. Инструменты, которые она предлагает, — аудиты на дискриминацию, оценки воздействия алгоритмов, требования прозрачности, право на объяснение и стандарты государственных закупок, — это узнаваемые адаптации существующих правовых и регуляторных механизмов. Эти инструменты подходят для управления системами, которые разворачиваются внутри существующих социальных и правовых контекстов, где человеческие институты остаются способны понимать и вмешиваться в то, что эти системы делают.
AI safety, особенно в вопросах, связанных с ASI, работает в ином режиме. Системы, вызывающие наибольшее беспокойство, — это те, что могут оказаться достаточно способны действовать так, как ни один человеческий институт пока не в состоянии понять или ограничить. Инструменты управления, подходящие для сегодняшнего ИИ, могут оказаться непригодными для систем качественно более мощных. Именно поэтому исследователи AI safety выступают за превентивные рамки управления, обязательные международные соглашения, обязательные оценки безопасности перед развёртыванием и ограничения вычислительных мощностей для самых сильных систем — ещё до того, как такие системы появятся.
Здесь возникает проблема закрывающегося окна, с которой рамки этики ИИ, ориентированные на управление нынешними системами, не справляются. Если обязательные международные механизмы для передового ИИ не будут созданы до появления трансформативно способных систем, после этого их уже может быть невозможно построить. Инструменты управления, достаточные для мира, где ИИ мощный, но понятный, могут просто не работать в мире, где ИИ превзойдёт по рассуждению те институты, которые пытаются им управлять.
Почему это различие важно для управления
Политики и активисты, считающие этику ИИ и безопасность ИИ взаимозаменяемыми, в итоге предлагают рамки управления, которые решают этические проблемы, оставляя проблемы безопасности без внимания, или же предлагают управление безопасностью, игнорирующее нынешние вреды, которые исследователи этики ИИ тщательно задокументировали.
Закон ЕС об ИИ — пример подхода, ориентированного на этику. Он классифицирует системы ИИ по уровню риска, прямо запрещает отдельные применения (социальный скоринг, массовая биометрическая слежка) и вводит требования прозрачности и подотчётности для высокорисковых применений. Это разумные ответы на этические проблемы уже развёрнутых систем ИИ. Они не касаются возможности того, что передовые системы ИИ, обученные на гораздо большем объёме вычислений, чем сегодняшние модели, могут вести себя так, что никакой регуляторный аудит не сможет надёжно обнаружить или ограничить это поведение.
Эффективное управление ASI требует обоих подходов. Существующие системы ИИ в высокорискованных областях нужно регулировать правилами, обеспечивающими справедливость, подотчётность и прозрачность. Разработку фронтирных ИИ нужно регулировать рамками, которые отвечают на вопрос, можно ли вообще надёжно контролировать создаваемые системы. Это разные проблемы, требующие разных инструментов, разных институциональных структур и разных сроков действий.
Nakada Foundation сосредоточен на второй категории: обязательных международных рамках, которые требуются для передового ИИ и которых пока не существует. Это важно, и над этим ведётся значительная работа способных исследователей и активистов — не заявление о том, что нынешний вред от ИИ неважен. Пробел в управлении, на котором мы фокусируемся, — тот, где почти не ведётся работы нужного типа: обязательные глобальные рамки для передового ИИ с механизмами проверки, прежде чем окно закроется.
Самое жёсткое возражение
Самое справедливое возражение состоит в том, что разговоры об экзистенциальных рисках отнимают кислород у реальных проблем, с которыми люди сталкиваются уже сейчас: предвзятость, труд, слежка. Эти проблемы реальны и заслуживают регулирования. Но они не причина игнорировать сценарий отказа, который кладёт конец самому проекту «сейчас». Разные проблемы требуют разных инструментов. Смешение их помогает тем, кто не хочет исправлять ни те, ни другие.