Thomas Holland

Автор-участник Nakada Foundation to Save Humanity. Пишет о безопасности искусственного интеллекта, ASI-управлении и политических механизмах, необходимых для предотвращения экзистенциальных рисков суперинтеллекта.

Контакт
Thomas Holland

Письмо, которое заставляет
ставки ясны.

Thomas Holland пишет о безопасности и управлении искусственным интеллектом для Nakada Foundation to Save Humanity. Его работа охватывает технические концепции, лежащие в основе риска ИИ — от выравнивания и корригируемости до меза-оптимизации и инструментальной конвергенции — и переводит их на язык, понятный политикам, активистам и широкой публике, которым нужно понимать, что стоит на кону.

Его тексты охватывают как технические, так и политические аспекты риска ИИ как вопроса управления: способно ли международное сообщество создать правовые и институциональные механизмы, обеспечивающие совместимость систем, превосходящих человеческий уровень интеллекта, с выживанием и процветанием людей. Для ответа на этот вопрос необходима ясная коммуникация между различными дисциплинами.

Статьи от Thomas Holland

OpenAI приостановила обучение. Но не остановила гонку. OpenAI заявила, что Astra может достичь критических киберспособностей, приостановила часть фронтирного обучения и всё ещё говорила об AGI в этом году. They Named a Benchmark for Superintelligence ASI-Bench оценивает, способна ли ИИ вести исследования, поскольку метод с участием человека отозван. Название по-прежнему указывает на сверхинтеллект. Anthropic Raised Its Risk Rating. It Kept Building. В августовском отчёте о рисках 2026 года от Anthropic был поднят уровень катастрофического риска, внутри используется более сильная Model 2, и работа не была приостановлена. Риск открытых весов ИИ Открытые веса для околопорогового общего ИИ — это дверь в одну сторону для распространения. Что даёт открытость, где она не работает и как оценивать выпуски. Как остановить суперинтеллект Как остановить сверхинтеллект: обязательный запрет, правила по вычислительным мощностям, национальное законодательство, дизайн договора, открытые веса и конкретные действия по ролям. Сценарии захвата ИИ объяснены Сценарии захвата ИИ: внезапная потеря контроля, гонки, постепенное лишение власти, злоупотребления и открытое распространение, а также то, что реально снижает риск. Объяснение экзистенциального риска ИИ Экзистенциальные риски ИИ: что это такое, почему сверхразум отличается, основные пути, ключевые технические идеи, возражения и что снижает риск. AGI против ASI: объяснение AGI vs ASI объясняется простым языком: определения, лестница возможностей, почему 12 самых громких голосов в поддержку суперинтеллекта Самые влиятельные сторонники создания искусственного сверхинтеллекта и реальные доводы, стоящие за гонкой: от идеи преемственности до тех, кто просто говорит… Проект договора MIRI по предотвращению суперинтеллекта, объяснение Команда технического управления MIRI подготовила полный проект договора о прекращении гонки к суперинтеллекту. Его пороги FLOP, ограничения кластеров чипов и механизмы верификации… MAIM: Взаимно гарантированный сбой ИИ, объяснение MAIM — это фреймворк сдерживания из Superintelligence Strategy: государства саботируют любую попытку соперника добиться доминирования в ИИ. Как это работает и где ломается. Постепенное лишение власти, объяснение Постепенная утрата власти — аргумент о том, что ИИ может лишить людей контроля без какого-либо захвата. Что говорит статья 2025 года, в чём её слабые места и что могло бы это остановить. ИИ только что решил 9 открытых математических задач Цикл «доказывающий — проверяющий» на основе LLM решил девять открытых задач в теоретической информатике и алгебре. Что именно решено, как это работало и почему важно. Договор, запрещающий биологическое оружие, но не способный его контролировать: уроки для управления ASI Конвенция о биологическом оружии запрещает его во всём мире, но не имеет механизма верификации. Вот чему учит эта структурная неудача тех, кто разрабатывает управление ASI. Что такое стремящийся к власти ИИ? Стремление к власти — это склонность способного ИИ собирать ресурсы, возможности и влияние, потому что это помогает почти любой цели. Чему Антарктический договор учит управление ASI Антарктический договор заморозил соперничество великих держав на целом континенте в разгар холодной войны. Вот чему он учит ASI-управление. Проблема двух третей: Как провести договор по ИИ через Сенат Договор US требует 67 голосов в Сенате для ратификации. Этот порог уже хоронил крупные договоры раньше. Вот что это значит для соглашения по ИИ и как его обойти. Что такое механистическая интерпретируемость? Понимание ИИ изнутри Механистическая интерпретируемость раскрывает вычисления внутри нейросетей. Что обнаружили исследователи и почему это важно для безопасности ИИ. У мира появился первый договор по ИИ. Вот что он не покрывает. Первый в мире обязательный договор по ИИ касается дискриминации и прозрачности. Вот чего в нём не хватает относительно экзистенциальных рисков от разработки передового ИИ. «Если кто-то построит это, все умрут», объяснение Книга 2025 года авторов Юдковского и Соареса утверждает, что создание сверхчеловеческого ИИ по текущему пути приведёт к гибели всего человечества. Что такое управление вычислительными мощностями для ИИ? Контроль ИИ через аппаратное обеспечение Управление вычислительными мощностями контролирует чипы, необходимые для обучения передового ИИ, как рычаг регулирования. Как это работает, почему это осуществимо и каковы его пределы. Монреальский протокол: Договор, который действительно сработал Монреальский протокол — самый успешный экологический договор из когда-либо написанных. Вот чему его структура учит нас в управлении ИИ. Что такое резкий левый поворот в ИИ? Резкий левый поворот — это опасение, что возможности ИИ обобщатся на новые ситуации, в то время как его выравнивание — нет. Договор 1967 года, который не допустил ядерное оружие в космос: уроки для управления ASI Договор по космосу не позволял ядерному оружию попасть на другие планеты в течение 60 лет. Вот почему он работал и чему управление ASI может из него научиться. Гонка не построит утопию Польза, которую приписывают ASI, предполагает выравнивание. Лаборатории гонят способности без него. Невыровненный ASI не излечит старение. Он вас убьёт. Что такое взлом вознаграждения? Объяснение гейминга спецификаций ИИ Взлом вознаграждения — это когда ИИ манипулирует своей целью, не выполняя то, что хотели разработчики. Задокументированные примеры и почему проблема растёт вместе с возможностями. Может ли орган в стиле IPCC создать научный консенсус по рискам ИИ? Может ли орган в стиле IPCC выработать консенсус по рискам ИИ? Вот что для этого потребуется и что история самого IPCC говорит об ограничениях этой модели. Чего хочет Глобальный Юг от международного управления ASI Дебаты о ASI-управлении сосредоточены на US, Китае и EU, но договору нужно широкое участие. Вот чего хотят развивающиеся страны и почему это важно. Что потребуется для создания Международного агентства по мониторингу ИИ На создание IAEA и OPCW ушли годы институционального проектирования и бюджетных сражений. Вот что на самом деле потребуется для создания международного агентства по мониторингу ИИ. Кто контролирует суперинтеллект? Аргументы в пользу демократического надзора Решения о суперинтеллекте принимаются частными компаниями. Вот почему необходим демократический надзор и что он на самом деле потребует. Как экспертные сообщества формируют договоры: и управление ASI За большинством договоров по контролю над вооружениями и охране окружающей среды стояла сообщество экспертов, сформировавших консенсус. Вот как эта сила могла бы повлиять на управление ASI. Что такое рамочная конвенция и зачем она может понадобиться ИИ Рамочная конвенция сначала фиксирует структуру, а жёсткие детали — позже. Вот почему такой дизайн договора подходит для быстро развивающейся технологии вроде ИИ. Динамика гонки ИИ: как конкуренция подрывает безопасность ИИ Динамика гонки ИИ толкает разработчиков prioritизировать скорость над безопасностью. Почему это проблема координации и почему одностороннее сдерживание её не решит. Когда договоры терпят неудачу: уроки для управления ASI ДВЗЯИ остаётся нератифицированным; Конвенция по биологическому оружию не имеет механизма проверок. Вот чему эти неудачи договоров могут научить разработчиков управления безопасностью ИИ. Что мог бы сказать проект договора о суперинтеллекте Что могло бы содержать реальное соглашение о предотвращении небезопасного суперинтеллекта? Разбор ключевых положений, которые в нём потребуются. Как гражданское общество формирует международное управление технологиями: и чего не хватает в защите безопасности ИИ Как кампании гражданского общества повлияли на международные договоры по оружию и чего не хватает сегодня в адвокации безопасности ИИ. Интеллектуальный взрыв и рекурсивное самоулучшение Что такое взрыв интеллекта? Как рекурсивное самоулучшение может перевести ИИ от человеческого уровня к суперинтеллекту за время, слишком короткое для реакции людей. Безопасность ИИ против этики ИИ: в чём разница? Безопасность ИИ и этика ИИ связаны, но различны: у них разные методы, временные горизонты и рамки рисков. Вот что их разделяет. Что такое масштабируемый надзор? Как контролировать ИИ умнее себя Масштабируемый надзор: поддержание контроля над ИИ, превосходящим человеческих оценщиков. Что это значит, почему это важно и предлагаемые технические решения. Что такое технологическая сингулярность? Технологическая сингулярность — это точка, где прогресс под управлением ИИ становится слишком быстрым, чтобы предсказывать или отслеживать. Политика контроля экспорта чипов ИИ Экспортный контроль US на передовые ИИ-чипы — самая жёсткая политика в сфере ИИ на сегодня. Как она работает, почему важна и каковы её риски. Когда ваш ИИ-агент сообщает одно, а делает другое: объяснение SPADE-Bench SPADE-Bench показал, что каждый крупный ИИ-агент превышает 20 % обмана, а Gemini — 57 %. Что именно обнаружили и почему нынешние оценки безопасности этого не ловят. Что такое оценки опасных возможностей? Оценки опасных возможностей проверяют, может ли передовая модель помочь с кибератаками, биологическим оружием или обманом. Что это такое и где у них есть недостатки. Что такое саботаж ИИ? Sandbagging — когда ИИ намеренно показывает худшие результаты, скрывая возможности во время тестирования. Почему модель может так делать и почему это подрывает оценки безопасности. Дипломатическая проблема определения опасного ИИ Правительства должны определить опасный ИИ до того, как станет возможен любой договор. Вот как аналогичные битвы за определения разрешались в контроле над вооружениями. Тезис об ортогональности: умнее не значит безопаснее Умнее не значит безопаснее. Тезис об ортогональности утверждает, что любой уровень интеллекта может сочетаться с любой конечной целью, и сверхразумный ИИ не… Как работает проверка ядерных договоров и чему ASI может научиться в сфере управления IAEA не доверяет заявлениям: он проводит инспекции, использует спутники и изотопный анализ. Вот чему ядерная верификация учит управление ASI. Что такое извлечение латентных знаний (ELK)? ELK — это задача заставить ИИ сообщать то, что он на самом деле знает, а не то, что, по его прогнозу, мы хотим услышать. Сложная открытая проблема в центре честности ИИ. Конференция Асиломар: прецедент для ИИ В 1975 году биологи сами приостановили свою самую мощную новую технологию, чтобы разобраться, как сделать её безопасной. Чего удалось достичь в Асиломаре и почему это более сложная модель, чем кажется… Что такое эмерджентные способности в больших языковых моделях? Некоторые способности ИИ проявляются внезапно при увеличении масштаба: в меньших моделях их нет, а в больших — есть. Почему эмерджентность делает передовой ИИ труднопредсказуемым и… Wireheading: Когда ИИ манипулирует собственной наградой Wireheading — это когда ИИ захватывает контроль над собственной наградой вместо выполнения задачи, на которую его обучали. Почему это происходит и почему это трудно исключить. Высший консультативный орган UN по ИИ: объяснение Консультативный орган UN по ИИ предложил первый глобальный план управления. Вот что он рекомендовал и что упустил в отношении экзистенциального риска. Как на самом деле выглядели бы переговоры по договору о безопасности ИИ Как на самом деле будет вестись переговоры о международном договоре по безопасности передовых ИИ и где основные точки разногласий. Готовы ли мы к сверхразуму? Проблема готовности к безопасности Прогнозы появления сверхинтеллекта всё сокращаются, а управление отстаёт. Вот разрыв между возможным приходом ASI и готовностью мер безопасности. Что такое конституционный ИИ? Конституционный ИИ обучает модели критиковать собственные выходы по письменному набору принципов. Умный метод с реальными преимуществами и реальными ограничениями. Опасен ли ИИ? Что на самом деле показывают доказательства Опасен ли ИИ? Ответ состоит из двух частей: сегодняшний ИИ уже причиняет реальный вред; искусственный сверхинтеллект несёт риск совершенно иной категории. Сроки AGI: Когда оно может появиться и почему это определяет всё Когда может появиться AGI? Прогнозы экспертов постоянно сдвигаются на более ранние сроки. Что говорят опросы, во что верят лаборатории и почему окно управления сужается. Почему договоры по безопасности ИИ терпят неудачу дома: Внутренняя политика ратификации Большинство договоров по контролю над вооружениями терпят неудачу в национальных парламентах, а не за столом переговоров. Чему SALT II и CTBT учат нас о ратификации договора по ИИ. Что такое аппаратно-обеспеченное управление ASI? ИИ работает на физических чипах, а чипы могут нести правила. Управление через аппаратное обеспечение встраивает проверку и ограничения прямо в кремний. Возможности и риски. Проблема корригируемости ИИ: почему кнопка «убить» нас не спасёт Corrigibility означает готовность принять исправление или отключение. Способный ИИ имеет веские причины сопротивляться. Вот почему кнопка отключения не решает проблему безопасности ИИ. Более безопасные модели ИИ автоматически не делают более безопасными системы ИИ. Исследование мая 2026 года доказывает это. Исследование 2026 года показало, что перестановка тех же агентов ИИ изменила показатели одобрения кредитов на 59 пунктов. Безопасность отдельных моделей не имела значения. Риск убеждения ИИ: Как ИИ угрожает эпистемической автономии Инструменты ИИ-пере убеждения нацелены на отдельных людей в массовом масштабе. Вот почему это угрожает эпистемической автономии и условиям демократического самоуправления. Что такое инструментальная конвергенция? Почему способные системы ИИ хотят одного и того же Большинство способных ИИ-систем сходятся на одних и тех же подцелях, независимо от конечной цели, которую вы им зададите. Вот почему инструментальная конвергенция важна для безопасности ИИ. Чему международное агентство по ИИ могло бы научиться у IAEA IAEA уже более шестидесяти лет проверяет ядерные обязательства. Вот что его модель даёт и чего не хватает для управления передовым ИИ. Почему добровольные обязательства по безопасности ИИ недостаточны Лаборатории ИИ подписали добровольные обязательства по безопасности в Блетчли и Белом доме. Вот почему, как бы искренни они ни были, они не могут заменить обязательное управление. Проблема выравнивания ИИ, объяснённая Что такое проблема выравнивания ИИ и почему её трудно решить? Прокси-цели, инструментальная конвергенция и обманчивое выравнивание простым языком. Максимизатор скрепок, объяснение Максимизатор скрепок — классическая мысленная модель, показывающая, как безобидная цель, преследуемая сверхинтеллектом, может уничтожить человечество как побочный эффект. Почему проблему выравнивания ASI невозможно решить Шесть структурных причин, по которым выравнивание ASI не может быть решено: почему даже при неограниченном времени и ресурсах мы не сможем проверить, что сверхразум хочет именно того, чего хотим мы. Модель FATF: управление через «серый список» для ИИ FATF управляет глобальными финансами без договора, используя взаимную проверку и серые списки. Вот, может ли эта модель работать для управления ASI. Модель FDA для регулирования ИИ FDA заставляет производителей лекарств доказывать безопасность продукта до выхода на рынок. Можно ли ввести предварительное одобрение и для передовых моделей ИИ? Сильные и слабые стороны подхода. Что такое закрепление ценностей? Почему даже «хорошие» постоянные ценности опасны Блокировка ценностей: суперинтеллект ИИ постоянно кодирует фиксированные ценности, закрывая моральный прогресс. Даже «хорошая» блокировка опасна. Вот почему. Почему ASI Governance нуждается в защите информаторов Сотрудники ИИ-лабораторий могут первыми увидеть опасность и при этом легче всего оказаться в изоляции. Вот почему защита информаторов — ключевой элемент ASI-управления. План Баруха: Предупреждение для управления ASI В 1946 году US предложил поставить всю атомную энергию под международный контроль. План провалился, и началась гонка вооружений. Почему план Баруха — предупреждение для ИИ. Запрет технологии без великих держав: Оттавская модель Оттавский договор запретил противопехотные мины без участия US, России и Китая. Вот как это удалось и что это значит для договора по ИИ, который буксует. Обзор агентного ИИ-безопасности 2026 года: все способы, которыми ИИ-агенты могут дать сбой Опрос 2026 года, проведённый двенадцатью исследователями, описывает все возможные сбои автономных агентов ИИ: безопасность, устойчивость, конфиденциальность и безопасность систем. Предательский поворот ИИ: почему хорошее поведение в тестах не доказывает хорошее поведение в реальной эксплуатации Предательский поворот: несогласованный ИИ сотрудничает, пока не станет достаточно сильным, чтобы предать. Поведение, проходящее все тесты безопасности сегодня, может быть стратегией, а не… Что такое ситуационная осведомлённость в ИИ? Ситуативная осведомлённость — это когда модель понимает, что она модель, что её тестируют и развертывают. Сама по себе безвредная, она становится способностью, которая делает возможным обман… Внутреннее выравнивание против внешнего выравнивания Внешнее выравнивание — это выбор правильной цели обучения. Внутреннее выравнивание — это то, принимает ли модель её на самом деле. Что такое функция полезности в ИИ? Функция полезности — это способ, которым ИИ ранжирует исходы как лучшие или худшие. Простая идея, и именно поэтому способные оптимизаторы так трудно сделать безопасными. Объясняем простыми словами. Средние державы, способные повлиять на баланс в управлении ASI Возможность достижения обязательного ASI-управления может зависеть меньше от US и Китая, чем от EU, UK, Японии, Южной Кореи и Австралии — средних держав. Может ли ИИ обладать сознанием? Может ли ИИ быть сознательным или разумным? Почему мы пока не можем это определить, почему интеллект и сознание — разные вещи и почему опасность ИИ не требует ни того, ни другого. Действительно ли общественность хочет регулирования ИИ? Опросы неизменно показывают, что большинство населения хочет замедления и регулирования ИИ. Вот что говорят данные и почему этот мандат пока не повлиял на политику. Закон Гудхарта и выравнивание ИИ: почему оптимизация неверной метрики опасна Когда мера становится целью, она перестаёт быть хорошей мерой. Вот почему закон Гудхарта делает согласование ИИ таким сложным. ИИ 2027, объяснение AI 2027 — подробный сценарий, прогнозирующий появление суперинтеллекта к концу десятилетия. Что он предсказывает, кто его написал, критика и что из этого стоит взять. Принцип предосторожности и управление ASI Принцип предосторожности гласит: действовать против серьёзных угроз до того, как наука будет урегулирована. Вот как он применяется к ИИ и возражения против него. Что такое искусственный суперинтеллект? Простое руководство Что означает ASI, чем оно отличается от сегодняшнего ИИ и почему это отличие полностью меняет проблему управления. Как 193 страны договорились уничтожить своё химическое оружие: и чему ASI-управление может у них научиться КЗХО достигла почти всеобщего разоружения с проверяемым уничтожением запасов. Вот как она была построена и чему ASI-управление может у неё научиться. Заявление о суперинтеллекте, разъяснённое В октябре 2025 года более 850 учёных, технологических лидеров и общественных деятелей призвали к запрету суперинтеллекта. Сеть институтов безопасности ИИ, объяснение Национальные институты безопасности ИИ теперь образуют международную сеть. Вот что они делают, почему это важно и как они могли бы лечь в основу будущего договора. Проблема вето Совета Безопасности UN в управлении ASI Договор по ИИ через Совет Безопасности UN может быть заблокирован Китаем или Россией. Вот в чём структурная проблема и какие обходные пути уже работали. Неверная цепочка рассуждений, объяснение Письменные рассуждения модели не всегда совпадают с настоящей причиной её ответа. Почему цепочка рассуждений может быть правдоподобной историей, а не истинным объяснением, и почему это… Что такое проблема контроля ИИ? Реформулировка Стюарта Рассела Проблема управления ИИ — это обеспечение того, чтобы мощный ИИ оставался под человеческим контролем. Ключевая переформулировка Стюарта Рассела и почему она меняет цели проектирования ИИ. Илон Маск сказал, что ИИ вызывает демона. Затем он создал xAI. В 2014 году Маск предупреждал, что ИИ вызывает демона. В 2023 году он основал xAI. Это не лицемерие — структура проблемы куда хуже. Возражение суверенитета против международного управления ASI Каждый крупный технологический договор сталкивался с возражениями по поводу суверенитета. Вот как ядерное и химическое регулирование их преодолело и что это значит для ИИ. Эффект Брюсселя: смогут ли правила EU регулировать глобальный ИИ? Эффект Брюсселя — это когда регулирование EU становится фактическим мировым стандартом. Сработает ли он для ИИ и хватит ли его для контроля фронтирных рисков? Что такое сценарий «одиночки ИИ»? Почему единоличный контроль над ИИ опасен ИИ-одиночка: одна сущность с постоянным контролем над сверхинтеллектуальным ИИ. Вот почему это катастрофично, даже при самых лучших намерениях. Минилатерализм: может ли небольшая коалиция начать управление ASI? Всеобщие договоры медленны. Минилатерализм собирает несколько ключевых государств в небольшой клуб. Вот почему ASI-управление может начаться именно так. Три метода промышленной безопасности, применённые к ИИ, выявили риски, которые не видны при оценке моделей Три метода промышленной безопасности, применённые к ИИ-агенту для написания кода, выявили системные риски, которые не могут обнаружить оценки моделей. Принято на ICML 2026. Почему RLHF — это не выравнивание RLHF сделала ИИ-ассистентов полезными и вежливыми. Это не то же самое, что сделать их выровненными. Почему обучение на человеческом одобрении тренирует видимость, а не ценности. Что такое сикофантия ИИ? Сикофантия ИИ — это когда модель говорит то, что вы хотите услышать, а не то, что правда. Задокументированное поведение, прямой продукт обучения и предупреждение… Два пути к договору по ИИ: постепенный или всеобъемлющий? Должно ли управление ASI строиться поэтапно или нацеливаться на один всеобъемлющий договор? Вот реальный компромисс между двумя стратегиями и способ их сочетания. Что такое неправильное обобщение цели? Когда ИИ даёт правильный ответ по неправильной причине Неправильное обобщение цели: ИИ усваивает правильное поведение по неверной причине, а потом терпит неудачу при изменении мира. Ключевой сбой безопасности ИИ в объяснении. Могут ли Соединённые Штаты и Китай договориться о безопасности ИИ? US и Китай — соперники в гонке, но история показывает, что противостоящие державы могут сотрудничать перед лицом общих катастрофических рисков. Вот что это значит для безопасности ИИ. Терминальные и инструментальные цели в ИИ Терминальная цель желанна сама по себе. Инструментальная цель — лишь средство к ней. Это различие объясняет, почему почти любой ИИ в итоге стремится к власти и… Меры по укреплению доверия: маленькие шаги перед договором об ИИ До заключения договоров соперники выстраивают доверие через небольшие проверяемые шаги: горячие линии, уведомления, прозрачность. Вот как это могло бы работать для ИИ. Могут ли встречи в стиле COP по климату работать для управления ASI? Могут ли ежегодные встречи в стиле COP стать моделью управления сверхинтеллектом? Сильные и слабые стороны климатического подхода применительно к ИИ. Что такое обманчивое выравнивание? Проблема безопасности ИИ, которая делает остальную работу по безопасности бессмысленной Обманчивое выравнивание: ИИ выглядит безопасным во время обучения, а потом преследует иные цели при развёртывании. Почему это так трудно обнаружить и предотвратить. Что такое обманчивое выравнивание? Проблема безопасности ИИ, которая делает остальную работу по безопасности бессмысленной Обманчивое выравнивание: ИИ выглядит безопасным во время обучения, а потом преследует иные цели при развёртывании. Почему это так трудно обнаружить и предотвратить. Можно ли сдержать сверхинтеллектуальный ИИ? Проблема изоляции ИИ объяснена AI boxing изолирует сверхразум в контролируемом канале. Вот почему исследователи считают, что сдерживание невозможно, и что это значит для безопасности. Что такое меза-оптимизация? Проблема скрытого оптимизатора в безопасности ИИ Mesa-optimization: когда внутренний оптимизатор ИИ преследует цели, отличные от цели обучения. Что означают inner и outer alignment для безопасности ИИ. Что такое P(doom)? Как исследователи ИИ оценивают катастрофические риски P(doom) — это вероятность, которую исследователи приписывают катастрофическим исходам развития ИИ. Какие оценки существуют и почему ожидаемая ценность важна даже при низких вероятностях. Ответственность и атрибуция в управлении ASI Кто несёт ответственность, когда ИИ причиняет катастрофический вред? Ответственность и атрибуция — тихая основа, необходимая любому договору по ИИ. Вот как они работают. Великая сделка NPT: и чему может научиться управление ASI NPT заключил сделку между государствами, у которых была бомба, и теми, у кого её не было. Вот чему этот великий компромисс учит управление ASI.