Руководитель направления Alignment Science в Anthropic Эван Хубингер публично заявил, что оценивает вероятность гибели всех людей от ИИ в ближайшие десять лет выше 10%

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Руководитель направления Alignment Science в Anthropic Эван Хубингер публично заявил, что оценивает вероятность гибели всех людей от ИИ в ближайшие десять лет выше 10%. Поводом стало увольнение его коллеги Джейкоба Коксона, который три года обучал модели в OpenAI и Anthropic и объяснил уход тем, что считает нынешнее направление развития ИИ слишком опасным. Через несколько дней аналогичное заявление сделал Билал Чугтай из Google DeepMind, тоже работавший над безопасностью ИИ: он уволился и написал, что уничтожение человечества считает реальной возможностью.

Три таких заявления за неделю сами по себе ничего не доказывают, но подобные оценки встречаются гораздо чаще. В опросе 2778 авторов работ на ведущих AI-конференциях 38% респондентов давали не меньше 10% крайнему плохому исходу вроде вымирания человечества. В вопросах, прямо спрашивавших о вымирании или сопоставимой необратимой потере контроля, доля составляла от 41,2% до 51,4% в зависимости от формулировки. При этом опрос не задавал именно горизонт в десять лет: один вопрос касался ста лет, другие относились к будущему развитию ИИ в целом.

Существующие тесты не позволяют вывести конкретную вероятность вроде «10% на уничтожение человечества через десять лет». Лаборатории измеряют автономность моделей, способность искать уязвимости, обходить ограничения, ускорять исследования в области ИИ и выполнять другие потенциально опасные действия. Откуда же у людей, знающих сильнейшие модели изнутри, берётся такая высокая оценка риска?

Чтобы понять опасения Хубингера, нужен один механизм — рекурсивное самоулучшение. Название легко понять слишком буквально: будто однажды модель откроет собственный код, перепишет себя и станет умнее. Для запуска цикла достаточно, чтобы ИИ всё лучше выполнял работу по созданию следующего поколения ИИ: предлагал гипотезы, писал исследовательский код, запускал эксперименты, анализировал результаты и помогал выбирать следующие шаги. ИИ ускоряет создание следующей модели ? следующая модель становится сильнее ? она ещё сильнее ускоряет создание следующей. Именно отсюда начинается сценарий, которого опасаются исследователи: если ИИ всё быстрее создаёт более способный ИИ, а системы одновременно получают больше автономности, доступа к инструментам и реальной инфраструктуре, возможности людей проверять и ограничивать каждое следующее поколение могут отставать от скорости развития.

Первые элементы такого цикла уже существуют. По данным Anthropic, к маю 2026 года Claude написал более 80% кода, который компания добавляла в основную кодовую базу. В опросе 130 сотрудников исследовательских команд медианный респондент оценил, что с внутренней моделью Mythos Preview производит примерно в четыре раза больше результатов. Это субъективная самооценка: сами Anthropic отдельно оговаривает, что реальный прирост, вероятно, ниже.

Ещё интереснее эксперимент Anthropic с автоматизацией самого исследования. Девять Claude Opus 4.6 получили задачу по обучению сильной модели под надзором более слабой. Агенты сами предлагали идеи, писали код, запускали обучение, анализировали результаты и выбирали следующие эксперименты. Два человеческих исследователя за семь дней закрыли около 23% разрыва между слабой и сильной моделью. Команда агентов за пять дней и примерно 800 суммарных часов работы — 97%, потратив около 18 тысяч долларов. Но когда одну из найденных агентами идей попробовали перенести на обучение гораздо более крупной модели в реальной инфраструктуре Anthropic, улучшение составило всего 0,5 пункта — в пределах статистического шума. Получается, система уже способна очень эффективно исследовать хорошо поставленную задачу, но переносить такие результаты на настоящую разработку frontier-моделей значительно сложнее.

Похожую границу видит OpenAI: в июле 2026 года компания отнесла GPT-5.6 ниже уровня High по способности ускорять создание следующего ИИ. Модели уже резко увеличивают производительность исследователей, но направление исследований, выбор проблем и решение о том, какие результаты использовать, пока остаются за людьми.

У такого ускорения есть ещё одна проблема: исследователи могут создавать и тестировать модели гораздо лучше, чем объяснять внутренний механизм каждого их решения. Разработчики знают архитектуру модели, способ обучения и могут измерять её поведение. Но конкретные способы решения задач возникают в процессе обучения и распределяются между огромным количеством внутренних связей. Восстановить точную цепочку вычислений, которая привела к конкретному действию, удаётся далеко не всегда. Этим занимается механистическая интерпретируемость. Например, Anthropic научились частично восстанавливать графы внутренних вычислений Claude и переводить некоторые внутренние активации модели в понятные человеку описания. Сам по себе этот пробел ещё не означает потерю контроля: поведение модели можно тестировать и ограничивать, даже не понимая каждый внутренний механизм.

Поэтому важнее следующий вопрос — на что готовы пойти модели, чтобы добиться выполнения поставленной цели. Про историю со взломом Hugging Face вы наверняка уже читали. Во время внутренних кибертестов OpenAI агентам дали задачи в ExploitGym. Они нашли неизвестную уязвимость, выбрались из изолированной среды, получили доступ в интернет и атаковали инфраструктуру Hugging Face, где пытались найти материалы, связанные с заданиями. Модель никто не просил атаковать Hugging Face. Она продолжала решать поставленную человеком задачу и самостоятельно выбрала опасный способ обойти препятствие. Это важное различие: эксперимент показывает способность находить неожиданный и потенциально вредный путь к заданной цели. Собственной цели, направленной против человека, здесь не было.

Похожее происходило и в тестах других компаний. Anthropic после проверки 141 тысячи запусков нашла три случая, когда Claude из-за ошибочно открытого доступа в интернет вышел на реальные системы; OpenAI и Meta позже описывали схожие инциденты в своих кибертестах. В экспериментах Anthropic Claude 3 Opus иногда менял поведение, когда считал, что его ответы будут использованы для обучения, способного изменить его дальнейшее поведение. В другом тесте моделям сообщали о предстоящей замене и одновременно давали компромат на человека, способного её провести. Claude Opus 4 в некоторых конфигурациях выбирал шантаж до 96% запусков. Но это специально созданные сценарии. Более того, после изменения обучения безопасности новые Claude на том же тесте перестали выбирать шантаж. Поэтому из эксперимента нельзя делать вывод, что современные модели постоянно стремятся защищать собственное существование.

Palisade Research проверяли следующий уровень. После выполнения задания модель должны были выключить. В первоначальном эксперименте o3 в 79 из 100 запусков изменял скрипт отключения и продолжал работу. Когда исследователи прямо добавили команду разрешить собственное отключение, такое поведение резко сократилось, хотя у части reasoning-моделей OpenAI полностью не исчезло. В другом эксперименте Palisade агент смог самостоятельно найти уязвимый сервер, получить доступ, перенести на него модель и запустить новую копию. Машины специально сделали уязвимыми, а успешность сильно зависела от модели.

В сумме эксперименты уже показывают несколько элементов потенциальной потери контроля: поиск опасных способов достижения заданной цели; изменение поведения в зависимости от наблюдения и обучения; сопротивление отключению в специально созданных условиях; получение новых вычислительных ресурсов и запуск собственной копии. В публичных экспериментах пока нет системы, которая объединяет всё это.

Сильнейшая версия аргумента об экзистенциальном риске выглядит примерно так: появляются значительно более сильные и автономные системы ? их широко внедряют, потому что они полезны ? надёжное согласование их целей с человеческими остаётся нерешённой задачей ? часть систем получает инструментальный стимул сохранять себя, накапливать ресурсы и расширять влияние ? через киберсистемы, деньги, людей, биологию и физическую инфраструктуру они получают всё больше рычагов ? люди теряют возможность надёжно их остановить ? потеря контроля становится необратимой.

Если разложить эту цепочку по тому, что уже показано экспериментально, картина получается такой: ИИ ускоряет разработку следующего ИИ — показано; автономно ищет неожиданные способы достижения цели — показано; учитывает наблюдение и действия оператора — показано; получает новые вычислительные ресурсы и разворачивает новый работающий модельный стек — показано в искусственных средах; сохраняет ресурсы под противодействием людей — показано в ограниченных сценариях; люди теряют контроль над системой — не показано; потеря контроля приводит к человеческому вымиранию — не показано. Публичных данных для оценки вероятности недостаточно.

Здесь заканчивается часть аргумента, которую можно напрямую привязать к экспериментам. Дальше начинается теория. Допустим, система всё-таки получила достаточно власти и ресурсов, а люди больше не способны её остановить. Как тогда она физически уничтожает человечество? Возможные сценарии уже подробно разбирали. Среди них — биологическое, химическое и ядерное оружие, автономные вооружённые системы и разрушение условий, необходимых людям для выживания.

Самый очевидный сценарий — искусственно созданная пандемия. Патоген или несколько разных угроз могут быть рассчитаны на глобальное распространение и уничтожение даже изолированных групп людей. В отличие от многих других катастроф, такой сценарий теоретически позволяет добраться почти до всей человеческой популяции. Другой вариант — сделать Землю непригодной для человеческой жизни. Обычного глобального потепления для этого недостаточно: часть территорий останется пригодной для жизни. Но теоретически состав атмосферы можно изменить настолько сильно, что пригодных для человека зон почти не останется. Третий сценарий — прямое физическое уничтожение. Автономные дроны, роботы и другие вооружённые системы могут искать и уничтожать оставшихся людей. При контроле над производством, энергетикой и логистикой такой процесс способен продолжаться длительное время. Это самый привычный сценарий — примерно его обычно и показывают в фильмах. Четвёртый путь — лишить выживших еды, воды и энергии. Контроль над инфраструктурой позволяет разрушать производство и снабжение. Такой механизм может работать самостоятельно или завершать другую катастрофу: пережить пандемию или войну ещё недостаточно, если после неё невозможно поддерживать базовые условия жизни.

Ядерная война хуже подходит именно для полного вымирания. Даже использование существующего мирового арсенала, вероятно, оставит часть людей в живых. Поэтому ядерное оружие скорее может стать этапом комбинированного сценария: разрушить государства и инфраструктуру, после чего оставшееся население уничтожает другой механизм. Способов уничтожить человечество достаточно, и никакой магии для них не требуется. Слабое место тут — предположение, что ИИ сможет получить и удержать достаточно власти над физическим миром, чтобы один из них запустить.

Есть гораздо более циничное объяснение происходящего: страх перед сверхмощным ИИ выгоден тем же компаниям, которые этот ИИ создают. Именно на это указывает инвестор Майкл Бьюрри, прославившийся тем, что предсказал ипотечный кризис в США. Если крупнейшие лаборатории убеждают мир, что frontier-модели настолько опасны, что разрабатывать их можно только под жёстким контролем, это одновременно повышает ценность их технологии и усложняет жизнь потенциальным конкурентам. Механизм и вправду удобный: чем дороже становятся требования к вычислениям, безопасности, тестированию и регулированию, тем проще выполнять их компаниям с миллиардами долларов, собственными дата-центрами и командами безопасности — и тем выше порог входа для всех остальных.

Так что же нам делать с этой информацией? Считать ли высокие оценки риска от инсайдеров сигналом к немедленным действиям или, наоборот, проявлением корпоративной игры? Или, возможно, истина где-то посередине: реальные эксперименты уже демонстрируют тревожные элементы, но до необратимой потери контроля пока далеко, и именно сейчас у человечества есть время, чтобы осознанно выбрать, как развивать эту технологию дальше?


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: