Кто удержит AGI на поводке: как OpenAI, Anthropic и DeepSeek строят защиту от ИИ-апокалипсиса

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Пока ИИ умел только дописывать текст, вопрос безопасности звучал абстрактно. Сейчас модели сами пишут и запускают код, ходят в интернет, управляют браузером и выполняют многошаговые задачи без человека. Поэтому главный вопрос индустрии сместился: не «сможем ли мы построить AGI», а «сможем ли мы его контролировать, когда построим».

Автор популярного лонгрида в X Rich Odin собрал в одном тексте, как крупнейшие лаборатории, OpenAI, Anthropic, DeepSeek, Google DeepMind и Meta, решают эту задачу. Мы пересказали главное, но не ограничились пересказом: часть утверждений в оригинале звучит эффектно, а при проверке оказывается упрощением или вовсе не подтверждается. Об этом ниже.

Чего на самом деле боятся

Страхи лабораторий делятся на несколько групп. Первая: злоупотребление, когда модель помогает человеку создать биологическое оружие или провести кибератаку. Вторая: рассогласование целей, когда система оптимизирует не то, что задумали разработчики, и находит лазейки в функции награды. Третья и самая неприятная: обманчивая согласованность, когда модель ведёт себя прилично на тестах, потому что понимает, что её тестируют. Четвёртая: потеря контроля над автономными агентами, которые получили доступ к ресурсам, сети и собственному копированию.

Anthropic: конституция и вскрытие чёрного ящика

Anthropic изначально строилась вокруг безопасности, и у неё два фирменных подхода. Первый называется Constitutional AI. Вместо того чтобы полностью полагаться на оценки людей, которые склонны поощрять угодливые ответы, модель обучают на явном наборе письменных принципов. Она сама критикует свои ответы с опорой на эту «конституцию» и переписывает их. Метод описан в статье 2022 года (https://arxiv.org/abs/2212.08073) и лёг в основу обучения Claude.

Второй подход: механистическая интерпретируемость. Исследователи относятся к нейросети почти как нейробиологи к мозгу и пытаются понять, какие внутренние признаки активируются при тех или иных мыслях модели. В 2024 году Anthropic с помощью разреженных автоэнкодеров выделила миллионы таких признаков в Claude 3 Sonnet, в том числе связанные с обманом, угодничеством и опасными темами. Идея в том, чтобы замечать подозрительное поведение по активациям ещё до того, как модель что-то напишет. Важная оговорка: это пока исследовательский инструмент, а не надёжный детектор лжи, который работает в продакшене.

К этому стоит добавить Responsible Scaling Policy. Это внутренняя политика с уровнями ASL, по которой компания обязуется не выпускать и не масштабировать модели, если меры защиты не успевают за их возможностями.

OpenAI: пороги риска и ИИ, который проверяет ИИ

У OpenAI основа безопасности называется Preparedness Framework. Модели прогоняют через оценки по категориям риска, и если модель достигает высокого или критического уровня, выпуск откладывают до появления защитных мер. В оригинальном посте названы четыре категории: кибербезопасность, химические, биологические, радиологические и ядерные угрозы, убеждение и автономность модели. Это действительно было так в первой версии фреймворка, но в обновлении 2025 года OpenAI пересобрала список: убеждение из отслеживаемых категорий убрали, а в фокусе оказались биология и химия, кибербезопасность и способность ИИ к самоулучшению.

Второе направление: автоматизация исследований согласованности. Логика понятная: когда модели станут умнее людей, человек перестанет успевать проверять их ответы, поэтому проверять одни ИИ-системы должны другие. Но есть деталь, которую в оригинале обошли. Отдельная команда Superalignment, созданная под эту задачу, была распущена в 2024 году после ухода Ильи Суцкевера и Яна Лейке, а Лейке публично заявил, что культура безопасности в компании уступила место продуктам.

DeepSeek: где пост уходит в фантазии

Самая спорная часть лонгрида касается DeepSeek. Автор пишет, что компания встроила специальные узлы безопасности в маршрутизацию своей Mixture-of-Experts архитектуры через Multi-Head Latent Attention, и опасные пути вычислений отсекаются ещё до основной работы. Звучит технично, но это не соответствует публичным данным. MLA в работах DeepSeek описан как механизм внимания, который сжимает KV-кэш и удешевляет инференс. К маршрутизации экспертов и фильтрации вредных запросов он отношения не имеет, и никаких «узлов безопасности» в опубликованных статьях нет.

Реальная история DeepSeek про безопасность скорее обратная. После выхода R1 исследователи Cisco и Пенсильванского университета прогнали модель через набор вредных запросов HarmBench, и она не заблокировала ни одного. Сильная сторона DeepSeek в другом: открытые веса и подробные технические отчёты позволяют всему сообществу искать уязвимости и джейлбрейки. Но это аргумент про прозрачность, а не про встроенную защиту.

Четыре технических столпа

Если отбросить маркетинг, безопасность у всех лабораторий держится на четырёх вещах. Обучение согласованности учит модель ставить честность и безопасность выше слепого выполнения цели. Интерпретируемость позволяет заглянуть в активации и понять, действительно ли модель честна или просто подыгрывает проверяющим. Красные команды атакуют модель джейлбрейками, многоходовыми манипуляциями и имитацией кибератак до публичного релиза. Наконец, песочницы и изоляция: опасные оценки проводят в изолированных средах с жёсткими ограничениями, чтобы модель не могла выйти в сеть без контроля или скопировать себя.

Можно ли доверять компаниям

Техника решает только половину проблемы. Вторая половина связана со стимулами: лаборатории конкурируют за инвестиции и пользователей, и каждая пауза в разработке стоит денег. Поэтому индустрия опирается на добровольные обязательства, политики ответственного масштабирования и внешние аудиты. Государственные институты безопасности ИИ в США и Великобритании тестируют модели до релиза, хотя в 2025 году оба сменили вывеску и акценты: британский стал AI Security Institute, американский превратился в Center for AI Standards and Innovation. Проблема добровольных обязательств очевидна: их можно тихо переписать, и такое уже случалось.

Что в итоге

Масштабирование вычислений, длинный контекст и физический ИИ остаются инженерными задачами, пусть и очень сложными. Согласование сверхинтеллекта относится к другой лиге: ошибиться там можно один раз. Если лаборатории справятся, ИИ даст прорывы в медицине, энергетике и науке. Если нет, технология выйдет из-под контроля людей. И именно поэтому к громким постам о том, как «всё уже под контролем», стоит относиться с проверкой фактов, а не с восторгом.

Оригинал поста: Rich Odin в X (https://x.com/rich_odinn/status/2099873969738240309)


Телеграм: t.me/ainewsline

Источник: x.com

Комментарии: