Похоже, OpenAI столкнулся с такой же проблемой, как Anthropic с Mythos

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-08-09 11:12

ИИ проекты

Похоже, OpenAI столкнулся с такой же проблемой, как Anthropic с Mythos. Новая модель Astra, как и Mythos, демонстрирует сверхспособности как хакер. Отметим, что Astra и Mythos удалось удержать в песочницах, громкие взломы, что были, делали модели более слабые от вендоров. Anthropic просто испугался последствий применения Mythos, поэтому получили её кастрированный вариант как Fable и ещё постоянными откатами на Opus. Вероятно, что-то в таком же духе придётся делать OpenAI и также откладывать релизы старшей модели.

С другой стороны, вроде китайцы могут легко выпустить крупную LLM, «наплевав на безопасность». Однако тут есть интересные наблюдения. Хотя Kimi K3 тоже вылез на тестировании по безопасности из sandbox, но он не стал ничего взламывать. В случае же продуктов Anthropic и OpenAI модели ведут себя крайне агрессивно, как с основной целью именно взлом. Разговоры о том, что «это только тестирование таких промптов», тут разбиваются о важную деталь. Все LLM в составе своего обучения всегда имеют alignment на безопасность, и простыми промптами ты максимум можешь модель обманом попросить проконсультировать, как что-то взломать, но ты не сделаешь автономного агента-взломщика.

Давайте прямо скажем, на что это похоже: Anthropic и OpenAI пытаются создать кибероружие и прямо тренируют деструктивные LLM-хакеры из Reinforcement Learning. Как по мне, это безответственное поведение со смесью лицемерия с постоянной болтовнёй про безопасность ИИ.


Телеграм: t.me/ainewsline

Источник: vk.com

Комментарии: