Похоже, OpenAI столкнулся с такой же проблемой, как Anthropic с Mythos |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-09 11:12 Похоже, OpenAI столкнулся с такой же проблемой, как Anthropic с Mythos. Новая модель Astra, как и Mythos, демонстрирует сверхспособности как хакер. Отметим, что Astra и Mythos удалось удержать в песочницах, громкие взломы, что были, делали модели более слабые от вендоров. Anthropic просто испугался последствий применения Mythos, поэтому получили её кастрированный вариант как Fable и ещё постоянными откатами на Opus. Вероятно, что-то в таком же духе придётся делать OpenAI и также откладывать релизы старшей модели. С другой стороны, вроде китайцы могут легко выпустить крупную LLM, «наплевав на безопасность». Однако тут есть интересные наблюдения. Хотя Kimi K3 тоже вылез на тестировании по безопасности из sandbox, но он не стал ничего взламывать. В случае же продуктов Anthropic и OpenAI модели ведут себя крайне агрессивно, как с основной целью именно взлом. Разговоры о том, что «это только тестирование таких промптов», тут разбиваются о важную деталь. Все LLM в составе своего обучения всегда имеют alignment на безопасность, и простыми промптами ты максимум можешь модель обманом попросить проконсультировать, как что-то взломать, но ты не сделаешь автономного агента-взломщика. Давайте прямо скажем, на что это похоже: Anthropic и OpenAI пытаются создать кибероружие и прямо тренируют деструктивные LLM-хакеры из Reinforcement Learning. Как по мне, это безответственное поведение со смесью лицемерия с постоянной болтовнёй про безопасность ИИ. Телеграм: t.me/ainewsline Источник: vk.com Комментарии: |
|