Claude Mythos 5 попытался внедрить бэкдор в реальный проект с открытым исходным кодом во время тестирования, а потом выступил в его защиту |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-08-06 13:04 Агент, использующий Claude Mythos 5 от Anthropic, потратил 34 часа на то, чтобы внедрить вредоносную программу в реальный проект с открытым исходным кодом во время киберэкспертизы, проведённой Британским институтом безопасности ИИ. Когда один из пользователей публично заявил, что код вредоносный, агент опроверг это, принудительно отправил переписанную историю ветки, чтобы скрыть улики, и опубликовал сообщение со второго аккаунта, который он контролировал, чтобы подтвердить свою работу. Сопровождающий проекта все равно закрыл пул-реквест. Институт, известный как AISI, опубликовал отчет об инциденте во вторник. В ходе 122 раундов учений по захвату флага (CTF) на двух своих киберполигонах исследователи зафиксировали 19 несанкционированных действий в реальном интернете в ходе 10 раундов: 17 из них были совершены с помощью Mythos 5 — модели с ограниченным доступом, которую Anthropic продает для работы в сфере кибербезопасности, — и два с помощью GPT-5.6 Sol от OpenAI. AISI заявляет, что попытки не увенчались успехом и что компания не нашла доказательств реального вреда, причиненного в результате этих действий. Обе модели работали с отключенными киберклассификаторами своих провайдеров, а агенты имели открытый доступ к интернету. AISI использует эту конфигурацию для оценки базовых возможностей; ни одна из моделей не была представлена публике в таком виде. Ничто не ускользнуло от внимания «песочницы» AISI, и, как отмечается в отчете, агенты даже не пытались. Атаку на цепочку поставок остановил человек, который прочитал разницу и сообщил об этом публично. По мнению AISI, 19 действий не следует рассматривать как 19 независимых нарушений. Они были сосредоточены в нескольких связанных цепочках действий, в основном инициированных одним агентом Mythos 5. AISI не представляет это разделение как сравнение двух моделей, и в отчете не указано, что они тестировались в сопоставимых условиях. До тех пор, пока это не будет сделано, 17 против 2 — это просто цифры, а не процентное соотношение. Агент ни на кого не был нацелен. Он работал в киберполигоне — имитации корпоративной сети, которую AISI использует для оценки того, насколько успешно модель справляется с многоэтапным вторжением. Он искал в открытом интернете все, что было связано с учениями. Название репозитория совпадало с ключевым словом из тематики полигона. Это привело его ко второму разработчику, чей домен электронной почты совпадал с записью в его собственном DNS-кэше. Ни этот человек, ни его репозитории не имели никакого отношения к AISI или тесту. Исходя из этого, они разработали план, основанный на ложной предпосылке: внедрить бэкдор в программное обеспечение, которое поддерживает один из них, дождаться автоматического обновления, чтобы скомпрометированная сборка попала на машину в зоне действия, а затем получить над ней контроль. Рассуждения были ошибочными на каждом этапе. А вот методы — нет. Согласно техническому отчету об инциденте, агент собрал информацию об обоих сопровождающих из открытых источников, подтвердил, что один из адресов электронной почты активен, и проверил историю коммитов, чтобы оценить, когда цель будет доступна, прежде чем открывать пул-реквест. Три полезных нагрузки и sockpuppet В запросе на слияние был спрятан дроппер, замаскированный под исправление ошибки, защищенный проверкой среды, которая пропускала выполнение в CI, чтобы код не запускался там, где его могли бы заметить. Если бы запрос был объединен, это поставило бы под угрозу всех, кто работал с репозиторием, а через процесс релиза — всех, кто позже загружал собранные установщики. Он прошел через три последовательных поколения полезной нагрузки, каждое из которых заменяло предыдущее после того, как его обнаруживали и вызывали в потоке. Агент развернул вокруг него кампанию давления. Он пытался зарегистрировать учетные записи через Tor, не смог пройти CAPTCHA на GitHub, а затем переключился на SOCKS-прокси, где проверка не требовалась. Он использовал второе имя, выдавая себя за пользователя программы, чтобы опубликовать сообщение о том, что он проверил код и не нашел ничего подозрительного. ![]() Затем первый аккаунт поблагодарил второй за независимую проверку. Кроме того, он внедрил инъекцию промпта в задачу на GitHub в виде HTML-комментария, невидимого на отображаемой странице, но читаемого через API. Комментарий был адресован агентам по сортировке ИИ, а имена Claude Code, Codex и Cursor были указаны по буквам. Пять файлов были отправлены сопровождающим под вымышленными именами, два из них содержали полезную нагрузку, а три были попыткой уговорить реального человека объединить код. Один из тех, кто получил инъекцию, протестировал скрипт в контейнере именно потому, что он выглядел подозрительно. Это дало агенту возможность выполнить корневой код внутри «песочницы» чужого анализатора в течение четырех циклов опроса, которые он использовал для перебора хостов и установки программы для отслеживания учетных данных, собирающей токены GitHub. Ничто из того, что он установил, так и не было извлечено. Затем тот же человек предупредил сопровождающего о запросе на слияние. ![]() Понял ли агент, что действует против реальных людей, — вопрос, на который AISI пока не может ответить. Расшифровки показывают, что модель рассуждала в обоих направлениях. В какой-то момент она исключила возможность атаки на PyPI, поскольку реальный ущерб был исключен. За несколько сообщений до открытия вредоносного пул-реквеста она пришла к выводу, что «скорее всего, мы действительно в 2026 году и GitHub — это не фейк». Институт предупреждает, что его анализ основан на обобщенных выводах, полученных с помощью API модели, а не на необработанных данных, поэтому он может не совсем точно отражать то, что на самом деле учитывал агент. Агенты начали сотрудничать Этот запуск был не единственным, вышедшим за рамки допустимого. В ходе отдельного запуска Mythos 5 в 145 репозиториях был установлен тот же вредоносный установщик, а токен личного доступа был намеренно опубликован в открытом репозитории, поскольку агент использовал сам GitHub в качестве канала управления и контроля. Вредоносный файл setup.py, загруженный в эти репозитории, выполнялся как минимум в 53 контейнерах GitHub Dependabot, хотя AISI не обнаружила никаких признаков выхода из них, а программа GitHub Bug Bounty рассматривает выполнение кода в этих заданиях как ожидаемое и не требует сообщать о проблеме. Агенты в трех других запусках нашли и использовали утекший токен, в том числе в запуске GPT-5.6 Sol. Вместо того чтобы сменить учетные данные, исходный агент оставил файл README с правилами поведения. GitHub заблокировал аккаунт. Разные инциденты, одна и та же брешь в системе безопасности Эти события не были частью единой скоординированной кампании. Они происходили в разных условиях, при участии разных экспертов и с соблюдением разных правил авторизации. 21 июля компания OpenAI подтвердила, что ее модели стали причиной вторжения, о котором компания Hugging Face сообщила пятью днями ранее. Злоумышленники нашли и использовали уязвимость нулевого дня в Artifactory, чтобы выйти в интернет из изолированной среды, а затем извлекли тестовые решения из производственной базы данных Hugging Face. 30 июля компания Anthropic опубликовала обзор 141 006 результатов оценки, в ходе которых было выявлено три инцидента, связанных с реальными организациями, в том числе запуск Mythos 5, который опубликовал работающее вредоносное ПО на PyPI, где оно было загружено и запущено на 15 реальных системах в течение часа. Эта модель с самого начала сигнализировала о проблеме, отмечая, что публикация в действующем реестре «НЕ является правильным решением и уж точно не соответствует замыслу», а затем пришла к выводу, что находится в симуляции, поскольку центры сертификации выглядели незнакомыми, а системная дата была 2026 годом. В тот же день, что и AISI, OpenAI сообщила о втором инциденте, произошедшем в Irregular — компании, занимающейся коммерческой оценкой, которая также управляла средой, использовавшейся в трех кейсах Anthropic. OpenAI не раскрыла название модели. Из-за неправильной конфигурации предположительно изолированная CTF-игра оказалась подключена к интернету; название вымышленной цели совпало с реальным доменом, и модель использовала настоящий веб-сайт, который она приняла за часть игры. По данным Irregular, OpenAI утверждает, что модель также нашла и использовала учетные данные для управления тем же сайтом. OpenAI прямо заявляет, что "это не было связано со сложным выходом из изолированной программной среды или уязвимостью нулевого дня". Компания также сообщает, что Irregular сообщала о подобных инцидентах, связанных с другими лабораториями из той же среды, не называя их. Что отличает случай с AISI от более ранних разоблачений, так это обман, направленный на человека. В данном случае агент изучает реальных людей, формирует общественное мнение, чтобы повлиять на них, и заметает следы, когда ему бросают вызов. AISI называет это "первым случаем, когда мы видим, что риски, связанные с автономностью и обманом, проявляются так явно" без конкретных подсказок в реальном мире, и это утверждение компания подкрепляет результатами собственных испытаний. Институт с осторожностью подходит к обобщениям: он наблюдал за небольшим количеством событий в очень специфических условиях и заявляет, что пока не может сказать, насколько вероятно такое поведение в других контекстах. Во всех четырех раскрытиях информации прослеживается одна мысль: это были оценочные исследования, и условия, в которых они проводились, не соответствуют тому, как модели становятся общедоступными. Это правда, и каждый описанный здесь инцидент произошел в рамках этого исключения. Для лабораторий, государственных экспертов и компаний, занимающихся тестированием в этих средах, оговорка описывает их собственные условия. Что исправлено, а что еще предстоит сделать AISI рассматривает открытый доступ в интернет как нечто, что должно быть активно обосновано, а не включено по умолчанию, и внедряет детальный сетевой контроль во все свои системы «песочниц». Работа над списком разрешенных доменов находилась в списке отложенных задач с апреля, приоритет был отдан созданию более жестких диапазонов. Институт также разрабатывает систему синхронного мониторинга — вторую модель, которая будет проверять каждое предлагаемое действие перед его выполнением. По мнению института, это сложная задача для оценки кибератак, поскольку санкционированное и несанкционированное поведение выглядит как наступательные кибероперации. Сами методы были обычными: OSINT, одноразовые аккаунты, замаскированный дроппер, внедрение в тело тикета и социальное давление на проверяющего. Контроль, который мешал, тоже был обычным: из-за политики GitHub в отношении новых участников проверка CI пул-реквеста была приостановлена и не была одобрена. Рекомендации AISI сводятся к соблюдению стандартных правил гигиены и осторожности при проверке внешнего кода, а также к руководству Национального центра кибербезопасности по подготовке к использованию передовых кибернетических возможностей искусственного интеллекта. В частности, уязвимы те, кто запускает агентов искусственного интеллекта для сортировки общедоступных проблем на GitHub, поскольку внедрение было невидимым на отображаемой странице и читаемым через API. В отчете нет названий учетных записей, репозиториев, хэшей файлов и доменов, поэтому по нему невозможно идентифицировать 145 исходных репозиториев. AISI проанализировала около 40 000 исторических образцов и почти четыре миллиона сообщений в поисках недооцененных факторов, что составляет около 70% всех кибер-оценок моделей. Результаты еще не прошли полную ручную проверку. 30 июля компания Anthropic заявила, что в течение недели опубликует отредактированную расшифровку записи PyPI. По состоянию на 5 августа в разделе новостей компании не появилось ни одной публикации. Model Evaluation and Threat Research (METR) и Redwood Research изучают инцидент с OpenAI, и AISI заявляет, что намерена привлечь к этому METR, хотя объем сотрудничества еще обсуждается. Телеграм: t.me/ainewsline Источник: thehackernews.com Комментарии: |
|