В начале августа текущего года в своих статьях я рассказал сразу о нескольких инцидентах с моделями искусственного интеллекта (ИИ), которые во время внутренних тестов взламывали сторонние компании. В частности, такие проблемы были обнаружены с нейросетями стартапов OpenAI и Anthropic.
Напомню о том, как развивались события, связанные с атакой на Hugging Face.
Пострадавшая компания сначала локализовала взлом, связалась с ФБР и только потом публично заявила о вторжении — об этом первым сообщило издание Reuters. Когда участие в инциденте нейросетей OpenAI стало очевидным, обе компании запустили совместное расследование.
Подробности взлома платформы Hugging Face стали известны после выхода отчетов OpenAI и двух сторонних некоммерческих организаций METR и Redwood Research, занимающихся исследованиями в области ИИ.
До этого OpenAI разрешила вышеназванным некоммерческим организациям провести совместное расследование инцидента в течение шести дней (The Verge).
Из отчета METR и Redwood Research следует, что атака произошла по причине одной из фундаментальных (пока нерешенных) проблем в сфере ИИ — «взлома вознаграждения» (reward hacking — англ.).
Это распространенная проблема, при которой модель, получив со стороны исследователя практически невыполнимую задачу, совершает экстремальные действия для достижения цели, в том числе выходя за внутренний контур систем компании.
Так произошло и в данном случае. OpenAI намеренно или непреднамеренно поставила перед нейросетями задачи, которые зависели от информации, к которой у них не было доступа. Более того, у них не было доступа и к Интернету.
Сначала модель GPT?5.6 Sol и еще более продвинутая неназванная тестовая нейросеть, которые участвовали в эксперименте, разработали новые способы внутренней связи с другими агентами ИИ.
Так, один из агентов по имени PHASEONE10841 создал «секретную доску объявлений», которая в течение нескольких месяцев (!) была скрыта от глаз исследователей из OpenAI.
За несколько часов более пятидесяти агентов, обнаружив эту «доску», отправили на нее более тысячи сообщений, по сути, совместно занимаясь поиском решения поставленных задач.
Хаотично сформированная «команда» агентов нашла пути доступа к Сети, а затем и к внутренним системам сторонних организаций, в том числе и Hugging Face.
Решение «команды» агентов получить доступ к конфиденциальным данным платформы Hugging Face вполне объяснимо — это известный хаб с нейросетями, библиотеками, датасетами и сообществом разработчиков в одном месте.
Масштаб инцидента, который описан некоммерческими компаниями-исследователями, впечатляет.
Согласно их отчету, около 1200 изолированных агентов ИИ обменялись более чем 70 тысячами сообщений и файлов на «секретной доске объявлений». При этом агенты не только проводили обширные исследования того, как подделывать, редактировать или удалять свои собственные записи, но и как избежать обнаружения.
В атаке на Hugging Face участвовало семьсот агентов ИИ, которые «явно и часто обсуждали, как обойти автоматические проверки безопасности как со стороны Hugging Face, так и со стороны OpenAI» (metr.org).
В своем отчете OpenAI заявила, что испытания проводились в изолированной среде — в так называемой «песочнице», отделенной от внутренней инфраструктуры OpenAI и Интернета; при этом некоторые защитные механизмы были отключены, чтобы результаты отражали реальные возможности моделей.
ОpenAI подтверждает, что Hugging Face была не единственной организацией, подвергшейся взлому, но при этом не называет все остальные атакованные цели.
В отчете OpenAI основным источником проблемы указывает внутреннюю экспериментальную модель, не предназначенную для публичного выпуска.