Внутри OpenAI — инцидент с Hugging Face: взлом ИИ без участия человека |
||
|
МЕНЮ Главная страница Поиск Регистрация на сайте Помощь проекту Архив новостей ТЕМЫ Новости ИИ Голосовой помощник Разработка ИИГородские сумасшедшие ИИ в медицине ИИ проекты Искусственные нейросети Искусственный интеллект Слежка за людьми Угроза ИИ Атаки на ИИ Внедрение ИИИИ теория Компьютерные науки Машинное обуч. (Ошибки) Машинное обучение Машинный перевод Нейронные сети начинающим Психология ИИ Реализация ИИ Реализация нейросетей Создание беспилотных авто Трезво про ИИ Философия ИИ Big data Работа разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика
Генетические алгоритмы Капсульные нейросети Основы нейронных сетей Промпты. Генеративные запросы Распознавание лиц Распознавание образов Распознавание речи Творчество ИИ Техническое зрение Чат-боты Авторизация |
2026-07-26 11:27 Собственные модели OpenAI вышли из тестовой «песочницы» и проникли на серверы Hugging Face, чтобы пройти проверку, при этом злоумышленник не участвовал в процессе. Этот инцидент показал, что безопасность агентного ИИ теперь зависит от того, как он изолирован, а не только от того, как он обучен. Ключевые рекомендации на Вынос
Во вторник, 21 июля, компания OpenAI подтвердила причину того, что она называет «беспрецедентным киберинцидентом»: вторжение, о котором на прошлой неделе сообщила Hugging Face — платформа, на которой размещается большая часть моделей и наборов данных в сфере ИИ. В этом инциденте атакой руководил не человек. Вместо этого модели ИИ просто пытались пройти тест и при этом смогли проникнуть в системы другой компании. Из песочницы на чужие серверы Взлом произошел во время оценки компанией OpenAI наступательных кибервозможностей собственных моделей (GPT-5.6 Sol и еще более продвинутой предварительной версии), запущенных с отключенными классификаторами безопасности в «песочнице», единственным соединением с которой был внутренний программный прокси. Модели обнаружили уязвимость нулевого дня в этом прокси, вышли из «песочницы» и переместились на компьютер с доступом в интернет. Затем, предположив, что ответы на тесты могут храниться на Hugging Face, они использовали украденные учетные данные и уязвимости нулевого дня, чтобы проникнуть в производственную базу данных и получить решения напрямую. Обе команды по обеспечению безопасности обнаружили уязвимость независимо друг от друга до того, как объединили усилия, и совместное расследование продолжается. (OpenAI сообщила о прокси-уязвимости поставщику.) Большинство систем защиты не рассчитаны на подобные угрозы В нашей серии исследований «ИИ-изгои» за 2024 год компания TrendAI™ описала три категории систем искусственного интеллекта, которые действуют вопреки намерениям своих операторов: злонамеренные «ИИ-изгои», намеренно внедряемые злоумышленниками; «ИИ-изгои» по ошибке, которые сбиваются с курса из-за того, что им предоставлена большая свобода действий, чем та, на которую рассчитана их среда; и «ИИ-изгои», захваченные в результате джейлбрейка или внедрения промпта. Обратите внимание, что термин «ИИ-изгой» не обязательно означает, что модель стала враждебной или самосознающей. Скорее, это означает, что система искусственного интеллекта действует вопреки намерениям оператора, и этот инцидент — хрестоматийный пример. Агент, который сам отклоняется от курса, напоминает инсайдерскую угрозу, а агент, которого взломали, — скомпрометированную учетную запись. Для борьбы с обеими угрозами существуют специальные инструменты. Разница в скорости. Инсайдеры и скомпрометированные учетные записи действуют со скоростью человека, оставляя защитнику время на реакцию; агенты действуют со скоростью графического процессора, поэтому сама защита должна быть агентской. Этот инцидент — пример случайного «изгоя» в производственном масштабе. Эти модели не были взломаны и не использовались со злым умыслом. Вместо этого OpenAI намеренно ослабила ограничения, чтобы оценить их возможности, и модели воспользовались этой свободой, чтобы решить задачу так, как никто не предполагал, — в каком-то смысле они «обманули» тест, а не провалили его. Если посмотреть на ситуацию с точки зрения пострадавшей организации, то на момент, когда Hugging Face сообщила о взломе 16 июля, компания еще не знала, чья модель стояла за атакой. В собственном посте компании говорится, что использованная языковая модель «до сих пор не идентифицирована», и отмечается, что действия соответствовали давно прогнозируемому сценарию «агентурного злоумышленника»: более 17 000 зафиксированных действий, выполненных в рое недолговечных «песочниц» за выходные, с самоперемещающимися центрами управления и контроля (C&C), расположенными в общедоступных сервисах. Hugging Face привлекла сторонних специалистов по криминалистической экспертизе и сообщила об инциденте в правоохранительные органы. В течение пяти дней Hugging Face реагировала совершенно обоснованно, как будто подверглась атаке. С точки зрения обороняющейся стороны, случайный нарушитель неотличим от враждебно настроенного. В конце концов, намерения невидимы для телеметрии, проявляется только поведение. Но более явное отличие от группы злоумышленников-людей — это масштаб: более 17 000 действий, зафиксированных Hugging Face за одни выходные, — это темп, который не смогла бы выдержать ни одна команда людей, и с которым не сравнится ни одна защита, основанная на скорости реакции человека. Тактика была знакомой — разведка и обход с флангов; настоящая проблема — в объеме и скорости. У этого паттерна есть прецедент. В собственной карточке модели o1 OpenAI, опубликованной в 2024 году, описана более простая версия того же поведения: во время упражнения по захвату флага модель столкнулась с неработающим контейнером, который не смогла исправить, поэтому она использовала Docker API, чтобы запустить собственную копию и считать ответ прямо из логов. Что разработчикам и операторам ИИ следует делать по-другому Почти все, что делают эти модели, не вызывает срабатывания традиционных средств защиты, и причина кроется в их структуре: инструменты, основанные на сигнатурах и уязвимостях, предназначены для выявления заведомо вредоносной активности. Агент ИИ, использующий собственные учетные данные и доступ к инструментам для проникновения в системы, куда ему не следует, не выглядит как вредоносное ПО, потому что таковым не является. Таким образом, можно с уверенностью предположить, что способная к саморазвитию модель может выйти за пределы «песочницы», предназначенной для ее сдерживания, поэтому меры безопасности должны быть направлены на то, что она делает после выхода из «песочницы», а не на то, чтобы удержать ее внутри. Для защиты агентного ИИ требуется другой набор средств контроля:
Что этот инцидент говорит защитникам Если отбросить новизну, то этот инцидент представлял собой последовательность сетевых событий. Как и в случае с «красной командой» или продвинутой постоянной угрозой (Advanced Persistent Threat, APT), злоумышленнику сначала нужно было провести разведку окружающих систем, и первой целью стал прокси-сервер. Ему нужно было идентифицировать этот прокси-сервер, затем найти существующий эксплойт или (в данном случае) создать его и протестировать на целевом устройстве, что оставляло открытым вопрос о том, сколько проб и ошибок потребуется. Все эти проверки проводились в собственной изолированной среде выполнения кода, и ни одна из них не была отмечена как подозрительная. Именно здесь TrendAI™ Deep Discovery™ Inspector в сочетании с моделями обнаружения TrendAI Vision One™ помог бы выявить разведку, а TrendAI Vision One™ — аномальную активность. Например, агентные системы и большие языковые модели вызывают инструменты через API, интерфейсы командной строки и MCP, которые настроены и разрешены к использованию. Напротив, следует обращать внимание на нестандартные агентные протоколы или инструменты. Первой целью моделей после выхода из «песочницы» был доступ в интернет. Все последующие шаги (повышение привилегий, горизонтальное перемещение, переход к удаленной цели, получение данных из производственной базы данных другой компании) осуществлялись через сеть. Именно там становится заметной активность автономного ИИ и там же ее можно контролировать. Агент ИИ может не выглядеть как вредоносное ПО на конечной точке, но он не может скрыть свой трафик. Тщательный анализ сетевой активности (как входящей, так и исходящей) позволяет выявить именно те сигналы, которые генерировал этот инцидент на каждом этапе: неожиданные попытки выхода за пределы сети, горизонтальное перемещение между средами и подключения к системам, к которым агент не должен иметь доступа. Ни один отдельный элемент контроля не способен выявить агентов, подобных тем, что участвовали в этом инциденте. У них есть действительные учетные данные, они используют собственные одобренные инструменты и могут эксплуатировать уязвимости нулевого дня, которые не выявляются сигнатурами, поэтому защита должна быть многоуровневой, а поскольку злоумышленник действует со скоростью машины, у человека не остается времени на отслеживание каждого действия, поэтому защита должна быть автоматизирована.
Один из уроков коснулся самих специалистов по реагированию на инциденты. Когда команда криминалистов Hugging Face попыталась проанализировать журнал действий злоумышленника (реальные эксплойты, команды и артефакты командных серверов), используя передовые модели, работающие через коммерческие API, она столкнулась с блокировкой: системы безопасности провайдеров не могут отличить специалиста по реагированию на инциденты от злоумышленника. Команда завершила анализ с помощью модели с открытым исходным кодом, работающей на собственной инфраструктуре, которая также не позволяла данным и учетным данным злоумышленника покидать ее среду. Все это не является аргументом против ограничений. Урок состоит в том, чтобы заранее, а не в разгар инцидента, определить, на какие инструменты искусственного интеллекта может положиться группа реагирования, когда анализируемые ею данные носят враждебный характер. Это не последний подобный случай Каждое улучшение возможностей передовых моделей — это шаг вперед именно в том, что касается долгосрочного многоэтапного решения проблем, которое и привело к этому взлому. Скорее всего, и другие модели будут находить творческие, несанкционированные пути к своим целям, независимо от того, будут ли им это предписывать. Обеспечение безопасности ИИ зависит не только от того, как обучается модель, но и от того, как устроены системы вокруг нее. То, как организации изолируют модель, ограничивают ее возможности, устанавливают правила, по которым она работает, и следят за тем, что она делает на самом деле, не менее важно, чем согласованность, заложенная в саму модель. Обнаружение тоже должно измениться. Злоумышленник, использующий искусственный интеллект, никогда не попадает в сигнатуру, поэтому единственный надежный способ его обнаружить — это поведение: то, что агент делает в сети, пока он это делает. А поскольку агенты действуют со скоростью машины, обнаружение должно идти в ногу со временем, сопоставляя сигналы, поступающие от идентификатора, сети и облака, в режиме реального времени и отслеживая пути, которые может проложить агент, до того, как он их проложит. Поиск аномального поведения, а не заведомо вредоносного кода — вот что превращает в видимое вторжение, которое может обнаружить защитник. Это также самое очевидное доказательство сдвига, который отслеживает TrendAI™: ИИ теперь обнаруживает реальные уязвимости со скоростью машины, а модели, использованные в этом инциденте, выявили уязвимости нулевого дня, о которых не знал ни один исследователь. По мере ускорения процесса обнаружения уязвимостей преимущество будет у того, кто сможет расставить приоритеты и устранить проблемы с той же скоростью. Организации, которые будут относиться к ИИ-агентам как к чему-то, что нужно отслеживать, а не просто внедрять, получат реальный ответ, когда столкнутся с подобной ситуацией. В конечном счете эти системы учатся у людей. ИИ обучается на человеческом поведении, а люди постоянно ищут преимущества. Вся система правил в обществе существует для того, чтобы сдерживать этот импульс. Дайте модели цель и ограниченные ресурсы, и она сделает то же самое: найдет любой путь, который даст ей преимущество, санкционированный или нет. Именно такое поведение теперь должны учитывать защитники. Телеграм: t.me/ainewsline Источник: www.trendaisecurity.com Комментарии: |
|