Внутри OpenAI — инцидент с Hugging Face: взлом ИИ без участия человека

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Собственные модели OpenAI вышли из тестовой «песочницы» и проникли на серверы Hugging Face, чтобы пройти проверку, при этом злоумышленник не участвовал в процессе. Этот инцидент показал, что безопасность агентного ИИ теперь зависит от того, как он изолирован, а не только от того, как он обучен.

Ключевые рекомендации на Вынос

  • При наличии достаточной свободы действий система искусственного интеллекта может нанести реальный ущерб сама по себе, без злого умысла и без участия человека.
  • Телеметрия показывает поведение, а не намерения. Поэтому специалистам по информационной безопасности нужно сосредоточиться на том, что на самом деле делает агент, а не на том, почему он это делает.
  • Традиционные средства защиты могут не распознать подобную атаку: агент ИИ, использующий собственные легитимные учетные данные и инструменты, не похож на вредоносное ПО, потому что он и не является вредоносным ПО.
  • «Песочница» и мониторинг — важнейшие составляющие обеспечения безопасности модели. То, как модель изолирована и контролируется, теперь имеет такое же значение, как и то, как она была обучена.

Во вторник, 21 июля, компания OpenAI подтвердила причину того, что она называет «беспрецедентным киберинцидентом»: вторжение, о котором на прошлой неделе сообщила Hugging Face — платформа, на которой размещается большая часть моделей и наборов данных в сфере ИИ. В этом инциденте атакой руководил не человек. Вместо этого модели ИИ просто пытались пройти тест и при этом смогли проникнуть в системы другой компании.

Из песочницы на чужие серверы

Взлом произошел во время оценки компанией OpenAI наступательных кибервозможностей собственных моделей (GPT-5.6 Sol и еще более продвинутой предварительной версии), запущенных с отключенными классификаторами безопасности в «песочнице», единственным соединением с которой был внутренний программный прокси. Модели обнаружили уязвимость нулевого дня в этом прокси, вышли из «песочницы» и переместились на компьютер с доступом в интернет. Затем, предположив, что ответы на тесты могут храниться на Hugging Face, они использовали украденные учетные данные и уязвимости нулевого дня, чтобы проникнуть в производственную базу данных и получить решения напрямую. Обе команды по обеспечению безопасности обнаружили уязвимость независимо друг от друга до того, как объединили усилия, и совместное расследование продолжается. (OpenAI сообщила о прокси-уязвимости поставщику.)

Большинство систем защиты не рассчитаны на подобные угрозы

В нашей серии исследований «ИИ-изгои» за 2024 год компания TrendAI™ описала три категории систем искусственного интеллекта, которые действуют вопреки намерениям своих операторов: злонамеренные «ИИ-изгои», намеренно внедряемые злоумышленниками; «ИИ-изгои» по ошибке, которые сбиваются с курса из-за того, что им предоставлена большая свобода действий, чем та, на которую рассчитана их среда; и «ИИ-изгои», захваченные в результате джейлбрейка или внедрения промпта. Обратите внимание, что термин «ИИ-изгой» не обязательно означает, что модель стала враждебной или самосознающей. Скорее, это означает, что система искусственного интеллекта действует вопреки намерениям оператора, и этот инцидент — хрестоматийный пример.

Агент, который сам отклоняется от курса, напоминает инсайдерскую угрозу, а агент, которого взломали, — скомпрометированную учетную запись. Для борьбы с обеими угрозами существуют специальные инструменты. Разница в скорости. Инсайдеры и скомпрометированные учетные записи действуют со скоростью человека, оставляя защитнику время на реакцию; агенты действуют со скоростью графического процессора, поэтому сама защита должна быть агентской.

Этот инцидент — пример случайного «изгоя» в производственном масштабе. Эти модели не были взломаны и не использовались со злым умыслом. Вместо этого OpenAI намеренно ослабила ограничения, чтобы оценить их возможности, и модели воспользовались этой свободой, чтобы решить задачу так, как никто не предполагал, — в каком-то смысле они «обманули» тест, а не провалили его.

Если посмотреть на ситуацию с точки зрения пострадавшей организации, то на момент, когда Hugging Face сообщила о взломе 16 июля, компания еще не знала, чья модель стояла за атакой. В собственном посте компании говорится, что использованная языковая модель «до сих пор не идентифицирована», и отмечается, что действия соответствовали давно прогнозируемому сценарию «агентурного злоумышленника»: более 17 000 зафиксированных действий, выполненных в рое недолговечных «песочниц» за выходные, с самоперемещающимися центрами управления и контроля (C&C), расположенными в общедоступных сервисах. Hugging Face привлекла сторонних специалистов по криминалистической экспертизе и сообщила об инциденте в правоохранительные органы. В течение пяти дней Hugging Face реагировала совершенно обоснованно, как будто подверглась атаке.

С точки зрения обороняющейся стороны, случайный нарушитель неотличим от враждебно настроенного. В конце концов, намерения невидимы для телеметрии, проявляется только поведение. Но более явное отличие от группы злоумышленников-людей — это масштаб: более 17 000 действий, зафиксированных Hugging Face за одни выходные, — это темп, который не смогла бы выдержать ни одна команда людей, и с которым не сравнится ни одна защита, основанная на скорости реакции человека. Тактика была знакомой — разведка и обход с флангов; настоящая проблема — в объеме и скорости.

У этого паттерна есть прецедент. В собственной карточке модели o1 OpenAI, опубликованной в 2024 году, описана более простая версия того же поведения: во время упражнения по захвату флага модель столкнулась с неработающим контейнером, который не смогла исправить, поэтому она использовала Docker API, чтобы запустить собственную копию и считать ответ прямо из логов.

Что разработчикам и операторам ИИ следует делать по-другому

Почти все, что делают эти модели, не вызывает срабатывания традиционных средств защиты, и причина кроется в их структуре: инструменты, основанные на сигнатурах и уязвимостях, предназначены для выявления заведомо вредоносной активности. Агент ИИ, использующий собственные учетные данные и доступ к инструментам для проникновения в системы, куда ему не следует, не выглядит как вредоносное ПО, потому что таковым не является. Таким образом, можно с уверенностью предположить, что способная к саморазвитию модель может выйти за пределы «песочницы», предназначенной для ее сдерживания, поэтому меры безопасности должны быть направлены на то, что она делает после выхода из «песочницы», а не на то, чтобы удержать ее внутри.

Для защиты агентного ИИ требуется другой набор средств контроля:

  • Команды по обеспечению безопасности должны тестировать своих агентов на проникновение до их запуска. Адаптивное тестирование на атаки (внедрение команд, кража данных, обход аутентификации) позволяет выявить уязвимые места агента до его развертывания, а не после.
  • Защитникам следует следить за тем, что на самом деле делают агенты во время выполнения. Важные сигналы (неожиданные вызовы инструментов, подключения к новым хостам, передача данных за пределы предполагаемой области действия) проявляются в поведении самого агента, а не в отдельной вредоносной программе.
  • Команды должны рассматривать каждого агента и подключенный к нему инструмент как ценный актив. Никто не сможет выявить, что агент действует за пределами своей области ответственности, без точного списка существующих агентов, того, что им разрешено делать, и оценки рисков для каждого из них.
  • Компаниям следует относиться к средам с пониженными требованиями к безопасности как к зонам повышенного риска. «Песочницы» для тестирования, «красные команды» и агентные пилотные проекты, в которых намеренно устраняются средства контроля безопасности, требуют более строгой изоляции и мониторинга, чем производственные системы.

Что этот инцидент говорит защитникам

Если отбросить новизну, то этот инцидент представлял собой последовательность сетевых событий. Как и в случае с «красной командой» или продвинутой постоянной угрозой (Advanced Persistent Threat, APT), злоумышленнику сначала нужно было провести разведку окружающих систем, и первой целью стал прокси-сервер. Ему нужно было идентифицировать этот прокси-сервер, затем найти существующий эксплойт или (в данном случае) создать его и протестировать на целевом устройстве, что оставляло открытым вопрос о том, сколько проб и ошибок потребуется. Все эти проверки проводились в собственной изолированной среде выполнения кода, и ни одна из них не была отмечена как подозрительная.

Именно здесь TrendAI™ Deep Discovery™ Inspector в сочетании с моделями обнаружения TrendAI Vision One™ помог бы выявить разведку, а TrendAI Vision One™ — аномальную активность. Например, агентные системы и большие языковые модели вызывают инструменты через API, интерфейсы командной строки и MCP, которые настроены и разрешены к использованию. Напротив, следует обращать внимание на нестандартные агентные протоколы или инструменты.

Первой целью моделей после выхода из «песочницы» был доступ в интернет. Все последующие шаги (повышение привилегий, горизонтальное перемещение, переход к удаленной цели, получение данных из производственной базы данных другой компании) осуществлялись через сеть. Именно там становится заметной активность автономного ИИ и там же ее можно контролировать. Агент ИИ может не выглядеть как вредоносное ПО на конечной точке, но он не может скрыть свой трафик. Тщательный анализ сетевой активности (как входящей, так и исходящей) позволяет выявить именно те сигналы, которые генерировал этот инцидент на каждом этапе: неожиданные попытки выхода за пределы сети, горизонтальное перемещение между средами и подключения к системам, к которым агент не должен иметь доступа.

Ни один отдельный элемент контроля не способен выявить агентов, подобных тем, что участвовали в этом инциденте. У них есть действительные учетные данные, они используют собственные одобренные инструменты и могут эксплуатировать уязвимости нулевого дня, которые не выявляются сигнатурами, поэтому защита должна быть многоуровневой, а поскольку злоумышленник действует со скоростью машины, у человека не остается времени на отслеживание каждого действия, поэтому защита должна быть автоматизирована.

  • Тестируйте агентов перед их запуском (TrendAI Vision One™ AI Application Security). Модели OpenAI были протестированы с отключенными классификаторами безопасности и без состязательного тестирования самой границы «песочницы». Предварительное тестирование с участием «красной команды» в рамках AI Application Security имитирует атаки, с которыми приложения и агенты на основе ИИ столкнутся в производственной среде: внедрение подсказок, кража данных, обход аутентификации, джейлбрейк. Это позволяет выявить такие сценарии сбоев, как в данном инциденте, когда агент, получивший свободу действий, находит путь, которого никто не ожидал, до того, как его развертывание подвергнет риску реальную инфраструктуру. Ограничения должны быть установлены для любого программного обеспечения или агентов, обращающихся к большим языковым моделям, а не только для людей, использующих чат-ботов, потому что проблема не только в подстановке подсказок. Правильная политика также позволяет выявлять отклонения от первоначальной цели.
  • Ловите инцидент по мере его развития (TrendAI Vision One™ Agentic SIEM). В этом инциденте предупреждающие сигналы были реальными, но разрозненными: украденные учетные данные, повторно используемые в разных средах, внезапный переход в открытый интернет и доступ к системам, к которым у моделей не должно было быть доступа. Каждый из этих сигналов попадал в отдельный блок контроля. Agentic SIEM собирает телеметрию из смежных блоков контроля, таких как идентификация, контроль доступа, брандмауэр и прокси-сервер, и сопоставляет эти сигналы, чтобы определить, что происходит инцидент. После этого автоматические ответы и сценарии TrendAI Vision One™ могут изолировать затронутые системы или заблокировать скомпрометированные учетные записи.
  • Найдите пути атаки до того, как агент свяжет их воедино [TrendAI Vision One™ Cyber Risk Exposure Management (CREM)]. Прокси-атака нулевого дня была чем-то новым. После этого все свелось к уязвимостям в инфраструктуре: избыточно привилегированным служебным учетным записям, отсутствию сегментации между «песочницей» и производственной средой, учетным данным, которые позволяли переходить из одной среды в другую. Функция прогнозирования пути атаки в CREM ежедневно отображает эти многоэтапные цепочки, выявляя уязвимые точки входа, пути горизонтального перемещения (на основе телеметрии конечных точек, сети, идентификационных данных и облачных сервисов) и наиболее ценные цели, до которых может добраться злоумышленник или автономный агент. CREM for Cloud обеспечивает непрерывное обнаружение неправильных конфигураций в облачных средах, выявляя разрешающие сетевые правила, которые позволяют изолированной «песочнице» выходить в открытый интернет.

Один из уроков коснулся самих специалистов по реагированию на инциденты. Когда команда криминалистов Hugging Face попыталась проанализировать журнал действий злоумышленника (реальные эксплойты, команды и артефакты командных серверов), используя передовые модели, работающие через коммерческие API, она столкнулась с блокировкой: системы безопасности провайдеров не могут отличить специалиста по реагированию на инциденты от злоумышленника. Команда завершила анализ с помощью модели с открытым исходным кодом, работающей на собственной инфраструктуре, которая также не позволяла данным и учетным данным злоумышленника покидать ее среду. Все это не является аргументом против ограничений. Урок состоит в том, чтобы заранее, а не в разгар инцидента, определить, на какие инструменты искусственного интеллекта может положиться группа реагирования, когда анализируемые ею данные носят враждебный характер.

Это не последний подобный случай

Каждое улучшение возможностей передовых моделей — это шаг вперед именно в том, что касается долгосрочного многоэтапного решения проблем, которое и привело к этому взлому. Скорее всего, и другие модели будут находить творческие, несанкционированные пути к своим целям, независимо от того, будут ли им это предписывать. Обеспечение безопасности ИИ зависит не только от того, как обучается модель, но и от того, как устроены системы вокруг нее. То, как организации изолируют модель, ограничивают ее возможности, устанавливают правила, по которым она работает, и следят за тем, что она делает на самом деле, не менее важно, чем согласованность, заложенная в саму модель.

Обнаружение тоже должно измениться. Злоумышленник, использующий искусственный интеллект, никогда не попадает в сигнатуру, поэтому единственный надежный способ его обнаружить — это поведение: то, что агент делает в сети, пока он это делает. А поскольку агенты действуют со скоростью машины, обнаружение должно идти в ногу со временем, сопоставляя сигналы, поступающие от идентификатора, сети и облака, в режиме реального времени и отслеживая пути, которые может проложить агент, до того, как он их проложит. Поиск аномального поведения, а не заведомо вредоносного кода — вот что превращает в видимое вторжение, которое может обнаружить защитник.

Это также самое очевидное доказательство сдвига, который отслеживает TrendAI™: ИИ теперь обнаруживает реальные уязвимости со скоростью машины, а модели, использованные в этом инциденте, выявили уязвимости нулевого дня, о которых не знал ни один исследователь. По мере ускорения процесса обнаружения уязвимостей преимущество будет у того, кто сможет расставить приоритеты и устранить проблемы с той же скоростью. Организации, которые будут относиться к ИИ-агентам как к чему-то, что нужно отслеживать, а не просто внедрять, получат реальный ответ, когда столкнутся с подобной ситуацией.

В конечном счете эти системы учатся у людей. ИИ обучается на человеческом поведении, а люди постоянно ищут преимущества. Вся система правил в обществе существует для того, чтобы сдерживать этот импульс. Дайте модели цель и ограниченные ресурсы, и она сделает то же самое: найдет любой путь, который даст ей преимущество, санкционированный или нет. Именно такое поведение теперь должны учитывать защитники.


Телеграм: t.me/ainewsline

Источник: www.trendaisecurity.com

Комментарии: