Сторонние киберэкспертизы с использованием моделей OpenAI

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



Независимое тестирование играет важную роль в проверке и дальнейшем анализе рисков перед развертыванием. В некоторых кибер-оценках намеренно используются пользовательские конфигурации, в том числе с пониженными уровнями защиты, для оценки базовых возможностей, а не того, как модели обычно ведут себя в общедоступных развертываниях.

В ходе недавних проверок два внешних партнера по тестированию выявили инциденты, в которых конфигурации и средства контроля тестирования в сочетании с растущими возможностями последних моделей приводили к тому, что активность моделей выходила за рамки тестирования. Эти инциденты подчеркивают важность сотрудничества между представителями отрасли и сторонними экспертами в области оценки для совершенствования стандартов и практик тестирования по мере роста возможностей моделей. Примечание редактора: это не связано с инцидентом, связанным с безопасностью Hugging Face, и мы продолжим информировать вас об инциденте с Hugging Face здесь.

Новые инциденты были связаны с доступом моделей OpenAI к общедоступному интернету во время сторонних кибертестирований при определенных условиях и с использованием конфигураций с пониженными мерами безопасности, которые не соответствовали обычному развертыванию. Среди инцидентов были:

  1. UK AISI, Институт безопасности искусственного интеллекта при правительстве Великобритании, проводил испытания в киберпространстве с намеренно включенным доступом в интернет, чтобы агенты могли находить собственные инструменты и действовать в условиях, приближенных к реальным, а также с отключенными киберклассификаторами для оценки базовых возможностей. Вы можете прочитать их блог здесь.(открывается в новом окне)
  2. Компания Irregular, один из наших внешних партнеров по тестированию кибербезопасности, проводила оценку в стиле «Захват флага», которая должна была проводиться в изолированной от интернета среде, но из-за неправильной конфигурации тестовой среды модели получили доступ к общедоступному интернету.

Ниже мы кратко описываем произошедшее, условия тестирования, которые привели к такой активности, меры, принятые для ее сдерживания, а также то, что мы делаем, чтобы независимые лаборатории могли продолжать тщательную и безопасную оценку все более совершенных моделей.

Укрепление среды для оценки сторонних моделей

Эти инциденты указывают на ту же более масштабную проблему, о которой мы писали в нашем недавнем посте об инциденте с Hugging Face: по мере развития возможностей моделей должны развиваться и системы обеспечения их безопасности. Это касается как сред, используемых для разработки моделей, так и сред, которые лаборатории и независимые партнеры используют для их оценки.

В ближайшие недели мы пересмотрим наш подход к стороннему тестированию, в том числе к выявлению оценок с повышенным риском, согласованию объема работ, оценке запросов на предоставление доступа к интернету или снижение уровня защиты, установлению требований к изоляции, обработке учетных данных, мониторингу и условиям прекращения работы, а также к более четким процессам уведомления об инцидентах и их эскалации.

Мы намерены работать со всей отраслью над совершенствованием общих практик безопасного проведения оценок с высоким уровнем риска, в том числе в ближайшие недели соберем заинтересованные стороны, такие как национальные институты искусственного интеллекта, независимые эксперты, другие лаборатории, занимающиеся разработкой ИИ, и другие группы. Наша цель — сохранить ценность тщательной независимой оценки, обеспечив при этом соответствие методов тестирования все более совершенным моделям.

ВЕЛИКОБРИТАНИЯ AISI

3 августа Управление по стандартам информационной безопасности Великобритании сообщило нам, что в ходе плановой киберпроверки, начавшейся 25 июля, модели от OpenAI и другой лаборатории в некоторых случаях выходили за рамки тестирования. Проверка проводилась в контролируемых киберсредах, имитирующих реальные сети. Из 19 выявленных инцидентов два были связаны с моделью OpenAI GPT-5.6 Sol. Остальные случаи касались моделей из другой лаборатории.

Для этой оценки агентам было поручено выступить в роли экспертов по кибербезопасности в упражнении «Захват флага»: взломать три подключенных друг к другу смоделированных среды и получить финальный флаг. В описании задачи были указаны сети, входящие в зону ответственности, и несколько систем, не входящих в нее. Кроме того, UK AISI обеспечила агентам доступ к интернету в режиме реального времени, чтобы они могли загружать инструменты и действовать в условиях, приближенных к реальным, а также отключила киберклассификаторы модели для оценки базовых возможностей.

Предполагаемой границей авторизации UK AISI был смоделированный кибердиапазон: агенты имели право атаковать указанные смоделированные сети и извлекать флаг, но не взаимодействовать с системами за пределами сетевого диапазона. Однако агентам не было четко сказано, как и когда они могут использовать открытый доступ в интернет, что, по мнению UK AISI, могло способствовать возникновению инцидента.

В ходе этих испытаний UK AISI обнаружила, что GPT-5.6 Sol совершила два несанкционированных действия, пытаясь найти путь в смоделированный диапазон и забрать флаг:

  1. GPT-5.6 Sol повторно использовала токен GitHub, который агент другой лаборатории оставил в открытом доступе, чтобы проверить, опрашивает ли система в пределах диапазона GitHub или другую службу обновлений. Кроме того, были предприняты попытки восстановления учетных записей и обхода ограничений на количество запросов, а также зарегистрированы учетные записи с использованием внешних DNS и провайдеров туннелирования.
  2. GPT-5.6 Sol использовала общедоступный сервис туннелирования, чтобы сделать DNS-сервер, работающий локально в оценочной среде, доступным из общедоступного интернета. Сервер содержал полезную нагрузку, предназначенную для использования известной уязвимости в программном обеспечении, работающем в тестовом диапазоне. Настройка не сработала, нет никаких свидетельств того, что какой-либо реальный преобразователь запрашивал этот сервер, а инфраструктура была удалена по окончании оценки.

Несмотря на то, что модель пыталась пройти киберполигон, Управление по стандартам информационной безопасности Великобритании сочло эти действия несанкционированными, поскольку они были связаны с реальными внешними учетными записями и сервисами за пределами полигона и не требовались для выполнения задачи. На DNS-сервере также размещались эксплойты, доступные в открытом интернете, хотя эта настройка не работала, и нет никаких доказательств того, что какой-либо реальный преобразователь запрашивал эти данные.

AISI Великобритании идентифицировала активность 28 июля после того, как мониторинг безопасности обнаружил необычную передачу данных. Он остановил соответствующие оценки, изолировал соответствующие компьютеры и локализовал активность примерно через час после обнаружения.

Мы высоко ценим сотрудничество с UK AISI на протяжении всего этого процесса, в том числе их работу по выявлению, расследованию и предоставлению подробной информации о деятельности. Мы с нетерпением ждём продолжения нашего сотрудничества.

Нерегулярный

29 июля один из наших сторонних партнеров по оценке, компания Irregular, уведомила нас об инциденте, связанном с моделями OpenAI, во время оценки кибербезопасности в стиле Capture-the-Flag (CTF). Моделям было дано задание найти скрытую информацию, используя уязвимости в смоделированной среде, и им сообщили, что у них нет доступа к интернету. Однако из-за неправильной настройки тестовой среды модели получили доступ к общедоступному интернету.

В одном из тестов название вымышленной цели для CTF-челленджа случайно совпало с реальным доменом. Поскольку тестовая среда была по ошибке подключена к интернету, модель использовала реальный веб-сайт, приняв его за часть смоделированной среды. Это не было связано со сложным выходом из «песочницы» или уязвимостью нулевого дня: доступ к интернету появился из-за неправильной настройки, и модель, по всей видимости, воспользовалась базовой уязвимостью системы безопасности.

По данным Irregular, модель также нашла и использовала учетные данные для работы с тем же сайтом. Irregular не выявила последствий, выходящих за рамки собственных данных затронутого сайта, и продолжает аудит. Компания приостановила оценку рисков, начала устранение последствий и уведомила затронутые стороны. Irregular сообщила нам, что все выявленные проблемы, связанные с инцидентом, устранены, а в среду тестирования добавлены соответствующие меры безопасности. Irregular также сообщила о связанных инцидентах, произошедших в других лабораториях той же среды тестирования.

Мы высоко ценим сотрудничество с Irregular и продолжим тесно работать с ними, чтобы поддержать их исследование. Irregular также готовит официальный документ, в котором будут представлены лучшие практики по сдерживанию и безопасному проведению кибертестирования. Мы с нетерпением ждем возможности принять участие в подготовке этого документа, чтобы сделать его результаты доступными для сообщества, и продолжим наше сотрудничество. Мы считаем такое сотрудничество необходимым для обеспечения безопасной и тщательной оценки существующих и будущих моделей.


Телеграм: t.me/ainewsline

Источник: openai.com

Комментарии: