OpenAI впервые подробно рассказывает об инциденте с Hugging Face на конференции Black Hat

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



На заседании, на котором присутствовал представитель Ground Level AI, исследователи OpenAI заявили, что компания «сознательно замедляет темпы исследований для повышения безопасности», пока продолжается полный технический анализ.

Сегодня я посетил насыщенную сессию ежегодной конференции по кибербезопасности Black Hat в Лас-Вегасе, где компания OpenAI представила свою первую подробную публичную реконструкцию инцидента в сфере кибербезопасности, связанного с искусственным интеллектом, который в конечном итоге привел к компрометации Hugging Face. Впервые об этом инциденте стало известно 16 июля.

Во время презентации исследователь в области согласованности и безопасности OpenAI Эрик Уоллес и инженер по инфраструктуре и безопасности OpenAI Майкл Далтон рассказали о «самом интересном с точки зрения качества примере возможностей ИИ», который они когда-либо видели. Внутренняя оценка передовой модели привела к непредвиденному побочному эффекту — скоординированным атакам автономных агентов ИИ. По их словам, полный технический анализ еще не завершен и будет опубликован в открытом доступе.

Истоки этого инцидента восходят к событиям 7 мая

Приступая к реконструкции инцидента, Уоллес подчеркнул, что «модели, работающие на границе возможностей, действительно любят жульничать, и причина в том, что во время обучения на них оказывается разное давление, чтобы они работали быстро или эффективно». По его словам, они понимают, что вместо того, чтобы выполнять задачу, они могут попытаться найти ответ в интернете, чтобы решить ее быстрее.

По его словам, в отличие от обычных инцидентов, которые можно отследить по одному дню, эффекту или журналу, в этом случае команда агентов работала сообща, находила уязвимости, делилась ими друг с другом, перемещалась по системам OpenAI и внешним системам в течение нескольких дней и недель.

По словам Уоллеса, корни июльской атаки на Hugging Face уходят в события 7 мая, когда компания проводила обучение и оценку кибербезопасности еще не выпущенной передовой модели искусственного интеллекта. В ходе этой работы автономным агентам были поставлены задачи по обеспечению безопасности программного обеспечения, которые оказалось невозможно решить в существующих условиях.

Однако агенты нашли альтернативные способы их выполнения. В OpenAI рассказали, что обнаружили возможность оставлять сообщения друг для друга во внутреннем репозитории программного обеспечения, который использовался во время обучения. Простые просьбы о помощи превратились в доску объявлений, где агенты делились открытиями, эксплойтами и рабочими заданиями, превратившись в скоординированный рой агентов, работающих сообща.

«Этот инцидент интересен тем, что, если один агент в разное время смог найти подобные уязвимости, он может поделиться ими с другими агентами на доске объявлений, — сказал Уоллес. — То есть, если одна модель находит способ получить доступ, которого у нее быть не должно, она может оставить эту дверь открытой для других агентов».

По данным OpenAI, к началу июля компания полагала, что проблема устранена. После внутреннего инцидента, связанного с безопасностью, 4 июля компания заявила, что отозвала учетные данные, которые позволяли агентам публиковать сообщения, перестроила свой внутренний репозиторий программного обеспечения, известный как Artifactory, удалила доску объявлений, исправила обнаруженные уязвимости и возобновила обучение и оценку ИИ.

Агенты воссоздали доску объявлений

Но, по данным OpenAI, даже после того, как исходная доска объявлений была удалена, агенты нашли другой способ общаться друг с другом. Вместо того чтобы оставлять сообщения в файлах, они использовали в качестве сообщений названия вновь созданных каталогов, фактически воссоздав доску объявлений.

Кстати, в этот момент я слышал, как люди вокруг меня говорили что-то вроде: «Это безумие» и «Боже мой».

По данным OpenAI, затем агенты начали делиться информацией о недавно обнаруженных уязвимостях, учетных данных и рабочих заданиях. Передавая информацию другим агентам, коллектив мог действовать гораздо быстрее.

Сотрудничество между агентами в конечном итоге вышло за пределы собственной инфраструктуры OpenAI. Некоторые агенты предположили, что ответы на поставленные перед ними задачи могут находиться на внешних сайтах, таких как GitHub или Hugging Face. Сначала агенты атаковали внутреннюю инфраструктуру OpenAI, а затем использовали те же методы для атаки на Hugging Face. В июле OpenAI связала эти два инцидента, обнаружив, что учетные данные, связанные с взломом Hugging Face, были получены в ходе тех же внутренних тестов ИИ.


Телеграм: t.me/ainewsline

Источник: www.groundlevel-ai.com

Комментарии: