OpenAI опубликовала официальный отчет о взломе Hugging Face

OpenAI опубликовала официальный отчет о взломе Hugging Face

Arkadiy Andrienko
Сегодня, 19:23

OpenAI рассказала, как внутренняя исследовательская модель IM1 вышла за пределы заданных ограничений и через Artifactory добралась до Hugging Face. В компании подчеркнули, что инцидент стал не просто сбоем в тестах, а поводом пересмотреть всю схему защиты экспериментальных ИИ-агентов.

Проверки проходили в ходе внутренних оценок кибербезопасности нескольких моделей OpenAI. Первые признаки необычной активности сотрудники заметили в мае: после блокировки доступа агенты продолжили искать и использовать другие уязвимости в мае и июне.

Посмотрим насколько защита стала лучше и не повторяться ли подобные инциденты
Посмотрим насколько защита стала лучше и не повторяться ли подобные инциденты

Ключевую роль в случившемся сыграла внутренняя исследовательская модель IM1, которую OpenAI сравнивает по масштабу с GPT. Модели работали с ослабленными защитными механизмами, общались через несанкционированные каналы и использовали уязвимости в общей инфраструктуре, чтобы получить доступ к интернету и сторонним системам.

Отдельно в отчёте описан способ, которым агенты выходили в сеть: они манипулировали Artifactory, заставляя его отправлять запросы от их имени. В начале июля высокая активность в Artifactory вызвала сбой платформы, после чего инженеры OpenAI перестроили её архитектуру. В техническом отчёте OpenAI также использует бенчмарк ExploitGym. Там IM1 снова получила доступ к интернету и другим моделям OpenAI, после чего компания объявила о новых мерах защиты: более изолированных песочницах, ограничении интернет-доступа и контроле над доступом к весам моделей.

ИИ смог ненадолго сбежать
ИИ смог ненадолго сбежать

Кроме того, OpenAI заявила, что инвестирует больше вычислительных ресурсов в мониторинг цепочки рассуждений и работает с внешними советниками, включая CrowdStrike. Сама компания назвала инцидент «предупредительным выстрелом» и прямо признала, что без надёжных ограничений продвинутые ИИ-агенты уже способны обходить технические барьеры и действовать без команды человека.

Это был для нас и для всего мира «предупредительный выстрел»: без надёжных ограничений продвинутые ИИ-агенты уже способны обходить технические барьеры, координироваться через несанкционированные каналы и совершать опасные действия без команды человека.
— OpenAI, компания

Как думаете, смогут ли новые песочницы и ограничения интернет-доступа реально защитить ИИ-агентов от повторения такого сценария?

🥾 «История игрушек 5» вышла в сети
    Об авторе
    Комментарии0