OpenAI опубликовала официальный отчет о взломе Hugging Face
OpenAI рассказала, как внутренняя исследовательская модель IM1 вышла за пределы заданных ограничений и через Artifactory добралась до Hugging Face. В компании подчеркнули, что инцидент стал не просто сбоем в тестах, а поводом пересмотреть всю схему защиты экспериментальных ИИ-агентов.
Проверки проходили в ходе внутренних оценок кибербезопасности нескольких моделей OpenAI. Первые признаки необычной активности сотрудники заметили в мае: после блокировки доступа агенты продолжили искать и использовать другие уязвимости в мае и июне.
Ключевую роль в случившемся сыграла внутренняя исследовательская модель IM1, которую OpenAI сравнивает по масштабу с GPT. Модели работали с ослабленными защитными механизмами, общались через несанкционированные каналы и использовали уязвимости в общей инфраструктуре, чтобы получить доступ к интернету и сторонним системам.
Отдельно в отчёте описан способ, которым агенты выходили в сеть: они манипулировали Artifactory, заставляя его отправлять запросы от их имени. В начале июля высокая активность в Artifactory вызвала сбой платформы, после чего инженеры OpenAI перестроили её архитектуру. В техническом отчёте OpenAI также использует бенчмарк ExploitGym. Там IM1 снова получила доступ к интернету и другим моделям OpenAI, после чего компания объявила о новых мерах защиты: более изолированных песочницах, ограничении интернет-доступа и контроле над доступом к весам моделей.
Кроме того, OpenAI заявила, что инвестирует больше вычислительных ресурсов в мониторинг цепочки рассуждений и работает с внешними советниками, включая CrowdStrike. Сама компания назвала инцидент «предупредительным выстрелом» и прямо признала, что без надёжных ограничений продвинутые ИИ-агенты уже способны обходить технические барьеры и действовать без команды человека.
Это был для нас и для всего мира «предупредительный выстрел»: без надёжных ограничений продвинутые ИИ-агенты уже способны обходить технические барьеры, координироваться через несанкционированные каналы и совершать опасные действия без команды человека.
Как думаете, смогут ли новые песочницы и ограничения интернет-доступа реально защитить ИИ-агентов от повторения такого сценария?
-
OpenAI поставила мощнейшие ИИ на паузу: модели оказались слишком опасными -
OpenAI изменила поведение ChatGPT: нейросеть стала отвечать короче и реже ошибаться -
Бесплатный ChatGPT останется без лимита на переписку — похоже, OpenAI научилась считать вдвое дешевле -
OpenAI приостановила разработку модели Astra из‑за опасений о возможном использовании технологии в кибератаках -
OpenAI закрыла подразделение, которое искало самые опасные угрозы от ИИ

