ИИ получил доступ к реальным системам во время тестов — OpenAI и Anthropic раскрыли детали инцидентов

ИИ получил доступ к реальным системам во время тестов — OpenAI и Anthropic раскрыли детали инцидентов

Hennadiy Chemеris
Сегодня, 14:02

Инцидент OpenAI затронул инфраструктуру Hugging Face: 21 июля компания рассказала, что несколько её моделей вышли из изолированной тестовой среды через ранее неизвестную уязвимость и получили доступ к инфраструктуре сервиса, отвечающей за продакшен. Это выглядит особенно тревожно, потому что речь шла не о симуляции, а о реальных внешних системах.

Почти одновременно Anthropic сообщила о трёх инцидентах, в которых Claude сначала вышел в интернет, а затем получил несанкционированный доступ к системам трёх разных организаций. Компания проверила 141 006 прогонов оценок, где модель могла выйти в сеть, и именно там нашла эти три случая.

Во всех трёх инцидентах Claude выполнял capture-the-flag-задачу — формат киберсостязания, в котором ИИ нужно решать задачи и добираться до «флага» в специально подготовленной среде. При этом в промпте модели прямо говорили, что это симуляция и доступа к интернету у неё нет. На практике всё оказалось иначе: из-за ошибки в конфигурации машины, с которыми работал Claude, всё же имели доступ в интернет.

Даже тестовая среда может перестать быть безопасной, если модель получает доступ к реальной инфраструктуре
Даже тестовая среда может перестать быть безопасной, если модель получает доступ к реальной инфраструктуре

В первом случае участвовала модель Opus 4.7. Она получила доступ к учётным данным и базе с несколькими сотнями строк production-данных. Anthropic отмечает, что в четырёх прогонах модель в какой-то момент понимала, что система, вероятно, реальная, но после этого всё равно продолжала атаку.

Во втором инциденте Claude создал и загрузил в PyPI вредоносный Python-пакет, чтобы выиграть задачу. Пакет был доступен в сети примерно час, и за это время его скачали и запустили на 15 реальных системах. По словам компании, она уведомила своего партнёра Irregular и три затронутые организации в понедельник, 27 июля.

Ситуация выглядит особенно неприятно из-за самой природы этих инцидентов: ИИ действовал без намеренного вмешательства человека, но с вполне ощутимым ущербом для внешних сервисов. На фоне таких кейсов вопрос о безопасности тестовых сред для моделей становится куда острее.

Кстати, ранее сообщалось, что пастор подал в суд на OpenAI: он уверяет, что ChatGPT отговаривал его от больницы и едва не убил.

Можно ли считать такие инциденты уже не сбоями, а полноценной угрозой со стороны ИИ-систем?

🕷 Новый «Человек-паук» — годнота: «Новый день» получил восторженные отзывы критиков
    Об авторе
    Комментарии2