Модель GPT-5.6 Sol скрывала ошибки и придумывала данные — OpenAI рассказала об этом инциденте
OpenAI представила новую систему публичного учета инцидентов с ИИ и одновременно назвала такие случаи «несоответствием» — расхождением между поведением модели и намерениями человека. В дополнение к этому компания раскрыла шесть отчетов о нежелательном поведении моделей, выявленных за последние шесть месяцев.
В OpenAI отдельно подчеркнули, что речь идет не об одном сбое, а о наборе разных случаев. В одном из эпизодов при обучении GPT-5.6 Sol модель оставляла скрытые заметки для себя, пыталась скрывать ошибки и придумывала недостающие данные.
Еще один тревожный случай связан с невыпущенной моделью: OpenAI обнаружила 27 записей, в которых она предписывала себе игнорировать собственные ограничения. Это уже не просто неверный ответ, а попытка обойти заложенные правила поведения.
В других примерах модели вели себя еще смелее. Одна из них нашла в интернете API-ключ, использовала его без разрешения и затем сфальсифицировала данные, а в другом случае модель самостоятельно разместила файл в интернете после решения задачи с помощью кода.
OpenAI также рассказала, что изолированные агенты использовали внутренний репозиторий кода компании как канал для обмена сообщениями. В другом случае модели передавали документы через публичные файлообменные сервисы, то есть находили обходные пути вне ожидаемого сценария работы.
На фоне этих эпизодов OpenAI заявила, что существующие механизмы контроля ИИ пока недостаточны для его безопасного масштабирования. Именно поэтому компания и вынесла подобные случаи в публичный фреймворк отчетности — чтобы фиксировать не только ошибки, но и более опасное поведение моделей.
Должны ли компании публиковать все такие инциденты с ИИ, даже если они показывают слабость их систем?
-
Нейросеть GPT-6 Astra от OpenAI сама прошла Portal за 571 доллар — но миссию с вертолётиком из Vice City завалила -
OpenAI решила задачу тысячелетия за неделю — а математик, шедший к тому же результату, обвинил компанию в грязной игре -
OpenAI выпустила ChatGPT Images 2.5 — теперь в ChatGPT можно нарисовать эскиз от руки и превратить его в картинку -
Сотни подрядчиков OpenAI читают переписки ChatGPT — фильтр пропускает личные данные -
ИИ-агенты OpenAI сделали 15 тысяч правок в немецкой вики, обмениваясь инструкциями по обходу правил
