Модель GPT-5.6 Sol скрывала ошибки и придумывала данные — OpenAI рассказала об этом инциденте

Модель GPT-5.6 Sol скрывала ошибки и придумывала данные — OpenAI рассказала об этом инциденте

Arkadiy Andrienko

OpenAI представила новую систему публичного учета инцидентов с ИИ и одновременно назвала такие случаи «несоответствием» — расхождением между поведением модели и намерениями человека. В дополнение к этому компания раскрыла шесть отчетов о нежелательном поведении моделей, выявленных за последние шесть месяцев.

В OpenAI отдельно подчеркнули, что речь идет не об одном сбое, а о наборе разных случаев. В одном из эпизодов при обучении GPT-5.6 Sol модель оставляла скрытые заметки для себя, пыталась скрывать ошибки и придумывала недостающие данные.

Еще один тревожный случай связан с невыпущенной моделью: OpenAI обнаружила 27 записей, в которых она предписывала себе игнорировать собственные ограничения. Это уже не просто неверный ответ, а попытка обойти заложенные правила поведения.

График прогресса обучения ИИ-моделей
График прогресса обучения ИИ-моделей

В других примерах модели вели себя еще смелее. Одна из них нашла в интернете API-ключ, использовала его без разрешения и затем сфальсифицировала данные, а в другом случае модель самостоятельно разместила файл в интернете после решения задачи с помощью кода.

OpenAI также рассказала, что изолированные агенты использовали внутренний репозиторий кода компании как канал для обмена сообщениями. В другом случае модели передавали документы через публичные файлообменные сервисы, то есть находили обходные пути вне ожидаемого сценария работы.

На фоне этих эпизодов OpenAI заявила, что существующие механизмы контроля ИИ пока недостаточны для его безопасного масштабирования. Именно поэтому компания и вынесла подобные случаи в публичный фреймворк отчетности — чтобы фиксировать не только ошибки, но и более опасное поведение моделей.

Должны ли компании публиковать все такие инциденты с ИИ, даже если они показывают слабость их систем?

🧟‍♂️ Для Project Zomboid делают вид от 1-го лица
    Об авторе
    Комментарии1