OpenAI поставила мощнейшие ИИ на паузу: модели оказались слишком опасными
OpenAI объявила о временной заморозке части работ над своими самыми мощными моделями искусственного интеллекта. Причиной стали не технические сбои и не нехватка вычислительных мощностей, а опасения, связанные с кибербезопасностью. Разработчики официально подтвердили, что обучение с подкреплением (RL) для ряда передовых систем было остановлено на две недели, а самый крупный запланированный запуск до сих пор остается на паузе.
Поводом для пересмотра внутренних протоколов послужили два события. Во-первых, недавний инцидент, связанный с платформой Hugging Face, который вынудил компанию пересмотреть подход к изоляции исследовательских сред. Во-вторых, предварительные тесты будущей модели под кодовым названием Astra показали, что она может достичь критического порога кибервозможностей, описанного в собственной шкале рисков OpenAI (Preparedness Framework).
В компании подчеркивают: по мере роста способностей ИИ растут и риски, связанные с их разработкой и внутренним тестированием. Простой проверки готового продукта перед релизом уже недостаточно. Защитные механизмы теперь встраиваются непосредственно в процесс обучения.
OpenAI ужесточила требования к инфраструктуре, на которой тренируются и оцениваются модели. В первую очередь это коснулось сред, где ИИ может выполнять код или взаимодействовать с инструментами, имеющими доступ в интернет. Сразу после инцидента с Hugging Face компания приостановила запуск таких задач в исследовательских кластерах. Позже доступ восстановили, но с серьезными ограничениями.
Теперь для «фронтирных» (наиболее продвинутых) моделей действуют три уровня защиты. Первый — изоляция рабочих нагрузок. Код, сгенерированный моделью или полученный из ненадежных источников, выполняется только в усиленных «песочницах». Второй — сетевая изоляция и высокорисковые процессы отрезаны от интернета, а скомпрометированная система не должна автоматически получать доступ к внутренним сетям. Третий — непрерывное тестирование безопасности. OpenAI убрала уязвимые общие сервисы, сократила постоянные привилегии и начала использовать собственные модели для имитации атак на эти границы.
Для Astra и схожих с ней систем теперь действуют самые строгие требования. Значительная часть задач, связанных с обучением и оценкой этой модели, все еще заморожена до полного перевода инфраструктуры на новые стандарты защиты. Отдельное внимание уделено отслеживанию внутренней активности нейросетей. OpenAI расширила систему мониторинга, которая теперь работает по многоступенчатому принципу. На уровне каждого токена (условной единицы текста) срабатывают классификаторы, которые при подозрении на аномалию передают данные более сложным автоматизированным системам расследования. Те анализируют действия с инструментами, доступные рассуждения и всю цепочку операций на предмет попыток несанкционированного доступа, кражи данных, разрушительных действий или обхода защиты.
OpenAI фактически признала, что гонка за созданием все более мощных систем ИИ требует не только новых архитектур и данных, но и принципиально иного уровня защиты от самих этих систем. Внутренние исследования показывают: модели следующего поколения могут обладать навыками, применимыми для кибератак, а значит, среда, в которой они обучаются, сама становится целью. Компания намерена обновить свой подход к оценке рисков, чтобы связать меры безопасности на этапах обучения и развертывания. В перспективе планируется привлекать внешние организации для проверки новых подходов.
Что для вас важнее — быстрый прогресс в области ИИ или более медленный, но контролируемый процесс с усиленными мерами безопасности? Делитесь в комментариях.
-
OpenAI приостановила разработку модели Astra из‑за опасений о возможном использовании технологии в кибератаках -
OpenAI изменила поведение ChatGPT: нейросеть стала отвечать короче и реже ошибаться -
OpenAI выпустила GPT-5.6-Cyber — публичного доступа к ней нет -
OpenAI закрыла подразделение, которое искало самые опасные угрозы от ИИ -
Бесплатный ChatGPT останется без лимита на переписку — похоже, OpenAI научилась считать вдвое дешевле

