OpenAI представила GPT-6 Astra — модель теперь работает за компьютером за вас, заказывает еду и программирует одновременно

OpenAI представила GPT-6 Astra — модель теперь работает за компьютером за вас, заказывает еду и программирует одновременно

Aleksandr Manin

OpenAI представила GPT-6 Astra и называет её самой интеллектуальной и согласованной моделью в мире. Доступ уже открыт части организаций, в ближайшие дни модель получат подписчики ChatGPT Plus, Pro, Business и Enterprise, а также пользователи API. В API она стоит $10 за миллион входных токенов (около 870 рублей) и $50 за миллион выходных (примерно 4350 рублей).

Главная ставка — работа за компьютером. Astra умеет обращаться с браузером, таблицами, сайтами и десктопными приложениями, выполняя многоэтапные задачи, а не выдавая один короткий ответ. В демонстрации модель занималась 3D-моделированием, собирала презентации и параллельно вела несколько дел из разных областей сразу — например, заказывала еду, одновременно программируя игру. Из показанных сценариев также заполнение онлайн-форм, обновление записей в CRM, ведение календаря, веб-исследования и оформление результатов в документы и письма. Сотрудники компании голосом превратили жёлтый круг в ракету, затем в трёхмерную игру, а после оформили объявление на eBay.

Отдельно OpenAI подчёркивает, что модель держит визуальную оценку происходящего и не сползает с изначальной задачи по ходу длинной цепочки действий.

Сравнительная таблица бенчмарков GPT-6 Astra и конкурентов
Сравнительная таблица бенчмарков GPT-6 Astra и конкурентов

Теперь цифры. В ExploitBench, проверяющем умение эксплуатировать уязвимости, Astra выбила 100% — у предыдущей GPT-5.6 Sol было 78,5%. В SRE-Bench на обратную разработку бинарных файлов без исходного кода модель решила 88% задач с первой попытки и 99,2% за четыре, тогда как у Sol было 55,9% и 68,7%. В ARC-AGI-3 на решение незнакомых задач — 98,6%, в Terminal Bench 4.0 на программирование — 57,7%, в Agent's Last Exam на агентные способности — 59,3%.

К показателю ARC-AGI-3 стоит относиться с оговоркой: модели проходят этот тест в разных конфигурациях, и одно только наличие постоянной памяти меняет результат, так что сравнивать напрямую некорректно.

Ещё в августе OpenAI сообщала, что Astra самостоятельно решила или существенно продвинула десять давних математических задач, а результаты проверили в Lean 4.

Любопытный поворот: несмотря на идеальный балл в тестах на взлом, модель специально обучили отказываться от продвинутых задач по кибербезопасности. Заодно усилили устойчивость к попыткам обойти ограничения и улучшили отслеживание злоупотреблений.

Президент OpenAI Грег Брокман (Greg Brockman) считает, что мерить такие модели стоит не токенами. По его словам, рынку нужна цена за выполненную задачу: вопрос в том, справится ли модель за приемлемые деньги и за приемлемое время.

Как у вас с нейросетями в работе — уже доверяете им многоэтапные задачи или пока используете как продвинутый поиск?

⚡️ Path of Exile 2 выйдет из раннего доступа 11 декабря
    Об авторе
    Комментарии0