77% против 31%: новый Gemini 3.1 Pro уничтожил предшественника в тестах, но догонит ли он в реальных задачах?

77% против 31%: новый Gemini 3.1 Pro уничтожил предшественника в тестах, но догонит ли он в реальных задачах?

Arkadiy Andrienko

Google сделала очередной шаг в развитии своих больших языковых моделей, представив обновление для своего самого мощного инструмента — Gemini 3.1 Pro. Главная фишка обновления — это прокачка так называемых «рассуждающих» способностей. Нейросеть стала гораздо лучше справляться с задачами, где нельзя просто выдать факт из базы данных, а нужно выстроить сложную логическую цепочку, провести анализ или решить нестандартную проблему.

В Google традиционно ссылаются на результаты бенчмарков и в этот раз в качестве мерила выступил тест ARC-AGI-2. Если не углубляться в технические дебри, то этот бенчмарк создан для того, чтобы проверять, насколько ИИ способен справляться с абсолютно новыми для него логическими головоломками, а не просто узнавать знакомые паттерны. Предыдущая версия, Gemini 3 Pro, набрала в этом испытании 31%. новая же итерация показала результат в 77%. Рост более чем в два раза — это серьезный скачок, который вряд ли останется незамеченным. В компании заявляют, что их флагман предназначен для тех самых случаев, когда «простого ответа недостаточно»: будь то многоэтапное исследование, синтез данных из кучи разрозненных источников или визуализация сложных концепций.

Помимо «мозгов», модель прокачали и в творческих задачах. Разработчики улучшили качество генерации анимированной графики. Теперь по текстовому запросу Gemini 3.1 Pro умеет создавать сложные анимированные SVG-изображения. Фишка тут не только в красоте, но и в технологичности. Такие файлы хранятся не как «тяжелое» видео, а как легкий код, который при этом остается четким и не теряет в качестве, даже если увеличить картинку до размеров рекламного билборда. Для веб-дизайнеров и разработчиков, которые ищут способы украсить сайт без ущерба для скорости загрузки, это может стать настоящей находкой.

Обновление уже начали раскатывать по платформам компании, но правда, с доступом есть нюансы. В превью-режиме модель получили обладатели платных подписок Google AI Pro и Ultra — они могут опробовать новинку как в самом приложении Gemini, так и в сервисе NotebookLM. Разработчики тоже не остались в стороне: доступ к Gemini 3.1 Pro в режиме предварительного просмотра открыт через Google AI Studio, платформу Antigravity (которая ориентирована на создание агентов), а также через Vertex AI для корпоративных клиентов.

77% против 31%: новый Gemini 3.1 Pro уничтожил предшественника в тестах, но догонит ли он в реальных задачах?

В Google подчеркивают, что это пока «превью», чтобы собрать обратную связь и доработать механизмы перед полноценным релизом. Судя по темпам, с которыми компания обновляет свои модели в последнее время, ждать «стабильную» версию долго не придется.

А как вы думаете, в какой сфере усиление логических способностей ИИ принесет больше пользы, и не приведет ли это к тому, что сложные задачи мы начнем перекладывать на нейросети слишком бездумно? Делитесь мнением в комментариях.

🐧 Симулятор поднимателя пингвинов, но это психологический триллер — в Steam вышла Penguin Lifter
    Об авторе
    Комментарии4