Gemini 3.8 Flash стоит в семь раз дешевле Claude Opus 5 — и обходит его в тестах на финансы, право и работу с видео
Google представила Gemini 3.8 Flash — уже третью модель линейки Flash за шесть недель. Компания называет её своей самой умной рабочей лошадкой и целит в кодинг, агентные задачи, веб-исследования и автотесты. Занятно другое: модель бюджетного сегмента в восьми бенчмарках обошла флагманы конкурентов, стоящие в разы дороже.
Разница в ценниках действительно велика. Gemini 3.8 Flash стоит 0,75 доллара (около 65 рублей) за миллион входных токенов и 3,75 доллара (примерно 327 рублей) за миллион выходных. У Claude Opus 5 — 5 и 25 долларов, у GPT-5.6 Sol — 4 и 20. То есть речь о семикратной разнице с Opus 5.
С оговоркой: это вводная ставка, которая действует до конца 2026 года. Регулярная цена вдвое выше — 1,50 и 7,50 доллара соответственно. Плюс стоит помнить, что цена за токен и стоимость решения задачи — разные вещи: на сложных запросах модель думает дольше и чаще обращается к инструментам, так что итоговый счёт может оказаться выше ожидаемого.
Где новинка лидирует. Vals Finance Agent v2 на задачи финансового аналитика — 61,4%. Юридический бенчмарк Harvey — 10,0% против 6,7% у Opus 5 и 2,5% у GPT-5.6 Sol; низкие цифры здесь у всех, потому что зачёт ставится только при выполнении абсолютно всех критериев разом. LVBench на понимание длинных видео — 87,8% в агентном режиме против 75,4% у Opus 5, и это самый крупный отрыв. CharXiv Reasoning на работу со сложными графиками — 86,2%. HLE-Verified на экспертные рассуждения — 54,9% против 54,4%. Биологические LABBench2 и BioMysteryBench в сложной категории — 86,2% и 56,5%.
Отдельно стоит Terminal-Bench 2.1, проверяющий, справится ли агент с реальной работой в терминале. Здесь у Gemini 3.8 Flash 89,4% против 89,1% у Opus 5 — формально победа, фактически три десятых процентного пункта.
А вот где модель проигрывает, там проигрывает уже по-крупному. В более сложном Terminal-Bench 4.0 результат составил 19,1% против 51,8% у Claude Opus 5. В OSWorld-2.0 на управление компьютером — 59,0% против 75,4%. В рейтинге GDPVal-AA v2, оценивающем офисную работу, разрыв тоже заметный: 1545 против 1824. В DeepSWE v1 на долгие задачи разработки Gemini набрала 71,0% против 74,0% у Opus 5 и 72,7% у GPT-5.6 Sol.
Картина складывается довольно чёткая. Сильные стороны новинки — мультимодальное понимание, профильные агенты для финансов, права и биологии, а также терминальные задачи средней сложности. Слабые — по-настоящему сложные автономные сценарии и работа с компьютером.
Вместе с основной моделью Google выпустила Gemini 3.8 Flash Cyber для задач кибербезопасности. Она заметно лучше находит уязвимости: по внутренним тестам компании, эффективность выросла на 12% относительно предыдущей версии.
Обе модели уже доступны на основных платформах.
Что для вас важнее при выборе нейросети — максимальные баллы в тестах или соотношение цены и результата?
-
Google усложнила установку APK на Android -
Google заставит разработчиков Android‑приложений оптимизировать потребление оперативной памяти и ресурсов -
Google представила Gemini 3.7 Flash: цена вдвое ниже, результат в DeepSWE вырос до 65,3% -
Android 17 научился бороться с укачиванием: Google добавила необычную функцию

