Gemini 3.5 Flash: быстрее прошлого Pro и втрое дороже прежнего Flash

На Google I/O 2026 показали Gemini 3.5. Flash доступен сразу и обгоняет Gemini 3.1 Pro на кодовых и агентных бенчмарках, но в API он стоит $1.50/$9 за миллион токенов против $0.50/$3 у Gemini 3 Flash.

DB
DBG · по материалам Google Blog
0

19 мая на Google I/O 2026 Google представила семейство Gemini 3.5. Flash вышел сразу, Pro обещают выкатить в течение следующего месяца. Главный тезис анонса: младшая модель нового поколения обходит старший Pro предыдущего — на Terminal-Bench 2.1 у Gemini 3.5 Flash 76,2%, на MCP Atlas 83,6%, на GDPval-AA 1656 Elo, на CharXiv Reasoning 84,2%. По скорости выдачи токенов Google заявляет четырёхкратное преимущество над другими frontier-моделями.

Для разработчиков модель доступна через Gemini API в Google AI Studio и Android Studio, в агентной среде Antigravity и в Gemini Enterprise; в потребительских продуктах — в приложении Gemini и в AI Mode поиска. Вокруг модели Google выкатила и остальной инструментарий: Antigravity 2.0 с CLI и SDK, Managed Agents прямо в Gemini API, а также WebMCP — предложение веб-стандарта, который позволяет странице объявлять инструменты (JS-функции, HTML-формы) для браузерных агентов; origin trial стартует в Chrome 149.

Отдельная история — прайс. По официальному прайс-листу Gemini API, Gemini 3.5 Flash стоит $1.50 за миллион входных токенов и $9.00 за миллион выходных (thinking-токены считаются как выходные). У Gemini 3 Flash Preview это было $0.50 и $3.00. То есть «дешёвая» линейка подорожала втрое, и старое интуитивное правило «Flash — это то, чем затыкают массовые запросы» больше не работает по умолчанию.

Что это значит на практике. Если у вас на Gemini 3 Flash висит пайплайн классификации, извлечения полей или суммаризации — простая замена идентификатора модели утроит счёт при том же трафике. Обратный случай: если вы держали Pro-класс ради агентных сценариев с длинными цепочками tool-call, переезд на 3.5 Flash может дать экономию при сопоставимом качестве. Универсального ответа нет, решает замер на своих задачах.

Практические выводы: во-первых, гоняйте A/B на собственном эвал-сете, а не на чужих бенчмарках — Terminal-Bench и MCP Atlas почти ничего не говорят про качество на вашем домене. Во-вторых, следите за thinking-токенами: они тарифицируются как выход, и на $9 за миллион неконтролируемый «долгий рассуждающий» режим быстро превращается в неприятный счёт. В-третьих, не спешите выпиливать Gemini 3 Flash из конфигов — для дешёвых массовых задач он остаётся в прайсе и в четыре раза дешевле нового поколения.

Комментарии