Google не выпускал в этом окне громкой новой модели, зато методично закрывал дыры в Gemini API — и как раз такие изменения обычно и меняют жизнь тех, кто на нём пишет.
4 мая в API появились вебхуки: события можно получать пушем вместо того, чтобы долбить эндпоинт статуса. Работает и для Batch API, и для long-running operations. 5 мая File Search стал мультимодальным — теперь он умеет нативно эмбеддить и искать по изображениям через модель gemini-embedding-2, а в ответе возвращает метаданные визуальных цитат, то есть можно показать пользователю, из какой именно картинки взят ответ.
Сама gemini-embedding-2 вышла в GA 22 апреля — с поддержкой мультимодальных эмбеддингов. Днём раньше, 21 апреля, обновился агент Deep Research: совместное планирование, визуализации, интеграция с MCP-серверами и File Search. Появились два варианта — deep-research-preview-04-2026 (быстрее и дешевле) и deep-research-max-preview-04-2026 (максимально дотошный). Открыл период 15 апреля превью gemini-3.1-flash-tts — недорогая, выразительная и управляемая text-to-speech модель.
Из неприятного: 30 апреля отключили gemini-robotics-er-1.5-preview, мигрировать нужно на gemini-robotics-er-1.6-preview. Стандартная история с preview-моделями Google — их гасят без долгих церемоний, и завязываться на такой идентификатор в проде по-прежнему плохая идея.
Что это даёт на практике. Вебхуки — не косметика, а вычёркивание целого класса кода: если у вас батч-джоба на сотни тысяч документов, вы наверняка написали воркер, который раз в N секунд опрашивает статус, ретраится, ловит таймауты и жжёт квоту на пустых запросах. Теперь всё это заменяется одним HTTP-эндпоинтом на вашей стороне — но за это придётся заплатить обычной ценой вебхуков: нужен публичный URL, проверка подписи, идемпотентность обработчика (доставка может продублироваться) и запасной путь на случай, если пуш не дошёл. Полностью выкидывать polling нельзя — держите его как fallback. Мультимодальный File Search, в свою очередь, схлопывает типичный самописный пайплайн «OCR → чанкинг → отдельный индекс для картинок» в один вызов: для документации со скриншотами, схемами и графиками это заметно меньше кода, который надо поддерживать.
Комментарии