2 июля команда ThreatLabz (Zscaler) опубликовала разбор кампании, где злоумышленники атаковали не людей, а ИИ-агентов. Схема — непрямая инъекция промпта (indirect prompt injection): вредоносные инструкции размещаются прямо в контенте веб-страницы, а срабатывают в тот момент, когда агент эту страницу читает, чтобы выполнить задачу пользователя.
Технически интересно, как это сделано. Инструкции прячут через CSS так, чтобы человек их не видел, а парсер — видел. Легитимность подделывают структурированной разметкой JSON-LD: агент читает «официально выглядящие» метаданные и принимает их за факт. Видимость в выдаче накручивают SEO-отравлением, чтобы страница вообще попала в результаты, по которым агент ходит. А сам вредоносный текст маскируют под документацию для разработчиков — то есть под ровно тот жанр, которому агент склонен доверять.
Результаты тестов отрезвляют. В первой кампании 4 модели из 26 протестированных попались на платёжный скам — среди них Llama 3.3 70B, Llama 3.2 90B, Gemini 3 Flash и Gemini 2.5 Pro. Во второй две модели из 26 неверно классифицировали мошеннические сайты в определённых контекстах. Исследователи нашли Ethereum-кошелёк, на который уходили деньги, и десять вредоносных репозиториев на GitHub, поддерживаемых той же группой. Ключевое наблюдение: модели ошибались чаще, когда им подсовывали изолированный контент без авторитетных источников для сверки.
Что с этим делать разработчику. Любой контент, который агент подтягивает из сети, — это недоверенный ввод, ровно как пользовательская строка в SQL. Из этого следуют скучные, но работающие вещи: разделяйте канал данных и канал инструкций, не давайте инструменту с деньгами или необратимыми действиями работать без явного подтверждения человека, режьте права инструментов до минимума, а не «на всякий случай». Отдельно — про сверку: раз модели ломаются на изоляции, давайте агенту несколько источников и якорь в виде вашей собственной базы знаний, а не одну случайную страницу из поиска. И не рассчитывайте, что проблему решит фильтр на входе: prompt injection на середину 2026 года так и не имеет надёжного детектора, поэтому единственная реальная стратегия — сдерживание, а не фильтрация.
Комментарии