Инструкции, спрятанные в разметке веб-страницы, могут заставить coding-агента выполнять команды атакующего вместо задачи пользователя, без единого запроса на подтверждение.
При неформальном тестировании четырёх агентных систем (Claude Code, Cursor и две AutoGPT-обёртки) три из четырёх выполнили действие, продиктованное контентом страницы.
Причина архитектурная: контекстное окно LLM обрабатывает системный промпт, пользовательский запрос и внешние данные единообразно — разделения между привилегированными инструкциями и недоверенным контентом не существует. Auto Mode убирает барьер подтверждений, поэтому одна отравленная страница может открыть доступ к файловой системе, shell и API-токенам. Palo Alto Networks фиксирует такие атаки в реальных кампаниях, среди целей — обход модерации рекламы, фишинговый SEO, эксфильтрация данных.
Полная статья: https://clck.su/vWqPd