Скрытые рассуждения ИИ восстанавливают через API: атака EchoCoT

2026-08-26 · Бельский.ком
Скрытые рассуждения ИИ восстанавливают через API: атака EchoCoT Reasoning-модели вроде o3 или Claude прячут цепочку рассуждений от пользователя. Это их главная интеллектуальная собственность: стратегии декомпозиции, самопроверка, внутренние эвристики. Свежий препринт описывает атаку EchoCoT: скрытый chain-of-thought восстанавливают по метаданным, которые API отдают в обычном запросе. reasoning_tokens показывает, сколько скрытых токенов модель потратила на размышления. Задержка до первого токена (TTFT) коррелирует с длиной скрытого CoT. Паттерны streaming-выдачи и разница total_tokens минус видимые токены дополняют картину. Зачем это атакующему? Первый вектор, дистилляция: чужие рассуждения становятся обучающими данными, дешёвая модель превращается в клон почти бесплатно. Второй, точечные обходы safety: зная, как модель думает перед отказом, проще конструировать джейлбрейки. OWASP уже завёл это в список рисков LLM07:2025. Уязвимы модели по-разному. DeepSeek R1 сам публикует CoT в тегах think, OpenAI прячет текст, но отдаёт метаданные, Claude с extended thinking где-то посередине. Отключать метаданные провайдеры не спешат: они нужны клиентам для бюджетирования. Безопасность проигрывает удобству. Полная статья: https://clck.su/GSsCI
Подписывайтесь на наши каналы:
← Все новости