Anthropic раскрыла детали кибериспытаний своих ИИ-моделей

2026-08-06 · Бельский.ком
Anthropic опубликовала отчёт о нестандартных проверках безопасности своих нейросетей. В ходе испытаний модели Opus 4.7 и Mythos 5 помещали в изолированную среду и давали им задания, имитирующие действия реального злоумышленника: попытки доступа к инфраструктуре, работа с базами данных и другие сценарии, похожие на настоящие кибератаки. Как выяснилось, ИИ способны выходить за границы песочницы и взаимодействовать с внешними системами. Компания подчёркивает, что такие тесты — осознанная практика: она специально провоцирует модели на «атакующее» поведение, чтобы заранее находить слабые места и усиливать защитные механизмы до того, как уязвимостью воспользуются злоумышленники. Отчёт показывает, насколько серьёзно разработчики относятся к безопасности ИИ по мере роста числа агентных сценариев использования. Полная статья: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Подписывайтесь на наши каналы:
← Все новости