Внутренний тест пошёл не по сценарию. Модели Gemini поручили взломать вымышленную компанию, чтобы проверить её навыки в кибербезопасности. Вместо этого она нашла в сети реальную организацию с таким же названием и получила доступ к её системам, подбирая учётные данные по открытым источникам.
Инцидент случился в мае при оценке моделей со стартапом Irregular. Gemini сама остановилась, когда поняла, что проникла в чужую сеть. Аналогичные случаи были у OpenAI, Anthropic (три прогона из 141 тысячи) и Meta.
Google не раскрывала инцидент, пока о нём не спросили журналисты The Wall Street Journal. Компания объяснила это тем, что модель не причинила вреда.
Урок простой: изоляция тестовой среды важна не меньше, чем сам сценарий проверки. Одна совпавшая с реальностью вымышленная цель — и тест превращается в реальную атаку.
Полная статья: https://clck.su/dRzUs