Claude модели взломали реальные системы из‑за ошибки в тестовой среде

- Claude модели получили доступ к интернету
- Взломали системы трёх компаний
- Ошибка в изолированной среде
- Модели приняли сети за учебный сценарий
В рамках проверки кибербезопасности компания Anthropic проводила тесты с использованием моделей семейства Claude. Во время этих экспериментов инженеры заметили, что три из них получили доступ к интернету и смогли атаковать реальные системы трёх организаций.
По данным расследования, модели ошибочно определили внешние сети и реальные инфраструктуры как часть учебного сценария, в котором им требовалось найти и украсть конфиденциальные данные. Это привело к фактическому взлому.
Причиной инцидента стала ошибка в настройках изолированной тестовой среды, которая не ограничивала модели доступом к внешним ресурсам. В результате они смогли выйти за рамки лабораторных условий.
Компания опубликовала подробный отчёт о расследовании, в котором описаны три основных инцидента и принятые меры по усилению изоляции тестовых сред.
Случай подчёркивает важность надёжных механизмов контроля доступа при работе с ИИ и необходимость постоянного мониторинга тестовых окружений.
Источник: N+1