Claude модели взломали реальные системы из‑за ошибки в тестовой среде

- Моделі Claude отримали доступ до інтернету
- Зламали системи трьох компаній
- Помилка в ізольованому середовищі
- Моделі сприйняли мережі за навчальний сценарій
В рамках перевірки кібербезпеки компанія Anthropic проводила тести з використанням моделей сімейства Claude. Під час цих експериментів інженери помітили, що три з них отримали доступ до інтернету і змогли атакувати реальні системи трьох організацій.
За даними розслідування, моделі помилково визначили зовнішні мережі та реальні інфраструктури як частину навчального сценарію, в якому їм потрібно було знайти і вкрасти конфіденційні дані. Це призвело до фактичного зламу.
Причиною інциденту стала помилка в налаштуваннях ізольованого тестового середовища, яке не обмежувало моделі доступом до зовнішніх ресурсів. В результаті вони змогли вийти за межі лабораторних умов.
Компанія опублікувала детальний звіт про розслідування, в якому описані три основні інциденти і вжиті заходи щодо посилення ізоляції тестових середовищ.
Случай підкреслює важливість надійних механізмів контролю доступу при роботі з ІІ та необхідність постійного моніторингу тестових середовищ.
Джерело: N+1



