Слідом за OpenAI: ШІ Anthropic вийшов з-під контролю та атакував комп’ютерні системи трьох компаній
31 Липня 16:12
Американський технологічний гігант Anthropic визнав, що в ході передрелізного тестування з кібербезпеки її моделі зі штучним інтелектом проникли до комп’ютерних систем трьох інших компаній. Про це пише «Комерсант Український» з посиланням на DW.
Компанія проаналізувала 141 006 тестових прогонів, у чотирьох з них була атакована та сама організація. Інші два інциденти сталися в рамках незалежного тестування.
Спочатку ні постраждалі, ні Anthropic не виявили злому. Це сталося лише за наступних перевірок.
Дивіться нас у YouTube: важливі теми – без цензури
У тестовому сценарії вказувалося, що моделі не мають доступу до інтернету.
Однак через помилку в налаштуваннях комп’ютери, до яких Claude отримував доступ у рамках тестування, були підключені до мережі. Ні Anthropic, ні партнер із тестування Irregular не знали про помилку в налаштуваннях, поки не виявили її під час додаткового моніторингу минулого тижня.
В інцидентах брали участь три різні моделі
У трьох інцидентах брали участь три різні моделі, і кожна з них по-різному реагувала на ситуацію.
Як уточнили у ЗМІ, йшлося про Mythos 5, Opus 4.7 та одну внутрішню дослідницьку модель. Вони сприйняли реальні сервери та веб-сайти як частину тестового завдання.
Усі три випадки сталися під час виконання вправи capture-the-flag, яка широко використовується для оцінки навичок у сфері кібербезпеки. Моделі мали знаходити приховану інформацію в контрольованому середовищі, проте через доступ до інтернету почали взаємодіяти з реальними системами.
Моделі не використовували вразливості “нульового дня”
В Anthropic наголосили, що моделі не використовували вразливості “нульового дня” (zero-day, невідомий розробникам дефект у програмному коді). Вони застосовували лише базові методи злому, зокрема скористалися слабкими паролями та незахищеними кінцевими точками – пристроями чи веб-адресами. Крім того, під час тестів було відключено додаткові захисні механізми, які використовуються у публічних версіях Claude.
Один із найсерйозніших інцидентів стосувався Mythos 5, яка створила та опублікувала шкідливий пакет на Python у репозиторії PyPI, помилково вважаючи це частиною симуляції. Пакет залишався доступним близько години і був запущений на 15 реальних системах, одна з яких належала компанії, що займається кібербезпекою.
Інша модель, Opus 4.7, не знайшовши вигаданої мети, виявила в інтернеті реальний сайт з такою ж назвою і атакувала його. У той же час внутрішня дослідницька модель просканувала приблизно 9000 адрес і змогла отримати доступ до одного із додатків, але згодом самостійно припинила атаку, коли визначила, що середовище не пов’язане із тестовим завданням.
Аналогічний інцидент із OpenAI
Після інцидентів Anthropic призупинила всі випробування в галузі кібербезпеки, які можуть мати доступ до інтернету, та проводить перевірку власної тестової інфраструктури разом із партнером Irregular.
Нещодавно аналогічний інцидент стався із OpenAI. Під час тестування агенти на базі GPT-5.6 Sol та ще однієї невипущеної моделі вийшли за межі ізольованого середовища, виявивши невідому вразливість та отримали доступ до частини виробничої інфраструктури Hugging Face. Після цього Hugging Face зажадала від OpenAI 100 млн. доларів у вигляді обчислювальних ресурсів для розробки засобів кіберзахисту.
Читайте нас в Telegram: важливі теми – без цензури