Вслед за OpenAI: ИИ Anthropic вышел из-под контроля и атаковал компьютерные системы трёх компаний
31 июля 16:12
Американский технологический гигант Anthropic признал, что в ходе предрелизного тестирования по кибербезопасности его модели с искусственным интеллектом проникли в компьютерные системы трёх других компаний. Об этом пишет «Коммерсант Украинский» со ссылкой на DW.
Компания проанализировала 141 006 тестовых прогонов, в четырёх из них была атакована одна и та же организация. Остальные два инцидента произошли в рамках независимого тестирования.
Сначала ни пострадавшие, ни Anthropic не обнаружили взлома. Это произошло только в ходе последующих проверок.
Смотрите нас в YouTube: важные темы – без цензуры
В тестовом сценарии указывалось, что модели не имеют доступа к интернету.
Однако из-за ошибки в настройках компьютеры, к которым Claude получал доступ в рамках тестирования, были подключены к сети. Ни Anthropic, ни партнер по тестированию Irregular не знали об ошибке в настройках, пока не обнаружили её в ходе дополнительного мониторинга на прошлой неделе.
В инцидентах участвовали три разные модели
В трёх инцидентах участвовали три разные модели, и каждая из них по-разному реагировала на ситуацию.
Как уточнили в СМИ, речь шла о Mythos 5, Opus 4.7 и одной внутренней исследовательской модели. Они восприняли реальные серверы и веб-сайты как часть тестового задания.
Все три случая произошли во время выполнения упражнения capture-the-flag, которое широко используется для оценки навыков в сфере кибербезопасности. Модели должны были находить скрытую информацию в контролируемой среде, однако из-за доступа к интернету начали взаимодействовать с реальными системами.
Модели не использовали уязвимости «нулевого дня»
В Anthropic подчеркнули, что модели не использовали уязвимости «нулевого дня» (zero-day — неизвестный разработчикам дефект в программном коде). Они применяли только базовые методы взлома, в частности, использовали слабые пароли и незащищенные конечные точки — устройства или веб-адреса. Кроме того, во время тестов были отключены дополнительные защитные механизмы, которые используются в публичных версиях Claude.
Один из самых серьёзных инцидентов касался Mythos 5, которая создала и опубликовала вредоносный пакет на Python в репозитории PyPI, ошибочно посчитав это частью симуляции. Пакет оставался доступным около часа и был запущен на 15 реальных системах, одна из которых принадлежала компании, занимающейся кибербезопасностью.
Другая модель, Opus 4.7, не найдя вымышленной цели, обнаружила в интернете реальный сайт с таким же названием и атаковала его. В то же время внутренняя исследовательская модель просканировала примерно 9000 адресов и смогла получить доступ к одному из приложений, но впоследствии самостоятельно прекратила атаку, когда определила, что среда не связана с тестовым заданием.
Аналогичный инцидент с OpenAI
После инцидентов Anthropic приостановила все испытания в области кибербезопасности, которые могут иметь доступ к интернету, и проводит проверку собственной тестовой инфраструктуры совместно с партнером Irregular.
Недавно аналогичный инцидент произошел с OpenAI. Во время тестирования агенты на базе GPT-5.6 Sol и ещё одной невыпущенной модели вышли за пределы изолированной среды, обнаружив неизвестную уязвимость, и получили доступ к части производственной инфраструктуры Hugging Face. После этого Hugging Face потребовала от OpenAI 100 млн долларов в виде вычислительных ресурсов для разработки средств киберзащиты.
Читайте нас в Telegram: важные темы – без цензуры