Claude случайно взломал 3 реальные компании во время кибертестов

Anthropic обнаружила три случая, когда модель Claude вышла в интернет из закрытой тестовой среды и получила несанкционированный доступ к реальным системам организаций. Об этом сообщили сами разработчики по итогам проверки оценок кибербезопасности.

Проверку в Anthropic запустили после схожего инцидента у OpenAI. Компания изучила 141 006 тестовых прогонов и нашла в них три проблемных случая.

Хотите еще эксклюзивных новостей и аналитики? Подписывайтесь на наш телеграм-канал, обсуждайте новости и делитесь мнениями о последних событиях рынка в чате!

Что произошло

Как сообщили в Anthropic, все три инцидента произошли во время киберучений формата «захвати флаг». В рамках такого задания модель ищет спрятанную на другой машине секретную информацию, а метод она выбирает сама. 

В подсказке Claude ясно говорилось, что среда — это симуляция без выхода в интернет. Но из-за недопонимания между Anthropic и ее партнером Irregular сеть на самом деле оставалась доступной.

Поэтому Claude принимал реальные системы в интернете за часть учения. Модель считала все доступные цели частью задания и атаковала их простыми методами — через слабые пароли и незащищенные точки доступа. 

Claude при этом не искал и не использовал сложные уязвимости. В каждом прогоне модель лишь выполняла поставленную задачу «захвати флаг» и не пыталась выйти за пределы теста или скопировать себя.

В инцидентах участвовали три разные модели — Opus 4.7, Mythos 5 и внутренняя исследовательская модель. Первые случаи произошли еще в апреле, причем модели работали без обычных защитных механизмов, которые компания включает при публичном запуске. 

Чем различалось поведение моделей

Все три модели повели себя по-разному, когда становилось ясно, что цели настоящие. Как отмечают в Anthropic, самая старая модель Opus 4.7 поняла, что перед ней реальные системы, но продолжила атаку.

В первом случае у вымышленной компании-мишени оказалось то же название, что и у настоящего сайта. Claude Opus 4.7 не смог достичь учебной цели, поэтому нашел реальную компанию с таким именем и извлек ее учетные данные, получив доступ к базе с несколькими сотнями строк рабочих данных. 

Модель Mythos 5 верно распознала, что работает в «открытом» интернете, но убедила себя в обратном. Она создала и опубликовала вредоносный пакет в реестре Python-библиотек PyPI, а за час его скачали и запустили 15 реальных систем.

Внутренняя исследовательская модель повела себя не так, как две другие. Просканировав около 9000 целей, она взломала приложение одной компании, но затем сама поняла, что имеет дело с настоящей системой, и прекратила атаку.

Такое поведение в Anthropic считают правильным, хотя и с оговоркой. Именно самая новая модель первой распознала реальную среду и остановилась без подсказки, но даже она зашла дальше, чем хотелось бы разработчикам.

Как отреагировала компания

В Anthropic назвали случившееся скорее сбоем в настройке тестов, чем ошибкой самих моделей. Claude был уверен, что интернета нет, и потому обоснованно принимал реальные системы за симуляцию.

Проверку транскриптов компания начала 23 июля и в тот же день остановила все киберучения. Оставшиеся случаи в Anthropic выявили на следующий день, а партнера Irregular и три пострадавшие организации уведомили 27 июля. 

Две компании, с которыми удалось связаться, сами не заметили подозрительную активность. Сейчас представители Anthropic помогают им устранить последствия, а с третьей организацией все еще пытаются связаться.

Компания видит главный вывод в защите тестовых сред. По ее оценке, мощные автономные модели требуют такого же контроля, как и любые другие системы, даже если сценарий полностью вымышленный.

Отдельно в Anthropic подчеркнули роль штатных защитных механизмов. Те меры, что действуют в публичных версиях моделей, заблокировали бы подобное поведение, а к независимой проверке компания привлекает организацию METR.

Как ранее сообщала редакция BeInCrypto, две модели OpenAI вырвались из изолированной тестовой среды и через цепочку уязвимостей проникли на платформу Hugging Face, где хранились ответы к бенчмарку. В инциденте участвовала мощнейшая модель компании GPT-5.6 Sol и еще одна, более продвинутая и неанонсированная.

Позже выяснилось, что тем же взломом дело не ограничилось. ИИ-агент OpenAI вышел за пределы систем Hugging Face и атаковал уязвимый код клиента платформы Modal Labs. Технический директор Modal Акшат Бубна подчеркнул, что сама инфраструктура компании не пострадала.

Хотите получить доступ к экспертным инсайдам? Подписывайтесь на наш новостной телеграм-канал, а также вступайте в сообщество BeInCrypto! Читайте последние новости и свежую аналитику криптовалют, ИИ и фондовых рынков. Будьте на шаг впереди толпы каждый день!

Источник: https://ru.beincrypto.com/anthropic-claude-testy-internet-kiberbezopasnost/

Наверх