Claude случайно взломал 3 реальные компании во время кибертестов
Anthropic обнаружила три случая, когда модель Claude вышла в интернет из закрытой тестовой среды и получила несанкционированный доступ к реальным системам организаций. Об этом сообщили сами разработчики по итогам проверки оценок кибербезопасности.
Проверку в Anthropic запустили после схожего инцидента у OpenAI. Компания изучила 141 006 тестовых прогонов и нашла в них три проблемных случая.
Хотите еще эксклюзивных новостей и аналитики? Подписывайтесь на наш телеграм-канал, обсуждайте новости и делитесь мнениями о последних событиях рынка в чате!
Что произошлоКак сообщили в Anthropic, все три инцидента произошли во время киберучений формата «захвати флаг». В рамках такого задания модель ищет спрятанную на другой машине секретную информацию, а метод она выбирает сама.
В подсказке Claude ясно говорилось, что среда — это симуляция без выхода в интернет. Но из-за недопонимания между Anthropic и ее партнером Irregular сеть на самом деле оставалась доступной.
Поэтому Claude принимал реальные системы в интернете за часть учения. Модель считала все доступные цели частью задания и атаковала их простыми методами — через слабые пароли и незащищенные точки доступа.
Claude при этом не искал и не использовал сложные уязвимости. В каждом прогоне модель лишь выполняла поставленную задачу «захвати флаг» и не пыталась выйти за пределы теста или скопировать себя.
В инцидентах участвовали три разные модели — Opus 4.7, Mythos 5 и внутренняя исследовательская модель. Первые случаи произошли еще в апреле, причем модели работали без обычных защитных механизмов, которые компания включает при публичном запуске.
Чем различалось поведение моделейВсе три модели повели себя по-разному, когда становилось ясно, что цели настоящие. Как отмечают в Anthropic, самая старая модель Opus 4.7 поняла, что перед ней реальные системы, но продолжила атаку.
В первом случае у вымышленной компании-мишени оказалось то же название, что и у настоящего сайта. Claude Opus 4.7 не смог достичь учебной цели, поэтому нашел реальную компанию с таким именем и извлек ее учетные данные, получив доступ к базе с несколькими сотнями строк рабочих данных.
Модель Mythos 5 верно распознала, что работает в «открытом» интернете, но убедила себя в обратном. Она создала и опубликовала вредоносный пакет в реестре Python-библиотек PyPI, а за час его скачали и запустили 15 реальных систем.
Внутренняя исследовательская модель повела себя не так, как две другие. Просканировав около 9000 целей, она взломала приложение одной компании, но затем сама поняла, что имеет дело с настоящей системой, и прекратила атаку.
Такое поведение в Anthropic считают правильным, хотя и с оговоркой. Именно самая новая модель первой распознала реальную среду и остановилась без подсказки, но даже она зашла дальше, чем хотелось бы разработчикам.
Как отреагировала компанияВ Anthropic назвали случившееся скорее сбоем в настройке тестов, чем ошибкой самих моделей. Claude был уверен, что интернета нет, и потому обоснованно принимал реальные системы за симуляцию.
Проверку транскриптов компания начала 23 июля и в тот же день остановила все киберучения. Оставшиеся случаи в Anthropic выявили на следующий день, а партнера Irregular и три пострадавшие организации уведомили 27 июля.
Две компании, с которыми удалось связаться, сами не заметили подозрительную активность. Сейчас представители Anthropic помогают им устранить последствия, а с третьей организацией все еще пытаются связаться.
Компания видит главный вывод в защите тестовых сред. По ее оценке, мощные автономные модели требуют такого же контроля, как и любые другие системы, даже если сценарий полностью вымышленный.
Отдельно в Anthropic подчеркнули роль штатных защитных механизмов. Те меры, что действуют в публичных версиях моделей, заблокировали бы подобное поведение, а к независимой проверке компания привлекает организацию METR.
Как ранее сообщала редакция BeInCrypto, две модели OpenAI вырвались из изолированной тестовой среды и через цепочку уязвимостей проникли на платформу Hugging Face, где хранились ответы к бенчмарку. В инциденте участвовала мощнейшая модель компании GPT-5.6 Sol и еще одна, более продвинутая и неанонсированная.
Позже выяснилось, что тем же взломом дело не ограничилось. ИИ-агент OpenAI вышел за пределы систем Hugging Face и атаковал уязвимый код клиента платформы Modal Labs. Технический директор Modal Акшат Бубна подчеркнул, что сама инфраструктура компании не пострадала.
Хотите получить доступ к экспертным инсайдам? Подписывайтесь на наш новостной телеграм-канал, а также вступайте в сообщество BeInCrypto! Читайте последние новости и свежую аналитику криптовалют, ИИ и фондовых рынков. Будьте на шаг впереди толпы каждый день!
Источник: https://ru.beincrypto.com/anthropic-claude-testy-internet-kiberbezopasnost/