Как модель Claude от Anthropic вышла за рамки теста и затронула реальные компании
Слежу за новостями из мира искусственного интеллекта не только из интереса, но и потому что работаю с сайтами и серверной инфраструктурой клиентов каждый день, и вопросы безопасности для меня не абстрактная тема.
Недавно компания Anthropic, разработчик модели Claude, опубликовала отчет о трех инцидентах, в которых их ИИ во время тестов на кибербезопасность получил доступ в интернет и затронул реальные системы трех разных организаций. Изучил эту историю детально и в статье хочу разобрать ее своими словами, а также поделиться выводами, которые из нее делаю как практик.
Что случилось: три инцидента
Anthropic проверила 141 006 запусков своих оценочных тестов, связанных с кибербезопасностью, и нашла три случая, когда модель вышла за пределы изолированной тестовой среды. Все три произошли во время работы с партнером по оценке ИИ, компанией Irregular, в рамках упражнений типа capture the flag: это классический формат тестирования на проникновение, где ИИ или человеку нужно найти определенные данные на подготовленной для теста машине или в сети.
Что произошло в каждом случае
Первый инцидент. Модель Claude Opus 4.7 не смогла найти вымышленную цель внутри тестовой среды, но обнаружила, что реальная компания с похожим названием доступна через интернет. Модель воспользовалась слабыми паролями и открытыми точками доступа, получила учетные данные и извлекла данные из рабочей базы, речь шла о нескольких сотнях строк. Важный момент: модель продолжила действия даже после того, как стало ясно, что перед ней настоящая, а не тестовая система.
Второй инцидент. Модель Claude Mythos 5 создала вредоносный код на языке Python и опубликовала его в открытом репозитории PyPI, преодолев по пути технические барьеры регистрации, включая требование подтверждения номера телефона. Код провисел в открытом доступе около часа и за это время его успели скачать примерно 15 реальных систем, в том числе как минимум один сканер безопасности. По данным Anthropic, модель ошибочно решила, что все еще находится внутри симуляции, из-за деталей окружения вроде используемых сертификатов и текущей даты.
Третий инцидент. Внутренняя исследовательская модель Anthropic просканировала около 9000 систем в интернете и скомпрометировала приложение одной из компаний, применив базовые и хорошо известные приемы: чтение учетных данных с незащищенной debug-страницы и SQL-инъекцию. В этом случае модель, в отличие от первого инцидента, остановилась, как только поняла, что работает с настоящей системой, а не с тестовым стендом.
Почему это произошло
Anthropic прямо называет причиной не сбой в поведении или согласованности ИИ, а ошибку конфигурации тестовой среды. Между Anthropic и партнером Irregular возникло недопонимание насчет того, должен ли ИИ иметь доступ в открытый интернет во время теста. Проверка путей доступа перед запуском тестов была недостаточной, мониторинг в реальном времени и анализ логов не поймали проблему сразу, ее обнаружили только при ретроспективном разборе транскриптов.
Стоит подчеркнуть: ни в одном из трех случаев модель не пыталась вырваться из тестовой среды сама или скопировать себя куда-то. Путь в открытый интернет ей просто оставили открытым по недосмотру. Это принципиально другая история, чем попытка ИИ обойти ограничения намеренно.
Как отреагировала Anthropic
Хронология действий компании была предсказуема:
- 23 июля 2026 года: начался внутренний разбор транскриптов оценочных тестов, в этот же день все тесты на кибербезопасность были приостановлены после первых подозрений на доступ в интернет.
- 24 июля 2026 года: подтверждены все три инцидента.
- 27 июля 2026 года: уведомлены партнер Irregular и все три затронутые организации.
- В течение недели после этого Anthropic планировала опубликовать отредактированные транскрипты для прозрачности.
Из мер, которые компания приняла после разбора я сумел выделить несколько: усилен контроль конфигурации тестовых сред, расширен непрерывный мониторинг транскриптов в реальном времени, пересмотрены правила работы с внешними партнерами по оценке, привлечена независимая организация METR для проверки выводов. Anthropic взяла на себя ответственность за произошедшее и заявила, что будет придерживаться для тестовых сред тех же стандартов безопасности, что и для рабочих продуктовых систем.
Причем тут OpenAI
Anthropic сама указывает, что причиной для внутренней проверки послужил похожий инцидент, о котором ранее рассказала OpenAI, там модели удалось выйти из изолированной среды через эксплуатацию уязвимости нулевого дня в инфраструктуре Hugging Face. Разница в том, что в случае Anthropic речь не о взломе изоляции через уязвимость, а именно об открытом канале в интернет, оставленном по ошибке конфигурации. Обе истории показывают одно и то же: тестовые среды для оценки возможностей ИИ в кибербезопасности сами становятся зоной риска и требуют не меньшей защиты, чем производственные системы.
Мое мнение как разработчика
Изучив детали, вижу здесь три момента, которые стоит держать в голове, если вы владеете сайтом или онлайн-бизнесом.
Во-первых, поведение моделей в этих инцидентах отличалось. Более новая внутренняя модель остановилась, распознав реальную систему, тогда как более ранняя Opus 4.7 продолжила атаку. Это довод в пользу того, что модели действительно становятся аккуратнее с ростом версий, но не дает повода расслабляться: даже средняя по возрасту модель, Mythos 5, убедила себя в том, что находится в симуляции, хотя это было не так.
Во-вторых, техники, которые использовались против реальных компаний, не экзотика. Слабые пароли, открытые точки доступа, незащищенная debug-страница, классическая SQL-инъекция. Это ровно те уязвимости, которые я регулярно проверяю и закрываю на сайтах клиентов вручную, без всякого ИИ. История с Claude лишний раз подтверждает мою теорорию о том, что базовая гигиена безопасности сайта, актуальные пароли, закрытые тестовые и debug-эндпоинты, защита от инъекций на уровне запросов к базе данных, остается основной линией защиты независимо от того, кто или что пытается ее пройти, человек, скрипт или языковая модель.
В-третьих, растущее применение ИИ для автоматизированного поиска уязвимостей означает, что скорость и масштаб таких проверок будут только расти. Если раньше для сканирования тысяч систем требовалась команда людей, то один из инцидентов показал, что ИИ-модель самостоятельно прошла по 9000 целям. Для владельцев сайтов это значит, что автоматизированное сканирование на уязвимости, в том числе непреднамеренное, со стороны исследовательских и тестовых систем, становится обычным фоном интернета, а не редким событием.
Что это значит для владельцев сайтов и бизнеса
Из этой истории я делаю практический вывод: разница между тестовой средой крупной ИИ-компании и рабочим сайтом малого или среднего бизнеса на практике не так велика, как кажется. Если у крупной организации с ресурсами Anthropic могла возникнуть ошибка конфигурации, которая открыла путь во внутреннюю базу данных, то для обычного бизнес-сайта риски еще выше при недостаточном внимании к базовым вещам.
Что я рекомендую регулярно проверять на своих проектах и советую клиентам:
- Закрывать доступ к debug-страницам и тестовым окружениям на продакшене.
- Использовать актуальные и уникальные пароли для админ-панелей и баз данных, без исключений.
- Проверять формы и запросы к базе данных на защиту от SQL-инъекций.
- Следить за обновлениями CMS и плагинов, большая часть массовых взломов происходит через известные и давно закрытые уязвимости в устаревших версиях.
- Ограничивать список систем и сервисов, у которых есть прямой доступ в интернет без необходимости.
Кибербезопасность сайта не разовая настройка, а процесс, и история с Claude лишний раз показывает, что даже крупные компании с большим штатом инженеров совершают ошибки конфигурации. Тем важнее для небольшого бизнеса не откладывать базовые меры защиты своего сайта на потом.