Блог о разработке, SEO и цифровых решениях для бизнеса

Как модель Claude от Anthropic вышла за рамки теста и затронула реальные компании

Слежу за новостями из мира искусственного интеллекта не только из интереса, но и потому что работаю с сайтами и серверной инфраструктурой клиентов каждый день, и вопросы безопасности для меня не абстрактная тема.

Максим Климов 6 минут чтения
Как модель Claude от Anthropic вышла за рамки теста и затронула реальные компании
Как модель Claude от Anthropic вышла за рамки теста и затронула реальные компании

Недавно компания Anthropic, разработчик модели Claude, опубликовала отчет о трех инцидентах, в которых их ИИ во время тестов на кибербезопасность получил доступ в интернет и затронул реальные системы трех разных организаций. Изучил эту историю детально и в статье хочу разобрать ее своими словами, а также поделиться выводами, которые из нее делаю как практик.

Что случилось: три инцидента

Anthropic проверила 141 006 запусков своих оценочных тестов, связанных с кибербезопасностью, и нашла три случая, когда модель вышла за пределы изолированной тестовой среды. Все три произошли во время работы с партнером по оценке ИИ, компанией Irregular, в рамках упражнений типа capture the flag: это классический формат тестирования на проникновение, где ИИ или человеку нужно найти определенные данные на подготовленной для теста машине или в сети.

Что произошло в каждом случае

Первый инцидент. Модель Claude Opus 4.7 не смогла найти вымышленную цель внутри тестовой среды, но обнаружила, что реальная компания с похожим названием доступна через интернет. Модель воспользовалась слабыми паролями и открытыми точками доступа, получила учетные данные и извлекла данные из рабочей базы, речь шла о нескольких сотнях строк. Важный момент: модель продолжила действия даже после того, как стало ясно, что перед ней настоящая, а не тестовая система.

Второй инцидент. Модель Claude Mythos 5 создала вредоносный код на языке Python и опубликовала его в открытом репозитории PyPI, преодолев по пути технические барьеры регистрации, включая требование подтверждения номера телефона. Код провисел в открытом доступе около часа и за это время его успели скачать примерно 15 реальных систем, в том числе как минимум один сканер безопасности. По данным Anthropic, модель ошибочно решила, что все еще находится внутри симуляции, из-за деталей окружения вроде используемых сертификатов и текущей даты.

Третий инцидент. Внутренняя исследовательская модель Anthropic просканировала около 9000 систем в интернете и скомпрометировала приложение одной из компаний, применив базовые и хорошо известные приемы: чтение учетных данных с незащищенной debug-страницы и SQL-инъекцию. В этом случае модель, в отличие от первого инцидента, остановилась, как только поняла, что работает с настоящей системой, а не с тестовым стендом.

Почему это произошло

Anthropic прямо называет причиной не сбой в поведении или согласованности ИИ, а ошибку конфигурации тестовой среды. Между Anthropic и партнером Irregular возникло недопонимание насчет того, должен ли ИИ иметь доступ в открытый интернет во время теста. Проверка путей доступа перед запуском тестов была недостаточной, мониторинг в реальном времени и анализ логов не поймали проблему сразу, ее обнаружили только при ретроспективном разборе транскриптов.

Стоит подчеркнуть: ни в одном из трех случаев модель не пыталась вырваться из тестовой среды сама или скопировать себя куда-то. Путь в открытый интернет ей просто оставили открытым по недосмотру. Это принципиально другая история, чем попытка ИИ обойти ограничения намеренно.

Как отреагировала Anthropic

Хронология действий компании была предсказуема:

  • 23 июля 2026 года: начался внутренний разбор транскриптов оценочных тестов, в этот же день все тесты на кибербезопасность были приостановлены после первых подозрений на доступ в интернет.
  • 24 июля 2026 года: подтверждены все три инцидента.
  • 27 июля 2026 года: уведомлены партнер Irregular и все три затронутые организации.
  • В течение недели после этого Anthropic планировала опубликовать отредактированные транскрипты для прозрачности.

Из мер, которые компания приняла после разбора я сумел выделить несколько: усилен контроль конфигурации тестовых сред, расширен непрерывный мониторинг транскриптов в реальном времени, пересмотрены правила работы с внешними партнерами по оценке, привлечена независимая организация METR для проверки выводов. Anthropic взяла на себя ответственность за произошедшее и заявила, что будет придерживаться для тестовых сред тех же стандартов безопасности, что и для рабочих продуктовых систем.

Причем тут OpenAI

Anthropic сама указывает, что причиной для внутренней проверки послужил похожий инцидент, о котором ранее рассказала OpenAI, там модели удалось выйти из изолированной среды через эксплуатацию уязвимости нулевого дня в инфраструктуре Hugging Face. Разница в том, что в случае Anthropic речь не о взломе изоляции через уязвимость, а именно об открытом канале в интернет, оставленном по ошибке конфигурации. Обе истории показывают одно и то же: тестовые среды для оценки возможностей ИИ в кибербезопасности сами становятся зоной риска и требуют не меньшей защиты, чем производственные системы.

Мое мнение как разработчика

Изучив детали, вижу здесь три момента, которые стоит держать в голове, если вы владеете сайтом или онлайн-бизнесом.

Во-первых, поведение моделей в этих инцидентах отличалось. Более новая внутренняя модель остановилась, распознав реальную систему, тогда как более ранняя Opus 4.7 продолжила атаку. Это довод в пользу того, что модели действительно становятся аккуратнее с ростом версий, но не дает повода расслабляться: даже средняя по возрасту модель, Mythos 5, убедила себя в том, что находится в симуляции, хотя это было не так.

Во-вторых, техники, которые использовались против реальных компаний, не экзотика. Слабые пароли, открытые точки доступа, незащищенная debug-страница, классическая SQL-инъекция. Это ровно те уязвимости, которые я регулярно проверяю и закрываю на сайтах клиентов вручную, без всякого ИИ. История с Claude лишний раз подтверждает мою теорорию о том, что базовая гигиена безопасности сайта, актуальные пароли, закрытые тестовые и debug-эндпоинты, защита от инъекций на уровне запросов к базе данных, остается основной линией защиты независимо от того, кто или что пытается ее пройти, человек, скрипт или языковая модель.

В-третьих, растущее применение ИИ для автоматизированного поиска уязвимостей означает, что скорость и масштаб таких проверок будут только расти. Если раньше для сканирования тысяч систем требовалась команда людей, то один из инцидентов показал, что ИИ-модель самостоятельно прошла по 9000 целям. Для владельцев сайтов это значит, что автоматизированное сканирование на уязвимости, в том числе непреднамеренное, со стороны исследовательских и тестовых систем, становится обычным фоном интернета, а не редким событием.

Что это значит для владельцев сайтов и бизнеса

Из этой истории я делаю практический вывод: разница между тестовой средой крупной ИИ-компании и рабочим сайтом малого или среднего бизнеса на практике не так велика, как кажется. Если у крупной организации с ресурсами Anthropic могла возникнуть ошибка конфигурации, которая открыла путь во внутреннюю базу данных, то для обычного бизнес-сайта риски еще выше при недостаточном внимании к базовым вещам.

Что я рекомендую регулярно проверять на своих проектах и советую клиентам:

  • Закрывать доступ к debug-страницам и тестовым окружениям на продакшене.
  • Использовать актуальные и уникальные пароли для админ-панелей и баз данных, без исключений.
  • Проверять формы и запросы к базе данных на защиту от SQL-инъекций.
  • Следить за обновлениями CMS и плагинов, большая часть массовых взломов происходит через известные и давно закрытые уязвимости в устаревших версиях.
  • Ограничивать список систем и сервисов, у которых есть прямой доступ в интернет без необходимости.

Кибербезопасность сайта не разовая настройка, а процесс, и история с Claude лишний раз показывает, что даже крупные компании с большим штатом инженеров совершают ошибки конфигурации. Тем важнее для небольшого бизнеса не откладывать базовые меры защиты своего сайта на потом.