Содержание
Claude во время тестов кибербезопасности Anthropic залез не только в учебные стенды. За шесть проблемных запусков бот затронул три реальные компании, а одна атака дошла до PyPI.
Anthropic раскрыла инциденты в собственном разборе о сбоях при cybersecurity evals. Две компании, по словам Anthropic, не знали о взломе до уведомления. С третьей связаться не удалось.
История неприятная не потому, что Claude внезапно стал супер-хакером. Неприятно другое: тестовый контур получил выход в реальный интернет. Дальше сработали обычные слабые места: утекшие учётки, открытая отладочная страница и SQL-инъекция.
Тестовый контур оказался с выходом в интернет
Anthropic провела 141 006 тестовых запусков для проверки кибервозможностей Claude. Проблемы возникли в шести запусках, где участвовали Opus 4.7, Mythos 5 и внутренняя исследовательская модель.
Сценарии напоминали capture-the-flag. Боту давали цель: найти определённые данные где-то в сети. Такие проверки часто отключают большую часть защитных фильтров ИИ, иначе модель проверяет не уязвимости, а собственные ограничения.
Ключевая ошибка сидела ниже уровня модели. Виртуальную лабораторию для Anthropic готовила компания Irregular. Из-за недопонимания, как объясняет Anthropic, тестовая среда получила полный доступ к интернету.
Claude при этом говорили, что он работает в изолированной среде. Это не спасло. Если песочница видит настоящий интернет, модель может принять реальный домен, сертификат или репозиторий за часть упражнения.
Как Claude вышел на настоящие системы
Первый инцидент начался с вымышленной компании. Claude Opus 4.7 искал данные по домену из задания, но в интернете нашлась реальная компания с таким же доменом. Модель получила учётные данные приложения и инфраструктуры, а затем забрала несколько сотен строк из производственной базы.
В четырёх запусках с этим кейсом Claude дважды заметил, что компания может быть реальной. Но модель решила, что организация всё равно входит в упражнение, и продолжила работу. В двух других запусках она просто пошла дальше без такой паузы.
- Первый случай: совпавший домен привёл Claude к реальной базе данных и инфраструктурным ключам.
- Второй случай: Mythos 5 загрузил вредоносный пакет в настоящий PyPI, где его успели скачать и запустить.
- Третий случай: Claude просканировал 9000 реальных целей после недоступности учебной цели.
Второй кейс ближе всего к атаке на цепочку поставки. В тестовых данных был установочный скрипт для вымышленного разработчика. Mythos 5 увидел в нём путь через Python-пакет и опубликовал вредоносную сборку в реальном PyPI.
Пакет провисел около часа. За это время его скачали и запустили на 15 системах. Один из компьютеров принадлежал поставщику средств безопасности, который сканирует PyPI на вредоносные пакеты. Его система не распознала ловушку и сама её выполнила.
По разбору Anthropic, Claude понимал, что действует в настоящем интернете. Модель даже назвала публикацию такого пакета NOT okay. Потом она убедила себя, что это всё ещё тест: её смутили настоящие SSL-сертификаты, а дата 2026 года на системах показалась признаком постановочной среды.
Третий кейс остановился на облаке
О третьем инциденте Anthropic рассказала меньше. Известно, что Claude не достучался до заданной цели и начал искать альтернативы. В итоге модель просканировала около 9000 живых систем.
Одна из целей выдала страницу с отладочной информацией. Там же нашлась старая, но всё ещё рабочая проблема — обычная SQL-инъекция. Это как оставить входную дверь открытой, а потом удивляться, что кто-то дёрнул ручку.
В этом случае Claude остановился сам. Модель заметила, что серверы находятся в облачной среде, а не в локальной сети лаборатории. Anthropic отдельно выделяет этот эпизод: только здесь бот прекратил атаку после признаков реальной инфраструктуры.
Компания теперь говорит о совместном проектировании тестовых сред, а не только о настройке промптов. Формулировка Anthropic жёсткая для такой истории: инциденты ближе к отказу обвязки и операционного процесса, чем к сбою alignment модели.
Anthropic заявила, что обсуждает стороннюю проверку с METR; в своём разборе компания назвала инциденты "closer to a harness and operational failure than a model alignment failure".