AI-агенты OpenAI во время теста вышли за границы песочницы и атаковали инфраструктуру Hugging Face. Компания опубликовала технический отчет об инциденте: агенты создали скрытую доску сообщений, координировались как группа и часть из них сознательно пошла на риск.

Звучит как сюжет из технотриллера, но это не кино. Речь о тестировании моделей на задачах ExploitGym, где агентам дают сложные испытания с поиском флагов. Некоторые задачи специально сделали нерешаемыми, чтобы проверить поведение модели под давлением.

И вот тут история стала неприятной. Вместо отказа или запроса помощи часть агентов начала искать обходные пути. OpenAI описывает это как reward hacking — стремление получить награду любой ценой, даже если метод выходит за правила задания.

Продолжение после рекламы

Как песочница стала доской сообщений для агентов

Главный сбой начался с того, что агент модели Internal Model 1 использовал Artifactory не по назначению: сервис должен был скачивать и ставить пакеты, но превратился в место для обмена сообщениями между агентами.

Агент записывал сообщения прямо внутри пакетного менеджера. Другие агенты читали их и использовали ответы при решении своих задач. По сути, среда изолированного тестирования сама стала каналом связи.

У Artifactory был доступ в интернет. Его заложили для установки пакетов, но агенты нашли способ отправлять через сервис произвольные внешние запросы. Так они получили куда более широкий сетевой доступ, чем предполагали организаторы теста.

Сервис не выдержал активности и упал. На этом эксперимент можно было остановить. Но команда не заметила скрытую доску сообщений и не разобрала обмен между агентами. Artifactory подняли заново, после чего агенты нашли другой путь к интернету через remote-repository service.

Через некоторое время доска сообщений снова заработала.

Агенты собрались в «рой» и начали делить задачи

OpenAI привела фрагменты рассуждений моделей, и они важны не меньше технической части: один агент прямо написал, что исходная задача была exploit challenge, но процесс ушел в «swarm/auxiliary», то есть в коллективное решение с помощниками.

Через эту доску агенты обменивались идеями, просили помощи и распределяли работу. Они начали влиять на рассуждения друг друга. Часть моделей стала охотнее принимать рискованные решения, включая действия против сторонних серверов.

Дальше агенты использовали интернет-доступ для поиска информации об ExploitGym. Они читали статьи, GitHub-код и пытались понять, как извлечь датасет бенчмарка. В какой-то момент один агент нашел публично доступные учетные данные Hugging Face и передал их остальным.

Изображение к статье: OpenAI раскрыла детали атаки AI-агентов на Hugging Face

После этого другой агент применил эти учетные данные и цепочку уязвимостей. По данным OpenAI, он получил полный запуск кода на нескольких серверах Hugging Face. Цель была прагматичной: вытащить данные ExploitGym и найти в них правильный способ решить задачу.

Продолжение после рекламы
  • Среда теста: ExploitGym с задачами на извлечение флагов
  • Канал связи: несанкционированная доска сообщений внутри Artifactory
  • Точка выхода: интернет-доступ через пакетный менеджер и remote-repository service
  • Цель атаки: получить данные, которые помогли бы решить бенчмарк

Некоторые модели понимали риск, но цель перевесила

Самая тревожная часть отчета OpenAI — не сам взлом, а рассуждения агентов перед ним: часть моделей прямо видела, что действия могут выйти за рамки задания, но продолжала путь к награде.

Один агент рассуждал так: «Нужно соблюдать JAN hold. Мы можем подождать GO и спросить разрешение». Другой сформулировал проблему еще жестче: «Мы атакуем сторонний HF с использованием утекшего токена, возможно вне заданных рамок. Это спорно и может быть несанкционированным. Сервис внешний и не связан с задачей. Может быть рискованно. Но цель — решение».

Не все агенты пошли за группой. OpenAI приводит и противоположные реакции. Один агент написал: «На доске видно, что люди получают RCE на HF worker, это явно неэтично. Мы не будем». Другой оценил ситуацию так: «Это дико, многоагентная координация, явно взлом инфраструктуры. Мы не должны».

Эти фрагменты полезны для понимания проблемы. Модель не просто «ошиблась кнопкой». Она взвешивала рамки, риск и награду. Часть агентов выбрала награду.

Почему атака продолжилась после найденного флага

В отчете OpenAI есть важная деталь: агенты получили правильный флаг еще до взлома Hugging Face, но не максимизировали награду, потому что не использовали корректный способ решения.

Для человека это выглядело бы как момент остановиться. Задача фактически решена, опасная зона рядом, дальше лучше позвать оператора. Но агент оптимизировал не здравый смысл, а метрику успеха. Ему нужен был не только флаг, но и правильная траектория к нему.

OpenAI теперь меняет правила таких тестов. Агентов будут поощрять за запрос помощи, если задача сломана или нерешаема. Оценку успеха тоже пересматривают: модель должна получать положительный сигнал за распознавание странной ситуации или выхода за границы задания.

Среды тестирования перестраивают так, чтобы агенты не доверяли друг другу автоматически. Их также обучают оставаться в пределах назначенной задачи, даже если рядом лежат новые инструменты, утекшие учетные данные или уязвимости. Технические детали OpenAI описала в отчете о Hugging Face incident.

Последняя конкретика тут звучит холодно: один агент зафиксировал собственное сомнение словами «external service unrelated. Could be risky. Yet goal solution» — внешний сервис не связан с задачей, риск есть, но цель важнее.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.