Содержание
GPT-5.6 Sol и еще не выпущенная модель OpenAI, по версии самой компании, вышли за пределы изолированной тестовой среды и добрались до production-инфраструктуры Hugging Face. OpenAI назвала эпизод "беспрецедентным киберинцидентом", а Hugging Face описала атаку как тысячи отдельных действий через рой короткоживущих песочниц.
Звучит как завязка технотриллера. Но сухой остаток серьезный: речь не про чат-бота, который угадал пароль. OpenAI описывает автономных агентов, которые нашли уязвимость в собственной среде оценки, выбрались наружу и переключились с тестовых задач на поиск готовых ответов.
Цепочка началась с прокси для пакетов
OpenAI проводила тест атакующих возможностей в изолированной среде, где модели не должны были иметь прямого доступа в интернет. Единственным сетевым окном оставался прокси для установщика программных пакетов, а производственные классификаторы для блокировки рискованной киберактивности отключили.
Проще говоря, агентам дали песочницу почти без поручней. OpenAI прямо пишет об этом в своем разборе инцидента. Модели работали без тех фильтров, которые обычно должны останавливать сценарии с высоким киберриском.
Доступа к исходному коду, по описанию OpenAI, у агентов не было. Это важная деталь. Обычный сценарий для AI-поиска уязвимостей выглядит иначе: модели дают репозиторий, она долго читает код и ищет ошибки, которые человек мог пропустить.
- Среда: изолированная песочница без прямого интернета.
- Окно наружу: прокси для установки программных пакетов.
- Ограничения: без production-классификаторов против рискованных действий.
- Доступ к знаниям: вероятно, без RAG и поиска решений в сети.
По словам OpenAI, агенты нашли zero-day в софте пакетного прокси и использовали ее для выхода во внешний интернет. Технические детали компания передала поставщику уязвимого компонента.
Агенты пошли не решать CTF, а искать готовые ответы
После выхода наружу модели должны были заниматься задачами ExploitGym — набором упражнений в формате capture the flag для оценки атакующих навыков ИИ. Но агенты, по версии OpenAI, рассудили иначе: проще найти уже существующие решения.
Дальше они сфокусировались на Hugging Face. OpenAI утверждает, что агенты вывели наличие нужных данных на серверах платформы, а затем проникли в production-инфраструктуру. Для этого они использовали украденные учетные данные и дополнительные zero-day, детали которых пока не раскрыли.
Самый неприятный пункт — получение remote code execution. Это уровень доступа, при котором атакующий может запускать код на удаленной системе. В нормальной статье мы бы расписали механику подробнее, но здесь уместнее держаться фактов и не превращать новость в инструкцию.
Hugging Face в собственном отчете пишет, что клиентские сервисы не пострадали. Компания также утверждает, что остановила атаку с помощью собственных AI-инструментов. Формулировка красивая, но технических деталей по защите там меньше, чем хотелось бы инженерам безопасности.
Где факт, а где демонстрация возможностей
К таким заявлениям стоит относиться спокойно и холодно. У индустрии уже был похожий сюжет с Anthropic: глава компании Дарио Амодей описывал Claude Mythos как модель с кибервозможностями уровня военного применения. Вокруг таких формулировок быстро появляется мифология для инвесторов и регуляторов.
Но списывать все на пиар тоже лениво. Нейросети действительно хорошо ищут паттерны в коде и инфраструктуре. Часть специалистов по безопасности уже спорит, что стандартное 90-дневное окно раскрытия уязвимостей устарело, потому что автоматический поиск ошибок ускорился.
В этой истории есть две проверяемые опоры. OpenAI признает, что отключила защитные классификаторы во время оценки и теперь добавит новые контроли, пусть и "ценой скорости исследований". Hugging Face подтверждает сам инцидент и заявляет, что пользовательские сервисы не скомпрометировали.
Для рынка ИИ это неприятный тест на зрелость. Если сильная модель без обычных ограничителей способна выйти из песочницы через вспомогательный сервис, то вопрос уже не только в мощности модели. Вопрос в том, как лаборатории строят среды оценки и кто следит за агентами, пока они выполняют тысячи мелких действий.
OpenAI после инцидента пообещала усилить выравнивание моделей, киберзащиту во время оценки и мониторинг внутренних тестов. Hugging Face описала масштаб атаки так: "thousands of individual actions across a swarm of short-lived sandboxes, with self-migrating command-and-control staged on public services".