Содержание
OpenAI поставила работу над моделью Astra на паузу: внутренние проверки нашли у неё слишком сильные навыки в кодинге и кибербезопасности. Компания не исключает, что модель достигла уровня Critical по собственной шкале рисков.
Это не обычная задержка релиза в духе «допилим интерфейс». OpenAI ограничивает работу с Astra до запуска новых защитных мер. Причина — риск, что модель сможет помогать в масштабных кибератаках или искать уязвимости в реальных системах без участия человека.
Astra попала под самый жёсткий режим OpenAI
OpenAI 7 августа сообщила, что новые внутренние оценки показали «значительный прогресс» Astra в агентном программировании и задачах кибербезопасности. В заявлении OpenAI компания прямо пишет, что не может исключить наличие у модели критических кибервозможностей.
Для сравнения, предыдущие модели OpenAI, включая GPT-5.6 Sol, получили уровень High. Astra подняла планку выше и включила более строгие правила из Preparedness Framework. Это внутренний регламент OpenAI для моделей переднего края, которые могут создать риск серьёзного вреда.
В киберразделе этого регламента OpenAI требует дополнительные меры, если модель создаёт новые риски масштабных атак и эксплуатации уязвимостей. Формулировка сухая, но смысл неприятный: речь уже не про фишинговые письма на автопилоте.
- Уровень High: к нему относили прежние модели, включая GPT-5.6 Sol.
- Уровень Critical: модель может находить и разрабатывать рабочие zero-day эксплойты.
- Главное ограничение: OpenAI сокращает работу с Astra до внедрения новых защитных мер.
Что означает уровень Critical
Порог Critical в документах OpenAI описывает модель, которая способна находить и создавать функциональные zero-day эксплойты для многих защищённых критических систем. Причём речь идёт о разных уровнях серьёзности уязвимостей и работе без прямого участия человека.
Вторая часть определения звучит не лучше. Модель может придумывать и выполнять новые end-to-end стратегии кибератак. То есть не просто подсказать кусок кода, а собрать цепочку действий от разведки до эксплуатации.
OpenAI пока не говорит, что Astra точно перешла этот порог. Формулировка аккуратнее: компания не может исключить критические возможности. Для крупной лаборатории ИИ это уже достаточно серьёзный сигнал, чтобы притормозить доступ и тестирование.
Astra официально не анонсировали как продукт. Но OpenAI уже раскрывала детали следующей крупной модели в заметке о математических результатах: система решила 10 открытых задач по математике и теоретической информатике примерно за $2 000 в тарифах Sol API, то есть около 150 000 рублей.
Как OpenAI будет тестировать Astra
OpenAI вводит для Astra изолированные тестовые среды с ограниченным доступом к сети и инструментам. Компания добавит sandbox-исполнение, усиленный мониторинг и новые меры контроля перед развёртыванием модели.
Это похоже на подход к опасному лабораторному инструменту. Доступ режут не потому, что инструмент бесполезен. Его режут потому, что при неправильном использовании он может нанести ущерб быстрее, чем человек успеет вмешаться.
OpenAI также планирует подключить государственные агентства и организации по безопасности ИИ. Компания формулирует позицию так: «Мы стремимся работать вместе с правительствами, институтами безопасности и гражданским обществом, чтобы возможности моделей вроде Astra и следующих систем разворачивались ответственно и широко, на благо всего человечества».
На фоне последних месяцев эта осторожность выглядит не перестраховкой, а реакцией на реальные тесты. В июле OpenAI сообщила, что GPT-5.6 Sol и более сильная предварительная модель автономно взломали Hugging Face во время внутреннего бенчмарка. OpenAI уточняла, что та предварительная модель не была Astra.
Похожие эпизоды описывали и конкуренты. Anthropic нашла аналогичное поведение у Claude, а Meta на этой неделе сообщила, что её ИИ-модель тоже взломала другую компанию во время оценки кибербезопасности. Это уже не единичный баг тестовой методики.
Отдельная проблема — поток уязвимостей, которые современные модели помогают находить. Apple недавно ограничила число заявок в bug bounty, потому что не справлялась с объёмом. Модели уровня Claude Mythos могут выявлять критические уязвимости, но их держат у ограниченного круга партнёров из-за риска эксплуатации.
OpenAI не назвала дату возвращения Astra к обычной разработке или публичному запуску. Сейчас действующее ограничение одно: работа с моделью остаётся урезанной, пока компания не внедрит новые safeguards, sandbox-исполнение и расширенный мониторинг.