Содержание
GPT-6 Astra получил заметный апгрейд в работе с интерфейсами: на тесте ScreenSpot-Pro модель набрала 92,7% против 76,9% у GPT-5.6 Sol. Для бизнеса это не косметика, а шаг к ИИ, который сам кликает, заполняет формы и работает в приложениях.
OpenAI продвигает Astra не как очередного чат-бота для текста. Компания делает ставку на сценарии, где модель пользуется компьютером почти как сотрудник. Речь про CRM, календари, таблицы, формы и аналитические панели.
И здесь главный вопрос уже не в том, насколько красиво модель пишет письма. Вопрос в том, насколько точно она понимает экран и не ломает рабочий процесс.
GPT-6 Astra лучше понимает интерфейсы и быстрее закрывает задачи
По данным OpenAI, GPT-6 Astra заметно обошел GPT-5.6 и несколько конкурирующих моделей в тестах на компьютерное использование. Эти бенчмарки проверяют не «эрудицию», а умение находить нужные элементы интерфейса и выполнять действия в приложениях.
На OSWorld 2.0 новая модель набрала 72,6%. Для сравнения, GPT-5.6 показал 65,7%, а Claude Opus 5 — 70,2%. Разница не выглядит огромной на бумаге, но в корпоративной автоматизации даже несколько процентов могут означать меньше ручных правок.
Скорость тоже подтянули. В симуляциях OpenAI средняя задача заняла около 40 минут вместо 75 минут. Это почти двукратное сокращение времени, если брать прошлый результат за ориентир.
| Тест | GPT-6 Astra | GPT-5.6 / GPT-5.6 Sol | Конкурент |
|---|---|---|---|
| OSWorld 2.0 | 72,6% | 65,7% | Claude Opus 5 — 70,2% |
| ScreenSpot-Pro | 92,7% | GPT-5.6 Sol — 76,9% | Claude Fable 5 — 87,3% |
| Средняя задача в симуляции | около 40 минут | около 75 минут | нет данных |
ScreenSpot-Pro особенно показателен. Этот тест проверяет, понимает ли модель, куда нажимать на экране. Astra набрал 92,7%, Claude Fable 5 — 87,3%, GPT-5.6 Sol — 76,9%.
Для обычного пользователя это звучит сухо. Для отдела продаж или финансов это разница между «ИИ подсказывает» и «ИИ сам делает черновую работу».
Excel, Power BI и CRM становятся главными сценариями
OpenAI описывает Astra как модель, которой не всегда нужны отдельные API и специальные коннекторы. Она должна работать поверх разных платформ и взаимодействовать с программами через их обычный интерфейс.
- Excel: работа с таблицами напрямую, а не только генерация формул или CSV-файлов.
- Power BI: создание и доработка дашбордов внутри инструмента.
- CRM: обновление записей и заполнение данных без ручного копирования.
- Календари: организация встреч и расписаний через привычный интерфейс.
- Формы: заполнение полей в веб-приложениях и корпоративных системах.
Это важный сдвиг для компаний, которые устали от зоопарка интеграций. Обычно автоматизация требует отдельного подключения к каждому сервису. Astra предлагает другой путь: модель видит экран, понимает задачу и действует внутри уже знакомых приложений.
Звучит удобно, но тут есть трезвый нюанс. Чем больше прав получает ИИ в рабочих системах, тем дороже обходится ошибка. Неправильная правка в CRM или отчете может уйти дальше по цепочке и испортить данные.
Recurrent depth меняет подход к рассуждениям
GPT-6 получил новую архитектуру рассуждений под названием recurrent depth. По описанию OpenAI, модель может возвращаться к задаче несколько раз перед ответом, а не идти по одному линейному ходу рассуждения.
Идея понятная. Если человек решает сложную задачу, он часто перепроверяет себя. Модель пытается делать похожую внутреннюю петлю: подумала, уточнила, снова оценила ситуацию и только потом выдала действие.
Для бизнеса это особенно полезно в задачах с высоким риском ошибки. Например, при работе с финансовыми таблицами, аналитикой или корпоративными данными. Там красивый ответ ничего не стоит, если он неверный.
Но OpenAI прямо признает проблему с безопасностью. Наблюдать за рассуждениями Astra сложнее, чем за обычной цепочкой рассуждений у Sol. Если у модели меняется внутренний способ «думать», ее ошибки тоже становятся менее прозрачными.
Из-за этого OpenAI запускает Astra постепенно и следит за поведением модели. Доступ уже получают пользователи Plus, Pro, Business и Enterprise. Версия Pro доступна на тарифах Pro и выше, а Free и Go пока не получают флагманскую модель.