Pathway BDH-CQ показала на бенчмарке ARC-AGI-1 результат 29,5% pass@2 при цене $0,0007 за задачу, то есть около 6 копеек. Для модели на 150 млн параметров это редкий случай, когда архитектура выглядит не менее важной, чем размер.

Pathway, лаборатория с фокусом на Post-Transformer архитектурах, опубликовала результаты своей reasoning-модели BDH-CQ. Главная мысль простая: дорогие рассуждения ИИ часто дорожают из-за лишних токенов, а не из-за самой сложности задачи.

Мы не говорим о победе над топовыми frontier-моделями. Claude Opus 5 и Gemini 3.1 Pro всё ещё сильно впереди по качеству. Но Pathway бьёт в другое место — стоимость вывода, где каждый токен превращается в деньги.

ARC-AGI-1: 29,5% за $0,0007 на задачу

На публичном наборе ARC-AGI-1 модель Pathway набрала 29,5% pass@2, а сравнимая по сценарию GPT 5.6 Luna (Low), лежащая под ChatGPT, показала 34,2% при цене $0,008 за задачу. Разница в качестве есть, но разница в цене крупнее — примерно в 11 раз.

Продолжение после рекламы

ARC-AGI-1 проверяет не знание фактов, а умение вывести правило из нескольких примеров. Система получает небольшие задачи и должна применить найденную закономерность к новым входным данным. Это ближе к тесту на обобщение, чем к обычной викторине.

Цены выглядят особенно любопытно на фоне недавнего снижения стоимости Luna. Разрыв уже учитывает 80-процентное удешевление OpenAI, которое стартовало 30 июля 2026 года.

Модель Результат ARC-AGI-1 Цена за задачу
Pathway BDH-CQ 150M 29,5% pass@2 $0,0007, около 6 копеек
GPT 5.6 Luna (Low) 34,2% $0,008, около 70 копеек
Claude Opus 5 97-98% около $0,5-$0,6, примерно 45-55 рублей
Gemini 3.1 Pro 97-98% около $0,5-$0,6, примерно 45-55 рублей
Qwen3 235B ниже своего Low-варианта более чем в 3 раза дороже BDH-CQ
Изображение к статье: Модель Pathway BDH-CQ считает дешевле ChatGPT в 11 раз

На верхнем конце таблицы цена за качество растёт резко. Claude Opus 5 и Gemini 3.1 Pro набирают почти потолочные 97-98%, но одна задача стоит примерно в тысячу раз дороже, чем у BDH-CQ.

BDH-CQ считает в памяти, а не печатает ход мысли

Разница в стоимости идёт от способа рассуждения: многие reasoning-системы сначала пишут длинный промежуточный текст, токен за токеном, а уже потом дают ответ. BDH-CQ решает задачу внутри собственной памяти и не тратит бюджет на видимую цепочку рассуждений.

Для пользователя это звучит почти бытово. Одна модель думает «вслух» и выставляет счёт за каждую строку. Другая делает часть работы молча, поэтому тратит меньше вычислений на тот же тип задачи.

Глава и сооснователь Pathway Зузанна Стамировска сформулировала позицию компании так: «Сегодняшний ИИ платит высокий токеновый налог за рассуждения, но этот налог задаёт архитектура, а не закон интеллекта».

В AWS результат BDH-CQ назвали шагом к более доступному применению reasoning-моделей в продуктах. Представитель Amazon Web Services Николя Тардуччи сказал, что клиенты всё чаще хотят перенести продвинутые рассуждения из экспериментов в продакшен, где важны производительность, эффективность и масштабирование.

У Pathway есть и более длинная заявка. Компания утверждает, что ранние эксперименты уже следуют Transformer-подобным законам масштабирования на размерах от 1 млрд до 600 млрд параметров. Если это подтвердится на сложных тестах, разговор уйдёт от простого «сделаем модель больше» к вопросу, как именно она тратит вычисления.

Следующие цели Pathway — математические рассуждения, ARC-AGI-2 и полноценные оценки ARC-AGI-3. Подробности компания опубликовала в своём отчёте по BDH-CQ.

Продолжение после рекламы

Лукаш Кайзер, соавтор оригинальной статьи о Transformer 2017 года, описал результат коротко: «Pathway показывает, что архитектура модели, а не только масштаб, может двигать следующий скачок в reasoning-ИИ».

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.