Pathway BDH-CQ показала на бенчмарке ARC-AGI-1 результат 29,5% pass@2 при цене $0,0007 за задачу, то есть около 6 копеек. Для модели на 150 млн параметров это редкий случай, когда архитектура выглядит не менее важной, чем размер.
Pathway, лаборатория с фокусом на Post-Transformer архитектурах, опубликовала результаты своей reasoning-модели BDH-CQ. Главная мысль простая: дорогие рассуждения ИИ часто дорожают из-за лишних токенов, а не из-за самой сложности задачи.
Мы не говорим о победе над топовыми frontier-моделями. Claude Opus 5 и Gemini 3.1 Pro всё ещё сильно впереди по качеству. Но Pathway бьёт в другое место — стоимость вывода, где каждый токен превращается в деньги.
ARC-AGI-1: 29,5% за $0,0007 на задачу
На публичном наборе ARC-AGI-1 модель Pathway набрала 29,5% pass@2, а сравнимая по сценарию GPT 5.6 Luna (Low), лежащая под ChatGPT, показала 34,2% при цене $0,008 за задачу. Разница в качестве есть, но разница в цене крупнее — примерно в 11 раз.
ARC-AGI-1 проверяет не знание фактов, а умение вывести правило из нескольких примеров. Система получает небольшие задачи и должна применить найденную закономерность к новым входным данным. Это ближе к тесту на обобщение, чем к обычной викторине.
Цены выглядят особенно любопытно на фоне недавнего снижения стоимости Luna. Разрыв уже учитывает 80-процентное удешевление OpenAI, которое стартовало 30 июля 2026 года.
| Модель | Результат ARC-AGI-1 | Цена за задачу |
|---|---|---|
| Pathway BDH-CQ 150M | 29,5% pass@2 | $0,0007, около 6 копеек |
| GPT 5.6 Luna (Low) | 34,2% | $0,008, около 70 копеек |
| Claude Opus 5 | 97-98% | около $0,5-$0,6, примерно 45-55 рублей |
| Gemini 3.1 Pro | 97-98% | около $0,5-$0,6, примерно 45-55 рублей |
| Qwen3 235B | ниже своего Low-варианта | более чем в 3 раза дороже BDH-CQ |
На верхнем конце таблицы цена за качество растёт резко. Claude Opus 5 и Gemini 3.1 Pro набирают почти потолочные 97-98%, но одна задача стоит примерно в тысячу раз дороже, чем у BDH-CQ.
BDH-CQ считает в памяти, а не печатает ход мысли
Разница в стоимости идёт от способа рассуждения: многие reasoning-системы сначала пишут длинный промежуточный текст, токен за токеном, а уже потом дают ответ. BDH-CQ решает задачу внутри собственной памяти и не тратит бюджет на видимую цепочку рассуждений.
Для пользователя это звучит почти бытово. Одна модель думает «вслух» и выставляет счёт за каждую строку. Другая делает часть работы молча, поэтому тратит меньше вычислений на тот же тип задачи.
Глава и сооснователь Pathway Зузанна Стамировска сформулировала позицию компании так: «Сегодняшний ИИ платит высокий токеновый налог за рассуждения, но этот налог задаёт архитектура, а не закон интеллекта».
В AWS результат BDH-CQ назвали шагом к более доступному применению reasoning-моделей в продуктах. Представитель Amazon Web Services Николя Тардуччи сказал, что клиенты всё чаще хотят перенести продвинутые рассуждения из экспериментов в продакшен, где важны производительность, эффективность и масштабирование.
У Pathway есть и более длинная заявка. Компания утверждает, что ранние эксперименты уже следуют Transformer-подобным законам масштабирования на размерах от 1 млрд до 600 млрд параметров. Если это подтвердится на сложных тестах, разговор уйдёт от простого «сделаем модель больше» к вопросу, как именно она тратит вычисления.
Следующие цели Pathway — математические рассуждения, ARC-AGI-2 и полноценные оценки ARC-AGI-3. Подробности компания опубликовала в своём отчёте по BDH-CQ.
Лукаш Кайзер, соавтор оригинальной статьи о Transformer 2017 года, описал результат коротко: «Pathway показывает, что архитектура модели, а не только масштаб, может двигать следующий скачок в reasoning-ИИ».