Содержание
AMD и Cerebras Systems объявили техническое партнерство для AI-инференса: стойки Helios займутся обработкой промптов, а Wafer-Scale Engine будет генерировать токены. Компании заявляют до 5x выше tokens per second per watt против конфигурации Cerebras WSE без Helios.
Угол тут простой: AMD получает доступ к похожей идее разделенного инференса без сделки уровня Nvidia. Nvidia в конце 2025 года лицензировала у Groq технологию SRAM decode за $20 млрд (около 1,6 трлн рублей), причем соглашение не эксклюзивное. Groq и Nvidia описали его как лицензирование inference-технологий для глобального масштаба.
AMD Helios возьмет prefill, Cerebras WSE — decode
Новая схема делит инференс на две части: AMD Helios обрабатывает prompt processing, а Cerebras Wafer-Scale Engine отвечает за выдачу токенов. Это ровно тот случай, когда две разные архитектуры закрывают слабые места друг друга, а не пытаются тащить всю задачу в одиночку.
В LLM-инференсе есть два крупных этапа. Prefill прогоняет входной запрос и готовит контекст. Decode затем генерирует ответ токен за токеном. Для первого этапа нужны память, пропускная способность и плотная работа с большими весами. Для второго сильнее важны задержки и быстрый доступ к данным.
Cerebras WSE давно выглядит убедительно на decode-части. Но prefill для больших моделей дается ему сложнее. Поэтому AMD и Cerebras вынесли prompt processing на Helios, а WSE оставили там, где он сильнее.
Доступ к такой конфигурации обещают через Cerebras Cloud во второй половине 2026 года. То есть речь пока не про коробку для обычного дата-центра с понятным прайсом, а про облачную услугу для клиентов, которым нужен быстрый инференс больших моделей.
Пять раз по ваттам — сильная цифра, но не вся картина
Заявленные 5x по TPS/W компании получили во внутренних тестах на open-source модели Kimi 2.6 1T. Сравнение идет против самостоятельной конфигурации Cerebras WSE, а не против стойки Nvidia или другого rackscale-решения.
Это ключевая оговорка. Без прямых тестов против Nvidia GB200, будущих систем Vera Rubin или других AI-стоек цифра не отвечает на главный вопрос покупателя: сколько токенов на ватт он получит за свои деньги в реальном дата-центре.
Выбор Kimi 2.6 тоже не нейтрален. Moonshot AI выпустила модель 20 апреля 2026 года. Это mixture-of-experts с одним триллионом параметров всего, но только 32 млрд активных параметров на токен. Модель изначально идет в INT4.
В INT4 полный набор весов занимает около 500 ГБ. Один wafer Cerebras держит 44 ГБ. Даже без KV cache конфигурации только на WSE нужно больше дюжины wafers, чтобы просто разместить модель. По объему памяти одна стойка Helios держит такой набор весов примерно шесть десятков раз.
Такой расклад играет против WSE-only. На плотной модели меньшего размера, которая помещается на нескольких wafers, Cerebras могла бы выглядеть лучше. Поэтому 5x не стоит читать как универсальный множитель для любого LLM-инференса.
Финансовые условия AMD и Cerebras пока не раскрыли
AMD и Cerebras не назвали сумму сделки, структуру платежей и возможные обязательства по закупкам железа. Это заметная пауза, потому что рынок AI-инфраструктуры уже нервно смотрит на сделки, где инвестиции и покупки оборудования идут рядом.
У AMD уже был похожий контекст. Компания заключала стратегическое партнерство с Anthropic, где речь шла о развертывании до 2 ГВт систем на GPU AMD Instinct MI450. AMD описала эту сделку в своем официальном сообщении.
Для Cerebras новость выходит в чувствительный момент. Компания вышла на Nasdaq в мае 2026 года по цене $185 за акцию. Бумаги открылись на $350, закрыли первый день на $311,07, а к концу июня откатились примерно к $227.
AMD выглядит крепче на бирже: акции выросли на 121,48% с начала года. Инвесторы ставят на новые Instinct AI processors, а связка с Cerebras добавляет AMD еще один сценарий для Helios в облачном инференсе.
Публичный запуск объединенной конфигурации AMD Helios и Cerebras WSE намечен на вторую половину 2026 года через Cerebras Cloud; цены, регионы доступности и параметры коммерческих SLA компании пока не раскрыли.