Huawei Ascend 960E рассчитан на ИИ-модели до 10 трлн параметров: компания делает ставку не на один рекордный ускоритель, а на огромные связки чипов и быстрый обмен данными между ними.

Главная ставка в новой дорожной карте — UnifiedBus. Это внутренняя архитектура соединения процессоров, памяти и накопителей. Huawei продвигает её как ответ на боль больших ИИ-систем: тысячи ускорителей должны постоянно гонять данные, иначе часть вычислительной мощности простаивает.

Atlas 960E связывает 4096 NPU в одной системе

Atlas 960E использует UnifiedBus для объединения до 4096 NPU с доступом к общей памяти внутри SuperPoD. Для обучения больших моделей это критично: чем крупнее нейросеть, тем сильнее система упирается не только в FLOPS, но и в задержки обмена.

Продолжение после рекламы

Huawei дополнила UnifiedBus оптической технологией Hi-ONE. В этой схеме оптические компоненты размещают ближе к процессорам. Такой подход называют near-packaged optics, или NPO. Он сокращает путь сигнала и снижает энергозатраты на межпроцессорный обмен.

  • До 4096 NPU: единая связка ускорителей внутри SuperPoD
  • 8 EFLOPS FP8: заявленная вычислительная производительность
  • До 10 трлн параметров: поддерживаемый размер ИИ-моделей
  • Около 5500 Hi-ONE: вместо примерно 48000 обычных 800G-оптических модулей
  • Более 550 кВт: заявленное снижение потребления в системе межсоединений

Это не похоже на обычный апгрейд ускорителя, где компания просто поднимает частоты и добавляет память. Huawei пытается выиграть за счёт масштаба. Если отдельный Ascend уступает лучшим решениям Nvidia, проблему можно частично закрыть числом чипов и более плотной связью между ними.

Дорожная карта Ascend 960 уходит в десятки тысяч процессоров

Изображение к статье: Huawei Ascend 960E потянет модели на 10 трлн параметров

Более крупная конфигурация Atlas 960 SuperPoD в дорожной карте Huawei выросла до 15488 процессоров Ascend 960. Ранее компания говорила о варианте на 8192 процессора, так что масштаб почти удвоили.

Система Процессоры / NPU FP8 Память и обмен
Atlas 960E До 4096 NPU 8 EFLOPS Общая память через UnifiedBus
Atlas 960 SuperPoD До 15488 Ascend 960 30 EFLOPS 4460 ТБ памяти, 34 ПБ/с

Для старшей конфигурации Huawei заявляет 30 EFLOPS в FP8 и 60 EFLOPS в FP4. Объём памяти достигает 4460 ТБ, а пропускная способность межсоединения — 34 ПБ/с. Ожидаемая скорость обучения указана на уровне 15,9 млн токенов в секунду.

Пока это паспортные характеристики Huawei, а не результаты независимых тестов. Для таких систем это особенно важно. В реальной нагрузке всё решают компилятор, сеть, стек обучения и то, насколько ровно модель раскладывается по тысячам ускорителей.

Atlas 960E можно объединять в SuperCluster на 512000 NPU. Huawei также говорит об архитектуре, которая в перспективе поддержит конфигурации с миллионом процессоров. Звучит массивно, но логика понятна: современные LLM уже давно не живут на одном сервере.

Huawei ускоряет график Ascend 960DT и 960PR

Huawei сдвинула сроки для семейства Ascend 960. Версия Ascend 960DT теперь запланирована на I квартал 2027 года, а Ascend 960PR — на III квартал 2027 года. Компания говорит, что обе версии выйдут раньше прежнего графика.

Дэвид Ван, заместитель председателя и ротирующий председатель Huawei, описал темп разработки так: “Мы развиваем серию Ascend по циклу одно поколение в год”. В том же выступлении Huawei связала будущий рост с Tau Scaling Law. Компания ожидает, что спецификации вычислений продолжат удваиваться.

В 2028 и 2029 годах Huawei планирует вывести чипы Ascend 970 и Ascend 980. Эти сроки компания озвучила в публичном выступлении Дэвида Вана на мероприятии Huawei, где раскрыла обновлённую дорожную карту Ascend.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.