Содержание
Huawei Ascend 950PR вызвал заметный интерес у китайских гиперскейлеров не столько «сырой» мощностью, сколько софтом: обновлённый стек CANN Next сделал программирование на Ascend ближе к NVIDIA CUDA. Об этом сообщило Reuters со ссылкой на людей, знакомых с планами компаний.
По данным Reuters, компании стали охотнее смотреть в сторону 950PR, потому что чип теперь лучше совместим с экосистемой CUDA и быстрее откликается в задачах обучения и инференса.
CANN Next копирует модель CUDA: блоки, warps и запуск ядер
Ключевое изменение в CANN Next — переход к SIMT-модели программирования, похожей на CUDA. В неё добавили знакомые разработчикам сущности: thread blocks, warps и kernel launches. Это снижает порог входа для команд, которые годами писали и оптимизировали код под NVIDIA.
При этом идея CANN Next, судя по описанию, не в том, чтобы дать «переводчик» CUDA на Ascend. Huawei скорее пытается сделать так, чтобы разработчик чувствовал себя как в CUDA, а дальше компилятор и рантайм подбирали параметры под железо Ascend.
Ещё один важный момент — CANN Next нацелен на масштабирование «в стойке», а не на одиночный ускоритель. Параметры вроде числа потоков и размеров блоков подбирают с оглядкой на собственные чипы Huawei, чтобы стыковать софт и железо в одном дизайне.
Что известно про Ascend 950PR по характеристикам
По данным из отрасли, Ascend 950PR ориентируют на обучение и инференс в дата-центрах. При этом в обсуждениях вокруг чипа отдельно подчёркивают: для внутренних гиперскейлеров он может уступать решениям NVIDIA по вычислительной части, но выигрывает за счёт более привычной модели разработки.
- Низкая точность: поддержка форматов вплоть до FP8
- Производительность FP8: до 1 PFLOPS
- Производительность FP4: до 2 PFLOPS
- Интерконнект: до 2 TB/s
- Память HBM: «самосборная» HBM Huawei HiBL 1.0
- Объём HBM: 128 ГБ
- Пропускная способность HBM: 1,6 TB/s
Отдельно отмечается, что собственная HBM может снизить риски упора в поставки при наращивании выпуска. В тексте это подают как один из факторов, почему Huawei рассчитывает на более стабильный объём производства.
Планы заказчиков и объёмы выпуска: ByteDance, Alibaba и 750 тысяч чипов
Reuters пишет, что ByteDance и Alibaba планируют размещать заказы на Ascend 950PR в ближайшее время. Там же говорится о целевом объёме выпуска: 750 000 чипов в этом году.
Для китайских дата-центров здесь важен практичный момент: закупки топовых ускорителей NVIDIA, вроде H200, сопровождаются заметной регуляторной нагрузкой. Из-за этого компании либо арендуют мощности за пределами страны, либо активнее смотрят на внутренние альтернативы.
И финальная развилка, которую рынок будет проверять уже в поставках, простая: даже при улучшенной «CUDA-похожести» CANN Next всё упрётся в два ограничения — объёмы самих 950PR и готовность клиентов к массовому развёртыванию.
По данным Reuters, ориентир по выпуску Ascend 950PR на этот год — 750 000 ускорителей.