Huawei Ascend 910C впервые привязали к крупной тренировочной задаче DeepSeek: группа с участием Huawei заявила о полном посттрейнинге модели DeepSeek V4-Pro на кластере из 1000 ускорителей.
Речь не о запуске готовой нейросети на инференсе, где китайские ускорители уже выглядят крепче. Команда говорит именно о full-parameter post-training — этапе, где меняют все веса модели, а не прикручивают тонкий адаптер сверху.
DeepSeek V4-Pro дообучали всем набором весов
По данным South China Morning Post, городские власти Шэньчжэня сообщили о кластере минимум из 1000 чипов Ascend 910C, который использовали для полного посттрейнинга DeepSeek V4-Pro с 1,6 трлн параметров.
В проекте участвовали Huawei Technologies, Shenzhen Loop Area Institute, кампус Харбинского политехнического института в Шэньчжэне и Shenzhen Research Institute of Big Data. Заявление важно именно из-за масштаба. До сих пор слабым местом китайских AI-чипов оставались не ответы модели, а обучение.
Ascend 910C — флагманский AI-ускоритель Huawei с двумя кристаллами. В ранних тестах DeepSeek он выдавал около 60% производительности Nvidia H100 на инференсе. Для готовой модели это уже рабочая зона. Для тренировки нагрузка жестче: нужно синхронно пересчитывать веса, гонять данные между чипами и держать софт без сбоев.
Посттрейнинг идет после базового обучения. На предобучении модель набирает основные навыки на огромных корпусах текста. В документации DeepSeek для V4-Pro указан корпус больше 32 трлн токенов. После этого модель доводят инструкциями, проверками безопасности и узкими наборами данных под задачи.
Полный посттрейнинг лучше обычного adapter-tuning. В таком режиме команда обновляет каждый параметр модели. Для 1,6 трлн параметров это уже серьезная проверка памяти, межсоединений и программного стека.
Без бенчмарков заявление пока держится на доверии
Главная оговорка простая: публичных цифр по этому запуску нет. В заявлении нет времени обучения, сравнения с Nvidia, потребления кластера и данных о том, насколько эффективно загрузили все 1000 ускорителей Ascend 910C.
Нам бы не хотелось путать две разные вещи. Посттрейнинг большой модели на Ascend — сильный результат для платформы Huawei, если он прошел именно так. Но это не доказывает, что Ascend 910C уже готов предобучать frontier-модель с нуля.
Разница тут не академическая. Предобучение тяжелее, дороже и дольше. Оно сильнее упирается в сеть между ускорителями, стабильность драйверов и зрелость софта. В случае Nvidia эту роль играет экосистема CUDA. У Huawei аналогичную задачу закрывает стек CANN.
Контекст делает новость более осторожной. В августе появлялись данные, что DeepSeek не смогла завершить успешный тренировочный прогон модели R2 на Ascend, даже с инженерами Huawei на площадке. Среди причин называли нестабильную производительность, медленные связи между чипами и пробелы в CANN.
После этого DeepSeek, по тем же данным, вернулась к Nvidia GPU для обучения, а Ascend оставила для инференса. DeepSeek V4-Pro вышла в апреле и стала первой моделью DeepSeek, которую изначально строили вокруг Ascend.
- Время прогона: сколько занял полный посттрейнинг V4-Pro.
- Сравнение: как тот же сценарий выглядел бы на Nvidia H100.
- Утилизация: какую долю времени 1000 чипов реально работали под нагрузкой.
DeepSeek публично не комментировала заявление Шэньчжэня. Из подтвержденных дат пока есть только релиз DeepSeek V4-Pro в апреле и августовские сообщения о проблемах с обучением R2 на Ascend.