Huawei Ascend 910C впервые привязали к крупной тренировочной задаче DeepSeek: группа с участием Huawei заявила о полном посттрейнинге модели DeepSeek V4-Pro на кластере из 1000 ускорителей.

Речь не о запуске готовой нейросети на инференсе, где китайские ускорители уже выглядят крепче. Команда говорит именно о full-parameter post-training — этапе, где меняют все веса модели, а не прикручивают тонкий адаптер сверху.

DeepSeek V4-Pro дообучали всем набором весов

По данным South China Morning Post, городские власти Шэньчжэня сообщили о кластере минимум из 1000 чипов Ascend 910C, который использовали для полного посттрейнинга DeepSeek V4-Pro с 1,6 трлн параметров.

В проекте участвовали Huawei Technologies, Shenzhen Loop Area Institute, кампус Харбинского политехнического института в Шэньчжэне и Shenzhen Research Institute of Big Data. Заявление важно именно из-за масштаба. До сих пор слабым местом китайских AI-чипов оставались не ответы модели, а обучение.

Продолжение после рекламы

Ascend 910C — флагманский AI-ускоритель Huawei с двумя кристаллами. В ранних тестах DeepSeek он выдавал около 60% производительности Nvidia H100 на инференсе. Для готовой модели это уже рабочая зона. Для тренировки нагрузка жестче: нужно синхронно пересчитывать веса, гонять данные между чипами и держать софт без сбоев.

Посттрейнинг идет после базового обучения. На предобучении модель набирает основные навыки на огромных корпусах текста. В документации DeepSeek для V4-Pro указан корпус больше 32 трлн токенов. После этого модель доводят инструкциями, проверками безопасности и узкими наборами данных под задачи.

Полный посттрейнинг лучше обычного adapter-tuning. В таком режиме команда обновляет каждый параметр модели. Для 1,6 трлн параметров это уже серьезная проверка памяти, межсоединений и программного стека.

Изображение к статье: Huawei заявила о дообучении DeepSeek на 1000 Ascend 910C

Без бенчмарков заявление пока держится на доверии

Главная оговорка простая: публичных цифр по этому запуску нет. В заявлении нет времени обучения, сравнения с Nvidia, потребления кластера и данных о том, насколько эффективно загрузили все 1000 ускорителей Ascend 910C.

Нам бы не хотелось путать две разные вещи. Посттрейнинг большой модели на Ascend — сильный результат для платформы Huawei, если он прошел именно так. Но это не доказывает, что Ascend 910C уже готов предобучать frontier-модель с нуля.

Разница тут не академическая. Предобучение тяжелее, дороже и дольше. Оно сильнее упирается в сеть между ускорителями, стабильность драйверов и зрелость софта. В случае Nvidia эту роль играет экосистема CUDA. У Huawei аналогичную задачу закрывает стек CANN.

Контекст делает новость более осторожной. В августе появлялись данные, что DeepSeek не смогла завершить успешный тренировочный прогон модели R2 на Ascend, даже с инженерами Huawei на площадке. Среди причин называли нестабильную производительность, медленные связи между чипами и пробелы в CANN.

После этого DeepSeek, по тем же данным, вернулась к Nvidia GPU для обучения, а Ascend оставила для инференса. DeepSeek V4-Pro вышла в апреле и стала первой моделью DeepSeek, которую изначально строили вокруг Ascend.

  • Время прогона: сколько занял полный посттрейнинг V4-Pro.
  • Сравнение: как тот же сценарий выглядел бы на Nvidia H100.
  • Утилизация: какую долю времени 1000 чипов реально работали под нагрузкой.

DeepSeek публично не комментировала заявление Шэньчжэня. Из подтвержденных дат пока есть только релиз DeepSeek V4-Pro в апреле и августовские сообщения о проблемах с обучением R2 на Ascend.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.