Содержание
Китайский суперкомпьютер LineShine в центре NSCC в Шэньчжэне относится к редкому классу CPU-only систем для AI и HPC и, по описанию источника, достигает 1,54 Эфлопс (класс ExaFLOPS) без использования GPU. В заголовке материала подчёркивается, что это «монстр» на CPU, который включает 2,4 млн Armv9-ядер, разработанных Huawei.
Тренд понятный. Большинство топовых HPC и AI-кластеров строят по схеме CPU для оркестрации и GPU для плотной математики. В Китае всё чаще идут в CPU-only, потому что доступ к нужным ускорителям ограничен, и их просто сложно набрать в нужных объёмах.
Что известно про процессор LX2: 304 ядра и HBM с 4 ТБ/с
LineShine собрали на кастомных Armv9-процессорах LX2, заточенных под AI и HPC. Разработчика официально не называют, но аналитик Jon Peddie (Jon Peddie Research) прямо называет чип «Huawei LX2». При этом внятных публичных подтверждений, что это именно Huawei, нет: процессор может быть кастомным Huawei HPC CPU, совместной разработкой NSCC/Huawei или продуктом другого китайского разработчика под эгидой государства.
Архитектура у LX2 нетипичная для «обычного серверного CPU». Внутри два вычислительных чиплета и 304 CPU-ядра. Ядра собраны в восемь кластеров по 38 ядер. У каждого ядра есть Arm SVE и SME — блоки для векторных и матричных операций, которые нужны в научных расчётах и обучении нейросетей.
- Поддерживаемые форматы: FP64, FP32, BF16, FP16, INT8
- L1-кэш на ядро: 32 КБ инструкций + 32 КБ данных
- L2-кэш на кластер: 28,5 МБ (общий)
Самая интересная часть — память. LX2 совмещает 32 ГБ HBM прямо в корпусе процессора и до 256 ГБ DDR5 снаружи. Пропускная способность HBM заявлена до 4 ТБ/с. Похожую идею в своё время использовал Fujitsu в A64FX для Fugaku, но здесь речь про Armv9 и явный упор на AI-матрицу.
Цена этой схемы — сложная топология. В одном процессоре 16 NUMA-доменов. Доступ к HBM сильно зависит от «локальности», а DDR ведёт себя ровнее в пределах кристалла и разделяется между кластерами. Для перекидывания данных между DDR и HBM используют выделенный движок SDMA, а софт должен учитывать размещение данных и планирование задач.

По производительности один LX2 заявлен так: 60,3 TFLOPS FP64, 240 TFLOPS BF16/FP16 и 960 TOPS INT8. В описании отдельно подчёркивают, что архитектура выглядит сильно оптимизированной под плотные AI- и матричные нагрузки.
Как устроен LineShine: 20 480 процессоров Armv9
В исходном материале говорится, что машина класса 1,54 ExaFLOPS использует 20 480 Armv9-based CPU. Важно: это именно количество процессоров, а не вычислительных узлов.
Детали уровня «сколько CPU на узел» и, соответственно, точное число узлов в статье-источнике не раскрываются, поэтому корректно фиксировать можно только заявленную конфигурацию по процессорам. В сумме это согласуется с формулировкой из заголовка источника про 2,4 млн Huawei-designed Armv9 cores (округлённое значение, без уточнения до последнего ядра).

Почему CPU-only вообще работает, и где главный компромисс
CPU-only суперкомпьютер в AI и HPC даёт несколько практичных плюсов, особенно в задачах «AI плюс тяжёлый продакшен данных». Когда вычисления и память живут в одном типе процессора, проще избегать дорогих и сложных перегонов CPU-to-GPU, не упираться в ограничения памяти ускорителей и не тащить отдельный «акселераторный» стек под каждую платформу.
Ещё один плюс — большие связные пулы памяти. Комбинация HBM и ёмкой DDR помогает в сценариях с массивными научными датасетами и там, где чисто GPU-памяти часто мало.
Но компромисс жёсткий: CPU-only системы обычно менее энергоэффективны и дают ниже плотную AI-производительность, чем кластеры на GPU. Поэтому индустрия в целом всё равно держится за гетерогенную схему CPU+GPU, особенно там, где важны ватт на TFLOPS и предсказуемая масштабируемость под плотную математику.
Оценку происхождения LX2 публиковал Jon Peddie Research: материал Jon Peddie Research.