Содержание
LineShine развернули как CPU-only кластер для обучения ИИ с заявленной производительностью 1,54 экзафлопса — и без единого GPU. Внутри — около 2,45 млн Armv9-ядер на процессорах, связанных с Huawei.
Смысл этой конструкции простой: когда ускорители уровня Nvidia недоступны, можно собрать «монстра» на одних CPU и все равно получить экзафлопсный класс по ИИ-нагрузкам. Но цена вопроса — плотность вычислений и энергоэффективность.
LineShine собрали из 20 480 узлов и 40 960 CPU
По опубликованным параметрам, LineShine состоит из 20 480 вычислительных узлов. В каждом узле стоят два процессора LX2, так что суммарно выходит 40 960 чипов на весь кластер.
Каждый LX2 несет 304 CPU-ядра. Если перемножить, получаем примерно 2,45 млн Armv9-ядер на систему. Это тот случай, когда «многоядерность» перестает быть маркетингом и превращается в архитектурную необходимость.
Что внутри LX2: чиплеты, SVE/SME и HBM на корпусе
Происхождение LX2 описывают осторожно. Процессор разработала Huawei или его спроектировали совместно с одним из китайских центров суперкомпьютинга, но точного первоисточника публично не раскрыли.
Архитектура у чипа нетипичная для привычных серверных CPU. Внутри — два вычислительных чиплета, а ядра собраны в восемь кластеров по 38 ядер в каждом.
На уровне инструкций важны два блока: ARM Scalable Vector Extension (SVE) и Scalable Matrix Extension (SME). Они ускоряют векторные и матричные операции, на которых держится обучение нейросетей.
- FP64: 60,3 терафлопса
- BF16: 240 терафлопс
- INT8: 960 тераопс
Память тоже сделана «по-взрослому». У процессора есть 32 ГБ HBM на корпусе с пропускной способностью до 4 ТБ/с. Плюс поддержка до 256 ГБ DDR5 вне корпуса.
Почему CPU-only вообще имеет смысл для ИИ
Главная идея CPU-only суперкомпьютера — убрать дорогие пересылки данных между CPU и ускорителями. В гетерогенных системах часть времени и энергии уходит на перемещение тензоров и датасетов между разными типами памяти и шинами.
В однородной CPU-схеме вычисления и память живут в одном адресном пространстве. Плюс можно собрать большой когерентный пул памяти, комбинируя быструю HBM и емкую DDR. Это полезно для задач, где ИИ-тренировка идет рядом с тяжелой загрузкой данных и препроцессингом, а еще для сценариев вроде retrieval augmented generation и длинных контекстов, где лимиты GPU-памяти часто становятся узким местом.
Но есть и жесткий компромисс. CPU-only системы обычно проигрывают GPU-суперкомпьютерам по энергоэффективности и плотности ИИ-производительности. Поэтому индустрия в массе ставит на связку CPU + GPU, а не на «одни процессоры».
LineShine здесь выглядит как инженерный ответ на ограничения по доступности GPU и экосистемы CUDA. Это рабочая альтернатива, но не знак того, что CPU внезапно стали лучшим железом для обучения больших моделей.
Часть деталей о LineShine и процессорах LX2 в таком виде собрали и проверили по материалам Tom’s Hardware.