LineShine развернули как CPU-only кластер для обучения ИИ с заявленной производительностью 1,54 экзафлопса — и без единого GPU. Внутри — около 2,45 млн Armv9-ядер на процессорах, связанных с Huawei.

Смысл этой конструкции простой: когда ускорители уровня Nvidia недоступны, можно собрать «монстра» на одних CPU и все равно получить экзафлопсный класс по ИИ-нагрузкам. Но цена вопроса — плотность вычислений и энергоэффективность.

LineShine собрали из 20 480 узлов и 40 960 CPU

По опубликованным параметрам, LineShine состоит из 20 480 вычислительных узлов. В каждом узле стоят два процессора LX2, так что суммарно выходит 40 960 чипов на весь кластер.

Продолжение после рекламы

Каждый LX2 несет 304 CPU-ядра. Если перемножить, получаем примерно 2,45 млн Armv9-ядер на систему. Это тот случай, когда «многоядерность» перестает быть маркетингом и превращается в архитектурную необходимость.

Что внутри LX2: чиплеты, SVE/SME и HBM на корпусе

Происхождение LX2 описывают осторожно. Процессор разработала Huawei или его спроектировали совместно с одним из китайских центров суперкомпьютинга, но точного первоисточника публично не раскрыли.

Архитектура у чипа нетипичная для привычных серверных CPU. Внутри — два вычислительных чиплета, а ядра собраны в восемь кластеров по 38 ядер в каждом.

Изображение к статье: LineShine: CPU-суперкомпьютер на 1,54 экзафлопса без GPU

На уровне инструкций важны два блока: ARM Scalable Vector Extension (SVE) и Scalable Matrix Extension (SME). Они ускоряют векторные и матричные операции, на которых держится обучение нейросетей.

  • FP64: 60,3 терафлопса
  • BF16: 240 терафлопс
  • INT8: 960 тераопс

Память тоже сделана «по-взрослому». У процессора есть 32 ГБ HBM на корпусе с пропускной способностью до 4 ТБ/с. Плюс поддержка до 256 ГБ DDR5 вне корпуса.

Почему CPU-only вообще имеет смысл для ИИ

Главная идея CPU-only суперкомпьютера — убрать дорогие пересылки данных между CPU и ускорителями. В гетерогенных системах часть времени и энергии уходит на перемещение тензоров и датасетов между разными типами памяти и шинами.

В однородной CPU-схеме вычисления и память живут в одном адресном пространстве. Плюс можно собрать большой когерентный пул памяти, комбинируя быструю HBM и емкую DDR. Это полезно для задач, где ИИ-тренировка идет рядом с тяжелой загрузкой данных и препроцессингом, а еще для сценариев вроде retrieval augmented generation и длинных контекстов, где лимиты GPU-памяти часто становятся узким местом.

Но есть и жесткий компромисс. CPU-only системы обычно проигрывают GPU-суперкомпьютерам по энергоэффективности и плотности ИИ-производительности. Поэтому индустрия в массе ставит на связку CPU + GPU, а не на «одни процессоры».

LineShine здесь выглядит как инженерный ответ на ограничения по доступности GPU и экосистемы CUDA. Это рабочая альтернатива, но не знак того, что CPU внезапно стали лучшим железом для обучения больших моделей.

Продолжение после рекламы

Часть деталей о LineShine и процессорах LX2 в таком виде собрали и проверили по материалам Tom’s Hardware.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.