CXL для AI-серверов выходит за пределы одной стойки: Meta и Panmnesia работают над схемой, где до 960 AI-ускорителей попадают в один домен согласованности.

Идея звучит почти как мечта архитектора дата-центра. Несколько стоек должны вести себя не как набор отдельных серверов, а как один большой вычислительный блок. Для обучения нейросетей это больное место: тысячи ускорителей постоянно синхронизируются и ждут самый медленный узел.

CXL переносит согласованность за пределы сервера

Compute Express Link, или CXL, в этой архитектуре связывает CPU, ускорители и память через несколько стоек без обычного обмена по Ethernet или InfiniBand внутри такого домена. Смысл в том, чтобы сократить разброс задержек, который растет при масштабировании AI-кластера на сотни серверов.

Продолжение после рекламы

Обычные сети хорошо справляются с большой пропускной способностью. Но они тащат за собой пакетную обработку, сетевой стек и программную координацию. Для веб-сервисов это нормально. Для обучения большой модели лишние микросекунды превращаются в простой дорогих ускорителей.

Panmnesia предлагает добавить к CXL отдельные аппаратные блоки. Они должны держать обмен между стойками более предсказуемым, чем у классической сетевой схемы.

  • High-fan-out switch: коммутирует большое число CXL-линий в общей фабрике.
  • Link acceleration unit: ускоряет обмен по линиям между узлами.
  • Fabric controller: управляет трафиком и поведением общей CXL-фабрики.

Архитекторы раскладывают систему на trays, pods и fabric. Это похоже на то, как инженеры группируют функциональные блоки внутри чипа. Только масштаб тут уже серверный: не миллиметры кремния, а стойки в дата-центре.

Сравнение с NVIDIA GB200 NVL72

Изображение к статье: CXL от Meta и Panmnesia свяжет до 960 AI-ускорителей

Главное отличие от референса NVIDIA в числе ускорителей на один CPU: в GB200 NVL72 один процессор напрямую работает с двумя ускорителями через NVLink-C2C, а схема Panmnesia поднимает это число до 16. На бумаге это восьмикратный рост координации на процессор.

Параметр NVIDIA GB200 NVL72 Архитектура Panmnesia CXL
Связь CPU и ускорителей NVLink-C2C CXL-фабрика
Ускорителей на один CPU 2 16
Рост координации Базовый уровень В 8 раз выше
Размер домена Один крупный узел NVL72 Около 60 групп, до 960 ускорителей

Если объединить около 60 таких групп, получается домен примерно на 960 ускорителей. Это уже почти тысяча GPU-класса устройств, которые видят общую согласованную среду. Не магия, конечно: физика линий и задержки никуда не исчезают.

Но цифры по задержкам выглядят сильнее обычного серверного апгрейда. Доступ между стойками должен уйти с микросекундного уровня к нескольким сотням наносекунд. Разница примерно на порядок, если сравнивать с типичным сетевым обменом за пределами одной системы.

Есть и эксплуатационный плюс. Архитектура разделяет устройства так, что отказавший ускоритель можно заменить отдельно. Весь сервер при этом не придется выводить из работы. Реальная польза зависит от реализации, но для крупных AI-кластеров даже такая мелочь быстро превращается в деньги.

Главное ограничение — длина линии CXL

У проекта остается жесткий физический потолок: электрический CXL на скорости 128 GT/s с двумя ретаймерами тянется примерно на 7 метров. Для одной стойки или соседних узлов этого хватает, но дата-центр на несколько залов так не собрать.

Panmnesia поэтому продвигает оптические CXL-линии для дальних соединений. Компания уже провела аппаратную проверку proof-of-concept для такого подхода. Это не серийный продукт, но уже не слайд с красивой стрелкой между стойками.

Продолжение после рекламы

По кремнию у Panmnesia тоже есть прогресс. Fabric controller и link acceleration unit прошли silicon validation. High-fan-out switch уже изготовили, а предварительные образцы кремния поставляют для дальнейшей разработки коммерческих продуктов.

Глава Panmnesia Мёнсу Чон сформулировал цель прямо: «CXL дает всему дата-центру работать как единой вычислительной системе». Техническое ограничение пока такое же конкретное: электрическая линия CXL при 128 GT/s и двух ретаймерах держит около 7 метров.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.