Содержание
CXL для AI-серверов выходит за пределы одной стойки: Meta и Panmnesia работают над схемой, где до 960 AI-ускорителей попадают в один домен согласованности.
Идея звучит почти как мечта архитектора дата-центра. Несколько стоек должны вести себя не как набор отдельных серверов, а как один большой вычислительный блок. Для обучения нейросетей это больное место: тысячи ускорителей постоянно синхронизируются и ждут самый медленный узел.
CXL переносит согласованность за пределы сервера
Compute Express Link, или CXL, в этой архитектуре связывает CPU, ускорители и память через несколько стоек без обычного обмена по Ethernet или InfiniBand внутри такого домена. Смысл в том, чтобы сократить разброс задержек, который растет при масштабировании AI-кластера на сотни серверов.
Обычные сети хорошо справляются с большой пропускной способностью. Но они тащат за собой пакетную обработку, сетевой стек и программную координацию. Для веб-сервисов это нормально. Для обучения большой модели лишние микросекунды превращаются в простой дорогих ускорителей.
Panmnesia предлагает добавить к CXL отдельные аппаратные блоки. Они должны держать обмен между стойками более предсказуемым, чем у классической сетевой схемы.
- High-fan-out switch: коммутирует большое число CXL-линий в общей фабрике.
- Link acceleration unit: ускоряет обмен по линиям между узлами.
- Fabric controller: управляет трафиком и поведением общей CXL-фабрики.
Архитекторы раскладывают систему на trays, pods и fabric. Это похоже на то, как инженеры группируют функциональные блоки внутри чипа. Только масштаб тут уже серверный: не миллиметры кремния, а стойки в дата-центре.
Сравнение с NVIDIA GB200 NVL72
Главное отличие от референса NVIDIA в числе ускорителей на один CPU: в GB200 NVL72 один процессор напрямую работает с двумя ускорителями через NVLink-C2C, а схема Panmnesia поднимает это число до 16. На бумаге это восьмикратный рост координации на процессор.
| Параметр | NVIDIA GB200 NVL72 | Архитектура Panmnesia CXL |
|---|---|---|
| Связь CPU и ускорителей | NVLink-C2C | CXL-фабрика |
| Ускорителей на один CPU | 2 | 16 |
| Рост координации | Базовый уровень | В 8 раз выше |
| Размер домена | Один крупный узел NVL72 | Около 60 групп, до 960 ускорителей |
Если объединить около 60 таких групп, получается домен примерно на 960 ускорителей. Это уже почти тысяча GPU-класса устройств, которые видят общую согласованную среду. Не магия, конечно: физика линий и задержки никуда не исчезают.
Но цифры по задержкам выглядят сильнее обычного серверного апгрейда. Доступ между стойками должен уйти с микросекундного уровня к нескольким сотням наносекунд. Разница примерно на порядок, если сравнивать с типичным сетевым обменом за пределами одной системы.
Есть и эксплуатационный плюс. Архитектура разделяет устройства так, что отказавший ускоритель можно заменить отдельно. Весь сервер при этом не придется выводить из работы. Реальная польза зависит от реализации, но для крупных AI-кластеров даже такая мелочь быстро превращается в деньги.
Главное ограничение — длина линии CXL
У проекта остается жесткий физический потолок: электрический CXL на скорости 128 GT/s с двумя ретаймерами тянется примерно на 7 метров. Для одной стойки или соседних узлов этого хватает, но дата-центр на несколько залов так не собрать.
Panmnesia поэтому продвигает оптические CXL-линии для дальних соединений. Компания уже провела аппаратную проверку proof-of-concept для такого подхода. Это не серийный продукт, но уже не слайд с красивой стрелкой между стойками.
По кремнию у Panmnesia тоже есть прогресс. Fabric controller и link acceleration unit прошли silicon validation. High-fan-out switch уже изготовили, а предварительные образцы кремния поставляют для дальнейшей разработки коммерческих продуктов.
Глава Panmnesia Мёнсу Чон сформулировал цель прямо: «CXL дает всему дата-центру работать как единой вычислительной системе». Техническое ограничение пока такое же конкретное: электрическая линия CXL при 128 GT/s и двух ретаймерах держит около 7 метров.