ACE для x86 — новый набор расширений от Intel и AMD, который ускоряет ИИ-задачи на обычных процессорах. Главное отличие от AVX10 простое: ACE добавляет отдельную логику для умножения матриц, а не заставляет CPU имитировать эту работу через старые векторные команды.
Компании уже опубликовали публичную спецификацию ACE v1. Для x86 это важный шаг, потому что ИИ-нагрузки давно уехали на GPU и NPU. Но не каждая задача выигрывает от такого маршрута.
Маленькая модель, локальный ассистент или операция с жёсткими требованиями к задержке часто лучше чувствуют себя на CPU. Процессору не нужно гонять данные туда и обратно между оперативной памятью и видеокартой. А в ноутбуке или офисном ПК отдельной видеокарты может вообще не быть.
ACE использует AVX10, но считает матрицы отдельным блоком
ACE опирается на существующие регистры AVX10 и работает с 512-битными входными данными, но добавляет специализированный кремний под матричные операции. Такой подход упрощает интеграцию в будущие CPU: разработчикам не нужно придумывать отдельный формат входных данных только ради ACE.
В ИИ матричное умножение — базовая операция. Берём таблицы чисел, перемножаем элементы, складываем результаты и повторяем это миллионы раз. Любой современный CPU умеет такую работу, но делает её не самым прямым способом.
AVX10 уже поддерживает операции multiply-accumulate. Проблема в том, что AVX исторически проектировали под векторные вычисления, а не под двумерные матрицы. Для ИИ это похоже на сборку шкафа кухонным ножом: сделать можно, но инструмент не родной.
По спецификации ACE за то же число входных векторов может выполнить в 16 раз больше операций, чем эквивалентный цикл на AVX10. Это не обещание 16-кратного ускорения в реальных приложениях. Скорость всё равно упрётся в конкретный процессор, частоты, кэш, память и ширину исполнительных блоков.
Но выигрыш в архитектуре уже понятен. Одна инструкция ACE делает больше работы, чем цепочка AVX10-команд. Значит, CPU тратит меньше времени на диспетчеризацию инструкций. В отдельных сценариях это ещё и снижает давление на память.
Один путь кода для PyTorch, TensorFlow и x86-процессоров
Разработчики машинного обучения получают не только новые инструкции, но и единый ориентир для оптимизации. ACE задуман как стандарт без привязки к конкретной реализации Intel или AMD, поэтому библиотеки под PyTorch и TensorFlow смогут держать меньше отдельных веток под разные уровни поддержки AVX.
Это особенно заметно на фоне NPU. Каждый нейропроцессор приходит со своими особенностями, драйверами и ограничениями. CPU с ACE даёт более предсказуемую цель для x86-систем, если задачу нужно выполнить быстро и без долгой адаптации под конкретный ускоритель.
- INT8: компактный формат для инференса и квантованных моделей
- INT32: целочисленные операции с большим диапазоном
- FP8: плотный формат для современных ИИ-вычислений
- FP16: популярный формат для ускорения нейросетей
- FP32: классическая точность для универсальных вычислений
- BF16: формат, часто используемый в обучении и инференсе
ACE также нативно работает с блочно-масштабируемыми форматами MX от Open Compute Project. У AVX10 такой поддержки нет. Для разработчиков это означает меньше ручных преобразований данных и меньше странных обходных путей в библиотеках.
Новый набор команд не отменяет GPU. Большие модели, обучение и массовый инференс останутся на ускорителях. ACE нужен там, где важны задержка, энергоэффективность и доступность вычислений без отдельной видеокарты.
Для владельцев ПК это пока не повод откладывать апгрейд. Intel и AMD не назвали модели процессоров с поддержкой ACE и не дали сроки выхода таких чипов. В июньской спецификации ACE v1 уже зафиксированы INT8, INT32, FP8, FP16, FP32, BF16 и MX-форматы, но дат релиза потребительских CPU с ACE в документе нет.