Содержание
CUDA на AMD в Windows перестала быть чистой теорией: разработчик Speedstu собрал открытый проект CUDA-for-AMD-Windows, который запускает часть CUDA-зависимых задач на Radeon без виртуализации, WSL2 и второй системы.
Это не новая среда выполнения и не магическая замена видеокартам Nvidia. Проект связывает ZLUDA v6-preview.69 с Windows-версией AMD HIP/ROCm SDK. Скрипты на PowerShell определяют архитектуру GPU, подтягивают нужную версию ZLUDA и мапят CUDA-вызовы на библиотеки AMD.
Контекст тут важнее хайпа. Nvidia годами держит сильный ров вокруг CUDA. Даже когда AMD подтянула ROCm на Windows, многие AI-репозитории и старые научные проекты всё равно требуют CUDA в зависимостях. Иногда автор просто захардкодил Nvidia, и всё.
Что именно заработало на Radeon RX 9060 XT
Speedstu проверил связку на игровой Radeon RX 9060 XT и запустил CUDA-зависимую нагрузку без правок в самих CUDA-библиотеках. Пока это единственная видеокарта, которую проект прямо называет официально поддержанной.
- CUDA Driver API: базовые вызовы драйверного уровня
- cuBLAS: операции линейной алгебры
- cuSPARSE: работа с разреженными матрицами
- cuFFT: быстрые преобразования Фурье
Для проверки автор обучил PPO-сеть для reinforcement learning на 2,2 млн параметров. Нагрузка прошла end-to-end на Radeon RX 9060 XT. Для домашних экспериментов с нейросетями это уже интересный результат, хотя до универсальной совместимости далеко.
Сам проект открыт на GitHub: CUDA-for-AMD-Windows. По сути, это автоматизированный адаптер между софтом, который требует CUDA, и стеком AMD HIP/ROCm под Windows.
Бенчмарки: чистый путь ZLUDA оказался быстрее
В документации проекта есть A/B-тест на той же PPO-нагрузке с 2,2 млн параметров. Публичная связка ZLUDA и штатного HIP SDK 6.4 показала медианные 13 278 SPS, а кастомный восстановленный слой на старых бинарниках ZLUDA отстал примерно на 3%.
| Метрика | Public upstream | Recovered custom | Разница |
|---|---|---|---|
| Overall SPS, median | 13 278,46 | 12 875,80 | -3,03% |
| Overall SPS, mean | 13 172,49 | 12 649,83 | -3,97% |
| Collection SPS, median | 63 306,00 | 59 360,67 | -6,23% |
| Consumption SPS, median | 16 806,36 | 16 445,66 | -2,15% |
| Inference time, median | 0,5863 с | 0,6293 с | +7,33% |
| PPO learn time, median | 3,2076 с | 3,2958 с | +2,75% |
Чистая публичная ветка выглядит предпочтительнее. Она быстрее в общем throughput и не требует собирать стек из восстановленных старых компонентов.
Но сам автор честно фиксирует цену такого подхода. В документации сказано, что более поздняя переработка убрала LibTorch/ZLUDA из PPO и дала заметно более высокую скорость. Значит, прослойка трансляции всё равно съедает часть производительности.
ROCm на Windows уже лучше, но CUDA-зависимости никуда не делись

AMD недавно укрепила Windows-поддержку ROCm для потребительских видеокарт. Официальная связка PyTorch и HIP SDK теперь закрывает Radeon RX 7000 и Radeon RX 9000, что раньше было больным местом для владельцев обычных игровых карт.
Проблема начинается там, где софт не хочет работать с HIP. Это могут быть старые репозитории, экспериментальные инструменты с GitHub или специализированные AI-приложения. Они проверяют наличие CUDA, тянут CUDA-библиотеки и не предлагают альтернативный путь для AMD.
CUDA-for-AMD-Windows закрывает именно этот сценарий. Не корпоративный продакшен. Не серверную ферму. Скорее рабочий ПК энтузиаста, который хочет запускать CUDA-only инструменты на своей Windows-машине с Radeon.
Главные ограничения: cuDNN, TensorRT и NCCL пока мимо
Проект пока не ломает главный барьер CUDA-экосистемы. Критичные библиотеки cuDNN, TensorRT и NCCL не резолвятся, поэтому совместимость зависит от конкретной нагрузки.
Если AI-инструмент сильно опирается на cuDNN, такая связка не спасёт. Если ему хватает CUDA Driver API, cuBLAS, cuSPARSE или cuFFT, шанс уже есть. Для владельцев Radeon это разница между «вообще не запускается» и «можно проверить без переустановки системы».
Есть и организационный риск. ZLUDA потеряла коммерческую поддержку уже второй раз, а текущий мейнтейнер ведёт проект как хобби выходного дня. Для домашней лаборатории это нормально. Для платной инфраструктуры — слишком хрупкая основа.
Сейчас CUDA-for-AMD-Windows официально поддерживает только Radeon RX 9060 XT; cuDNN, TensorRT и NCCL в этой связке пока не работают.