Microsoft добавила в Windows ML для Windows 11 экспериментальный способ локального запуска моделей в форматах GGUF и ONNX — Windows ML Runtime API. Как сообщает IT Home, компания также представила интерфейсы для создания функций генерации текста и распознавания речи.

Windows ML помогает разработчикам запускать ИИ-модели на самом устройстве. GGUF часто используют для хранения моделей, работающих локально, а ONNX позволяет переносить модели между программными инструментами и оборудованием. Отдельно Microsoft сообщила об экспериментальной интеграции с llama.cpp: через неё разработчики могут загрузить GGUF-модель с Hugging Face и запустить её на компьютере.

По словам Microsoft, новый Windows ML Runtime API даёт более глубокую интеграцию с системой и более тонкое управление запуском моделей. Компания также заявила о работе с Nvidia над улучшениями производительности llama.cpp, но результатов измерений в сообщении нет.

Прежний ONNX Runtime API остаётся доступен. Microsoft намерена в первую очередь развивать оптимизации для Windows ML Runtime API, при этом оба варианта входят в текущую версию: разработчикам не требуется переходить на новый интерфейс сразу.
Источник: IT Home.