Nvidia бесплатно опубликовала Nemotron 3 Diarization — модель, которая определяет, кто и когда говорит на записи. Она различает до восьми участников, в том числе когда их голоса накладываются друг на друга. Такая разметка помогает связать реплики с участниками встречи, но для получения текста модель нужно использовать вместе с системой распознавания речи.

Nemotron 3 Diarization содержит 100 млн параметров и работает как с готовыми записями, так и с поступающим в реальном времени звуком. В последнем случае можно выбирать, сколько аудио модель накопит перед определением говорящего: 0,32, 0,64 или 1,04 секунды. Более длинный фрагмент даёт ей больше контекста и повышает точность. Для обработки готовой записи стандартная настройка использует фрагменты по 30,4 секунды.

В тесте DIHARD III частота ошибок определения говорящего у новой модели при обработке записи составила 12,73%. У прежней Streaming Sortformer v2.1, рассчитанной максимум на четырёх участников, — 19,09%, пишет PC Watch. Частота ошибок здесь отражает качество распределения времени речи между участниками, а не точность расшифровки слов.

Изображение к статье: Nvidia открыла Nemotron 3 Diarization для разделения голосов

Веса модели доступны на Hugging Face по лицензии OpenMDW-1.1, разрешающей коммерческое использование. Для локального запуска предусмотрены NeMo-Speech.cpp, Nvidia NeMo и Hugging Face Transformers; среди указанного совместимого оборудования — системы с видеокартами Nvidia. На вход требуется монофонический звук с частотой дискретизации 16 кГц.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.