Nvidia бесплатно опубликовала Nemotron 3 Diarization — модель, которая определяет, кто и когда говорит на записи. Она различает до восьми участников, в том числе когда их голоса накладываются друг на друга. Такая разметка помогает связать реплики с участниками встречи, но для получения текста модель нужно использовать вместе с системой распознавания речи.
Nemotron 3 Diarization содержит 100 млн параметров и работает как с готовыми записями, так и с поступающим в реальном времени звуком. В последнем случае можно выбирать, сколько аудио модель накопит перед определением говорящего: 0,32, 0,64 или 1,04 секунды. Более длинный фрагмент даёт ей больше контекста и повышает точность. Для обработки готовой записи стандартная настройка использует фрагменты по 30,4 секунды.
В тесте DIHARD III частота ошибок определения говорящего у новой модели при обработке записи составила 12,73%. У прежней Streaming Sortformer v2.1, рассчитанной максимум на четырёх участников, — 19,09%, пишет PC Watch. Частота ошибок здесь отражает качество распределения времени речи между участниками, а не точность расшифровки слов.
Веса модели доступны на Hugging Face по лицензии OpenMDW-1.1, разрешающей коммерческое использование. Для локального запуска предусмотрены NeMo-Speech.cpp, Nvidia NeMo и Hugging Face Transformers; среди указанного совместимого оборудования — системы с видеокартами Nvidia. На вход требуется монофонический звук с частотой дискретизации 16 кГц.