ElevenLabs представила голосовые модели v4 и v4 Turbo. Они поддерживают более 90 языков вместо 70 у предыдущего поколения. Компания также заявляет, что для клонирования голоса с помощью v4 достаточно 10 секунд исходной записи.
Как сообщает IT Home, модели получили более точное управление интонацией. При озвучивании длинного текста они должны лучше сохранять тембр говорящего и учитывать контекст соседних фраз. В v4 можно задавать несколько текстовых меток эмоций подряд: модель обрабатывает их в указанном порядке. По оценке ElevenLabs, заметнее всего качество синтеза улучшилось для японского, бразильского португальского, путунхуа и кантонского.
Для голосовых помощников компания выделяет снижение задержки ответа. v4 может начинать создавать аудио, пока языковая модель ещё формирует текст ответа. Это должно сокращать паузы в разговоре — сценарий, для которого ElevenLabs предлагает новые модели.
Источник: IT Home.