ElevenLabs представила голосовые модели v4 и v4 Turbo. Они поддерживают более 90 языков вместо 70 у предыдущего поколения. Компания также заявляет, что для клонирования голоса с помощью v4 достаточно 10 секунд исходной записи.

Как сообщает IT Home, модели получили более точное управление интонацией. При озвучивании длинного текста они должны лучше сохранять тембр говорящего и учитывать контекст соседних фраз. В v4 можно задавать несколько текстовых меток эмоций подряд: модель обрабатывает их в указанном порядке. По оценке ElevenLabs, заметнее всего качество синтеза улучшилось для японского, бразильского португальского, путунхуа и кантонского.

Для голосовых помощников компания выделяет снижение задержки ответа. v4 может начинать создавать аудио, пока языковая модель ещё формирует текст ответа. Это должно сокращать паузы в разговоре — сценарий, для которого ElevenLabs предлагает новые модели.

Источник: IT Home.

Продолжение после рекламы

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.