Как озвучивать текст и клонировать голос в ElevenLabs

Обсудить
Как озвучивать текст и клонировать голос в ElevenLabs
Реклама. АО «ТаймВэб». erid: 2W5zFGYisQD

Синтез речи на основе искусственного интеллекта давно перестал звучать как робот из старых навигаторов. Голоса научились дышать, делать паузы там, где это нужно по смыслу, менять интонацию в зависимости от контекста фразы. ElevenLabs – один из сервисов, где эта технология развита сильнее всего: здесь можно не только озвучить текст готовым голосом из библиотеки, но и переозвучить существующую запись, а также клонировать собственный голос или голос другого человека при наличии его согласия. 

В этом материале разберем основные инструменты платформы – «Text to Speech», «Voice Changer» и клонирование голоса, – а заодно пройдемся по настройкам, тарифам и типичным проблемам, с которыми сталкиваются пользователи. 

Text to Speech: превращаем текст в голос

Раздел «Text to Speech» открывается по одноименной кнопке в боковом меню и представляет собой простое текстовое поле, куда нужно вставить или напечатать нужный текст. Справа расположена панель с настройками голоса, а под полем ввода – счетчик символов, который показывает, сколько места осталось в рамках текущего лимита. Если тестируете сервис впервые, лучше начать с короткого фрагмента в пару предложений, чтобы быстро оценить, подходит ли выбранный голос под задачу.

Процесс генерации выглядит так:

  1. Откройте раздел «Text to Speech» в боковом меню.Переход к нужному разделу для озвучки текста в ElevenLabs

  2. Вставьте или напишите текст в основное поле. Учитывайте, что доступный объем зависит от тарифа.Вставка материала в форму для озвучки текста в ElevenLabs

  3. Нажмите на текущий голос над полем ввода и выберите подходящий вариант. Библиотека голосов открывается через раздел «Voices», а прямо в редакторе можно быстро переключаться между уже добавленными в «My Voices».Выбор голоса для озвучки текста в ElevenLabs

  4. В блоке «Model» укажите модель озвучки. Для русского языка и вообще любого текста не на английском обязательно нужна одна из мультиязычных моделей – например, «Eleven Multilingual v2» или «Eleven v3», поскольку англоязычные модели просто не заточены под другие языки.Выбор модели для озвучки текста в ElevenLabs

  5. При необходимости настройте параметры «Stability», «Similarity» и «Style Exaggeration» – подробнее о них ниже.Дополнительные настройки для озвучки текста в ElevenLabs

  6. Нажмите «Generate speech» и дождитесь обработки.Запуск генерирования для озвучки текста в ElevenLabs

  7. Прослушайте результат прямо в браузере, а если он устраивает – скачайте аудиофайл.Прослушивание результата для озвучки текста в ElevenLabs

Настройки справа влияют на звучание сильнее, чем кажется на первый взгляд, поэтому стоит разобраться, за что отвечает каждая из них. «Stability» определяет, насколько предсказуемо голос звучит от генерации к генерации. При низком значении речь получается более живой и эмоциональной, но иногда неустойчивой – голос может ускоряться или вести себя странно на отдельных фразах. Высокое значение делает подачу ровной и предсказуемой, вплоть до монотонности, зато почти исключает артефакты. Для дикторского текста или технической инструкции разумно держать стабильность на уровне 60-75, а для более живого и эмоционального повествования – ближе к 30-50.

«Similarity» отвечает за то, насколько точно сгенерированный голос повторяет тембр исходного образца, на котором обучалась модель. Разработчики рекомендуют держать это значение в районе 75 и не поднимать выше 80-85, поскольку слишком высокая похожесть иногда тянет за собой шумы и артефакты из исходной записи, если та была не идеального качества. «Style Exaggeration» усиливает характерные особенности голоса – манеру речи, эмоциональность – но одновременно повышает нагрузку на модель и может сделать результат менее стабильным, поэтому в большинстве случаев этот параметр лучше оставлять на нуле и включать только тогда, когда действительно не хватает выразительности.

Ознакомление с разными настройками для озвучки текста в ElevenLabs

Отдельно стоит сказать про выбор модели, поскольку от него зависит итоговое качество не меньше, чем от голоса. «Eleven Flash v2.5» генерирует речь почти мгновенно и расходует меньше кредитов, но по художественной выразительности уступает более тяжелым моделям – годится для быстрых черновиков или задач, где важна скорость. «Eleven Multilingual v2» остается основным выбором для финального контента на русском и других не английских языках. «Eleven v3» – самая свежая модель с поддержкой аудио-тегов вроде смеха, шепота или сарказма прямо в тексте, но она чувствительнее к настройкам и иногда «фантазирует», особенно на длинных фрагментах.

Voice Changer: меняем голос в готовой записи

Если у вас уже есть аудиозапись, например собственная озвучка ролика, но хочется заменить голос, не переписывая интонацию заново, пригодится «Voice Changer». Раньше эта функция называлась Speech to Speech, и суть у нее осталась прежней: сервис берет вашу запись, сохраняет темп, паузы и эмоциональную окраску, но подставляет вместо исходного тембра голос из библиотеки или ваш клон. 

Это может пригодиться, когда нужно быстро озвучить сцену персонажем определенного пола или акцента, а актера озвучки под рукой нет, а также когда хочется исправить неудачное произношение в готовой генерации Text to Speech, не перезаписывая весь фрагмент.

  1. Откройте «Voice Changer» в боковом меню.Переход к изменению голоса в ElevenLabs

  2. Загрузите аудиофайл через область «Click to upload, or drag and drop» или запишите голос прямо в браузере кнопкой «Record audio». Файл должен весить не больше 50 МБ, а длительность записи – не превышать 5 минут: более длинные фрагменты лучше разбить на части и обработать по очереди.Выбор дорожки или запись голоса для изменения в ElevenLabs

  3. В блоке «Voice» выберите целевой голос – из библиотеки, своих клонов или созданных через «Voice Design».Выбор модели или дизайна для изменения голоса в ElevenLabs

  4. Проверьте модель в блоке «Model»: для не английской речи нужна мультиязычная версия.Выбор нового голоса для изменения в ElevenLabs

  5. При шумной исходной записи включите удаление фонового шума – опция находится в дополнительных настройках рядом с параметрами голоса.

  6. Нажмите «Generate speech» и дождитесь обработки.Запуск изменения голоса после настроек в ElevenLabs

Важный нюанс: результат сильно зависит от того, что было в исходной записи. Если читаете текст с акцентом или на определенном языке, итоговый голос унаследует эту особенность, даже если выбранный целевой тембр записан носителем совсем другого языка. Иначе говоря, Voice Changer не переводит речь и не исправляет акцент – он лишь переносит тембр, оставляя манеру произношения практически без изменений.

Клонирование голоса

ElevenLabs предлагает два принципиально разных способа получить собственный голос в сервисе: быстрое клонирование и профессиональное. Разница не только в скорости, но и в том, как модель работает с вашими данными изнутри, поэтому важно понимать, какой вариант подходит именно под вашу задачу, прежде чем тратить время на запись материала.

Instant Voice Clone: быстрый вариант

Мгновенное клонирование использует загруженный образец как референс прямо во время генерации, без обучения отдельной модели. Это самый быстрый путь получить рабочий клон – процесс занимает буквально пару минут, – но и качество здесь ограничено тем, что дал исходный файл: шум, посторонние звуки или недостаточная длительность записи напрямую сказываются на результате.

  1. Откройте раздел «Voices» и нажмите «Create Voice».Переход к созданию голоса в ElevenLabs

  2. Выберите пункт «Instant Voice Clone».Выбор режима быстрого создания голоса в ElevenLabs

  3. Загрузите аудио или запишите голос через микрофон. Минимально хватит около 10 секунд, но для более стабильного результата стоит предоставить хотя бы 1-2 минуты чистой речи без музыки и посторонних голосов.Загрузка или запись аудио для быстрого создания голоса в ElevenLabs

  4. Присвойте голосу имя и, если требуется, подтвердите права на использование записи.Сохранение созданного голоса в ElevenLabs

  5. Дождитесь создания клона – он появится в разделе «My Voices» и станет доступен для выбора в «Text to Speech» и «Voice Changer».

Функция доступна начиная с тарифа Starter: на бесплатном плане клонирование голоса не открывается вовсе.

Professional Voice Clone: студийное качество

Профессиональное клонирование работает иначе – вместо использования записи как референса модель дообучается непосредственно на ваших аудиоданных, подстраивая внутренние параметры под конкретный голос. За счет этого итоговый клон получается заметно точнее: лучше передаются акцент, эмоциональный диапазон и характерные особенности речи, включая паузы и манеру произношения отдельных звуков.

  1. Откройте «Voices», нажмите «Create Voice» и выберите «Professional Voice Clone». Функция доступна только с тарифа Creator и выше.

  2. Загрузите аудиоматериал: разработчики рекомендуют не меньше 30 минут чистой записи, а по-настоящему высокое качество клон показывает от нескольких часов исходников.

  3. Пройдите проверку голоса – сервис использует технологию voice-captcha, чтобы подтвердить, что образец действительно принадлежит вам или что у вас есть право на его использование.

  4. Дождитесь завершения обучения модели. В отличие от мгновенного клонирования, здесь процесс занимает часы, а не минуты.

  5. Проверьте результат в «Text to Speech», сравнив звучание с оригинальной записью, и при необходимости донастройте параметры стабильности и похожести под конкретный клон.Профессиональное создание голоса в ElevenLabs

Записывать материал лучше с приличным микрофоном в тихом помещении, без реверберации и посторонних шумов: модель копирует буквально все, что слышит, включая покашливания, дыхание и особенности комнаты, поэтому чем чище исходник, тем предсказуемее итоговый голос. Также важно выдерживать одну манеру речи на протяжении всей записи – если часть фрагментов начитана спокойно, а часть эмоционально и быстро, модель может «путаться» и выдавать нестабильный результат.

Какой вариант выбрать, зависит от задачи. Для тестов, коротких роликов или личных проектов вполне хватает Instant Voice Clone – результат получаете сразу, а качество для большинства сценариев более чем приемлемое. Если же голос становится частью бренда, используется в аудиокниге или коммерческой озвучке, где слушатель проведет с ним не одну минуту, лучше сразу инвестировать время в Professional Voice Clone – переделывать материал позже обойдется дороже, чем один раз записать его правильно.

Voice Design: создание голоса с нуля

Если клонировать реальный голос не нужно, а требуется, к примеру, персонаж для игры или подкаста, пригодится «Voice Design». Инструмент создает голос с нуля по текстовому описанию – без какой-либо исходной записи.

Использование функции дизайна для создания голоса в ElevenLabs

Открывается функция через «Voices» – «Create Voice» – «Voice Design». В поле «Prompt» нужно словами описать желаемый голос: возраст, пол, тембр, манеру речи и даже характер – например, «глубокий скрипучий голос немолодого злодея с театральной подачей и нотками безумия». Дополнительно можно указать текст для предпрослушивания, чтобы сразу услышать, как голос будет звучать на конкретной фразе. После нажатия «Generate voice» сервис предложит три варианта на выбор, из которых остается сохранить подходящий в «My Voices». Стоит учитывать, что генерация голоса через Voice Design списывает заметно больше кредитов, чем обычная озвучка текста, поэтому есть смысл сразу продумать описание, а не перебирать варианты вслепую.

Что еще есть в сервисе

Помимо основных инструментов для озвучки, в ElevenLabs есть еще несколько разделов, которые могут пригодиться в смежных задачах:

  • «Sound Effects» – генерация звуковых эффектов по текстовому описанию: шаги, скрип двери, звуки природы и так далее.
  • «Music» – создание музыкальных треков и вокала по промту, подходит для фоновой музыки к роликам.
  • «Speech to Text» – транскрибация аудио и видео в текст с расстановкой таймкодов, полезна при подготовке субтитров.
  • «Voice Isolator» – удаление фонового шума и посторонних звуков из уже готовой записи, отдельно от Voice Changer.
  • «Dubbing» – автоматический перевод и переозвучка видео на другой язык с сохранением интонации и тайминга оригинала.
  • «Flows» – конструктор, где можно связать несколько моделей и инструментов в единый сценарий, если задача выходит за рамки одной генерации.

Просмотр доступных инструментов на сайте ElevenLab

Тарифы и лимиты

Работа сервиса построена на кредитах, которые тратятся в зависимости от инструмента и модели. Бесплатный тариф дает 10 000 кредитов в месяц – этого хватает примерно на 10 минут озвучки через мультиязычную модель, – но без права на коммерческое использование и без доступа к клонированию голоса. Тариф Starter за 6 долларов открывает 30 000 кредитов, коммерческую лицензию и Instant Voice Clone. Creator за 22 доллара дает 121 000 кредитов и добавляет Professional Voice Clone вместе с аудио более высокого качества. Тариф Pro за 99 долларов рассчитан на серьезный объем работы – 600 000 кредитов в месяц и вывод через API в максимальном качестве.

Просмотр доступных тарифных планов на сайте ElevenLab

Расход кредитов отличается по инструментам: обычная озвучка текста через мультиязычную модель стоит 1 кредит за символ, быстрые модели вроде Flash обходятся дешевле – от 0,5 кредита за символ. Voice Changer и Voice Isolator списывают около 1000 кредитов за минуту обработки, а генерация музыки – около 900 кредитов за минуту. Неизрасходованные кредиты переносятся на следующие месяцы, но не больше чем на двукратный объем месячного лимита, поэтому копить их про запас на несколько месяцев вперед не получится.

Типичные проблемы и как их решить

При работе с сервисом периодически возникают одни и те же сложности, и большинство из них решается достаточно просто.

  • Неправильное произношение слов чаще всего связано с опечатками в исходном тексте – модель озвучивает написанное буквально, не пытаясь угадать правильный вариант. Перед генерацией стоит перечитать текст на предмет ошибок, а числа и сокращения лучше прописывать словами, если хочется получить предсказуемый результат: «двадцать пятого» вместо «25-го» модель прочитает куда увереннее.
  • Смена языка или акцента посреди длинной генерации – известная проблема, особенно на объемных фрагментах текста. Помогает разбивка большого текста на смысловые куски покороче, а также использование клонированного голоса, обученного именно на нужном языке: голоса из общей библиотеки в основном ориентированы на английский и могут «соскальзывать» в него на сложных фразах.
  • Артефакты и посторонние звуки в клонированном голосе почти всегда тянутся из исходной записи. Если в референсе есть шум, эхо или сжатие звука низкого качества, а параметр «Similarity» выставлен близко к максимуму, модель честно воспроизведет все эти дефекты вместе с тембром. Решение – переписать референс в тишине с приличным микрофоном либо снизить значение похожести, пожертвовав точностью ради чистоты звучания.
  • Если генерация звучит нестабильно или голос вдруг начинает говорить слишком быстро, в первую очередь стоит проверить параметр «Style Exaggeration» – при значении выше нуля он повышает выразительность, но заодно расшатывает стабильность модели. В большинстве случаев проблему решает возврат этого ползунка на ноль и небольшое повышение «Stability».

Заключение

Настройка голоса под конкретную задачу редко получается с первого раза – параметры стабильности, похожести и модель приходится подбирать заново под каждый новый тембр и стиль текста. Начинать удобнее с рекомендованных значений: стабильность около 50, похожесть около 75, стиль на нуле, а дальше уже отталкиваться от того, чего не хватает в звучании – живости, четкости или предсказуемости. 

Отдельное внимание стоит уделить исходному материалу при клонировании: сколько бы настроек ни было в интерфейсе, ни одна из них не исправит шумную или неровную по манере речи запись, поэтому основное время лучше вкладывать именно в подготовку референса, а не в подбор параметров после. 

Наши постоянные авторы и читатели делятся лайфхаками, основанными на личном опыте. Полная свобода самовыражения.

Комментарии

С помощью соцсетей
У меня нет аккаунта Зарегистрироваться
С помощью соцсетей
У меня уже есть аккаунт Войти
Инструкции по восстановлению пароля высланы на Ваш адрес электронной почты.
Пожалуйста, укажите email вашего аккаунта
Ваш баланс 10 ТК
1 ТК = 1 ₽
О том, как заработать и потратить Таймкарму, читайте в этой статье
Чтобы потратить Таймкарму, зарегистрируйтесь на нашем сайте