Назад к блогу
#озвучка#нейромонтаж#нейросети

Озвучка текста нейросетью: ElevenLabs, клон голоса и бесплатные аналоги

Как сделать озвучку текста нейросетью: ElevenLabs по шагам, разметка текста, клонирование своего голоса, тарифы, работа из России и бесплатные аналоги на русском.

Артём Исламов14 мин чтения
Содержание

Озвучка текста нейросетью в 2026 году звучит почти как живой диктор: с дыханием, паузами и интонацией. Вставляете текст, выбираете голос и через несколько секунд скачиваете готовый файл. Чаще всего для этого берут ElevenLabs, бесплатно можно начать с голоса браузера, озвучки в CapCut или программы VoiceStudio на своём компьютере, а свой голос клонируется по записи длиной в пару минут.

Озвучку для роликов я делаю в ElevenLabs, поэтому ниже весь путь по шагам: как подготовить текст, какие настройки трогать, как записать образец для клона своего голоса и чем заменить ElevenLabs, если он вам недоступен.

Озвучка текста нейросетью: как звучит в 2026 году и где уместна

На коротких текстах хорошую нейроозвучку почти не отличить от человека. Слабых мест два: длинные тексты, где голос постепенно становится монотонным, и незнакомые модели слова (фамилии, термины, редкие ударения).

Модели обновляются быстро. 28 сентября 2026 года ElevenLabs выпустила Eleven v4: больше 90 языков, расширенные теги эмоций и клон голоса по фрагменту примерно в 10 секунд. Русский поддерживают все основные модели сервиса.

Где нейросетевой голос уже уместен:

  • Обучающие видео и инструкции. Ровный понятный голос, а правка текста не требует перезаписи всего урока.
  • Короткие ролики без лица и голоса автора. Голос нейросети, субтитры и графика собирают ролик целиком.
  • Ваш текст вашим голосом. Записали образец один раз, дальше правите сценарий и перегенерируете фразу, а не переписываете дубль.
  • Перевод роликов на другие языки. Дубляж сохраняет тембр исходного голоса.
  • Подкасты и аудиоверсии статей. Особенно когда текст уже написан и вычитан.

Живой голос пока лучше там, где важна импровизация: личные истории, юмор на интонации, эфиры. Нейросеть хорошо читает, но не играет.

ElevenLabs: озвучка текста по шагам

ElevenLabs это самый известный сервис нейроозвучки: живые голоса, хороший русский, клонирование и дубляж в одном месте. От текста до готового файла уходит пара минут.

Шаг 1. Регистрация и бесплатный тариф

Зарегистрируйтесь на сайте ElevenLabs через Google или почту. Бесплатный тариф даёт 10 000 кредитов в месяц, по словам самого сервиса это около 10 минут озвучки. Попробовать голоса хватит. Ограничений три: озвучку нельзя использовать в коммерческих целях, при публикации нужно указать elevenlabs.io в названии, а клонирование голоса недоступно.

Шаг 2. Голос и модель

Откройте раздел Text to Speech. Голос выбирается в библиотеке Voices, там тысячи готовых голосов и фильтр по языку. Отфильтруйте русские голоса: они звучат естественнее, чем англоязычные, которых заставили говорить по-русски.

Библиотека голосов ElevenLabs с фильтром Russian: почти пять тысяч русских голосов. Справа видно, сколько раз голос уже использовали, это хороший ориентир для первого выбора.

Модель выбирается в том же окне. Для русского текста подходят четыре:

  • Eleven v4. Новый флагман с конца сентября 2026 года: самая выразительная модель, понимает теги эмоций, до 10 000 знаков за раз.
  • Eleven v3. Предыдущий флагман, тоже с тегами эмоций, до 5 000 знаков за раз.
  • Multilingual v2. Проверенная модель на 29 языков, ровная и предсказуемая. Понимает теги пауз и все ползунки настроек.
  • Flash v2.5. Быстрая и дешёвая, для ботов и голосовых помощников. Звучит проще.

Для роликов начинайте с v4. Если голос переигрывает или на длинном тексте нужен ровный дикторский тон, сравните тот же абзац в Multilingual v2.

Окно Text to Speech: слева размеченный текст из примера ниже с тегами [excited] и [whispers], справа выбор модели. Русский есть у Eleven v4, v3 и Multilingual v2, остальные открываются по Show all models.

Шаг 3. Настройки голоса

Ползунков немного, и почти все можно оставить по умолчанию. Набор зависит от модели: у v4 в окне только Stability и Similarity, у v3 часть ползунков тоже скрыта, у Multilingual v2 есть все.

  • Stability (стабильность). По умолчанию 50. Ниже: больше эмоций, но каждая генерация звучит по-своему. Выше: ровно и одинаково, но со временем монотонно. Для инструкций попробуйте сдвинуть вправо, для живого рассказа влево.
  • Similarity (сходство). По умолчанию 75. Насколько строго держаться исходного голоса. Если в образце клона был шум, высокое сходство вытащит и его.
  • Style (усиление стиля). Утрирует манеру исходного голоса. Сама ElevenLabs советует держать его на нуле: стиль делает голос менее стабильным.
  • Speed (скорость). От 0,7 до 1,2. Для коротких роликов голос обычно чуть ускоряют, для обучающих видео оставляют 1.
  • Speaker boost. Немного добавляет сходства с исходным голосом. Эффект слабый, а генерация медленнее.
Настройки голоса для модели Eleven v4: в окне только Stability и Similarity. Здесь стабильность выкручена до Robust, так голос читает ровнее, но спокойнее.

Шаг 4. Разметка текста

Здесь решается половина качества. Нейросеть читает то, что написано, а не то, что вы имели в виду. Текст для озвучки пишут для уха: числа словами, без сокращений, короткими фразами.

Попробуйте сами: ниже абзац, написанный для глаз. Включайте правки по одной и слушайте, как меняется чтение. Встроенный голос браузера хорошо показывает ловушки, на которых спотыкается и нейросеть.

13из 13 ловушек в тексте. Он написан для глаз, не для уха
С 1 окт. открываем 2-й зал на 40 мест. Капучино 0,3 л стоит 250 руб., а по будням до 11:00 скидка 20%. Wi-Fi бесплатный, пароль на чеке. Если вы приходите с ноутбуком, садитесь у окна, там есть розетки, а ещё там тише всего, потому что кухня далеко и музыка играет не так громко, как в первом зале. Велосипед оставьте у входа, на стойке висит замок.
Цифры, проценты и время голос читает как попало: «двадцать процент», «одиннадцать ноль ноль».

Подчёркнуто то, на чём спотыкается синтез речи. Голос в кнопке встроен в ваш браузер, это не ElevenLabs: на нём ошибки слышны особенно хорошо.

Что работает в ElevenLabs:

  • Паузы. В v3 и v4 паузы делают знаками: многоточие, точка, новая строка. В Multilingual v2 и Flash работает тег <break time="1.5s" />, пауза до трёх секунд.
  • Эмоции. В v3 и v4 есть теги в квадратных скобках: [whispers] (шёпотом), [laughs] (смех), [sighs] (вздох), [excited] (с воодушевлением). Их пишут по-английски даже в русском тексте. В v4 теги можно ставить подряд, модель выполнит их по очереди.
  • Числа и сокращения. Сервис сам раскрывает многие числа, но надёжнее написать словами и в нужном падеже: «двести пятьдесят рублей», а не «250 руб.».
  • Ударения. Для v4 официально предлагают фонетическую запись IPA, но на практике проще переписать фразу: добавить контекст или заменить омограф. Букву «ё» пишите всегда.

Так выглядит размеченный текст для v4:

[excited] Друзья, у нас новость!
Со следующей недели... мы открываем второй зал.
[whispers] А первые сто гостей получат кофе бесплатно.

Раскладывать сотню чисел вручную скучно, это хорошо делает Claude или ChatGPT. Промпт, который можно скопировать:

Подготовь текст к озвучке синтезатором речи:
- числа, даты, время, проценты и суммы напиши словами в нужном падеже;
- раскрой все сокращения;
- английские названия запиши русскими буквами, как их произносят;
- разбей предложения длиннее 12 слов;
- омографы (замок, мука, атлас) замени или добавь контекст, чтобы ударение было однозначным;
- смысл и порядок мыслей не меняй.
Текст: [вставьте текст]

Если промпты пока даются тяжело, загляните в формулу промпта из пяти частей.

Шаг 5. Генерация и экспорт

Нажмите Generate speech и послушайте. Сервис сразу делает два варианта, Generation 1 и Generation 2. Каждая генерация звучит немного иначе, поэтому неудачную фразу просто сгенерируйте ещё раз и выберите лучший вариант. Длинные тексты удобнее озвучивать в Studio: там текст разбит на абзацы, и каждый правится отдельно. Готовый файл скачивается в MP3.

Готовая озвучка: два варианта одной фразы и запись во вкладке History. Прослушайте оба и скачайте тот, где интонация лучше. Старые генерации в истории размыты.

Тарифы ElevenLabs и работа из России

Платные тарифы ElevenLabs начинаются от 6 долларов в месяц, но из России сервис официально не работает. Сначала про цены, потом про доступ.

Тарифы на октябрь 2026 года по странице цен ElevenLabs:

  • Free, 0 $. Около 10 минут озвучки в месяц, без коммерческого использования и клонирования.
  • Starter, 6 $ в месяц. Около 30 минут, коммерческая лицензия, быстрый клон голоса.
  • Creator, 22 $ в месяц. Около 121 минуты, профессиональный клон голоса.
  • Pro, 99 $ в месяц. Около 600 минут, для тех, кто озвучивает много.

Кредиты общие на все функции: озвучку, дубляж, звуковые эффекты. На первый месяц сервис часто даёт скидку, поэтому смотрите актуальную цену перед оплатой.

Теперь о доступе. В справке ElevenLabs Россия прямо названа в списке стран, откуда доступ к сервису ограничен, а российские карты оплату не проходят. Обходить правила сервиса я не советую. Если вы живёте в другой стране, а карта у вас российская, проще всего оплатить зарубежной виртуальной картой, например Плати по всему миру. Если вы в России, переходите сразу к бесплатным и российским сервисам: там есть варианты с оплатой в рублях.

Клонирование голоса: что записать и какой клон выбрать

Клонирование голоса это когда нейросеть по вашей записи учится говорить вашим тембром и читает любой текст. В ElevenLabs два вида клона: быстрый (Instant Voice Cloning) по паре минут записи и профессиональный (Professional Voice Cloning) по получасу и больше.

  • Быстрый клон. С тарифа Starter. Нужно 1-2 минуты чистой речи, больше трёх минут ElevenLabs давать не советует: это может даже испортить результат. Клон готов сразу. Тембр ловит хорошо, манеру речи хуже.
  • Профессиональный клон. С тарифа Creator. Минимум 30 минут записи, оптимально 2-3 часа. Перед обучением сервис просит прочитать фразу с экрана, чтобы убедиться, что голос ваш. Обучение идёт 3-6 часов, результат почти не отличить от живой записи.

Для первых роликов хватает быстрого клона. Профессиональный имеет смысл, если вы озвучиваете своим голосом курсы или книги и готовы записать пару часов материала.

Первый шаг Instant Voice Clone: загрузить файл до 10 МБ или записать голос прямо в браузере. Форма пропустит уже 10 секунд записи, но для похожего клона дайте от одной до двух минут.

Как записать образец

Клон повторяет всё, что слышит в записи, включая эхо комнаты и гул холодильника. Поэтому качество образца важнее длины. Соберите свой вариант записи и посмотрите, какой клон из него получится:

Где записано
Чем записано
Сколько голосов
Как звучит речь
Обработка
Качество образца95
Быстрый клон
Готово
Хороший образец для быстрого клона. В ElevenLabs он доступен с тарифа Starter.
Профессиональный клон
Мало
Нужно минимум 30 минут чистой записи, а лучше 2-3 часа. Тариф от Creator, плюс проверка, что голос ваш.
что поправить
Телефон подойдёт, если держать его на одном расстоянии, примерно в два кулака от рта, и не дышать в микрофон.

Оценка по рекомендациям ElevenLabs к образцам голоса (октябрь 2026). У других сервисов требования похожие: чистый звук, один голос, ровная подача.

Короткий чек-лист по рекомендациям ElevenLabs:

  • Тихая комната с мебелью, шторами или коврами. Пустая комната с голыми стенами даёт эхо.
  • Микрофон примерно в двух кулаках ото рта, расстояние одно и то же всю запись. Подойдёт петличка или USB-микрофон, телефон тоже справится.
  • Только ваш голос: без музыки, собеседника и смеха на фоне.
  • Читайте так, как хотите звучать в озвучке. Клон копирует подачу: если в образце вы спокойны, спокойным будет и клон.
  • Без сильного шумодава и резких склеек. MP3 от 192 кбит/с достаточно, WAV качество клона обычно не улучшает.

Текст для клонирования голоса

Читать можно что угодно, главное, чтобы в тексте были вопросы, перечисления, короткие и длинные фразы. Вот текст примерно на минуту чтения. Прочитайте его дважды, не торопясь, и оставьте лучший вариант:

Привет! Меня зовут [имя], и это запись моего голоса.
Сегодня обычный день: утром кофе, потом работа, вечером прогулка.
Вы замечали, как меняется город после дождя?
Улицы пахнут по-другому, а звуки становятся тише.
Я люблю объяснять сложное простыми словами.
Например, как работает двигатель или почему небо голубое.
Когда я увлекаюсь, говорю быстрее. Когда думаю... медленнее.
Цифры тоже важны: двадцать пять, сто сорок, две тысячи двадцать шесть.
Неожиданно, правда? А теперь серьёзно.
Спасибо, что дослушали до конца. До встречи в следующем ролике.

Клонирование голоса из видео

Клонировать голос из видео можно, если в нём звучит один человек без музыки. Вырежьте 1-2 минуты чистой речи без чужих реплик. Если под голосом играет музыка, сначала отделите голос: в ElevenLabs для этого есть Voice Isolator. Шумная запись с конференции или из кафе даст шумный клон, лучше записать образец заново.

Только свой голос или с согласия

Клонируйте только свой голос или голос человека, который явно согласился. Правила ElevenLabs запрещают копировать чужой голос без согласия и выдавать сгенерированную речь за настоящую, чтобы обмануть. Отдельного закона об охране голоса в России пока нет (законопроект вносили в Госдуму в 2024 году), но запись голоса может считаться биометрическими персональными данными, а подделка чужого голоса легко превращается в мошенничество. Почему голосовые записи не стоит раздавать сервисам без нужды, я писал в статье о том, что нельзя отправлять в нейросеть.

Бесплатная озвучка нейросетью на русском и российские сервисы

Бесплатно озвучить текст на русском можно тремя способами: голосом браузера, в CapCut и в программе VoiceStudio на своём компьютере. Если нужна оплата в рублях, есть Yandex SpeechKit. А SaluteSpeech от Сбера, который советуют многие старые подборки, новым пользователям больше недоступен.

Голос браузера

В Chrome, Edge и Safari есть встроенный синтез речи, его можно послушать в первой демке. Звучит он механически и для роликов не годится, зато для проверки текста подходит отлично: если браузерный голос прочитал абзац без запинок, нейросеть тоже справится.

CapCut

В видеоредакторе CapCut есть озвучка текста: пишете текст прямо в ролике и выбираете голос. Русских голосов немного, зато озвучка сразу ложится на таймлайн. Удобно для коротких роликов, если вы и так монтируете в CapCut.

SaluteSpeech от Сбера

Сервис синтеза речи Сбера долго был главным бесплатным вариантом для физлиц: 200 000 знаков в месяц, примерно 200 минут озвучки. Но по тарифам на сайте Сбера с 15 июля 2026 года физлицам прекратили продавать новые пакеты и продлевать бесплатный тариф, а новым компаниям пакеты тоже не продают. Уже купленный пакет работает до конца срока, но начать с нуля в октябре 2026 года не получится.

Yandex SpeechKit

Синтез речи Яндекса: набор русских голосов и оплата в рублях. По прайсу SpeechKit миллион знаков через API v1 стоит 1 342 ₽, то есть минута озвучки обходится примерно в рубль с небольшим. Минус в том, что сервис сделан для разработчиков: голоса пробуют в Playground в консоли, а работают через API. Ударение здесь ставится плюсом перед гласной (зам+ок), пауза тегом sil<[500]>. Свой голос (Brand Voice) делают только компаниям, и стоит это больше ста тысяч рублей в месяц.

VoiceStudio: бесплатный аналог ElevenLabs на компьютере

VoiceStudio это открытая программа, которая работает прямо на вашем компьютере: озвучка, клонирование голоса, дубляж видео и расшифровка. Подписки нет, текст и голос никуда не уходят, это плюс для приватности. Работает на macOS с Apple Silicon, Windows и Linux. Без видеокарты тоже запустится, но медленнее.

Страница VoiceStudio на GitHub. Авторы прямо называют программу локальной альтернативой ElevenLabs, лицензия AGPL 3.0, скачать её можно с сайта voicestudio.sh.

Честно о минусах. Качество зависит от выбранного движка, русский стоит проверить на своём тексте. У моделей внутри программы свои лицензии, их нужно прочитать перед коммерческим использованием. И установка сложнее, чем регистрация в облачном сервисе: программу нужно скачать, поставить и выбрать движок.

Fish Audio

Если вы живёте не в России, посмотрите ещё Fish Audio. Бесплатно дают около 7 минут генерации в месяц, тариф Plus стоит 11 долларов и даёт около 200 минут. Русский поддерживается, но во втором ряду языков после английского, китайского и японского, так что сравните голос с ElevenLabs на своём абзаце.

Чтобы не перебирать всё подряд, ответьте на три вопроса и подвиньте ползунок с объёмом. Демка подберёт сервис под способ оплаты и количество минут в месяц:

Чем будете платить
Нужен свой голос
Для чего
Yandex SpeechKit≈ 81 ₽ в месяц
Облако Яндекса, оплата в рублях, хорошие русские голоса. Рассчитан на разработчиков: работает через консоль и API. Расчёт по тарифу API v1, 1 342 ₽ за миллион знаков.
VoiceStudioбесплатно
Открытая программа, работает на вашем компьютере: озвучка и клон своего голоса без подписки. Быстрее всего на Mac с Apple Silicon или с видеокартой NVIDIA.
ElevenLabs по своим правилам ограничивает доступ из России и не принимает российские карты, поэтому здесь его нет. SaluteSpeech с 15 июля 2026 года новым пользователям недоступен.

Цены и лимиты по официальным сайтам на октябрь 2026. Минута озвучки примерно равна тысяче знаков текста, точный расход зависит от темпа и языка.

Отдельно про озвучку песен нейросетью. Это другая задача: нужен генератор музыки или замена голоса в готовом треке, а не синтез речи из текста. Сервисы из этой статьи петь не умеют, у ElevenLabs для музыки есть отдельный продукт Eleven Music.

Озвучка видео нейросетью и дубляж

Озвучка видео нейросетью делается в два хода: сначала текст превращается в аудио, потом аудио ставится под картинку. Если видео уже записано вашим голосом и нужно перевести его на другой язык, это дубляж.

Порядок, при котором меньше всего переделок:

  1. Сценарий разбит на фразы, каждая под свою сцену.
  2. Озвучка по абзацам, а не одним куском: правка одной фразы не потянет переозвучку всего ролика.
  3. Монтаж под голос: картинку подгоняют под озвучку, а не наоборот.
  4. Субтитры по готовой озвучке, чтобы текст на экране совпадал со словами.

Для перевода в ElevenLabs есть Dubbing: загружаете видео, выбираете язык, сервис переводит речь и озвучивает её голосом, похожим на исходный. Он доступен на всех тарифах, но на бесплатном к результату добавляется водяной знак. Перевод проверьте хотя бы обратным переводом: имена и термины сервис иногда путает.

Если картинки для ролика нет, сцены можно сгенерировать по описанию: как это делается, разобрано в статье про Kling AI.

Сама озвучка бесплатным путём делается за вечер. Труднее превратить её в ролик: подогнать сцены и графику под каждую фразу, поставить субтитры точно в слова, держать одно оформление от выпуска к выпуску. Как собирать видео вокруг готовой озвучки, я разбирал в статье про монтаж видео с помощью нейросетей. В курсе «Нейромонтаж» этому посвящён отдельный урок: свой голос, клон или бесплатная локальная модель, а потом файл озвучки кладут в папку проекта, и нейросеть подгоняет тайминги сцен под дорожку. Монтаж, инфографику и анимации там тоже собираем словами через Claude или ChatGPT, без видеоредактора.

Частые ошибки в нейроозвучке

  • Текст для глаз. Цифры, «руб.», «т.е.», скобки. Синтез читает их буквально или пропускает.
  • Длинные предложения. К концу фразы на тридцать слов голос теряет интонацию. Режьте на фразы по 7-12 слов.
  • Ударения в фамилиях, названиях и омографах. Прослушайте их отдельно. Помогает контекст, замена слова, буква «ё», а в SpeechKit знак «+».
  • Аббревиатуры. Решите, как их читать, и напишите так: «эс-бэ-пэ», «эй-пи-ай». Иначе голос выберет сам.
  • Весь текст одной генерацией. Одна неудачная фраза, и переделывать всё. Озвучивайте по абзацам.
  • Стабильность на минимуме ради эмоций. Голос начинает плавать между абзацами, и кажется, что читают разные люди.
  • Бесплатный тариф в коммерческом проекте. У ElevenLabs Free это запрещено, для рекламы и курсов нужен платный тариф.
  • Чужой голос без согласия. Нарушение правил сервиса, а иногда и закона.

Итог

Хорошая озвучка текста нейросетью начинается с текста, а не с выбора голоса: числа словами, короткие фразы, проверенные ударения. Дальше всё просто. Если ElevenLabs вам доступен, начните с бесплатных 10 минут и модели v4, для своего голоса хватит тарифа Starter и двух минут чистой записи. Если вы в России, пробуйте VoiceStudio на своём компьютере или Yandex SpeechKit с оплатой в рублях.

Остальные сервисы, которыми я пользуюсь для видео, текстов и кода, собраны на странице «Чем я пользуюсь».

Частые вопросы

Какая нейросеть лучше всего озвучивает текст на русском?

Чаще всего выбирают ElevenLabs: модели v4 и Multilingual v2 звучат живо и хорошо держат русский. Из сервисов с оплатой в рублях хорошие русские голоса у Yandex SpeechKit.

Можно ли сделать озвучку нейросетью бесплатно на русском?

Да. Голос браузера и озвучка в CapCut ничего не стоят, VoiceStudio работает на вашем компьютере без лимитов, а бесплатный тариф ElevenLabs даёт около 10 минут в месяц, но из России сервис официально недоступен и для рекламы на Free использовать его нельзя.

Работает ли ElevenLabs в России?

Официально нет: ElevenLabs ограничивает доступ из России и не принимает российские карты. Из России можно пользоваться Yandex SpeechKit, озвучкой в CapCut и программой VoiceStudio.

Сколько стоит подписка ElevenLabs?

На октябрь 2026 года Starter стоит 6 долларов в месяц (около 30 минут озвучки), Creator 22 доллара (около 121 минуты), Pro 99 долларов. Бесплатный тариф даёт около 10 минут в месяц.

Сколько нужно записать для клонирования голоса?

Для быстрого клона в ElevenLabs достаточно 1-2 минут чистой речи. Для профессионального нужно минимум 30 минут, а лучше 2-3 часа записи.

Можно ли клонировать голос из видео?

Можно, если в видео чистая речь одного человека без музыки: вырежьте 1-2 минуты таких фрагментов. Клонировать можно только свой голос или голос человека, который на это согласился.