Содержание
Озвучка текста нейросетью в 2026 году звучит почти как живой диктор: с дыханием, паузами и интонацией. Вставляете текст, выбираете голос и через несколько секунд скачиваете готовый файл. Чаще всего для этого берут ElevenLabs, бесплатно можно начать с голоса браузера, озвучки в CapCut или программы VoiceStudio на своём компьютере, а свой голос клонируется по записи длиной в пару минут.
Озвучку для роликов я делаю в ElevenLabs, поэтому ниже весь путь по шагам: как подготовить текст, какие настройки трогать, как записать образец для клона своего голоса и чем заменить ElevenLabs, если он вам недоступен.
На коротких текстах хорошую нейроозвучку почти не отличить от человека. Слабых мест два: длинные тексты, где голос постепенно становится монотонным, и незнакомые модели слова (фамилии, термины, редкие ударения).
Модели обновляются быстро. 28 сентября 2026 года ElevenLabs выпустила Eleven v4: больше 90 языков, расширенные теги эмоций и клон голоса по фрагменту примерно в 10 секунд. Русский поддерживают все основные модели сервиса.
Где нейросетевой голос уже уместен:
- Обучающие видео и инструкции. Ровный понятный голос, а правка текста не требует перезаписи всего урока.
- Короткие ролики без лица и голоса автора. Голос нейросети, субтитры и графика собирают ролик целиком.
- Ваш текст вашим голосом. Записали образец один раз, дальше правите сценарий и перегенерируете фразу, а не переписываете дубль.
- Перевод роликов на другие языки. Дубляж сохраняет тембр исходного голоса.
- Подкасты и аудиоверсии статей. Особенно когда текст уже написан и вычитан.
Живой голос пока лучше там, где важна импровизация: личные истории, юмор на интонации, эфиры. Нейросеть хорошо читает, но не играет.
ElevenLabs это самый известный сервис нейроозвучки: живые голоса, хороший русский, клонирование и дубляж в одном месте. От текста до готового файла уходит пара минут.
Шаг 1. Регистрация и бесплатный тариф
Зарегистрируйтесь на сайте ElevenLabs через Google или почту. Бесплатный тариф даёт 10 000 кредитов в месяц, по словам самого сервиса это около 10 минут озвучки. Попробовать голоса хватит. Ограничений три: озвучку нельзя использовать в коммерческих целях, при публикации нужно указать elevenlabs.io в названии, а клонирование голоса недоступно.
Шаг 2. Голос и модель
Откройте раздел Text to Speech. Голос выбирается в библиотеке Voices, там тысячи готовых голосов и фильтр по языку. Отфильтруйте русские голоса: они звучат естественнее, чем англоязычные, которых заставили говорить по-русски.
Модель выбирается в том же окне. Для русского текста подходят четыре:
- Eleven v4. Новый флагман с конца сентября 2026 года: самая выразительная модель, понимает теги эмоций, до 10 000 знаков за раз.
- Eleven v3. Предыдущий флагман, тоже с тегами эмоций, до 5 000 знаков за раз.
- Multilingual v2. Проверенная модель на 29 языков, ровная и предсказуемая. Понимает теги пауз и все ползунки настроек.
- Flash v2.5. Быстрая и дешёвая, для ботов и голосовых помощников. Звучит проще.
Для роликов начинайте с v4. Если голос переигрывает или на длинном тексте нужен ровный дикторский тон, сравните тот же абзац в Multilingual v2.
Шаг 3. Настройки голоса
Ползунков немного, и почти все можно оставить по умолчанию. Набор зависит от модели: у v4 в окне только Stability и Similarity, у v3 часть ползунков тоже скрыта, у Multilingual v2 есть все.
- Stability (стабильность). По умолчанию 50. Ниже: больше эмоций, но каждая генерация звучит по-своему. Выше: ровно и одинаково, но со временем монотонно. Для инструкций попробуйте сдвинуть вправо, для живого рассказа влево.
- Similarity (сходство). По умолчанию 75. Насколько строго держаться исходного голоса. Если в образце клона был шум, высокое сходство вытащит и его.
- Style (усиление стиля). Утрирует манеру исходного голоса. Сама ElevenLabs советует держать его на нуле: стиль делает голос менее стабильным.
- Speed (скорость). От 0,7 до 1,2. Для коротких роликов голос обычно чуть ускоряют, для обучающих видео оставляют 1.
- Speaker boost. Немного добавляет сходства с исходным голосом. Эффект слабый, а генерация медленнее.
Шаг 4. Разметка текста
Здесь решается половина качества. Нейросеть читает то, что написано, а не то, что вы имели в виду. Текст для озвучки пишут для уха: числа словами, без сокращений, короткими фразами.
Попробуйте сами: ниже абзац, написанный для глаз. Включайте правки по одной и слушайте, как меняется чтение. Встроенный голос браузера хорошо показывает ловушки, на которых спотыкается и нейросеть.
Подчёркнуто то, на чём спотыкается синтез речи. Голос в кнопке встроен в ваш браузер, это не ElevenLabs: на нём ошибки слышны особенно хорошо.
Что работает в ElevenLabs:
- Паузы. В v3 и v4 паузы делают знаками: многоточие, точка, новая строка. В Multilingual v2 и Flash работает тег
<break time="1.5s" />, пауза до трёх секунд. - Эмоции. В v3 и v4 есть теги в квадратных скобках:
[whispers](шёпотом),[laughs](смех),[sighs](вздох),[excited](с воодушевлением). Их пишут по-английски даже в русском тексте. В v4 теги можно ставить подряд, модель выполнит их по очереди. - Числа и сокращения. Сервис сам раскрывает многие числа, но надёжнее написать словами и в нужном падеже: «двести пятьдесят рублей», а не «250 руб.».
- Ударения. Для v4 официально предлагают фонетическую запись IPA, но на практике проще переписать фразу: добавить контекст или заменить омограф. Букву «ё» пишите всегда.
Так выглядит размеченный текст для v4:
[excited] Друзья, у нас новость!
Со следующей недели... мы открываем второй зал.
[whispers] А первые сто гостей получат кофе бесплатно.Раскладывать сотню чисел вручную скучно, это хорошо делает Claude или ChatGPT. Промпт, который можно скопировать:
Подготовь текст к озвучке синтезатором речи:
- числа, даты, время, проценты и суммы напиши словами в нужном падеже;
- раскрой все сокращения;
- английские названия запиши русскими буквами, как их произносят;
- разбей предложения длиннее 12 слов;
- омографы (замок, мука, атлас) замени или добавь контекст, чтобы ударение было однозначным;
- смысл и порядок мыслей не меняй.
Текст: [вставьте текст]Если промпты пока даются тяжело, загляните в формулу промпта из пяти частей.
Шаг 5. Генерация и экспорт
Нажмите Generate speech и послушайте. Сервис сразу делает два варианта, Generation 1 и Generation 2. Каждая генерация звучит немного иначе, поэтому неудачную фразу просто сгенерируйте ещё раз и выберите лучший вариант. Длинные тексты удобнее озвучивать в Studio: там текст разбит на абзацы, и каждый правится отдельно. Готовый файл скачивается в MP3.
Платные тарифы ElevenLabs начинаются от 6 долларов в месяц, но из России сервис официально не работает. Сначала про цены, потом про доступ.
Тарифы на октябрь 2026 года по странице цен ElevenLabs:
- Free, 0 $. Около 10 минут озвучки в месяц, без коммерческого использования и клонирования.
- Starter, 6 $ в месяц. Около 30 минут, коммерческая лицензия, быстрый клон голоса.
- Creator, 22 $ в месяц. Около 121 минуты, профессиональный клон голоса.
- Pro, 99 $ в месяц. Около 600 минут, для тех, кто озвучивает много.
Кредиты общие на все функции: озвучку, дубляж, звуковые эффекты. На первый месяц сервис часто даёт скидку, поэтому смотрите актуальную цену перед оплатой.
Теперь о доступе. В справке ElevenLabs Россия прямо названа в списке стран, откуда доступ к сервису ограничен, а российские карты оплату не проходят. Обходить правила сервиса я не советую. Если вы живёте в другой стране, а карта у вас российская, проще всего оплатить зарубежной виртуальной картой, например Плати по всему миру. Если вы в России, переходите сразу к бесплатным и российским сервисам: там есть варианты с оплатой в рублях.
Клонирование голоса это когда нейросеть по вашей записи учится говорить вашим тембром и читает любой текст. В ElevenLabs два вида клона: быстрый (Instant Voice Cloning) по паре минут записи и профессиональный (Professional Voice Cloning) по получасу и больше.
- Быстрый клон. С тарифа Starter. Нужно 1-2 минуты чистой речи, больше трёх минут ElevenLabs давать не советует: это может даже испортить результат. Клон готов сразу. Тембр ловит хорошо, манеру речи хуже.
- Профессиональный клон. С тарифа Creator. Минимум 30 минут записи, оптимально 2-3 часа. Перед обучением сервис просит прочитать фразу с экрана, чтобы убедиться, что голос ваш. Обучение идёт 3-6 часов, результат почти не отличить от живой записи.
Для первых роликов хватает быстрого клона. Профессиональный имеет смысл, если вы озвучиваете своим голосом курсы или книги и готовы записать пару часов материала.
Как записать образец
Клон повторяет всё, что слышит в записи, включая эхо комнаты и гул холодильника. Поэтому качество образца важнее длины. Соберите свой вариант записи и посмотрите, какой клон из него получится:
Оценка по рекомендациям ElevenLabs к образцам голоса (октябрь 2026). У других сервисов требования похожие: чистый звук, один голос, ровная подача.
Короткий чек-лист по рекомендациям ElevenLabs:
- Тихая комната с мебелью, шторами или коврами. Пустая комната с голыми стенами даёт эхо.
- Микрофон примерно в двух кулаках ото рта, расстояние одно и то же всю запись. Подойдёт петличка или USB-микрофон, телефон тоже справится.
- Только ваш голос: без музыки, собеседника и смеха на фоне.
- Читайте так, как хотите звучать в озвучке. Клон копирует подачу: если в образце вы спокойны, спокойным будет и клон.
- Без сильного шумодава и резких склеек. MP3 от 192 кбит/с достаточно, WAV качество клона обычно не улучшает.
Текст для клонирования голоса
Читать можно что угодно, главное, чтобы в тексте были вопросы, перечисления, короткие и длинные фразы. Вот текст примерно на минуту чтения. Прочитайте его дважды, не торопясь, и оставьте лучший вариант:
Привет! Меня зовут [имя], и это запись моего голоса.
Сегодня обычный день: утром кофе, потом работа, вечером прогулка.
Вы замечали, как меняется город после дождя?
Улицы пахнут по-другому, а звуки становятся тише.
Я люблю объяснять сложное простыми словами.
Например, как работает двигатель или почему небо голубое.
Когда я увлекаюсь, говорю быстрее. Когда думаю... медленнее.
Цифры тоже важны: двадцать пять, сто сорок, две тысячи двадцать шесть.
Неожиданно, правда? А теперь серьёзно.
Спасибо, что дослушали до конца. До встречи в следующем ролике.Клонирование голоса из видео
Клонировать голос из видео можно, если в нём звучит один человек без музыки. Вырежьте 1-2 минуты чистой речи без чужих реплик. Если под голосом играет музыка, сначала отделите голос: в ElevenLabs для этого есть Voice Isolator. Шумная запись с конференции или из кафе даст шумный клон, лучше записать образец заново.
Только свой голос или с согласия
Клонируйте только свой голос или голос человека, который явно согласился. Правила ElevenLabs запрещают копировать чужой голос без согласия и выдавать сгенерированную речь за настоящую, чтобы обмануть. Отдельного закона об охране голоса в России пока нет (законопроект вносили в Госдуму в 2024 году), но запись голоса может считаться биометрическими персональными данными, а подделка чужого голоса легко превращается в мошенничество. Почему голосовые записи не стоит раздавать сервисам без нужды, я писал в статье о том, что нельзя отправлять в нейросеть.
Бесплатно озвучить текст на русском можно тремя способами: голосом браузера, в CapCut и в программе VoiceStudio на своём компьютере. Если нужна оплата в рублях, есть Yandex SpeechKit. А SaluteSpeech от Сбера, который советуют многие старые подборки, новым пользователям больше недоступен.
Голос браузера
В Chrome, Edge и Safari есть встроенный синтез речи, его можно послушать в первой демке. Звучит он механически и для роликов не годится, зато для проверки текста подходит отлично: если браузерный голос прочитал абзац без запинок, нейросеть тоже справится.
CapCut
В видеоредакторе CapCut есть озвучка текста: пишете текст прямо в ролике и выбираете голос. Русских голосов немного, зато озвучка сразу ложится на таймлайн. Удобно для коротких роликов, если вы и так монтируете в CapCut.
SaluteSpeech от Сбера
Сервис синтеза речи Сбера долго был главным бесплатным вариантом для физлиц: 200 000 знаков в месяц, примерно 200 минут озвучки. Но по тарифам на сайте Сбера с 15 июля 2026 года физлицам прекратили продавать новые пакеты и продлевать бесплатный тариф, а новым компаниям пакеты тоже не продают. Уже купленный пакет работает до конца срока, но начать с нуля в октябре 2026 года не получится.
Yandex SpeechKit
Синтез речи Яндекса: набор русских голосов и оплата в рублях. По прайсу SpeechKit миллион знаков через API v1 стоит 1 342 ₽, то есть минута озвучки обходится примерно в рубль с небольшим. Минус в том, что сервис сделан для разработчиков: голоса пробуют в Playground в консоли, а работают через API. Ударение здесь ставится плюсом перед гласной (зам+ок), пауза тегом sil<[500]>. Свой голос (Brand Voice) делают только компаниям, и стоит это больше ста тысяч рублей в месяц.
VoiceStudio: бесплатный аналог ElevenLabs на компьютере
VoiceStudio это открытая программа, которая работает прямо на вашем компьютере: озвучка, клонирование голоса, дубляж видео и расшифровка. Подписки нет, текст и голос никуда не уходят, это плюс для приватности. Работает на macOS с Apple Silicon, Windows и Linux. Без видеокарты тоже запустится, но медленнее.
Честно о минусах. Качество зависит от выбранного движка, русский стоит проверить на своём тексте. У моделей внутри программы свои лицензии, их нужно прочитать перед коммерческим использованием. И установка сложнее, чем регистрация в облачном сервисе: программу нужно скачать, поставить и выбрать движок.
Fish Audio
Если вы живёте не в России, посмотрите ещё Fish Audio. Бесплатно дают около 7 минут генерации в месяц, тариф Plus стоит 11 долларов и даёт около 200 минут. Русский поддерживается, но во втором ряду языков после английского, китайского и японского, так что сравните голос с ElevenLabs на своём абзаце.
Чтобы не перебирать всё подряд, ответьте на три вопроса и подвиньте ползунок с объёмом. Демка подберёт сервис под способ оплаты и количество минут в месяц:
Цены и лимиты по официальным сайтам на октябрь 2026. Минута озвучки примерно равна тысяче знаков текста, точный расход зависит от темпа и языка.
Отдельно про озвучку песен нейросетью. Это другая задача: нужен генератор музыки или замена голоса в готовом треке, а не синтез речи из текста. Сервисы из этой статьи петь не умеют, у ElevenLabs для музыки есть отдельный продукт Eleven Music.
Озвучка видео нейросетью делается в два хода: сначала текст превращается в аудио, потом аудио ставится под картинку. Если видео уже записано вашим голосом и нужно перевести его на другой язык, это дубляж.
Порядок, при котором меньше всего переделок:
- Сценарий разбит на фразы, каждая под свою сцену.
- Озвучка по абзацам, а не одним куском: правка одной фразы не потянет переозвучку всего ролика.
- Монтаж под голос: картинку подгоняют под озвучку, а не наоборот.
- Субтитры по готовой озвучке, чтобы текст на экране совпадал со словами.
Для перевода в ElevenLabs есть Dubbing: загружаете видео, выбираете язык, сервис переводит речь и озвучивает её голосом, похожим на исходный. Он доступен на всех тарифах, но на бесплатном к результату добавляется водяной знак. Перевод проверьте хотя бы обратным переводом: имена и термины сервис иногда путает.
Если картинки для ролика нет, сцены можно сгенерировать по описанию: как это делается, разобрано в статье про Kling AI.
Сама озвучка бесплатным путём делается за вечер. Труднее превратить её в ролик: подогнать сцены и графику под каждую фразу, поставить субтитры точно в слова, держать одно оформление от выпуска к выпуску. Как собирать видео вокруг готовой озвучки, я разбирал в статье про монтаж видео с помощью нейросетей. В курсе «Нейромонтаж» этому посвящён отдельный урок: свой голос, клон или бесплатная локальная модель, а потом файл озвучки кладут в папку проекта, и нейросеть подгоняет тайминги сцен под дорожку. Монтаж, инфографику и анимации там тоже собираем словами через Claude или ChatGPT, без видеоредактора.
- Текст для глаз. Цифры, «руб.», «т.е.», скобки. Синтез читает их буквально или пропускает.
- Длинные предложения. К концу фразы на тридцать слов голос теряет интонацию. Режьте на фразы по 7-12 слов.
- Ударения в фамилиях, названиях и омографах. Прослушайте их отдельно. Помогает контекст, замена слова, буква «ё», а в SpeechKit знак «+».
- Аббревиатуры. Решите, как их читать, и напишите так: «эс-бэ-пэ», «эй-пи-ай». Иначе голос выберет сам.
- Весь текст одной генерацией. Одна неудачная фраза, и переделывать всё. Озвучивайте по абзацам.
- Стабильность на минимуме ради эмоций. Голос начинает плавать между абзацами, и кажется, что читают разные люди.
- Бесплатный тариф в коммерческом проекте. У ElevenLabs Free это запрещено, для рекламы и курсов нужен платный тариф.
- Чужой голос без согласия. Нарушение правил сервиса, а иногда и закона.
Хорошая озвучка текста нейросетью начинается с текста, а не с выбора голоса: числа словами, короткие фразы, проверенные ударения. Дальше всё просто. Если ElevenLabs вам доступен, начните с бесплатных 10 минут и модели v4, для своего голоса хватит тарифа Starter и двух минут чистой записи. Если вы в России, пробуйте VoiceStudio на своём компьютере или Yandex SpeechKit с оплатой в рублях.
Остальные сервисы, которыми я пользуюсь для видео, текстов и кода, собраны на странице «Чем я пользуюсь».
Частые вопросы
Какая нейросеть лучше всего озвучивает текст на русском?
Чаще всего выбирают ElevenLabs: модели v4 и Multilingual v2 звучат живо и хорошо держат русский. Из сервисов с оплатой в рублях хорошие русские голоса у Yandex SpeechKit.
Можно ли сделать озвучку нейросетью бесплатно на русском?
Да. Голос браузера и озвучка в CapCut ничего не стоят, VoiceStudio работает на вашем компьютере без лимитов, а бесплатный тариф ElevenLabs даёт около 10 минут в месяц, но из России сервис официально недоступен и для рекламы на Free использовать его нельзя.
Работает ли ElevenLabs в России?
Официально нет: ElevenLabs ограничивает доступ из России и не принимает российские карты. Из России можно пользоваться Yandex SpeechKit, озвучкой в CapCut и программой VoiceStudio.
Сколько стоит подписка ElevenLabs?
На октябрь 2026 года Starter стоит 6 долларов в месяц (около 30 минут озвучки), Creator 22 доллара (около 121 минуты), Pro 99 долларов. Бесплатный тариф даёт около 10 минут в месяц.
Сколько нужно записать для клонирования голоса?
Для быстрого клона в ElevenLabs достаточно 1-2 минут чистой речи. Для профессионального нужно минимум 30 минут, а лучше 2-3 часа записи.
Можно ли клонировать голос из видео?
Можно, если в видео чистая речь одного человека без музыки: вырежьте 1-2 минуты таких фрагментов. Клонировать можно только свой голос или голос человека, который на это согласился.
