Назад к блогу
#транскрибация#нейросети#видео

Транскрибация видео в текст: бесплатные способы, Whisper и промпты

Транскрибация видео в текст и аудио бесплатно: расшифровка YouTube, Whisper на компьютере, онлайн-сервисы, звонки и встречи. Плюс промпты для чистки текста и субтитров.

Артём Исламов13 мин чтения
Содержание

Транскрибация видео в текст это перевод речи из ролика или аудиозаписи в обычный текст, который можно читать, искать по нему и править. Самые быстрые бесплатные пути на октябрь 2026 года такие. Для ролика на YouTube нажмите под видео «Показать текст видео». Для своего файла поставьте бесплатную программу на основе Whisper, например Buzz или MacWhisper: запись не покинет компьютер. Если нужна разметка спикеров без возни, загрузите файл в онлайн-сервис, например ElevenLabs.

Я сам расшифровываю уроки своих курсов через Whisper: из транскрипта сайт потом собирает черновики и конспект урока. Ниже разберу каждый способ по шагам, дам промпты, которые превращают сырой текст в абзацы, субтитры и конспект, и расскажу, где распознавание ошибается.

Что такое транскрибация и чем она отличается от субтитров

Транскрибация это полный текст того, что сказано в записи, слово в слово. Обычно с таймкодами: у каждой фразы указано время, когда она прозвучала. Из расшифровки делают субтитры и конспект, но это разные вещи:

  • Расшифровка (транскрипт). Весь текст подряд или по репликам. Нужна, чтобы найти цитату, написать статью по видео, составить протокол встречи.
  • Субтитры. Тот же текст, нарезанный на короткие куски по одной-две строки, и у каждого куска точное время появления и исчезновения. Самый частый формат файла SRT, его понимают YouTube, CapCut, Premiere и почти любой плеер.
  • Конспект. Сжатый пересказ: главные мысли, цифры, договорённости. Нейросеть делает его из расшифровки за один запрос.

Работают здесь две разные нейросети. Сначала модель распознавания речи (Whisper, Scribe, движок Яндекса) превращает звук в текст. Потом языковая модель вроде Claude или ChatGPT доводит этот текст: расставляет абзацы, подписывает спикеров, пишет конспект. Часовое видео в чат-бот целиком обычно не загрузить, а распознаватель речи конспект не напишет, поэтому шаги лучше не смешивать.

Как сделать транскрибацию видео в текст: четыре способа

Сделать транскрибацию можно четырьмя способами: встроенными функциями YouTube и Яндекса, онлайн-сервисом, программой на своём компьютере или через API. Выбор зависит от трёх вещей: откуда запись, насколько она личная и есть ли у вас мощный компьютер.

Встроенные функции: YouTube, Яндекс, сервисы звонков

Бесплатно и ничего не нужно ставить. У роликов на YouTube с субтитрами есть полный текст видео. Транскрибация в Яндексе устроена иначе: Яндекс Браузер делает краткий пересказ видео с таймкодами для YouTube, VK Видео, Дзена и Rutube, а Телемост присылает расшифровку и конспект встречи, но только на тарифах Яндекс 360 для бизнеса. Минус встроенных функций в том, что вы получаете готовый результат без настроек: не нравится точность, поправить нечего.

Онлайн-сервисы транскрибации

Загружаете файл на сайт, через несколько минут скачиваете текст. Удобно, когда компьютер слабый или нужно разделить реплики по говорящим. Из сильных сервисов ElevenLabs: их модель Scribe распознаёт больше 90 языков, русский у них в группе самых точных, текст делится по спикерам, а время ставится у каждого слова. Бесплатных кредитов хватает примерно на полчаса распознавания в месяц, если не тратить их на озвучку. Оговорка для читателей из России: ElevenLabs ограничивает доступ из России и не принимает российские карты. Российский вариант с оплатой в рублях есть у Яндекса (SpeechKit), но он сделан для разработчиков. И минус у всех онлайн-сервисов общий: запись уходит на чужой сервер.

Отрывок из моего ролика, расшифрованный в ElevenLabs Speech to Text. Сервис сам определил русский язык, подписал говорящего (в отрывке он один) и отметил звуки вроде [с шумом вдыхает]. Междометия «э-э-э» в обычном режиме остаются в тексте.

Если из длинной записи нужен не текст, а короткие ролики с субтитрами, это отдельная задача. Для подкастов и эфиров я использую Vizard: он сам находит удачные моменты, нарезает их и подписывает, русский понимает. Как устроена автонарезка и чем заменить Vizard, разобрано в статье про нарезку видео на Shorts и Reels.

Программы для транскрибации на компьютере

Бесплатно, без лимитов и без интернета: запись остаётся у вас. Почти все такие программы и приложения для транскрибации работают на Whisper, открытой модели распознавания от OpenAI. На маке самая простая MacWhisper, а бесплатная Buzz работает на Windows, маке и Linux. Минус один: нужен не самый слабый компьютер, иначе час записи может расшифровываться час и дольше.

API для разработчиков

Когда расшифровок много и их нужно встроить в свой процесс (бот, сайт, CRM), берут API: Яндекс SpeechKit, ElevenLabs, OpenAI. Оплата поминутная. На моём сайте так устроен конвейер уроков: видео расшифровывается через Whisper автоматически, и из текста сразу собираются черновики и конспект урока.

Если не хочется разбираться в группах, ответьте на пять вопросов ниже. Подборщик предложит способ, запасной вариант и подскажет, на что обратить внимание.

Что расшифровать?
Сколько длится запись?
Можно ли отдавать запись в онлайн-сервис?
Бюджет
На чём работаете?
Вам подойдётBuzzБесплатная программа на основе Whisper для Windows, мака и Linux. Все модели, включая точную turbo, бесплатны. Сохраняет TXT и SRT, файлы не уходят в интернет.С чего начать. Установите Buzz со страницы проекта на GitHub, выберите модель turbo и добавьте файл.
Запасной вариантElevenLabs Speech to TextОнлайн и без нагрузки на компьютер, но бесплатно только около получаса в месяц. Для длинной записи понадобится платный тариф.
ElevenLabs ограничивает доступ из России и не принимает российские карты. Если вы в России, выбирайте программу на компьютере.

Подсказка по состоянию на октябрь 2026 года. Бесплатные лимиты онлайн-сервисов меняются, проверяйте их на сайте перед загрузкой большого файла.

Транскрибация видео с YouTube бесплатно

Для ролика на YouTube расшифровка уже готова, если у видео есть субтитры, хотя бы автоматические. Автоматические субтитры YouTube делает сам для десятков языков, включая русский. Достать текст можно так:

  1. Откройте ролик на компьютере или в приложении YouTube.
  2. Раскройте описание под видео (кнопка «...ещё») и нажмите «Показать текст видео». Откроется весь текст с таймкодами.
  3. Выделите текст и скопируйте. Таймкоды можно оставить: по ним потом легко найти нужный момент в видео.
  4. Вставьте текст в Claude или ChatGPT с промптом для чистки из раздела ниже. Автоматические субтитры идут без точек и заглавных букв, а с промптом читаются как статья.
Справа панель «Расшифровка видео», она открывается кнопкой «Показать текст видео» в описании. Это автоматические субтитры моего ролика: у каждой фразы свой таймкод, нажатие на фразу перематывает видео к ней.

Если кнопки нет, у ролика нет субтитров: автор их отключил или видео загружено совсем недавно. Автоматические субтитры к своему видео можно проверить и поправить в Творческой студии YouTube, в разделе «Субтитры».

Когда нужен не весь текст, а суть ролика, удобнее Яндекс Браузер. Под видео появляется кнопка пересказа, и вы видите тезисы с таймкодами. Работает бесплатно для роликов от 2 минут до 4 часов. Это самая простая нейросеть для конспектов по видео, но полного текста она не даёт.

Транскрибация аудио и видео на компьютере через Whisper

Whisper это модель распознавания речи от OpenAI с открытым кодом: программа и веса модели выложены под лицензией MIT. Она бесплатная, понимает русский, работает без интернета и принимает любые привычные форматы: MP4, MOV, MP3, M4A, WAV.

У Whisper несколько моделей. Чем больше модель, тем она точнее и медленнее:

  • turbo (в программах называется Large v3 Turbo). Выбор по умолчанию: по данным разработчиков, примерно в 8 раз быстрее самой большой модели при небольшой потере точности. Нужно около 6 ГБ видеопамяти.
  • large (Large v3). Самая точная и самая медленная, около 10 ГБ видеопамяти. Пригодится на сложном звуке и для перевода речи на английский: turbo переводить не обучена.
  • small и medium. Для слабых компьютеров, около 2 и 5 ГБ памяти. Ошибок больше, особенно в терминах и именах.
  • tiny и base. Очень быстрые, но на русском слабые. Годятся, чтобы проверить, что всё запустилось.

На маке: MacWhisper

  1. Скачайте MacWhisper со страницы разработчика или из Mac App Store.
  2. При первом запуске выберите модель. В бесплатной версии самая точная из доступных Small, модели Medium, Large v3 и Large v3 Turbo открываются в платной Pro. Модель скачивается один раз, дальше интернет не нужен.
  3. Перетащите видео или аудио в окно. Язык можно оставить на автоопределении или выбрать русский.
  4. Когда текст готов, экспортируйте его или скопируйте в Claude либо ChatGPT для доводки.

Бесплатной версии с моделью Small хватает на чистую запись с одним голосом. Pro покупается один раз и открывает большие модели, разметку спикеров и другие функции. Состав версий разработчик время от времени меняет, поэтому перед покупкой сверьтесь с описанием на сайте. Если нужна точная модель бесплатно, поставьте на мак Buzz: в ней Large v3 Turbo ничего не стоит.

На Windows, маке и Linux: Buzz

Buzz это бесплатная программа с открытым кодом для Windows, мака на Apple Silicon и Linux. Внутри тот же Whisper, есть ускорение на видеокартах. Добавляете файл, выбираете модель и язык, на выходе получаете TXT, SRT или VTT. Все модели, включая Large v3 Turbo, бесплатны. Умеет и разделять текст по спикерам.

На ноутбуке без отдельной видеокарты выбирайте модель small: так быстрее, хотя ошибок будет больше. Длинную запись удобно поставить на расшифровку и заняться своими делами.

Если не боитесь командной строки

Оригинальный Whisper ставится одной командой. Понадобятся Python и программа ffmpeg:

pip install -U openai-whisper
whisper lekciya.mp4 --model turbo --language Russian --output_format srt
Whisper с моделью turbo расшифровывает отрывок длиной 1 минута 40 секунд на маке, это заняло меньше минуты. Ошибки видны сразу: в строке 00:17 «выжить» вместо «выжать», а ChatGPT записан на слух как «чатом GPT».

В папке появится файл lekciya.srt с субтитрами. Вместо srt можно написать txt (просто текст) или all (все форматы сразу). Если настраивать Python не хочется, поручите это ИИ-агенту вроде Claude Code: напишите «поставь Whisper и расшифруй lekciya.mp4 в SRT», и он сам установит всё нужное и запустит команду.

Файл otryvok.srt, который Whisper сохранил рядом с записью: номер субтитра, время начала и конца, текст. Такой файл можно сразу загрузить в YouTube или CapCut.

Транскрибация звонка или встречи

Звонок или встречу на русском надёжнее всего записать, а потом расшифровать отдельно, через Whisper или онлайн-сервис с разметкой спикеров. Это сложнее обычной записи: голосов несколько, люди перебивают друг друга, звук идёт через интернет. Порядок такой:

  1. Предупредите участников, что встреча записывается и будет расшифрована. Это вопрос и вежливости, и правил многих компаний.
  2. Запишите встречу встроенной записью Телемоста или Zoom либо любой программой записи экрана. Лучше, если каждый говорит в гарнитуру, а не в микрофон ноутбука через всю комнату.
  3. Расшифруйте файл: локально через MacWhisper или Buzz, если разговор рабочий, или онлайн с разметкой спикеров, если запись можно отдавать наружу.
  4. Соберите протокол промптом: кто что сказал, какие решения приняли, кто что делает и к какому сроку. Готовый промпт ниже.

Встроенная расшифровка в сервисах звонков есть, но с оговорками. Телемост делает её только на бизнес-тарифах Яндекс 360. Google Meet на октябрь 2026 года сохраняет транскрипты на восьми языках, и русского среди них нет. Поэтому для русскоязычных встреч путь «записать, потом расшифровать» пока самый надёжный.

Сколько времени экономит ИИ-транскрибация

Вручную на час записи уходит от 3 до 6 часов: приходится постоянно ставить на паузу, переслушивать и печатать. С нейросетью человек только вычитывает готовый текст, и это в разы быстрее, особенно на чистом звуке.

Подвиньте ползунок на длину своей записи и выберите, какой у вас звук. Нормы в полях можно поменять, если знаете свою скорость.

1 ч
Какой звук
Урок, вебинар или подкаст: пара голосов, иногда шум.
Вручную4 ч
Нейросеть и вычитка1 ч
Плюс время распознавания: от пары минут в облаке до длины самой записи на слабом ноутбуке. В это время компьютер работает без вас.
экономия75%За месяц освобождается 12 ч вашего времени.

Нормы примерные: опытный расшифровщик тратит от 3 до 6 часов на час записи, вычитка готового текста идёт в разы быстрее. Подставьте свои цифры в поля.

Сильнее всего выигрыш на длинных записях и регулярной работе: уроки, подкасты, еженедельные созвоны. А если вы записываете голос только ради текста (заметки, письма, длинные промпты), файл не нужен вовсе. Я надиктовываю длинные промпты через Wispr Flow: говорю, и текст сразу появляется в любом поле ввода.

Что делать с текстом после расшифровки

Сырая расшифровка почти никогда не годится как есть, но доводится одним запросом в Claude или ChatGPT. Переключайте вкладки и смотрите, как один фрагмент становится абзацами, репликами, субтитрами и конспектом. Промпт для каждого вида можно скопировать.

razgovor.mp4 · 0:30Пример: выдуманный разговор
Результат
ну вот смотрите я записал урок минут на двадцать и потом э три часа сидел над субтитрами а можно же сразу получить текст да можно загружаете файл в виспер он выдаёт расшифровку с таймкодами а дальше просите клод убрать слова паразиты и разбить на абзацы и сколько это по времени ну минут десять на вычитку не больше
Откуда это
Так выглядят автоматические субтитры YouTube и простые распознаватели: без точек и заглавных букв, со словами-паразитами, названия записаны на слух («виспер», «клод»). Читать такое тяжело, но вся информация уже здесь.
Выберите вид выше, чтобы увидеть, во что этот текст превращается за один запрос.

Пример выдуманный, но так и выглядит работа с расшифровкой: распознавание даёт сырой текст, а нужный вид получается одним промптом в Claude или ChatGPT.

Главное правило для всех таких промптов: попросите нейросеть ничего не добавлять от себя и помечать сомнительные места. Иначе она «улучшит» текст и припишет человеку слова, которых он не говорил. Как собрать промпт, который работает с первого раза, я разбирал в статье как писать промпты.

Сырой текст из Whisper я отдал Claude в терминале с промптом для абзацев из демки выше, поменяв только имена. Claude разбил текст на абзацы, исправил «чатом GPT» на ChatGPT, а сомнительное «выжить» не стал додумывать и пометил [?].

Протокол встречи из длинной расшифровки

Для записи на час и больше пригодится промпт, который делает всё сразу:

Ниже автоматическая расшифровка рабочей встречи.
Участники: [имена и роли].
Сделай три части:
1. Краткое содержание: от пяти до семи пунктов.
2. Решения, которые приняли.
3. Задачи: что сделать, кто отвечает, срок (если назвали).
Пиши только то, что есть в тексте.
Если не уверен, кто это сказал или что за слово, ставь [?].

Расшифровка:
[вставьте текст]

Нейросеть для субтитров к видео

Субтитры удобнее всего сразу сохранять из Whisper или Buzz в формате SRT: время у каждой строки уже выставлено. Языковая нейросеть нужна для доводки: исправить имена и термины, переразбить длинные строки под вертикальное видео, перевести субтитры на другой язык с теми же таймкодами. Готовый SRT загружается в YouTube, CapCut и большинство видеоредакторов.

Конспект по видео или лекции

Отдельная нейросеть для конспектов не нужна: подойдёт любой чат-бот, которому вы дадите расшифровку. Попросите структуру под задачу: тезисы, вопросы для самопроверки, список терминов с объяснениями. Очень длинный текст загрузите файлом или частями, а в конце попросите собрать общий конспект.

Точность: от чего зависит и как проверить расшифровку

На чистой записи с одним голосом современные модели ошибаются редко: ElevenLabs, например, заявляет для русского ошибку не больше чем в 5% слов. На реальных записях точность ниже, и причины почти всегда одни и те же:

  • Микрофон и расстояние. Петличка или гарнитура дают заметно лучший результат, чем ноутбук на другом конце стола.
  • Шум и музыка. Фоновая музыка в ролике мешает распознаванию сильнее, чем кажется на слух.
  • Несколько голосов одновременно. Когда люди перебивают друг друга, модель склеивает реплики.
  • Термины, имена, бренды. «Клод» вместо Claude, перевранные фамилии и названия. Самая частая ошибка.
  • Размер модели. Маленькие модели Whisper на русском заметно хуже больших.

Термины можно подсказать заранее. У Whisper в командной строке есть параметр --initial_prompt: передайте туда имена и названия, которые звучат в записи, и модель чаще будет писать их правильно. В онлайн-сервисах похожая настройка обычно называется словарём или ключевыми терминами.

Настройки распознавания в окне загрузки файла ElevenLabs. В поле Keyterms вписывают имена и термины из записи, здесь ChatGPT, а переключатель No verbatim убирает «э-э-э», повторы и запинки прямо при распознавании.

Отдельная особенность Whisper: на тишине и музыке он иногда «слышит» фразы, которых не было. В конце ролика может появиться «Продолжение следует...» или благодарность за просмотр. Почему нейросети вообще дописывают несуществующее, я объяснял в статье почему нейросеть врёт.

Проверять расшифровку целиком на слух не обязательно. Достаточно четырёх приёмов:

  • Прочитайте текст глазами: ошибки распознавания видны как бессмысленные слова и обрывки фраз.
  • Переслушайте места с цифрами, именами и датами. Ошибка там обходится дороже всего.
  • Попросите нейросеть выписать слова, которые не подходят по смыслу, вместе с таймкодами. Звук она не слышит, но несуразицу замечает хорошо.
  • Субтитры проверьте, посмотрев ролик на скорости 1,5: сразу видно и опечатки, и рассинхрон.

Конфиденциальность: что не стоит отправлять в онлайн-сервис

Онлайн-сервис транскрибации получает файл целиком: голоса, имена, суммы, всё, что прозвучало. Для лекции или ролика с YouTube это неважно. Для созвона с клиентом, консультации врача или юриста, встречи под договором о неразглашении лучше локальный Whisper: запись не покидает ваш компьютер.

То же касается следующего шага. Когда вы вставляете расшифровку в ChatGPT или Claude, текст тоже уходит в облако. Что туда можно отдавать, а что нет, я разбирал в статье что нельзя отправлять в нейросеть. Если текст личный, уберите из него имена, телефоны и суммы до отправки.

От расшифровки к монтажу

Расшифровка с таймкодами нужна не только для чтения. Это основа монтажа: по ней видно, где пауза, где неудачный дубль, какую фразу убрать. Из неё же получаются субтитры, нарезка коротких роликов и подписи к графике.

Бесплатные инструменты из этой статьи доводят вас до текста и файла субтитров. Дальше обычно начинается видеоредактор: искать по таймкодам неудачные дубли, вырезать паузы, вручную расставлять субтитры. Можно иначе: положить исходник в папку проекта, описать ролик словами, и ИИ-агент сам соберёт монтаж, субтитры и графику. Как это выглядит, я показывал в статье про монтаж видео с помощью нейросетей.

В курсе «Нейромонтаж» так монтируем отснятое видео с говорящей головой: субтитры, графика поверх кадра, версия для YouTube и вертикальная для рилзов из одного исходника, без видеоредактора. Там же озвучка и инфографика для роликов, которые собираются из текста.

Частые вопросы

Как сделать транскрибацию видео в текст бесплатно?

Для ролика на YouTube раскройте описание и нажмите «Показать текст видео». Для своих файлов поставьте бесплатную программу на Whisper: Buzz (Windows, мак, Linux) или бесплатную версию MacWhisper. Обе работают без интернета и без лимитов по минутам.

Какая нейросеть лучше расшифровывает русскую речь?

Из бесплатных чаще всего берут Whisper с моделью turbo или large. Из онлайн-сервисов сильный вариант ElevenLabs Scribe: русский у неё в группе самых точных языков, есть разметка спикеров, но из России сервис официально недоступен. На чистом звуке разница небольшая, на шумном заметнее.

Есть ли транскрибация в Яндексе?

Частично. Яндекс Браузер бесплатно делает краткий пересказ видео с таймкодами, а полную расшифровку и конспект встречи Телемост присылает только на тарифах Яндекс 360 для бизнеса. Для разработчиков есть платный API SpeechKit.

Нужен ли мощный компьютер для Whisper?

Для модели turbo желательна видеокарта примерно с 6 ГБ памяти или мак на чипе M. На обычном ноутбуке подойдёт модель small: она ошибается чаще, зато справляется на слабом железе. Все модели Whisper бесплатны и работают без интернета.

Как сделать транскрибацию звонка или встречи?

Запишите встречу, предупредив участников, и расшифруйте файл в Whisper или в онлайн-сервисе с разметкой спикеров. Потом попросите Claude или ChatGPT подписать реплики и собрать протокол с решениями и задачами.

Чем транскрибация отличается от субтитров?

Транскрибация это полный текст записи. Субтитры это тот же текст, разбитый на короткие строки с точным временем показа, обычно в файле SRT. Whisper умеет сохранять и то и другое.