Лидеры года — новая категория на Workspace Digital Awards! Номинируйте вашу команду, продукты и проекты.
ООО Медплатформа
Закадровый перевод видео на русский: распознавание, перевод и синтез речи
ООО Медплатформа
#Разработка программного обеспечения#ИИ и нейросети

Закадровый перевод видео на русский: распознавание, перевод и синтез речи

15 
ООО Медплатформа Россия, Москва
Поделиться: 0 0 0
Закадровый перевод видео на русский: распознавание, перевод и синтез речи
Сфера

Образование, наука, работа

Сдано

Сентябрь 2026

Задача

Внутренний проект. Серия англоязычных лекций нужна на русском с закадровым голосом. Ручной перевод и диктор стоят дорого и долго, а онлайн-сервисы дубляжа ломают темп речи, не держат укладку и не дают контроля над терминами.

Задача: конвейер, который переводит ролики потоком без участия человека, с естественным русским голосом и попаданием фраз в таймкоды оригинала, на открытых моделях с лицензией, допускающей коммерческое использование.

Решение

Собрали конвейер из шести шагов, запускаемый одной командой на ролик: выгрузка видео и субтитров, разбор субтитров в предложения с таймкодами, машинный перевод офлайн-моделью, синтез русской речи, укладка и сведение, наложение текстовых плашек и экспорт.

Укладка: длина каждой синтезированной фразы сравнивается с окном оригинала, темп подгоняется автоматически, дорожка собирается по таймкодам, исходный голос приглушается.

Выбор голоса: сравнили несколько движков синтеза по качеству и лицензии (в том числе клонирование голоса по образцу). Оставили два варианта с открытой лицензией без ограничений на коммерческое использование, некоммерческие отбросили сразу.

Плашки и заголовки рендерятся из HTML в PNG и накладываются поверх видео, без видеоредактора. Промежуточные файлы удаляются после сборки, поэтому очередь из десятков роликов не занимает диск.

Стек: Python, ffmpeg, yt-dlp, Argos Translate, Vosk, vosk-tts, Voicebox, headless Chrome.

Результат

Ролики переводятся потоком без диктора и студии: одна команда на лекцию, на выходе MP4 с русской дорожкой и плашками. Стоимость определяется только машинным временем, все модели работают локально.

Шесть шагов конвейера и инструменты на каждом из них.

Тот же конвейер подходит для обучающих курсов, вебинаров и продуктовых видео: меняются только источник и голос. При необходимости добавляется ручная правка перевода перед синтезом.

Комментарий агентства

Александр Исаев
Александр Исаев

Самое сложное в дубляже не перевод, а укладка и лицензии голосов: половина популярных моделей синтеза запрещает коммерческое использование. Мы проверяем это до того, как клиент получит готовый ролик.


Стек технологий

  • Python Python Язык программирования
  • Docker Docker Среда разработки

Над проектом работали:


Оцените кейс
Спасибо за оценку
Выскажите мнение
Авторизуйтесь, чтобы добавить свой комментарий.
оставить заявку

Хотите заказать похожий проект?

ООО Медплатформа с удовольствием обсудит вашу задачу

Оставить заявку