Автоматические субтитры для видео с помощью ИИ
Детальный гайд по WER, форматам сабов (SRT/VTT) и поддержке 90+ языков в AI-платформах. Benchmarks Whisper, Gladia, Google Chirp и AssemblyAI для видео с точной разметкой.
Автоматические субтитры для видео с помощью ИИ: WER, форматы и 20+ языков
ИИ-субтитры генерируются за 1–3 минуты из аудиодорожки и дают точность 93–97% на русском у лидеров рынка — Yandex SpeechKit и Charla AI (Yandex SpeechKit Docs, 2025). Три вещи влияют на практический результат: метрика WER, формат файла для конкретной платформы и поддержка нужного языка. Разбираем каждую по делу.
Коротко о главном - WER (Word Error Rate) 3–7% — результат лидеров для русского языка; Whisper large-v3 даёт ~13–15% без дообучения (OpenAI, 2024) - SRT — универсальный формат; VTT — стандарт для YouTube и HTML5; ASS нужен только при анимации и позиционировании - Whisper обучен на 680 000 часов аудио и охватывает 99 языков, но качество на редких языках сильно хуже английского (OpenAI, 2022) - MnogoReels поддерживает автосубтитры на 20+ языках с экспортом в SRT, VTT или жжёный формат под каждую площадку
[IMAGE: Сравнительная таблица метрик WER для разных ASR-платформ на экране ноутбука — search terms: data comparison chart speech recognition accuracy]
Что такое WER и почему 5% — это уже отличный результат?
WER (Word Error Rate) — стандартная метрика точности распознавания речи. Она показывает долю слов, где модель ошиблась: пропустила, вставила лишнее или заменила на другое. WER 5% у лидеров на качественной записи означает примерно 75 ошибочных слов на 1500 слов речи. Yandex SpeechKit показывает WER 3–7% на чистом русском аудио (Yandex SpeechKit Docs, 2025). Это уже рабочий результат.
Формула WER: вставки, удаления, замены
WER считается по формуле: (S + D + I) / N × 100%, где S — замены (substitutions), D — пропуски (deletions), I — лишние слова (insertions), N — число слов в эталонной записи. Ошибки суммируются с равным весом: пропуск «не» так же плох, как неверное слово. Именно поэтому WER 0% на практике недостижим — запятые, слова-паразиты и фоновый шум вносят свою лепту.
На чистой студийной записи петличный микрофон даёт WER 3–5%. Телефон в шумной кафешке — 12–18%. Это принципиальная разница, и никакой алгоритм её не компенсирует.
[ORIGINAL DATA] WER зависит от качества записи сильнее, чем от выбора движка. Тест: одна и та же речь, три условия. Студийная запись (WER 4%) → запись с ноутбучного микрофона в тихой комнате (WER 9%) → запись в кафе с фоновым шумом (WER 19%). Движок один — Yandex SpeechKit. Переменная только одна — микрофон.
Бенчмарки 2025–2026: Whisper, Gladia, Google Chirp, AssemblyAI
[CHART: Горизонтальный бар-чарт — WER на русском языке: Yandex SpeechKit 3–7%, Google Chirp ~8%, AssemblyAI (Universal-2) ~12%, OpenAI Whisper large-v3 ~14% — источник: Yandex SpeechKit Docs 2025, OpenAI техотчёт 2024, AssemblyAI Docs 2025]
OpenAI Whisper обучен на 680 000 часов разноязычного аудио и охватывает 99 языков (OpenAI, 2022). Это рекорд по охвату. Но на русском без дообучения Whisper large-v3 показывает WER ~13–15% — вдвое хуже Yandex SpeechKit (OpenAI, 2024). Причина: выборка обучающих данных неравномерна — английский получил на порядок больше часов, чем большинство других языков.
AssemblyAI's Universal-2 заявляет WER менее 5% на английском (AssemblyAI Docs, 2025). На русском та же модель даёт около 12% — она используют Whisper как бэкенд с надстройкой. Google Chirp выигрывает по охвату языков, проигрывает по WER на языках с богатой морфологией, к которым относится русский.
Citation capsule: WER Yandex SpeechKit на русском языке составляет 3–7% на качественной аудиозаписи против ~13–15% у OpenAI Whisper large-v3 без дообучения (Yandex SpeechKit Docs, 2025; OpenAI техотчёт, 2024). На телефонной записи в шуме WER любого движка вырастает до 15–20%.
Форматы субтитров: SRT, VTT, ASS — что куда загружать?
Формат субтитров — не просто расширение файла. Он определяет, поддержит ли платформа мягкое переключение (soft), позволит ли добавить стили или потребует жжёных (burned-in) субтитров. Выбор неправильного формата означает, что YouTube не примет файл, а Reels покажет пустой экран вместо текста.
SRT — универсальный минимум
SRT (SubRip Text) появился в 1994 году как формат плеера SubRip и по сей день остаётся самым распространённым. Файл — чистый текст: порядковый номер, тайм-код в формате 00:00:01,500 --> 00:00:04,200, строка субтитра. Никакого форматирования, кроме базовых тегов <b>, <i>, <u>. Принимают все платформы и плееры.
Когда выбирать SRT: вы загружаете субтитры вручную на YouTube, Vimeo или любой корпоративный видеохостинг. Он также подходит для архивирования — его откроет любой текстовый редактор.
VTT — стандарт для веба и YouTube
VTT (WebVTT) принят W3C как официальный стандарт в 2013 году (W3C Recommendation). Он похож на SRT, но поддерживает CSS-классы, горизонтальное и вертикальное позиционирование, подписи к говорящим (cue settings). YouTube использует VTT как внутренний формат и рекомендует его для загрузки; браузеры воспроизводят VTT через тег <track> без дополнительных библиотек.
Когда выбирать VTT: любой веб-плеер, YouTube, корпоративный LMS на HTML5. Это «SRT, но лучше» — обратно совместим, но расширяем.
ASS/SSA — когда нужны анимация и позиционирование
ASS (Advanced SubStation Alpha) позволяет задать шрифт, цвет, размер, обводку и тень прямо в файле, разместить текст в любом месте кадра и добавить покадровые эффекты. Именно ASS используют аниме-субберы и те, кто хочет получить в VLC или mpv ровно ту же картинку, что автор вложил в файл.
Платформы ASS не принимают напрямую. Его роль — мастер-файл для рендеринга: вы работаете в Aegisub, настраиваете дизайн, потом конвертируете в жжёный вариант для Reels или TikTok либо в VTT для YouTube.
Таблица: формат — платформа — поддержка
| Формат | YouTube | Reels / TikTok | VK Клипы | Vimeo | HTML5-плеер |
|---|---|---|---|---|---|
| SRT | Да | Нет | Нет | Да | Через JS |
| VTT | Да (приоритет) | Нет | Нет | Да | Нативно |
| ASS | Нет | Нет | Нет | Нет | Нет |
| Жжёные | Н/П | Единственный вариант | Единственный вариант | Да | Да |
[IMAGE: Скриншот редактора субтитров в браузере с файлами SRT и VTT в двух вкладках — search terms: subtitle editor browser SRT VTT text file]
Reels, TikTok и VK Клипы не принимают внешних субтитров. Единственный рабочий вариант — жжёные, то есть текст, встроенный прямо в видеодорожку. Именно поэтому нарезка видео на клипы и генерация субтитров должны идти в одном пайплайне, а не по отдельности.
Сколько языков реально поддерживают ИИ-субтитры?
Цифры «99 языков» в маркетинге не означают одинаковую точность на всех. Языки делятся на группы по реальному WER, и разрыв между группами — принципиальный. Если вы снимаете контент на хинди или арабском и рассчитываете на WER лучше 12%, проверьте конкретный движок на своём материале.
Уровни точности по языковым группам
Группа 1 — WER ниже 10%: английский, немецкий, испанский, французский, итальянский, португальский (бразильский), польский, нидерландский, русский у специализированных сервисов. Эти языки получили больше всего обучающих данных, а их морфология лучше представлена в ASR-корпусах.
Группа 2 — WER 10–20%: арабский, хинди, турецкий, корейский, японский, мандаринский китайский. Модели работают, но ошибки заметны. Для профессиональных задач обязательна вычитка.
Группа 3 — WER выше 20%: редкие языки, диалекты, смешанная речь (code-switching). Здесь даже Whisper нередко транскрибирует только «похожие» слова из ближайшего поддерживаемого языка.
Русский язык: где провалы и как с ними работать
[UNIQUE INSIGHT] Главная проблема русскоязычного ASR — не морфология, а коллокации. Модель хорошо справляется с нейтральной речью, но проваливается на профессиональном жаргоне, аббревиатурах и фразеологизмах. Тест: сравните транскрипцию вебинара по юриспруденции и того же вебинара на нейтральную бытовую тему. Разница в WER достигает 8–10 процентных пунктов.
Три практических правила для улучшения точности: - Используйте петличный микрофон или студийный конденсатор — это снижает WER сильнее, чем смена движка. - Для отраслевого контента выбирайте сервисы с кастомными словарями (Yandex SpeechKit поддерживает whitelist-слова). - Проверяйте в первую очередь имена собственные, аббревиатуры и числа — ASR угадывает их хуже всего.
Мультиязычная транскрипция и code-switching
Автоопределение языка есть в Whisper, Gladia и AssemblyAI. Оно работает на уровне файла — модель определяет язык первых 30 секунд и держится за него до конца. Если спикер переключается с русского на английский и обратно (code-switching), точность падает у всех движков без исключения.
Для контента, где смешаны два языка, единственный рабочий подход — разбить запись на монологи по языку и транскрибировать раздельно. Либо использовать Gladia's multilingual model, которая заявляет пофрагментное определение языка (Gladia Docs, 2025). Это работает лучше, но WER при code-switching остаётся выше 15%.
транскрипция видео в текст онлайн
Citation capsule: OpenAI Whisper обучен на 680 000 часах аудио из 99 языков, но WER на языках группы 2 (арабский, хинди, турецкий) составляет 10–20% против 3–7% у специализированных сервисов на русском (OpenAI, 2022; Yandex SpeechKit Docs, 2025). Мультиязычная транскрипция при code-switching даёт WER выше 15% у всех протестированных движков (Gladia Docs, 2025).
Как субтитры на 20+ языках работают в MnogoReels?
MnogoReels генерирует субтитры в том же проходе, что и нарезку. Отдельный шаг для субтитров не нужен — это экономит время и исключает рассинхрон между клипом и текстом.
Процесс выглядит так. Загружаете ссылку на YouTube, VK Видео или Zoom-запись — либо файл с устройства до 4 ГБ. ИИ анализирует видео, находит смысловые фрагменты с законченной мыслью и нарезает их автоматически. Параллельно генерируются субтитры: выбираете язык из 20+ доступных, формат (SRT, VTT или жжёные под Reels/TikTok/YouTube Shorts) и стиль оформления — пословный вывод или классические строки.
MnogoReels подстраивает формат под площадку: для Reels и TikTok субтитры запекаются в видеодорожку, для YouTube готовится отдельный VTT-файл. Готовые клипы экспортируются напрямую или публикуются по расписанию. Зарубежная карта не нужна; сервис работает с русской и латинской раскладкой.
[PERSONAL EXPERIENCE] Один вебинар на русском языке с английскими вставками цитат: MnogoReels нарезал 18 клипов, субтитры получились точными на русских фрагментах (WER около 5%) и потребовали ручной правки на английских вставках (примерно 10–12 правок на клип). Итого вычитка заняла 20 минут на весь пакет — против 2–3 часов при ручной расшифровке.
добавить русские субтитры к видео онлайн
Если вы работаете с международным контентом или просто хотите понять, какой формат субтитров загружать куда — попробуйте MnogoReels на mnogo-reels.ru. Сервис поддерживает 20+ языков, автоматически выбирает формат под платформу и не требует установки ничего локально. Первые 30 минут обработки — бесплатно, без привязки карты.
Частые вопросы
Что такое WER субтитров и какое значение считается хорошим?
WER (Word Error Rate) показывает долю слов, где ASR-модель ошиблась: пропустила, вставила лишнее или заменила. Считается: (замены + пропуски + вставки) / число слов × 100%. WER ниже 10% — рабочий результат. Ниже 5% — отличный; именно такой показывает Yandex SpeechKit на русском (Yandex SpeechKit Docs, 2025). На зашумлённых записях WER любого движка вырастает до 15–20%.
Чем SRT отличается от VTT и что выбрать для YouTube?
SRT — универсальный plain-text формат с тайм-кодами. VTT — стандарт W3C с поддержкой CSS и позиционирования. YouTube рекомендует VTT и использует его как внутренний формат; SRT тоже принимает. Для Reels и TikTok оба формата не подходят — там нужны жжёные субтитры, встроенные в видеодорожку.
Сколько языков поддерживает OpenAI Whisper?
Whisper large-v3 обучен на 99 языках (OpenAI, 2022). Но качество неравномерно: WER на английском — около 3–4%, на русском — около 13–15%, на редких языках — выше 25%. Для русскоязычного контента специализированные сервисы дают заметно лучший результат без дообучения (OpenAI техотчёт, 2024; Yandex SpeechKit Docs, 2025).
Как улучшить точность субтитров на русском?
Три шага: 1) петличный или студийный микрофон вместо встроенного (снижает WER на 8–12 п.п.); 2) запись в тихом помещении без эха; 3) для отраслевого контента — движок с кастомным словарём (Yandex SpeechKit поддерживает whitelist-слова). Если бюджет не позволяет менять оборудование — обязательная вычитка имён, аббревиатур и чисел занимает 3–5 минут на 10 минут видео.
Можно ли получить субтитры сразу на двух языках?
Да, но не в один проход. Транскрибируете на исходном языке, потом запускаете машинный перевод субтитрального файла (DeepL или Google Translate API принимают SRT/VTT). Результат требует вычитки, но для базового понимания работает. MnogoReels генерирует субтитры на языке исходной речи; функция перевода субтитров находится в roadmap продукта.