Проверил, какая нейросеть умеет говорить по-русски в видео: пять моделей, одна фраза
Захотелось выяснить простую вещь. Есть модели, которые делают ролик и сразу озвучивают героя - он открывает рот, и оттуда идёт голос. Вопрос: сколько из них справятся с русской речью, а не только с английской.
В обзорах ответа нет. Там либо перечисляют сервисы для озвучки уже готового видео, либо ссылаются на рейтинги, где ролики оценивают вообще без звука. Пришлось проверять руками.
Условия
Придумал фразу, в которой собраны самые неудобные для машины звуки:
Слушай, я уже всё решил: щенка мы забираем в четверг.
Тут «ш», «ж», «щ», «ч» и мягкие согласные. На них модели обычно и спотыкаются - либо губы разъезжаются, либо слово превращается в кашу.
Описание сцены написал по схеме, которую сама Google советует для Veo: кадр, герой, действие, обстановка, стиль, а реплика - в двойных кавычках. Kling в своей документации рекомендует тот же приём. Ничего от себя не придумывал.
Текст описания взял один и тот же для всех пяти моделей, буква в букву. Настройки тоже одинаковые: горизонтальный формат, 720p, пять секунд. Только у Gemini Omni пятёрки в списке нет, там пришлось ставить шесть.
Чтобы не спорить «мне кажется, похоже», проверял так: вытаскивал звуковую дорожку и прогонял через распознавание речи. Двумя разными моделями распознавания - если обе слышат одинаково, значит так и было сказано. Плюс мерил громкость дорожки: сразу видно, речь там или просто фон.
Результаты
Veo 3.1. Распознавание вернуло фразу без единой правки. Обе модели сошлись, язык определён как русский с уверенностью 0,99. Забавно, что при заказанных пяти секундах ролик пришёл на восемь.
Gemini Omni. То же самое - фраза целиком, ни одной ошибки. Картинка вышла ближе всего к описанию: кухня, окно, дневной свет.
Seedance 2 Pro. Говорит уверенно, голос живой. Но распознавание слышит «шинка мы заберем в четверть» вместо «щенка мы забираем в четверг». Звук «щ» упростился до «ш», а конец слова «четверг» модель не вытянула. Вторая модель распознавания услышала то же, только вместо «четверть» - «в 4». Картинка при этом отличная, проблема ровно в двух звуках.
Kling 3.0. Говорит, и распознавание уверенно определяет русский. Только от фразы остаётся одно первое слово: «Слушай, а я уже всё и дел. Шченко мой забирай муфкетка». Вторая модель распознавания услышала свой вариант той же каши, но совпало главное - «слушай» на месте, «щенка» стало «шченко», а «четверг» не опознали обе.
Полез в документацию Kling и нашёл объяснение: там прямо написано, что версия 3.0 знает пять языков - китайский, английский, японский, корейский и испанский. Русского в списке нет. Модель произносит его как чужой набор звуков - примерно как человек читает вслух незнакомый язык по буквам. Картинку по описанию при этом отрабатывает нормально.
Wan 2.7. Пять запусков, две версии модели, два варианта описания. Каждый раз ошибка генерации. Тут дело не в русском языке, а в том, что модель в этот день просто не отвечала. Пишу как есть, проверить не вышло.
Почему рассыпается именно «щ»
Никакой магии. Русского в обучающих данных обычно сильно меньше, чем английского или китайского, и первым страдает то, чего в других языках нет.
Отдельного «щ» в английском нет вообще - модель подставляет знакомое «ш». Мягкость согласных на слух едва различима, её проглатывают. А четыре согласных подряд в конце «четверга» модель просто обрывает.
Вывод бытовой: если пишете реплику для модели, в русском которой не уверены, берите слова попроще. Короткие, без «щ», без нагромождения согласных. Шанс услышать фразу целиком заметно вырастает.
Что делать, если модель по-русски не умеет
Работает связка из двух шагов, и она же спасает, когда нужен конкретный голос.
Сначала голос. ElevenLabs, режим озвучки диалога, язык русский - он там заявлен официально, в списке 76 языков. Отдал ту же фразу, получил 3,4 секунды чистой речи. Распознавание услышало её дословно, уверенность в языке - единица.
Потом губы. HeyGen 1.0, режим синхронизации. Загружаешь видео и новую дорожку, модель переставляет губы под звук. Я взял тот самый ролик Seedance, где фраза прозвучала криво, и подложил чистый голос. На выходе - картинка Seedance и нормальная русская речь.
Грабля, на которую напоролся: HeyGen откажется работать, если длительность звука и видео отличается больше чем на 15 процентов. У меня было 3,4 секунды против пяти - отказ. Добил аудио тишиной до пяти секунд, дальше прошло с первого раза.
Итог
Нужен говорящий герой по-русски и сразу со звуком - Veo 3.1 или Gemini Omni. Обе произнесли фразу дословно.
Seedance 2 Pro берите, если реплика простая. Картинка у неё сильная, а речь при желании перекладывается через ElevenLabs с HeyGen.
Kling 3.0 для русских диалогов сейчас мимо: язык похож на русский, а слова в фразу не собираются. И это не придирка - вендор сам русский не заявляет.
И общее: списки языков у всех меняются каждые пару месяцев, а такая проверка занимает минут двадцать. Прежде чем строить что-то вокруг одной модели, прогоните через неё свою фразу.
Если хотите повторить
Все пять моделей плюс ElevenLabs и HeyGen живут в одном боте Cyber AI, переключаться между ними можно в пару кликов, отдельные аккаунты не нужны.
Порядок простой: раздел «Создать видео», выбираете модель, ставите одинаковые для всех настройки, вставляете описание с репликой в кавычках. У Seedance включите тумблер генерации аудио, у Kling - Native Audio. Если речь не получилась - идёте в раздел «Музыка и Озвучка», делаете голос в ElevenLabs и синхронизируете губы в HeyGen.

