Качество многоязычного ASR неравномерное, и языки с малыми ресурсами (казахский, киргизский, узбекский) страдают от нехватки данных.
Преодолеть эту проблему смогли, создав GigaAM Multilingual (https://huggingface.co/ai-sage/GigaAM-Multilingual) с conformer‑энкодером (600M параметров), предобученным на 2 млн часов аудио в стиле HuBERT.
Для борьбы с доминированием массовых языков на стадии предобучения ввели кластерную балансировку и объединили языки в 5 кластеров на основе нормализованного графа совместной встречаемости, подбирая веса так, чтобы увеличить вклад центральноазиатской группы.
Файнтюнингом предотвратили перекос в сторону больших синтетических подвыборок, делая CTC‑дообучение на смеси русского, английского, казахского, киргизского, узбекского с доменно‑осознанным семплированием (открытые, краудсорсинговые, синтетические и слаборазмеченные данные).
Метод успешно перенесли на редкие языки, адаптировав к башкирскому и грузинскому (менее 500 ч в предобучении) с лучшими WER.
В результате модель превосходит Whisper Large v3 и Omnilingual‑1B на целевых языках, особенно на спонтанной речи, причём даже компактный вариант 240M опережает крупные базовые энкодеры при равных условиях CTC‑файнтюнинга.
Архитектура объединила аудиоэнкодер и проекцию в предварительно обученную текстовую LLM, передавая временные метки как форматированный текст, а контекстное окно объёмом 128k токенов обеспечило обработку до 90 минут без фрагментации.
Данные собирали из реальных многоязычных записей (AISHELL-4, подкасты, фильмы) и симулированных многоголосых смесей с наложениями, паузами и шумами.
В результате она превосходит все коммерческие системы (Doubao, ElevenLabs, GPT-4o и Gemini 2.5/3 Pro) на AISHELL-4, Podcast и Movies по метрикам CER (качество распознавания), cpCER (с учётом правильности спикера) и Δcp = cpCER – CER (изолирует ошибки диаризации), сохраняя стабильность атрибуции спикеров на длинных записях, где конкуренты часто неприменимы.
Поддерживаются 40 региональных вариантов языков, среди них 19 готовы к транскрипции, 13 имеют широкий охват, оставшиеся 8 требуют дообучения.
Архитектура, основанная на Cache-Aware FastConformer-RNNT и Language-ID Prompt, совершает потоковую обработку без перекрывающихся вычислений за счёт повторного использования кэша энкодера.
Размеры чанков для обработки составляют 80, 160, 320, 560 и 1120 миллисекунд.
Встроенные возможности добавляют пунктуацию и заглавные буквы, автоматически определяют язык (target_lang=auto) и дают гибкий выбор компромисса между задержкой и точностью во время вывода.
Пропускная способность (число одновременных потоков) на H100 составляет 240 при 80 мс (против 14 у Parakeet RNNT 1.1B), 480 при 160 мс, 960 при 320 мс, 1500 при 560 мс и 2400 при 1120 мс (против 400 у аналога).
В результате точность по FLEURS и LangID выросла, так как средний WER снизился с 10.38% (80 мс) до 8.84% (1.12 с).
Она может распознавать китайский и английский, включая диалекты (у, кантонский, хоккиен, сычуаньский и др.), используя кодовое переключение без языковых тегов, распознавать пение даже с аккомпанементом, а также справляться с сильным шумом, далёким захватом и наложением голосов (многоговорящие сценарии). При этом она выдаёт точную транскрипцию сложного контента, включая классическую поэзию, термины, имена и техническую лексику со встроенной смысловой пунктуацией без постобработки.
Обучали её на крупномасштабном mid-training, качественном SFT и новых алгоритмах обучения с подкреплением (RL).
В результате модель хорошо себя показала на публичных и внутренних бенчмарках, превосходя Qwen3-ASR, Seed-ASR 2.0, Whisper Large V3, FunASR-1.5 и Gemini-3.1-Pro по среднему WER во всех категориях.
Представили две новые модели для преобразования речи в текст с высочайшим качеством, диаризацией и низкой задержкой в линейке Voxtral Transcribe 2 (https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-26...). Разработанные для интеллектуального анализа встреч, голосовых агентов, автоматизации контакт-центров, субтитров и наблюдения за выполнением правил.
Первая из них имеет название Voxtral Mini Transcribe V2 и предназначена для пакетной обработки, имея лучшее соотношение цены и качества (низкая доля ошибок, $0.003/мин). Она поддерживает 13 языков, диаризацию, метки времени и контекстное исправление слов.
Вторая модель, эффективная для периферийных устройств, называется Voxtral Realtime, созданна для работы в реальном времени с настраиваемой задержкой до <200 мс. У неё тоже имеется многоязычность, а её веса открыты под лицензией Apache 2.0.
Все эти модели имеют высочайшую точность и низкую цену, поддержку 13 языков, надежную работу в шумной среде, а также обработку аудио до 3 часов.
Модели Qwen3-ASR-1.7B / 0.6B нужны для распознавания речи (ASR) с идентификацией языка, поддерживая 52 языка и акцента (30 языков + 22 китайских диалекта), и работают с речью, пением и фоном.
А модель Qwen3-ForcedAligner-0.6B нужна для точной привязки текста к аудио (выравнивание) в 11 языках.
У моделей ASR высокая точность, и, например, 1.7B-модель показывает результаты на уровне лучших коммерческих API (GPT-4o, Gemini) и опережает open-source аналоги (Whisper). В свою очередь, по эффективности 0.6B-модель тут лучший баланс скорости и качества, имеющая очень низкую задержку (TTFT ~92 мс) при высокой пропускной способности. Все эти модели обладают высокой универсальностью, устойчиво работая в сложных условиях (шум, диалекты, детская/старческая речь, песни с музыкой). Они поддерживают потоковый и оффлайн-режим, а также длинные аудио (до 20 мин).
Что касается ключевых особенностей ForcedAligner, то здесь выделяется точность таймстампов, которая превосходит другие современные модели выравнивания (NFA, WhisperX), поддерживая длинное аудио до 5 минут.
Плюсом ко всему вместе с моделями выпущен готовый инструмент для inference с поддержкой пакетной обработки, потокового режима и т. д.
В ней применён контроль контекста, дающий ограниченный просмотр вперед и назад в энкодере. Кроме того, был реализован механизм кэширования активаций для эффективного потокового вывода без повтора вычислений.
Модель согласованная и в ней нет разрыва между режимами обучения и вывода. У неё гибридная архитектура, включающая общий энкодер для двух декодеров (CTC и RNN-T), что улучшает точность и скорость обучения.
В плане гибкости есть поддержка нескольких уровней задержки одной моделью.
В результате модель превышает точность буферизованных стриминговых подходов при меньшей задержке и времени вывода, а гибридная архитектура улучшает сходимость CTC-декодера.
Друзья всем привет! Делал для себя приложение на ПК чтобы общаться в игровых чатах с дивана без клавиатуры. Возможно есть такие же как я, которые играют на ПК с геймпада. Причины у всех разные, начиная от "надоело сидеть за компом", заканчивая физическими ограничениями и здоровьем. Изначально идея была сделать поддержку только геймпада, но со временем понял что и поддержку клавиатуры добавить будет не лишним. Теперь я вам расскажу что оно умеет и как может быть вам полезным.
Простой интерфейс. Вы можете нажать мышкой или использовать свою комбинацию клавиш на геймпаде или клавиатуре.
По запросу друзей, добавил кнопку копирования текста из приложения (далее поймете зачем).
Главное окно приложения.
3. После скачки приложения и модели распознавания, работает полностью автономно, вам не нужен интернет для использования. Поддержка 5 самых популярных языков в Steam (русский, английский, китайский (упрощенный), немецкий, испанский). Как это работает: Вы говорите на русском любую желаю фразу в свой микрофон, получаете перевод в виде текста в любом активном приложении. Для этого я и выводил кнопку копирования текста в главном окне приложения.
Мне лично хватает базовой модели для игровых чатов, но если вы будете использовать как переводчик, то возможно вам нужна будет нужна модель получше. Просто выберите то что вам подходит и используйте без каких либо ограничений. Потребление оперативной памяти, будет пиковым. Т.е. прирост потребления только в момент распознавания. После распознавания (1-2 секунды), лишняя память освобождается.
Меню выбора модели распозавания.
4. В интерфейсе вы можете включить автозапуск, выключить оверлей и т.д.
Настройки интерфейса.
5. Поддержка ваших комбинаций клавиш. Для клавиатуры это ctrl+любая клавиша или shift+любая клавиша (либо ctrl+shift+любая клавиша). Для геймпада любая комбинация клавиш. Главное требование это поддержка вашим геймпадом XInput (геймпады сертифицированные Microsoft). У меня просто нет другого типа дуалшоков, поэтому написать и протестировать не могу.
Приложение полностью бесплатное без рекламы и скама. Просто качаете его на моем гитхабе вот тут и пользуетесь. На сертификацю от microsoft 200 баксов в год я платить не могу, поэтому возможно ваш защитник винды может ругаться при первом запуске. Просто ждете 5 секунд (при первом запуске), запускаете приложение, на предупреждение даете согласие и пользуетесь.
Вроде все просто, но на всякий случай тут видео как пользоваться.
Я начинающий .NET разработчик. Приложение делал для себя и использую как свой пет проект. Потратил кучу времени на него, очень хотелось бы добавить поддержку linux (для stemdeck), но я уже не могу себе позволить его развивать, так как пока писал совсем забросил обучение разработке.
Если кому-то приложение окажется нужным, пожалуйста не поленитесь оставить звездочку на гитхабе. Или если вы .NET разработчик, присоединяйтесь к разработке.
Ну или если вам совсем лень, хотя бы на юутбе лайк поставьте. Я хочу устроиться на работу без накруток опыта и вранья. Только с теми знаниями и умениями которые есть, по честному.