Серия «Новости»

0

Вышла новая модель Granite 4.2

Серия Новости

Озвучено первое семейство плотных рассуждающих только с декодером моделей Granite 4.2 (https://huggingface.co/collections/ibm-granite/granite-42-la...) от IBM в размерах 3B, 8B и 30B под лицензией Apache 2.0 с контекстом до 512K токенов.

Мышление переключается между "мышлением", "без мышления" и режимом низких усилий (короткое рассуждение для простых задач). Вызовы инструментов нативно поддерживаются и совместимы с форматом OpenAI.

Архитектура трансформера только с декодером эксплуатирует GQA, RoPE (θ=10M), SwiGLU, RMSNorm и раздельные эмбеддинги, причём версии 3B, 8B и 30B имеют 40, 40 и 64 слоя соответственно.

Претрейнинг начался с нуля на токенах объёмом около 15T, следуя стратегии из 5 фаз, отталкиваясь от веб-данных к высококачественному миксу и удлинению контекста.

Обучение с учителем (SFT) обладало объёмом около 7.2 млн сэмплов (примерно 100B токенов) и состояло из 31.6% агентных данных (код, терминал, поиск) и 68.4% неагентных (инструкции, код, математика), где качество контролировали LLM-судьями (GPT-OSS, Gemma), удаляя галлюцинации, битые вызовы инструментов и дубликаты, а у 30B была вторая фаза SFT с упором на агентный код.

Многостадийное и мультисредовое обучение с подкреплением (RL) осуществлялось по алгоритму Async GRPO (без сети оценки, групповые преимущества) на инфраструктуре из NeMo-RL (тренинг) и NeMo-Gym (среды).

На фундаментальном (все модели) этапе RL использовали RLVR с проверяемыми наградами (математика, код, наука, инструкции) и бустеры с короткими прогонами для прокачки навыков (IF, GPQA, код). На агентном (только 8B и 30B) этапе RL применили SWE Agent для решения задач в реальных репозиториях с тестами (OpenHands), Terminal Agent для работы в живом терминале (Harbor и Terminus) и Search Agent для многопроходного поиска в вебе (награда от LLM-судьи). На финальном (все модели) этапе RL прибегли к RLHF для юстировки под предпочтения человека и безопасность (с штрафом за длину рассуждений).

Версия 3B подверглась только фундаментальному RL и RLHF, в отличие от версий 8B и 30B, прошедших полный цикл, включая агентные стадии (от SWE до Terminal и Search).

Инфраструктура основывается на железе кластера NVIDIA GB200 NVL72 и софте из контейнеров .sqsh, PyTorch и NeMo-RL.

В результате 30B лидирует с 57.0 на SWE-Bench Verified и 89.17 на AIME25. 8B силен в агентности за свой размер с 47.67 на SWE-Bench и 50.29 на BFCL. 3B хорош в базовых задачах с 78.33 на AIME25.

Показать полностью 3
2

Вышла новая модель для синтеза речи Raon-OpenTTS

Серия Новости

Загружены новые открытые модели Raon-OpenTTS-0.3B (https://huggingface.co/KRAFTON/Raon-OpenTTS-0.3B) и Raon-OpenTTS-1B (https://huggingface.co/KRAFTON/Raon-OpenTTS-1B) с данными для устойчивого синтеза речи, обученные на Raon-OpenTTS-Core и работающие с аудио в виде мел-спектрограмм (16 кГц), текстом на уровне символов и вокодером HiFi-GAN.

Ориентировались на создание полностью воспроизводимой TTS-системы (открытые данные, код, веса), сопоставимой с проприетарными аналогами.

Raon-OpenTTS-Pool, крупнейший открытый мультиисточниковый набор для TTS, включает 615K часов английской речи и 240M сегментов (из 10 открытых датасетов и обработанного YouTube Commons). Подмножество Raon-OpenTTS-Core (510K часов, 194M сегментов) отфильтровали по WER (ошибка транскрипции), DNSMOS (качество звука) и Speech Ratio (доля речи), удаляя нижний 15-й процентиль по комбинированному рангу. Бенчмарк устойчивости Raon-OpenTTS-Eval (6K пар промт-текст) из 12 датасетов разбит на 4 акустических режима, таких как Clean (чистая речь), Noisy (шумная), Wild (спонтанная и реальная) и Expressive (эмоциональная).

Фильтрация (15% комбинированная) дала наилучший средний ранг по сравнению с отсутствием фильтрации или агрессивной (50%), при этом мультиисточниковый пул при равном объёме (47K ч) превосходит одиночный Emilia по WER и SIM, а добавление YouTube-Commons улучшает WER и SIM в большинстве режимов, кроме Noisy.

Вклад состоит из крупнейшего открытого мультиисточникового речевого корпуса (615K ч), эффективного пайплайна фильтрации для TTS, бенчмарка устойчивости Raon-OpenTTS-Eval и открытых весов с кодом конкурентоспособных TTS-моделей.

В результате Raon-OpenTTS-1B достиг WER 1.78% (2-е место среди открытых моделей) и SIM 0.749 (1-е место) на Seed-TTS-Eval, превосходя все открытые аналоги, уступая лишь Qwen3-TTS и CosyVoice 3. Кроме того, Raon-OpenTTS-1B показал лучшую разборчивость и схожесть на сложном подмножестве с WER 6.15% (1-е) и SIM 0.775 (1-е). Также на Raon-OpenTTS-Eval у Raon-OpenTTS-1B лучший средний WER (2.81) и SIM (0.695) по всем режимам, однако он особенно силён в Wild (5.61 WER против 136.03 у F5-TTS). По субъективным оценкам Raon-OpenTTS-1B владеет лучшим общим CMOS (предпочтение по натуральности) и лучшим SMOS (схожесть с диктором), составляющий 3.70.

Показать полностью 2
0

Вышла новая модель для 4D-реконструкции человека 4DAnyone

Серия Новости

Доступна новая модель 4DAnyone (https://huggingface.co/AntResearch/4DAnyone), восстанавливающая 4D-человека из обычного монокулярного видео без калибровки камер.

Конвейер генерирует многоракурсные видео, далее реконструируя их гауссовым 4D облаком частиц (4DGS).

Однако при десятках целевых видов видеодиффузия теряет межракурсную согласованность из-за ограниченного контекста внимания DiT, поскольку референс-контекст растёт как O(N) и группы видов очищаются от шума раздельно, вызывая структурный дрейф.

Упаковка референсного контекста (RCP) сжимает растущие референс-виды в фиксированный контекст смешанного разрешения со сложностью O(1). Маршрутизация целевого контекста (TCR) при высоком шуме циклически перегруппировывает виды для обмена глобальной структурой, а при низком фиксирует соседние группы для стабилизации деталей. Скелетное обусловливание использует вместо плотной глубины надёжные 3D-скелеты, устраняя неоднозначность 2D-поз рендерингом с буфером глубины.

Имеющиеся данные дополнили новыми синтетическими датасетами MVGameHuman, SynCamVideo, DNA-Rendering и монокулярными материалами Pexels и TedTalk для трёхстадийного обучения на базе Wan2.2-TI2V-5B с функцией потерь, основанной на латентном сопоставлении потоков и LPIPS.

Ограничения возникают из-за плохо задаваемой скелетом свободной одежды и наследуемых во все сгенерированные виды ошибки оценки позы.

В результате модель превосходит MV-Performer, TrajectoryCrafter и ReCamMaster на DNA-Rendering и DyMVHumans по PSNR, SSIM и LPIPS, устойчиво обобщаясь на произвольные видео.

Показать полностью 3
1

Вышла новая модель для генерации видео MAGI-2 (Preview)

Серия Новости

В видеогенерации нет ясной связи "масштаб модели влияет на качество генерации", в отличие от LLM, но Magi-2 (https://huggingface.co/sand-ai/MAGI-2-preview) исследует, как эффективно масштабировать видеогенерацию.

Архитектура обладает единой последовательностью токенов для текста, видео и аудио в одном трансформере (однопоточном) и, чтобы упростить масштабирование Magi-2, не переносит авторегрессионное разбиение из Magi-1.

Сверхмелкозернистый MagiMoE содержит около 114B параметров и примерно 6B активных на токен, насчитывая всего 40 слоёв, из которых 36 средних MoE-слоёв и 4 граничных плотных слоя. Скрытая размерность равна 3072 с 12 головами по 256 измерений. Каждая голова задействует свой роутер и 256 экспертов с активацией топ-6. Эксперт FFN работает с размерностями от 256 до 1280 и снова 256, используя SwiGLU.

Многоголовочный латентный MoE и параллелизм голов делят токен на независимые низкоразмерные головы с фиксированной коммуникацией, обмениваясь головами до роутинга и оставляя динамический Top-k локальным.

Иерархический параллелизм голов позволяет фиксированно обмениваться головами в InfiniBand, заодно храня и собирая экспертов, градиенты и оптимизатор в NVLink. Среда выполнения MagiMoE управляет объединенной маршрутизацией, Top-K, группированным экспертным FFN и слиянием, балансируя без вспомогательной функции потерь через смещение эксперта. Оптимизатор MagiMuon учитывает структуру "голова на эксперта", пользуясь Muon для матриц и Adam для адаптеров и гейтинга.

"Ловушка фильтрации" приводит к упрощению данных под слабую модель, ограничивая сильную модель. Значит, необходимо перейти от фильтрации к производству данных и точной мультимодальной разметке субъектов, действий, кадров, диалогов, звука и текста на экране. Сохранение сложных связей дало эмерджентные возможности, такие как постоянство персонажей между кадрами и синхронизация субтитров со звуком.

В результате большее количество параметров не всегда означает автоматическое улучшение качества.

Показать полностью 1
3

Вышла новая модель для GUI-агентов UI-Mate

Серия Новости

GUI-агентам мешают нехватка и смещение обучающих данных, неоднозначность инструкций и низкая воспроизводимость успеха, так как обычный промт не передаёт пользовательские процедуры, инструменты и неявные договорённости.

UI-Mate (https://huggingface.co/collections/tencent/ui-mate) решает проблему, выступая открытым базовым GUI-агентом, объединяющим обучение в привязке к среде и обучение по демонстрациям в контексте.

Конвейер данных привязан к среде через автогенерацию задач и сред, генерацию траекторий, фильтрацию и дерево способностей, создавая данные для SFT и проверяемые пакеты задач для онлайн RL.

Модуль DemoCUA превращает демонстрации человека или агента в отдельные рабочие процессы, в которых агент следует шагам, где они полезны, но перепланирует их по живому скриншоту, ориентируясь на демонстрацию вместо жёсткого скрипта.

Бенчмарк OSWorkerBench, состоящий из 100 длинных офисных задач в 41 приложении, предлагает режимы только по инструкции или с использованием демонстраций, предусматривая 33 задачи на самодемонстрацию и 45 задач с вариативными демонстрациями.

Обучение содержало SFT на проверенных траекториях и онлайн RL с применением GRPO, центрирования на этапах принятия решений, нормализации на уровне токенов, опциональной модели оценки процесса и адаптивной выборки учебного плана.

В результате получены 77.0% на OSWorld-Verified, 66.2% на WindowsAgentArena и достигнут статус SOTA среди моделей с открытыми весами. У OSWorkerBench 41.0% строгой успешности, 76.9% прогресса и прирост +17.7 и +24.5 процентных пунктов к Qwen3.6-27B. На самодемонстрации из 33 задач прогресс вырос с 67.9% до 81.1%, а успешность поднялась с 17.2% до 35.4%.

Показать полностью 2
2

Вышла новая модель для синтеза речи IndexTTS 2.5

Серия Новости

Обнародована новая модель IndexTTS 2.5 (https://huggingface.co/IndexTeam/IndexTTS-2.5) для многоязычного zero-shot эмоционального TTS как развитие IndexTTS 2.

Путём сжатия семантического кодека частоту кадров уменьшили с 50 до 25 Гц, последовательности сократили вдвое, удешевив обучение и вывод. В архитектуре S2M заменили U-DiT на требующий меньше параметров и быстрее генерирующий мел-спектрограммы Zipformer. Многоязычную поддержку китайского, английского, японского, испанского и арабского воплотили тремя стратегиями, опираясь на выравнивание с учётом границ, конкатенацию на уровне токенов и генерацию на основе инструкций. RL оптимизировали посредством GRPO для пост-обучения T2S с наградой по WER (ASR) и сходству диктора, что привело к улучшенному произношению и естественности.

Данные извлекли из примерно 100 тыс. часов речи (zh 30k, en 25k, ja 42k, es 22.9k, ar 20k) и 135 ч эмоциональных данных.

В результате на zero-shot средний WER 6.75 и SS 73.18, но WER после RL уже 6.00 и SS 73.63. Межъязыковые (китайский промт) способности добиваются среднего WER 6.22 и SS 68.62, но после RL уже 6.17 и 70.20. По сходству эмоций и MOS на ja/es/ar она выше CosyVoice 3 с zero-shot точностью эмоций zh 0.713 (против 0.467) и en 0.673 (против 0.567) на CV3. На RTF T2S скорость равняется 0.119 (было 0.232) и S2M 0.017, что суммарно в 2.28 раза быстрее IndexTTS 2.

Показать полностью 4
3

Вышла новая модель Ornith-1.5

Серия Новости

Выложена новая модель Ornith-1.5 (https://huggingface.co/collections/ornith-ai/ornith-15) в версиях 397B MoE, 35B MoE и 9B dense (плюс мобильная 9B-Mobile), перешедшая к полному циклу самоулучшения, самостоятельно генерируя задачи, опорные структуры и варианты решений для обучения с подкреплением.

Цикл самоулучшения сперва генерирует новые, более трудные, чем решённые ранее задачи, далее генерирует опорные структуры, такие как инструкции, инструменты, декомпозиция и оркестрация, потом формирует варианты решения задачи, под конец обновляя все три стадии наградой через GRPO, обеспечивая устойчивый рост способностей модели в рассуждении, программировании и агентных задачах.

Система наград основывается на формуле задачи R_task = V(q,s) x D(q,s,{τ_i}) x N(q), где V обозначает валидность или проверяемость, D измеряет сложность у границы возможностей (p* ≈ 0.2), а N отражает новизну, между тем для опорной структуры применяется R_harness = C(q,h) x F(h,{τ_i}) x H(h), рассматривающая соответствие задаче, точность оценки и устойчивость к взлому системы вознаграждения, а вариант решения выражается формулой R_rollout(τ_i) = h(q,τ_i).

В результате версия 397B набрала 86.1 на Terminal-Bench 2.1, 56 на DeepSWE и 86 на SWE-bench Verified, будучи сопоставимой с Claude Opus 4.8, превосходя GLM-5.2 и DeepSeek-V4-Flash. Версия 35B превосходит Qwen3.6-35B, Gemma-4-31B и Muse-Glimmer-30B, а версия 9B превосходит более крупные Gemma-4-31B и Qwen3.6-35B, являясь пригодной для iPhone или Android.

Показать полностью 3
1

Вышла новая модель Needle 2

Серия Новости
Вышла новая модель Needle 2

Предлагается новая агентная модель Needle 2 (https://huggingface.co/Cactus-Compute/needle2) для крошечных устройств с 45M параметров, одним бинарником на 14 МБ и сессионной памятью около 28 МБ, вызывающая инструменты, управляющая устройством и осуществляющая структурированное извлечение.

Основу построили на базе Simple Attention Network, сжатии CQ2-bit (Cactus Quants) и обучении модели сразу под 2-бит.

Скорость декодирования набирает около 500 ток/с на Raspberry Pi 5, 400-1500 на VR, 300-700 на дешёвых телефонах и более того работает на ESP32-S3.

Точность проявляется в 63.7 на Mobile Actions, 17.0 на DroidCall, 32.6 в домене и 28.7 вне домена на Seal-Tools, общий 42.6 на BFCL v4.

Цель сводится к созданию периферийного ИИ для устройств дешевле $200 без GPU или NPU с поддержкой офлайн-режима и приватности.

Архитектура опирается на многослойный перцептрон Адамара, engram-память на n-граммах, многоканальные остаточные связи, окно 256 токенов с закреплёнными описаниями инструментов и грамматику, гарантирующую валидные вызовы.

Движок обладает одним C++ бинарником, сквозным int8, не разворачивающимися в RAM весами и грамматикой, отсекающей до 98% вычислений на структурных токенах.

Обучение состояло из предобучения на 115B токенов, посттренировки на 38B, и есть возможность тонкой настройки на своём Mac или PC.

Готовность к продакшену уже присутствует, и, например, компания Pebble, известная как пионер в сфере современных носимых устройств, использует её локально в приложении Index 01, чтобы преобразовывать голосовые запросы в действия без подключения к сети.

В результате она сопоставима с LFM2.5 230M, FunctionGemma 270M и Apple FM, будучи в 5-70 раз меньше и при 2 битах против их f16.

Показать полностью 1
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества