Вышла новая модель Granite 4.2
Озвучено первое семейство плотных рассуждающих только с декодером моделей Granite 4.2 (https://huggingface.co/collections/ibm-granite/granite-42-la...) от IBM в размерах 3B, 8B и 30B под лицензией Apache 2.0 с контекстом до 512K токенов.
Мышление переключается между "мышлением", "без мышления" и режимом низких усилий (короткое рассуждение для простых задач). Вызовы инструментов нативно поддерживаются и совместимы с форматом OpenAI.
Архитектура трансформера только с декодером эксплуатирует GQA, RoPE (θ=10M), SwiGLU, RMSNorm и раздельные эмбеддинги, причём версии 3B, 8B и 30B имеют 40, 40 и 64 слоя соответственно.
Претрейнинг начался с нуля на токенах объёмом около 15T, следуя стратегии из 5 фаз, отталкиваясь от веб-данных к высококачественному миксу и удлинению контекста.
Обучение с учителем (SFT) обладало объёмом около 7.2 млн сэмплов (примерно 100B токенов) и состояло из 31.6% агентных данных (код, терминал, поиск) и 68.4% неагентных (инструкции, код, математика), где качество контролировали LLM-судьями (GPT-OSS, Gemma), удаляя галлюцинации, битые вызовы инструментов и дубликаты, а у 30B была вторая фаза SFT с упором на агентный код.
Многостадийное и мультисредовое обучение с подкреплением (RL) осуществлялось по алгоритму Async GRPO (без сети оценки, групповые преимущества) на инфраструктуре из NeMo-RL (тренинг) и NeMo-Gym (среды).
На фундаментальном (все модели) этапе RL использовали RLVR с проверяемыми наградами (математика, код, наука, инструкции) и бустеры с короткими прогонами для прокачки навыков (IF, GPQA, код). На агентном (только 8B и 30B) этапе RL применили SWE Agent для решения задач в реальных репозиториях с тестами (OpenHands), Terminal Agent для работы в живом терминале (Harbor и Terminus) и Search Agent для многопроходного поиска в вебе (награда от LLM-судьи). На финальном (все модели) этапе RL прибегли к RLHF для юстировки под предпочтения человека и безопасность (с штрафом за длину рассуждений).
Версия 3B подверглась только фундаментальному RL и RLHF, в отличие от версий 8B и 30B, прошедших полный цикл, включая агентные стадии (от SWE до Terminal и Search).
Инфраструктура основывается на железе кластера NVIDIA GB200 NVL72 и софте из контейнеров .sqsh, PyTorch и NeMo-RL.
В результате 30B лидирует с 57.0 на SWE-Bench Verified и 89.17 на AIME25. 8B силен в агентности за свой размер с 47.67 на SWE-Bench и 50.29 на BFCL. 3B хорош в базовых задачах с 78.33 на AIME25.























