Не модель решает: Nvidia подняла Claude Opus 5 с 30% до 100%, ничего в ней не меняя
Исследователи Nvidia взяли фронтирную модель, не тронули ни один её вес — и результат на интерактивном бенчмарке ARC-AGI-3 вырос с 30 до 100 процентов. Поменялась только программная оболочка вокруг модели. Ту самую оболочку в индустрии называют харнесс — обвязка.
Что такое обвязка и почему её обычно не замечают
Харнесс — это всё, что окружает модель в работающем агенте: набор инструментов, управление памятью и контекстом, правила остановки, циклы перепроверки. Мозг у агента один, но именно обвязка решает, сколько раз он подумает, что запомнит и когда признает, что зашёл в тупик. В публичных рейтингах этого слоя нет вообще — там сравнивают голые модели.
ARC-AGI-3, на котором ставили эксперимент, устроен жёстко: это набор двумерных игр, к которым не прилагается никаких инструкций. Модель должна сама сообразить, по каким правилам играет и как выиграть. Это проверка не эрудиции, а способности вести длинную осмысленную линию поведения — ровно то, на чём агенты обычно и сыплются.
Что сделала Nvidia
Компания собрала расширенный харнесс под названием Agentic Variation Operators (AVO). Ключевая деталь — надстроенный «наблюдающий агент», который следит за основным и вмешивается, когда тот буксует или уходит в бесплодную ветку. По сути, над исполнителем поставили руководителя. Это заметный отход от привычной схемы одиночного цикла, на которой работают Claude Code и Codex.
Адель Эль Халлак, вице-президент по продуктам ИИ-подразделения Nvidia, формулирует это прямо:
Агент — это на самом деле больше, чем модель. Это и модель, и строительные леса вокруг неё, которые мы называем харнессом.
Почему это важно
Практический вывод неприятный для всех, кто выбирает модель по таблице лидеров: цифра в рейтинге всё хуже предсказывает, как система поведёт себя на реальной длинной задаче. Одна и та же модель может дать и 30%, и 100% — разница целиком в инженерии вокруг. OpenAI и сама недавно признавала, что небольшие правки обвязки заметно двигают результаты на бенчмарках, — правда, до уровня Nvidia там не дошло.
Стоит помнить и про интерес рассказчика: Nvidia продвигает тезис об открытых харнессах, потому что её собственная экосистема Nemo — как раз про то, чтобы отдать пользователю все ручки. Но сам замер от этого не перестаёт быть замером: за громкими релизами моделей давно стоит вторая, куда менее заметная гонка — за обвязку.
Источник: TechCrunch













