Nemotron 3 Ultra [2/2]
(часть 1)
Результаты:
Усреднённо по девяти категориям связка ACE-RTL + Nemotron 3 Ultra выдаёт pass rate 97% против 95% у Kimi K2.6 и 92% у GLM 5.2 при фиксированном агенте (то есть изолированно измеряется вклад самой модели). На категории отладки cid016 сам агентный контур поднимает точность драматически: GLM 5.2 идёт с 44% в одиночку до 94% в агенте, Kimi K2.6 - с 68% до 97%, Nemotron - с 65% до 100%. Вывод для практика очевиден: без итеративной петли с инструментами реалистичные RTL-задачи не берутся, каким бы сильным ни был базовый LLM.
Но главная цифра - не pass rate, а стоимость. Nemotron 3 Ultra достигает лидирующей точности при 7k токенах на итерацию против 9k у GLM 5.2 и 22k у Kimi K2.6 - примерно на 28% и на 71% меньше соответственно. Для агентного RTL это критично: контекст одной итерации отладки распухает мгновенно - туда входят спецификация, сгенерированный RTL, вывод симулятора, сработавшие ассерты и прошлые попытки фикса. При равном compute-бюджете меньший расход токенов означает больше взятых задач и более быстрый оборот итераций. В агентном коде это часто важнее, чем лишний процент на лидерборде.
Отдельно стоит отметить, как модель учили под RTL. Пайплайн синтетических данных из статьи ACE-RTL стартует с отобранных из публичных репозиториев seed-дизайнов, а затем генерирует не только пары «спецификация → эталонный RTL», но и задачи на редактирование и на отладку: в seed инжектируются реалистичные ошибки (неверные переходы конечного автомата, нарушения handshake и таймингов), а спецификация снабжается диагностикой наблюдаемого сбоя. Всё это проходит через фильтр - синтаксические проверки, деконтаминацию относительно бенчмарков и rubric-скоринг через LLM-as-judge на семантическое соответствие. Именно тренировка на edit/debug-задачах, а не только на генерации с чистого листа, объясняет, почему модель хорошо себя ведёт внутри агентной петли.
@vlsihub
Post #798
3.31K
- 🔥 5
- ❤ 1
- 🤯 1
- 🦄 1