NVIDIA выкатили Nemotron 3 Embed — семейство open-моделей для RAG, agentic retrieval, code retrieval и памяти агентов.
Флагман Nemotron-3-Embed-8B-BF16 заявлен как SOTA на multilingual RTEB на 16 июля 2026 года. Это retrieval-бенчмарк: он показывает, насколько хорошо embedding-модель находит нужный контекст для RAG.
Почему это важно для агентов?
Когда retrieval промахивается, агент получает мусорный контекст. Дальше начинаются лишние поиски, длиннее reasoning, больше токенов и выше счёт за inference.
В линейке три модели:
* 8B-BF16 — максимум качества
* 1B-BF16 — дешевле и быстрее для продакшена
* 1B-NVFP4 — версия под Blackwell/vLLM, квантованная через NVIDIA Model Optimizer
Все модели работают с входом до 32K токенов, то есть могут индексировать длинные документы, код и agent history без слишком агрессивной нарезки.
У 1B-NVFP4 на RTEB почти тот же результат, что у BF16: 72.00 против 72.38, при этом модель остаётся совместимой по embedding-space с 1B-BF16.
https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb
Post #5461
4.74K

- ❤ 5
- 👍 4