🟣KDD 2026
9–13 августа команда AI VK Research участвовала в KDD 2026 — ключевой мировой ML-конференции. Наши ребята представили результаты своих исследований, посвящённых развитию RecSys. Репортаж с конференции и ссылки на исследования — в посте.
🟣Нейропрофиль пользователя: новая модель для рекомендаций в продуктах VK
10 августа инженеры AI VK запустили единую модель для анализа взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека — в VK Видео, VK Клипах и других продуктах экосистемы. Объединение этих данных в один поток дало реальный буст на проде. Подробнее мы писали на Хабре.
🟣NVIDIA: роутинг вместо одной большой модели
11 августа NVIDIA выпустила Nemotron 3.5 Lightning и NeMo Switchyard: открытую MoE на 30B для массовых коротких операций внутри агентных систем и роутинг-библиотеку, выбирающую модель под конкретный вызов. В тесте LangChain на 145 агентных задачах к frontier-модели уходило 7% вызовов: стоимость снизилась на 74% при потере ~6% качества.
🟣Upstage: модель, доводящая работу до результата
11 августа южнокорейская Upstage выпустила Solar Pro 4: контекст 512K токенов, до 128K выходных и регулируемый reasoning. Модель рассчитана на многошаговые офисные задачи: на Terminal-Bench 2.1 она получила 57.0 против 43.2 у Solar Open 2. Отдельный акцент модели — это groundedness, утверждения без опоры в документах помечаются как неподтверждённые.
🟣SpaceXAI (xAI): Grok 4.6 для длинных агентных траекторий
12 августа SpaceXAI (xAI) выпустила Grok 4.6 с фокусом на длинные сессии агента. Intelligence Index — 61 балл, что на уровне GPT-5.6 Sol и чуть ниже Fable 5 Max с 62. Лидером по кодинг-бенчмаркам модель не стала: на Terminal-Bench 3.0 набирает 26% против 34.6% у GPT-5.6 Sol.
🟣Google DeepMind: Flash с управляемым рассуждением
13 августа Google DeepMind выпустила Gemini 3.7 Flash: контекст 1M токенов, на вход принимает текст, изображения, аудио и видео. Модель получила управляемый бюджет на рассуждения, позволяющий выбирать компромисс между качеством, стоимостью и задержкой, и агентский video understanding — использование видео в reasoning-процессе. Это итерация поверх Gemini 3.6 Flash.
🟣Alibaba: открытая 27B и preview архитектуры Qwen4
14 августа Alibaba открыла веса Qwen3.8-27B — dense-модели с нативной обработкой изображений и видео. 26 августа вышла Qwen3.8-Flash-Next: MoE на 125B параметров плюс 51B N-gram-эмбеддингов, ~6B активных на токен и гибрид Gated DeltaNet + Qwen Sparse Attention. По данным Alibaba, обучение обошлось в 9 раз дешевле Qwen3.7-Plus.
🟣Z.ai: большая модель и быстрый Flash
14 августа Z.ai выпустила GLM-5.3 — MoE на 743B параметров с ~39B активных. 26 августа к ней добавилась GLM-5.3-Flash, до релиза известная как Ox Alpha: 320B параметров, 18B активных, нативная мультимодальность и контекст 1M токенов. GLM-5.3-Flash требует втрое меньше вычислений и в 4,4 раза меньше памяти под KV-кеш, чем GLM-5.3, и превосходит GLM-5.2 на агентных бенчмарках.
🟣DeepSeek: Flash получает зрение
21 августа DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp и мультимодальный API. Текстовые возможности остаются на уровне V4-Flash, а в мультимодальных агентных задачах модель приближается к Opus 4.8. Появился Files API для повторного использования загруженных изображений.
🟣Agnes AI: reasoning за центы
26 августа сингапурская Agnes AI выпустила Agnes 2.5 Pro Beta — по $0,10 / $0,30 за 1M токенов. Intelligence Index вырос с 40 (июльская Alpha) до 49, а Agentic Index — с 25 до 44. При этом доля галлюцинаций снизилась с 88% до 33% за счёт более осторожного поведения модели.
🟣Обзор движков для инференса LLM
Сделали подробный разбор TensorRT-LLM, LMDeploy, vLLM, SGLang и llama.cpp. Подробнее в карточках.
➡️ Самые интересные статьи от AI VK на Хабре
🟣Обучение с подкреплением в рекомендациях: оптимизируем удовлетворённость пользователя за всю сессию
🟣Нейроранжирование: отказ от бустинга в пользу нейросетей
🟣Как устроен нейропрофиль пользователя в рекомендациях VK
#aivkhub #дайджест
Post #600
906

- ❤ 5
- 🔥 5
- 👍 3
- 🎉 2
- 🤩 1