TGViewer
Channel Public Channel
AI VK Hub

AI VK Hub

@aihubvk

Рассказываем и показываем AI в VK 🔉
Subscribers
2.48K
Photos
459
Videos
26
Links
225

Showing posts older than #602 · Back to latest

Older Posts 11 shown
Post #601 1.42K
📢 Как мы увеличили время в ленте ВКонтакте на 11%

Рекомендательная система ВКонтакте — зрелый пайплайн, но и в нём есть точки роста. В этом году команда AI VK улучшила несколько этапов: заменила классический мультитаргет ранкера на композитный, стохастику в блендере — на детерминированный алгоритм Брезенхема, эвристики в ALS — на вероятностную оценку.

🔥 Результат: +11% времени в ленте, CTR лайка вырос на 30%, CTR скрытия поста снизился на 10%.

➡️ Подробности в статье на Хабре
  • ❤ 10
  • 🔥 8
  • 😁 3
  • 👍 2
  • 👏 2
Post #600 906
🟣KDD 2026

9–13 августа команда AI VK Research участвовала в KDD 2026 — ключевой мировой ML-конференции. Наши ребята представили результаты своих исследований, посвящённых развитию RecSys. Репортаж с конференции и ссылки на исследования — в посте.

🟣Нейропрофиль пользователя: новая модель для рекомендаций в продуктах VK

10 августа инженеры AI VK запустили единую модель для анализа взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека — в VK Видео, VK Клипах и других продуктах экосистемы. Объединение этих данных в один поток дало реальный буст на проде. Подробнее мы писали на Хабре.

🟣NVIDIA: роутинг вместо одной большой модели

11 августа NVIDIA выпустила Nemotron 3.5 Lightning и NeMo Switchyard: открытую MoE на 30B для массовых коротких операций внутри агентных систем и роутинг-библиотеку, выбирающую модель под конкретный вызов. В тесте LangChain на 145 агентных задачах к frontier-модели уходило 7% вызовов: стоимость снизилась на 74% при потере ~6% качества.

🟣Upstage: модель, доводящая работу до результата

11 августа южнокорейская Upstage выпустила Solar Pro 4: контекст 512K токенов, до 128K выходных и регулируемый reasoning. Модель рассчитана на многошаговые офисные задачи: на Terminal-Bench 2.1 она получила 57.0 против 43.2 у Solar Open 2. Отдельный акцент модели — это groundedness, утверждения без опоры в документах помечаются как неподтверждённые.

🟣SpaceXAI (xAI): Grok 4.6 для длинных агентных траекторий

12 августа SpaceXAI (xAI) выпустила Grok 4.6 с фокусом на длинные сессии агента. Intelligence Index — 61 балл, что на уровне GPT-5.6 Sol и чуть ниже Fable 5 Max с 62. Лидером по кодинг-бенчмаркам модель не стала: на Terminal-Bench 3.0 набирает 26% против 34.6% у GPT-5.6 Sol.

🟣Google DeepMind: Flash с управляемым рассуждением

13 августа Google DeepMind выпустила Gemini 3.7 Flash: контекст 1M токенов, на вход принимает текст, изображения, аудио и видео. Модель получила управляемый бюджет на рассуждения, позволяющий выбирать компромисс между качеством, стоимостью и задержкой, и агентский video understanding — использование видео в reasoning-процессе. Это итерация поверх Gemini 3.6 Flash.

🟣Alibaba: открытая 27B и preview архитектуры Qwen4

14 августа Alibaba открыла веса Qwen3.8-27B — dense-модели с нативной обработкой изображений и видео. 26 августа вышла Qwen3.8-Flash-Next: MoE на 125B параметров плюс 51B N-gram-эмбеддингов, ~6B активных на токен и гибрид Gated DeltaNet + Qwen Sparse Attention. По данным Alibaba, обучение обошлось в 9 раз дешевле Qwen3.7-Plus.

🟣Z.ai: большая модель и быстрый Flash

14 августа Z.ai выпустила GLM-5.3 — MoE на 743B параметров с ~39B активных. 26 августа к ней добавилась GLM-5.3-Flash, до релиза известная как Ox Alpha: 320B параметров, 18B активных, нативная мультимодальность и контекст 1M токенов. GLM-5.3-Flash требует втрое меньше вычислений и в 4,4 раза меньше памяти под KV-кеш, чем GLM-5.3, и превосходит GLM-5.2 на агентных бенчмарках.

🟣DeepSeek: Flash получает зрение

21 августа DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp и мультимодальный API. Текстовые возможности остаются на уровне V4-Flash, а в мультимодальных агентных задачах модель приближается к Opus 4.8. Появился Files API для повторного использования загруженных изображений.

🟣Agnes AI: reasoning за центы

26 августа сингапурская Agnes AI выпустила Agnes 2.5 Pro Beta — по $0,10 / $0,30 за 1M токенов. Intelligence Index вырос с 40 (июльская Alpha) до 49, а Agentic Index — с 25 до 44. При этом доля галлюцинаций снизилась с 88% до 33% за счёт более осторожного поведения модели.

🟣Обзор движков для инференса LLM

Сделали подробный разбор TensorRT-LLM, LMDeploy, vLLM, SGLang и llama.cpp. Подробнее в карточках.

➡️ Самые интересные статьи от AI VK на Хабре

🟣Обучение с подкреплением в рекомендациях: оптимизируем удовлетворённость пользователя за всю сессию 

🟣Нейроранжирование: отказ от бустинга в пользу нейросетей

🟣Как устроен нейропрофиль пользователя в рекомендациях VK

#aivkhub #дайджест
  • ❤ 5
  • 🔥 5
  • 👍 3
  • 🎉 2
  • 🤩 1
Post #599 763
Устаревание контента в рекомендациях: возраст почти ни при чём

Вчерашняя новость может быть опровергнута, старый гайд остаётся полезным годами, а свежий айтем не нужен конкретному пользователю. Правило «старше N дней значит удалить» здесь слишком грубое, поскольку устаревание (staleness) — это не возраст, а вероятность, что айтем сохраняет достаточную полезность для пользователя и контекста.

Свежесть не равна полезности

Свежесть говорит, когда айтем был опубликован, новизна — насколько он незнаком пользователю, а релевантность — насколько отвечает запросу. Исторический документ может быть идеальным ответом на вопрос «что было известно о событии в 2019 году», а свежий айтем может быть знаком пользователю, который уже видел его в ленте.
Устаревать может и сама система, когда эмбеддинги и профиль пользователя перестают отражать реальность.

Почему TTL ломается

Жёсткий порог по дате предполагает, что полезность всех айтемов монотонно падает с возрастом и с одинаковой скоростью. В реальности же срочная новость устаревает за минуты, журналистское расследование живёт месяцами, а сезонный материал снова оживает через год.

Два механизма

В статье Decomposing Staleness in Recommender Systems устаревание разделено на два независимых механизма:

🟣Supersession (замещение) — айтем устарел, потому что появился более новый, который меняет статус той же темы. Сообщение «Елизавета II находится под медицинским наблюдением» устаревает в момент объявления о смерти. Это направленная связь между парой айтемов, поэтому возраст тут — недостаточный сигнал.

🟣Decay (затухание) — полезность падает сама по себе, без замены. Прогноз погоды, расписание, короткая акция. Это похоже на постановку задачи анализа выживаемости: предсказать вероятность, что айтем сохранит полезность на горизонте.

Архитектура

Supersession-модель — это классификатор, который получает связанные айтемы и решает, отменяется ли старый айтем новым. Разметку генерирует большая языковая модель, затем её знания дистиллируются в компактную.

Decay-модель предсказывает по содержимому айтема, какая доля интереса к нему уже исчерпана, и убирает его из набора кандидатов при потере значительной доли.

Оба фильтра срабатывают перед ранжированием, ответы кешируются заранее, поэтому ранкер перестаёт считать заведомо устаревших кандидатов, что экономит вычисления.

В онлайн-эксперименте бейзлайн с TTL почти не изменил долю устаревших показов, а пара обученных фильтров снизила эту долю примерно на 7%. За два года эксплуатации жалобы на устаревший контент упали почти наполовину.

Границы подхода

Оба фильтра работают на уровне айтема и не учитывают сигнал пользователя. Часть оставшихся жалоб относится к контенту, который человек уже видел, поскольку модель затухания (decay) пропускает длинный хвост медленно устаревающих айтемов.

Такой отдельный слой нужен далеко не всегда. Например, в RAG актуальность должна учитываться внутри отбора кандидатов. На корпусе NVD CVE свежий релевантный документ попадал в топ-50 лишь в одном запросе из пяти. Позднее ранжирование не вернёт айтем, потерянный на этапе отбора.

В Re3 адаптивное объединение семантической и временной оценок обошло жёсткие бейзлайны без использования бинарного фильтра. Одновременное попадание в контекст устаревших и актуальных документов снижает качество ответов даже при наличии правильного.

TTL остаётся дешёвым резервным механизмом для холодного старта и аварийного контроля. Задача зрелой системы в другом: предсказывать продолжение полезности, отличать замещение от затухания, а высокоуверенные проверки ставить до дорогого персонализированного ранжирования.

#aivkhub #recsys
  • 🔥 5
  • ❤ 4
  • 👍 4
  • 👏 1
Post #598 1.05K
📢 Инженеры AI VK начали использовать единую нейросетевую архитектуру для финального ранжирования контента в рекомендациях.

В новой статье рассказываем, почему отказались от классического бустинга, как построили многозадачный нейроранкер и научили его одновременно предсказывать вероятность лайка и дизлайка, а также прогнозировать время вовлеченного просмотра.

➡️Подробнее читайте на Хабре

#aivkhub #discovery #нейроранжирование #recsys
  • 🔥 10
  • ❤ 5
  • 👍 3
  • 💅 3
Post #588 1.33K
Обзор движков для инференса LLM

LLM-движок размещает веса и KV cache, собирает запросы в батчи, выбирает ядра и держит SLO по TTFT и TPOT. Выход длиной T токенов требует T последовательных decode-итераций, поэтому на каждом шаге движок решает, кого обработать следующим.

TensorRT-LLM
, LMDeploy, vLLM, SGLang и llama.cpp решают задачу с разными приоритетами. Как это происходит, рассказываем в карточках.

#aivkhub #llm #обзор
  • 🔥 8
  • ❤ 5
  • 👍 5
  • 💅 2
Post #587 110K
Репортаж с KDD 2026 ⬆️

На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.

Что обсуждали на KDD, какие тренды появились и как прошла презентация работ команды, рассказывает старший исследователь AI VK Research Артём Матвеев 🎬


Подробнее об исследованиях

➡️ Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction
🟣Обзор статьи

➡️ Planning over Matrix-Factorization MDPs for Candidate Generation
🟣 Обзор статьи

#aivkhub #конференция #kdd #recsys #репортаж
  • ❤ 18
  • 🔥 16
  • 💅 9
  • 👍 5
  • 🤓 1
Post #586 951
Expressiveness-Efficiency Trade-off: длина кода SID против стоимости генерации

В авторегрессивных декодерах каждый дополнительный токен Semantic ID (SID) требует отдельного шага генерации. Чем длиннее код, тем точнее он различает айтемы, но и тем выше задержка. Это третья из фундаментальных проблем генеративных рекомендаций.

Часть 1
Часть 2
Часть 3

Стороны компромисса

Кодовое пространство SID содержит K ** L кодов, где K — размер кодбука, а L — число уровней. Длинные SID уменьшают коллизии и лучше различают тонкие атрибуты, позволяя эффективнее использовать сильные энкодеры. В экспериментах RPG увеличение длины с 4 до 16–64 токенов примерно удвоило NDCG@10.

С другой стороны, так как декодер генерирует SID токен за токеном, то число прямых проходов пропорционально произведению ширины beam на длину SID. Например, TIGER ограничивается 4 уровнями с кодбуком 256, и при длине SID 32 и более beam search становится неприемлемым. Короткие SID порождают обратную проблему: рост коллизий и усложнение разрешения айтема.

Проблема в архитектуре, а не в длине

Ключевой вывод: компромисс верен для TIGER-подобных архитектур, но не фундаментален. Его причина в последовательной зависимости residual quantization и авторегрессивного декодирования.

RQ квантует остатки последовательно: каждый токен уточняет предыдущий, создавая иерархию от грубых категорий к тонким атрибутам, но требуя L шагов декодера. Авторегрессивный декодер усиливает это ограничение: каждый шаг зависит от предыдущего, ошибки накапливаются, а beam search умножает стоимость на ширину поиска.

Подходы к решению проблемы

1️⃣Параллельная генерация длинных SID

RPG заменяет residual quantization на Optimized Product Quantization: токены независимы, так как каждый кодирует ортогональное подпространство эмбеддинга. Модель предсказывает все токены одновременно через multi-token prediction.

Поиск валидных SID ведётся через граф семантически близких кодов, сложность которого не зависит от числа айтемов. Это позволяет использовать SID длиной до 64 токенов без пропорционального роста задержки.

2️⃣Адаптивное сжатие длинного кода

Например, ACERec сохраняет длинный 32-токенный SID, но до подачи в последовательную модель сжимает его через cross-attention в малое число латентных токенов. Декодер работает на компактном представлении, а скоринг сводится к параллельному вычислению логитов по кодбукам и суммированию для каждого айтема.

Таким образом, стоимость определяется числом латентных токенов, а не длиной SID.

3️⃣Кластерные SID в гибридном пайплайне

Промышленные системы отходят от требования «один айтем, один SID». GLIDE использует 4-уровневый SID с кодбуком 256, а коллизии внутри групп разрешаются выбором популярнейшего эпизода.

CQ-SID трактует SID как cluster ID: трёхуровневый кластерный код с крупными кодбуками позволяет сократить beam вдвое при том же качестве. Генеративный канал работает как источник кандидатов, а финальный ранкер обеспечивает точную идентичность.

4️⃣Коллизии как часть дизайна

Google в задаче ранжирования видео показал, что семантические коллизии полезнее случайных: близкие айтемы делят статистическую силу, что улучшает обобщение и холодный старт. Но для доменов, где точная идентичность важнее семантической близости, разрешение коллизий на основе популярности может систематически вытеснять длинный хвост.

Итог

Компромисс выразительности и эффективности снимается переходом к параллельной или гибридной генерации. Оптимум определяется не длиной SID, а совместным выбором кодбука, декодера, ограничением поиска и слоя разрешения.

#aivkhub #genrecsys #recsys
  • 🔥 3
  • ❤ 1
  • 👍 1
Post #585 955
Weak Semantic Reasoning: проблема понимания Semantic ID

Даже согласованный токенизатор не отвечает на главный вопрос: понимает ли LLM структуру каталога или просто запоминает популярные переходы? Это вторая из трёх фундаментальных проблем генеративных рекомендаций: разрыв между заложенным в Semantic ID (SID) смыслом и тем, что модель фактически выучила.

➡️ Часть 1
➡️ Часть 2

Рассуждения в стиле «LLM не видела SID на претрейне» логически ошибочны. Отсутствие кода в обучающих данных не исключает, что модель выучит его роль после адаптации. Эксперименты с произвольными символьными метками подтверждают: трансформер осваивает искусственные знаковые системы при достаточном объёме адаптационных данных.

Четыре рассогласованных пространства

SID создают 4 потенциально несовместимых геометрии:

🟣Item geometry: непрерывные эмбеддинги айтемов
🟣SID geometry: дискретные кодовые последовательности
🟣LLM representation: скрытые состояния и эмбеддинги токенов внутри модели
🟣Autoregressive likelihood: условные вероятности последующих токенов

Нет причин ожидать, что эти пространства изоморфны

Общий префикс в SID может отражать устройство токенизации, а не понятие, которое модель интерпретирует как категорию. Так, иерархия RQ-VAE остаётся свойством кодировщика: первый код грубо приближает эмбеддинг, последующие корректируют остатки. Каузальное внимание не знает, что первая позиция соответствует родительскому кластеру, а четвёртая — листовому узлу: позиционные эмбеддинги кодируют порядок, но не роль в онтологии.

Три уровня понимания

🟣Token recognition: модель генерирует и валидно декодирует SID
🟣Structural understanding: модель использует префикс как иерархию
🟣Semantic reasoning: модель выводит корректные отношения для незнакомых комбинаций атрибутов и доменов

Рост метрик ранжирования после SID-aware обучения не доказывает структурного понимания. Если большинство пользователей после айтема A выбирают B, модель предсказывает SID(B) без знания о том, что A и B из одной категории. Recall@K и NDCG не различают зазубривание, интерполяцию и рассуждение.

Три направления решения

1️⃣ Совместная оптимизация токенизатора и рекомендателя. Например, DIGER делает квантование дифференцируемым через Gumbel exploration: градиент от рекомендательного лосса пробрасывается в токенизатор, и кодбук корректируется под итоговую задачу

2️⃣ SID-языковое выравнивание. Так, SIDReasoner строит двунаправленную связь между кодами и естественным языком, переводя SID в заголовок и обратно, а PLUM расширяет словарь SID-токенами и проводит continued pre-training на доменных данных до fine-tuning

3️⃣ Семантико-коллаборативное выравнивание. Например, DAS объединяет квантование контентных признаков с коллаборативным сигналом, очищенным от популярностного смещения. Такой подход особенно полезен в сценариях холодного старта, где контентные признаки покрывают новые айтемы, а коллаборативные фильтруют поведенческий шум.

Методологический пробел

Бенчмарка для оценки рассуждения над SID не существует. Для проверки нужны:

🟣Prefix intervention: заменить префикс, сохранив суффикс, и измерить эффект
🟣Random-SID control: переставить SID между айтемами, сохранив частоты
🟣Held-out composition split: исключить комбинации пар атрибутов и проверить обобщение
🟣Faithfulness test: изменить промежуточный reasoning trace и проверить, меняется ли рекомендация

Без этих тестов улучшение NDCG остаётся инженерным результатом, но не доказательством семантического рассуждения.

#aivkhub #genrecsys #recsys
  • 👍 3
  • ❤ 2
  • 🔥 2
Post #584 7.14K
📢 Исследователи AI VK Research научили двухбашенный трансформер над историей оптимизировать удовлетворённость пользователя за всю сессию. Работа принята на воркшоп конференции KDD 2026, которая проходит сейчас в Южной Корее.

Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах.

На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам.

➡️ Подробнее в статье на Хабре.

#aivkhub #ml #recsys
  • 🔥 7
  • ❤ 6
  • 👍 3
  • 👏 1
Post #583 817
Продолжаем разбирать, как работают генеративные рекомендательные системы и какие задачи в этом направлении сейчас решают ведущие AI-команды мира.

➡️ Здесь начало статьи.

Tokenizer Dissociation: разрыв оптимизации

Токенизатор обучается отдельно от рекомендательной модели. После заморозки кодбука Semantic ID градиенты целевой задачи перестают поступать в токенизатор. Это первая из трёх фундаментальных проблем генеративных рекомендаций, обозначенных в прошлом посте.

Стандартный пайплайн

Из контентных и коллаборативных признаков энкодер строит непрерывные эмбеддинги айтемов, далее их превращают в дискретные Semantic ID через иерархическую кластеризацию или векторное квантование. Получившийся кодбук замораживается, рекомендательная модель учится на фиксированных токенах: предсказывает следующий Semantic ID или сразу ранжированный список Semantic ID. На инференсе сгенерированные токены сопоставляются с айтемами через кодбук.

Где возникает разрыв

Токенизатор оптимизирует компактность кодового пространства, а рекомендательная модель минимизирует проксирующий лосс для Recall@K и NDCG. После заморозки кодбук изолируется от градиентов рекомендательной функции потерь.

Дрейф и деградация

Токенизатор группирует айтемы на основе близости их исходных эмбеддингов, стремясь минимизировать ошибку квантования кодового пространства. Рекомендательная же модель перестраивает это пространство под задачу ранжирования. Эти две геометрии неизбежно расходятся, так как компактное представление кодов конфликтует с оптимальным ранжированием.

В процессе обучения модель удаляется от исходного распределения и статическая дискретизация теряет свою дискриминативную силу, переставая быть оптимальной для финальной задачи ранжирования.

Из-за недифференцируемости операции дискретного выбора градиенты не могут пройти сквозь слой квантования и модель теряет способность корректировать границы токенов. В результате система не может адаптироваться к новым айтемам или изменившимся поведенческим паттернам.

Направления решений

1️⃣ ETEGRec (SIGIR 2025) объединяет токенизатор и рекомендатель в единую архитектуру. Градиенты от ранжирующего лосса проходят в токенизатор через sequence-item alignment и preference-semantic alignment. Попеременная EM-like оптимизация стабилизирует совместное обучение. Это самый прямой подход к проблеме, но и самый сложный в стабилизации

2️⃣ OneRec (2025) подмешивает коллаборативный сигнал к контентным признакам ещё до квантования, формируя Semantic ID на основе совместных просмотров товаров пользователями. PLUM (2025) развивает эту логику, внедряя многоэтапную схему с непрерывным предобучением на логах взаимодействий. COSETTE (2025) насыщает токенизатор сигналом непосредственно на этапе построения, заставляя токены одновременно реконструировать контент и максимизировать релевантность для рекомендации через контрастивную цель. Во всех случаях двухэтапный пайплайн сохраняется, но кодбук перестаёт быть слепым к задаче ранжирования

3️⃣ DAS (CIKM 2025) объединяет квантование и выравнивание в единый сквозной этап обучения. Contrastive alignment и dual learning синхронизируют квантованные представления пользователей и айтемов

4️⃣ Инженеры AI VK под руководством Владимира Байкалова совместно с ИТМО решали смежную задачу: пересчёт Semantic ID на свежих логах ломает совместимость с уже обученным ретривером. Предложенный метод выравнивает новые токены под старое пространство через биективный матчинг, после чего ретривер дообучается без полного переобучения


Полностью совместная, стабильная при масштабе обучающая процедура пока не разработана. Продакшен-системы сохраняют гибридный дизайн: замороженный кодбук с alignment-слоями.

#aivkhub #genrecsys #recsys
  • 🔥 5
  • 👍 4
  • ❤ 3
  • ✍ 1
Post #582 787
📢 Инженеры AI VK запустили единую ИИ-модель для анализа всех типов взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека.

Нейропрофиль решает главную проблему больших экосистем — изоляцию данных между разными сервисами. Вместо того, чтобы копить историю пользователя по кусочкам, трансформер объединяет все его действия в один поток.

Что это дало:

🟣Связь между разными форматами контента
🟣Масштабирование для новых продуктов
🟣Реальный буст на проде

Подробнее в статье на Хабре.

#aivkhub #discovery #recsys
  • 🔥 12
  • ❤ 7
  • 💅 5
  • 👍 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →