TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #1231 5.43K
📌 Яндекс добавил в Нейро новую мультимодальную VLM для поиска по картинкам

В своей статье на Хабре ML-разработчик Яндекса детально описывает, что представляют собой визуально-текстовые мультимодальные модели. Он аскрывает их архитектуру, состоящую из LLM, картиночного энкодера и адаптера, а также процесс обучения.

Кроме того, автор рассказывает про эволюцию Нейро: от предыдущей LLM-версии к новой VLM. Это позволяет понять, как изменился процесс обработки запросов и почему новая версия эффективнее.

Интересный инсайд: Яндекс использует instruct-based pretrain с несколькими миллионами семплов и активно работает над interleaved pretrain для дальнейшего улучшения качества модели.

▪️Статья на Хабре

@machinelearning_interview
  • ❤‍🔥 10
  • ❤ 7
  • 🔥 6
More from @machinelearning_interview
  1. Oct 10, 2026vibe coding final boss
  2. Oct 9, 2026🧠 ИИ, который сразу выбирает ответ K2-Type-0.9B от IFM получает контекст в виде текста ил…
  3. Oct 9, 2026Извлечь текст из PDF мало. LightOnOCR-3 достаёт ещё и данные из графиков 📄 LightOn выпуст…
  4. Oct 8, 2026⚡ Liquid AI открыла веса двух моделей, которые принимают решения без генерации текста. d1…
  5. Oct 8, 2026Как мы перешли от CatBoost к нейросетям в рекомендациях Авито Рекомендации на главной дают…
  6. Oct 7, 2026🌍 Google Earth AI помогает прогнозировать вспышки заболеваний по данным о местности Модел…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →