TGViewer
AbstractDL AbstractDL @abstractdl · 18.7K subscribers
Post #110 7.62K
🔥MTTR: End-to-End Text Referring Video Object Segmentation

Представлена новая SOTA в сегментации объектов на видео по их текстовому описанию. Качество просто невероятное!

Модель основана на мультимодальном трансформере, в который подаются фичи от текстового энкодера (RoBERTa) и видео энкодера (Video Swin). Примечательно, что в отличие от предыдущих решений, обучение здесь end2end — sequence prediction problem.

P.S. Авторы опубликали и код, и веса моделей 👍

Статья, GitHub
  • 👍 3
More from @abstractdl
  1. Oct 5, 2026Меня не просили, но я сделал. Уроборос теперь на лету переводит свой интерфейс на любой яз…
  2. Oct 5, 2026😊
  3. Sep 30, 2026Все же слышали, что OpenAI пересмотрели условия подписок Codex? Теперь такое по квотам: 10…
  4. Sep 28, 2026Sonnet-5.5 фанфакт из техрепорта: это первая модель антропик, которой пофиг насколько вежл…
  5. Sep 27, 2026Опять много взломов и новостей алаймента от агентов OpenAI накопилось, держите дайджест: >…
  6. Sep 25, 2026Evidence of Linear Superposition in LLMs Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →