TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #9881 22.1K
🌟 HY-Embodied-0.5: компактная модель для роботов на Mixture-of-Transformers.

Tencent Robotics X и Hunyuan Vision выложили веса HY-Embodied-0.5 MoT-2B — младшей модели нового семейства HY-Embodied-0.5 для воплощённого интеллекта.

Семейство позиционируется как когнитивное ядро для VLA-пайплайнов: модель должна выполнять роль «мозга», который принимает кадры с камер робота, рассуждает о трехмерной сцене и выдает план действий исполнительному модулю.

Формально MoT-2B содержит 4 млрд параметров, но на инференсе активируется только 2,2 млрд, что дает скорость плотной 2B-модели при качестве восприятия, сопоставимом с тяжёлыми VLM.

В основе лежит архитектура Mixture-of-Transformers с латентными токенами и модально-специфичными вычислениями для зрительного тракта.

Суть MoT: перед мультимодальным обучением Tencent дублирует FFN- и QKV-блоки языковой модели и инициализирует копию её же весами - визуальные токены прогоняются через визуальную ветку, текстовые через языковую.

Помимо разделения FFN и QKV, разведены и механизмы внимания: для визуальных токенов используется двунаправленное полное внимание, для языковых - causal-внимание.

Связующим звеном служат обучаемые visual latent tokens, которые приписываются в конец каждого визуального элемента (кадра или изображения) и переносят визуальную семантику в языковой контекст.


В семействе будет старший вариант - HY-Embodied-0.5 MoE-A32B на 32 млрд активных параметров. Он построен уже на MoE и, по словам создателей, выходит на уровень Gemini 3.0 Pro.

Веса флагмана не опубликованы, но именно эта модель выступает учителем в дистилляции, передавая навыки рассуждения младшей MoT-2B.

🟡Результаты на бенчмарках

🟢MoT-2B обходит Qwen3-VL 2B/4B, RoboBrain 2.5 4B и MiMo-Embodied 7B в большинстве из 22 тестов на визуальное восприятие и пространственное мышление: 89,2 на CV-Bench, 92,3 на DA-2K, 54,5 на ERQA и 66,3 на MindCube, где ближайший конкурент отстаёт почти вдвое.

🟠На задачах планирования (RoboBench-Planning, Ego-Plan2, RefSpatial-Bench) лидерство остаётся за RoboBrain и MiMo-Embodied, здесь Tencent пока догоняет.

Для инференса рекомендуется GPU с минимум 16 ГБ VRAM.

В планах - интеграция с vLLM и Gradio-демо.


📌Лицензирование: Tencent HY Community License


🟡Модель
🟡Arxiv
🟡Техотчет
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #Embodied #Robotics #Tencent #Hunyuan
  • 🤓 52
  • 👍 38
  • ❤ 10
  • 👏 10
  • 🔥 7
  • 🤔 5
  • 👀 3
  • ❤‍🔥 1
  • 😁 1
More from @ai_machinelearning_big_data
  1. Oct 10, 2026📌 Humanity's Sixth Sense: мультимодальные модели все еще отстают в когнитивном восприятии…
  2. Oct 9, 2026🔍 Microsoft выпустила модель, которая только принимает решения. В 35 раз быстрее GPT-6 So…
  3. Oct 9, 2026✔️ Odyssey выпустила модель мира Odyssey-3 Новая модель стартапа Odyssey, основанного выхо…
  4. Oct 9, 2026✔️ OpenAI начала развёртывание GPT-6 с динамическим интерфейсом Главное новшество – систем…
  5. Oct 9, 2026📌 Кейноут Windows and Surface event На осенней презентации 7 октября Microsoft рассказала…
  6. Oct 9, 2026✔️ Meta*, DeepMind и Isomorphic Labs присоединились к проекту симуляции живых клеток Неком…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →