TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #3419 1.21K

Forwarded from Machinelearning

✔️ DeepSeek раскатал Vision Mode в чат-боте

DeepSeek запустил Vision Mode в веб-версии и мобильном приложении. Режим поддерживает визуальный CoT для сложных задач (геометрические выводы, анализ графиков и прямую конвертацию UI-скринов в HTML).

В основе функции лежит работа Thinking with Visual Primitives, в которой авторы решили проблему восприятия MMLM при точной локализации и пространственных рассуждениях.

Координаты и граничные рамки используются как минимальные единицы мышления и встраиваются непосредственно в визуальную цепочку CoT.

Это дает модели точную пространственную ориентацию в инференсе без опоры на описания естественным языком.


Vision Mode обрабатывает только статические изображения. Поддержки аудио, видео и генерации картинок нет.


@ai_machinelearning_big_data

#news #ai #ml
  • 👍 4
  • 🔥 1
More from @machinelearning_ru
  1. Sep 23, 2026Невыполнимая задача заставляет ИИ чаще искать обходные пути В системной карте Claude Opus…
  2. Sep 23, 2026Протестируй своё решение на задаче и данных от ПАО «Интер РАО» На хакатоне ты создашь умно…
  3. Sep 22, 2026Теренс Тао призвал замедлить гонку ИИ в математике «Мы можем позволить себе двигаться медл…
  4. Sep 20, 2026📌Goldman Sachs повысил прогноз по развитию физического ИИ Финансовый конгломерат обновил…
  5. Sep 18, 2026🧠 ИИ может «думать дольше», не генерируя длинную цепочку рассуждений Исследователи предст…
  6. Sep 17, 2026🔥 Cohere ускорила LLM inference на H100 с помощью megakernel - до 1,58× быстрее vLLM Обыч…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →