TGViewer
CyberGraf CyberGraf @cybergraf · 32 subscribers
Post #786 48
🐳 Инфографика про DeepSeek-OCR

Как обойти лимиты контекстного окна и снизить стоимость внимания при работе с длинными вводами.

Полезно тем, кто строит чат-ботов и документные модели.

⭐️Проблема: LLM имеют фиксированное окно контекста, а стоимость внимания быстро растет с длиной ввода

⭐️Подход: вместо прямой подачи длинного контекста в LLM превратить его в изображение, сжать в визуальные токены и передать их модели

⭐️Эффект: меньше токенов - ниже вычислительная стоимость внимания и больше эффективное окно контекста; чат-боты и документные модели становятся более способными и эффективными

⭐️ Архитектура Encoder: обрабатывает изображение текста, извлекает визуальные признаки и сжимает их в небольшое число vision tokens

⭐️ Архитектура Decoder: Mixture of Experts языковая модель, считывает эти токены и генерирует текст по одному токену, как в стандартном decoder-only transformer

⭐️ Когда применять: очень длинные документы, выходящие за пределы стандартных окон; контекстное сжатие, стандартные OCR-задачи и глубокий парсинг (таблицы и сложные макеты - текст)

📌 Для чего полезно:
✅ Обучение и сверка: быстро понять, чем визуальные токены и MoE помогают с длинным контекстом
✅ Практика в команде: оптимизировать обработку больших документов в чат-ботах и документных моделях
✅ Навигация и структурирование: выбирать между контекстным сжатием, OCR и глубоким парсингом под задачу

#daily_infographic
#DeepSeek #LLM #AI
More from @cybergraf
  1. Jan 10, 2026#weekend_meme
  2. Jan 9, 2026#weekend_meme
  3. Jan 8, 2026#weekend_meme
  4. Jan 7, 2026#weekend_meme
  5. Jan 6, 2026#weekend_meme
  6. Jan 5, 2026#weekend_meme
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →