🐳 Инфографика про DeepSeek-OCR
Как обойти лимиты контекстного окна и снизить стоимость внимания при работе с длинными вводами.
Полезно тем, кто строит чат-ботов и документные модели.
⭐️Проблема: LLM имеют фиксированное окно контекста, а стоимость внимания быстро растет с длиной ввода
⭐️Подход: вместо прямой подачи длинного контекста в LLM превратить его в изображение, сжать в визуальные токены и передать их модели
⭐️Эффект: меньше токенов - ниже вычислительная стоимость внимания и больше эффективное окно контекста; чат-боты и документные модели становятся более способными и эффективными
⭐️ Архитектура Encoder: обрабатывает изображение текста, извлекает визуальные признаки и сжимает их в небольшое число vision tokens
⭐️ Архитектура Decoder: Mixture of Experts языковая модель, считывает эти токены и генерирует текст по одному токену, как в стандартном decoder-only transformer
⭐️ Когда применять: очень длинные документы, выходящие за пределы стандартных окон; контекстное сжатие, стандартные OCR-задачи и глубокий парсинг (таблицы и сложные макеты - текст)
📌 Для чего полезно:
✅ Обучение и сверка: быстро понять, чем визуальные токены и MoE помогают с длинным контекстом
✅ Практика в команде: оптимизировать обработку больших документов в чат-ботах и документных моделях
✅ Навигация и структурирование: выбирать между контекстным сжатием, OCR и глубоким парсингом под задачу
#daily_infographic
#DeepSeek #LLM #AI
Post #786
48
