Пиксели > Токены. DeepSeek предлагает качать LLM картинками
Китайцы из DeepSeek (те самые, что нашумели с эффективной моделью R1) снова тонко намекают, что вся индустрия идёт куда-то не туда. Они выкатили DeepSeek-OCR. Сама по себе распознавалка текста — просто proof-of-concept. Вся соль — в методе.
Они заявляют: обрабатывать пиксели (картинки) для LLM может быть значительно эффективнее, чем токены (текст). Настолько, что даже Андрей Карпатый (Andrej Karpathy) задумался: «Может, вообще всё в LLM надо подавать как изображения?»
Их OCR-модель сжимает визуальные данные в 10 раз (!), используя крошечный энкодер (380M) и декодер (всего 570M активных параметров), и почти не теряет в точности (97%).
Это прямой удар по идеологии «AI-фабрик». Зачем строить гигаваттные дата-центры, если можно просто научиться нормально сжимать данные? DeepSeek явно метит в главных специалистов по компрессии в AI. Если они правы, то гигантские контекстные окна (на десятки страниц доков или целые репозитории) могут стать не роскошью, а дешёвой нормой.
Главный вопрос: Google и OpenAI в своих закрытых моделях уже делают так, просто молчат?
Post #28
99

- ❤ 1