TGViewer
AI и грабли AI и грабли @oestick · 13.7K subscribers
Post #423 4.5K
Текст не нужен

Последние пару месяцев живу с маргинальной мыслью, что текст как входные данные для AI систем – костыль

Казалось бы, наоборот, современный прорыв в ИИ случился в больших языковых моделях. Но у меня стойкое ощущение, что это просто промежуточный шаг на пути к более естественной форме восприятия – графической.

У человека нет текстового токенизатора – мы считываем текст глазами. Сколько лет наши буквы эволюционировали, чтобы считываться даже размытыми или только с верхней половиной?

Точно ли хорошая идея делать для LLM отдельный "орган восприятия" для текста? Да еще на основе всех костылей придуманных в Computer Science для строк.

Хз

Я уже перевел один клиентский проект на полностью картиночное восприятие, и частично перевел второй. И это при том, что там в основном текстовые пдфки. Моя интуиция, почему это работает – визуал сохраняет много мета-информации о тексте, которая готовилась для человеков: разные размеры шрифтов, взаимное расположение блоков инфы, таблицы, цветовое выделение.

Часть этого компенсируется маркдаун разметкой, но все равно с потерями.

———

Кстати, про маргинальность.

Пока этот пост лежал у меня недописанным в отложке, DeepSeek выпускают OCR модель со статьей буквально о том, о чем пишу выше – оптимизации для картинок текста. А затем еще и Карпатый в твиттере делает на них обзор.

Меня там зацепило:

- Сжатие до 10x (!) по числу токенов при точности 97%

- Это очевидно, но я даже не задумывался – Visual модели нативно поддерживают двунаправленный механизм внимания

- Интересный разгон про хранение картинок текста для реализации памяти у агентов (можно держать в контексте в 10 раз больше при тех же ресурсах).

- А "забывание" реализовать через постепенное понижение разрешения для старых/неиспользуемых кусков

———

И еще, доп. бонус от картиночного восприятия: нативные bbox для RAG пайплайнов. Очень круто показывать пользователю не только страницу, где нашли инфу, но и выделять конкретную область на ней (скрин ниже).

———

DeepSeek OCR
Твит Карпатого
Gemini Object Detection

———
  • 🔥 33
  • ❤ 13
  • 👍 12
  • 🥰 1
More from @oestick
  1. Sep 27, 2026Скоро: видео-монтаж-слоп во всех лентах страны Opus-5.5 теперь сам такое ваншотит на remot…
  2. Sep 26, 2026О, Валера @neuraldeep принял эстафету и выложил свой neuraldeep.ru/depth с детекцией глуби…
  3. Sep 26, 2026Я уже неделю не могу дописать важный пост про SynthID – метку о том, что контент сгенериро…
  4. Sep 21, 2026Стартуем https://youtu.be/rQWGshpC1rc?t=661
  5. Sep 19, 2026⬆️ Расскажу про vscode moment для агентов и нативный способ дать клод коду оркестрировать…
  6. Sep 19, 2026Что вы знаете про bb? Они называют себя "AI IDE that builds itself". Достаточно молодой пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →