TGViewer
Инженер Контекста Инженер Контекста @proitru · 943 subscribers
Post #2984 113
Вышел DeepSeek V4.1-Flash. Что там по применимости для контента?

Если лень всё читать, то вот сразу вывод: модели дешевеют быстрее, чем умнеют. Читать миллион токенов теперь почти ничего не стоит, а фактология осталась на прежнем уровне. Значит, на первый план выходит не выбор модели, а то, что мы кладём ей в контекст. Кто собирает хороший контекст, тот получает хороший текст. Кто надеется на модель, получит уверенную ошибку, просто дешевле. Контент-инженерия всё больше превращается в инженерию контекста.

Теперь подробности. В отчёте DeepSeek на 51 страницу нет ни одного теста на качество текста и ни слова о русском языке. Модель делали под агентов и код. Но часть выводов прямо переносится на контент-пайплайны.

1. Редстандарты в начало промпта

Главное в релизе — дешёвый контекст. Префилл стал почти вдвое дешевле, KV-кэш — вчетверо компактнее. Кэш префикса DeepSeek хранит не меньше 72 часов. В контент-пайплайне постоянная часть промпта большая: редстандарт, tone of voice, эталоны, описание продукта. Её выгодно ставить первой и не менять между запусками. Всё переменное: задание, исходник, дату — в конец. Если поставить дату в первую строку системного промпта, кэш будет сбрасываться каждый день.

2. Факты давать, а не спрашивать

Слабое место модели — фактология. На SimpleQA-Verified базовая модель набирает 42,3, а V4-Pro — 55,2. Длинные рассуждения не спасают: при переходе с уровня 25 на 100 результат меняется на пару пунктов. Если модель чего-то не знает, додумать это она не сможет.

Для контента вывод простой: имена, даты, цифры и названия продуктов берутся только из источников в контексте. Особенно это касается тех, кто работает на deepseek-v4-pro: с 14 сентября такие запросы молча уйдут на V4.1-Flash.

3. Миллион токенов не значит понимание миллиона токенов

На LongBench-V2 у модели 45,2, у V4-Pro — 51,5. Когда адаптируете длинный отчёт, отдавайте нужные разделы, а не весь PDF целиком.

4. Картинки на вход рабочий инструмент

Модель нативно мультимодальная, на DocVQA у неё 95,6. Слайды спикера, скриншоты интерфейса и таблицы из PDF можно отдавать как есть и просить черновик. При этом картинка сжимается примерно до 1344×1344, так что длинные скриншоты и плотную инфографику лучше резать на части. И цифры, снятые с графиков, стоит проверять: на Chartography у модели 78,9, у Opus 5 — 84.

5. Max не по умолчанию

В API три уровня: low, high и max, внутри это 50, 75 и 100. Переход с 25 на 100 даёт плюс 8–9 пунктов на тестах и примерно в 2,5 раза больше токенов. Большая часть прироста набирается уже к 60–80. Эти данные только по математике и коду, по текстам замеров нет. Моя гипотеза: для рерайта, адаптаций и анонсов хватит low, для аналитики стоит брать high.


Забрать DeepSeek V4.1-Flash, опубликовано под лицензией MIT

#ai
  • 🔥 2
More from @proitru
  1. Oct 9, 2026Сегодня хочется просто поддержать коллег из Yandex и Yandex Cloud. Тем, кто пытается восст…
  2. Oct 2, 2026Post #2990
  3. Sep 24, 2026Не давай модели подбирать слова. Заметка для редакторов про метод Птачека Томас Птачек, че…
  4. Sep 12, 2026Не вайбкодь на выходных, не вайбкодь на выходных, не вайбкодь на выходных...
  5. Sep 11, 2026Обещал на 1000 подписчиков, но получилось раньше. Отдельный скилл clean-ai-patterns для пр…
  6. Sep 11, 2026Обещанная история про косяки и разработку агентов, написанная во время перелёта в Москву Т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →