Вышел DeepSeek V4.1-Flash. Что там по применимости для контента?
Если лень всё читать, то вот сразу вывод: модели дешевеют быстрее, чем умнеют. Читать миллион токенов теперь почти ничего не стоит, а фактология осталась на прежнем уровне. Значит, на первый план выходит не выбор модели, а то, что мы кладём ей в контекст. Кто собирает хороший контекст, тот получает хороший текст. Кто надеется на модель, получит уверенную ошибку, просто дешевле. Контент-инженерия всё больше превращается в инженерию контекста.
Теперь подробности. В отчёте DeepSeek на 51 страницу нет ни одного теста на качество текста и ни слова о русском языке. Модель делали под агентов и код. Но часть выводов прямо переносится на контент-пайплайны.
1. Редстандарты в начало промпта
Главное в релизе — дешёвый контекст. Префилл стал почти вдвое дешевле, KV-кэш — вчетверо компактнее. Кэш префикса DeepSeek хранит не меньше 72 часов. В контент-пайплайне постоянная часть промпта большая: редстандарт, tone of voice, эталоны, описание продукта. Её выгодно ставить первой и не менять между запусками. Всё переменное: задание, исходник, дату — в конец. Если поставить дату в первую строку системного промпта, кэш будет сбрасываться каждый день.
2. Факты давать, а не спрашивать
Слабое место модели — фактология. На SimpleQA-Verified базовая модель набирает 42,3, а V4-Pro — 55,2. Длинные рассуждения не спасают: при переходе с уровня 25 на 100 результат меняется на пару пунктов. Если модель чего-то не знает, додумать это она не сможет.
Для контента вывод простой: имена, даты, цифры и названия продуктов берутся только из источников в контексте. Особенно это касается тех, кто работает на deepseek-v4-pro: с 14 сентября такие запросы молча уйдут на V4.1-Flash.
3. Миллион токенов не значит понимание миллиона токенов
На LongBench-V2 у модели 45,2, у V4-Pro — 51,5. Когда адаптируете длинный отчёт, отдавайте нужные разделы, а не весь PDF целиком.
4. Картинки на вход рабочий инструмент
Модель нативно мультимодальная, на DocVQA у неё 95,6. Слайды спикера, скриншоты интерфейса и таблицы из PDF можно отдавать как есть и просить черновик. При этом картинка сжимается примерно до 1344×1344, так что длинные скриншоты и плотную инфографику лучше резать на части. И цифры, снятые с графиков, стоит проверять: на Chartography у модели 78,9, у Opus 5 — 84.
5. Max не по умолчанию
В API три уровня: low, high и max, внутри это 50, 75 и 100. Переход с 25 на 100 даёт плюс 8–9 пунктов на тестах и примерно в 2,5 раза больше токенов. Большая часть прироста набирается уже к 60–80. Эти данные только по математике и коду, по текстам замеров нет. Моя гипотеза: для рерайта, адаптаций и анонсов хватит low, для аналитики стоит брать high.
Забрать DeepSeek V4.1-Flash, опубликовано под лицензией MIT
#ai
Post #2984
113

- 🔥 2