21 августа DeepSeek выпустила экспериментальную DeepSeek-V4-Flash-Vision-Exp - версию V4 Flash, которая умеет работать не только с текстом, но и с изображениями.
Теперь модели можно отправить:
📸 фотографию - попросить описать или проанализировать;
🖥 скриншот интерфейса - найти ошибки или объяснить, что происходит;
📊 график или диаграмму - извлечь показатели и сделать выводы;
📄 скрин документа - прочитать и проанализировать содержимое;
🤖 изображение внутри агентного сценария - например, чтобы агент мог визуально проверять результат своих действий.
Поддерживаются форматы JPEG, PNG, GIF и WebP. Изображение можно передать ссылкой, загрузить напрямую или предварительно сохранить через Files API.
При этом по работе с обычным текстом Vision-версия сохраняет возможности DeepSeek V4 Flash: рассуждение, работу с инструментами и агентные сценарии. Контекст - до 1 млн токенов. Модель также поддерживает Tool Calling, Responses API и Anthropic-совместимый API.
Интересная деталь по моим наблюдениям: после обработки одно изображение занимает максимум около 384 входных токенов, поэтому работа с картинками потенциально получается довольно дешёвой.
⚠️ Пока модель имеет статус experimental, так что для критичных production-сценариев я бы сначала хорошо протестировал качество.
Где попробовать:
1. Официальный DeepSeek API
Получаете API-ключ и указываете модель:
deepseek-v4-flash-vision-expЧитайте тут: https://api-docs.deepseek.com/guides/vision/
Получить DeepSeek API Key можно тут: https://platform.deepseek.com
2. Через OpenRouter
Модель уже появилась там как DeepSeek V4 Flash Vision Exp, поэтому её удобно подключать к своим приложениям и инструментам через единый API от OpenRouter
Вот тут вся инфа поней: https://openrouter.ai/deepseek/deepseek-v4-flash-vision-exp