DeepSeek выпускает V4.1‑Flash, утверждает, что он превосходит флагман V4‑Pro
Китайский стартап DeepSeek выпустил модель DeepSeek‑V4.1‑Flash — меньшую по активным ресурсам модель новой архитектуры, которую компания заявляет более производительной, чем её более крупный V4‑Pro. Это MoE‑модель с 552 миллиардами параметров, но с каузальным энкодер‑декодером, который оставляет в работе лишь 8 млрд параметров при обработке подсказки и 16 млрд при генерации; ключ‑значение кеш уменьшен до ~890 байт на токен, примерно четверть от предыдущей версии. DeepSeek перенаправит запросы к V4‑Pro на V4.1‑Flash с 14 сентября и выставит оплату по тарифам меньшей модели, выложил веса на Hugging Face под MIT‑лицензией и публикует бенчмарки, где V4.1‑Flash чуть опережает Opus 5 и GPT‑5.6 Sol по ряду тестов.
Для разработчиков это означает заметное снижение затрат и ускорение отклика: офф‑пиковые тарифы указаны как $0.15 за миллион некешированных входных токенов и $0.60 за миллион выходных, а при перенаправлении пиковая стоимо
Post #110
193

- ❤ 1