TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.4K subscribers
Post #916 16.2K
Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости

Новая версия Deepseek V4 стала получше своего предшественника. Возможно, там что-то подкрутили с reasoning, т.к. бенчмарк новой версии работал в 2.5 раза дольше и потратил больше денег. Но это стоило того, т.к. по соотношению цена/качество в долгоиграющих агентских задачах эта модель попала на Pareto-фронтир рядом с gpt-oss-120b

Deepseek V4 - это Mixture-of-experts (разреженная) модель с 284B параметров, из которых активируются 13B. В версии от конца июля заново прогнали post-train, чтобы заточить ее больше на "coding, reasoning, and agent workflows".

Модель можно выкачать и запустить. Правда, старушку gpt-oss-120B она пока не сильно подвинула (последняя занимает еще и фронтир по скорости).

Но, если смотреть как фронтир потихоньку ползет все дальше от начала координат, остается только очень радоваться за скорость прогресса. Появляется все больше хороших и открытых моделей под разные задачи!

Ваш, @llm_under_hood 🤗
  • ❤ 42
  • 🔥 30
  • 👍 21
  • 🤗 2
More from @llm_under_hood
  1. Oct 1, 2026Как вы думаете, справится Codex c такой задачей? Вот я сейчас запустил задачу, где прошу н…
  2. Oct 1, 2026Обязательно смотрим OpenAI DevDays сами! Те выжимки, которые есть в куче каналов - фокусир…
  3. Sep 30, 2026Что нового в разработке продуктов с LLM под капотом? Раньше я много писал про кейсы продук…
  4. Sep 29, 2026Бенчмарк GPT-6.1 Sol - аналогичное качество за меньшие деньги А еще Sonnet 5.5 и Opus 5.5…
  5. Sep 28, 2026Концепция Katas или зачем изобретать велосипеды никакая автоматизация не дает повод изобре…
  6. Sep 25, 2026Семь месяцев работы с Codex-ом в одном графике Это иллюстрация из моего поста про последни…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →