TGViewer
Все о блокчейн/мозге/space/WEB 3.0 в России и мире Все о блокчейн/мозге/space/WEB 3.0 в России и мире @blockchainrf · 20.5K subscribers
Post #13310 2.62K
Вау! Смотрите, если к дешёвым open-source моделям добавить самопроверку, то они обгонят Claude

Исследователи из Stanford, Berkeley (запрещены в РФ) и NVIDIA показали, как это работает на практике с помощью фреймворка LLM-as-a-Verifier.

Так DeepSeek V4 Flash + самопроверка
на Terminal-Bench 2.1 смогла:

1. Сгенерировать всего 5 вариантов решения
2. Та же модель их оценила и выбрала лучший
3. Точность выросла с 79 % до 88 %

В итоге обогнали Claude Fable 5 и сделали это в 11 раз дешевле.
  • 👍 12
  • ❤ 6
  • 🔥 4
More from @blockchainrf
  1. Sep 25, 2026Свежее от #DeepSeek:они показали,как выглядит фабрика обучения ИИ-агентов изнутри Команда…
  2. Sep 25, 2026Но всех рвет Джефф Дин, ex-Google, его стартап инвесторы оценивают в $50млрд, и это не пре…
  3. Sep 25, 2026Это какое-то безумие, инвесторы оценивают разработчика Jev в $10млрд Мы недавно писали про…
  4. Sep 25, 2026Anthropic разобрали как создать ИИ-агентов для торговли и сами рынки для агентов Команда р…
  5. Sep 24, 2026Google DeepMind говорят, что безусловного дохода недостаточно для счастливого будущего с И…
  6. Sep 24, 2026Шмидхубер стал Chief Scientific Advisor в Sakana AI 🙂
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →