TGViewer
AI4Dev — AI for Development AI4Dev — AI for Development @llm4dev · 5.29K subscribers
Post #231 2.2K
Помните, мы все удивились новой китайской модели DeepSeek R1, которая сравнима с o1, но открытая? Ах, да, конечно помните, это же было неделю назад. Она основана на модели DeepSeek V3 (не рассуждающей). А теперь встречайте Tulu3-405B — американскую открытую модель, которая превосходит DeepSeek V3 по большинству бенчмарков (по крайней мере из тех, которые авторы указали в пресс-релизе).

Разработчик: некоммерческий институт AI2 (Сиэтл)
Параметры: 405B, обучение — 256 GPU

По HumanEval (популярный бенчмарк на программирование с проверкой заданий юнит тестами) превосходит DeepSeek, есть дистиллированные маленькие модели - кандидаты на локальную модель для программирования, по отзывам скорости на бытовом железе скромные.

На бенчмарках PopQA (вопросы по Википедии) и GSM8K (математика), обгоняя не только DeepSeek V3, но и GPT-4o с Llama 3.1.

Код доступен на GitHub, Hugging Face, протестировать можно в чат-боте AI2.
Рассуждать, правда, придётся самостоятельно — Tulu3 пока не умеет.

Более подробный обзор: TechCrunch
  • 👍 6
More from @llm4dev
  1. Sep 25, 2026Почему наука автоматизируется неравномерно? О пределах исследовательского harness рассказа…
  2. Sep 25, 2026Live stream finished (58 minutes)
  3. Sep 25, 2026🔴 Мы в эфире! ИИ уже помогает искать уязвимости. Вопрос в том, кто первым найдёт слабое м…
  4. Sep 25, 2026Live stream started
  5. Sep 17, 2026Live stream finished (1 hour)
  6. Sep 17, 2026Live stream started
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →