TGViewer
AI4Dev — AI for Development AI4Dev — AI for Development @llm4dev · 5.3K subscribers
Post #545 1.78K
Moonshot выпустили Kimi K3, 57 баллов в Artificial Analysis Intelligence Index. Выше только Claude Fable 5 (60) и GPT-5.6 Sol (59). Opus 4.8 с его 56 остался позади.

Что интересно в цифрах:

— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне

Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.

Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.

А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они также заявляют как «second only to Fable 5».

Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
  • 👍 7
  • 🔥 3
  • ❤ 1
More from @llm4dev
  1. Sep 17, 2026Live stream finished (1 hour)
  2. Sep 17, 2026Live stream started
  3. Sep 17, 2026Кажется, что достаточно объединить несколько LLM-агентов, разрешить им общаться — и получи…
  4. Sep 16, 2026Live stream finished (1 hour)
  5. Sep 16, 2026Live stream started
  6. Sep 16, 2026🤖 Как поднять корпоративного LLM-бота в закрытом контуре? Расскажет Алексей Кудаков, CTO…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →