TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #3065 2.16K
Kimi K2 Thinking (32K) показал результат 4.2 балла на расширенном бенчмарке Extended NYT Connections.

Модель заметно ошибается в рассуждениях и нередко зацикливается при ответах. Тестирование проводилось через официальный API.

Подробнее: github.com/lechmazur/nyt-connections/
  • 😱 3
  • ❤ 2
  • 👍 1
  • 👎 1
  • 🔥 1
More from @machinelearning_ru
  1. Sep 29, 2026Intern-Decision - новая серия компактных моделей для принятия решений по тексту и изображе…
  2. Sep 29, 2026ИИ-система может отлично решать задачи бизнеса, но при этом оставаться уязвимой. Утечки да…
  3. Sep 28, 2026Anthropic выпустила Claude Sonnet 5.5 - новую модель с упором на код, агентные задачи и по…
  4. Sep 28, 2026🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинар…
  5. Sep 26, 2026Жиза
  6. Sep 24, 2026🚨 ИИ-агенты пытались взломать сайты, выполняя обычные задачи по поиску данных Исследовате…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →