Kimi K2 Thinking (32K) показал результат 4.2 балла на расширенном бенчмарке Extended NYT Connections.
Модель заметно ошибается в рассуждениях и нередко зацикливается при ответах. Тестирование проводилось через официальный API.
Подробнее: github.com/lechmazur/nyt-connections/
Post #3065
2.16K

- 😱 3
- ❤ 2
- 👍 1
- 👎 1
- 🔥 1