Я тут понял, что мой харнесс является не только хорошим оркестратором AI-моделей, но и с него можно собирать интересные аналитические данные.
Например, о том, как какая модель справляется с тем или иным типом задач. Где и какие ошибки допускает в сравнении со старшими братьями.
Вот я вчера начал новую Grok 4.7 нагружать боевыми задачами, а сегодня уже новую MiMo 2.6 Pro от Xiaomi могу нагрузить. И собрать обратную связь о том, кто из них как справляется.
В реальности, а не на искусственных тестах.
Замутим собственный Bench?
Post #138
47
- 🔥 4