Artificial analysis (они зайки, делают лучшие бенчмарки сейчас) пишут про то, что изменилось:
1. Подрос общий индекс способностей модельки: SotA результаты на их бенчмарках при меньшем количестве использованных токенов, чем Opus 4.6 или GPT 5.2-xhigh, при этом скорость генерации сильно выше.
2. Почти вдвое уменьшили количество галлюцинаций (88%->50%), но при этом количество общих знаний у модели несопоставимо больше, чем у конкурентов.
3. Наконец-то доросли до фронтира по агентному кодингу.
Post #338
8.76K

- 👏 54
- 🔥 10
- ❤ 9
- 🥴 2
- 🌚 1
- 🍓 1