Наглядно о том, насколько далек новый Fable от того, что мы получили изначально
Аналитики из BridgeMind провели повторные эвалы модели после возвращения, и вот результат:
Debugging: 86.2 → 25.9
Refactoring: 73.6 → 38.4
Hallucination: 75.9 → 61.7
Сама по себе глупее модель не стала, все дело в новых ограничениях: слишком много задач, даже самых обычных, маршрутизируются к Opus 4.8. Отсюда и просадка в метриках.
Post #9483
29.9K

- 😁 60
- 🫡 33
- 😭 32
- ❤ 4
- 👍 4
- 🔥 2
- ⚡ 1
- 🏆 1
- 💘 1