Наглядно о том, насколько далек новый Fable от того, что мы получили изначально
Аналитики из BridgeMind провели повторные эвалы модели после возвращения, и вот результат:
Debugging: 86.2 → 25.9
Refactoring: 73.6 → 38.4
Hallucination: 75.9 → 61.7
Сама по себе глупее модель не стала, все дело в новых ограничениях: слишком много задач, даже самых обычных, маршрутизируются к Opus 4.8. Отсюда и просадка в метриках.
Post #1891
3.01K
