Бенчмарки, которым можно верить
Наблюдения Михаила Парахина подтвердились сегодняшними замерами Toloka Arena (замеры на закрытом наборе задач) — Claude 4.8 показывает лучший результат среди всех моделей, правда и жжет больше токенов, чем GPT-5.5 в режиме XHigh, у которого второе место.
Впрочем, высока вероятность, что до конца недели случится новый релиз от OpenAI :)
@devspotting
Post #158
1.26K

- 👍 10
- ❤ 1
- 🔥 1