Занимаемся добавлением новой модели opus 4.8 🔥
По заверениям антропик:
- Лучше по всем бенчмаркам по сравнению с Opus 4.7
- Более эффективный коллаборатор в агентных задачах - лучше суждение, ловит собственные ошибки, задаёт правильные вопросы
- Единственная модель, прошедшая все кейсы Super-Agent benchmark end-to-end (обошла GPT-5.5)
- Лучший результат на Legal Agent Benchmark - первая модель, пробившая 10% на all-pass стандарте
- 84% на Online-Mind2Web (computer-use/browser-agent) - значительный прыжок над 4.7 и GPT-5.5
Post #72
1.04K
- 👍 7
- 🔥 4