ВОЙНА МОДЕЛЕЙ
Ждали Sonnet 5. Получили Opus 4.6.
Через несколько минут - OpenAI отвечает GPT-5.3-Codex.
Никто не ждал такого поворота.
Claude Opus 4.6:
• 1M токенов контекста (впервые для Opus)
• Agent teams - команды агентов работают параллельно
• Terminal-Bench 2.0 - первое место
• GDPval - бьёт GPT-5.2 на 144 Elo
• Claude в Excel и PowerPoint
GPT-5.3-Codex:
• Модель участвовала в создании себя самой
• 25% быстрее предшественника
• Terminal-Bench 2.0 - 77.3%
• OSWorld - прыжок с 38% до 65%
• Первая модель с рейтингом «High capability» по кибербезу
Что общего? Обе ставят на агентность. Автономная работа, долгие сессии, инструменты.
Opus 4.6 уже тестирую.
2026 начинается жёстко.
Post #79
5.17K

- 🔥 37
- ❤ 9
- 👏 6