🔥 Что реально изменилось за последние дни: GPT-6, Claude Opus 5.5, Xiaomi MiMo и грядущий Qwen 4
За последние пару дней вышло сразу несколько крупных AI-моделей. Я сравнила их не по сухим рейтингам, а по тому, что мне кажется важнее: код, агенты, контекст, скорость и сколько всё это стоит на практике.
🤖 OpenAI GPT-6 Sol / Luna
Здесь интереснее всего то, что OpenAI фактически спустила часть технологий GPT-6 Astra в более дешёвые модели. Sol и Luna обучались похожими методами и получили улучшения Astra в coding, computer use, factuality и agentic-задачах.
При этом API подешевел примерно вдвое:
Sol: $2 input /$10 output
Luna: $0.10 /$0.50 за 1M токенов
По бенчмарку DeepSWE 1.1:
Sol — 68.8%
Luna — 66.6%
То есть даже Luna уже залезает в область серьёзного coding-agent, хотя стоит копейки. Плюс OpenAI переработала prompt caching: cached input теперь может быть дешевле на 90%.
🧠 Claude Opus 5.5
Anthropic пошла немного другим путём: ставка на длинные автономные задачи и качество агента.
Цена: $4 /$20. Это на 20% ниже Opus 5, модель генерирует более чем на 30% быстрее, а типичная задача, по данным Anthropic, обходится примерно на 40% дешевле из-за меньшего количества токенов и шагов.
То есть Opus интересен не только тем, что «умнее». Он стал меньше ходить кругами и делать меньше tool calls для получения результата. Для больших codebase, рефакторинга и автономных агентов это может быть важнее цены одного токена.
🚀 Xiaomi MiMo-V2.6 Pro
Для меня это самый интересный релиз по соотношению характеристик и цены.
Что внутри:
1M context
128K max output
text + image + video + audio
tool calling
open weights
Цена: $0.435 input /$0.87 output.
На Artificial Analysis Intelligence Index Xiaomi указывает 46.32 — сейчас это один из самых сильных результатов среди open-weight моделей.
Но технически интереснее другое: Xiaomi сильно масштабировала RL на реальных agentic-задачах. Для Pro использовали около 750 тыс. trajectories, а DeepSWE v1.1 в процессе RL вырос с 58.4 до 72.6.
То есть open-weight модели начинают догонять закрытые уже не только масштабом pretraining — их серьёзно дожимают через agentic RL.
👀 И ещё важное — Qwen 4
Это уже официально: Alibaba сообщила, что Qwen 4 находится в обучении.
Причём компания уже показала направление развития: Qwen3.8-Max прогнали через месяц автоматического self-improvement — 33 итерации, после чего его Artificial Analysis score вырос с 40 до 45.
Дальше в roadmap — Qwen 4.5 и Qwen 5, где Alibaba говорит уже о масштабе 5–10 трлн параметров.
💡 Мой вывод после сравнения:
Claude Opus 5.5 — ставка на тяжёлые и длинные agentic-задачи.
GPT-6 Sol — сильный компромисс между frontier-возможностями и ценой.
GPT-6 Luna — особенно интересна для массовых агентов и большого числа вызовов.
MiMo V2.6 Pro — наиболее интересный open-weight релиз по цене/возможностям.
Какую модель вы бы протестировали? Делитесь в комментариях! 👇
Post #155
71
- ❤ 20
- 👏 8
- 🥰 7
- 🔥 4
- 🤩 1