TGViewer
техно-свалка техно-свалка @techs_dump · 463 subscribers
Post #155 71
🔥 Что реально изменилось за последние дни: GPT-6, Claude Opus 5.5, Xiaomi MiMo и грядущий Qwen 4

За последние пару дней вышло сразу несколько крупных AI-моделей. Я сравнила их не по сухим рейтингам, а по тому, что мне кажется важнее: код, агенты, контекст, скорость и сколько всё это стоит на практике.

🤖 OpenAI GPT-6 Sol / Luna
Здесь интереснее всего то, что OpenAI фактически спустила часть технологий GPT-6 Astra в более дешёвые модели. Sol и Luna обучались похожими методами и получили улучшения Astra в coding, computer use, factuality и agentic-задачах.
При этом API подешевел примерно вдвое:
Sol: $2 input /$10 output
Luna: $0.10 /$0.50 за 1M токенов
По бенчмарку DeepSWE 1.1:
Sol — 68.8%
Luna — 66.6%
То есть даже Luna уже залезает в область серьёзного coding-agent, хотя стоит копейки. Плюс OpenAI переработала prompt caching: cached input теперь может быть дешевле на 90%.

🧠 Claude Opus 5.5
Anthropic пошла немного другим путём: ставка на длинные автономные задачи и качество агента.
Цена: $4 /$20. Это на 20% ниже Opus 5, модель генерирует более чем на 30% быстрее, а типичная задача, по данным Anthropic, обходится примерно на 40% дешевле из-за меньшего количества токенов и шагов.
То есть Opus интересен не только тем, что «умнее». Он стал меньше ходить кругами и делать меньше tool calls для получения результата. Для больших codebase, рефакторинга и автономных агентов это может быть важнее цены одного токена.

🚀 Xiaomi MiMo-V2.6 Pro
Для меня это самый интересный релиз по соотношению характеристик и цены.
Что внутри:
1M context
128K max output
text + image + video + audio
tool calling
open weights
Цена: $0.435 input /$0.87 output.
На Artificial Analysis Intelligence Index Xiaomi указывает 46.32 — сейчас это один из самых сильных результатов среди open-weight моделей.
Но технически интереснее другое: Xiaomi сильно масштабировала RL на реальных agentic-задачах. Для Pro использовали около 750 тыс. trajectories, а DeepSWE v1.1 в процессе RL вырос с 58.4 до 72.6.
То есть open-weight модели начинают догонять закрытые уже не только масштабом pretraining — их серьёзно дожимают через agentic RL.

👀 И ещё важное — Qwen 4
Это уже официально: Alibaba сообщила, что Qwen 4 находится в обучении.
Причём компания уже показала направление развития: Qwen3.8-Max прогнали через месяц автоматического self-improvement — 33 итерации, после чего его Artificial Analysis score вырос с 40 до 45.
Дальше в roadmap — Qwen 4.5 и Qwen 5, где Alibaba говорит уже о масштабе 5–10 трлн параметров.
💡 Мой вывод после сравнения:
Claude Opus 5.5 — ставка на тяжёлые и длинные agentic-задачи.
GPT-6 Sol — сильный компромисс между frontier-возможностями и ценой.
GPT-6 Luna — особенно интересна для массовых агентов и большого числа вызовов.
MiMo V2.6 Pro — наиболее интересный open-weight релиз по цене/возможностям.


Какую модель вы бы протестировали? Делитесь в комментариях! 👇
  • ❤ 20
  • 👏 8
  • 🥰 7
  • 🔥 4
  • 🤩 1
More from @techs_dump
  1. Sep 25, 2026Alice AI Foundation: что Яндекс открыл вместе с весами модели 21 сентября Яндекс опубликов…
  2. Sep 22, 2026Xiaomi выпустила MiMo-V2.6 Новая серия включает модели MiMo-V2.6 Pro и Flash. Они мультимо…
  3. Sep 21, 2026В Шанхае прошли бои полноразмерных гуманоидов На турнире URKL сражались гуманоиды EngineAI…
  4. Sep 18, 2026В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили…
  5. Sep 17, 2026Давно читаю канал Тани Савельевой, интересно пишет про вайб кодинг и предпринимательство.…
  6. Sep 17, 2026Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам Конфа была топ Я…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →