Дайджест AI/ML за неделю 21–27 сентября 2026
Anthropic: Claude Opus 5.5
Опять менять подписку. Opus 5.5 обгоняет Fable 5.1 почти по всей таблице: Terminal-Bench 4.0 66.4% против 55.8% (у Astra 57.9%), CursorBench 57.8% против 51.8%, HLE 67.7% против 65.6%. При этом $4/$20 вместо $5/$25 у Opus 5, кэш $0.20, на 30% быстрее, типичные задачи на 40% дешевле. Первый релиз после того как Амодей призвал притормозить фронтир.
Sonnet и Haiku 5.5 обещают через несколько недель.
Блогпост, AA
OpenAI: GPT-6 Sol и GPT-6 Luna
По совпадению вышли через полтора часа после Opus 5.5. Модели подросли по бенчам, но главное - подешевели в 2 раза: Sol $2/$10, Luna $0.10/$0.50. Обещают вдвое меньше фактических ошибок чем у 5.6 Sol. Terra в шестом поколении нет.
Не Opus 5.5 конечно, но новые парето-оптимальные модели.
Блогпост, форум
xAI: Grok 4.7
2.1T параметров, на 40% больше Grok 4.6, контекст 500К, цена та же $2/$6. В индексе интеллекта AA 46 против 53 у Fable и GPT-6.
Из плюсов: SOTA на бенчмарке по электротехнике.
Из минусов: гайки цензуры прикрутили, NSFW больше нет. С каждым днем мы все дальше от МехаГитлера.
Блогпост
Xiaomi: MiMo-V2.6 Pro и Flash
Открытые омнимодальные модели под MIT: текст, картинки, видео и аудио на входе, контекст 1М. Pro набирает 46 в индексе AA, то есть уровень Grok 4.7 и лучший результат среди открытых. Flash $0.14/$0.28, кэш $0.0028. Если хотите отвлечься от чтения слопокода - с весами выложили 7000+ RL-окружений для кода, уязвимостей и веба и весь пайплайн обучения, а RL-фаза, по их словам, стоила $2.62М для Pro и $850К для Flash. Бонусом 9B дистиллят на базе Qwen3.5.
Блогпост, RL, HF
BFL: FLUX 3 Action
Открытая 7B world action model для роботов: по картинкам с камер, состоянию и инструкции предсказывает следующие действия и заодно будущие кадры. На RoboLab-120 42.9% против 36.8% у Cosmos 3 Nano на 16B, до 3.95 раза быстрее. Интегрирована в LeRobot, есть рецепты файнтюна.
Модель, HF
Alibaba: Qwen-Audio-3.1
Пять моделей: ASR, TTS и Realtime модели обновили и удешевили, а также из интересного добавили умные версии ASR и TTS:
ASR-Next - Распознает эмоции, роли, фоновые шумы, убирает эээ слова-паразиты
TTS-Next - можно кроме самой речи прописывать эффекты, эмоции, тайминги и тд
Блогпост, X
Google: Gemini 3.8 Flash TTS и Flash-Lite TTS
Flash для актерской игры и дизайна голосов, Lite для дубляжа и агентов. 100+ языков, 2000+ голосов, клонирование по 30 секундам с устным согласием владельца, SynthID в каждом файле. В оценке Hume обе заняли первые два места.
Блогпост, API
Tencent: Hy
До 20 референсов вместо трех, многоходовое редактирование с памятью сессии, 4K на выходе. Обещают 30% прироста по human eval относительно 3.0. $0.024 за картинку против $0.045–0.211 у GPT Image 2.5. Весов нет, только API и бесплатно в Miora до 7 октября. KuCoin
DeepSeek: DSec
Статья про инфраструктуру песочниц для RL от DeepSeek, которая обслуживала все RL раны от V3.2 до V4.1. Есть отдельная глава про то, как агенты ломали песочницу ради награды. Статья
inclusionAI: Ming-Image-0.1-Design - 6B под MIT для UI, инфографики и постеров с читаемым текстом и RGBA на выходе, плюс Design-Layer, который раскладывает готовый макет на слои. Первое место среди открытых на UI/UX лидерборде AA. HF, GitHub
Fireworks: Ember-1 - Kimi K3, дообученная думать на 40% короче без потери качества: DeepSWE 75.2 против 66.4 у базовой K3, Terminal-Bench 2.1 82.0. $3/$15, research preview, весов нет. Блогпост