Qwen почти втрое прокачала флагман в задачах с кодом
Alibaba выпустила Qwen3.8-Max-0902 — тот же флагман на 2,4 трлн параметров с контекстом в миллион токенов, но дополнительно обученный на программировании и длительной работе ИИ-агентов.
В таблице Qwen прирост приличный:
TerminalBench: 11,3 → 29,0
ProgramBench: 10,5 → 28,0
DeepSWE: 56,6 → 69,3
JobBench: 53,4 → 64,0
Особенно интересно выглядит SWE-Atlas QnA, где агент должен разбираться в большом существующем репозитории: Qwen получила 66,3 против 63,2 у Opus 5 в сравнении Alibaba.
Но корону пока выдавать рано. В тяжелом автономном кодинге Opus 5 все еще впереди: например, в TerminalBench — 42,7 против 29,0.
Есть и независимый результат. Новая Qwen сначала вышла на первое место Code Arena: WebDev, но после появления Fable 5.1 опустилась на второе. Сейчас у нее 1688 баллов против 1687 у Opus 5, причем результат Qwen пока предварительный и статистические интервалы сильно пересекаются.
Цена в международном QwenCloud осталась $2 за миллион входных и $6 за миллион выходных токенов. Кэш обходится заметно дешевле.
Еще нюанс: сам снапшот 0902 пока доступен через облачный сервис, но вся 2,4-триллионная линия Qwen не закрыта. Веса Qwen3.8-2.4T-A95B уже опубликованы.
Получается, Qwen за месяц сильнее всего подтянула именно то, где августовская Max заметно проигрывала, — долгую самостоятельную работу с кодом.
https://anonhaven.com/news/qwen-pochti-vtroe-uluchshila-flagman-v-zadachah-s-kodom/
@Anonhaven | anonhaven.com
Post #423
26