Bloomberg сравнил семь передовых моделей США и Китая по набору тестов на программирование, работу с инструментами, профессиональные задачи, естественные науки и рассуждение.
Оказалось, что американские системы пока чаще занимают верхние строчки. Но Kimi K3 уже соседствует с Claude Fable 5 и GPT-5.6 Sol, а привычная оценка «Китай отстаёт на 6–9 месяцев» стремительно устаревает. По расчётам Bloomberg, открытым моделям потребовалось 19,7 месяца, чтобы догнать GPT-3.5, 8,5 месяца — чтобы приблизиться к o1, и лишь 4,8 месяца — чтобы сравняться с Claude Opus 4.5 на агентных тестах.
Однако главное преимущество Китая обнаружилось не в рекордах, а в цене
Журналисты проставили семи моделям одинаковую задачу — построить интернет-магазин вымышленной кофейни Brewberg. Почти все создали работающий сайт. Claude Fable 5 выдал один из лучших результатов, но потратил на задачу $48,99. Kimi K3 сделал сопоставимый функциональный сайт более чем на 75% дешевле, а DeepSeek V4 Pro уложился менее чем в $4 — разница в 12 раз.
Тарифы объясняют масштаб: миллион выходных токенов Fable 5 стоит $50, Kimi K3 — $15, DeepSeek V4 Pro — $3,96 в часы пик и $1,98 вне пика. То есть китайский вывод дешевле примерно в 3–25 раз.
Правда, цена токена не равна цене результата: многословная или ошибающаяся модель может потратить больше ходов. Поэтому эксперимент с целой задачей важнее прайс-листа.
Китай, похоже, выигрывает войну за массовый промышленный интеллект: код, сайты, поиск, документы, поддержку и тысячи фоновых агентов. Когда достаточно 90–95% максимального качества, 12х-экономия превращается в стратегическое преимущество. Не случайно в июле китайские модели обеспечили уже более 60% трафика OpenRouter.
Но способны ли "китайцы" работать на задачи, где готового шаблона нет?
На сложных тестах — безусловно. Kimi K3 получил 93,5% на GPQA Diamond против 94,1% у GPT-5.6 Sol; на Humanity’s Last Exam с инструментами — 56% против 58%. Это практически один класс систем.
На уровне настоящих открытий картина осторожнее. Внутренняя модель OpenAI опровергла гипотезу Эрдёша 1946 года, а затем Astra представила результаты по десяти открытым проблемам с формальными сертификатами Lean и экспертной проверкой.
У Китая уже есть собственный прецедент: система Пекинского университета за 80 часов решила задачу Андерсона 2014 года по коммутативной алгебре и формализовала доказательство в Lean почти без участия человека. Но это специализированная двухагентная исследовательская установка, а работа пока опубликована как препринт — не демонстрация обычной Kimi или DeepSeek.
Поэтому говорить следует о двух гонках. В первой побеждает тот, кто дешевле автоматизирует миллионы повторяемых операций, — и здесь Китай уже впереди. Во второй нужно находить то, чего прежде не знал никто. США пока предъявили более сильные публичные доказательства лидерства, но оснований считать эту способность исключительно американской уже нет.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
