Рассказываем, что нового в мире ИИ
🥇🤖Модели Google и OpenAI победили в олимпиаде
Google и OpenAI отчитались (анонс Google, анонс OpenAI) о результатах своих языковых моделей на международной математической олимпиаде (IMO). Обе модели решили пять из шести задач, что соответствует уровню золотой медали. «Золото» IMO получают около 8% участников соревнования.
На решение задач отводилось 4,5 часа — стандартное время для всех участников. Модели использовали только естественный язык, без доступа к интернету или внешним инструментам вроде среды исполнения кода. Решения модели Google проверяли судьи олимпиады по стандартным критериям. OpenAI не проходила официальную проверку, но, как утверждает сама компания, результат проверили 3 бывших медалиста IMO.
Почему это важно?
С 2024 года компании активно развивают продвинутые математические способности языковых моделей. Ранее высокие результаты показывали только специализированные системы или модели с доступом к внешним инструментам. Теперь модели общего пользования, работающие исключительно с естественным языком, достигли уровня золотой медали IMO. Это демонстрирует прогресс парадигмы «рассуждающих» LLM, которые генерируют длинные цепочки «мыслей» перед финальным ответом.
🇨🇳Обновления Qwen3
Китайский холдинг Alibaba Group представил обновленные языковые модели Qwen3. В предыдущих версиях Qwen3 использовался гибридный подход — можно было вручную указывать, нужны ли длинные рассуждения перед ответом или требуется мгновенный отклик. Однако это понизило общее качество.
Теперь разработчики снова разделили две модели на рассуждающую и быструю. Новые LLM значительно превосходят гибридные версии во всех тестах. Модели доступны в двух размерах: 235 млрд или 30 млрд параметров. «Большой» Qwen3 теперь лишь незначительно уступает закрытым коммерческим ChatGPT и Gemini. Все обновленные модели размещены на HuggingFace под лицензией, разрешающей коммерческое использование.
Кроме того, вышли две специализированные версии Qwen. Первая предназначена для машинного перевода — она превосходит GPT-4.1 и Gemini 2.5 Pro по качеству и скорости, но доступна только через API. Вторая специализируется на программировании и не уступает лидеру в этой области — Claude Sonnet 4 от Anthropic. Веса модели открыты.
Почему это важно?
Линейка Qwen входит в число лучших открытых LLM на рынке. Ее выделяет большая широта: модели общего назначения представлены в различных размерах, что делает их подходящими как для локального использования обычными пользователями, так и для развертывания на мощных корпоративных серверах. Многие академические исследователи выбирают Qwen в качестве базы для проверки своих гипотез.
🤖 «Системный Блокъ» @sysblok