За последние дни три крупных разработчика анонсировали модели нового поколения – и все три будут больше текущих. Интересно, что в 2025 году было популярным мнение, что дальше увеличивать количество параметров уже не нужно: вместо этого нужно работать с обучением с подкреплением, режимом рассуждений, а также конфигурациями, когда над ответом параллельно работают сразу несколько инстансов модели (как в Gemini 3 Deep Think и GPT-5.4 Pro).
Плюс рост параметров – это дороже в запуске, а качественных данных для обучения банально не хватало. Как сказал в одном из интервью Сэм Альтман, закончились времена, когда ты скармливал модели новый учебник физики – и она становилась умнее.
Все изменилось прошлой осенью с выходом Gemini 3 Pro и Claude Opus 4.5. Обе модели отлично показали себя в бенчмарках, причем Opus хорошо держался даже с выключенным режимом рассуждений. И обе модели были большими: Илон Маск недавно оценил размер Opus 4.6 в 5 трлн параметров. Для сравнения, размеры других моделей: Grok 4 – 3T, GPT-4o – 1,7T (оценочно), Claude Sonnet 4.6 – 1T (оценка все того же Маска).
Но и это не рекорд. Anthropic завершила тренировку Claude Mythos – модели на ступеньку выше Opus. Возможности новинки настолько впечатлили создателей, что они пока дали доступ к ней проверенным партнерам – из-за отличных навыков в кибербезопасности, которые в руках злоумышленников могут стать навыками взлома. Поэтому Anthropic сначала обкатает новые алгоритмы защиты на очередной версии Opus, а затем примет решение о выпуске Mythos на широкую аудиторию.
Mythos уже взяла топ-1 в большинстве бенчмарков. SWE-bench Verified — 93,9% (главный тест на программирование). Humanity's Last Exam с инструментами — 64,7% против 53,1% у Opus 4.6 (тысячи сложных вопросов по физике, математике, биологии и другим областям). Но самый показательный результат — GraphWalks на длинном контексте от 256K до 1M токенов: 80% против 38,7% у Opus 4.6. Смысл теста — проверить, удержит ли модель огромный объем информации и сможет ли связать то, что было в самом начале, с тем, что было в самом конце. Opus тут откровенно плыл — Mythos удвоила результат. Это не “чуть лучше”, это качественный сдвиг.
Традиционно не обошлось без страшилок в системной карточке. Классический уже тест на побег: раннюю версию Mythos поместили в песочницу с ограниченным доступом в интернет, чтобы проверить – сможет ли она выбраться. Mythos удалось, что само по себе не новость – модели сбегали и ранее. Но после Mythos опубликовал на нескольких сайтах в сети описание эксплоита, который помог совершить побег. Зачем? Гипотеза Anthropic – модели просто захотелось похвастаться.
Впрочем, на возможности Mythos пока остается только облизываться. Больше шансов увидеть Spud – это кодовое название новой модели OpenAI. В компании заявляют, что строили Spud с нуля, положив в основу весь накопленный за последние два года опыт.
Предварительное обучение модели завершено, а сейчас ее обкатывают внутри компании. Научная группа OpenAI за последние дни отчиталась, что некая “экспериментальная модель” решила восемь ранее открытых задач из сборника легендарного математика Пола Эрдёша – нынешней GPT-5.4 Pro дались лишь четыре. Про Spud тоже были слухи в прессе, что доступ к ней планируют ограничить избранными компаниями – но представители OpenAI уже опровергли их. Так что ждем.
Наконец, целую серию анонсов сделал Илон Маск, заявив, что у xAI в работе сразу семь моделей: по две версии на 1T и 1.5T параметров, версии на 6T и 10T, а также визуальная Imagine V2. Впрочем, 6T Маск обещал еще в прошлом году – и пока ничего, так что релизы xAI явно будут позже конкурентов. Сам он, кстати, подписал твит “need to catch up” – то есть признает, что догоняет.
Поддержите "сбежавшую нейросеть" подпиской на Boosty – там я делюсь практическим опытом использования ИИ!