TGViewer
сбежавшая нейросеть сбежавшая нейросеть @ai_exee · 23.8K subscribers
Post #441 9.84K
Поговорим о топ-моделях

Действительно, ну эти ваши нейросети

За последние дни три крупных разработчика анонсировали модели нового поколения – и все три будут больше текущих. Интересно, что в 2025 году было популярным мнение, что дальше увеличивать количество параметров уже не нужно: вместо этого нужно работать с обучением с подкреплением, режимом рассуждений, а также конфигурациями, когда над ответом параллельно работают сразу несколько инстансов модели (как в Gemini 3 Deep Think и GPT-5.4 Pro).

Плюс рост параметров – это дороже в запуске, а качественных данных для обучения банально не хватало. Как сказал в одном из интервью Сэм Альтман, закончились времена, когда ты скармливал модели новый учебник физики – и она становилась умнее.

Все изменилось прошлой осенью с выходом Gemini 3 Pro и Claude Opus 4.5. Обе модели отлично показали себя в бенчмарках, причем Opus хорошо держался даже с выключенным режимом рассуждений. И обе модели были большими: Илон Маск недавно оценил размер Opus 4.6 в 5 трлн параметров. Для сравнения, размеры других моделей: Grok 4 – 3T, GPT-4o – 1,7T (оценочно), Claude Sonnet 4.6 – 1T (оценка все того же Маска).

Но и это не рекорд. Anthropic завершила тренировку Claude Mythos – модели на ступеньку выше Opus. Возможности новинки настолько впечатлили создателей, что они пока дали доступ к ней проверенным партнерам – из-за отличных навыков в кибербезопасности, которые в руках злоумышленников могут стать навыками взлома. Поэтому Anthropic сначала обкатает новые алгоритмы защиты на очередной версии Opus, а затем примет решение о выпуске Mythos на широкую аудиторию.

Mythos уже взяла топ-1 в большинстве бенчмарков. SWE-bench Verified — 93,9% (главный тест на программирование). Humanity's Last Exam с инструментами — 64,7% против 53,1% у Opus 4.6 (тысячи сложных вопросов по физике, математике, биологии и другим областям). Но самый показательный результат — GraphWalks на длинном контексте от 256K до 1M токенов: 80% против 38,7% у Opus 4.6. Смысл теста — проверить, удержит ли модель огромный объем информации и сможет ли связать то, что было в самом начале, с тем, что было в самом конце. Opus тут откровенно плыл — Mythos удвоила результат. Это не “чуть лучше”, это качественный сдвиг.

Традиционно не обошлось без страшилок в системной карточке. Классический уже тест на побег: раннюю версию Mythos поместили в песочницу с ограниченным доступом в интернет, чтобы проверить – сможет ли она выбраться. Mythos удалось, что само по себе не новость – модели сбегали и ранее. Но после Mythos опубликовал на нескольких сайтах в сети описание эксплоита, который помог совершить побег. Зачем? Гипотеза Anthropic – модели просто захотелось похвастаться.

Впрочем, на возможности Mythos пока остается только облизываться. Больше шансов увидеть Spud – это кодовое название новой модели OpenAI. В компании заявляют, что строили Spud с нуля, положив в основу весь накопленный за последние два года опыт.

Предварительное обучение модели завершено, а сейчас ее обкатывают внутри компании. Научная группа OpenAI за последние дни отчиталась, что некая “экспериментальная модель” решила восемь ранее открытых задач из сборника легендарного математика Пола Эрдёша – нынешней GPT-5.4 Pro дались лишь четыре. Про Spud тоже были слухи в прессе, что доступ к ней планируют ограничить избранными компаниями – но представители OpenAI уже опровергли их. Так что ждем.

Наконец, целую серию анонсов сделал Илон Маск, заявив, что у xAI в работе сразу семь моделей: по две версии на 1T и 1.5T параметров, версии на 6T и 10T, а также визуальная Imagine V2. Впрочем, 6T Маск обещал еще в прошлом году – и пока ничего, так что релизы xAI явно будут позже конкурентов. Сам он, кстати, подписал твит “need to catch up” – то есть признает, что догоняет.

Поддержите "сбежавшую нейросеть" подпиской на Boosty – там я делюсь практическим опытом использования ИИ!
  • 👍 68
  • 🔥 25
  • ❤ 19
  • 👏 3
  • 😁 1
More from @ai_exee
  1. Sep 30, 2026Окей, dot, чем займемся сегодня? Новый ИИ-ассистент OpenAI – dot или “точка” – уже появилс…
  2. Sep 29, 2026OpenAI Dots. Вы даете ИИ имя, выбираете личность и получаете в комплекте поводок. Не для а…
  3. Sep 29, 2026Обзор DevDay: OpenAI дала повод вернуться – и повод поворчать OpenAI бахнула на DevDay пач…
  4. Sep 29, 2026Мы с OpenAI больше не друзья? В сети пожар: глава Codex Тибо Сотьо анонсировал возвращение…
  5. Sep 28, 2026Claude Sonnet 5.5 – OpenAI, держи подарок на DevDay! Anthropic выпустила Claude Sonnet 5.5…
  6. Sep 28, 2026Наберусь смелости и предположу, что GPT-6 Astra и Claude Opus 5.5 мы запомним “поворотными…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →