TGViewer
Алексей Цыкарев | ИТ, ИИ и бизнес Алексей Цыкарев | ИТ, ИИ и бизнес @release_it · 1.22K subscribers
Post #350 262
Давно ничего не писал про нейросети (итак из каждого утюга), а сейчас хочу поделиться мыслью про происходящую гонку моделей

Буквально за ~месяц в мире frontier-моделек произошло много интересного. Краткий мой пересказ - под спойлером.


Антропики распиарили свою супер-модель нового поколения Mythos 5, которая по их словам: слишком крута и слишком опасна, потому что на раз можем взломать любые системы, умеет думать, обходить правила, прямо почти AGI — в общем, человечество к такому пока не готово и поэтому модельку дали только какому-то супер-узкому составу компаний. А для обычных людей в начале июня выкатили на всех «урезанную версию» поколения Mythos — Fable 5, которая вроде как и нового поколения, но по бенч-маркам показывает не сильно большой прирост, при этом стоит х2 от Opus 4.8, и при том еще автоматически переключается в виде фолбека на тот самый Опус, если ей кажется что она может быть опасной/навредить — забавно, но еще не все. Потом пришел «американский РКН» и обязал Антропиков заблокировать модель для всех неграждан США, а те не имея возможности надежно исполнить требование (потому что как ты определишь гражданство миллионов своих пользователей?) выключили модаль вообще для всех до выяснения обстоятельств. И только спустя месяц (вот буквально вчера) они снова вернули ее в общий доступ, но с еще более жесткими фильтрами по безопасности и более частыми переключениями на Opus. По существу самой модели я сказать ничего не могу - пользовался ей минимально, по ощущениям тот же Опус :) Читал каналам - тоже единого мнения не увидел: кто-то говорит про какой-то несущественный прирост, кто-то даже писал про деградацию на своих задачах — в любом случае, какого-то революционного скачка не было

Тем временем, китайская Z.AI выпустила своего флагмана GLM-5.2, который тоже сколько-то шуму наделал. По многим бенчмаркам она уже ну уровне с флагманами Opus 4.7-4.8, GPT-5.5 и при этом в 5 раз меньше по цене. Китайцы не дают расслабиться в этом конкурентной борьбе.

Ну и OpenAI. Долго молчали, а на прошлой неделе сделали пятничный подарок и объявили о своих новых моделях - GPT-5.6, которые не уступают по бенчамарках тому самому Mythos от Антропиков. Там особенность в том, что это уже сразу сеймейство моделей: Sol (супер-флагман по цене GPT-5.5), Terra (рабочая лошадка для повседневных задач - на уровне gpt-5.5, но по цене gpt-5.4) и Luna (быстрая, дешевая, для простых задач). Главное, что я тут вижу и чему рад — более лояльная ценовая политика. Новый флагман по цене флагмана предыдущего поколения, а качество и мозки gpt-5.5 по более низкой цене — кайф, короче. Но есть нюанс. Модели пока сделали доступными для узкого круга проверенных компаний, а для всех откроют через ~месяц после пилотов и консультаций все с тем же «американским РКН»


Знаете принцип Парето? Мне кажется, что 20% пути, которые дали нам 80% результата был пройдены где-то в момент появления gpt-5.4 и Opus 4.5 (примерно).

Я очень активно использую в работе для повседневных задач и для кодинга gpt-5.4/gpt-5.5 и поймал себя на мысли, что уже довольно давно мне этого полностью хватает. Модели уже настолько крутые, что прямо с лихвой закрывают все мои потребности и я буквально не вижу существенной точки роста в дальнейшем развитии моделей. Если модели станут в разы круче по всем бенчмаркам, то скорость работы/эффективности увеличится благодаря этому совсем незначитально (если вообще увеличится).

Сейчас точка роста с возможностей моделей сместилась совсем на другое, на «Харнесс»: подход к работе, организация воркфлоу, тулы для моделей, оркестрация, организация и умение работать с контекстом. На то, как с кратко выросшей благодаря нейросетям скоростью не скатиться в хаос и сохранить контроль над процессом и продолжать выдавать прогнозируемое качество результата.

А увеличивать эффективность не за счет моделей, а за счет харнесса — гораздо сложней. Потому что в случае с модельками за тебя все делают всякие Антропики и ты просто используешь. А в случае с харнессом надо включать мозги, копаться и перестраивать свои процессы — а это часто бывает очень больно 😀
  • 👍 3
  • ❤ 1
More from @release_it
  1. Sep 22, 2026Динамика рынка ИТ-аутстаффинга за май 2025 - август 2026 Август давно кончился, делюсь обн…
  2. Sep 15, 2026Ходил сегодня в новый зал после перерыва. Смотрю, в дальнем углу зала стоит небольшая груп…
  3. Sep 2, 2026Просто обожаю чувство юмора и креативный подход к неймингу у своих коллег 😅
  4. Sep 1, 2026С 1 сентября!
  5. Aug 10, 2026Динамика рынка ИТ-аутстаффинга за май 2025 - июль 2026 Июль кончился, делюсь обновленным г…
  6. Aug 7, 2026На скрине статистика расхода токенов за неделю при полном выжигании подписки Codex, котора…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →