Буквально за ~месяц в мире frontier-моделек произошло много интересного. Краткий мой пересказ - под спойлером.
Антропики распиарили свою супер-модель нового поколения Mythos 5, которая по их словам: слишком крута и слишком опасна, потому что на раз можем взломать любые системы, умеет думать, обходить правила, прямо почти AGI — в общем, человечество к такому пока не готово и поэтому модельку дали только какому-то супер-узкому составу компаний. А для обычных людей в начале июня выкатили на всех «урезанную версию» поколения Mythos — Fable 5, которая вроде как и нового поколения, но по бенч-маркам показывает не сильно большой прирост, при этом стоит х2 от Opus 4.8, и при том еще автоматически переключается в виде фолбека на тот самый Опус, если ей кажется что она может быть опасной/навредить — забавно, но еще не все. Потом пришел «американский РКН» и обязал Антропиков заблокировать модель для всех неграждан США, а те не имея возможности надежно исполнить требование (потому что как ты определишь гражданство миллионов своих пользователей?) выключили модаль вообще для всех до выяснения обстоятельств. И только спустя месяц (вот буквально вчера) они снова вернули ее в общий доступ, но с еще более жесткими фильтрами по безопасности и более частыми переключениями на Opus. По существу самой модели я сказать ничего не могу - пользовался ей минимально, по ощущениям тот же Опус :) Читал каналам - тоже единого мнения не увидел: кто-то говорит про какой-то несущественный прирост, кто-то даже писал про деградацию на своих задачах — в любом случае, какого-то революционного скачка не было
Тем временем, китайская Z.AI выпустила своего флагмана GLM-5.2, который тоже сколько-то шуму наделал. По многим бенчмаркам она уже ну уровне с флагманами Opus 4.7-4.8, GPT-5.5 и при этом в 5 раз меньше по цене. Китайцы не дают расслабиться в этом конкурентной борьбе.
Ну и OpenAI. Долго молчали, а на прошлой неделе сделали пятничный подарок и объявили о своих новых моделях - GPT-5.6, которые не уступают по бенчамарках тому самому Mythos от Антропиков. Там особенность в том, что это уже сразу сеймейство моделей: Sol (супер-флагман по цене GPT-5.5), Terra (рабочая лошадка для повседневных задач - на уровне gpt-5.5, но по цене gpt-5.4) и Luna (быстрая, дешевая, для простых задач). Главное, что я тут вижу и чему рад — более лояльная ценовая политика. Новый флагман по цене флагмана предыдущего поколения, а качество и мозки gpt-5.5 по более низкой цене — кайф, короче. Но есть нюанс. Модели пока сделали доступными для узкого круга проверенных компаний, а для всех откроют через ~месяц после пилотов и консультаций все с тем же «американским РКН»
Знаете принцип Парето? Мне кажется, что 20% пути, которые дали нам 80% результата был пройдены где-то в момент появления gpt-5.4 и Opus 4.5 (примерно).
Я очень активно использую в работе для повседневных задач и для кодинга gpt-5.4/gpt-5.5 и поймал себя на мысли, что уже довольно давно мне этого полностью хватает. Модели уже настолько крутые, что прямо с лихвой закрывают все мои потребности и я буквально не вижу существенной точки роста в дальнейшем развитии моделей. Если модели станут в разы круче по всем бенчмаркам, то скорость работы/эффективности увеличится благодаря этому совсем незначитально (если вообще увеличится).
Сейчас точка роста с возможностей моделей сместилась совсем на другое, на «Харнесс»: подход к работе, организация воркфлоу, тулы для моделей, оркестрация, организация и умение работать с контекстом. На то, как с кратко выросшей благодаря нейросетям скоростью не скатиться в хаос и сохранить контроль над процессом и продолжать выдавать прогнозируемое качество результата.
А увеличивать эффективность не за счет моделей, а за счет харнесса — гораздо сложней. Потому что в случае с модельками за тебя все делают всякие Антропики и ты просто используешь. А в случае с харнессом надо включать мозги, копаться и перестраивать свои процессы — а это часто бывает очень больно 😀