TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.02K subscribers
Post #274 311

Forwarded from Сиолошная

А вот и результаты — они показывают, что модели уже могут быстрее и дешевле справляться с некоторыми повторяющимися, четко определёнными задачами. Однако большинство профессий — это не просто набор задач, которые можно записать в виде инструкции, поэтому речи о полной замене людей, конечно, не идёт.

На первом месте с солидным отрывом Claude Opus 4.1, который выдаёт решения, оцениваемые эксертами не ниже, чем исполненные реальными людьми, для 47.6% задач. Только вдумайтесь, при парном сравнении с людьми модели начинают приближаться к паритету с отраслевыми экспертами!

На втором месте идёт GPT-5, которая слегка обгоняет o3, а уже затем располагаются все остальные. Самая слабая модель из замеренных — GPT-4o из прошлого поколения — служит точкой отсчёта прогресса, чтобы оценить, насколько большие изменения произошли буквально за год.
More from @vibecodingartem
  1. Oct 1, 2026Post #1038
  2. Oct 1, 2026🏠 Мы активно пользуемся Шушей, и вот что за этим стоит В нашей семье Шуша уже ведёт больш…
  3. Oct 1, 2026Post #1036
  4. Oct 1, 2026Уровень effort, перенесённый с Opus 5 на Opus 5.5, — уже другая настройка: слово то же, а…
  5. Sep 30, 2026Учитывая популярность видео, сделанных на Opus 5.5 – не могу не поделиться большущей библи…
  6. Sep 30, 2026🤖 Стартуем новую тему в лекционном клубе - робототехника. Недавно писал, что присматриваю…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →