TGViewer
ИИволюция 👾 ИИволюция 👾 @ai_volution · 11.8K subscribers
Post #1319 3.59K

Forwarded from Сиолошная

Вероятно на прошлой неделе вы натыкались на упоминания статьи от Apple, где рассказывалось про «ограниченность» мышления рассуждающих моделей. Может быть вы даже видели разгромные разборы этой статьи, где в красках описывалось, где именно авторы налажали (ну например давали задачу, где доказано, что начиная с определенной сложности решений не существует в принципе — а авторы-то выносили это в ограничение моделей). Почитать можно, например, тут (или вот более детальный пост на LW с контекстом).

Решил об этом написать, когда увидел вот этот твит от Dan Hendrycks, который на бенчмаркинге моделей собаку съел (он был авторов нескольких самых именитых бенчей).

«Apple недавно опубликовала статью, показывающую, что современные системы искусственного интеллекта не способны решать простые для людей головоломки.
Люди: 92,7%
GPT-4o: 69,9%

Однако они не проводили оценку самых свежих рассуждающих моделей. Если бы они это сделали, то обнаружили бы, что OpenAI o3 набирает 96,5%, опережая людей»

😂 every single time
  • ❤ 13
  • 👾 2
More from @ai_volution
  1. Oct 7, 2026Сегодня во всех каналах “OpenAI дропнули 722 пейпера по математике” А мы с женой, по больш…
  2. Oct 7, 2026OpenAI упростили понятие тиров на платформе для компаний. Было 5 тиров с разными лимитами,…
  3. Oct 7, 2026“AI заменит людей в службе поддержки” – говорили они. Но почему-то у OpenAI служба поддерж…
  4. Oct 6, 2026“at this time” или как мягко послать куда подальше 🤡
  5. Oct 6, 2026Народный антифрод-ресерч: саммари чатов о банах Claude С момента последнего поста в чатах…
  6. Oct 3, 2026Уехал подальше от всех этих искусственных интеллектов, за тишиной и спокойствием. Продолжи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →