TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.48K subscribers
Post #959 2.51K
И дальше про LLMs evaluating LLMs: на днях вышел пейпер, где авторы собрали 4550 заданий из 30 курсов Mathematics and Electrical Engineering and Computer Science (EECS) в MIT. Эти 30 курсов достаточно сдать, чтобы выпуститься, собственно, бакалавром

И вот они говорят, что ChatGPT решает 30% этих задач, а GPT-4 делает идеальный скор 100% (и получает диплом with honors)

Но есть ✨ нюанс ✨: как же получали скоры того, насколько хорошо пройдены тесты? Особенно с учетом того, что в датасете большая часть вопросов были с открытым ответом или на программирование? Ответ прост – оценить решения GPT-4 попросили саму GPT-4. Human evaluation в статье нет

Еще GPT-4 «решала» задания в очень приятных условиях: при генерации ответов в промте использовали few-shot (давали 3 похожих вопроса из датасета вместе с решением – то есть при решении она видела человеческие ответы на ту же тему), chain-of-thought, self-crtique и expert prompting, применяя все эти методы поочередно, и без ограничения на число итераций

В Твиттере конечно не все долистали до эвалюации, потому там очередная волна «this is a game changer»
  • 🤡 46
  • ❤ 7
  • 👍 2
  • 🤔 2
  • 🥴 1
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →