TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4972 1.48K
Диогу Алмейда: AI, за которым можно не присматривать (Рубрика #AI4SDLC)

Почему AI впечатляет решением сложных задач, а обычный возврат денег клиенту всё ещё страшно поручить ему без проверки? В 18-минутном июльском выступлении на AI Engineer Диогу Алмейда предлагает искать ответ в цели обучения. По его мнению, индустрия научилась делать отличных помощников, а надёжная автоматизация требует другого набора свойств. Алмейда — один из основных авторов InstructGPT, работы 2022 года, которая помогла превратить языковую модель в исполнителя инструкций. Теперь он разбирает ограничения этого подхода. Получается интересная исследовательская петля: сначала научить AI работать с человеком, затем понять, что мешает убрать постоянный присмотр.

RLHF учит модель получать хорошие человеческие оценки. В классической схеме люди сравнивают ответы, на этих предпочтениях обучают модель вознаграждения, а затем оптимизируют поведение языковой модели под её оценки. Правильность может входить в критерии, но сама оценка остаётся приближением к тому, чего мы хотим от системы.

Представим ответ службы поддержки. Он вежливый, подробный, выглядит убедительно. А возврат оформлен по неверному правилу. Если результат проверяет человек, он ещё может заметить ошибку. Если ответ стал условием в программе, дальше уже поехали деньги. Здесь качество формулировки и качество решения приходится измерять отдельно.

Отсюда провокация Алмейды: ChatGPT и Claude Code принадлежат одной эпохе — эпохе ассистентов. По его логике, агент может выполнять всё больше действий, но это ещё не означает, что ему можно доверить процесс целиком. В идеале автоматизация должна стать настолько обыденной, что о ней вспоминают примерно как о фоновом задании на сервере.

У этой критики есть предметная опора. В отчёте GPT-4 показано, что после постобучения модель хуже оценивала вероятность правильности своих ответов на подмножестве MMLU. При этом результаты на TruthfulQA улучшились. То есть можно чаще отвечать правильно, но хуже соотносить уверенность с реальной точностью. Два разных свойства, которые легко склеить в одно слово «качество».

Для автоматизации Алмейда предлагает отдельную цель — калиброванные решения. Если система выдаёт вероятность 90%, то на большой группе таких прогнозов доля верных должна быть около 90%. Тогда можно настраивать границы: где программа действует сама, где запрашивает дополнительные данные, где передаёт случай человеку. Эти границы всё равно придётся проверять на своих задачах, так как ваше распределение решений может отличаться.

Сильная часть аргумента — требование сделать неопределённость пригодной для программирования. А вот необходимость человека при каждом запуске из RLHF автоматически не следует. Человек участвует в обучении; сколько проверки потребуется при эксплуатации, зависит от реальных ошибок и цены их последствий. Поэтому объяснять все проблемы автоматизации одним методом обучения было бы слишком удобно.

Ещё у Алмейды есть хороший поворот про программное обеспечение. AI уже помогает быстрее писать код, а он хочет изменить сами возможности готовой программы: добавить в неё смысловые суждения, которые можно проверять и соединять с обычной логикой. Условие «клиент действительно просит возврат» гораздо труднее выразить кодом, чем проверку суммы или даты.

На момент выступления его TypeSafe ещё готовилась к релизу, который состоялся 15 сентября. Собственно, у этой идеи появился API и модель Jev, про которую мы поговорим в следующем посте.

#AI #AI4SDLC #Engineering #Automation #Research
YouTube Jev CEO: I made ChatGPT, now I'm building What's Next Diogo Almeida, a GPT-4 co author formerly at OpenAI and now CEO of TypeSafeAI, creators of Jev, argues that RLHF made models that are extraordinary at pleasing the human in the loop, and that is exactly the problem. Optimizing for human preference optimizes…
  • ❤ 5
  • 🔥 3
  • 👍 1
More from @book_cube
  1. Sep 21, 2026Research Insights Made Simple #30: Developer Productivity for Humans (Рубрика #Management)…
  2. Sep 21, 2026Y Combinator: железо, агенты и основатели (Рубрика #AI) В свежем выпуске The Lightcone «Th…
  3. Sep 20, 2026Jev: интеллект для обычного if (Рубрика #AI4SDLC) В предыдущем посте Диогу Алмейда предлаг…
  4. Sep 20, 2026Материалы 3 AImigo S1E6: как не утонуть в потоке AI-изменений и сохранить силы (Рубрика #A…
  5. Sep 20, 2026Regenerative Software — Чад Фаулер (Рубрика #Books) Книга ещё не дописана, а рекомендовать…
  6. Sep 19, 2026Материалы 3 AImigo S1E5: джун без простых задач (Рубрика #AI4SDLC) Готовы материалы пятого…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →