TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #10285 22.9K
📌 Р. Саттон: ИИ без оценки результатов в процессе работы не способен к научным открытиям

Ричард Саттон, один из основоположников RL и лауреат премии Тьюринга, записал видео, в котором раскритиковал нынешние генеративные модели.

Современные генеративные модели (LLM, генераторы изображений и видео) по своей природе лишь имитируют и не способны к настоящему творчеству и открытиям.

Основной ограничитель - отсутствие механизма, который оценивал бы их результаты непосредственно во время работы.

Свой довод Саттон построил вокруг известной шутки об отзыве на научную работу: она "и новая, и хорошая, но хорошие части не новы, а новые - не хороши".


Это описание точно подходит к генеративному ИИ: его вывод бывает либо новым (за счёт случайности при генерации), либо качественным (за счёт обучающих данных), но не тем и другим сразу.

Для большинства задач это несущественно: имитация и есть назначение обучения с учителем, а генеративный ИИ остаётся полезной технологией, если он быстрее, дешевле или удобнее воспроизводимого образца. Проблема возникает там, где требуются открытие и творчество, то есть в науке и математике.

Научное открытие складывается из 3 шагов: вариативности, оценки и избирательного сохранения удачного. Этой способности нет в чистом предсказании и обучении с учителем, но она есть в RL, планировании и комбинаторном поиске.

Саттон привёл в пример системы, которые, по его оценке, нашли одновременно новые и качественные решения: AlphaGo, AlphaZero, AlphaFold и AlphaProof.

Сам трёхчастный принцип, кстати, не нов. На близкие идеи указывали ещё Дональд Кэмпбелл и Дэниел Деннет.


🟡 Генеративным моделям недостаёт шага оценки

Из-за предобучения, они не имеют способа оценивать собственный вывод в момент работы, а без оценки нет и отбора лучшего. Оценку может давать человек, выбирающий результат, но важнее кейс, когда критерий задан явной целью (например, ходом, ведущим к мату, или шагом, ведущим к доказательству).

Ограничение Саттон распространил и на сам метод обучения. Алгоритм обратного распространения ошибки лишён случайности, она вносится лишь однажды при инициализации весов, из-за чего сеть со временем теряет пластичность.

В качестве решения он напомнил о предложенном его группой алгоритме Continual Backprop, который периодически заново инициализирует редко используемые нейроны, поддерживая способность сети меняться.

🟡Вывод

Чтобы добиться полностью автономного ИИ-учёного, инженерам следует делиться с моделями измеримыми целями, по которым те могли бы самостоятельно проходить весь цикл: порождать варианты, оценивать их и сохранять лучшие, не полагаясь на человека в роли арбитра.

Тезисы Саттона перекликаются с его эссе "Горький урок", где он отстаивал ставку на поиск и обучение, масштабируемые вместе с вычислительными мощностями, в противовес встраиванию готовых человеческих знаний.


🔜 Послушать лекцию на Youtube


@ai_machinelearning_big_data
  • 🤔 90
  • 👍 62
  • ❤ 39
  • 👏 15
  • 💯 3
  • 🤣 3
  • 🤓 2
  • 🥰 1
  • 👌 1
More from @ai_machinelearning_big_data
  1. Oct 5, 2026🏅 Нобелевку по медицине дали за то, что нейроны научились включать светом Премию по физио…
  2. Oct 5, 2026✔️ Китайские инженеры разработали неинвазивный нейроинтерфейс весом 3 грамма Исследователи…
  3. Oct 4, 2026✔️ Runway показала генеративную оболочку ОС Исследовательское подразделение Runway анонсир…
  4. Oct 3, 2026✔️ Anthropic открыла моды для Claude Code Моды – небольшие функции на TypeScript, меняющие…
  5. Oct 3, 2026⚡️ OpenAI обнулила лимиты платных аккаунтов ChatGPT Главный по ресетам в OpenAI сообщил, ч…
  6. Oct 2, 2026⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →