Ричард Саттон, один из основоположников RL и лауреат премии Тьюринга, записал видео, в котором раскритиковал нынешние генеративные модели.
Современные генеративные модели (LLM, генераторы изображений и видео) по своей природе лишь имитируют и не способны к настоящему творчеству и открытиям.
Основной ограничитель - отсутствие механизма, который оценивал бы их результаты непосредственно во время работы.
Свой довод Саттон построил вокруг известной шутки об отзыве на научную работу: она "и новая, и хорошая, но хорошие части не новы, а новые - не хороши".
Это описание точно подходит к генеративному ИИ: его вывод бывает либо новым (за счёт случайности при генерации), либо качественным (за счёт обучающих данных), но не тем и другим сразу.
Для большинства задач это несущественно: имитация и есть назначение обучения с учителем, а генеративный ИИ остаётся полезной технологией, если он быстрее, дешевле или удобнее воспроизводимого образца. Проблема возникает там, где требуются открытие и творчество, то есть в науке и математике.
Научное открытие складывается из 3 шагов: вариативности, оценки и избирательного сохранения удачного. Этой способности нет в чистом предсказании и обучении с учителем, но она есть в RL, планировании и комбинаторном поиске.
Саттон привёл в пример системы, которые, по его оценке, нашли одновременно новые и качественные решения: AlphaGo, AlphaZero, AlphaFold и AlphaProof.
Сам трёхчастный принцип, кстати, не нов. На близкие идеи указывали ещё Дональд Кэмпбелл и Дэниел Деннет.
🟡 Генеративным моделям недостаёт шага оценки
Из-за предобучения, они не имеют способа оценивать собственный вывод в момент работы, а без оценки нет и отбора лучшего. Оценку может давать человек, выбирающий результат, но важнее кейс, когда критерий задан явной целью (например, ходом, ведущим к мату, или шагом, ведущим к доказательству).
Ограничение Саттон распространил и на сам метод обучения. Алгоритм обратного распространения ошибки лишён случайности, она вносится лишь однажды при инициализации весов, из-за чего сеть со временем теряет пластичность.
В качестве решения он напомнил о предложенном его группой алгоритме Continual Backprop, который периодически заново инициализирует редко используемые нейроны, поддерживая способность сети меняться.
🟡Вывод
Чтобы добиться полностью автономного ИИ-учёного, инженерам следует делиться с моделями измеримыми целями, по которым те могли бы самостоятельно проходить весь цикл: порождать варианты, оценивать их и сохранять лучшие, не полагаясь на человека в роли арбитра.
Тезисы Саттона перекликаются с его эссе "Горький урок", где он отстаивал ставку на поиск и обучение, масштабируемые вместе с вычислительными мощностями, в противовес встраиванию готовых человеческих знаний.
🔜 Послушать лекцию на Youtube
@ai_machinelearning_big_data
