Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информации, но что-то интересное оттуда все же хочется отметить:
Первую половину интервью очень много говорится про генерализацию, и что модели гораздо лучше сейчас себя показывают на бенчмарках, чем действительно способны решать задачи в реальной жизни. Илья это отсутствие генерализации через RL описывает очень удачной метафорой: допустим, есть один студент, который решает стать лучшим в спортивном программировании, он несколько лет решает все существующие задачи, тренируется, выучивает стратегии решений, и в конце действительно становится в этом хорош. Другой студент решает по приколу пройти один курс по спортивному программированию и сразу же становится чемпионом. Если спросить, какой из студентов в дальнейшем будет успешен в карьере (или даже – кто из студентов умнее), скорее всего вы ответите, что второй. Но модели сейчас учат скорее по первому принципу, закидывая в них вообще все существующие задачи в одной области, пока не побьется скор на каком-нибудь бенчмарке
Суцкевер такую разницу между моделями описывает как "it factor" – модель либо умная (и, следовательно, генерализуется), либо не очень. Но потом в интервью подозрительно много времени говорят про value functions, и мне показалось, что ключ к тому, как сделать модели умнее и научить из генерализировать свои навыки, Илья видит в них
Value function по-хорошему должна нам подсказывать, насколько хорошее или адекватное действие мы сейчас пытаемся предпринять в текущей ситуации. Value functions людей скорее всего очень сложные. Здесь Илья приводит пример одного клинического случая, когда из-за поражения мозга у мужчины отключились все эмоции, и одновременно с этим он стал гораздо хуже принимать любые решения: от того, что надеть сегодня, до финансового поведения – хотя эти вещи казалось бы не сильно связанные. При этом, в нормальном состоянии наши value functions работают очень хорошо, люди довольно быстро выучивают, как водить машину или как делить столбиком. То есть в большом количестве новых ситуаций мы достаточно быстро становимся способны угадать, какие действия выигрышные, а какие лучше не совершать
Возвращаясь к примеру со студентами: кажется, что разница между ними в том, что второй умеет учиться, а первый умеет зубрить. Тогда можно ли создать такую value function, которая будет толкать модель выучивать более общие эвристики и глобальные паттерны, а не только ориентироваться в задаче, которую она решает непосредственно сейчас? I.e., научить правильно подходить к решению задач, а не к решению конкретной задачи? Такую всеобъемющую value function, чтобы она могла достаточно хорошо угадывать в большом числе разрозненных доменов, экспраполируя опыт даже из, казалось, не очень связанных областей?
Как сам Суцкевер сказал в интервью, there is nothing deep learning cannot do ✏️ И мне кажется нечто подобное они пытаются сварить, хотя понятно, что о конкретных планах SSI он не может особо распространяться
Post #1075
4.43K