AGI: экзамен на неизвестное
Модели уже пишут код, переводят, объясняют физику, составляют планы и ведут диалог. Поэтому естественный вопрос: если система умеет столько разного — не это ли и есть общий интеллект?
Действительно, классические определения общего интеллекта устроены примерно так: это способность достигать целей в широком диапазоне сред — или, в более прикладной формулировке, решать широкий круг задач. Сходные определения дают Шейн Легг и Маркус Хаттер, Пей Ванг и Бен Гёрцель.
В этом контексте могут вызвать удивление результаты проверки, о которых 17 сентября сообщила TechCrunch: UNICEF протестировал шесть ведущих LLM на более чем 133 тысячах ответов на вопросы о глобальных показателях развития. Средняя точность оказалась лишь 21,2%. Примерно в трёх ответах из пяти модели вообще не давали пригодного численного значения.
Получается, что широта сама по себе — слабый критерий. LLM предобучены на огромной части доступного текста, кода, задач и их решений. Благодаря этому они умеют переносить закономерности между множеством похожих ситуаций — и часто делают это впечатляюще. Широкий диапазон навыков вполне может возникнуть из очень широкого опыта. Но его не всегда оказывается достаточно.
За словесными определениями в AGI стоят формальные критерии, предполагающие проверку на неограниченном множестве сред. Технически это недостижимо, но суть не столько в широте диапазона как таковой, сколько в том, что все эти среды нельзя заранее перечислить. Точнее было бы сказать: интеллект проявляется при решении новых задач в новых средах. Именно с появлением LLM эта разница — между широтой спектра и новизной решаемых задач — стала особенно наглядной.
На практике важен не единичный успех на незнакомом примере, а способность устойчиво осваивать задачи, для которых нет заранее выученного шаблона. У современных LLM она, безусловно, есть — но заметно менее надёжна, чем работа в знакомом пространстве задач.
Здесь возникает проблема оценки. Если задача, её типичный ход решения или готовый ответ уже попадали в данные обучения, высокий балл измеряет не только способность рассуждать. Это называют загрязнением бенчмарка (benchmark contamination). Например, DeepLearning.AI разбирает исследование, в котором GPT-4 заметно хуже решал задачи Codeforces, опубликованные после предполагаемого среза его обучения.
В классическом машинном обучении прогресс измеряют баллом на фиксированном бенчмарке. Но для AGI окончательного набора экзаменов быть не может: заранее перечисленный класс задач со временем превращается в материал для обучения. Может ли модель сама предложить содержательный тест, которого пока не проходит?
Не случайно Демис Хассабис предлагает регулярно выводить из обращения «насыщенные» бенчмарки и заменять их скрытыми независимыми тестами, к которым у лабораторий нет доступа. Это пока не готовый стандарт, но само предложение показательно.
Главный вопрос об AGI — не сколько задач система уже умеет решать, а способна ли она систематически осваивать те, которых ещё не было в её опыте. Как это измерять — и что должно измениться в архитектуре и обучении, чтобы такой переход стал надёжным, — одна из центральных тем этого канала.
Post #15
55
- 👍 2
- ❤ 1