TGViewer
Чекпоинт: AGI Чекпоинт: AGI @checkpoint_agi · 57 subscribers
Post #15 55
AGI: экзамен на неизвестное

Модели уже пишут код, переводят, объясняют физику, составляют планы и ведут диалог. Поэтому естественный вопрос: если система умеет столько разного — не это ли и есть общий интеллект?

Действительно, классические определения общего интеллекта устроены примерно так: это способность достигать целей в широком диапазоне сред — или, в более прикладной формулировке, решать широкий круг задач. Сходные определения дают Шейн Легг и Маркус Хаттер, Пей Ванг и Бен Гёрцель.

В этом контексте могут вызвать удивление результаты проверки, о которых 17 сентября сообщила TechCrunch: UNICEF протестировал шесть ведущих LLM на более чем 133 тысячах ответов на вопросы о глобальных показателях развития. Средняя точность оказалась лишь 21,2%. Примерно в трёх ответах из пяти модели вообще не давали пригодного численного значения.

Получается, что широта сама по себе — слабый критерий. LLM предобучены на огромной части доступного текста, кода, задач и их решений. Благодаря этому они умеют переносить закономерности между множеством похожих ситуаций — и часто делают это впечатляюще. Широкий диапазон навыков вполне может возникнуть из очень широкого опыта. Но его не всегда оказывается достаточно.

За словесными определениями в AGI стоят формальные критерии, предполагающие проверку на неограниченном множестве сред. Технически это недостижимо, но суть не столько в широте диапазона как таковой, сколько в том, что все эти среды нельзя заранее перечислить. Точнее было бы сказать: интеллект проявляется при решении новых задач в новых средах. Именно с появлением LLM эта разница — между широтой спектра и новизной решаемых задач — стала особенно наглядной.

На практике важен не единичный успех на незнакомом примере, а способность устойчиво осваивать задачи, для которых нет заранее выученного шаблона. У современных LLM она, безусловно, есть — но заметно менее надёжна, чем работа в знакомом пространстве задач.

Здесь возникает проблема оценки. Если задача, её типичный ход решения или готовый ответ уже попадали в данные обучения, высокий балл измеряет не только способность рассуждать. Это называют загрязнением бенчмарка (benchmark contamination). Например, DeepLearning.AI разбирает исследование, в котором GPT-4 заметно хуже решал задачи Codeforces, опубликованные после предполагаемого среза его обучения.

В классическом машинном обучении прогресс измеряют баллом на фиксированном бенчмарке. Но для AGI окончательного набора экзаменов быть не может: заранее перечисленный класс задач со временем превращается в материал для обучения. Может ли модель сама предложить содержательный тест, которого пока не проходит?

Не случайно Демис Хассабис предлагает регулярно выводить из обращения «насыщенные» бенчмарки и заменять их скрытыми независимыми тестами, к которым у лабораторий нет доступа. Это пока не готовый стандарт, но само предложение показательно.

Главный вопрос об AGI — не сколько задач система уже умеет решать, а способна ли она систематически осваивать те, которых ещё не было в её опыте. Как это измерять — и что должно измениться в архитектуре и обучении, чтобы такой переход стал надёжным, — одна из центральных тем этого канала.
  • 👍 2
  • ❤ 1
More from @checkpoint_agi
  1. Oct 9, 2026Субъективно об ИИ-творчестве Выскажу личное и, возможно, непопулярное мнение о том, возмож…
  2. Oct 8, 2026719 математических ИИ-рукописей — и три отзыва на следующий день 🧮 6 октября OpenAI откры…
  3. Oct 7, 2026ИИ начинает проектировать железо для себя Когда говорят о рекурсивном самоулучшении, обычн…
  4. Oct 6, 2026Креативность ИИ: почти уровень человека — но что именно измерили? Мы уже писали о нюансах…
  5. Oct 5, 2026Инфраструктура цифровых научных агентов Предыдущий пост был о лабораториях, где ИИ замыкае…
  6. Oct 3, 2026Лаборатория как среда обучения Мы привыкли думать, что ИИ обучается на уже собранном челов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →