Microsoft и York University выпустили любопытную работу про то, как мы измеряем «человечность» LLM.
Модели нельзя называть понимающими, эмпатичными, тревожными или самосознающими без очень аккуратных тестов. Многие исследования фактически закладывают нужный вывод уже в дизайн эксперимента, а потом находят его в ответах модели.
Авторы используют провокационный пример с Age of Empires II. В теории игру можно превратить в вычислительную среду: логические элементы, маленький перцептрон, биты через перемещение юнитов. Если тот же LLM-подобный процесс собрать внутри игры, где условные козы двигаются как биты, будем ли мы говорить, что система «понимает», «чувствует тревогу» или «проявляет эмпатию», если на выходе она выдаёт ту же фразу?
Одна и та же вычислительная логика может выглядеть совершенно по-разному, а наши выводы о «внутренних состояниях» часто зависят от интерфейса и ожиданий наблюдателя.
Авторы говорят осторожнее: прежде чем приписывать моделям человеческие качества, нужно отделять поведение от интерпретации.
Иначе мы рискуем измерять не «понимание» модели, а собственную склонность видеть человека в красивом текстовом интерфейсе.
arxiv.org/abs/2605.31514
Title: “If LLMs Have Human-Like Attributes, Then So Does Age of Empires II”
Post #5337
4.73K

- 👍 7
- 🔥 4
- ❤ 3