Креативность ИИ: почти уровень человека — но что именно измерили?
Мы уже писали о нюансах ИИ в творчестве - авторстве и о проблеме слопа. Здесь много субъективности, но в ИИ любят бенчмарки.
🧪 Недавняя работа AGC-Bench пытается измерить «общую креативность» языковых моделей. Авторы собрали 78 опубликованных наборов задач: придумать необычные идеи, решить нестандартную проблему, предложить научную гипотезу, написать рассказ или метафору, пошутить, создать дизайн. В психологии творческий ответ обычно должен быть одновременно новым и уместным — не случайной странностью, а удачным решением задачи.
Для прямого сопоставления моделей с людьми авторы взяли пять одинаковых заданий, на которых есть ответы 201 человека и 80 LLM. Лучший человек набрал 0,65, лучшая модель — 0,53. То есть в этом небольшом интегральном сравнении лучший человек всё ещё впереди.
Это не означает, что ИИ уже проиграл или победил людям «в творчестве вообще». Здесь нет сравнения с лучшими профессиональными писателями, художниками, инженерами или учёными на реальных работах. И наоборот: открытые задания и уже опубликованные бенчмарки могли попасть в данные обучения новых моделей. Авторы признают риск загрязнения данных, но не проводят полноценный аудит того, какие конкретно задания видела каждая модель.
Ещё труднее вопрос оценки. Для открытой задачи нет одного правильного ответа. AGC-Bench использует три LLM-судьи, статистически калибрует их строгость, а затем обучает отдельную модель-судью на их оценках. Это аккуратнее, чем один судья, но остаётся оценкой моделей моделями. По нашему опыту работы с массовой генерацией, LLM может предложить много вариантов, но отбирать по-настоящему удачный результат всё ещё приходится человеку. Поэтому высокий балл такого бенчмарка скорее говорит о близости к вкусу его судей, чем надёжно измеряет художественную ценность.
Как мы писали, это принципиальное ограничение устройства современных LLM. Они превосходно комбинируют огромный культурный материал и умеют по запросу варьировать стиль, жанр и идею. Но у них нет собственных жизненных задач, опыта и внутренней причины что-либо выразить. Цель, контекст и критерий успеха пока задаёт человек. Агент может сгенерировать тысячу изображений или песен, но без внешнего отбора это чаще поток вариантов, а не самостоятельный творческий жест.
Это ограничение не обязано быть принципиальным для будущего AGI. Система с устойчивыми целями, опытом, памятью, моделями мира и собственным развитием могла бы стать автором в более сильном смысле. Но из нынешних успехов LLM такой вывод ещё не следует.
⛪ В этом контексте интересно недавнее заявление папы Льва XIV: он призвал отличать человеческое искусство от машинного и говорил об «онтологическом», а не только эстетическом различии. С этим можно спорить: происхождение работы не делает её автоматически лучше или хуже. Но его тезис точно указывает на нечто, что AGC-Bench почти не измеряет: искусство — это не только качество артефакта, но и субъект, который через него проявляет себя в мире.
Современный ИИ уже стал мощным творческим инструментом — и иногда замечательным соавтором. Но пока он скорее расширяет человеческое пространство поиска, чем заменяет человеческий источник замысла.
Post #45
32
- 👍 3
- ❤ 1
- 🔥 1
- 🤣 1