🎨 На фоне крестового похода папы римского в защиту «истинного творчества» художников и музыкантов против ИИ, вероятно, стоит посмотреть самые свежие бенчмарки по творчеству для ИИ. Как я уже писал, первыми попытками были DAT (Divergent Association Task) и AUT (Alternate Uses Task). Они показали, что ИИ имеет креативность выше средних людей, но проигрывает примерно Top 10%, однако вопрос в том, что это были замеры только отдельных творческих способностей и на устаревших моделях.
Из последних тестов на творчество ИИ самый свежий и продвинутый — AGC-Bench. Однако исследователи также не успевают за бурным развитием ИИ: пока они делают замеры, уже вендоры LLM убегают далеко вперёд. Однако по AGC-Bench хорошо видно, что общие показатели креативности моделей растут от числа весов, т.е. креативность крупных моделей типа Claude Fable, ChatGPT Astra и Kimi K3 определённо значительно выше, чем в бенчмарке. Однако любопытный факт: важно, если вы сравниваете разные ИИ между собой, в случае человека с ним может успешно конкурировать в творчестве часто и модель на 8B параметров. Также важное наблюдение: дисперсия (разброс) творческих способностей моделей от размера весьма велика, поэтому часто небольшие модели очень креативные.
Дело в том, что AGC-Bench показал, что ИИ обладает подавляющим преимуществом над человеком в «кросс-доменном творчестве», т.е. когда для креативности нужно соединять творческие навыки из разных доменов знаний. Люди обычно креативны «монодоменно», поэтому если тест широкий, они могут провалиться против модели даже на 8B параметров, которая заточена не только на креативное письмо, но, несмотря на маленький размер, сохраняет некоторую способность к «широте творчества между доменами».
Если сравнивать ИИ, то лидерами по творчеству являются модели Anthropic, на втором месте — модели OpenAI и Z.Ai.
Однако если вы начнёте соревнование с людьми, то тест исследователей показал, что из 201 человека только 2 (1%) смогли выбить результат выше ИИ, т.к. третьим финишировал Kimi K2. Однако куда более тревожно для людей, что в Top 10 лучших попал mistralai/ministral-8b. Это показывает, что у людей из-за «монодоменности» есть большие «дыры творчества», поэтому даже модель, которую можно запускать на домашнем GPU, более творческая, чем 95% людей. На деле это не парадокс для тех, кто работает с генерацией тех же рассказов с ИИ, т.к. небольшие модели, ещё обученные на тематику, давно показывают впечатляющие результаты; скорее новое — что малая модель всё равно сохраняет в той или иной степени эффект «кросс-доменного творчества».
📌 Если как мораль, то в соревновании с ИИ важно затачивать как нож свои творческие способности в узком домене. При этом подключать ИИ в творческий процесс, когда требуется уже кросс-доменное творческое произведение, т.к. ИИ даже годичной давности тут уже мощнее людей.
https://arxiv.org/abs/2607.01152v2
Post #5277
2.9K

- 👍 11
- ✍ 10
- ❤ 3
- 🤯 3
- ⚡ 1