VLM уже умеют искать «интересное». Но пока плохо умеют уходить от того, что уже нашли.
Sakana AI вместе с MIT и NYU проверили, можно ли повторить PicBreeder на агентах с визуально-языковыми моделями.
В оригинальном PicBreeder не было целевой картинки. Люди просто выбирали изображения, которые казались им перспективными, и передавали их дальше. Через много поколений из случайных форм появлялись лица, животные, машины, черепа и другие неожиданные структуры.
Это важная идея из книги Кеннета Стэнли «Иллюзия целей»: сильные открытия часто рождаются не из оптимизации метрики, а из открытого поиска.
В новом эксперименте VLM-агенты работали похожим образом:
- смотрели общий архив изображений
- выбирали то, что считают интересным
- развивали выбранные варианты
- публиковали новые изображения
- оценивали работы других агентов
Им не давали целевую картинку. Не давали функцию прогресса. Не говорили, к чему надо прийти.
VLM-агенты действительно находят визуальные и семантические зацепки. Если добавить агентов с разными «личностями», архив становится заметно шире и по разнообразию приближается к человеческому.
Но главный провал тоже виден: модели слишком быстро фиксируются на найденном мотиве. Вместо резкого смещения в новую область они часто начинают улучшать уже знакомую форму, стиль или смысл.
Человек в PicBreeder может увидеть случайную странность и превратить её в новое направление. VLM чаще видит паттерн и начинает его эксплуатировать.
Похоже, для open-ended discovery мало уметь распознавать novelty. Нужно ещё уметь менять собственный критерий интересного, бросать локально удачную ветку и сохранять слабые сигналы, которые пока не выглядят полезными.
Блог: pub.sakana.ai/picbreeder-vlm
Статья: arxiv.org/abs/2605.23908
Post #5444
5.11K

- 👍 10
- ❤ 7
- 🔥 4
- 🤣 3