Можно ли применить Inference-Time Scaling не только для улучшения LLM - как было с o1 - но и для генерации изображений?
Именно такой вопрос проресёрчили ребята из Гугл, NYU и MIT, и оказалось что ответ: да, можно, и приводит к успеху
Напомню на чём строится идея за этим направлением в общих чертах:
1️⃣ У нас есть проблемы с обучением ИИ, которые решают задачи с 100% точностью end-to-end
2️⃣ Но мы неплохо продвинулись в вопросе верификации ответов
Разница: легко научиться понимать вкусный ли торт, но в разы сложнее научиться его печь с нуля
Поэтому, мы можем, используя всякие метрики: CLIP/DINO/FID/IS, проверять насколько сгенерированное изображение соответствует запросу и выбирать лучшее из всех попыток - Random Search
Или пойти дальше и по пути генерации пикчи - решения ODE/интегрирования - заглядывать немного в будущее и смотреть какие шумы приведут к каким результатам и выбирать лучший путь - Search over Paths
Имхо, очень любопытно. Но можно ли эту мысль перепроецировать на рендеринг? 🤔🤔
#ии #статья
Post #207
763


- 🔥 3
- 👍 2