Sakana AI релизнули модель для генерации моделей
Она называется Text-to-LoRA. LoRA – это метод файнтюнинга, когда мы вместо полного дообучения всей сети настраиваем для нужных нам задач специальные низкоранговые адаптеры.
Это довольно эффективный метод, но и он требует сбора данных и какого-никакого обучения.
Sakana же предлагают модель, которая на лету генерирует сразу готовые LoRA адаптеры из обычного текстового промпта. Например, на вход: «хочу модель для анализа отзывов в картах». На выход: готовые веса адаптера, которые не надо обучать, а остается только запустить.
Под капотом у T2L лежит классический hypernetwork-подход. Гиперсеть получает на вход эмбеддинг описания задачи вместе с эмбеддингами для каждого слоя исходной модели, а потом через серию MLP-блоков генерирует нужные низкоранговые матрицы A и B, которые сразу прикладываются к базовым весам. Это и есть готовый LoRA-адаптер.
На тестах это работает хорошо: в среднем +8 % к точности над исходником. Это примерно на уровне или даже лучше, чем ручные LoRA и мульти-задачные LoRA.
Представьте, насколько это снижает порог входа в тюнинг моделей для не-инженеров
Статья | GitHub
Post #7122
25.5K



- 🤯 188
- 👍 60
- ❤ 38
- 🔥 4
- ⚡ 2
- 🤔 1
- 🤝 1
- 😎 1