Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
📄 Статья
Нередко интересующую задачу можно разбить между несколькими LLM-ками, делегировав более простые куски бюджетным моделям, а сложные — самым топовым и дорогим.
Коммуникацию можно построить через текст, однако внутренние представления, в частности KV-кэш, могут содержать гораздо больше полезной информации.
В работе Cache-2-Cache рассматривается следующая постановка:
1. 🔹 Source- и target-модели делают префилл.
2. 🔹 Обучаемый fuser-модуль выдаёт добавку к target-модели, которая в некотором смысле передаёт знания из source-модели.
Практически интересны два сценария:
- 🧠 Делаем префилл большой моделью и достаточно длинную генерацию маленькой моделью. Надеемся, что мощный префилл зарешает.
- ⚡ Делаем большой префилл маленькой моделью и короткую генерацию большой моделью. Авось большая модель переварит выдачу малой модели и выдаст точный ответ.
Однако в исходной статье префилл, по-любому, приходится делать двумя моделями, и обучение fuser может быть недешёвым.
Ребята из NVIDIA предложили обучать проектор, в большинстве случаев линейный, из одной модели в другую, подобрав для target-модели наиболее полезные слои из source-модели, — и оно более-менее завелось.
Post #807
1.34K
- 👍 6
- ❤ 5