Индекс строит 9B, запрос кодирует 0.6B
Perplexity выложили pplx-embed-v2-late: две ColBERT-модели, 0.6B и 9B. Каждый токен кодируется вектором на 128 чисел.
Самое интересное не размер, а общее пространство. Документы можно один раз проиндексировать тяжелой 9B, а запросы кодировать маленькой. Цена запроса не меняется, потому что документы все равно в оффлайне считать.
На текстовых доменных задачах такая схема дает +1.6 пункта, это примерно половина разрыва между моделями. При этом на текст у 0.6B работает около 240M активных параметров, остальное эмбеддинги токенов и визуальная часть.
Техрепорт обещают позже. Как мы знаем минус ColBERT подхода, что индекс растет с длиной документа. Что они делают с этим, пока не сообщается.
Веса · блог
Post #8
80