[3/8] Context Ranking: как отобрать реально полезные куски из репозитория
Дальше по плану — как автодополнение вообще наскребает контекст для LLM. В живом репозитории потенциально полезного добра вагон и тележка, поэтому тупо искать куски с похожими словами — мимо. Надо еще выкупить, какие из них реально стоит показать модели.
Разбираем классику ранжирования — BM25: почему редкие идентификаторы ценнее популярных слов, зачем учитывать размер файла и почему десять одинаковых совпадений не должны быть в десять раз полезнее одного.
Читать заметку
👉 Data Science | Machinelearning [ru]
Post #5836
1.76K

- 👍 1