LLMCOD теперь тащит базу знаний не только из HTML, но и из SPA с открытыми API
Задача «собрать базу знаний из сайта» на вид плевая: спарсить HTML, выдрать текст, порезать на куски, посчитать embeddings и скормить это RAG. На нынешних сайтах такая схема всё чаще идёт лесом. Причина простая: в исходной разметке данных может почти не быть. Юзер открывает страницу, подтягивается JavaScript, тот дёргает API — и только API отдаёт услуги, товары, объекты, статьи, цены и прочее.
Ровно на эти грабли наступили, когда пилили новую фичу в LLMCOD. Теперь система умеет не только обычные страницы, но и SPA с доступными открытыми API. В статье — как это провернули, на что напоролись по пути и почему одного vector search для такой таски оказалось мало.
Читать далее
👉 JS
Post #3930
145
