TGViewer
Настоящий JavaScript Настоящий JavaScript @true_js · 5.91K subscribers
Post #3930 145
LLMCOD теперь тащит базу знаний не только из HTML, но и из SPA с открытыми API

Задача «собрать базу знаний из сайта» на вид плевая: спарсить HTML, выдрать текст, порезать на куски, посчитать embeddings и скормить это RAG. На нынешних сайтах такая схема всё чаще идёт лесом. Причина простая: в исходной разметке данных может почти не быть. Юзер открывает страницу, подтягивается JavaScript, тот дёргает API — и только API отдаёт услуги, товары, объекты, статьи, цены и прочее.

Ровно на эти грабли наступили, когда пилили новую фичу в LLMCOD. Теперь система умеет не только обычные страницы, но и SPA с доступными открытыми API. В статье — как это провернули, на что напоролись по пути и почему одного vector search для такой таски оказалось мало.

Читать далее

👉 JS
More from @true_js
  1. Sep 26, 2026Next.js без Vercel: держим один VPS, переключаемся без даунтайма и откатываемся за пару се…
  2. Sep 26, 2026Как мы латаем обрезанные ответы LLM и почему склейка вышла сложнее, чем кажется У нас серв…
  3. Sep 25, 2026Морские карты S-57 прямо в браузере: открытый парсер на TypeScript — без GDAL и без SDK за…
  4. Sep 25, 202612 CSS-штук, после которых часть ваших зависимостей можно смело провожать на пенсию Fronte…
  5. Sep 25, 2026Post #3927
  6. Sep 24, 2026Саппорт-агент на LLM, которому не дадут забыть про заказ Первый заход вышел так себе: в ка…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →