TGViewer
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение @dsproglib · 18.3K subscribers
Post #7648 1.28K
🤔 Почему поиск понимает, что один документ релевантнее другого?

Например, запрос:


python machine learning


Почему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже?

🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов.

Он учитывает:

TF — насколько часто термин встречается в документе;

IDF — насколько термин редкий во всей коллекции;

длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.


Упрощённо:


score =
TF × IDF × поправка на длину документа


💡 BM25 — не нейросеть и не semantic search. Он работает с совпадением терминов, поэтому отлично подходит как базовый слой поиска и часто используется вместе с векторным поиском в hybrid search.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 5
  • ❤ 2
  • 🔥 2
More from @dsproglib
  1. Sep 20, 2026Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Sc…
  2. Sep 19, 2026🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube,…
  3. Sep 18, 2026А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tp…
  4. Sep 18, 2026📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
  5. Sep 17, 2026🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробова…
  6. Sep 15, 2026🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →