Ключевые моменты из документа о поисковых технологиях Google (2)
Другие сигналы
- eDeepRank: Система на основе больших языковых моделей (LLM), использующая BERT и трансформеры. Ее цель – разложить сигналы на компоненты для повышения их прозрачности.
- PageRank: Сигнал, отражающий расстояние от известного качественного источника и используемый как входной параметр для оценки качества (Q*).
Поисковый индекс
По определению HJ Kim, поисковый индекс состоит из фактического просканированного контента – заголовков и основного текста документов (инвертированный индекс). Существуют также отдельные специализированные инвертированные индексы для других типов контента (например, из Twitter, Macy's), которые хранятся отдельно от индекса для органических результатов. Сигналы, зависящие от запроса, не хранятся в индексе, а вычисляются в момент выполнения запроса. Однако для удобства некоторые сигналы, включая Q* (который в основном статичен, но иногда зависит от запроса), хранятся непосредственно в поисковом индексе.
Данные со стороны пользователя
Под данными со стороны пользователя (User-Side Data) инженеры Google понимают данные о взаимодействии пользователя с системой, а не контент, созданный пользователями (например, ссылки между страницами).
Поисковые функции и их ранжирование
Различные элементы поисковой выдачи, такие как "10 синих ссылок" и другие вертикали (например, панели знаний), имеют собственные системы ранжирования. Проект Tangram (ранее Tetris) был создан для применения основных принципов поиска ко всем этим элементам. Алгоритмы Tangram/Tetris, как и другие, было сложно разработать, но их можно было бы легко реконструировать при наличии данных о кликах и запросах. Knowledge Graph (Граф знаний) используется не только для отображения в панелях на странице результатов поиска, но и для улучшения традиционного поиска, предоставляя ему информацию о связях между объектами (например, в запросе о росте жены Барака Обамы).
Риски обратной разработки (Reverse Engineering)
В документе выражается обеспокоенность тем, что утечка документов Google, раскрывающих некоторые компоненты системы ранжирования, в сочетании с данными о работе системы, может позволить конкурентам реконструировать принципы работы, включая кривые и пороговые значения, без необходимости проводить собственные дорогостоящие исследования.
Post #173
3.88K