Perplexity запустила Search API
* На скриншоте показано качество ответов в сравнении с другими ПС.
Компания Perplexity запустила Search API, который предоставляет доступ к результатам поиска (вместе с текстами, а не только урлами), которые сервис использует для составления ответов на запросы пользователей. Кроме этого, можно искать по своему списку доменов (до 20 штук).
Параллельно они опубликовали статью "Разработка и оценка API поиска на базе ИИ".
Основные тезисы:
- Используется гибридный поиск (лексика + семантика), ранжирование происходит в несколько стадий + обучение на фидбэке юзеров (ПФ).
Лексика: в языке есть слова кошка и кот.
Семантика: они оба означают домашнее животное семейства кошачьих, но различаются по полу.
- Perplexity наблюдали бифуркацию (это точка, где порядок может перейти либо в хаос, либо в новый, более сложный порядок) экосистемы ИИ между лексическим и семантическим поиском, причем появились системы, переоптимизированные для одной модальности по сравнению с другой.
- Понимание контекста требует, чтобы система не только фиксировала релевантность на уровне документа, но и рассматривал отдельные разделы и группы документов как самостоятельные единицы. "Мы извлекаем и оцениваем результаты как на уровне документа, так и на уровне поддокументов."
- Разбивают документ на поддокументы, чтобы БД не засорялась мусором. Это решает ключевую проблему RAG, когда от слишком большого контекса модель тупеет.
- Используют ML, чтобы предсказывать что и когда индексировать. Это делается, чтобы поддерживать индекс, отвечающий требованиям как по полноте, так и по актуальности. Нельзя часто индексировать все, нужен ML, чтобы решать: «обновить старое» или «поймать новое».
- Полнота против качества. Жесткая фильтрация дает чистоту, но теряет важные куски, мягкая фильтрация дает больше, но с шумом.
- Модель машинного обучения предсказывает, нужно ли индексировать тот или иной URL.
- Используется динамический парсинг, разные правила под разные сайты.
- Поисковый индекс - эксабайтный (33 млн. фильмов в 4К формате). Более 400 петабайт в «горячем» (13 млн. фильмов в 4К формате) хранилище, а остальное — в «холодных» и «теплых» уровнях.
- Используются как обученные модели, так и настроенные эвристики для определения того, какие документы следует сохранять «горячими», отдавая приоритет документам из авторитетных доменов, документам, затрагивающим малоизученные темы.
- Ручная оптимизация качества возможна, но полученные правила анализа могут не охватить критически важный контент. "Мы могли бы вручную прописать правила, применяющие минимальную фильтрацию к исходному контенту, что может повысить полноту, но в ущерб качеству. Каждый элемент контекста ценен.".
- Для веб-сайта, насыщенного хорошо структурированными данными в виде списков или таблиц, могут быть полезны более шаблонные правила анализа и извлечения, в то время как для другого веб-сайта, преимущественно содержащего контент свободной формы, создаваемый пользователями, может потребоваться более свободный набор правил.
- Для проведения оценок использовали четыре бенчмарка: SimpleQA и FRAMES для одношагового поиска, а также BrowseComp и HLE для глубоких исследований. В совокупности эти бенчмарки предоставляют общепринятые критерии для агентов знаний.
#geo
Post #36
233
