Как пролезть в ответы Perplexity AI — и почему модель не жрёт страницу целиком
Автор взял 20 промптов, прогнал их через Perplexity API по три раза — на выходе 60 ответов. Каждую сноску [N] он привязал к странице-источнику, куда она ведёт. Дальше по каждой такой паре рылся в HTML и искал кусок текста, максимально похожий на фразу из ответа. Из 1355 сносок 948 тыкали в страницы, которые ещё открываются, и на 448 из них отыскался пассаж — абзац, пункт списка или ячейка таблицы, — накрывающий хотя бы треть слов из утверждения.
Что это даёт тому, кто пишет страницы: на странице, которая выстрелила, реально задействовано медианно два пассажа из 85, примерно по 49 слов каждый. В штуках это 2%, в словах побольше — медиана 6,4% текста страницы, в среднем 11,6%: сработавший пассаж длиннее типичного. Так что закладываться надо не на «страницу прочитают целиком», а на то, что из неё выдернут один самодостаточный абзац. Что это значит для конкретного текста — подробно разложено в разделе про работу с Perplexity, он стоит посередине, ещё до разбора ошибок в коде. А границы, за которыми эти числа отваливаются, вынесены в отдельный раздел — там же расписано, как проверить то же самое на своей нише.
С чего всё началось: в логе замера видно, какие URL Perplexity суёт в источники, а вот что именно со страницы уехало в ответ — весь текст, абзац или одна строчка из списка — уже не видно.
Читать далее
👉 About Python
Post #3149
281
