зробив
аб тест базового веб пошуку клоду (`webSearch`) з сервісом агентського пошуку `exa.ai`.
результат (спойлер):
exa значно перемагає. зрозуміло чому підняли 250 лямів недавно
деталі результату під дизайном.дизайн аб тесту:- 20 запитів на 4 рівнях складності, (від «коли україна здобула незалежність» до технічних доків по
API.)
- потім запустив команду агентів для перевірки результатів:
-- 10 агентів верифікували результати: кожен відкрив посилання руками, звірив цитату з оригіналом, перевірив чи факт справді у джерелі.
-- ще 8 оцінили якість всліпу. вони не знали де exa а де
webSearch. результати анонімізовані і перемішані.
- кожен ставив бал від 0 до 5 за п'ятьма вимірами: доречність, глибина, конкретика, свіжість, авторитет джерела.
п'ять вимірів × п'ять балів × двоє оцінювачів усереднено дають 25.
на одному спірному запиті додав третього арбітра.
результат: швидкість 287 мс проти 7807 мс.
галюцинації 3 проти 8.
якість 23.7/25 проти 16.8/25 з 25.
exa у 27 разів швидший та виграв усі 20 запитів.
ще цікава поведінка їх, коли ламаються:exa ламається видимо. на запиті про незалежність вона повернула посилання на сторінку верховної ради, яка віддає 404. на технічному запиті вона повернула опис репозиторію, який автор переписав 11 днів тому, а індекс exa тримає стару версію. дата кешу видна, агент розуміє що індекс старий, бачить помилку і рухається далі.
`webSearch` вигадує. цитата експерта, якого ніхто не казав. ціна продукту, якої нема в джерелі. порівняння двох моделей навиворіт. і все це гладким текстом, впевненим тоном, з посиланнями знизу, які нібито підтверджують. оце і є небезпечна хуйня. коли інструмент тихо бреше гарною прозою, і якби агенти не звіряли руками, ніхто б не помітив.
я вже перевів свій клод код на exa. сижу тиждень і дуже радіювистачає безкоштовної версії, але якщо треба буде заплатити 10 баксів, я не проти
Claude Code Україна