Агент сходил в интернет, забрал три страницы и выдал ответ в одну строчку. Текст одной страницы – около 2500 токенов, и это уже после чистки от меню и футеров. Итого вы заплатили за 8 тысяч токенов там, где по делу было сто
Обойти это своими силами тяжело, и упирается все раньше, чем кажется: нужен программный доступ к поисковой выдаче, а его обычно просто нет – не то что к релевантным фрагментам, даже к полным страницам. А когда доступ появляется, начинается своя работа: скачать страницы, почистить HTML, нарезать, отранжировать и выбрать то, что реально отвечает на вопрос
Yandex Cloud закрыл это одним вызовом: в Search API появились Smart Snippets. На входе запрос, на выходе по каждой найденной странице отобранные под этот запрос фрагменты с цитатами и ссылкой на источник. Их сразу можно отдавать в LLM
Что меняется:
• До 3 раз меньше токенов на веб-контексте при том же качестве ответа
• Поиск и подготовка контекста – один вызов API
• Поиск кастомизируется как обычный Search API: регион, свежесть, ограничение по сайтам
Не путайте с генеративным ответом. Smart Snippets ничего не сочиняют – отдают дословные фрагменты страниц, а итоговый ответ собирает ваша модель. Внутри при этом те же поисковые технологии, что готовят контекст для генеративного ответа в Поиске Яндекса
Кому ощутимее всего – тем, кто платит за инференс на объеме: корпоративные ассистенты, research-инструменты, внутренние AI-платформы. Веб-контекст там обычно самая тяжелая часть промпта
🔗 Протестировать на своих запросах можно по этой ссылке – оставляете заявку, эксперт Yandex Cloud связывается и показывает, как это работает

