Прежде чем делиться документом, его полезно сжать, сохранив информацию (скилл здесь, https://t.me/cryptovalerii/999 - если сжимает мало, попросите сделать экстремальное сжатие). Читателю меньше работы, автору приходится разобраться, что он вообще хотел сказать, для модели — компаундный эффект (экономия на каждом прогоне).
С контекстом для LLM похожая история (часто документ и является контекстом), только хуже.
Допустим, вы делаете агента, которому нужны данные из интернета. Проблемы начинаются раньше, чем кажется: нужен программный доступ к поисковой выдаче, а его негде взять. И даже когда доступ есть, найти страницы недостаточно — их нужно скачать, почистить HTML, нарезать на фрагменты, выбрать подходящие и передать модели.
Я уже рассказывал про Yandex Scale — теперь у них появились Smart Snippets в Yandex Search API. Отправляете запрос, получаете релевантные фрагменты найденных страниц с цитатами и ссылками на источники. Поиск и подготовка веб-контекста — одним вызовом API.
Каждый фрагмент — примерно 500 токенов. В контекст идут выбранные части страниц. Итоговый ответ на их основе формирует ваша модель: Smart Snippets подготавливают для неё материал.
По данным Yandex Cloud, это сокращает количество токенов веб-контекста до 3 раз при том же качестве ответа.
Тут полезно правильно посчитать экономику. Если веб-контекст сократился втрое, весь счёт за LLM втрое не уменьшится из за остальной обертки: остаются инструкции, история диалога, генерация ответа. Плюс стоимость самого поиска. Но если агент регулярно ходит в интернет и приносит много текста, оптимизировать эту часть вполне имеет смысл.
Ну и приятная возможность — снять с себя часть работы по обработке веб-контента. Это, к сожалению, не значит, что поддерживать становится нечего: свой код вокруг ответа API остаётся, и отвечать за то, как это работает в проде, всё равно кому-то придётся.
Есть смысл потестировать на своих запросах качество ответов, полную стоимость запроса и задержку. Если качество сохраняется, а стоимость и объём поддержки снижаются — есть вполне понятная причина использовать.
Протестировать можно здесь
Post #1011
9.41K


- 👎 103
- ❤ 14
- 👍 13
- 😴 6
- 🥱 4
- 🔥 3
- 👌 1