TGViewer
Время Валеры Время Валеры @cryptovalerii · 32K subscribers
Post #1011 9.41K
Прежде чем делиться документом, его полезно сжать, сохранив информацию (скилл здесь, https://t.me/cryptovalerii/999 - если сжимает мало, попросите сделать экстремальное сжатие). Читателю меньше работы, автору приходится разобраться, что он вообще хотел сказать, для модели — компаундный эффект (экономия на каждом прогоне).

С контекстом для LLM похожая история (часто документ и является контекстом), только хуже.

Допустим, вы делаете агента, которому нужны данные из интернета. Проблемы начинаются раньше, чем кажется: нужен программный доступ к поисковой выдаче, а его негде взять. И даже когда доступ есть, найти страницы недостаточно — их нужно скачать, почистить HTML, нарезать на фрагменты, выбрать подходящие и передать модели.

Я уже рассказывал про Yandex Scale — теперь у них появились Smart Snippets в Yandex Search API. Отправляете запрос, получаете релевантные фрагменты найденных страниц с цитатами и ссылками на источники. Поиск и подготовка веб-контекста — одним вызовом API.

Каждый фрагмент — примерно 500 токенов. В контекст идут выбранные части страниц. Итоговый ответ на их основе формирует ваша модель: Smart Snippets подготавливают для неё материал.

По данным Yandex Cloud, это сокращает количество токенов веб-контекста до 3 раз при том же качестве ответа.

Тут полезно правильно посчитать экономику. Если веб-контекст сократился втрое, весь счёт за LLM втрое не уменьшится из за остальной обертки: остаются инструкции, история диалога, генерация ответа. Плюс стоимость самого поиска. Но если агент регулярно ходит в интернет и приносит много текста, оптимизировать эту часть вполне имеет смысл.

Ну и приятная возможность — снять с себя часть работы по обработке веб-контента. Это, к сожалению, не значит, что поддерживать становится нечего: свой код вокруг ответа API остаётся, и отвечать за то, как это работает в проде, всё равно кому-то придётся.

Есть смысл потестировать на своих запросах качество ответов, полную стоимость запроса и задержку. Если качество сохраняется, а стоимость и объём поддержки снижаются — есть вполне понятная причина использовать.

Протестировать можно здесь
  • 👎 103
  • ❤ 14
  • 👍 13
  • 😴 6
  • 🥱 4
  • 🔥 3
  • 👌 1
More from @cryptovalerii
  1. Oct 8, 2026Вчера общался со старшим директором по Data Science в одной компании в Штатах. Оказалось,…
  2. Oct 5, 2026Нет совета директоров? Одолжим на вечер: в четверг шесть экспертов разберут ваш AI-проект…
  3. Oct 11, 2026Live stream scheduled for Oct 11 at 18:00
  4. Oct 2, 2026В воскресенье, 11 октября в 19 по Лондону (21 по мск), проведём стрим с моим другом и буду…
  5. Sep 30, 2026AI-проекты с нуля: как выбрать нишу, собрать продукт и выйти на первую выручку Собрать AI-…
  6. Sep 30, 2026Не перестаю радоваться и удивляться тому, что студенты всегда остаются студентами. Вот и в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →