Маленькая модель сжала контекст RAG в 10 раз 👀
AWS проверила схему, где после поиска дешёвая модель оставляет в документах только дословные фрагменты, связанные с вопросом. Уже очищенный контекст получает основная LLM.
На тесте из 500 вопросов по базе с 500 000+ документов сочетание переранжирования и сжатия дало:
🔘 на 90% меньше входных токенов основной модели;
🔘 на 36% ниже общую стоимость;
🔘 97,6% исходного качества;
🔘 снижение доли ответов с неподтверждёнными утверждениями с 51% до 38%.
Цена оптимизации — рост задержки на 12%. Для тебя это рабочий шаблон, если поиск настроен на высокий охват и обычно возвращает больше контекста, чем нужно. Важно извлекать дословные фрагменты с идентификаторами источников, а не пересказывать их маленькой моделью.
Результаты получены на одном наборе данных, поэтому перед продом нужен собственный сравнительный тест.
Пруф: технический разбор AWS от 21 августа 2026 года
#rag #llm #contextengineering #inference #llmops #aws
@data_engi
Post #1272
127