Dan Petrovic провів цікаве дослідження по чанкам контенту
https://dejan.ai/blog/how-big-are-googles-grounding-chunks/
Тут використовується термін "grounding chunks", тому варто пояснити. Граундінг це використання конкретних фрагментів тексту зі сторінок в якості контексту або підстави для відповідей LLM. Моделі не опираються на повний текст, а беруть вибірку з цього тексту (граундінг чанки). Це дозволяє швидко отримати релевантні факти без перегляду всього вмісту.
Так ось, Dan проаналізував 7000+ запитів, за допомогою Vertex AI Grounding API отримав чанки (сніппети) і порівняв з вмістом сторінок. Ось що цікавого вийшло:
- Типова довжина grounding‑фрагмента близько 15,5 слів.
- Кожен запит має фіксований бюджет граундінгу, який становить приблизно 2000 слів.
- Цей бюджет розподіляється між всіма джерелами інформації.
- Найбільш релевантне джерело (топ1) отримує близько 28% загального бюджету, наступні ранги — 23%, 20%, 17% та 13% відповідно. Тобто переможне джерело отримує майже вдвічі більше порцій в порівнянні з п’ятим за релевантністю.
- Збільшення контенту зменьшує охоплення. Сторінки з менш ніж 1K слів зазвичай мають більш високе охоплення (~61%), але зі збільшенням обсягу сторінки охоплення швидко падає (до ~13% для 3K+ слів).
Виходе, що середня та коротша сторінки можуть досягати більшого охоплення grounding, а надмірна довжина дає слабкий приріст або навіть зменшує ефективність. Фокус в контенті має бути на релевантність, а не на довжину.
Висновки можна розглядати як орієнтовний напрямок, тому що все-таки методологія дослідження може бути не ідеальною.
Post #5603
2.59K