💡 Мысль дня: Устаревание контента и забывание – ключевой процесс для корпоративной Базы знаний
Пообщались с Сергеем Долговым автором канала @aivkube. Ребята помогают доводить AI до продакшена в крупных компаниях.
Поспрашивал его о том, что будет важно учесть когда мы будем делать свою базу знаний для AI агентов. А планируем начать делать уже в этом месяце.
Оказалось, что ключевая идея которая поднимает качество ответа не в том, что ты используешь модные технологии – графовые подходы и прочие штуки, а грамотно убираться в устаревшем контенте.
Ключевые механизмы такой уборки:
1️⃣ Статус на каждой записи — Actual / Deprecated / Hypothesis / Cancelled. Чтобы ИИшка могла фильтровать по таким статусам и не тянуть лишнего. Ну и разумеется поле UpdateDate чтобы потенциально устаревшие записи можно было помечать ворнингами. Но важно, что именно статус закрывает проблему «модель уверенно цитирует устаревшее с номером пункта». Статус важнее даты (старое решение может быть всё ещё в силе).
2️⃣ Атомарные самодостаточные статьи — Каждая запись должна нести свой контекст внутри (продукт, дата, версия), без «см. выше» и неявных отсылок — вектор такие связи рвёт. Это правило ведения контента, внедряется сразу, без кода.
3️⃣ Набор заведомо конфликтных запросов как тест — Для тестирования ИИ пайплайнов можно собрать 10–20 запросов, где есть противоречащие документы, и регулярно проверять: система берёт верный источник или честно говорит «тут конфликт», а не отвечает уверенно по случайному. Такое тестирование дёшево, ловит регрессии. При смене модели к примеру.
Есть еще много оптимизационных техник, но они должны ложиться на крепкую основу. И вот про пометки и метадату контента в целом это довольно неплохой для меня инсайт оказался.
Post #24
104
- 🔥 3
- 🌚 1
- 👾 1