👑 Интереная статья от Mindbox: как сделать и поддерживать базу знаний для ИИ
Mindbox выкатили статью про то, как сделали свою базу знаний и подружили её с чатом на AI. По итогу закрытие обращений без оператора выросло с 18% до 45% — только за счёт ИИ.
Тут цифры не столько интересны сами по себе. Скорее они тут как показатель того, что ребята продвинулись с помощью своих дейсвий в правильном направлении.
Ну а мы можем уже подчерпнуть все это и для себя.
Поскольку я на работе сейчас занимаюсь ровно такой же задачей, читал с интересом и карандашом. Вот что они нашли и сделали:
1️⃣ Сначала был хаос в контенте. 5000+ сырых диалогов в месяц, дубли, обрывки. Навели структуру: 15 категорий → 120 подкатегорий, три слоя (FAQ-пары, статьи, перекрёстные ссылки). По сути сделали что-то типа графа контента, но структуру забили руками. Интересно — может, графовый движок было бы быстрее сюда занести.
2️⃣ Затащили авто-обновление контента. Сделали так, чтобы база знаний обновлялась сама — иначе пришлось бы нанимать штат редакторов. Цикл: классифицировать диалог → отфильтровать → решить действие (пропустить / добавить / удалить / проверить) → внедрить.
3️⃣ Авто-обновление раздувало статьи до 200+ пунктов частных случаев, и они переставали отвечать на основной вопрос. Вот это то, чего я при проектировании таких циклов боюсь больше всего. А ребята полечили это лимитом объёма. Просто и красиво.
4️⃣ Для обновления базы брали только диалоги, где подключался оператор (= бот не справился). Остальное — шум.
5️⃣ Полную автоматизацию не сделали — оставили валидацию + ежемесячный аудит качества. Это заменило штат из 3-5 редакторов. И это полностью совпадает с моими ощущениями: шаг ручной валидации перед полной автоматизацией обязателен, чтобы ты понял все краевые случаи. Применимо вообще к любой автоматизации — универсальный принцип.
6️⃣ Раскатывали постепенно по линиям поддержки (1-я → 2-я → 3-я).
7️⃣ Техника: RAG / семантический поиск; свою базу знаний отдали наружу по MCP для других внутренних AI-инструментов. Мы собираемся сделать ровно так же. Тут было бы интересно послушать, какие тулы они завели в MCP и как его спроектировали, чтобы он не жрал токены. Но в статье про это не было.
Что отметил для себя:
→ Структура и связность контента важнее модели.
→ Автопополнение без ограничителя объёма убивает качество.
→ Чтобы контент не забивал контекст, удаление должно быть частью жизненного цикла, а не разовой уборкой.
→ Неожиданный инсайт: учиться надо на провалах (диалоги, где не справился бот), а не на всём трафике.
@neuralfordevs
#базазнаний #rag #mcp #агенты #mindbox
Post #23
120