Как построить базу знаний, которой пользуются и люди, и агенты
Команда Cerebras разобрала, как они собрали внутреннюю базу знаний – она обновляется автоматически и одинаково доступна и сотрудникам, и AI-агентам. Мне кейс нравится тем, что показывает, куда движется KM: база знаний перестает быть отдельным местом и становится общим слоем поиска поверх всего, где знания уже копятся.
Вот что зацепило.
Знания живут не в базе, а в источниках
БЗ строится поверх Slack, кодовой базы, документов, Jira, Confluence и еще кучи систем. То есть не «давайте перенесем все в одно место», а «давайте искать там, где оно уже есть».
Slack – золото и мусор одновременно
Самое ценное лежит в тредах: в глубине переписки принимается куча решений. Но вытащить это тяжело, потому что рядом столько же «sounds good, thanks!». Сработала комбинация: полнотекстовый поиск, эмбеддинги, реранкинг по редким токенам (обсуждение вокруг редкого флага конфига должно всплывать, а вежливое «спасибо» – нет) и механизм устаревания фактов: тред полугодовой давности про инфраструктуру, которой уже нет, проигрывает свежему.
Код индексируется инкрементально
Для поиска по коду взяли опенсорсный фреймворк CocoIndex – он пересчитывает индекс не целиком, а на каждый коммит.
Плагины под каждую команду
Если у команды свой источник или база, ее можно подключить через плагин – маленький Python-модуль, который отдает данные в общем формате. Команда сама открывает PR, без переноса данных.
who_knows: ищем не только знание, но и носителя
Отдельный тул сразу выдает имена людей, релевантных запросу. Хорошее напоминание, что часть знаний – это не документы, а люди. Плюс результаты агрегируются по проектам, чтобы поиск был точнее.
Как это выглядит у нас
Мы в компании пошли другим путем и используем внешнее решение, но принцип тот же: к нему подключены многие корпоративные источники, и мы работаем над тем, чтобы проиндексировать вообще все. Сверху есть MCP – то есть наши командные и персональные агенты имеют доступ к проиндексированному из тикет-трекера, Miro, Slack, GitHub и так далее. По сути та же идея, что у Cerebras: единый слой поиска, в который одинаково ходят и люди, и агенты.
И снова видно главное: AI не отменяет качественную инфраструктуру знаний, а целиком на нее опирается. Хорошо проиндексированные источники – это теперь не только про удобный поиск для людей, но и про то, будет ли вашим агентам на что опереться.
А вы уже смотрите на свою базу знаний как на источник не только для людей, но и для агентов?
Post #441
796
- 🔥 6
- 👍 3