Команда Cerebras рассказала, как они построили свою автоматически обновляемую внутреннюю базу знаний, которую одновременно используют и люди, и агенты. Вот интересное:
👉База знаний строится поверх всех источников, в которых уже накапливается ценная информация – Slack, кодовая база, документы, Jira, Confluence и куча чего еще.
👉Самые полезные сведения лежат в Slack, так как в глубине тредов принимается куча важных решений. Вытаскивать ее оттуда тоже очень сложно, потому что мусорных обсуждений тоже много. В итоге сработала комбинация из полнотекстового поиска, эмбеддингов, механизма устаревания фактов, реранкинга более редких токенов.
👉Для поиска по коду используется опенсорсный фреймворк CocoIndex, который умеет пересчитывать индекс для каждого коммита инкрементально.
👉В базе знаний есть механизм плагинов, чтобы каждая команда могла добавить свой кастомный источник.
👉Помимо непосредсвенно поиска информации, сделали отдельный тул
who_knows, который сразу выдает имена людей, релевантных поисковому запросу.👉Информация агрегируется по проектам, чтобы сделать результаты поиска более релевантными.