⚔️🤖 AnythingLLM: как собрать локальную базу документов для информационно-аналитической работы
AnythingLLM позволяет развернуть на рабочей станции локальную систему поиска и анализа собственных документов с использованием Ollama и других средств запуска БЯМ. Актуальная версия – 1.16.1.
В систему загружаются PDF, текстовые материалы и другие документы. AnythingLLM извлекает содержание, разбивает его на фрагменты, преобразует их при помощи отдельной модели в числовые представления и сохраняет в векторной базе данных.
После запроса БЯМ получает не всю библиотеку, а найденные фрагменты документов. Поэтому такой способ особенно удобен для поиска сведений по большому архиву: технических характеристик, контрактов, организационных изменений, учений, фамилий, дат и связанных документов.
📌 Практическая схема может выглядеть так:
документы – AnythingLLM – эмбеддинг – БД → локальная БЯМ → ответ с использованием найденных материалов.
При этом модель для поиска и модель, формирующая ответ, могут быть разными. AnythingLLM отдельно поддерживает Ollama как источник моделей векторного представления документов.
🔻 Система уже не ограничивается обычным RAG. Агенту можно разрешить поиск по собственной базе, работу с файлами в выбранных каталогах, веб-поиск, обработку сайтов, SQL, создание документов и подключение дополнительных инструментов. Доступ к каталогам задаётся отдельно; по умолчанию агент файловую систему не видит.
То есть можно создать отдельные рабочие пространства, например:
«контракты»;
«учения»;
«руководящие документы»;
«промышленность».
В каждое загружается собственный массив источников, после чего локальной модели можно задавать обычный запрос: «найди упоминания этой программы, сопоставь суммы и даты и укажи документы, где они встречаются».
🔺 Но качество зависит не только от БЯМ. По умолчанию AnythingLLM разбивает текст на фрагменты по 1000 символов, используя один механизм разбиения для всех типов документов. Размер и перекрытие фрагментов необходимо подбирать под собственный архив; после их изменения старые документы требуется индексировать заново.
На больших собраниях в сотни длинных PDF отмечается ещё одно ограничение: обычный векторный поиск может хорошо находить ближайшие фрагменты, но хуже устанавливать связи между удалёнными документами. Поэтому для серьёзной аналитической базы необходимо проверять качество поиска, структуру исходных PDF и настройки разбиения, а не просто загружать тысячи файлов в одно рабочее пространство.
🔵 Практическое значение AnythingLLM – возможность без программирования превратить локальную БЯМ в рабочее средство поиска по собственному архиву документов. При использовании Ollama, локальной модели векторного представления и БД сами документы и их обработка могут оставаться внутри рабочей станции; доступ в интернет требуется только для задач, которым разрешён внешний поиск.
Post #1798
109
