В этом канале делюсь различными рекомендациями и контентом, который считаю полезным или интересным. Как правило, контент связан с программированием в геологии.
Чат по программированию и ML: https://t.me/GeoMLearning
Post #191
202
Scispace\perplexity на коленке
С чего на самом деле начиналась история ИИ - ассистента?
На самом деле - первоначальная задумка - создать непосредственно помощника исследователя, аналогичного перечисленным в заголовке.
Как они работают?
Как правило - это некоторая большая языковая модель или ряд отдельных БЯМ вокруг которых есть разные инструменты - это всё объединяется в харнес-систему (harness - упряж), где множество агентов одновременно выполняют различные задачи.
Главная модель (как правило - самая большая) - является оркестратором, которая знает сильно больше других, и ряд маленьких - у них в контексте четкая задача и небольшой набор инструментов для них.
Например, вы отправляете запрос "Создай подборку статей про рудоносность золото‑сульфидных месторождений Восточной Сибири за последние 5 лет".
Оркестратор раскидывает задачу:
— один агент генерирует ряд запросов для поиска, вытаскивает DOI / аннотации, научные метаданные;
— второй шерстит открытые источники — eLibrary, КиберЛенинку, сайты институтов;
— третий собирает всё в единую таблицу: title, authors, year, url, relevance_score.
Дальше эта информация может разными способами векторизоваться\индексироваться и собираться в базу, с которой может работать другой агент.
Технический стек
Сама обвязка может состоять из разного, для конкретно нашей цели - нужен минимум RAG (Retrieval-Augmented Generation, генерация с поиском по базе) и, собственно, источники информации, которые должны базу заполнять, ну и технологический стек, основанный на российских технологиях, чтобы голова не болела.
С точки зрения индексации баз по науке существует несколько систем научного цитирования, colab.ws и РЦНИ. У того и у другого есть апи и вроде бы как оба доступны.
Ребятам из колаба можно написать в чат - быстро ответят и решат все вопросы, со вторыми сколько не пытался связаться, к сожалению, так и не получил ответа, при этом что отправлял несколько запросов с разных адресов.
Кроме научных баз - полезно собирать данные и статьи из интернета - для этого используется апи яндекса, оно доступное и достаточно бюджетное.
Ну и сама языковая модель - гигачат, на мой вкус - он отвечает лучше других с точки зрения русского языка и у них сразу есть модель для эмбедингов.
Результаты
В целом, система получилась более менее рабочей, но пока что сильно требовательно по ресурсам с точки зрения запросов - в тот же самый колаб может улетать до 100 запросов на поиск разной литературы. Также далеко не всегда можно скачать PDF, что усложняет создание базы для RAG и пока что требует частого вмешательства, ну и написание статей у меня пока не в приоритете, поэтому это больше остается экспериментом и интересным опытом.
Ну а что в приоритете - это вторая версия системы автоматического описания керна, про которую, наконец, скоро смогу рассказать много подробностей :)
@geologistprogrammer | VK | max
С чего на самом деле начиналась история ИИ - ассистента?
На самом деле - первоначальная задумка - создать непосредственно помощника исследователя, аналогичного перечисленным в заголовке.
Как они работают?
Как правило - это некоторая большая языковая модель или ряд отдельных БЯМ вокруг которых есть разные инструменты - это всё объединяется в харнес-систему (harness - упряж), где множество агентов одновременно выполняют различные задачи.
Главная модель (как правило - самая большая) - является оркестратором, которая знает сильно больше других, и ряд маленьких - у них в контексте четкая задача и небольшой набор инструментов для них.
Например, вы отправляете запрос "Создай подборку статей про рудоносность золото‑сульфидных месторождений Восточной Сибири за последние 5 лет".
Оркестратор раскидывает задачу:
— один агент генерирует ряд запросов для поиска, вытаскивает DOI / аннотации, научные метаданные;
— второй шерстит открытые источники — eLibrary, КиберЛенинку, сайты институтов;
— третий собирает всё в единую таблицу: title, authors, year, url, relevance_score.
Дальше эта информация может разными способами векторизоваться\индексироваться и собираться в базу, с которой может работать другой агент.
Технический стек
Сама обвязка может состоять из разного, для конкретно нашей цели - нужен минимум RAG (Retrieval-Augmented Generation, генерация с поиском по базе) и, собственно, источники информации, которые должны базу заполнять, ну и технологический стек, основанный на российских технологиях, чтобы голова не болела.
С точки зрения индексации баз по науке существует несколько систем научного цитирования, colab.ws и РЦНИ. У того и у другого есть апи и вроде бы как оба доступны.
Ребятам из колаба можно написать в чат - быстро ответят и решат все вопросы, со вторыми сколько не пытался связаться, к сожалению, так и не получил ответа, при этом что отправлял несколько запросов с разных адресов.
Кроме научных баз - полезно собирать данные и статьи из интернета - для этого используется апи яндекса, оно доступное и достаточно бюджетное.
Ну и сама языковая модель - гигачат, на мой вкус - он отвечает лучше других с точки зрения русского языка и у них сразу есть модель для эмбедингов.
Результаты
В целом, система получилась более менее рабочей, но пока что сильно требовательно по ресурсам с точки зрения запросов - в тот же самый колаб может улетать до 100 запросов на поиск разной литературы. Также далеко не всегда можно скачать PDF, что усложняет создание базы для RAG и пока что требует частого вмешательства, ну и написание статей у меня пока не в приоритете, поэтому это больше остается экспериментом и интересным опытом.
Ну а что в приоритете - это вторая версия системы автоматического описания керна, про которую, наконец, скоро смогу рассказать много подробностей :)
@geologistprogrammer | VK | max
- 👍 6
- ❤ 1
- 🔥 1








