Как ИИ может работать со знаниями собранными нашим бизнесом.
Решил описать как устроена технология, может быть кто то после понимания, решит применить у себя. Кажется что многим будет полезно знать.
Предположим, мы – владельцы медицинской клиники, у нас много докторов и они много раз ставили какие то диагнозы, прописывали лечение и медикаменты.
Мы хотим сделать плагин, который бы показывал врачу по обезличенным анализам пациента, диагнозы и план лечения от других врачей, и то, какие препараты они рекомендовали. Наш врач сможет посмотреть на это, воспользоваться лучшими из них вкупе со своим опытом, и сделать свою работу еще лучше и быстрее.
Конечно, мы не хотим чтобы врач получал все анализы по этим симптомам и тратил лишнее время на поиск и сортировку, а хотим упростить его работу:
- Врач может вбить описание словами и увидеть максимально отвечающие вопросу диагнозы и планы лечения других докторов.
- В момент, когда врач пишет план лечения, надо чтобы ему показывались релевантные планы других врачей с учетом того, что врач уже написал часть плана.
Как это реализуется (сильно упрощаю, но зато понятно):
- Загнать всю нашу базу текущих анализов в ChatGPT и по каждому из них использовать метод embeddings api - все что метод делает, он берет каждое слово в анализе и классифицирует это слово по 1500 параметрам. (Например слово "окно", стеклянное на 100%, а вкусное на 0%, и т.д.), то есть создаем вектора слов.
- В ответ мы получаем те самые вектора слов. То есть ChatGPT тут никак не обучается на наших данных – он только превратил все слова в вектора.
- Затем эти вектора записываем в нашу отдельную от ChatGPT базу данных, например https://www.pinecone.io/
- Когда врач генерирует какой то запрос, мы снова идем в ChatGPT просим его дать вектор фразы запроса (по точно тем же 1500 параметрам на слово), берем этот цифровой вектор и ищем по нему в нашей базе данных.
Результат: даже если в анализе нет прямых вхождений слов запроса, мы сможем находить подходящие анализы. Например, получить ответ на "покажи мне анализы тех, кто участвовал в айронмэн, у которых болит колено и показатели давления более чем 120 на 80.", хотя в диагнозах и планах лечения ни у кого нет ни слова про айронмэн, но есть другие, типа "марафон", или "пробежав 20 километров пациент почувствовал ...."
Работает это на том, что сравниваться будут не прямые вхождения слов, а их вектора.
Ну и главное — сделать это дешево и быстро. Несколько месяцев работы пары человек, сделать плагин, обезличить данные, поиграться с обучением. Раньше такое бы заняло много человеколет, сотни миллионов рублей, и могло не дать результата.
Post #221
1.42K