Еще одно направление, набирающее актуальность на фоне взлета языковых моделей, – как заставить их пользоваться внешними инструментами и/или внешними данными при генерации. Вот тут я уже писала про LangChainAI (я кстати уверена, что это очень недооцененный пока фреймворк, который должен взлететь), которые позволяют оффлоудить некоторые задачи, которые необходимы для нахождения ответа. Например, языковая модель может сама посмотреть что-то в Википедии, что-то посчитать в питоньем скрипте, можно и стекать эти операции, чтобы получить достаточно сложное поведение агента
Теперь сделали еще и либу GPT Index, которая позволяет модель легко использовать какие-то внешние мультимодальные (!) данные. Можно считать массив текстов и использовать его как долгосрочную память для чатбота. Или сделать из этого базу знаний для QA-системы. Можно распарсить текст с фотографий – вот тут например модель получает инфу с фотографии чека, и может ответить на вопросы по его содержанию (раньше для такого нужна была бы мультимодальная модель типа Flamingo). Можно парсить презентации, pdf, можно парсить Твиттер, Notion и Слэк, можно парсить аудио и видео даже!
По сути можно создать базу данных из чего угодно и оправлять к ней запросы в natural language, плюс, снимаются ограничения, наложенные размером контекстного окна модели. А еще это может помочь модели меньше галлюцинировать факты, раз их нужно не сгенерить, а просто найти
И интеграция с LangChainAI у них тоже есть, чтобы можно было эмулировать сложную последовательность работы с данными
А на хакатоне Scale AI (очень много AI на один пост) недавнем уже набросали поверх GPT Index тулзу, чтобы можно было передавать GPT большие папиры и потом вместе с ней их обсуждать и задавать по ним вопросы (видео собственно с ней)
Post #895
2.16K
- ❤ 13
- 🔥 4
- 👍 1