📚Сказ о том, как мы с Саньком OpenAI в наш таск-трекер пытались интегрировать.
В прошлый четверг с прекрасным @sagos95 сделали доклад на девфоруме про то, как мы попытались прикрутить LLMку к поиску по нашему корпоративному таск-трекеру Kaiten.
Саму попытку совершали в октябре прошлого года, так что какие-то вещи уже устарели (к примеру дипсика тогда не было), но на суть доклада это не влияет.
🎞 Смотреть можно туть
Коротко текстом, о чем видос
1️⃣ Хотели научиться искать дубликаты багов в таск-трекере по абстракному описанию типа "Э-э-эм, ну мы тут сделали кнопку с чаевыми вроде и вроде были какие-то баги с ней. Можешь найти?"
2️⃣ Попробовали просто пихнуть 100 задачек в /completions эндпоинт OpenAI – получилось хорошо
3️⃣ На 1000 задачек окна контекста уже не хватило
4️⃣ Дальше идет рассказ про то, как мы пытались отфильтровать из >1000 карточек только те, что относятся к задаче
5️⃣ @sagos95 рассказывает про векторизацию и векторное сходство, а также про то, что такое Retrieval Augmented Search и как он в целом работает.
6️⃣ Рассказываем про проблему антонимов и как она делает неподходящие по смыслу запроса карточки проблемой такого поиска.
7️⃣ Показываем код и пайплайн обработки данных
🎱 Показываю просто 🩼🩼🩼 МЕГАКОСТЫЛЬ 🩼🩼🩼 для поиска
9️⃣ Делаем выводы.
Ну и коротко поделюсь тут своими эмоциями от работы над поиском, усиленным AI-шкой 😱
Ищет эта штука данные по не супер-стабильно. На малой выборке все работает более менее, но чем больше даете на вход, тем хуже становится разброс. Мы все это делали на 4o модельке, но не думаю, что дело в ее развитости, тут вопрос скорее всего в принципах работы этой штуки
Поэтому LLM надо прям затачивать под задачи. Чем более узкая задача, тем лучше будет выход.
То есть если просто загрузить карточки и начать задавать по ним вопросы, то пользователю будет не очень удобно – ему придется все время писать “выдай в таком-то формате, не пиши то-то, а пиши вот так-то”.
Дебажить эту штуку пиздец как сложно – вот она тебе выдала все правильно. Снова что-то спросил, даже то же самое и она просто ничего не выдала. Как? Почему? И тестов так-то не напишешь. По крайней мере я плохо как-то представляю такие тесты.
P.S.: Но кстати, мне кажется, что само по себе тестирование AI штук – интересный топик. Я бы поглядел какие-то доклады про енто дело.
P.P.S.: Кстати, если тоже делали RAG поиск, то поделитесь в комментах, что у вас получалось с этим делом, будет интересно почитать.
Post #286
559