Самый топовый инструмент на платформе OpenAI – Evals
В базовом варианте – загружаем табличку с двумя столбцами – примерами входных данных и правильными ответами. Это наш тестовый датасет. И для любого нашего промпта по нажатию кнопки получаем его качество – в скольки процентах сгенерированный ответ совпадает с правильным.
Понятно, что такое работает очень редко – когда нужно проверить полное совпадение ответов. Например, когда классифицируем текст - проверяем, отзыв позитивный (1), негативный (-1) или нейтральный (0).
А если мы делаем промпт для саммари созвона? Может быть бесконечное количество хороших саммари – не обязательно полное совпадение с "правильным" ответом в нашей табличке.
Для таких случаев, OpenAI добавили кучу разных режимов. Самые интересные кмк:
* Проверка фактической схожести (в отличие от повсеместной семантической схожести на ембеддингах). Это буквально "мне насрать как ответ сформулирован, но суть должна быть верная" – то, в чем часто косячат продукты поверх LLM.
* Кастомный критерий – буквально можно прописать любую меру похожести, любой вайбчек. Это просто разъеб!
А самый кайф в том, что критерии можно комбинировать.
———
Осталось понять, зачем это все, да?
Да просто мы оптимизируем то, что измеряем (и смотрим на измеренные числа, конечно). Это могут быть деньги на счете, время просранное в соц. сетях, количество подписчиков в канале или корректность фактов в ответах LLMки.
OpenAI сделали систему вообще бесшовной, так что наконец можно не городить свои костыли.
А что и как измеряете вы?
Post #272
1.05K

- 🔥 7
- ❤ 1