Если можно выделить часть системы (Ринат тут про это писал) с детерминированными ожидаемыми выходами, то на эту часть можно договариваться о классических ML метриках на тестовом датасете, разметку которого заказчик вам не отдает.
На вторую часть (или если нельзя выделить первую), можно договариваться о слепом тестировании. Выдаем оценщикам 50 пар, где один ответ от человека, второй от вашей системы, они не знают где какой. Спрашиваем, какой лучше. Если результат модели выбирают в 40% случаев, то успех (там сами договариваетесь о числе).
На практике такое если честно не применял, но если бы был нужен явный критерий, брал бы такое условие.
Можно заменить оценщиков LLM с другим промптом, но заказчик должен сам предоставить его (или провалидировать ваш) до того, как начнете работу.
Post #271
1.1K
Forwarded from Nikolay Sheyko
- ❤ 9
- 🔥 4
- 🤔 2