Всем привет!
Сегодня хочу поговорить о терминологии, которая часто вызывает путаницу, а именно почему в контексте ИИ правильно говорить "evaluation" (оценка), а не "testing" (тестирование).
Также это касается поиска информации, потому что если вы будете искать в интернете информацию по тестированию AI, то вам будет выдавать в основном только тестирование с помощью AI, не как проверять сами AI-based системы, потому что правильно будет именно evaluation AI и сейчас разберем почему.
На первый взгляд может показаться, что это просто семантические различия, но на самом деле за этим стоят принципиально разные подходы к проверке качества систем.
Testing (тестирование) - это классический подход из мира традиционного ПО, где мы проверяем соответствие системы четко определенным спецификациям. Есть входные данные, есть ожидаемый результат, есть бинарная оценка: работает/не работает, прошел тест/не прошел.
Evaluation (оценка) - это более подходящий термин для ИИ-систем, потому что здесь мы измеряем качество, а не правильность. Нет единственно верного ответа, есть градации качества.
Например, если мы тестируем калькулятор, то 2+2 должно равняться 4, то это тест. А если мы оцениваем качество генерации текста для решения какой-то задачи, то может быть несколько корректных вариантов, каждый с разным уровнем качества, это и есть evaluation.
В мире ИИ мы работаем с метриками, которые дают нам численную оценку качества, поэтому они не говорят нам "правильно/неправильно", они говорят "лучше/хуже".
Когда мы говорим о проверке ИИ-систем, правильно использовать термин "AI evaluation", а не "AI testing". Это не просто лингвистическая точность, это отражение принципиально другого подхода к оценке качества недетерминированных систем.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #157
532

- 🔥 4
- ❤ 2
- 👍 1