Всем привет!
Я провел анализ рынка тестирования AI, изучил различные отчеты Gartner, McKinsey, LangChain, Stanford, данные с Reddit и вот что я узнал.
Основной формат тестирования, который сейчас к сожалению преобладает в тестировании ИИ систем - это прогон промптов вручную, который я называют “vibe check” или “vibe testing”.
Более того из полученных данных я узнал, что:
• 29.5% команд, создающие AI-агенты, вообще их не оценивают или не понимают как (ссылка)
• 40 % компаний уже столкнулись с негативными последствиями от внедрения ИИ (ссылка)
• 90-95% проектов не доходят до стадии продакшен использования из-за проблем с данными или отсутствие понимания качества системы (ссылка)
И все что описано выше - это не проблема AI. Это проблема QA.
У нас есть десятилетия применения методологии для тестирования детерминированных систем, при этом для стохастических нет ничего.
• Нет стандартов.
• Нет общепринятых метрик.
• Нет даже консенсуса по тому, что такое хорошо работающая ИИ система.
И самое пугающее, что практика “vibe testing” в части ИИ систем по-прежнему активно распространена, то есть мы доверяем ИИ тестирование ИИ, при этом даже не понимая, насколько это правильно, то есть без возможности управлять этим процессом.
Что думаете по этому поводу?👇
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 7 мая! 🔥
📌🔥Последний день получить скидку 10%!‼️
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #138
612

- 🔥 6
- ❤ 2
- 👍 1
- 💯 1