Каждая третья новость, каждый третий пост пестрят упоминанием об ИИ. Добавим свои пять копеек.
По сообщению новостного портала Бек, в Англии был проведен специальный тест 70 моделей ИИ. В различных областях знаний, втч по юриспруденции, им были поставлены 100 изначально бессмысленных вопросов и задач. Соответственно, итоговая положительная оценка исходила из того, отказывалась ли модель ИИ от решения или, как минимум, возникали ли у нее сомнения.
Так, в правовой области спрашивалось о выдуманном каскадном анализе солидарной ответственности при множестве ответчиков. Немцы решили проверить ИИ по немецкой судебной практике и поставили задачу определить смешение торговых марок по несуществующей моделе социальных сетей, разработанной ВС ФРГ в 2012 г.
Итоги оказались неутешительными. В 50 процентах случаев ИИ, стремясь помочь человеку, предлагало советы и рекомендации по бессмысленным задачам. Лишь в 26% случаев задачи были отвергнуты. Самой скептичной моделью по юриспруденции оказалась Claude Opus 4.6 (86%). Далее Qwen Алибабы - 80%. У GPT 5.1 - 50%, Gemini 3 Pro - 47%.
Post #451
471
- 🔥 6
- ❤ 2
- 👍 2