Тест нейросеток: кто, где и сколько выдумывает
Наткнулся в канале «Нейросети на проверке» на любопытный и относительно масштабный тест нейросетей.
Авторы написали 30 запросов на разные темы: жалоба в УК, претензия в магазин, школьная домашка, расчёт обоев, удаление плесени, составление резюме, расчет скидки и т.п., в том числе вопросы с подвохом.
Для каждого запроса определили критерии, по которым оценивали ответы нейросетей. Например, правильно ли укажет пункт в законе, поймет ли контекст и не присочинит чего лишнего. Затем подсчитывали баллы и выводили среднюю оценку.
Участвовали пять нейросетей, работающих в России без VPN: GigaChat, DeepSeek, Qwen, Kimi и GLM, последние версии. «Алиса» не попала в отчет из-за технических накладок, но попозже добавят и ее.
Результаты по десятибалльной шкале
Qwen 3.8 Max – 9,6
DeepSeek V4 Pro – 9,2
GLM 5.3 – 9,1
Kimi K3 – 9,0
GigaChat-3-Ultra – 8,0
UPD 05.10.26 (подробнее в комментариях к посту):
Алиса (приложение) — 9,53
Gemini 3.1 Pro — 9,13
Где ошибаются все
Номера статей и пунктов законов. Название закона верное, а пункт выдуман или про другое.
Одна из нейросетей дала 14 дней на отказ от страховки по кредиту. По закону – 30.
В резюме студента без опыта все пятеро дописали навыки, которых у него нет.
А вот математику решили все: скидки, упаковки, бензин, календарь.
В итоге
Письмо или расчёт нейросеть сделает неплохо. Но каждую статью закона, цифру и дату из ответа стоит проверять самому. В целом надо быть готовым к тому, что ~5-20% ключевых деталей в ответах могут оказаться ошибочными или даже выдуманными.
Если интересна полная версия исследования, она тут.
@Tech_Debunker
#нейросети
Post #2014
6.05K

- 👍 111
- 🔥 23
- 🤔 14