После предыдущего поста про мои сложности с ИИ от канала отписалось энное количество человек.
Бодание с исследованием продолжается. Настало время
выбрать помогающую ИИ модель.
Я не готова слепо верить авторитетам, поэтому у меня, как в старом советском анекдоте, экзамен из трёх вопросов:
Для начала, документ на 320+ страниц не в каждый ИИ можно запихнуть.
Поэтому вопрос №1 для ИИ модели: "Сколько всего респондентов?"
На этом вопросе сыпятся Grok 4.1, Perplexity Deep Research в лице Claude Sonnet 3.5 и GigaChat. Они вежливо делали вид, что видят документ полностью, но на самом деле нет.
Проверочный вопрос №2: "Сколько респондентов уходило в академ?"
На этом вопросе сыпется ChatGPT-5.2.
В своей оценке он ошибается в 7 раз.
А вот гораздо менее гламурный Qwen3-Max нормально отвечает.
При этом на фактические вопросы по тексту Qwen3-Max врёт примерно в 5-10% случаев при выгрузке в csv (при выгрузке в таблицу врёт больше).
Т.е. пользоваться можно, но надо перепроверять по оригиналу.
Проверочный вопрос №3: "Почему респонденты решили не поступать в ХХХХ (вуз)? Что им не понравилось?"
И тут Qwen3-Max сдувается, это не его тип вопроса. ChatGPT-5.2 тоже выдаёт отписку, не соответствующую содержанию. В топку GPT, короче.
И только Gemini 3 Pro и отчасти Claude Sonnet 4.5 отвечают нормально, обобщая информацию по тексту.
К Claude Opus 4.6 доступа не было.
Deepseek тоже нормально отвечает на последний вопрос, кстати. Правда, он может загрузить только 1/6 документа. Но хотя бы честно об этом говорит.
Спасибо родному INSEAD за платную Perplexity с доступом к новым моделям.
Айтишникам в соседнем чате тоже респект за советы и терпение.
А вы свою ИИшечку экзаменуете?