TGViewer
NGI | Влад Корнышев про AI и создание AI-продуктов NGI | Влад Корнышев про AI и создание AI-продуктов @ngi_ru · 4K subscribers
Post #399 1.55K
Как LLM косячат в человекоцентричных задачах

Для меня LLM стали незаменимым инструментом в задачах, где мне нужно обрабатывать большие массивы информации. Благо, подобных у меня, как у продакта - довольно много: исследования, интервью с пользователями, отзывы и обратная связь на разрабатываемые продукты и много чего другого. Благодаря им я трачу в десятки раз меньше времени на все эти операции, но здесь не обошлось без ложки деготя…

Многие знают, что LLM склонны галюцинировать. С этим можно и нужно бороться через контроль температуры, правильный промпт-инжиниринг и управление контекстом, например, как я делаю при чтении с ИИ. Однако с последним поколением моделей вроде GPT o3, Gemini 2.5 PRO и Sonnet 4 проявляется проблема похуже.

Суть проблемы
В последние месяцы я активно использовал LLM для всего того, что описал выше, и заметил, что указанные мной модели как никогда сильно косячат в задачах, где важно человеческое суждение: эмоциональный интеллект, оценка soft skills, анализ обратной связи. Я неоднократно повторял, что ИИ и эмпатия несовместимы, но сейчас ситуация стала хуже и нам нужно быть еще внимательнее.

Вот лишь несколько моих кейсов, где модель была неправа:
⁃ классифицировала положительные отзывы с развернутой ОС про “что можно сделать лучше” как негативные;
⁃ 3 из 3 раз проигнорировала софт-скиллы кандидатов;
⁃ загнобила меня за сообщение с конструктивной критикой, сказав, что я токсичный 😁;
⁃ 100 раз назвала меня гениальным, после того, как я исправлял ее ошибки;
⁃ многократно доказывала мне, что я не прав, отказываясь давать заднюю даже при сильной аргументации.

Почему это происходит?
Виной всему Reinforcement Learning (RL).. На этом уже спотыкались OpenAI, когда их обновление GPT 4o сделало модель подлизой и ее пришлось откатывать. RL сейчас активно применяется для обучения моделей, и одной из побочек здесь является то, что в процессе обучения модель учится достигать своей цели любыми доступными способами. Поэтому, когда модели на вход подается информация, где нет единственного правильного ответа - она просто пытается зацепиться хотя бы за что-то, чтобы спрогнозировать “правильный” по ее мнению ответ. Выражается это либо в гипетрафированных “эмоциях” либо в том, что модель просто решит их игнорировать.

Как с этим бороться?
1. Управляйте семантикой - не давайте в своих промптах оценочных суждений. Не спрашивайте модель “хорошо ли я сделал?”. Модель будет цепляться за ваше “хорошо” и это уже будет влиять на ее ответ. Вместо этого пишите “дай взвешенную оценку, включающую плюсы и минусы”.
2. Не верьте первому ответу - модель будет лениться. Задавайте уточняющие вопросы, спрашивайте, насколько модель уверена в своем ответе.
3. Просите модель покритиковать свой же ответ - пусть LLM сама проанализирует свой ответ, следующим шагом попросите ее доработать свой первоначальный ответ, учитывая эту ОС.
4. Используйте предыдущие версии моделей - в тех задачах, что я описал, они справляются лучше. Гораздо проще переключить на Gemini 2.0, чем по 100 раз даблчекать результат.
5. Опирайтесь на собственное мнение и формируйте его ДО того, как увидите ответ LLM - вы несете ответственность за результат работы с ИИ. О человеческом должен судить человек, а не машина.

В комментариях делитесь, какие у вас были кейсы, когда LLM ошибалась в чем-то подобном!
  • 🔥 20
  • 👍 8
  • ❤ 5
More from @ngi_ru
  1. Sep 16, 2026Делаем вторую версию конференции ROИИ Многие из вас помнят нашу первую конференцию в февра…
  2. Sep 14, 2026Post #668
  3. Sep 11, 2026Post #667
  4. Sep 9, 2026Post #666
  5. Sep 8, 2026Post #665
  6. Sep 3, 2026Kickstarter как лучший тренажер для продуктового питча Поймал себя на том, что в последнее…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →