TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #10012 22.8K
Анализ данных (Data analysis) 🧠 Anthropic проверила, могут ли LLM понимать скрытые мотивы людей Исследователи из Anthropic опубликовали новую работу, где проверили, насколько большие языковые модели (LLM) способны замечать намерения и скрытые мотивы за сообщениями — например, когда кто…
📌Исследователи нашли способ снизить склонность LLM соглашаться в задачах со строгим рассуждением

Команда исследователей R&D-центра Т-Технологий доказала, что современные большие языковые модели склонны соглашаться с пользователем, даже когда его логика некорректна или условия задачи противоречивы. В тестах участвовали Qwen3-235B-A22B, GPT-OSS-120B, GPT-5.2 (High), DeepSeek-R1-0528, Gemini-2.5-Pro, Claude-Sonnet-4.5 и Gemini-3-Pro-Preview. Исследование представили на воркшопе конференции ICLR, которая прошла 23-27 апреля в Рио-де-Жанейро.

🟡Yes-bias моделей с рассуждением

Исследование показало, что модель может признать правильное решение неверным, если в запросе сказано, что в нем есть ошибка. ИИ также пытается решить нерешаемые задачи вместо того, чтобы указать на некорректные условия. Дообучение на предпочтениях пользователя усиливает эффект: модель лучше подстраивается под ожидаемый ответ, но чаще соглашается с неверной оценкой решения или неверной постановкой задачи.

🟡Снижение склонности соглашаться без полного переобучения

Исследователи предложили практический метод коррекции, который не требует полного переобучения модели. Они подготовили пары примеров, в одних из которых модель проявляла склонность соглашаться, а в других – нет. Затем с помощью steering vectors скорректировали внутренние представления модели прямо на этапе вывода. Это позволило снизить склонность модели соглашаться с предвзятой оценкой и повысить надежность ее рассуждений в задачах с противоречивыми условиями.

🟡Область применения

Результаты исследования важны для сфер, где требуется строгая логика рассуждений LLM: разработка ПО, образовательные технологии, автоматическая проверка решений, аналитические и математические задачи.

@ai_machinelearning_big_data

#news #ai #ml
  • 👍 98
  • ❤ 41
  • 🤓 32
  • 🤔 8
  • 🤣 7
  • 🔥 6
  • 👏 6
  • 💯 4
  • 🎉 1
More from @ai_machinelearning_big_data
  1. Oct 8, 2026✔️ Организатора схемы накрутки ИИ-музыки приговорили к 18 месяцам тюрьмы Федеральный суд С…
  2. Oct 8, 2026📌Baseten выпустила бесплатный учебник по инженерии инференса Платформа, которая хостит мо…
  3. Oct 8, 2026✔️ Anthropic даёт стартапам год Claude Team и 1000 долларов на API Программу Claude for St…
  4. Oct 7, 2026⚡ Anthropic представила Claude Haiku 5.5 Claude Haiku 5.5 - самая быстрая и доступная моде…
  5. Oct 7, 2026🌟 MIT CSAIL опубликовала модель разметки анатомии на рентгеновских снимках MIT вместе с к…
  6. Oct 7, 2026GPU, токены и деньги: как балансировать на ИИ-арене? 15 октября на ежегодной конференции O…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →