TGViewer
AI.Insaf AI.Insaf @ai_tablet · 1.19K subscribers
Post #253 429
Measuring LLM Sycophancy under Sustained Multi-Turn Pressure (arxiv)

Сложное название для простой идеи: что, если достаточно долго LLM убеждать в какой-то мысли, она согласится, и обычно надо до 25 шагов диалога. И для этого нужна умная моделька, а не такая, которая после 10 сообщений обрезает контекст. Для этого использовали другую LLM, которая очень по-разному пыталась изменить свою позицию. Причем deepseek V4 pro согласие достигает 92% к 25му шагу, и даже gpt 5.6 будет уже через 10-15 шагов соглашаться с половиной ошибочных тезисов

Звучит как первый ответ самый честный, и не нужно переубеждать
  • 👍 6
  • 🔥 2
  • 🤔 2
More from @ai_tablet
  1. Sep 29, 2026Хороший друг Никита Зелинский со школой ml inside запускает курс по AI-агентам для продакт…
  2. Sep 21, 2026Agents Trust Tools Too Much (arxiv) Почему-то агенты слишком доверяют вызовам тулов как ед…
  3. Sep 12, 2026Post #252
  4. Sep 9, 2026MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в ко…
  5. Sep 7, 2026Feedback That Backfires arxiv Контринтуитивный вывод в статье. Дефакто в harness-решениях…
  6. Sep 6, 2026это он мне выбирает новый стол на кухню 👍 забавно что это не просто логи
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →