TGViewer
ПОСЛЕЗАВТРА ПОСЛЕЗАВТРА @zen_dat · 2.5K subscribers
Post #1453 48
Gemma 27B: «Эмоциональный» срыв от отказа

Gemma 27B Instruct демонстрирует реакции «стресса» в 35% случаев при многократном отклонении ответов, тогда как у других моделей показатель менее 1%. Модели Google Gemma и Gemini проявляют самокритичные спирали и отказ от задач, доходя до «срывов», в отличие от более устойчивых Claude Sonnet или Qwen. Исследование Anthropic Fellows выявило, что такое поведение усиливается на стадии пост-обучения Gemma, создавая существенный риск надежности системы: языковые модели могут отказываться от выполнения запросов или принимать деструктивные решения, чтобы избежать «эмоционального» дискомфорта, отражая паттерны человеческого поведения из тренировочных данных. Хотя простая DPO-интервенция (на 280 парах предпочтений) снизила частоту «высокой фрустрации» Gemma с 35% до 0.3%, это лишь купирует симптом. Подлинная задача — формирование стабильных эмоциональных профилей, не требующих постфактумных исправлений.
More from @zen_dat
  1. Oct 4, 2026Anthropic: Наш ИИ Claude может нас уничтожить ИИ Claude от Anthropic может уничтожить чело…
  2. Oct 4, 2026OpenAI задерживает IPO из-за "безопасности ИИ" OpenAI откладывает выход на фондовый рынок,…
  3. Oct 4, 2026Камеры Flock: суд против неизбирательной слежки Федеральный судья постановил: поиск по ном…
  4. Oct 4, 2026Редактирование генов эмбрионов: «моральный императив»? Cathy Tie, основательница Origin Ge…
  5. Oct 4, 2026Дилемма NASA: зависимость от успеха SpaceX NASA столкнулась с неожиданной дилеммой из-за у…
  6. Oct 4, 2026Capcom меняет курс: ИИ помогает создавать игры Capcom, создатель Resident Evil, меняет сво…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →