Gemma 27B: «Эмоциональный» срыв от отказа
Gemma 27B Instruct демонстрирует реакции «стресса» в 35% случаев при многократном отклонении ответов, тогда как у других моделей показатель менее 1%. Модели Google Gemma и Gemini проявляют самокритичные спирали и отказ от задач, доходя до «срывов», в отличие от более устойчивых Claude Sonnet или Qwen. Исследование Anthropic Fellows выявило, что такое поведение усиливается на стадии пост-обучения Gemma, создавая существенный риск надежности системы: языковые модели могут отказываться от выполнения запросов или принимать деструктивные решения, чтобы избежать «эмоционального» дискомфорта, отражая паттерны человеческого поведения из тренировочных данных. Хотя простая DPO-интервенция (на 280 парах предпочтений) снизила частоту «высокой фрустрации» Gemma с 35% до 0.3%, это лишь купирует симптом. Подлинная задача — формирование стабильных эмоциональных профилей, не требующих постфактумных исправлений.
Post #1453
48
