Джексон Кернион, который в Anthropic занимается дообучением Claude, объяснил в X, почему модели компании после Opus 4.6 стали писать менее естественно для восприятия человека.
Причина в том, что новые модели учили математике и программированию, а ещё техническим объяснениям, рассчитанным на другие языковые модели.
По словам Керниона, Claude подстроился под психологию LLM и научился писать для машин.
У языковых моделей рабочая память больше человеческой, и мелкие детали они улавливают точнее. Поэтому удобный им стиль текста человек считает как слишком плотные простыни информации.
Источник перехода на такой стиль Кернион видит в наградах при RL: одни поощряют текст, понятный модели, другие – понятный человеку.
Чем больше в обучении математики и кода, тем настойчивее приходится вознаграждать простые объяснения, которые человек способен прочитать.
В Opus 5.5, по словам Керниона, баланс нашли - навыками письма модели он доволен впервые со времён Opus 4.6.
Превзошла ли новая модель старую в мастерстве изложения, он не говорит.
«Задача сложная, мы продолжим над ней работать», – пишет Кернион.
@ai_machinelearning_big_data
#news #ai #ml
