рассуждения у моделей появились как интерфейсная фича примерно в эпоху o1 и быстро стали любимыми
причина понятная: когда модель показывает ход мысли, кажется, что ты видишь не просто ответ, а процесс. можно понять, где она ошиблась, почему выбрала такой путь, насколько ей можно доверять. для сложных задач это выглядело как маленькое окно внутрь модели
но, кажется, эта эпоха была очень короткой
новое исследование anthropic показывает, что chain-of-thought нельзя воспринимать как честный audit log. модель может что-то “понимать” внутри, но не проговаривать это в reasoning trace. то есть красивое объяснение в интерфейсе не обязательно совпадает с тем, как модель реально пришла к ответу
и это сильно меняет продуктовый смысл рассуждений
в текущем виде они уже не так полезны. вместо “покажи ход мысли” важнее становятся проверяемые вещи: источники, tool calls, артефакты, тесты, история действий агента
reasoning был красивым переходным интерфейсом. но если мы строим не демки, а рабочие системы, то доверие нужно переносить с текста “как я думал” на проверяемые следы “что я сделал”
Post #192
946
Intermission Как известно, лучшая загрузка — это её отсутствие. Раньше игры маскировали ожидание ползущей полоской с подписью «загружается мир, расставляются деревья». Затем научились прятать загрузку за виртуальными дверями и туннелями: пока ты идёшь, предыдущий уровень…
- 👍 7
- ❤ 4