Chain-of-thought (CoT): цепочка рассуждений – по-простому, мы просим модель "подумать" перед выбором финального ответа. Например,
перед тем как дать ответ опиши ход своих мыслей в нескольких предложениях. Вариаций как организовать CoT масса. Это позволяет модели порефлексировать, набросать черновые варианты или выделить, на что обратить внимание, – до того как давать ответ. В чем причина такого поведения нейросети: каждый раз, для выбора следующего токена, нейросеть прогоняет через себя весь предыдущий текст. Включая текст своего ответа. А значит если мы просим ее написать ответ сразу, она будет исходить только из нашего промпта, а если мы просим "рассуждать вслух", то к моменту ответа в контексте окажутся еще и те слова, которыми она будет описывать рассуждения.
На самом деле не так важно "кто" поразмышлял вслух - это могли быть и наши собственные рассуждения. И совершенно не факт, что рассуждения нейросети будут в верном направлении. Но если добавить минимальную архитектуру (даже с полностью ручным подходом и без автоматизации) когда мы каждую цепочку последовательно критикуем, дорабатываем и затем попарно сравниваем, мы получим очень большой контекст и повысим шанс получить правильный ответ в несколько раз.