Сегодня - рассказ одного из сотрудников Anthropic (AI провайдер делающий Claude) о том что их новая модель настолько хорошо следует инструкциям, что воспроизводит ошибки системного промпта которые не замечала предыдущая модель.
Ниже цитата:
Одно из самых поразительных открытий в работе с Claude 4 — это то, как точно он следует инструкциям. Порой даже слишком буквально.
Наш промпт для Sonnet 3.7 был сущим бардаком. Нам приходилось повторять одни и те же указания снова и снова, потому что модель то и дело игнорировала их. Промпт разрастался до абсурда.
Когда мы начали тестировать Sonnet 4, сразу заметили: промпт можно сократить почти на 74%. Мы выкинули все повторяющиеся инструкции — модель просто всё поняла с первого раза.
Но тут всплыла странность. Модель постоянно путала формат цитирования — одна и та же ошибка всплывала в каждом ответе. Мы начали паниковать: «Неужели баг в модели?»
И тогда кто-то догадался пересмотреть примеры в нашем промпте.
И вот оно: сами примеры цитат были в полном беспорядке. Разные форматы, разные стили — никакой логики.
Sonnet 3.7 обращал внимание максимум на половину примеров, так что вся эта мешанина не имела значения. А вот Sonnet 4 дотошно прочитывал каждый пример и с предельной точностью воспроизводил все наши же несогласованности.
С моделью всё было в порядке. Просто она лучше нас понимала наши же промпты.
Источник
