На Reddit всплыл тред про страницу в документации Anthropic, которую мало кто читал. Три инструкции для системного промпта, которые заметно снижают галлюцинации Claude.
Явно разрешить модели отвечать «I don't know». Без этого Claude заполняет пробелы в знаниях правдоподобной выдумкой.
Потребовать цитаты и источники на каждое утверждение. Если источника нет, модель должна отозвать утверждение.
При работе с длинными документами (>20K токенов) заставить модель сначала извлечь дословные цитаты из текста, а потом анализировать. Это убивает дрейф смысла при пересказе, когда модель незаметно сдвигает значение при суммаризации.
Есть нюанс. Статья arXiv 2307.02185 показала, что жёсткие требования к цитированию давят креативную генерацию. Рекомендуют два режима: режим исследования с тремя инструкциями для фактчекинга, обычный режим без них — для свободной генерации.
https://docs.anthropic.com/en/docs/test-and-evaluate/strengthen-guardrails/reduce-hallucinations
Post #694
566