💡 Советы и лайфхаки
Включите авто-режим в Claude — сессии идут параллельно без запросов подтверждения, классификатор вместо них отсекает опасные действия.
CLAUDE_AUTOCOMPACT_PCT_OVERRIDE задает процент заполнения контекста (1-100), при котором срабатывает автокомпакт. По умолчанию 95%.
По умолчанию 95%. Протестировали 6 подходов к ответам на вопросы по длинным PDF-документам, чтобы выяснить, что лучше: Agentic RAG, Long-Context LLMs или Vision LLM. Использовали 30 реальных PDF-файлов с изображениями и таблицами, задав 171 вопрос Claude Sonnet 4.5. Выяснилось, что Long-Context LLMs чуть точнее (59.6%), но Agentic RAG почти не уступает (53.2%), при этом в 2-3 раза дешевле и без ошибок. Vision LLM — худший вариант для продакшена, т. к. самый дорогой и с 7% неисправимых сбоев.
LLM судит свой код мягче. Кросс-проверки между моделями поднимают качество.
Бессмысленно просить LLM оценить что-либо по числовой шкале. Никакого внутреннего эталона качества у моделей нет, шкала генерируется на ходу и скачет от запуска к запуску. Работает попарное сравнение: ставьте два объекта рядом и спрашивайте «какой лучше и почему».
🔹 Курс разработка AI-агентов
🔹 Получить консультацию менеджера
🔹 Сайт Академии 🔹 Сайт Proglib
🏃♀️ Азбука айтишника
#магиякода
Post #2591
392



- ❤ 2