2 новых скилла от Anthropic: build-eval & hillclimb
Вчера Anthropic добавили в свой claude-api скилл две команды - build-eval и hillclimb:
1) build-eval - дружбан интервьюирует вас, собирает эвал прямо в репо и проверяет его на вшивость: однозначны ли кейсы, не меняет ли грейдер вердикт на одном и том же ответе, хватит ли точности вообще заметить улучшение
2) hillclimb - улучшает систему по одному изменению за раунд. Кейсы делятся на train и test, и изменение остается, только если выросли оба. Чем-то напоминает autoresearch
Я гонял еще версию из PR, но вечером ее уже вмерджили - достаточно обновить скилл.
Погонял hillclimb на скоринге лидов в Onsa:
1) Гайд по экономии советует начинать с кэширования, а не с моделей и промптов. Включили явный кэш промпта у Gemini: ответы те же 20 из 20, минус 34% на вызов. Самая скучная и самая чистая победа.
2) Смоук тест с лимитом в $10: попробовал понизить thinking effort с medium на low —> скорость выросла на 60%. Но с небольшой потерей качества. Воодушевился и решил сделать полноценный тест
3) Сделал прогон на 616 кейсах за $17: скорость и стоимость существенно сдвинулись в нужную сторону (цена упала на 25%, а скорость выросла в 2.6 раза), но качество упало (1.4% → 4.3% хороших лидов терялось).
Формально - не прошел тест. Но я решил катить: имхо такой выигрыш по скорости перекрывает падение качества НО поставил followthrough, чтобы чекнуть через недельку.
В общем, скиллы - рекомендую! Хотя они и предполагают, что ты юзаешь anthropic api, но подходы применимы и к другим; подробнее читайте в статье
P.S. jev, кстати, сломался на этой задаче: очень упало качество, поэтому я не стал его внедрять тут
Post #1844
1.72K