TGViewer
Становимся продвинутым QA Становимся продвинутым QA @be_pro_qa · 938 subscribers
Post #244 471
Каждый запуск пайплайна стоит денег

API Anthropic не блокирует доступ мгновенно, как только баланс достигает нуля. В итоге одна незамеченная за ночь ошибка может привести к тому, что баланс AI-токенов не просто обнулится, а уйдет в глубокий минус. Когда тестовый скрипт начинает вести себя как оставленный без присмотра банкомат, реактивного мониторинга уже недостаточно. Нам нужна архитектурная дисциплина.

Вот стратегии, на которые я опираюсь, чтобы держать расходы на ML-оценку под контролем:

СНАЧАЛА МОКИ
Симулирую ответы модели для детерминированных, структурных частей пайплайна. Реальные вызовы LLM остаются исключительно для недетерминированного слоя "рассуждений", который действительно требует валидации.

ИЗОЛИРОВАННЫЕ ТОЧКИ ВХОДА В МОДУЛИ
Небольшие блоки if __name__ == "__main__": позволяют тестировать логику подмодулей и граничные случаи без запуска полного агентского цикла.

ОТЛАДКА НА МИКРО-БАТЧАХ
Я отлаживаю код на 1-3 тщательно отобранных наборах данных. Масштабирование до полного тестового набора происходит только после того, как тестовая обвязка полностью проверена.

СТОИМОСТЬ КАК АРХИТЕКТУРНОЕ ОГРАНИЧЕНИЕ
В нашем проекте задержка выполнения и стоимость токенов отслеживаются непрерывно - как через Langfuse, так и с помощью внутренних метрик. Им придается такое же значение, как и корректности работы.

В этом подходе есть еще один уровень, который меняет то, как вся команда реагирует на аномалии: читать далее
Mentorpiece Каждый запуск пайплайна стоит денег API Anthropic не блокирует доступ мгновенно, как только баланс достигает нуля. В итоге одна незамеченная за ночь ошибка может привести к тому, что баланс AI-токенов не просто обнулится, а уйдет в глубокий минус. Когда тестовый скрипт начинает вести себя как…
  • 👍 3
  • 🔥 3
More from @be_pro_qa
  1. Aug 17, 2026⚡️Mentorpiece Vacy Index август 2026: Число вакансий по тестированию AI-приложений растет…
  2. Aug 12, 2026Как обычно тестируются приложения, сгенерированные с помощью ИИ? QA-агенты проверяют UI и…
  3. Jul 29, 2026Почему ваш LLM-as-a-Judge "слишком вежливый" (и как с этим бороться) Я часто вижу, как ком…
  4. Jul 22, 2026Почему мне нравится работать ML Evaluation инженером после 20 лет опыта в QA Многие спраши…
  5. Jul 15, 2026⚡️Mentorpiece Vacy Index июль 2026: IT-найм продолжает падать, но сокращение Automation за…
  6. Jul 9, 2026Пройдет ли AI код-ревью? ИИ может за час сделать то, на что раньше уходили недели. Но гото…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →