Ищут друзья!
Инженер / консультант по тестированию и оценке AI-систем
(Test & Evaluation Engineer / Consultant)
Мы разрабатываем агентную платформу для фактчекинга на Python/FastAPI, LangChain и Celery с маршрутизацией запросов между несколькими моделями через OpenRouter.
Сейчас мы ищем опытного специалиста по тестированию и оценке AI-систем для первоначальной консультации по проектированию инфраструктуры тестирования и бенчмаркинга перед запуском продукта.
Для начала мы хотели бы провести предметную консультацию продолжительностью 1–2 часа. Задача — разобраться в существующей логике системы, определить, что именно необходимо тестировать и измерять, а также наметить практическую систему оценки: подходящие инструменты, методологии и приоритеты реализации.
В дальнейшем система оценки может включать:
- эталонные датасеты с утверждениями и статьями, для которых заранее известны правильные результаты;
- метрики качества извлечения утверждений, точности оценки надежности источников, уровня галлюцинаций, корректности цитирования и согласованности оценки предвзятости с мнением экспертов;
- регулярные автоматизированные запуски бенчмарков;
- систему для сравнения разных моделей на одинаковых задачах;
- регрессионные тесты, выявляющие снижение качества после замены модели, изменения промпта или логики пайплайна;
- отслеживание стоимости и задержек на каждом этапе обработки;
- подходы к воспроизводимому тестированию недетерминированных систем.
Создание датасетов обычно является наиболее трудоемкой частью работы, однако у нас уже есть определенные наработки: готовые датасеты, а также более сложные кейсы для глубокого тестирования.
Желателен опыт работы с pytest, CI-пайплайнами, включая GitHub Actions, подходами LLM-as-a-judge и понимание их ограничений, инструментами трассировки, например LangSmith, а также с мокированием провайдеров, фиксацией случайности и проверками с допустимыми отклонениями.
Особенно нам интересно поговорить со специалистом, который уже создавал инфраструктуру оценки для реального продукта на базе LLM и может объективно объяснить, что бенчмарки действительно способны показать, а где их выводы могут быть ненадежными.
Первый этап — оплачиваемая консультация. В дальнейшем возможно продолжение сотрудничества по проектированию и реализации системы оценки.
Контакты:
Galia Nezhinsky
galia.nezhinsky@gmail.com
+972-52-6094477 Whatsapp
Post #1493
2.78K
- ❤ 2
- 😁 2
- 🦄 2
- 🙏 1