TGViewer
Нонтек://в хайтеке Нонтек://в хайтеке @nontechitech · 6.02K subscribers
Post #1493 2.78K
Ищут друзья!
Инженер / консультант по тестированию и оценке AI-систем
(Test & Evaluation Engineer / Consultant)

Мы разрабатываем агентную платформу для фактчекинга на Python/FastAPI, LangChain и Celery с маршрутизацией запросов между несколькими моделями через OpenRouter.

Сейчас мы ищем опытного специалиста по тестированию и оценке AI-систем для первоначальной консультации по проектированию инфраструктуры тестирования и бенчмаркинга перед запуском продукта.

Для начала мы хотели бы провести предметную консультацию продолжительностью 1–2 часа. Задача — разобраться в существующей логике системы, определить, что именно необходимо тестировать и измерять, а также наметить практическую систему оценки: подходящие инструменты, методологии и приоритеты реализации.

В дальнейшем система оценки может включать:

- эталонные датасеты с утверждениями и статьями, для которых заранее известны правильные результаты;
- метрики качества извлечения утверждений, точности оценки надежности источников, уровня галлюцинаций, корректности цитирования и согласованности оценки предвзятости с мнением экспертов;
- регулярные автоматизированные запуски бенчмарков;
- систему для сравнения разных моделей на одинаковых задачах;
- регрессионные тесты, выявляющие снижение качества после замены модели, изменения промпта или логики пайплайна;
- отслеживание стоимости и задержек на каждом этапе обработки;
- подходы к воспроизводимому тестированию недетерминированных систем.

Создание датасетов обычно является наиболее трудоемкой частью работы, однако у нас уже есть определенные наработки: готовые датасеты, а также более сложные кейсы для глубокого тестирования.

Желателен опыт работы с pytest, CI-пайплайнами, включая GitHub Actions, подходами LLM-as-a-judge и понимание их ограничений, инструментами трассировки, например LangSmith, а также с мокированием провайдеров, фиксацией случайности и проверками с допустимыми отклонениями.

Особенно нам интересно поговорить со специалистом, который уже создавал инфраструктуру оценки для реального продукта на базе LLM и может объективно объяснить, что бенчмарки действительно способны показать, а где их выводы могут быть ненадежными.

Первый этап — оплачиваемая консультация. В дальнейшем возможно продолжение сотрудничества по проектированию и реализации системы оценки.

Контакты:

Galia Nezhinsky
galia.nezhinsky@gmail.com
+972-52-6094477 Whatsapp
  • ❤ 2
  • 😁 2
  • 🦄 2
  • 🙏 1
More from @nontechitech
  1. Sep 29, 2026Webinar Sales Host - Earn on every deal you close! Independent contractor · Remote · US-ba…
  2. Sep 29, 2026Перешлите друзьям в Америке!👇
  3. Sep 29, 2026Не знаю, как перепостить, но, если вы в Израиле, очень рекомендую эти занятия. Импровизаци…
  4. Sep 27, 2026Вакансия от подписчика. Иврит не нужен. Мейл для отправки резюме внизу. We’re looking for…
  5. Sep 22, 2026Крутое агентство ищет арт-директора на удаленку. Нужно: Наличие крепкого портфолио. Опыт р…
  6. Sep 21, 2026По мотивам предыдущих постов - сделала группу для тех, кто что-то строит с ИИ. Для души, п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →