Автономный ML-агент может накопить фальшивый прогресс 👀
4 сентября инженеры NetEase описали AutoLR — систему, которая сама ищет идеи для рекомендательной модели, меняет код, запускает обучение и проводит офлайн-оценку. В рабочем контуре она завершила 1 586 экспериментов; девять отобранных инженерами вариантов дошли до положительных онлайн-результатов.
Но длительная работа выявила эффект KEEP ratchet. Если случайно удачный результат сразу сделать новым baseline, все следующие модели сравниваются уже с ним. Несколько шумных улучшений подряд создают на графике устойчивый рост, которого на самом деле может не быть.
Практический вывод: автономному экспериментатору нельзя разрешать менять baseline после одного прогона. Нужны повторная проверка на сопоставимых данных, неизменяемая связь «код → конфигурация → метрики», отдельное состояние для перспективных кандидатов и запрет на promotion при отсутствии калибровки.
В AutoLR модель предлагает гипотезы и пишет код, но запуск экспериментов, подсчёт метрик и изменение постоянного состояния контролируют детерминированные сервисы. Онлайн-тесты и полный rollout остаются за людьми.
Пруф: исследование AutoLR от 4 сентября 2026 года
#aiagents #mlops #llmops #experimentation #recommendersystems #abtesting
@data_engi
Post #1331
159