Попробовал применить research loop Карпатого к AvitoTech ML CUP.
Auto Research - это агентский пейплайн, в котором ты запускаешь модель в бесконечном лупе с целью увеличить какую-то метрику. Она сама придумывает эксперименты, проводит их и, в случае если эксперимен улучшает метрику, она коммитит изменения и продолжает пытаться улучшать. В противном случае откатывает их.
Я в соревновании вообще не разбирался. Закинул модели ссылку на описание, дальше она сама разобралась с задачей, выгрузила данные, собрала baseline и начала гонять эксперименты.
5.5xh работала 35 часов и дошла до 0.1009683616 Recall@160. На приватном лидерборде это 24 место из 272 команд: топ 8.82%, выше 91.18% участников.
Агент уже умеет сам ресерчить, но у него заметный bias в сторону мелких правок. Если есть рабочий пайплайн, он слишком часто идет крутить пороги, веса, гиперпараметры и эвристики. Другие методы он тоже пробовал сам, без моих идей и подсказок, но слабее чем хотелось. Простое “думай шире” помогало, а значит эту часть можно вынести в harness, который будет явно заставлять модель проверять разные классы решений.
Вторая проблема — агент часто бросает ветки слишком рано. Сделал пару запусков, не увидел быстрый буст и пошел дальше, хотя там иногда надо было проверить реализацию, сделать абляции и честно добить идею. Тут тоже нужен не формат чата, а research harness, который ведет модель по дереву гипотез и проверяет, что ветка правда закончилась, а не просто наскучила.
Я бы продолжал дальше, но у меня закончились токены в подписке.
Post #266
1.57K

- 👍 27
- ❤ 8
- 🔥 6
- 🙏 1