SIFT от MIT снижает затраты на оценку ИИ-агентов для программирования
Исследователи MIT и Sakana AI разработали SIFT — метод, который помогает дешевле проверять улучшения ИИ-агентов для программирования. Вместо того чтобы запускать каждый вариант на полном бенчмарке, SIFT поручает отдельной языковой модели сравнивать кандидатов и параллельно продолжает поиск новых изменений. В одном запуске на бенчмарке Polyglot метод достиг точности 35,1% менее чем за пять часов, потратив 42 процессорных часа и около 150 долларов на вызовы API. Это может помочь командам выбирать, какие версии агента отправлять на дорогую проверку.
👉 Читать полностью
Post #7843
4