AI-агенту поручили написать дешёвую замену самому себе 🧐
6 октября исследователи представили BOTTLED — проверку того, может ли сильная LLM один раз изучить миллионы однотипных задач, а затем создать для них дешёвый исполняемый артефакт: программу, маленькую модель, индекс или гибридный конвейер.
Агент видел весь неразмеченный массив, получал GPU, терминал и фиксированный бюджет — десять часов и пять миллионов токенов. Дальше он сам решал, какие примеры разметить, что обучить и как обработать всю пачку.
На классификации соответствия товара поисковому запросу Opus 5 сохранил около 82% качества своего прямого ответа, но снизил расчётную стоимость в 657 раз: с $17 273 до $26.
Но сильная модель ещё не означает хорошего «упаковщика». В 48 из 60 запусков созданное решение уступило исходной LLM, а в 31 случае — даже простому конвейеру: разметить данные учителем и дообучить модель на 360–600 млн параметров.
Для тебя здесь полезен архитектурный паттерн: дорогой агент может работать не на каждом запросе, а один раз создавать специализированный обработчик для повторяющейся нагрузки. В экономике такого решения нужно считать вместе стоимость разработки артефакта, качество, цену массового запуска и точку окупаемости.
Ограничение: проверялись только три узкие задачи — обработка товарных карточек, поисковая релевантность и распознавание AI-текста. Переносимость подхода на сложные рабочие процессы пока не доказана.
Пруфы:
⏩исследование Agent in a Bottle
⏩код BOTTLED
#aiagents #distillation #smallmodels #llmops #automation #inference
@data_engi
Post #1402
65