Как ИИ улучшает ИИ
В конце июля вышла статья о том, как ИИ анализирует и модифицирует модели для обучения. Мотивация в том, что, хотя ученые в области ИИ придумывают новые прорывные (не всегда) архитектуры для улучшения качества, все равно человеческий фактор накладывает ограничения. Может быть, ИИ сумеет создать больше SOTA архитектур?
Признаюсь, надо напрячься для понимания, статья далась не легко. Я не прошарил все от А до Я, но вот некоторые основные компоненты системы (см. картинку):
🔹 Когнитивная база знаний
Из arxiv, papers with code, hugging face собираются статьи по теме и передаются в LLM для извлечения ключевых тезисов: цель статьи, алгоритм, сравнения с другими. Эти тезисы по каждой релевантной статье складываются в так называемую когнитивную базу. Они будут отправной точной при создании новых архитектур.
🔹 Researcher
Этот компонент (тоже LLM) берет из когнитивной базы тезисы, а также топ-50 лучших моделей с предыдущего шага. Причем не просто сырые результаты, а предварительно проанализированные, но об этом позже. И на основе этого генерирует код новой модели. Код проверяется на корректность и уникальность и может быть отправлен на доработку опять в LLM. Своего рода фидбек и работа над ошибками.
🔹 Engineer
Собственно, здесь новая архитектура обучается, проверяется на метрики. А метрик несколько: лосс, качество на бенчмарке и «судья» в лице LLM. Ее задача — оценить сложность, эффективность, новизну и выдать свой балл. Все это суммируется в один score.
🔹 Анализатор
Тут LLM должна проанализировать все результаты и выдать что-то типа отчета. Именно этот отчет будет использоваться Research-ом.
🤷♂️ Правда, по статье я не понял, разные ли во всех компонентах LLM-ки или все же одна? Вопрос открытый.
Нестандартные пути решения
Также делается акцент на том, что вся эта система выбирает такие модели, которые содержат в себе непривычные человеку конструкции. Но тем не менее они выдают хорошее качество.
А если дать больше GPU?
Авторы показывают, что вся эта история масштабируема. Кол-во новых SOTA архитектур линейно растет с увеличением вычислительных ресурсов. А значит, дальше больше 🔥
Post #91
124