Последние 3 дня я прям сильно закопал агентов в тему с Recursive Self Improvement.
Собственно это агентский цикл самоулучшения.
В основном агенты занимались разработкой сверхмалой модели по типу Jev которая смогла бы одновременно (это как раз сложно) играть в тетрис, змейку, уметь классифицировать логи и сортировать картинки.
такой сверх-быстрый комбайн.
определённый прогресс есть, все узкоспециализированные задачи модель размером в 1.8 млн параметров (7 мегабайт всего) выполняет. причём в тетрис играет лучше всего, в змейку - идеально но линейно, с остальным пока учится разбираться, но самое интересное что в ходе этой работы сам цикл самоулучшения постоянно дорабатывается.
Вот тут версия на Питоне, сейчас переписывется на Rust
и вот, сначала Гермес, потом Астра и затем Fable 5.1 собрали Универсальный RSI навык.
он гигантский.
Это не просто промпт, - это прям шаблоны инструкций для Мета RSI с примерами инструментов и процессов.
навык, как обычно, в ИИзбранном
ибо сложно и дорого.
На всю историю уже около 1млрд токенов сожглось. (хочу безлимит)
А тут в комментариях, - примеры результатов обучения модели.
особенно радует скорость отклика в диапазоне 4-40мс
#RSI #навыки
———
@tsingular
Post #8602
1.61K

- 🔥 20
- ❤ 2
- ✍ 2
- ⚡ 2
- 👍 1
- 🤩 1