🤖Как нейросети учатся чинить свои программы в изоляции (RSI) и почему инженеры не спешат отдавать им руль
Вышел фундаментальный 📄 75-страничный труд от ведущих ИИ-лабораторий и университетов (Tsinghua, Shanghai Jiao Tong, ByteDance и др.) под интригующим названием «The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement».
Главный тезис: экстенсивное наращивание мощностей остаётся крайне ресурсоёмким, а человек стал главным «узким горлышком» в процессе разработки и координации нейросетей. Следующий большой скачок это не просто больше данных и видеокарт, а переход к RSI (Recursive Self-Improvement).
🧠 В чем суть RSI?
Сегодня создание ИИ это тяжелый ручной труд дата-сайентистов: сбор датасетов, написание кода, тестирование гипотез, поиск багов. RSI является реальным сдвигом парадигмы. Автономный замкнутый цикл, в котором ИИ не просто решает прикладные задачи, но и улучшает сам процесс своего развития.
Он (в общем и простыми словами):
1️⃣ Находит свои слабые места.
2️⃣ Разрабатывает и тестирует обновления (в коде, промптах или архитектуре).
3️⃣ Внедряет их в себя.
4️⃣ Использует новые навыки, чтобы в следующем цикле искать улучшения и обучать себя еще быстрее и эффективнее.
📈 5 уровней автономии ИИ в рекурсивном самосовершенствовании
Авторы делят автономию рекурсивного самосовершенствования ИИ на 5 уровней, показывая, как система постепенно берёт на себя ответственность за цикл улучшений:
🔹 L1: Автономия исполнения (Execution). Человек говорит, что и как улучшить. ИИ выступает как рутинный чернорабочий в промышленных масштабах (например, сам размечает терабайты данных по строго заданным правилам).
🔹 L2: Автономия стратегии (Strategy). Человек ставит цель (например, «повысь точность кода на 10%»). ИИ сам решает, как это сделать — пишет скрипты, меняет промпты, тестирует гипотезы. (Прямо сейчас бигтехи массово переходят на этот уровень).
🔹 L3: Автономия опыта (Experience). ИИ сам понимает, чего не умеет, и формирует для себя учебную программу. Он генерирует задачи на грани своих текущих возможностей, чтобы точечно закрыть пробелы в знаниях (curriculum learning).
🔹 L4: Адаптация в реальности (Deployment). ИИ работает в условиях эксплуатации. Анализируя опыт взаимодействия со средой и пользователями, он извлекает уроки и сохраняет их в долговременную память под контролем внешних правил проверки, меняя поведение без остановки на глобальное переобучение.
🔹 L5: Мета-улучшение. ИИ переписывает саму логику того, как он учится. Он меняет свои внутренние системы оценки, механизмы поиска гипотез и правила отбора. Он сам создает более умную версию самого себя.
Ведущие ИИ-лаборатории исследуют делегирование агентам уровней L2–L3 задач генерации обучающих данных, тестирования и проведения экспериментов в процессе разработки моделей. Исследователи считают, что со временем роль человека сместится от ручной разработки к определению рамок и ограничений для поиска улучшений. Люди будут строить безопасные песочницы (цели, критерии и рамки), внутри которых ИИ будет эволюционировать сам. Именно люди-операторы определяют глобальные цели и бизнес-требования, задают неизменяемые проверочные стенды с объективными эталонами истины, очерчивают жёсткие рамки безопасности, права доступа к инфраструктуре и лимиты вычислительных ресурсов, сохраняют за собой исключительное право вето на допуск критических обновлений в эксплуатацию.
Внутри этих рамок ИИ берёт на себя отдельные этапы прикладной инженерии и исследовательской работы, выступая в роли автоматизированного ассистента исследователя. Когда система допускает ошибку, она не просто пробует ответить заново, а локализует источник проблемы. Агент исследует логи, сравнивает успешные и неудачные попытки и выясняет, что именно дало сбой.
👆Пока всё, что ИИ умеет сегодня (L3 и L4 на стадии экспериментов) это лишь капля в море по сравнению с тем, к чему приведёт запуск полноценного рекурсивного цикла RSI (L5).
✋ @Russian_OSINT
Post #7922
3.22K






