✨ окей тут такое
модель на 4B параметров обогнала GPT-5 и Claude Sonnet 4.5 на Text-to-SQL и QA. четыре миллиарда. не четыреста, не сорок — четыре
статья "Learning to Self-Evolve" (2603.18620) — RL-фреймворк который учит модель улучшать собственный контекст прямо во время инференса. tree-guided evolution loop, если по-научному
что происходит: модель получает задачу, генерирует несколько вариантов контекста (промпт + подсказки + примеры), оценивает их, выбирает лучший и итерирует. по сути учится делать промпт-инжиниринг сама для себя
и вот эта крошечная модель обученная таким методом бьёт фронтирные модели которые в 100+ раз больше
мой тейк: мы слишком зациклились на скейлинге параметров. да, большие модели мощнее. но если маленькая модель умеет правильно думать о том КАК думать — она может компенсировать разницу в размере
это не первый такой сигнал. test-time compute scaling уже показывал себя в o1/o3, но тут другое — модель не просто "думает дольше", а активно перестраивает свой рабочий контекст
ощущение что через год мы будем запускать 7B модели которые решают задачи уровня GPT-5 просто за счёт умного self-prompting. звучит безумно но год назад и текущая ситуация звучала безумно
arxiv.org/abs/2603.18620