Свежий завоз базы: Агенты, Синтетика и Архитектурные приколы 🤨Собрал для вас пак годноты, а то давно не было технички, буду периодически писать дайджесты, чтобы вы не просто кодили фит/пердикт, а понимали, куда движется индустрия и как уничтожать современные задачи 🚶♂️
1️⃣ Архитектурный трюк от ByteDance
Исследователи выкатили статью про Virtual Width Networks (VWN). Идея гениальная и простая: расширяем размерность эмбеддингов в несколько раз, а основные слои трансформера оставляем как есть.
Обычно, если хочешь прирост качества - платишь квадратичным ростом параметров и вычислений. А тут с помощью легковесных матриц Generalized Hyper-Connections (GHC) мы сжимаем жирные эмбеддинги перед attention/FFN и разжимаем обратно. Как итог это тварь даёт прирост в качестве, а backbone почти не пухнет: дешево, сердито, православно, гойда. Статья
2️⃣ Потыкать палкой в RL агента
AlphaXiv выкатили RL Playground - интерактивный тренажер по обучению с подкреплением. Можно в реал-тайме накидывать препятствия агенту и смотреть, как он страдает и адаптируется к новой среде. Идеальная вещь, чтобы понять интуицию за RL процессами, не написав ни строчки кода. Тоже православно, тоже гойда братья. Потыкать тут
3️⃣ Фундаментальная база по Агентам
Стэнфорд, Принстон, Гарвард выкатили манускрипт с полной таксономией адаптации современных AI-агентов.
🟣 Они разложили всех сложных агентов на 4 базовых типа адаптации: два про апгрейд самого агента (его "мозгов"), два - про апгрейд его инструментов (его "рук").
🟡 Если пилите агентов или хотите понять, куда движется эта хайповая тема - читать обязательно. Это та самая база, которую скоро могут спрашивать на собесах. Манускрипт
4️⃣ Синтетика: друг или враг?
Meta выпустила ресёрч про синтетические данные для претрейна LLM.
Все сейчас бегут генерить данные, но Meta поясняет: когда они реально бустят модель, а когда превращают её в тыкву. Разбор кейсов, когда синтетика помогает, а когда вредит. Читать
Ставьте 🔥, если нравятся такие посты, нужно ваше мнение 🎹
