🤖 Рідкі нейромережі Liquid AI кидають виклик чистим трансформерам
👤 Рамін Хасані – співзасновник і CEO Liquid AI (розробка ефективних не-трансформерних моделей ШІ)
🎤 Свікс (Шон Ван) – співзасновник Latent Space (медіа та венчурний фонд у сфері AI-інженерії), Річард – шеф-редактор Latent Space
📺 Latent Space – 👥 183 тис. підписників
⏱ 1 год 10 хв
🗓 18.09.26 (3 дні тому)
👁 5 тис.
📝 Рамін Хасані пояснює, як нервова система хробака з 302 нейронами надихнула розробку LFMs, чому майбутнє ШІ належить локальним обчисленням поза дата-центрами та як мета-пошук архітектур знижує витрати на інференс.
━━━━━━━━━━━━━━━
💡 ГОЛОВНІ ТЕЗИ
1️⃣ Архітектура Liquid натхненна хробаком із 302 нейронами
Нейромережа C. elegans керує 95 м'язами краще за традиційні роботичні системи. Її нейрони не генерують спайки, а працюють неперервно в часі, що лягло в основу диференційованих рідких нейромереж.
2️⃣ Масштабування нелінійних моделей руйнує паралелізм на GPU
Рекурентні динамічні системи забезпечують сублінійну складність обчислень, але впираються в обмеження сучасного заліза. Щоб їх масштабувати, доводиться лінеаризувати динаміку через SSM (State Space Models), жертвуючи частиною виразності.
3️⃣ Liquid AI відмовилася від ставки на єдину архітектуру
Стартап розробив мета-систему пошуку гібридних архітектур (фреймворк STAR). Алгоритм самостійно комбінує згортки, шари уваги та рекурентні блоки під конкретний чип без втрати якості генерації.
4️⃣ Модель LFM-2 на 80% складається з 1D-згорток
Замість чистого механізму уваги друга генерація Liquid Foundation Models використовує подвійні гейтовані згортки та лише 20% Group Query Attention. Це оптимізувало роботу нейромережі на стандартних процесорах (CPU).
5️⃣ Локальний інференс на пристроях скорочує витрати бізнесу
Надсилання 90% запитів у хмару економічно нежиттєздатне за мільярдних обсягів клієнтів. Liquid запустила мультимодальні моделі розміром 600 МБ для автомобілів Mercedes-Benz на чипах за $100.
6️⃣ Shopify обробляє понад 1 млрд запитів на місяць через LFMs
Платформа електронної комерції інтегрувала приватні інстанси Liquid у застосунок Shop. Інженери використовують ці моделі через низьку затримку та ефективне утримання якості під час потокової генерації.
7️⃣ Парадокс розміру: складні петлі корисні лише малим моделям
У малих моделях (до 20 млрд параметрів) додаткові структурні зсуви та зворотні зв'язки підвищують якість. При масштабному зростанні параметрів найкраще працюють прості, незсунуті архітектури.
💬 «Легкі проблеми підуть і вирішать усі інші. Якщо проблема складна – це робить її набагато привабливішою для створення бізнесу.»
🎯 ЩО З ЦИМ РОБИТИ
Для скорочення інфраструктурних витрат перестаньте ганяти весь трафік через важкі хмарні LLM. Тестуйте гібридні архітектури зі згортками та механізмом SSM на локальних чипах кінцевих пристроїв.
💵 0.11$
@icereadspodcastsua
Post #229
227
- 👍 3