LLM весом 14 МБ 🌵
Пока все меряются размерами моделей на 500B параметров, ребята из Cactus Compute (YC) пошли в другую сторону и выкатили Needle 2 — модель на 45M параметров, которая весит 14 МБ и жрет 28 МБ оперативы.
Это не чат-бот и не «GPT в кармане». Это модель ровно под одну задачу: превратить кривую фразу юзера в вызов функции с нормальными аргументами.
Что по метрикам?
🟢 45M параметров, файл 14 МБ, пиковая сессия 28 МБ RAM
🟢 500+ tok/s декода на Raspberry Pi 5
🟢 300–700 tok/s на телефонах до $200 (та самая Samsung A-серия)
🟢 400–1500 tok/s на Quest 3S и Apple Vision Pro
🟢 Запускается даже на микроконтроллере ESP32-S3
🟢 Лицензия Apache 2.0, полностью открыта
На бенчах tool call и mobile device use она разменивается победами с FunctionGemma 270M, LFM2.5 230M и Apple FM — будучи в 5–70 раз меньше и работая в 2 битах против их f16.
Почему это вообще работает?
Чтобы включить свет в комнате, знание мировой истории не нужно. Умным часам, роботу и колонке хватает выбрать функцию и подставить параметры. Убрали болтовню — хватило 45M параметров вместо миллиардов.
Из технически приятного:
🟢 2-битное квантование не пост-фактум, а с самого претрейна — деплоите ровно ту модель, которую обучали
🟢 Грамматика компилируется из схемы, поэтому сломанного JSON физически не бывает
🟢 Каждый ответ несет confidence score: ниже вашего порога — эскалируем в облако, выше — работаем локально
🟢 На левые запросы возвращает пустой вызов, а не выдумывает функцию
🟢 Один C++ бинарник без зависимостей, сам щупает CPU и выбирает кернелы (NEON, AVX2, RISC-V, wasm)
🟢 Файнтюн под свои тулзы гоняется на обычном маке за минуты-часы
🔗 Сайт с песочницей прямо в браузере
🔗 Гитхаб
🔗 Веса
Что смущает?
Модель узкоспециализированная: поболтать, написать код или подумать она не сможет в принципе. Плюс из коробки она знает generic-тулзы, а под ваш продукт ее почти наверняка придется дообучать. То есть это не «поставил и работает», а кирпич для тех, кто строит железо или оффлайн-фичу.
В проде уже крутится: Pebble гоняет Needle локально в приложении Index 01, чтобы кольцо без экрана понимало голос без интернета.
Кому зайдет:
— софт под IoT, умный дом
— оффлайн-фичи в мобилках, где не хочется платить за каждый запрос в облако
— парсинг документов в структурированный JSON на клиенте
— локальные агенты, где приватность важнее красноречия
По кайфу, что кто-то наконец пилит ИИ не для владельцев макбуков за 3к$, а для железа, которого в мире реально больше. Сами будем тыкать — если у кого дойдут руки прикрутить к своему проекту, делитесь результатами в комментариях.
Чат | Support | Market
Pelican | HiddenCode [EN]
Post #590
3.17K

- 👍 9
- 🔥 4
- 😁 3
- 🐳 2
- ❤ 1