Время от времени появляется что-то, что может изменить подход к разработке приложений. Google выпустил новый фреймворк LiteRT-LM, который позволяет запускать LLM (Large Language Models) прямо на устройствах, таких как Chrome, Chromebook Plus и Pixel Watch. Да, вы правильно поняли — GenAI теперь доступен в оффлайне, без необходимости в API-вызовах и без задержек, которые часто возникают при обращении к удалённым серверам.
💥 Для разработчиков это настоящая находка. Почему? Всё просто:
• Отсутствие задержек — LLM теперь работает прямо на устройстве, что исключает лаги, связанные с удалёнными серверными вызовами.
• Нет расходов на API — экономия на сервисах, которые обычно требуют платных запросов.
• Локальный GenAI — теперь все вычисления и процессы происходят непосредственно на вашем устройстве.
🔔 Что стоит знать о LiteRT-LM?
Google использует LiteRT-LM в своих устройствах, таких как Gemini Nano, Chromebook Plus и Pixel Watch. Фреймворк открывает доступ к множеству возможностей:
• Открытый C++ интерфейс — это позволяет интегрировать LiteRT-LM в кастомные решения. Вы можете настроить систему под свои задачи.
• Архитектура: LiteRT-LM состоит из Engine и Session. Engine хранит базовую модель и ресурсы, доступные для всех функций. Session — это контекст, с возможностью клонирования и переключения задач с минимальными затратами ресурсов.
• Поддержка аппаратного ускорения (CPU, GPU, NPU) и кроссплатформенность — работает на Android, Linux, macOS и Windows, обеспечивая широкие возможности для различных устройств.
• Минимальный pipeline для Pixel Watch — Google продумал оптимизацию под ограниченные ресурсы устройства, что позволяет запускать GenAI даже на устройствах с небольшой памятью.
⚠️ Что включает в себя новый стек от Google?
Google не просто выпустил LiteRT-LM, а открыл целый стек для работы с GenAI:
• LiteRT — это движок, который быстро запускает AI-модели прямо на устройстве, оптимизируя время отклика.
• LiteRT-LM — интерфейс C++ для работы с LLM, объединяющий кэширование промптов, хранение контекста, клонирование сессий и прочее.
• LLM Inference API — готовые решения для интеграции GenAI в приложения, доступные для разработчиков на Kotlin, Swift и JS. Эти интерфейсы облегчают процесс внедрения GenAI в мобильные и веб-приложения.
Это целая экосистема для создания мощных, высокопроизводительных решений, которые работают в оффлайне, на вашем устройстве, без задержек и дополнительных расходов на API. Если вы разрабатываете приложение, использование этого фреймворка может значительно ускорить процесс и снизить стоимость.
Data Science