Проект позволяет запускать локальные LLM из Go без отдельного inference-сервера.
Что интересно:
- прямой доступ к
llama.cpp- hardware acceleration
- Linux, macOS и Windows
- поддержка WebAssembly
- локальный inference внутри Go-приложения
- удобно для desktop, edge и offline-сценариев
То есть вместо схемы:
Go app → HTTP → отдельный LLM serverможно строить:
Go app → llama.cpp → локальная модельПолезно для CLI, desktop-приложений, локальных агентов и embedded AI, где важны приватность и отсутствие внешнего API.
GitHub:
https://github.com/hybridgroup/yzma
