SigmanticAI/apex-inference-chip
An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.
Language: Python
Stars: 647 Issues: 0 Forks: 1
https://github.com/SigmanticAI/apex-inference-chip
Post #13683
1.42K