【开源项目】在苹果 ANE 上实现直接的神经网络训练
一名开发者成功在苹果 Apple Neural Engine (ANE) 上直接实现了完整的神经网络训练(含反向传播)。该项目完全依赖 ANE 芯片底层算力,绕过了苹果官方的 CoreML 框架、Metal API 及自带的 GPU。
测试数据显示,在 M4 芯片上仅占用 11.2% 的 ANE 资源,即可跑通单个 Transformer 层(dim=768,seq=512),单步耗时 9.3 毫秒,持续算力达到 1.78 TFLOPS。其实测能效比约为 6.6 TFLOPS/瓦,显著优于传统数据中心 GPU 的功耗表现。此项技术使普通 Mac 设备能够以极低的电力消耗,长期在本地环境微调或训练 AI 模型,大幅削减大模型的算力成本。
包括 Zero-Human Company 在内的部分机构已开始将该技术应用于实际业务负载的测试中。这种低成本、高能效的端侧离线训练方案,为减少对云端大算力集群的依赖提供了有效的参考路径。
#人工智能 #AppleSilicon #端侧模型
http://github.com/maderix/ANE
Post #4851
1.69K
- ❤ 5