韩国AI初创公司VIDRAFT在Hugging Face上发布了Aether-7B-5Attn,一个完全开源的MoE基座模型,参数量约6.59B,每token仅激活约2.98B参数。模型遵循Apache-2.0许可,不仅公开了权重,还包含训练数据配方、完整训练代码、超参数、训练日志、中间检查点和评估代码,强调可完全复现。
核心架构创新在于将五种不同的注意力机制集成在49层Transformer中:全注意力、差分注意力、滑动窗口注意力、NSA系列稀疏注意力和混合注意力。为避免不同注意力类型在深度方向上聚集,团队采用7×7拉丁方布局,确保每种机制在各深度均匀分布。训练数据约1442亿token,其中数学占37.8%,韩语和英语各占21.6%,模型从设计上就是双语,而非先英语后适配韩语。
VIDRAFT此前披露的Darwin系列(生产级)在K-AI排行榜上获2026年总排名第一,GPQA Diamond达90.9%,但Aether-7B-5Attn自身基准尚未公布。社区可借助公开的评估代码自行跑MMLU等测试。
基础版和指令微调版均已上架Hugging Face,可搜索“VIDRAFT/Aether-7B-5Attn”获取。对于关注可复现性、主权AI或异质注意力研究的开发者,值得深入了解。
HuggingFace
#开发者 #工具 #VIDRAFT #Aether7B5Attn #MoE #异质注意力 #开源LLM #KrAI
@DevToolboxHub