Cohere 推出了 218 B 参数的 Mixture‑of‑Experts(MoE)翻译模型 North Small Translate,专门为机器翻译设计。模型采用稀疏架构,128 个专家中每个 token 仅激活 8 个,实际活跃参数约 25 B。支持 50 种语言,WMT26 评测得分 83.60,使用多轮自我校正可提升至 84.36。
该模型的硬件需求相对可控:4‑bit 量化版可在单个 NVIDIA B200 或两块 H100 上运行;BF16 精度需四块 B200 或八块 H100。为生产环境提供商业许可与 Model Vault 部署。
对开发者而言,North Small Translate 让翻译任务从复杂提示转为直接函数调用,减少工程成本。可通过 API 或下载权重(CC BY‑NC 4.0)进行评估。
GitHub: GitHub
🔗 原文:点击查看
#开发者 #工具 #Cohere #MoE #翻译模型 #NVIDIA #HuggingFace #PythonSDK
@DevToolboxHub
