RSI再创奇迹!StartLux推出开源决策模型StartLux-Decision,38项基准中31项高于Jev
> 钛媒体注:9月30日,上海人工智能公司StartLux(原点星辉)推出开源决策模型StartLux-Decision,并一次性推出0.8B、2B、4B、9B、27B五档版本,多项评测数据高于TypeSafe AI 公司近期发布的Jev 1.13。以下为StartLux官方发布文章原文,来源于微信公众号StartLux
Jev为大模型领域带来了一条全新的技术思路,在决策效率与响应速度上展现出很强的潜力。我们十分欣赏该团队的创新,也高度认可这一技术方向。智能体真正执行任务时,每一步等待都会累积,最终影响用户体验。
为此,StartLux(原点星辉)将团队自建的Auto Research方法用于决策模型研发,用3天时间完成了StartLux-Decision的研发与验证,并一次性推出0.8B、2B、4B、9B、27B五档版本。如此快速的迭代,得益于我们持续建设的Auto Research研发管线。这也是StartLux推进RSI的核心路径之一,让AI深度参与数据构造、训练、评测与失败分析,加快模型迭代。
在独立的Decision Index 0.2.1评测中,27B版本得分63.88,38项基准中有31项高于Jev 1.13;在上海人工智能实验室(上海AI实验室)发布Intern-Decision时采用的七项评测中,27B平均准确率达到91.82%,同样高于Jev的88.74%。[1]
本次发布的核心表现如下:
• 27B版本决策综合得分63.88,38项基准中31项高于Jev。在Decision Index 0.2.1 上,这一成绩比Jev1.13的57.91高出5.97分;9B版本以58.63分超过这一公开对照。
• 27B版本七套测试平均准确率达到91.82%。高于Jev的88.74%和Intern-Decision-4B的90.02%;公开JevBench答对208/231题,比Jev多9题,Hard子集的111道难题少错8题。
• 一次回答三个问题,4B平均耗时26毫秒。在单卡H200...
AGI-Signal | tmtpost.com • Oct 4, 2026
Post #9529
12
