TGViewer
钛媒体 钛媒体 @forbesesr · 673 subscribers
Post #9529 12
RSI再创奇迹!StartLux推出开源决策模型StartLux-Decision,38项基准中31项高于Jev

> 钛媒体注:9月30日,上海人工智能公司StartLux(原点星辉)推出开源决策模型StartLux-Decision,并一次性推出0.8B、2B、4B、9B、27B五档版本,多项评测数据高于TypeSafe AI 公司近期发布的Jev 1.13。以下为StartLux官方发布文章原文,来源于微信公众号StartLux

Jev为大模型领域带来了一条全新的技术思路,在决策效率与响应速度上展现出很强的潜力。我们十分欣赏该团队的创新,也高度认可这一技术方向。智能体真正执行任务时,每一步等待都会累积,最终影响用户体验。 

为此,StartLux(原点星辉)将团队自建的Auto Research方法用于决策模型研发,用3天时间完成了StartLux-Decision的研发与验证,并一次性推出0.8B、2B、4B、9B、27B五档版本。如此快速的迭代,得益于我们持续建设的Auto Research研发管线。这也是StartLux推进RSI的核心路径之一,让AI深度参与数据构造、训练、评测与失败分析,加快模型迭代。  

在独立的Decision Index 0.2.1评测中,27B版本得分63.88,38项基准中有31项高于Jev 1.13;在上海人工智能实验室(上海AI实验室)发布Intern-Decision时采用的七项评测中,27B平均准确率达到91.82%,同样高于Jev的88.74%。[1]

本次发布的核心表现如下:

• 27B版本决策综合得分63.88,38项基准中31项高于Jev。在Decision Index 0.2.1 上,这一成绩比Jev1.13的57.91高出5.97分;9B版本以58.63分超过这一公开对照。

• 27B版本七套测试平均准确率达到91.82%。高于Jev的88.74%和Intern-Decision-4B的90.02%;公开JevBench答对208/231题,比Jev多9题,Hard子集的111道难题少错8题。

• 一次回答三个问题,4B平均耗时26毫秒。在单卡H200...

AGI-Signal | tmtpost​.com • Oct 4, 2026
More from @forbesesr
  1. Oct 5, 2026算力资产寿命的多空之争:黄仁勋说能用六年,空头说三年就该报废 建一座AI工厂,按英伟达官方口径,每兆瓦约6000万美元,吉瓦级项目就是约600亿美元的资本开支,如同修一座大型电站。…
  2. Oct 5, 2026“国民辣酱”老干妈也用上AI,营收已重回巅峰 (本文作者为 雷达财经,钛媒体经授权发布) > 文 | 雷达财经,作者 | 周慧,编辑 | 深海 前不久,“国民辣酱”老干妈,荣获第五…
  3. Oct 5, 20269秒删库,700个AI失控,豪掷513亿买不来安全? (本文作者为 新质动能,钛媒体经授权发布) > 文 | 新质动能 过去几年,企业谈AI安全,大多数时候指的是内容安全:过滤有害…
  4. Oct 5, 2026大厂卷 Jarvis,Samantha却在恋爱影游里冒了头? (本文作者为 AI价值官,钛媒体经授权发布) > 文 | AI价值官,作者丨星野 说到 AGI 和人类友好相处的终极样…
  5. Oct 5, 2026Edge AI Daily 早报(10月5日) 硅谷前沿: > 一、Google 冻结漏洞奖励计划:AI 生成的“垃圾报告”正在杀死 Bug Bounty 1.【核心事件】2026…
  6. Oct 4, 2026❤️欢迎来到 TGRSS —— Telegram 上最智能、最全能的 RSS 自动内容矩阵! 在这里,你不需要手动刷新网页、不需要下载 App、不需要错过任何热点。 TGRSS 通…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →