TGViewer
Readhub Readhub @readhub_cn · 8.5K subscribers
Post #355961 39
StartLux 开源决策模型公开评测成绩超 Jev 登顶榜首

成立不到 5 个月的上海 AI 企业 StartLux 推出完全开源的决策模型 StartLux-Decision,在 Decision Index 0.2.1 的 38 项基准测试中 31 项成绩超过热门模型 Jev,综合得分领先近 6 分,36 局国际象棋对弈中赢下 35 局,是当前公开评测下全球最强的开源决策模型。该模型推出五档参数量版本及对应量化模型,可支持本地部署,针对候选集明确的高频判断场景优化,响应速度快、调用成本低,能填补本地智能系统的高频决策层级,与通用大模型形成分工,提升整体运行效率。该模型从立项到完成首轮研发验证仅耗时 3 天,依托的是团队长期搭建的 Auto Research 异构多模型协作研发体系,目前团队已将该体系推进到 RSI 三级阶段。此次发布并非孤立的模型迭代,而是 StartLux 本地智能系统架构按计划落地的组成部分,后续团队将持续推进系统整合,年内有望推出首个面向公众的本地智能体验版本。

媒体报道
Jev 被请下王座,StartLux 中国开源决策模型冲上第一 maomu.com/36Kr/腾讯网

#热门话题
More from @readhub_cn
  1. Oct 3, 2026韩国五大商业银行遭黑客攻击 三家出现客户信息泄露 10 月 3 日,韩国五大商业银行均遭遇黑客攻击或入侵尝试,其中新韩银行约 2.5 万名客户、KB 国民银行逾 100 名客户及韩…
  2. Oct 3, 20266M 参数 DepthART 轻量深度估计模型可部署至 Jetson 等端侧设备 DepthART 针对单目深度估计领域大模型泛化性强但部署难、传统轻量模型泛化性不足的断层问题,探…
  3. Oct 3, 2026Tavus 发布实时视频交互模型,宣称其通过视频图灵测试 AI 研究团队 Tavus 发布实时视频交互模型 Griffin,其实验预览版 Griffin-Lite 在一分钟视频通话…
  4. Oct 3, 2026普林斯顿大学团队实现毫秒级原子补充,同时保持量子比特相干性 普林斯顿大学 Jeff Thompson 团队在《Science》发表研究,实现中性原子量子比特的「相干重装载」:在不干…
  5. Oct 3, 2026研究发现大模型后训练极端稀疏监督可提升推理性能 针对大模型后训练普遍默认需要密集 token 级监督的假设,研究团队以 OPD 在线策略蒸馏为初始场景开展实验,发现仅保留单条推理轨…
  6. Oct 3, 2026为 MAX 10 认证扫清障碍,FAA 认定波音 737 MAX 软件故障无安全隐患 美国联邦航空管理局披露,专家组认定部分波音 737 MAX 客机飞行计算机的软件故障不存在安全…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →