Step 这次模型进步挺大的。测试了下 Step 5 Preview 模型,效果整体感觉比较不错。
测试主要是让它去进行了 OpenCLI 的 MCP 模式设计,同时和 Fable + GPT5.6 Sol 对比了一下。 另外 oneshot 实现了一个横版卷轴射击游戏,整个过程一气呵成,长程任务的运行表现不错,前端页面像素风格挺好看的。总体上,它在前端 Coding 的长程任务表现上挺不错的。
三个模型给 OpenCLI 的基础 MCP 重构设计案的对比,大方向上大家基本上都保持了一致,都赞成保留原有 core,外面包一层轻量的壳,同时支持 CLI 和 MCP。
对比下来:
Fable:Fable 确实还是牛逼,做了完整工程论证。证据最密、方案最具体、路线最可验证。另外很牛的地方是,主动进行了更加深入的方向的钻研,在整个工程演进上,非常敢于给出一些前瞻性的实践。它还干了一件很少有模型做的事,类似于批判性思维:主动否证自己的任务。
Step 5 preview 分层理得很清,把“CLI 形态已有资产”和“MCP 带来的纯新增能力”拆开成两个部分。但是在整个设计上不够有前瞻性。另外,它还主动拆解了 OpenCLI 的底层 session -> tab -> target 的运行时动态树状结构,以及它如何映射到 MCP 这个新的形态里。
gpt5-sol:工程边界卡得极好,约束条件写得非常完整。主动分析了一些异步环境和并发环境下的可能带来的问题。但是拉开 CLI 与 MCP 差距的特性分析得不够,因为 MCP 是能够提到更多的高级功能和特性的。另外演进的实施路径不是很清晰。
打了个分,Fable 确实是强,但是国模有这个效果其实挺不错了:
可执行工程决策文档:Fable(9)> sol(7)= Step 5 preview(7)
洞察与上限:Fable(9)> Step 5 preview(7)> GPT5-Sol(6.5)
Post #4879
84