TGViewer
钛媒体 钛媒体 @forbesesr · 622 subscribers
Post #9244 6
阿莫迪偷师姚顺雨,奥特曼偷师梁文锋

(本文作者为 字母AI,钛媒体经授权发布)

> 文 | 字母AI

正所谓天下文章一大抄,看你会抄不会抄。

刚刚发布的Opus 5.5和GPT-6 Luna,一眼望去,这两个模型上面满满是姚顺雨和梁文锋的影子。

或许是因为两家公司都已经将预训练做到了极致,为了提升模型的智能以及降低算力成本,所以这两个新模型都选择开辟新的战场。

Opus 5.5是对上下文动手,GPT-6 Luna是对缓存动手。

这我可熟啊!一个混元,一个DeepSeek啊!

但你别说,阿莫迪和奥特曼还真抄得挺像那么回事。


阿莫迪偷师姚顺雨

先看一组数字,Artificial Analysis的智能指数里,有一项统计是“跑完一道题平均要输出多少token”。

在这张榜单上,Claude Opus 5.5在max档位下,平均每题要吐出11.9万个输出token,其中8.4万个是“思考”,3.5万个是最终答案。而OpenAI的GPT-6 Astra,在同一档位下只用了2.7万个 token。

大模型想要提升模型的智能水平,传统路线是在预训练阶段堆数据、堆算力,把智力放进模型的权重里,一次训练、反复使用。

这条路线的模型在推理时几乎不做额外思考。模型训练时数据价值越高,模型的智能水平就越高。

但传统路线就怕出现没见过的题型,传统模型的泛化是插值。在训练数据覆盖的分布附近,它表现很好。一旦碰到没见过的题型,或者需要多步推理的题,它就开始瞎编。因为它的“智力”全在权重里,权重没见过的模式,它推理时也补不出来。

就像你对着木桩练了很久的拳法,结果发现上了战场以后,对方不会站着不动,而且还会使用武器。

另一条是test-time路线。训练完的模型只是个半成品,真正答题时,先让它写一大段推理,想得越久、答得越好。智力不再只来自权重,还来自于每次调用时现场的推理。

换句话说,智力被搬进了上下文。

Opus 5.5走的就是test-time路线。

官方有这么一条声明:除非特别注明,所有成绩都跑在“adaptive thinking at max effort”(最大力度的自适应思考)下。

而且从这一代开始,Opus ...

字母AI | tmtpost​.com • Sep 25, 2026
More from @forbesesr
  1. Sep 25, 2026❤️欢迎来到 TGRSS —— Telegram 上最智能、最全能的 RSS 自动内容矩阵! 在这里,你不需要手动刷新网页、不需要下载 App、不需要错过任何热点。 TGRSS 通…
  2. Sep 25, 2026灵巧手不是等AGI才用:一份被误读的物理AI落地地图 (本文作者为 韩工观察,钛媒体经授权发布) > 文 | 韩工观察 9月21日,宇树发布Dex5-S灵巧手:22个主动自由度、1…
  3. Sep 25, 2026CTA集体回撤:传统基本面研究,碰到极端行情就容易失灵? (本文作者为 万联万象,钛媒体经授权发布) > 文 | 万联万象 今年做CTA策略(管理期货策略)的人,普遍感觉不好做。…
  4. Sep 25, 2026CT无创筛查食管癌,达摩院AI站上临床前夜 (本文作者为 全球财说,钛媒体经授权发布) > 文 | 全球财说,作者|章悦,编辑|于清 近日,阿里达摩院联合四川省肿瘤医院、中山大学肿…
  5. Sep 25, 2026华能国际一口气新设三家分公司,煤电的“止血带”和新能源的“手术刀”同时上了 (本文作者为 预见能源,钛媒体经授权发布) > 文 | 预见能源 预见能源获悉,华能国际9月22日董事会…
  6. Sep 25, 2026起底AI网恋:4700个AI围猎2.5万人,10元造完美情人 (本文作者为 硅基降临,钛媒体经授权发布) > 文 | 硅基降临 你在交友软件上,网恋的对象,很可能不是真人。 一家公…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →