TGViewer
codedump的电报频道 codedump的电报频道 @codedump_notes · 5.5K subscribers
Post #885 2.73K
#人工智能
#播客

听晚点聊采访群核科技创始人的播客《160: 群核IPO后与黄晓煌聊这15年》,里面听到一句话:
CPU 是用的人越多、边际成本越低;而 GPU 的成本会随用量增长,这是两种芯片的硬件架构决定的

由于之前没有做过GPU编程,所以提问AI解释这段话,Gemini的回答如下。我的理解:CPU可以分片使用,但是GPU的瓶颈在显存,显存无法像CPU内存那样使用虚拟内存来调度存储资源。

这句话的内核在云计算、SaaS(软件即服务)和多租户(Multi-tenancy)基础设施的语境下是完全正确的,但前提必须澄清:这里讨论的“成本”不是芯片制造的规模经济(制造层面两者产量越大,单片边际成本都会降低),而是算力在服务端的部署与分发成本。

这种成本差异确实是由 CPU 和 GPU 截然不同的硬件架构决定的。以下是具体的逐步解析。

一、 CPU 的架构本质:为“控制”与“多任务”而生
CPU(中央处理器)的架构设计目标是低延迟(Low Latency)和复杂的逻辑控制。

强大的上下文切换(Context Switching)能力:CPU 内部拥有巨大的缓存(L1/L2/L3 Cache)、复杂的指令分支预测单元(Branch Predictor)以及专门的硬件虚拟化支持(如 Intel VT-x 或 AMD-V)。这使得 CPU 可以在极短的时间(微秒级)内保存当前任务的状态,切换到下一个任务。
超售(Overprovisioning)的基础:由于这种极速的切换能力,在云服务器上,1个物理 CPU 核心可以被虚拟出多个 vCPU,同时租给数十个不同的用户处理网页请求、数据库查询等相对碎片化的任务。
边际成本递减的逻辑:因为 CPU 极度擅长时间分片(Time-slicing),多加一个轻量级用户,系统只需要多分配一小段时间片,无需增加物理硬件。只要总负载不超过峰值,增加用户的物理边际成本几乎为零,服务器的固定成本被更多用户分摊,单客成本随之断崖式下降。
二、 GPU 的架构本质:为“吞吐”与“并行计算”而生
GPU(图形处理器)的架构设计目标是高吞吐量(High Throughput)和大规模并行处理。

极弱的上下文切换能力:GPU 的芯片面积大部分被数以千计的简单算术逻辑单元(ALU)占据,控制逻辑极其简化,缓存(Cache)非常小。它采用 SIMT(单指令多线程)模型,一旦开始计算,就需要数据如同瀑布一样源源不断地输入。如果要让 GPU 在不同用户/不同任务之间频繁切换,保存和恢复庞大的显存状态会导致极高的延迟和性能损耗,这在工程上是灾难性的。
显存(VRAM)的绝对物理瓶颈:GPU 计算(尤其是 AI 训练和推理)重度依赖显存容量和内存带宽。模型参数和上下文必须驻留在物理显存中。如果一个模型需要 20GB 显存,10个并发用户(假设各自有独立状态或微调模型)理论上就需要占用更多的显存。显存无法像 CPU 内存那样高效地使用虚拟内存(Swap)进行分页调度,一旦显存爆满,GPU 直接 OOM(Out of Memory)宕机。
边际成本随用量增长的逻辑:由于 GPU 无法像 CPU 那样高效地通过时间分片实现大规模“超售”,它只能做“空间隔离”(例如 NVIDIA 的 MIG 技术,将一张大显卡硬切分成几个独立的物理分区)。当用户量或请求量增长时,你无法通过压榨现有 GPU 的碎片时间来消化需求,你唯一的选择是购买新的 GPU 物理硬件。因此,每增加一定量的用户或算力需求,就需要成比例地增加高昂的 CapEx(硬件采购成本)和 OpEx(电力与散热成本)。
三、 总结:时间分片 vs 空间独占
CPU 是“时间共享”架构:像一辆公交车。乘客(任务)上上下下,车辆只要在跑,多载一个人几乎不增加额外油耗。乘客越多,单客成本越低。
GPU 是“空间独占”架构:像高铁的专属货运车厢。每个任务都需要实打实地占据一块物理空间(显存和流处理器阵列)。车厢塞满了,就必须花重金挂载新的车厢,甚至购买新的列车。用户的用量越大,所需的硬件规模呈线性甚至超线性增长。
因此,这句话准确地揭示了现代算力基础设施的商业现实:基于 CPU 的传统互联网应用具有极强的规模效应;而基于 GPU 的 AI 应用(如大模型推理),其算力成本目前仍表现为沉重的线性增长,极具商业挑战性。
Xiaoyuzhoufm 160: 群核IPO后与黄晓煌聊这15年:被嫌弃的GPU、冠军酷家乐、空间智能、六小龙 听《晚点聊 LateTalk》上小宇宙。 《晚点聊 LateTalk》由《晚点 LatePost》出品。 最一手的科技访谈,最真实的从业者思考。
More from @codedump_notes
  1. Sep 27, 2026#系统编程 讲解Go语言并发主题的小书:《Go concurrency distilled》
  2. Sep 22, 2026#开源软件 开源本来承载的主要任务之一就是赢得信任,智谱这一把开源不但没有赢取信任,反而让更多人感到了疑问,比如我。
  3. Sep 22, 2026#开源项目 #Rust #数据库 hawdb:Rust编写的嵌入式图数据库,用于Nowledge产品中管理本地图数据。
  4. Sep 21, 2026#Rust #人工智能 最近看了好几个Rust相关的新闻,比如: * Rust在微软内部升级为一级语言:《Guest Post: Rust Is Tier-1 Language a…
  5. Sep 19, 2026#人工智能 这个翻译可以说是 信达雅 了。
  6. Sep 15, 2026#人工智能 《我不得不把才华埋葬在昨天》,Deepseek 核心开发的文章,也许再过一段时间,他就不用亲手写算子了。
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →