Kimi K3 一点也不吃内存

这个标题不是我起的,是上周一位读者留给我的"作业"。


那篇 K3 的文章发出来后,有位读者(网名"小肥狼")在评论区留言质疑我,说得还挺专业:


"推理吃的是 CPU 和 DDR 内存,HBM 是显存、是跟着 GPU 走的,那玩意儿主要用在训练。你说 K3 让需求往 HBM 跑,搞反了吧?"


这话听着专业,也代表了很多人的直觉。但它只对了一半 —— 训练吃 HBM,这句没错;推理只吃 CPU 和普通 DDR,这句恰好说反了。


真相是:Kimi K3 确实"不吃内存"。


它不怎么依赖你我电脑里那种普通的 DDR 内存条。它吃的是更贵、更紧、更快的另一种内存 —— HBM(高带宽内存):直接贴在 GPU 旁边、带宽是普通 DDR 的十几倍、2026 年的产能早被订光、连 2027 年都基本订满了。至于普通 DDR,在 K3 身上只是个降级备胎 —— 没有集群时凑合跑跑、每秒吐几个字,根本上不了生产。

说实话,这条留言我特别喜欢 —— 因为很多人心里,都是这么想的。而这个想法,恰恰是当下 AI 投资里一个特别普遍、也特别关键的误区。今天这篇,我就借着他这个质疑,把"K3 这类大模型到底吃不吃 HBM"这件事,掰开揉碎讲清楚。搞懂了这个,你才真看得懂,钱为什么在往"内存"这条线上涌。


 


那推理,为什么反而更吃 HBM?


关键就在这里。像 K3 这种 2.8 万亿参数的巨无霸,跑起来(也就是"推理",模型真正干活、回答你问题的过程),不但吃 HBM,而且吃得特别凶。


为什么?我给你打个比方,你一秒就懂。


 


大胃王和它的喂食管


你可以把 GPU 想象成一个饭量惊人的大胃王,一秒钟能干一大堆活。


但问题是:饭,得有人喂给它。喂得够不够快,直接决定它能干多少活。


HBM,就是那根又粗又短的喂食管。 一次能塞一大口,大胃王吃得饱、手不停,活儿干得飞快。


而 DDR 普通内存,是根又细又长的吸管。 大胃王力气再大,也只能在那儿干等着,一口一口慢慢吸 —— 饿得发慌,活儿自然干得慢。


这就是关键:大模型跑起来,最怕的从来不是"算得慢",而是"喂不饱"。


模型的权重(可以理解成它的"记忆")必须全部常驻在内存里待命。K3 是混合专家架构(MoE),896 个专家每次只唤醒十几个干活 —— 但没人知道下一个字会唤醒谁,所以 2.8 万亿参数、压缩后约 1.4TB 的"记忆"得全量摆在手边。每生成一个字(token),都要高速读取本轮被激活的大量权重,并在多张加速卡之间频繁交换数据。模型越大、并发越高,"搬运"这条路就越容易卡脖子。


所以你就明白了:推理这件事,本质是个"带宽活",而不是"算力活"。GPU 的算力经常在那儿闲着,等 HBM 把数据喂过来。 "推理不吃 HBM",是彻底搞反了。


 


这不是我说的,是 K3 官方自己说的


你可能觉得,这是我为了圆自己的观点在强行解释。


不是。这是 K3 官方自己白纸黑字写的。


月之暗面在 K3 的官方技术博客里,明明白白建议:把 K3 部署在 "64 张或以上加速器组成的超节点"上 —— 这里说的"加速器",就是带 HBM 的 GPU、AI 芯片。它还专门强调,推理效率会因为"更大的高带宽通信域"而受益。


翻译成人话:K3 官方推荐的标准跑法,就是一大堆 HBM 芯片堆成的集群,根本不是那位读者说的"CPU 加 DDR"。


为什么非要这么大阵仗?看一组数字就懂了:上一代 K2,官方最小部署单元是 16 张卡;到了 K3,起步就是 64 张。开源旗舰模型的"最小服务单元",一代比一代大。


背后是同一个原因:云端推理对 HBM 的需求,是一个乘法 —— 模型有多大 × 要部署多少份 × 同时多少人在用 × 每个人的对话要保留多少上下文。


(行业里,最后这一项有个专门的名字,叫 KV cache。)


这四个乘数,现在全部在涨。装不下,就摊开;摊开了,就得靠高带宽把它们捆在一起。


那 DDR 那条路就完全没用吗?也不是。它是"备胎"。 当你没有集群、只有一台大内存服务器时,确实可以用 CPU 加 DDR 硬跑 —— 但慢到每秒只吐几个字。自己玩玩可以,真拿去做生意、服务成千上万的用户,根本不可能。


所以那位读者的思路,放在自己电脑上跑个小模型,是对的;但放到 K3 这种要服务全世界、2.8 万亿参数的巨无霸身上,就不成立了。

 


两个诚实的"但是"


讲到这,如果我只说"所以 HBM 稳赢",那我就又变成一个只报喜的自媒体了。有两个可能"泼冷水"的因素,我必须诚实地摆出来。


第一,模型架构一直在优化,确实在压低单位需求。 比如 DeepSeek V4,在百万上下文这种最烧内存的场景下,已经把单 token 的推理计算量压到了上一代的三成以内、缓存占用压到一成。模型越来越聪明,每跑一次占的资源确实在降。


但这里有个反作用力在兜底—— 就是我上一篇讲的"杰文斯悖论":跑一次越省钱,大家就跑得越多,总用量不降反升。过去三年,AI 一直是这个剧本。这两股力量谁跑得快,是接下来要看的关键。


第二,有些新方案想用另一种更快的内存(SRAM)来分蛋糕。 它确实快,适合抢那些对速度要求最变态的场景。但它有个死穴:太贵、装得太少,装不下 K3 这种 TB 级别的庞大身躯。所以它顶多分走金字塔尖那一小块,底下那个最大的主战场 —— 装权重、扛并发 —— 目前仍然是 HBM。


 


但真正的关键,不是"需求往哪走"


好,"推理吃 HBM、需求往内存走"这件事,讲到这应该说清楚了。


但如果文章到这就结束,那我只讲了半句话。我上一篇留下的那个框架是:需求迁移只是上半场,利润迁移才是正戏。 需求涌向 HBM,回答的是"谁的东西被用得更多";利润能不能真正沉淀在 HBM 厂商手里,回答的是"谁最后把钱留下"。这得看三道闸关不关得住:


第一道,供给纪律。 HBM 现在这么赚钱,是因为全球就三家(海力士、三星、美光)能大规模供货,谁也不敢乱扩产、破坏价格。可一旦大家为了抢这波需求疯狂扩产(何况还有新玩家在往里挤),量涨上去了,价格和利润可能反被自己人打下来。


第二道,买方的议价权。 现在买 HBM 的都是英伟达这样的巨头。到了下一代 HBM,这些大买家开始亲自参与设计芯片的底层结构,把存储厂往"代工厂"的位置上挤 —— 谁掌握设计、谁就掌握定价,利润就往谁那儿偏。


第三道,长约封顶。 现在很多产能靠长约锁定,比如美光和 16 家大客户签了战略协议,直接覆盖到 2030 年,锁定的最低合同收入就有约 1000 亿美元。好处是收入的确定性大大提高;但这类长约里,不少价格是固定的、或者设了上下限 —— 锁住收入的同时,也把这轮涨价的天花板提前标好了。


说白了 ——


钱,正从"模型的利润",迁向"内存的账单"。但这张账单最后落进谁的口袋,不看谁家模型最聪明,看这三道闸。


 


回到那位读者的质疑


"K3 一点也不吃内存"吗?


恰恰相反。它不怎么依赖 DDR,却重度依赖 HBM —— 它不是不吃内存,是吃的是最贵、最紧俏的那种内存。


而这背后,是我一直在跟你讲的那件事:当所有人都在争论"谁家的模型最聪明"时,钱,其实正悄悄流向谁家的带宽最宽、产能最紧。AI 时代的超额利润,往往不在最大的市场,而在最紧的瓶颈。


HBM,只是这轮最显眼的那个瓶颈。往后,钱还会继续往更上游、更紧的地方流 —— 比如封装、比如光互连里那个小小的激光器。那些,我们后面单独讲。


所以接下来,我只看三个信号:几大云厂的资本开支,是继续加码还是开始松口;模型的架构优化和实际用量,谁跑得更快;HBM 这三家,守不守得住不乱扩产的纪律。这三个信号往哪走,就知道这条利润链,是继续加固,还是开始松动。


资本从不消失,它只是不断迁移。看懂了它往哪迁,比预测哪只票会涨,重要得多。


最后,特别谢谢"小肥狼"那条质疑 —— 是它让这篇文章有了由头。也欢迎你在评论区继续挑刺,说不定下一篇,就是被你问出来的。


我们下篇文章见。


实盘观察,不构成投资建议。


—— 熊猫校长 Ming | AI 基建研究


相关研究标的:

$SK海力士(SKHY)$  $美光科技(MU)$  $英伟达(NVDA)$  

# 存储股连崩第二日,SK海力士再挫14%,抄底吗?

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论2

  • 推荐
  • 最新
  • Alex_0099
    ·02:58
    精彩
    Kimi just proved more GPU and HBM needed
    回复
    举报
    收起
    • 熊猫校长 Ming
      对的 我的文章内容就是说这个哈
      07:39
      回复
      举报