← 吴兆华个人网站站内作者版本 · 本页为长期 canonical · 最近核验 2026-07-21
Kimi暂停新用户订阅、请求量暴增、算力逼近上限及主权益与Code拆分的编辑型信息封面
KIMI K3 × 算力 × AI订阅制|旗舰解读

Kimi为什么
暂停收钱?

K3发布后的48小时内,请求量迅速逼近集群极限,C端新会员暂停,通用权益与Code准备拆分。表面是一场容量告急,背后是一份AI订阅制的商业压力测试。

撰文|吴兆华事实核验基准|2026年7月21日阅读约28分钟

一家互联网公司最喜欢看到的场面,通常是用户蜂拥而至、付费按钮被反复点击。可在7月19日晚上,Kimi却做了一个反常决定:暂时不再接受新的个人会员订阅。

这不是因为没人愿意买。恰恰相反,Kimi说,K3发布后的48小时里,用户请求量大幅超出预估,已经逼近现有集群的承载极限。为了保护已经付钱的人,它把新付费入口先关上,把有限算力优先留给存量会员。

如果只把这件事理解成“服务器爆了”,会错过更重要的变化:当AI从偶尔回答问题,变成能持续数小时写代码、调工具、读仓库、改文件的Agent,一张固定月费的会员卡,开始同时承诺功能、算力、并发、响应速度与任务完成概率。Kimi遇到的,不只是一次流量高峰,而是旧订阅制第一次被新型工作负载正面撞击。

01|事件本身暂停的是C端新订阅,不是注册与服务

老会员优先保障,扩容后逐步恢复;恢复时间、拆分价格仍未公布。

02|真正矛盾固定月费,撞上高度可变的Agent成本

一次用户任务可能触发多轮推理、工具调用、长上下文和失败重试。

03|结构变化会员正在变成“算力优先权”

主权益与Code拆分,本质是按工作负载建立不同容量池、定价和服务等级。

01 / 先把事实说清楚

三天里,Kimi发生了什么

7月16日Kimi K3发布

2.8万亿总参数、原生视觉、最高100万token上下文,进入Kimi、Work、Code与API。

随后48小时需求超出预估

官方没有公布用户数和请求数,只确认请求量快速上升并逼近现有集群极限。

7月19日暂停C端新订阅

把现有算力优先投入已订阅用户,并全速推进扩容。

后续计划拆分两类权益

Kimi主权益与Kimi Code面向后续新订阅用户分开,价格与迁移细则尚未公开。

Kimi团队关于算力紧缺与会员暂停开放的完整公告

公告里最关键的三句话

第一,压力来自“过去48小时的请求量”。这描述的是上线后的即时容量压力,不等于公司所有芯片永久不足。

第二,暂停的是“C端新用户订阅”。不是停止注册,不是关闭免费使用,也不是现有会员失去服务。

第三,权益拆分被写进了解法。说明问题不只靠买卡扩容解决,原来的产品与计费结构也需要重做。

公告能够证明什么
  • 请求量远超内部预测
  • 现有集群逼近承载上限
  • 公司优先保护已付费用户
  • 正在扩容并计划逐步恢复
  • 未来新订阅将拆分主权益与Code
公告不能证明什么
  • Kimi停止新用户注册或停止服务
  • 中国大模型行业整体“无卡可用”
  • K3一定低效,或一定是饥饿营销
  • 拆分后一定涨价或一定更便宜
  • 需求高峰已经转化成长期留存

这层边界很重要。需求爆发是事实,但官方没有披露请求量、活跃用户、GPU数量、平均排队时间和恢复日期。它证明K3经历了一场真实的交付压力测试,却还不足以单独证明持久的产品市场匹配,更不能替代后续留存、付费和稳定性数据。

02 / 为什么偏偏是K3

模型更强了,一次“请求”也变重了

K3不是一次普通的聊天模型升级。按照官方技术博客,它把长程代码、知识工作、视觉理解和Agent执行放到了同一套模型里。用户看到的是一个输入框,后台面对的却可能是一段持续很久的工程任务。

2.8T总参数规模

全球首个开放的3T级模型,是官方表述;完整权重计划于7月27日前开放。

16/896每token激活专家

MoE稀疏激活降低单token计算量,但完整专家仍需被存储、分布和路由。

1M最高上下文

能读大型代码库和超长资料;“最高”不代表每次请求都会用满。

64+官方部署建议

Kimi建议以64张以上加速器构成高带宽超节点,减少专家并行通信瓶颈。

Kimi K3官方技术博客主视觉
真实素材|Kimi K3官方技术博客主视觉。官方同时承认:K3总体能力仍落后于其所称的最强闭源模型,且实际用户体验存在明显差距。本文因此不把厂商Benchmark等同于用户体验。

“只激活16个专家”,为什么还会难以扩容

计算效率每次只走少量专家

每个token不需要运行全部2.8万亿参数,这让超大MoE模型具备可行的推理成本。

工程复杂度所有专家仍要随时待命

权重需要跨设备存放,路由结果决定数据发往哪里;高并发时通信、内存与负载均衡会成为一等问题。

这正是“大模型参数很多,但API价格仍可以很低”和“上线后扩容仍很难”能够同时成立的原因。稀疏激活减少了每个token的计算,却没有抹掉模型体量、设备互联、权重存储、路由均衡和服务工程。

Kimi官方还特别指出,KDA给传统前缀缓存带来新挑战;为此团队为vLLM贡献了相应实现。官方API宣称,在代码工作负载里,依托Mooncake分离式推理架构,缓存命中率超过90%。这说明成本优势并非只来自模型本身,还依赖缓存、调度和基础设施共同工作。

03 / 用户点一次,后台可能跑很多轮

Agent把“一次请求”变成一条任务链

传统对话的资源模型相对容易理解:读入一段文字,生成一段回答。代码Agent则可能先读仓库、制定计划、搜索文件、调用终端、修改代码、运行测试、发现错误、再次修改,最后再整理结果。每一步都可能重新调用模型。

用户看到一个任务,集群看到六类负载

01长上下文读入仓库、文档、历史对话进入prefill
02规划与推理拆任务、选工具、判断下一步
03工具执行终端、浏览器、文件与外部服务
04结果回填日志和文件继续进入上下文
05失败重试定位错误、换方案、再次运行
06输出与验证生成内容、检查结果、交付产物

重要:这是一张机制图,不代表每个Kimi任务固定调用六次。真实调用次数取决于任务、模型、工具、缓存命中和失败情况。

同样是一个用户,资源消耗可能差几十倍

短问答
长文分析
多工具Agent
长程Code任务
极高
示意关系,不是Kimi真实计量数据。

容量不是只有“GPU够不够”

加速器数量
显存与带宽
缓存与调度
瞬时并发
任何一项先触顶,都可能表现为排队、限流或失败。

K3官方案例里既有允许模型连续运行24小时的GPU内核优化,也有一次48小时的芯片设计任务。这些案例是厂商展示,不代表普通会员都能获得同样时长,却足以说明产品方向:模型不再只是“回答得更好”,而是在争夺持续占用计算资源的工作。

Kimi K3官方MiniTriton CUDA内核优化案例性能图
真实素材|Kimi K3官方MiniTriton案例图。它证明的是厂商展示的长程执行能力与优化结果,不是普通会员任务的速度承诺,也不能据此推算Kimi集群的真实成本。
04 / 真正被击穿的,是旧会员逻辑

固定月费,面对一条长尾成本曲线

用户购买一个固定价格

每月付39、79、159或599元折算年费,期待随时可用、速度稳定、任务能完成。

VS
平台承担一笔高度可变的成本

输入、缓存、输出、思考强度、工具轮次、并发与失败重试共同决定真实资源消耗。

单个会员毛利 ≈ 订阅收入 − Σ(每次任务的真实推理成本)

当少数重度Agent用户消耗远高于平均值,固定订阅会出现明显的交叉补贴与容量波动。

Kimi自己的计费说明提供了一个直观例子:一个简单请求可能只消耗约0.03元,而一个多步骤的一周旅行规划示例约1.6元,差距超过50倍。这个数字不是K3成本审计,也不是Code任务报价,但它说明平台面对的从来不是“每个请求都差不多”。

API把这种差异写得更直接:K3每百万token的缓存命中输入、未命中输入和输出,公开价格分别为0.30、3和15美元。缓存是否命中,单是输入价格就相差10倍;而模型切换会让既有上下文缓存失效,Kimi Code文档也明确提醒刚切换时消耗会偏高。

控制工具解决什么问题用户感受到什么
额度与限流阻止极少数重度用户无限消耗公共池小时、周、月额度;高峰期排队
分层会员让更高并发、更长上下文有独立价格不同套餐的速度、并发和能力不同
超额计费把重度使用从平均订阅中拆出Extra Usage、按token或按请求付费
工作负载隔离避免Code高峰挤占聊天与办公容量主会员与Code会员、容量池分开
暂停新增供给暂时无法追上需求时保护已售权益不能新购,但存量会员优先

因此,Kimi暂停新订阅并不等于商业模式失败。相反,它显示公司愿意用短期收入换取存量服务质量。但这也暴露了预测和容量准备不足:如果恢复时间很长、透明度不足,保护老用户的决定仍可能演化成信任问题。

05 / “主权益与Code拆分”不是一句运营话术

它是在重新切分算力池

Kimi主权益

聊天、App、Web与Work

  • 短任务占比相对更高
  • 搜索、阅读、写作与办公
  • 用户更在意日常响应与连续可用
  • 峰值更接近大众互联网流量
Kimi Code

终端、IDE与长程执行

  • 多文件、长上下文与工具调用
  • 单任务时长与消耗方差更大
  • 用户更在意持续执行、恢复与吞吐
  • 高峰更像专业生产力负载

一旦两类权益分开,平台就可以分别设计并发、上下文、推理强度、任务时长、优先级、超额计费和故障恢复。这既是价格拆分,也是容量治理、故障隔离与服务等级的拆分。

对只使用聊天的人,拆分可能减少对重度Code用户的交叉补贴;对只写代码的人,套餐也可能更精准。可对两边都用的用户,未来总成本未必下降。真正决定用户是否接受的,不是“拆不拆”,而是老会员迁移、价格、额度与服务承诺能否讲清楚。

已确认

官方只宣布后续新订阅用户将拆分权益,并未公布新套餐价格、恢复日期和老会员迁移规则。

合理推断

拆分有利于建立独立容量池和定价,但最终是否独立付费、是否共享钱包,要以正式产品页面为准。

待观察

“已有订阅用户全部权益不受影响”能否在高峰期持续兑现,需要实际可用性、排队和任务恢复数据验证。

06 / 一个看似矛盾的问题

融了几十亿美元,为什么还会缺算力

把公开材料按证据强度分开,资本故事比一句“融了几十亿美元”更复杂。阿里巴巴在2024财年年报中正式披露,以约8亿美元取得月之暗面约36%的股权;2026年5月,彭博与TechCrunch援引财务顾问及知情人士称,公司完成约20亿美元融资、估值超过200亿美元;6月又传出以约300亿美元估值洽谈新融资。后两组属于媒体与交易参与方口径,不是经审计财报,更不能直接等同于公司账上可自由支配的现金。

IPO也必须分阶段描述:3月是“据报考虑香港IPO并接触投行”,5月是“据报拟调整红筹架构”,7月又出现“最快约六个月”的报道;截至2026年7月21日,仍未见港交所正式递表或招股书。因此,可以写上市准备信号增强,不能写成IPO已经确定。

钱可以购买资源,但不能把资源瞬间变成稳定服务

采购拿到合适的加速器与网络

卡的型号、显存、互联和交付周期必须匹配模型部署方案。

工程把设备编成可用集群

权重切分、专家路由、缓存、调度、监控和回归测试都需要时间。

运营让高峰服务仍可预测

新增容量若没有限流、故障隔离和服务等级,仍可能被下一次高峰迅速吃满。

K3官方建议使用64张以上加速器组成高带宽超节点。这意味着扩容不是把任意几张GPU插入现有机房。对MoE模型而言,设备之间怎样交换数据、专家负载如何均衡、缓存如何复用,会直接决定吞吐和延迟。

而且,需求不是稳定水位。模型发布会带来短期洪峰,代码任务又有很长的尾部:一些用户几秒结束,一些任务持续数小时。为了不让所有人一起变慢,平台需要按用户、任务、模型和服务等级预留冗余。资本充足能提高解决问题的能力,却无法取消建设、适配和验证周期。

把这一幕放在潜在IPO背景下看,暂停新付费还有另一层意义:上市前的公司不仅要证明模型能力,也要证明它能管理容量、兑现付费权益、把新增收入转化为可持续毛利。一次漂亮的Benchmark可以带来流量,稳定交付才决定流量能否变成商业质量。

正式披露

阿里约8亿美元、约36%股权来自上市公司年报,证据等级最高;它说明重要股东投入,不说明这些钱全部购买了GPU。

媒体口径

2026年的融资额、估值与ARR主要来自交易顾问和媒体信源。ARR不等于确认收入,更不等于毛利、利润或现金。

仍然未知

月之暗面的GPU数量、云合同、推理毛利率、资本开支、扩容周期与单位任务成本均未公开。

07 / 由点到面:AI行业正在换一套产品语言

未来卖的不是一个按钮,而是一档计算服务

01能力

模型能不能完成任务,仍是基础,但不再是唯一竞争。

02容量

高峰期有多少并发、能支撑多长任务,决定真实可用性。

03优先级

谁先执行、谁排队,会员正在购买稀缺算力的顺序。

04恢复力

任务失败能否续跑、降级、切换与回滚,决定生产依赖。

05成本透明

额度为何下降、缓存是否命中、超额如何计费,决定信任。

这意味着大模型竞争正在从“谁的模型更聪明”扩展为“谁能把聪明稳定地交付出去”。训练出一个模型是科研与资本竞赛;把它变成每天都能用的产品,则是推理基础设施、容量规划、计费设计和客户运营的综合竞赛。

开源也不会自动消除这个问题。K3完整权重计划开放,企业和云平台因此多了一条自建路径;但2.8万亿参数和64张以上加速器的部署建议说明,它并不是普通用户下载后就能在个人电脑运行的模型。开放权重扩大了供给选择,却把硬件、网络与服务工程门槛交给了部署者。

模型发布完成,不等于产品交付完成。AI公司的下一道护城河,是把不确定的智能,装进一套可预测的服务里。

——本文核心判断

稀缺算力最终分给谁

容量池平台为什么需要它主要风险常见治理
免费用户获客、口碑、反馈与生态入口收入弱、峰值大、滥用难控低优先级、小模型路由、日限额
付费会员经常性收入与长期留存重度用户成本长尾,体验承诺明确独立额度、优先队列、并发限制
API开发者按使用量计费,扩展应用生态价格竞争与稳定性要求并存Token计费、RPM/TPM、缓存与批处理
企业合同大额、可预测、可预留的合同收入销售周期长,合规和交付更重最低消费、预留容量、SLA与专属部署

当容量紧张时,平台通常不是把所有GPU简单交给“出价最高的人”,而是先保护已经承诺的服务等级,再兼顾收入、增长与战略价值。Kimi本次优先保障既有会员,就是把信任成本排在短期新增收入之前。

对不同角色,这件事分别意味着什么

普通用户:先看自己买的是什么

不要只看“可用K3”,还要看上下文、并发、额度、Code是否包含,以及高峰期规则。

开发者:别把单一模型当成唯一生产依赖

为长任务设计断点、重试、模型降级与成本上限;保留可迁移的Agent框架。

模型公司:容量设计必须进入产品设计

会员、API、Code与Agent不能只共享一个模糊总池;状态透明和恢复机制也是产品。

企业采购:从“能力测试”升级为“SLA测试”

不仅问能否完成,还要测高峰可用性、限流规则、失败续跑、数据边界和价格波动。

投资者:需求爆发与利润改善不是同一件事

关注留存、付费转化、推理毛利、扩容资本开支和服务稳定性,而不只看社交热度。

算力产业链:效率提升不一定减少总需求

更低单次成本可能释放更多、更长的Agent任务;真正受益者仍需用订单和现金流验证。

08 / 这不是Kimi一家公司的特殊烦恼

整个行业都在把“无限会员”改造成算力套餐

把Kimi放回全球产品格局,会看到同一种方向:面向普通用户保留容易理解的月费入口,同时用额度、优先级、Credits、按量计费和独立容量池处理重任务。产品名称不同,本质都是在把稀缺计算资源分配给不同价值、不同成本的工作负载。

服务形态用户看到的商品后台真正治理的对象不能直接比较的地方
Kimi / Kimi Code消费会员、Code权益、API三套入口滚动窗口、共享月度额度、并发、RPM/TPM与临时限流会员额度不等于API Token;Code也不只是一个模型
OpenAI / Codex订阅内Agent用量与额外Credits任务复杂度、共享Agent用量与超额消耗Credits不是美元,也不能直接换算为Token单价
Google / Gemini会员层级、API按量与批处理RPM、TPM、每日请求、长上下文与Thinking输出在线与批处理价格、消费产品与API口径不同
Anthropic / Claude CodeClaude订阅与API分开上下文、附件、工具、模型、会话长度与缓存Claude Code执行产品不能只按模型API价格排名

这也是为什么“谁每百万Token更便宜”越来越不足以回答用户真正的问题。对Agent而言,更有意义的单位是一次成功任务的总成本:它用了多少轮模型、多少工具调用、多少上下文、多少重试,最后是否真正完成。未来的价格战,会从Token单价延伸到任务成功率、稳定性和单位任务毛利。

AI服务价值 ≠ 模型单价最低

更接近:任务成功率 × 可用性 × 速度 × 可恢复性 ÷ 一次成功任务的总成本。

09 / 接下来最值得观察的六个信号

一则公告的结论,还没有写完

恢复速度

是几天内逐步恢复,还是持续较长时间限售?这最能验证扩容难度。

老会员真实体验

暂停新增之后,排队、速度、任务中断是否明显改善?

拆分后的价格与额度

是降低交叉补贴,还是把同一需求变成两次付费?

Code的独立服务等级

是否公布并发、长任务、超额使用、失败恢复和高峰规则?

7月27日权重开放

是否按计划开放完整权重,以及第三方部署的真实成本和性能。

热度能否变成留存

发布期的请求洪峰之后,月活、付费、API调用与企业使用能否持续。

如果恢复很快、老用户体验改善、权益拆分透明,这次限售会成为一次有纪律的容量管理;如果扩容迟缓、套餐复杂、权益解释反复,它也可能成为用户重新评估依赖成本的起点。现在就断言“胜利”或“失败”,都太早。

结语

Kimi关掉的不是一个付费按钮

它暂时关掉的,是“软件可以无限复制、会员可以无限卖”的旧想象。Agent时代,每一次更长的思考、更多的工具和更完整的交付,背后都有一台真实机器在持续工作。

主要公开依据与事实分层

  1. 月之暗面Kimi|关于算力紧缺与会员暂停开放的说明,2026-07-19。
  2. Kimi官方技术博客|Kimi K3: Open Frontier Intelligence,2026-07-16。
  3. Kimi Code官方文档|最新动态,含K3、HighSpeed与Extra Usage说明。
  4. Kimi帮助中心|Kimi Agent概览
  5. Kimi帮助中心|会员体系与额度
  6. Kimi Code文档|会员与用量计算
  7. Kimi开放平台|K3价格与推理强度,中国区页面。
  8. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving
  9. Mooncake官方开源仓库
  10. Kimi开放平台|Context Caching成本说明
  11. 阿里巴巴FY2024年报|月之暗面投资披露
  12. Reuters|Moonshot暂停订阅、融资与潜在IPO背景,2026-07-20。
  13. TechCrunch|约20亿美元融资与估值报道,2026-05-07。
  14. OpenAI帮助中心|订阅内用量与Credits
  15. Google AI for Developers|Gemini API速率限制
  16. Google AI for Developers|Gemini API定价
  17. Anthropic帮助中心|Claude用量限制说明
  18. AP|K3发布与订阅暂停的国际报道,2026-07-20。

说明:文中“已确认”为公开一手材料可直接支持的事实;厂商性能、缓存命中与案例数据均按“官方自述”呈现,不等同于独立审计。“合理推断”“核心判断”为基于产品、技术与商业机制的分析;“待观察”为公开信息尚未回答的问题。本文不构成投资建议。

e签宝吴兆华名片,联系电话13967449069