← 吴兆华个人网站站内作者版本 · 本页为长期 canonical · 最近核验 2026-07-21

MODEL RESEARCH · 2026.07

一份面向模型选型、企业落地与高频AI用户的证据型研究

如果只看“2.8万亿参数”,Kimi K3很容易被理解成又一次规模竞赛。但把官方文档、定价、Kimi Linear与Attention Residuals两篇技术论文,以及Fable 5、GPT‑5.6 Sol的公开资料放在一起,真正值得注意的并不是“大了多少”,而是Kimi第一次同时改写了三个坐标:序列长度、网络深度和Agent工作流

先说结论

这不是K2.7的小升级。 K3把总参数推到2.8T、上下文推到1,048,576 tokens,并引入始终开启的深度推理与新的工具调用机制。
技术主线比参数更重要。 Kimi Delta Attention解决“横向看得更长”的成本,Attention Residuals尝试解决“纵向堆得更深”时的信息稀释。
规格已经进入前沿旗舰同一张表。 K3、Fable 5和GPT‑5.6 Sol都在约100万上下文;K3把单次最大输出上限推到100万tokens,远高于另外两者的128K。
价格有吸引力,但K3不再是廉价模型。 未缓存输入/输出为3美元/15美元,分别是K2.7 Code的约3.2倍和3.75倍;但仍显著低于Sol与Fable。
最关键的证据缺口仍在。 截至2026年7月17日,官方没有发布K3标准基准表、激活参数、训练数据规模或模型权重;Artificial Analysis也尚无K3独立成绩。因此它是“前沿挑战者”,还不是已被证实的行业前三。
图1|从K2.6/K2.7到K3:规模、上下文、推理与价格同时换挡。来源:Kimi官方文档,作者整理。

图1|从K2.6/K2.7到K3:规模、上下文、推理与价格同时换挡。来源:Kimi官方文档,作者整理。

一、这次升级有何不同:Kimi换了一套目标函数

K2时代,Kimi最鲜明的标签是“开放权重、Agent能力强、价格低”。K2.6的官方模型卡披露了1T总参数、32B激活参数、256K上下文;K2.7 Code继续强化长周期编码,API未缓存输入0.95美元、输出4美元。〔4—6〕

K3改变了这套平衡。官方给出的2.8T是总参数,但没有披露激活参数,也没有明确公布专家路由规模。对MoE模型而言,总参数决定知识与容量的上限,激活参数才更接近每个token实际消耗的计算量。因此,2.8T可以证明规模跃迁,却不能直接证明推理成本提升了2.8倍,也不能直接换算成能力排名。

更值得重视的是产品取舍:K2.6同时支持思考与非思考,K3则始终开启推理,目前reasoning_effort只支持max。这意味着K3从一开始就不是面向所有简单问答的默认模型,而是为软件工程、知识工作、复杂研究和长周期任务设计的“重型发动机”。〔1—3〕

K3真正的分水岭,不是从1T变成2.8T,而是Kimi开始愿意用更高价格、更长思考和更复杂接口,换取一次把难任务做完的概率。

二、技术底座:一个负责“看得长”,一个负责“堆得深”

图2|K3的三维升级:KDA管理序列长度,AttnRes管理网络深度,动态工具加载管理Agent复杂度。

图2|K3的三维升级:KDA管理序列长度,AttnRes管理网络深度,动态工具加载管理Agent复杂度。

1. Kimi Delta Attention:降低长上下文的记忆成本

标准Transformer的全注意力很强,但序列越长,注意力计算和KV Cache压力越大。Kimi Linear论文提出的Kimi Delta Attention(KDA),用更细粒度的门控去更新有限状态记忆,并与少量全局注意力层混合。论文中的48B/3B实验模型采用3:1的KDA与MLA层比例;在相同训练配方下,研究团队报告其在1M上下文下最高减少75%的KV Cache,并取得最高约6倍解码吞吐。〔7〕

但这里必须划清边界:这些效率数字来自Kimi Linear研究模型,不是K3线上服务的实测指标。K3官方只说“Built on Kimi Delta Attention”,没有披露K3的层比例、激活参数、吞吐或KV Cache实测。正确的表述应是:K3继承了已经公开验证过的架构方向,但K3自身的工程收益仍待单独数据证明。

2. Attention Residuals:让深层网络学会选择“该听谁的”

现代大模型通常把每一层输出以固定权重不断累加。网络变深后,隐藏状态规模持续增长,早期层的贡献容易被稀释。Attention Residuals(AttnRes)把这种固定累加改成对前序层输出做内容相关的softmax注意力:当前层不再平均继承所有历史,而是根据输入选择更有用的层。

为了控制训练时的内存和通信成本,论文进一步提出Block AttnRes,把层分组并对块级表示做选择。研究团队在48B总参数、3B激活参数的Kimi Linear模型上训练1.4T tokens,观察到更均匀的深度方向输出与梯度分布,并在所测任务上持续改善。〔8〕

如果说KDA是在token序列的“横轴”上压缩成本,AttnRes就是在网络层数的“纵轴”上减少信息损失。两者同时进入K3,意味着月之暗面这次不是简单复用K2架构再扩大专家数,而是在尝试建立一条适合超大规模、超长上下文的完整架构栈。

三、1M上下文只是表面,真正的新能力在“工作流长度”

K3的上下文窗口是1,048,576 tokens,是K2.6/K2.7的4倍。更激进的是,官方文档写明max_completion_tokens默认131,072,最高可设到1,048,576。换句话说,K3不仅可以“读”100万tokens,理论上也可以一次“写”接近100万tokens;Fable 5与GPT‑5.6 Sol的单次最大输出均为128K。〔1、10、12〕

这并不意味着企业应该让模型动辄生成百万tokens。长输出会放大延迟、成本、偏航和验收难度。它真正有价值的地方,是给大型代码迁移、超长报告、海量文件重组和持续Agent日志留下更高的系统上限,减少过去因为输出上限而被迫切段、重启或丢失状态的情况。

K3还新增了两个面向Agent的接口:tool_choice可以要求或限制调用工具;动态工具加载允许把完整工具定义放到对话中需要的位置,而不是每轮都把所有工具塞进提示词。对拥有几十到几百个工具的企业Agent,这会直接影响上下文占用、工具选择准确率和长期运行稳定性。〔1、2〕

一个容易被忽略的限制

K3目前只能使用max推理强度,温度、top_p等采样参数也被固定;官方联网搜索仍在更新中,并明确不建议近期用于生产。这说明首发版已经具备“重任务”能力,但还没有把速度、成本与推理强度的控制面做完整。

四、价格:比顶级旗舰便宜,但比上一代Kimi贵得多

图3|示例成本:10万未缓存输入 + 1万输出。只比较模型token费用,不含工具调用、优先处理与税费。

图3|示例成本:10万未缓存输入 + 1万输出。只比较模型token费用,不含工具调用、优先处理与税费。

K3每百万tokens的未缓存输入、缓存命中输入和输出价格分别是3美元、0.30美元和15美元。相较K2.7 Code的0.95/0.19/4美元,K3未缓存输入约涨3.2倍,输出约涨3.75倍。〔2、4〕

但把它放进前沿旗舰组,价格又非常克制:GPT‑5.6 Sol为5/0.5/30美元,Claude Fable 5为10/1/50美元。按“10万未缓存输入+1万输出”的单次任务估算,K3约0.45美元,Sol约0.80美元,Fable约1.50美元;如果10万输入全部命中缓存,则约为0.18、0.35和0.60美元。〔2、9—12〕

这说明K3的经济性不是“便宜模型”,而是用接近GPT‑5.6 Terra的输出价格,挑战Sol和Fable承担的工作负载。对于知识库前缀稳定、同一批文档反复提问的场景,10倍缓存折扣尤其重要。反过来,如果请求短、任务简单、缓存难以复用,K3始终max推理的额外时间与token消耗可能抵消单价优势。

五、和Fable 5、GPT‑5.6 Sol相比,K3到底怎么样?

图4|三款旗舰的已公开规格对照。K3“未知”项代表尚未披露,不代表能力为零。

图4|三款旗舰的已公开规格对照。K3“未知”项代表尚未披露,不代表能力为零。

先看确定的部分:三者都进入约100万上下文;K3价格最低、最大输出最高,并且官方API原生支持图像与视频输入。Fable 5的优势是已被公开评测和客户案例验证的长周期自治与复杂知识工作能力;Sol的优势是工具编排、编程、计算机操作、设计和知识工作之间更均衡的端到端效率。

图5|公开评测不是一边倒:Sol在专业Agent与编码综合指数领先,Fable在综合智能与SWE‑Bench Pro领先。K3尚未进入同口径公开评测。

图5|公开评测不是一边倒:Sol在专业Agent与编码综合指数领先,Fable在综合智能与SWE‑Bench Pro领先。K3尚未进入同口径公开评测。

Fable 5:当前的“能力上限”,但价格与安全边界都更重

Artificial Analysis当前快照中,Fable 5综合指数约60,位居公开可用模型前列;OpenAI发布页引用的同一指数是59.9。Fable在SWE‑Bench Pro上为80%,也在GDPval‑AA v2上以1759.6 Elo略高于Sol。Anthropic把它定义为适合数天级、异步、长周期Agent的Mythos级公开模型。〔9、11、15〕

代价同样清晰:10/50美元的输入输出价格是三者最高;Fable要求30天数据保留,不支持Zero Data Retention;部分生物与网络安全请求会拒答或回退到Opus 4.8,Anthropic称平均影响少于5%的会话。对受监管数据和敏感研发,这些不是边角问题,而是架构选型条件。〔11—13〕

GPT‑5.6 Sol:不是所有单项第一,但“完成单位工作”的效率最强

Sol在Artificial Analysis综合指数上约59,仅比Fable低约1分;但在Artificial Analysis Coding Agent Index上为80,高于Fable的77.2。OpenAI公布的Agents’ Last Exam是52.7%对40.5%,Terminal‑Bench 2.1是88.8%对83.1%。同时,Fable在SWE‑Bench Pro以80%明显高于Sol的64.6%。这组结果说明,两者不是简单的“谁全面碾压谁”:Fable更像深度与长程一致性上限,Sol更像工具密集型专业工作的高效率执行者。〔9、16〕

K3:规格已经入场,排名还没有证据

截至本文研究日,K3没有出现在Artificial Analysis的独立模型页中,官方快速开始和价格页也没有标准基准表。Moonshot AI官方Hugging Face模型列表与GitHub主页尚未出现K3权重或专门模型仓库。〔1、2、14、17、18〕

因此,任何“已经超过Fable 5”或“稳居世界前三”的结论,目前都属于先于证据的判断。更严谨的说法是:K3在规格、价格和架构雄心上进入了前沿旗舰候选集,但在第三方质量、速度、稳定性和真实成本上仍处于待验证阶段。

六、Kimi在现有大模型中,究竟是什么位置?

如果用一条排行榜给答案,会误导。更有用的是把“能力证据、工程规格、开放性和产品生态”拆开看。

四层定位

能力证据层: Fable 5与Sol是已被同口径评测确认的第一梯队;K3暂时没有足够公开数据进入这一层的确定排名。
工程规格层: K3的2.8T、1M上下文、最高1M输出、原生图像/视频和动态工具加载,已经是前沿配置,部分上限甚至更激进。
经济性层: K3显著低于Fable与Sol,但明显高于K2.6/K2.7;它卡在“开源性价比”和“闭源能力上限”之间的新价位。
开放生态层: K2.6/K2.7仍有开放权重与自部署优势;K3首发形态是API和Kimi产品可用,尚不能被称为已开源模型。
K3现在最准确的位置,不是“世界第几”,而是“最有希望进入全球前沿采购表的中国旗舰之一”。它已经取得参赛资格,但还没有交出同口径成绩单。

七、谁应该现在就试,谁应该先等一等?

图6|模型不是按品牌选,而是按任务、证据与约束选。K3当前更适合进入试点池,而不是未经评估直接替换全部生产模型。

图6|模型不是按品牌选,而是按任务、证据与约束选。K3当前更适合进入试点池,而不是未经评估直接替换全部生产模型。

适合立即进入PoC的场景

超长中文材料、代码库、视频与文档混合输入;
需要多轮工具调用、长时间保持任务状态的Agent;
知识库前缀稳定、能够高比例命中缓存的工作负载;
希望在不承担Fable/Sol价格的情况下测试前沿能力;
愿意用真实业务集做A/B测试,并能保留回退模型。

不适合直接全量迁移的场景

需要本地部署、权重可审计或深度微调;
对吞吐、首token延迟和SLA有明确承诺,但尚未拿到K3实测;
高度依赖联网搜索的生产系统——官方明确说该能力仍在更新;
大量简单请求,希望随时关闭思考以降低延迟;
受监管场景中,需要明确训练数据、数据保留、地域处理与安全评测文件。

八、企业真正该怎么评测K3:别再只看榜单

建议把K3与当前生产模型放进同一套20—50个真实任务,而不是拿几道数学题或一次网页生成做结论。测试至少覆盖:中文长文研究、跨文档事实核对、代码修改、视觉/视频理解、工具选择、失败恢复与长会话一致性。

一套更接近业务价值的六项指标

任务成功率: 不是“回答看起来不错”,而是是否通过验收标准;
一次完成率: 需要多少轮纠正,人工修改了多少;
单位成功成本: 总token、工具费和重试成本除以成功任务数;
完成时间: 包含思考、工具调用、等待和人工接管;
证据质量: 引用是否可追溯,是否把未知说成已知;
长程稳定性: 任务跑到后半程后,目标、格式、文件和约束是否仍然一致。

只有当K3在你的任务集上同时改善成功率、单位成本或交付时间中的至少两项,迁移才有商业意义。否则,“参数更大、上下文更长”只是采购资料上的规格,不是生产系统里的收益。

结语:K3最重要的,不是宣告胜负,而是改变比赛方式

Fable 5代表当前公开模型的能力上限,GPT‑5.6 Sol代表前沿能力与执行效率的强平衡。K3没有足够证据证明自己已经站到它们前面,但它用更低价格、超长输出、原生视频和一套新的长上下文架构,逼迫市场重新计算“完成一次复杂任务到底该花多少钱”。

所以,对K3最合适的评价既不是“国产Fable 5已经来了”,也不是“没有榜单就不值一提”。更准确的判断是:这是Kimi第一次有资格和全球最强模型讨论同一类任务、同一张采购表;下一步决定它位置的,不再是参数,而是独立评测和真实交付。

研究说明

本文截至2026年7月17日,优先采用官方文档、原始论文与Artificial Analysis公开页面。K3首发信息仍可能更新;文中“尚未公布”仅代表研究日可核验的公开状态。厂商自测与第三方评测分开呈现,不把未知项按零分处理。

参考资料与口径

以下资料均在2026年7月17日访问。外部评测随版本更新,本文保留研究日口径。

〔1〕Kimi API Platform|Kimi K3 Quickstart
https://platform.kimi.ai/docs/guide/kimi-k3-quickstart

〔2〕Kimi API Platform|Kimi K3 Pricing
https://platform.kimi.ai/docs/pricing/chat-k3

〔3〕Kimi API Platform|Model List
https://platform.kimi.ai/docs/models

〔4〕Kimi API Platform|Kimi K2.7 Code Pricing
https://platform.kimi.ai/docs/pricing/chat-k27-code

〔5〕Kimi API Platform|Kimi K2.6 Pricing
https://platform.kimi.ai/docs/pricing/chat-k26

〔6〕Moonshot AI / Hugging Face|Kimi K2.6 Model Card
https://huggingface.co/moonshotai/Kimi-K2.6

〔7〕Kimi Team / arXiv|Kimi Linear: An Expressive, Efficient Attention Architecture
https://arxiv.org/abs/2510.26692

〔8〕Kimi Team / arXiv|Attention Residuals
https://arxiv.org/abs/2603.15031

〔9〕OpenAI|GPT-5.6 launch
https://openai.com/index/gpt-5-6/

〔10〕OpenAI Developers|GPT-5.6 Sol Model
https://developers.openai.com/api/docs/models/gpt-5.6-sol

〔11〕Anthropic|Claude Fable 5
https://www.anthropic.com/claude/fable

〔12〕Claude Platform|Claude Models Overview
https://platform.claude.com/docs/en/about-claude/models/overview

〔13〕Claude Platform|Introducing Claude Fable 5 and Claude Mythos 5
https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5

〔14〕Artificial Analysis|Artificial Analysis Intelligence Benchmarking
https://artificialanalysis.ai/methodology/intelligence-benchmarking

〔15〕Artificial Analysis|Claude Fable 5 analysis
https://artificialanalysis.ai/models/claude-fable-5

〔16〕Artificial Analysis|GPT-5.6 Sol analysis
https://artificialanalysis.ai/models/gpt-5-6-sol

〔17〕Moonshot AI / Hugging Face|Moonshot AI Models
https://huggingface.co/moonshotai/models

〔18〕Moonshot AI|Moonshot AI GitHub
https://github.com/moonshotai

本文为独立研究,不构成采购或投资建议。模型能力会随版本、工具、推理强度与运行环境变化。