Kimi学会了“自己干活”,中国大模型坐到了全球AI牌局主桌
来源:21世纪经济报道作者:石恩泽 朱益民2026-07-29 14:52
字号
超大
标准

两周前,月之暗面(Kimi)向全球AI大模型玩家扔出了一颗重磅炸弹——K3大模型。

瑞银分析师将其称为“第二个DeepSeek时刻”。不同于“DeepSeek 1.0时刻”一切从大模型性价比出发,K3带来的则是另一条叙事——当AI Agent嵌入工作流后,能给C端用户带来哪些效率的提升。

用户惊奇地发现,Kimi K3大模型不再是“一问一答”的聊天工具,而是开始像一名人类分析师那样,规划任务、检索信息、调用工具、并行协作、交付成果。也就是说,Kimi学会了“自己干活”。

当DeepSeek证明中国模型可以“跑得快”之后,Kimi出色的Agent能力正在将中国大模型整体推入一个新的竞争维度。这次比拼的不再是参数规模或数学题得分,而是谁的模型能嵌入真实工作流,在用户离开后仍持续交付成果。

这个改变也在向世界传递一个信号:中国大模型不再只是全球AI竞赛的跟随者,而是正在用“自己干活”的能力,参与到全球用户的争夺战中,在全球AI牌局里坐上了主桌。

烧卡换参数的阶段过去了

过去两年,中国大模型的叙事主线并不复杂:用更低的成本,训练出逼近甚至超越GPT-4性能的模型。

2025年初,DeepSeek以极低训练成本和开源策略震动全球,被业界称为“国运级突破”。一时间,国内AI赛道集体卷入一场“烧钱换参数、堆卡换性能”的消耗战。

然而,一个无法回避的事实是,纯粹的模型性能比拼正在陷入边际效益递减的困境。实际上,用户不关心各家大模型的分数、排名,他们只关心程序能不能跑通、结果是否可靠。

Agent能力的跃迁,恰好打破了这一僵局。2025年7月,月之暗面发布并开源Kimi K2大模型,首次提出大模型要为工作流而生。为此,Kimi K2在代码生成、工具调用和多步骤任务执行上进行了深度优化,被业内评价为“专为AI Agent打造的大模型”。

时隔一年,K3版本的落地则将这一趋势推向了更具说服力的生产场景。据月之暗面官方披露,K3在生成一个AI ASIC行业研究网站时,经历了120轮以上递归改进,完成2800次以上网页搜索与抓取、1100次以上终端数据调用,处理超过1.1万页内容,覆盖87份季度报告和99份原始PDF。

这些任务已不再是传统意义上的一次问答,而是由检索、执行、校验、绘图和修改组成的长链路流程。华泰证券在研报中指出,Agent渗透带来的核心增量并非用户请求数量本身,而是每个任务内部Token消耗、工具调用次数和并行执行宽度的共同增长,这意味着真实工作流的渗透正在实质性提升。

支撑这种长程执行能力的,是一整套Agent基础设施的重新设计。据月之暗面技术报告披露,K3训练和评估期间,系统共创建了超过5100万个沙箱,使长任务可以在等待模型推理时暂停以释放计算资源,在模型生成下一步动作后快速恢复。这相当于把一次原本几分钟的回答,拉长成一条可持续数小时的执行链。

要知道,传统强化学习训练会被少数特别慢的任务拖住整批GPU,而K3通过partial rollout机制,让已完成的部分轨迹先进入模型更新,未完成的轨迹暂停后再恢复执行,从而容忍异步和延迟,真正让长程Agent任务进入了规模化训练阶段。

模型能力的跃迁也反映在硬性的工程评测中。K3在Program Bench中得分77.8,超过GPT-5.6 Sol的77.6;在FrontierSWE中得分81.2,较GPT-5.6 Sol和Claude Opus 4.8分别高出9.9和14.5。

这种长程Agent能力也体现在智能体专项评测中。据月之暗面披露,K3在BrowseComp等智能体任务评测中表现突出,在AutomationBench测试中取得最高成绩。

有工程师在社交平台上称,在智能体工作流中,K3的表现接近Claude Fable 5,但成本显著降低。这让Agent能力从少数大厂的昂贵实验,变成了更多开发者可以负担和复用的工程选项。

“大模型真正的护城河,不在于单次对话的质量,而在于能否嵌入用户的工作流,成为无法被轻易替代的生产力环节。”一位长期跟踪AI赛道的分析师向记者表示,Kimi的升级意味着中国大模型竞争从模型层向应用层的实质性迁移,“烧Token的阶段正在过去,拼落地、拼不可替代性的时代已经到来。”

Kimi为什么非要走C端这条难走的路

与智谱AI、百度文心等早期以B端企业服务和API输出为主的大模型厂商不同,Kimi自诞生起就选择了一条更难走的路——直面C端用户。

这条路曾经备受质疑。B端市场合同金额高、客户忠诚度高,是大模型厂商最自然的商业化路径;而C端用户付费意愿低、获客成本高、产品迭代压力大,此前并无成功案例。然而,Kimi的C端策略在2025年下半年开始显现回报。

Kimi在和投资人的沟通中透露,公司海外收入已超过国内收入,2025年11月以来海外API收入增长4倍,全球付费用户在K2.5发布后实现4倍增长。在第三方平台OpenRouter上,K2.5的排名已升至第三位,仅次于Claude Sonnet 4.5和Gemini 3 Flash。这意味着,一个中国原生的大模型产品,正在全球C端市场获得真实付费用户的认可。

更值得关注的是其产品形态的创新。2025年9月,月之暗面推出全栈智能体助手OK Computer(Kimi Agent),随后又迭代出Kimi K2.5的Agent集群能力。当面对分析100家竞争对手等复杂任务时,模型可扮演“中央调度器”,动态创建并协调数十个具备不同虚拟角色的Agent分身并行工作,将原本需要数天的工作周期压缩至十几分钟。

K3的发布进一步验证了这一商业化逻辑。其API定价中,缓存命中输入、未命中输入和输出价格分别为0.30美元/百万Token、3.00美元/百万Token和15.00美元/百万Token,较K2系列明显提价,输出价格已与GPT-5.6 Terra相当。

瑞银证券中国互联网分析师熊玮指出,K3定价在国产模型的高端位置,恰恰说明了真正好的模型能力有溢价权,企业也能找到相应的用户为之付费。

华泰证券亦在研报中认为,K3通过自动缓存和推理系统优化降低实际调用成本,使模型厂商能够在提升名义Token价格的同时不提高用户使用门槛,行业商业化竞争正由单纯低价转向模型能力、缓存效率与算力利用率的综合比拼。

“如果说DeepSeek证明了中国的模型可以便宜又好用,那么Kimi证明了中国团队也能做出世界级的C端AI产品。”前述分析师认为,这种从产品形态到商业模式的双重突破,填补了中国大模型在消费级应用上的空白。

全球AI牌局里中国坐到了主桌

2026年1月,英伟达CEO黄仁勋在CES主题演讲中,用Kimi K2 Thinking取代此前常见的DeepSeek-R1,作为演示其Rubin NVL72系统性能的案例。这一细节被市场解读为中国大模型在全球AI基础设施供应链中话语权的提升。

事实上,Kimi的路径选择正影响着整个行业对“中国大模型能做什么”的认知边界。2025年7月Kimi K2开源后,在Hugging Face平台一周内下载量突破10万次,并获得硅谷知名投资人在播客中的公开推荐。其采用的MIT开源协议、OpenAI兼容API,以及对vLLM等主流工具的支持,大幅降低了海外开发者的使用门槛。

更具生态意义的是,月之暗面将AgentENV、MoonEP和FlashKDA等训练部署基础设施一并开放,意味着开发者获得的不仅是一个可调用的模型,也是一套可以进一步研究、修改和复用的Agent工程资源。

开源模型的强劲势头,也正在倒逼全球领先玩家采取应对动作。瑞银分析师熊玮指出,近期OpenAI等海外厂商相继采取额度重置、Token降价等措施,恰恰体现了中国模型在全球范围内开始得到更多市场以及行业对手的重视。

中国模型得以参与全球竞争,背后是一套结构性的成本优势。据瑞银调研,目前中国头部模型训练成本约为海外领先模型的十分之一,API价格通常只有海外同类模型的10%至20%,与此同时,国内模型厂商API业务仍能够保持20%至40%的毛利率。

熊玮分析称,这种结构性成本优势来自模型架构创新、GPU使用效率提升、兼顾性能与成本效率的训练策略,以及开源生态带来的技术扩散等因素,并且这一优势有望长期保持。

从技术演进来看,Kimi的迭代轨迹也映射出中国大模型能力的跃迁:2024年聚焦长文本处理,2025年K1.5在多模态推理上逼近OpenAI o1水平,2025年下半年K2系列专攻Agentic任务与代码能力,2026年K2.5引入原生多模态与Agent集群,再到2026年7月K3模型将参数规模推至2.8万亿、上下文长度拓展至100万Token。

K3的架构升级也预示着推理基础设施竞争格局的变化。该模型采用Kimi Delta Attention与Attention Residuals架构,配合Stable LatentMoE将专家数量扩展至896个,并明确提出64张以上加速卡组成的超节点部署建议。

华泰证券认为,这意味着推理基础设施的竞争指标正在从单卡算力扩展至超节点内部互联、共享内存域、集合通信效率和系统级稳定性,高速网络与整机系统的价值量有望随模型规模同步提升。

“中国大模型已经不再是追赶者的角色。”一位AI行业投资人向记者表示,DeepSeek在推理能力上的突破、Kimi在Agent应用上的落地,标志着中国AI力量正在从单点技术跟随走向生态能力并跑,“全球AI竞赛从‘美国创新、中国复制’的旧脚本,进入了多极竞争的新阶段。”

不过,竞争远未到终局。月之暗面创始人杨植麟曾在公开场合坦承:“Agent集群的规模化训练在技术上很有挑战。”

熊玮亦表示,目前两家大模型公司的上市时间都只有六七个月,整个行业仍处于市场不断学习和重新定价的阶段,“投资者交易仍然呈现较强的‘动能驱动’特征”。因此,当行业出现新的模型发布、技术突破等积极催化时,相关公司股价往往会走强;而当市场对竞争格局、商业化前景产生新的担忧时,股价也可能随之回调。

如何在C端持续扩大付费用户规模、在B端创造更稳固的企业服务收入、在全球化进程中应对地缘政治与合规风险,仍是摆在Kimi面前的未解之题。

但至少,中国大模型正在证明,在这个由Agent重新定义应用范式的时代,来自中国的创新者,不再只是牌桌上的旁观者。

责任编辑: 邓卫平
声明:证券时报力求信息真实、准确,文章提及内容仅供参考,不构成实质性投资建议,据此操作风险自担
下载"证券时报"官方APP,或关注官方微信公众号,即可随时了解股市动态,洞察政策信息,把握财富机会。
为你推荐
用户评论
登录后可以发言
网友评论仅供其表达个人看法,并不表明证券时报立场
发表评论
暂无评论
时报热榜
换一换
    热点视频
    换一换