作者 / 姚赟
来源 / 盒饭财经(ID:daxiongfan)
进入前沿牌桌不等于改变牌桌规则。
作者 | 许有阳
来源 | 盒饭财经(ID:daxiongfan)
头图及封面来源 | GPT
K3突然成了关注的焦点。
先是马斯克。
北京时间7月17日凌晨,马斯克在Artificial Analysis一条Kimi K3的评测帖下回复“Impressive”(令人印象深刻)。第二天,他又在谈及xAI正在训练的2万亿参数模型时表示,它“可能超过Kimi”。
随后,月之暗面Kimi在微博上隔空喊话:“欢迎加入「2万亿+」俱乐部”。
微博截图
为什么是“2万亿+俱乐部”?
7月16日晚,月之暗面发布新一代大模型Kimi K3,而“2万亿+”便是K3的参数规模范围。据月之暗面介绍,Kimi K3参数规模达2.8万亿,上下文窗口100万token,原生支持视觉理解,搭载自研KDA注意力算法,以及每个token从896个专家中激活16个。
Kimi K3的讨论范围,不只在海外的社交媒体。
Arena联合创始人兼CEO Anastasios Angelopoulos接受媒体采访时称,这可能是今年最大的一次模型发布。与此同时,K3登上Frontend Code Arena第一,在Artificial Analysis智能指数发布时排到第三。
而算力紧缺,又为K3的出圈添了一把火。
7月19日晚间,月之暗面旗下AI助手Kimi发布《关于算力紧缺与会员暂停开放的说明》,宣布即日起暂停C端新用户订阅,将现有算力全部用于保障已订阅用户权益,并全速推进扩容。
气氛的烘托中,K3的讨论中带上了“下一次DeepSeek”“DeepSeek时刻2.0”等话题。事实上,截至发稿前,许可证尚未披露,完整技术报告也仍未发布。
但如果把两者放到同一张账单上,差异随即出现。Artificial Analysis测得K3完成一项加权评测任务平均花费0.94美元,同一口径下DeepSeek V4 Pro约为0.04美元。K3已进入全球前沿比较,却没有复制DeepSeek最关键的一击。
确实看起来像2025年的DeepSeek
K3制造的冲击,更多来自它的比较对象突然变了。
据月之暗面公布,K3拥有2.8万亿总参数、原生视觉和100万token上下文,每个token从896个专家中激活16个。Artificial Analysis给出57分,发布时位列第三;在现实知识工作评测GDPval-AA v2中,它获得1668 Elo,高于Claude Opus 4.8和GPT-5.5,低于Claude Fable 5;在AA-Briefcase长程知识工作评测中,发布时仅次于Fable 5。
x截图
“虽然其整体性能仍然落后于最强大的专有型号Claude Fable 5和GPT 5.6 Sol,但Kimi K3在我们的评估套件中展示了前沿级别的性能,始终优于其他测试型号。”《Kimi K3:开放前沿智能》这样写道。
这些名次都有边界。
截至7月21日,K3已由发布时的第三移至第四。而Frontend Code Arena测量的是前端页面的视觉、交互和用户偏好,并不等于全部代码能力。
但,这些变化,也无法否认kimi完成了一次身份切换:K3不再只是“国产模型里表现不错”,而是直接进入Fable、GPT和Opus构成的全球比较。
一个直观的变化是,关注度从K3转向杨植麟本人。
K3发布后,杨植麟的导师Russ Salakhutdinov在X上公开祝贺;不少媒体先后刊发其人物侧写,海外科技媒体甚至单独写了一篇月之暗面会议室的命名方式。
x截图
2015年从清华大学毕业后,他前往卡内基梅隆大学攻读博士,参与Transformer-XL和XLNet等研究,直到2019年毕业。有媒体写道,杨植麟在卡内基梅隆大学读博期间,就以喜欢Pink Floyd等摇滚乐队闻名。这种个人趣味后来也进入公司命名:“月之暗面”取自Pink Floyd的同名专辑,Kimi则是杨植麟的英文名。
Pink Floyd,翻译过来为“平克·弗洛伊德”,这支乐队在1973年发布了一张名为《The Dark Side of the Moon》的专辑。专辑名翻译过来,就是“月之暗面”。
这种种很容易唤起DeepSeek式联想:一个年轻的研究者、非互联网大厂组织、以架构创新逼近前沿,再由一次集中发布闯入全球舆论。
但相似的出场方式,并不等于相同的商业动作。Kimi要做的一直都很清晰,并不是下一个“DeepSeek”。
3月25日,杨植麟在2026中关村论坛年会全体会议上,以《开源AI:加速探索智能上限》为题发表演讲,提出大模型发展核心判断,并系统披露Kimi最新技术路线与行业价值。期间,他将月之暗面的扩展方向概括为三条:提高token效率、拉长上下文、组织Agent集群。
不到四个月后,K3几乎就是这三个判断的实体化。
Kimi的目标,沿着一条线程工作下去
Token效率解决成本,长上下文解决容量,Agent集群突破顺序执行瓶颈。杨植麟对月之暗面规划的方向,共同指向了一个目的地:模型竞争正在从“一次回答”,转向“一条持续运行的任务线程”。
盒饭财经此前相关的文章《腾讯、阿里、字节,重做一遍Office》《OpenAI给Codex找了份新工作》《“前浪”WPS,争夺交付权》中,都谈到了这一趋势——AI竞争要从“问答”,转为“任务执行和交付”。
聊天的终点是一段回复,工作的终点则是一个能够继续使用的结果。这个曾经承载“咨询”“搜索”功能的助手,要进一步上岗干活了。
那自然就会对他有新的要求。比如,要完成任务时,他得记住目标,还要阅读文件和网页,过程中自然也要调用终端及浏览器,保存中间产物。相对过去,这个流程就变长变复杂了。
如果这个助手中途某一步出错,它需要知道从哪里恢复,而不是让用户从头再来。如果它在工作时忘掉一句重要要求或限制条件,过去或许只是体验瑕疵,现在却可能意味着全部返工。
而100万token上下文并不等于长线程。更长的上下文窗口,像一张足够大的工作台,决定一次能摊开多少资料;而长线程则是一项持续推进的项目,还取决于状态保存、工具反馈、任务拆解和错误恢复。
K3的厉害之处,是和DeepSeek一样用技术显化了战略。
比如,KDA先处理长任务为什么越来越贵。
2025年10月,Kimi Team发布了名为《Kimi Linear: An Expressive, Efficient Attention Architecture》的相关研究。该论文中,已经用KDA与MLA组成混合注意力架构。在48B总参数、3B激活参数的实验模型上,论文报告KV Cache最高减少75%,100万token下解码吞吐最高达到全MLA基线的约6倍。
这当然不是K3实测,却说明如果读取和保存历史的成本无法下降,线程越长,产品越难成立。
而Attention Residuals处理网络深度上的信息稀释问题。
相关论文显示,模型可以根据输入选择此前层的表示,而不是固定地逐层相加。验证同样来自48B模型,不能据此声称“Agent不会忘记目标”,只能说明它为超深模型提供了更稳定的内部信息流。
还有,Stable LatentMoE。
它能让每个token只激活896个专家中的16个,把总容量与单次计算拆开。月之暗面称,这些架构和训练配方合计将扩展效率提高到K2的约2.5倍。截至发稿前,技术报告尚未发布,暂时无法拆分各项贡献。
然而,单模型变得更能装,并没有消除顺序执行的限制。
Kimi从K2.5引入Agent Swarm,到2026年4月的K2.6已扩展到最多300个子Agent和4000多次工具调用。官方称大规模搜索速度相较单Agent最高提高4.5倍,当前集群已经由K3驱动。每个子Agent保留自己的上下文,只向协调者汇报关键结论。也就是说,月之暗面不仅在拉长线程,还打算把它拆成一支临时组织。
产品也沿着同一方向展开。
6月3日上线Beta的Kimi Work以Kimi Code为内核,把本地文件、WebBridge、Skills和权限控制接入桌面。它还能系统拆解目标、调用工具,并最终交付文档、表格、演示文稿或代码。
K3又同时进入Kimi.com、Kimi Work、Kimi Code和API。这意味着,Kimi正在从底模走向运行时和工作入口。
K3与DeepSeek,在这里分岔
进入前沿牌桌不等于改变牌桌规则,DeepSeek当年真正让市场不安的,是它顺手把牌桌的价格锚定点改了。
2024年5月6日,DeepSeek发布V2,并以极低的API价格引发国内大模型价格战。不久后,在《暗涌Waves》的专访中,梁文锋表示,公司只是核算成本后定价,原则是不补贴,也不追求暴利。
这个判断在2025年1月20日变成了一个完整动作。
R1和R1-Zero发布当天,DeepSeek给出6个从1.5B到70B的蒸馏版本;API未缓存输入价为0.55美元、输出价为2.19美元/百万token。能力、价格、权重、许可和不同尺寸的模型同一天到位,开发者不仅可以调用,还可以下载、修改、部署和继续蒸馏。
到2026年4月24日发布V4 Pro时,这套动作仍然连贯。
V4 Pro拥有1.6万亿总参数、49B激活参数和100万token上下文,发布时同步开放MIT许可权重,并兼容OpenAI Chat Completions与Anthropic接口。截至7月21日,官方未缓存输入价为0.435美元、输出价为0.87美元/百万token。
DeepSeek降低的不只是token标价,而是获得、迁移和改造模型的门槛。
R1发布一周后的2025年1月27日,英伟达市值在一个交易日内蒸发约5930亿美元,创下当时美国上市公司单日市值损失纪录。当然,这不能代表算力不再重要,但足以记录这次市场的恐惧:如果接近前沿的能力可以低价获得、立即下载,还能被压进不同尺寸的模型,围绕稀缺智能建立的价格和资本开支叙事就必须重算。
“DeepSeek时刻”代表的是,能力进入前沿、价格骤降、权重和蒸馏模型即时可得。三件事同时发生,强模型才从稀缺产品向可兼容、可改造的供应品移动。
Kimi走的是另一条路。
截至7月21日,K3已经进入Kimi Work、Kimi Code和API,但完整权重承诺最迟于7月27日发布。价格方面,API未缓存输入为3美元、输出为15美元/百万token。
月之暗面称,编程负载缓存命中率超过90%,命中后的输入价会降到0.30美元,这能降低实际调用成本,却仍没有把K3放进DeepSeek式的低价区间。
制作:盒饭财经
Artificial Analysis的同口径结果把分岔显示得更直接。
K3完成一项加权评测任务平均花费0.94美元,V4 Pro约为0.04美元,相差约23.5倍。当然,这一指标包含评测中的输入、缓存、推理和输出token,并不等于企业真实项目的总成本。如果模型可以把工程师一周的工作压缩到一天,昂贵的token依然可能是便宜的劳动力。
但这也意味着,K3的溢价不能再靠参数和榜单解释,只能靠结果解释——更少的重试、更少的人工接管、更低的返工概率,以及更高的最终交付成功率。
选择长线程,Kimi必须回答的问题
K3押注的是,用户愿意为更高的任务完成概率付费。
而这意味着,Kimi面对的竞争不再局限于模型榜单。它需要依次证明这条线程值钱、可靠、留得住结果,并且能够规模化交付。
用户付费,不是为了2.8万亿参数本身,而是希望模型可以解决实际的问题。比如,某程序员用AI产品连续工作数小时,读完代码库,调用终端与浏览器,处理数千页材料,他的目的是有一个能继续使用的结果。但如果无法交付这样可继续使用的结果,那么再低的token单价也没有意义。
K3的技术选择都在服务这场赌博。
制作:盒饭财经
比如,价格方面。
K3没有必要在token标价上击败DeepSeek,但必须证明多付的钱能够换来更少的失败。AA的0.94美元只是一个更接近任务经济性的代理指标,它仍没有计入人工审核、外部工具、错误恢复和返工。只有进入企业的真实流程之后,成功任务总成本才会揭晓。Kimi押注任务价值,就必须接受这种比跑分更苛刻的核算。
比如,运行方面。
7月9日,OpenAI推出ChatGPT Work,并披露Codex周活跃用户超过500万,其中100万以上已经用于非软件工作。Codex已经把沙箱、越界操作审批、diff和测试闭环做成基础能力。而Anthropic也为Claude Code提供文件和网络隔离、修改前检查点与恢复能力。竞争已经从模型能否完成任务,推进到模型出错之后系统能否限制损失、验证结果并恢复现场。Kimi需要证明的,不是它能调用多少工具,而是能否让一个会犯错的模型安全地行动。
比如,入口方面。
7月15日发布的WPS灵犀专业版可以直接调用WPS文档内核与原生API,生成可编辑、可审阅的文档、表格和演示文稿。微软则在4月把Word、Excel和PowerPoint中的Agent能力推向全面可用。它们未必始终拥有最强底模,却掌握文件对象、格式、版本、企业权限和协作关系。
Kimi Work也在连接WPS、Canva、Notion和专业数据库,但这既是扩张方式,也暴露了位置问题。如果成果最终仍要回到Office继续编辑、审阅和流转,Kimi究竟是新的工作入口,还是被旧入口调用的一层模型能力?模型越强,其他平台吸收它的价值反而越容易。
还有,来自K3自身。
7月19日的公告称,过去48小时的用户请求量已经逼近现有推理集群承载上限。
这证明了关注度,也直接暴露了长线程的供给账单。一次聊天可能只调用模型几轮,一项持续数小时的编程、研究或多Agent任务却会反复推理、读写上下文、调用工具。而K3官方又建议采用64个以上加速器组成的supernode。
热度越高,月之暗面越需要同时维持服务质量、单位任务成本和毛利。如果扩容只能换来更多昂贵推理,长线程会成为一张不断增长的成本表。
巧合的是,DeepSeek发布R1后,OpenAI CEO Sam Altman也曾用“impressive”评价它,与马斯克评价K3时用了同一个词。
DeepSeek的关键一击已经写进价格、权重和产业扩散,它让前沿智能从稀缺产品变成低价、兼容的供应品。
K3没有重复这一击。杨植麟选择把模型送进更长的任务,让它读取更多材料、调动更多工具、组织更多Agent,最终拿走更多工作价值。它试图改变的不是一单位智能的价格,而是模型参与工作的长度。
本文为盒饭财经原创,未经授权严禁转载!戳这里--【盒饭财经】,了解更多商业故事