出品 | 网易智能
作者 | 辰辰
编辑 | 王凤枝
8月13日晚,DeepSeek正式发布V4-Pro,同时把自己的Agent Harness也一起开源了。它目前还是开发者预览版,采用MIT协议。上线几小时,DeepSeek Harness的GitHub仓库就收获了3万多颗Star。
这不是又一个模型,也不只是一个AI编程助手。DeepSeek这次开源的,是让模型调用工具、读写文件、执行任务的那层系统。
但star数说明不了太多。开发者围绕它的争论其实分成了两派:一派说底层架构强,另一派说难用。
一、模型之外的那一层
先说说harness这个词。
它的英文原意是马具,套在马身上、让马能拉车干活的那套皮带。DeepSeek拿它给产品命名,意思很直接:模型就是那匹马,光有一匹好马拉不了车,还得有副马具,把马的力气变成能干的活。
这副马具管什么?管几件琐碎但绕不开的事:记得前面聊到哪了、该用哪个工具、文件怎么读怎么写、命令怎么执行、一件事做到哪一步算完。模型要是缺了这些,就好比一匹好马没套上缰绳,只会在原地打转。
DeepSeek Harness要做的,就是把这副马具做成产品。
它只认一条原则:一切皆插件(Everything is a plugin)。每一件零件都是独立的,坏了换、旧了换、想升级也换,不用把整套系统推倒重来。
官方文档里还有一句:这套系统里没有哪块是动不得的。想扩展,在旁边挂一个新插件就行。
它还预设了四档用法,从轻到重。最轻的一档只给两个基础工具,能跑就行;最全的一档,把读文件、写代码、上网搜索、派助手分头干活都配齐了;中间还有一档,专门把慢吞吞的操作打包起来一次跑完;最后一档,留给想自己动手改的人。
最后一点最关键:这套系统不挑模型。你想套在谁家的模型上都行,Anthropic的、OpenAI的、谷歌的,当然也包括DeepSeek自己的。甚至本机已经能用的Claude Code、Codex,也能被它叫过来干活,只是这个开关默认关着。
二、为什么说它架构强
夸它的人,基本集中在三个点。
第一是"插件化"做到了最深处。
一个AI助手干起活来,有套固定的动作循环:看一眼、想一想、动一下手、再看一眼。Claude Code也给开发者留了不少挂钩子的地方,但那套动作循环本身,主要还是由产品方来定。DeepSeek Harness更进一步:连这套循环都能拆下来换掉。
但这事没那么简单。一辆正在路上跑的车,你想换个轮子,得先停车。一个正在干活的程序,你想换掉其中一块,它可能已经跟别的部分纠缠在一起了:之前指向它的线怎么办、它正在跑的后台活要不要停、靠它的其他部分要不要跟着动、新换上去的这块要是出错怎么退回来。
DeepSeek为这些麻烦专门造了一层,叫Cordis。有开发者读完源码数了数,光管理"纤维"(程序里最小的一根执行线)这块核心代码就有750行。论文里满是范畴论符号,看着像关起门搞理论的产物,但它要解决的事很具体:让最核心的那块,也能不停机地换掉,出了错还能退回去。
第二是它给这个助手配了个黑匣子。
模型看过什么、工具动过什么、崩在哪一步,都按顺序记成一条流水账,一条都改不了。任务断了,能从这条账里原样接回去;还能从中间分叉,另起一条路重试。一位开发者说,这比很多"任务一断,现场就丢"的产品成熟得多。
第三是执行期的安全边界做得细。
DeepSeek Harness把文件沙箱和操作审批分开,默认预设为工作区可写、敏感操作询问,并针对Windows、macOS和Linux提供不同的隔离实现。不过官方也明确,这套沙箱主要约束文件操作,网络访问和进程可见性不在其规则范围内。
这种灵活性到底能到什么程度,有个开发者做了个测试:他在一次对话里,让这个助手自己检查自己正在跑的服务、用几行代码当场写了个"抛硬币"的小工具、然后直接调它,从定义到用上,全在这一次对话里完成,没重启。
三、开源Harness,涨价API:DeepSeek的商业算盘
便宜,是它火起来的原因之一。但"便宜"不只来自模型的标价,也来自harness本身。
一家叫Composio的机构做过一项横向测试:让同一个DeepSeek V4 Flash,在八个不同的harness上跑同一批任务。最便宜的是开源项目Pi,每个成功任务的平均推理成本约0.028美元;Claude Code约0.195美元。同一个模型、同一类工作,换一个harness,成本差了近七倍。
换句话说,Agent的成本不光看模型标价,也看Harness怎么设计。缓存怎么用、工具怎么调、任务循环怎么跑,都会影响最后花多少钱。
差在哪?很大一块是缓存命中。DeepSeek的缓存价极低,有第三方harness报告说,和它配合能到99.93%的缓存命中率。命中率越高,越少token走贵的那条路,单任务成本就越低。这就是"便宜"的工程来源,不是标价低,是整套跑法的成本被压到了很低。
但这个便宜,正在变贵。
同一天,DeepSeek宣布API调价,从8月17日0点(北京时间)起,改成峰谷定价:高峰时段是北京时间的上午9点到12点、下午2点到6点,其余时间算低谷,低谷价格是高峰的一半。官方说法是"更合理分配资源",用价格把开发者往空闲时段引导。
涨幅不算小。以V4-Pro为例:输出价格峰值从每百万token 6元涨到27元,是原来的4.5倍;连低谷价也要13.5元,是原来的2.25倍。输入(未命中缓存)峰值是原来的3倍。
涨得最狠的是缓存。V4-Pro缓存命中价从每百万token 0.025元,涨到峰值0.30元,12倍。
值得注意的,恰恰是这一项。前面说harness的便宜,很大程度靠缓存命中:命中就走极低的缓存价。现在缓存价涨得最猛,等于把这套"靠缓存省成本"的账,重新算了一遍。
把两件事放在一起看,信号很清楚:Harness本身MIT开源、免费,但喂给它的算力在同一天变贵了。开源的是框架,涨价的是算力。DeepSeek正在同时推进两件看似矛盾的事情:开放Agent基础设施,调整模型调用价格。受影响的是用API的开发者,恰好是Harness最想吸引的那批人。
当然,涨完之后DeepSeek比Claude Opus 5这类模型还是便宜得多,它不是变贵了,只是没那么极端便宜了。但它确实在往回收一部分自己之前打出的价格优势。
四、夸和骂,指向同一个设计
回到Harness本身,好评和差评很快在社交媒体上分成了清晰的两派。
好评那一侧,几乎都是"当场跑通"的例子。有人让它从零写一个3D魔方,27分钟、52步、一次成功;有人让它用纯C语言生成坦克大战,总成本0.12美元,能跑、能打、有音效。
StreamNative的软件工程师Yufan Sheng直言:"用了一天DeepSeek v4 Flash,它的Harness比Kimi K3好上不少。"
差评那一侧,声音同样具体。
最集中的是缺视觉。有开发者说,"V4和DSH都被'没有眼睛'严重拖累,模型们执着于想'看到'自己的工作"。还有人索性让Harness自己给自己写了个视觉插件,调用别家的模型来补。
然后是启动门槛。一位署名BG-VC的开发者把冷启动过程数了一遍:装Node.js、开终端、敲一串命令、访问一个本地地址、填密钥、选目录,实际解析了约590个依赖,装了500多个包,还弹出一个构建授权窗口。他的原话是:"程序员觉得这只是安装依赖,普通用户会觉得:这软件是不是坏了?"
还有个"运行轨迹"页面也一样。它把助手干活的每一步都摊开,发过什么指令、调过什么工具、传过什么数据、花了多长时间,全列出来。对排查问题的开发者是宝藏,对普通用户只是噪音。
宝玉从"普通用户"角度列了八条,挑几条:速度飞快,这点特别好;但Flash模型太快,思考文字闪得厉害,该做节流;Codex右侧的多Tab面板值得抄;运行轨迹对普通用户价值不大,不该占那么重要的位置;模型早点支持多模态。
BG-VC给的总结,是这几天最准的一句评价:"底层架构很强,用户体验很差。""它已经造出了一副很强的Agent骨架,但还没有长出面向人的皮肤。"
另一条长评说得更完整。开发者"鸭哥"把DeepSeek Harness和Codex的源码逐行对照后的判断是:对绝大多数日常写代码的开发者来说,它重得毫无必要;但对探索"自进化agent"的工程团队来说,它搭出了一套目前其他方案完全没有的底层骨架。
还有一条安全提醒,被压在好评下面,但值得单独拎出来。开发者Fan说:一切皆插件,等于装个插件就是让它直接跑代码,没有签名、没有权限清单,装了就是沦陷。默认信任,就是默认漏洞。
五、骨架已经搭好,皮肤还没长出来
两派其实在说同一件事。
夸的人看到的是它把每一层都做成了可替换的插件,模型、工具、循环、沙箱都能换。骂的人看到的是,它把东西拆得很细,却没做出一层给普通用户用的外壳,复杂全摆在脸上。
商业上也是类似的情况。它把最核心的骨架免费开源,同一天却把算力调贵;口头上说"一切皆插件、模型可以随便换",但真用久了会发现,模型是能换,围着Harness长出来的那套插件、权限和工作流不好搬家。用得越久,这一层越难换。DeepSeek现在争的,就是这一层。
BG-VC最后一句说:"DeepSeek Harness已经造出了一副很强的Agent骨架,但还没有长出面向人的皮肤。"宝玉@dotey补了一句更直白的:开发者愿意折腾插件的前提,是你的产品先有大量普通用户,否则新鲜劲过了就没人了。