ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

实测!DeepSeek V4 Pro配自家Harness,响应更快、缓存命中率提升1%!

实测!DeepSeek V4 Pro配自家Harness,响应更快、缓存命中率提升1%! 【DeepSeek V4 Pro正式版上线波折】近期DeepSeek持续上演反转。8月12日没有发布会没有预告DeepSeek悄悄更新API文档编号为 0813 的DeepSeek -V4-Pro正式版模型深夜静默上线。高关注度和期待之外是现实体验与官方跑分之间的落差还有一经上线便预告涨价的质疑。8月13日距离新模型发布不到24小时DeepSeek官网首页发布的横幅和开放平台公告突然被撤下。API文档中模型名称没变开发者仍可正常调用但官方保持沉默。事后有开发者发现DeepSeek在Hugging Face后台代码仓库疯狂抢修疑似因为前端接口、后端推理栈与权重配置出现了严重错位导致体验 翻车。同天晚上DeepSeek重新发布公告确认V4 Pro正式版上线同时开源DeepSeek Harness开发者预览版一切又回到了主场。【ModelHarnessAgent】DeepSeek曾给出过一个公式ModelHarnessAgent。这意味着对可执行任务的Agent来说只有模型是不完整的。Harness的可控、可观测、可回溯的特性补上了模型所缺失的另一半。模型是大脑负责思考、推理和理解意图。但纯语言模型只能输出文本无法直接操作文件、修改数据库和浏览网页。Harness是 身体 和 神经系统它提供了模型与外部世界交互所需的一切包括工具调用、文件读写、沙箱环境、权限管理、任务编排等。没有Harness模型只是一台会说话的引擎但无法成为真正干活儿的Agent。DeepSeek试图通过自身打造的Harness系统将模型性能发挥到最大化。从测试结果来看也的确如此。在DeepSeek Harness加持下DeepSeek V4 Pro正式版的响应速度更快且比接入Claude Code缓存命中率提升了1%。【祛魅和争夺范式】“一切皆插件”是DeepSeek Harness最核心的设计理念。简单来说就是从模型、工具到最核心的Agent Loop都拆解为可独立、组合的插件。这个理念由北大与DeepSeek联合提出的“时空可组合性”范式支撑该范式将Agent组件拆解为两个维度。一是时间可组合性通过“可逆效应”机制让系统自动记录并撤销组件卸载后的副作用加载过程即决定卸载过程确保系统长期稳定。二是空间可组合性通过“响应式共效应”实现声明式依赖管理组件只需声明需求运行时就能自动协调依赖变化实现动态激活与停用。两者融合于统一的上下文、承载状态、生命周期边界和依赖环境。Harness因此可实现“无特权核心”所有组件包括Agent主循环均可替换开发者通过配置文件即可自由组合。这一理念为构建灵活且面向未来的Agent基础设施奠定了方向。在OpenAI、Anthropic等巨头纷纷定义自己的Harness时DeepSeek的思路显得独树一帜。OpenAI和Anthropic的战略是“向下整合”即通过打造体验极致、深度绑定自家模型的Harness巩固其在AI应用层的优势DeepSeek的战略是“横向铺开”不再满足只做一个优秀的模型供应商而是试图通过开源一个模型中立、高度模块化的Agent底层标准成为下一代AI应用的基础设施。网传的DeepSeek Harness内测入选项目名单同样释放了强烈的信号入选项目高度集中在能夯实Agent能力的基础设施领域。其项目主要围绕MCP插件、代码智能体、运行时、编排框架、可视化UI与多智能体调度等方向直指Agent在真实世界落地的核心难题。DeepSeek的一系列操作可视为一场精心设计的“祛魅”运动。DeepSeek开源Harness并大力扶持各类基建插件本质上是在做一件事将“如何构建一个强大的Agent”的一整套方法论和源代码公之于众。在此之前OpenAI和Anthropic的Harness更像一个“黑箱”其内部优化是核心机密如何打造Agent产品被视为一种“特权”。DeepSeek通过开源和Cordis插件理论主动拆解了这个黑箱并证明Agent的强大不在于某一个神秘的内核而在于一套可组合、可替换的工程组件。当Harness被充分祛魅成为一个透明、可被随时替换的组件后整个价值链上唯一不可被标准化、仍会持续进化的就只剩下最底层的“模型”本身了。如果把DeepSeek的模型、开源、Harness、涨价四个动作连在一起看就会发现DeepSeek的目标非常明确。先建立生态再定标准然后用最强的模型性能完成商业价值的最终变现。Harness和开源就像是免费修建的高速公路前期用来吸引车流而当车流足够多时顺势提高燃油的价格便成为了最高效的商业兑现方式。【砍掉prompt场景一次跑通】昨天的文章里测评了DeepSeek -V4-Pro-0813的七项复杂任务唯独指环王那题没有跑完整。当时为了赶时间只给了《指环王》第一章的3句开头。恰好DeepSeek Harness也出来了就在DeepSeek自家的Harness里跑这次完整的测试看看自家的工具配自家的模型能擦出怎样的火花。安装的过程就不赘述了推荐大家用npmNode.js的默认包管理器安装并管理项目所需的各种第三方库可以简单理解为一个开放的应用市场安装也方便升级和安装其他插件可以直接运行npx deepseek-ai/dsh web启动如果卡住不动的话可以先运行一遍npm install -g deepseek-ai/dsh然后再运行刚才的命令就可以顺利启动了。初次打开和大部分Agent一样只不过在DeepSeek Harness这里暂时还是极简的画风。装好环境之后正式开始今天的测试《指环王》这个基准测的不是“会不会画一只鹈鹕”而是“读懂一段文学→理解一个世界→把世界程序化搭出来”的完整链路是目前圈内最狠的Agent考题之一。昨天的测试为什么不算数因为当时只给了3句开头而Karpathy给Opus 5的是原著第一段。今天把原文补齐第一章前段完整文字从比尔博宣布111岁生日宴会到霍比屯议论再到弗罗多身世往事共计1817个词、23段一字不改。第一次测试按“评测就该严谨”的思路把提示词写得滴水不漏1817个词的原文加上场景要素清单洞屋要有圆形门、宴会长桌要有食物、宾客要议论纷纷再加上运镜要求、灯光要求、比例要求一共五条硬性要求。结果很打脸第一次生成的效果非常粗糙叙事也不完整。场景是搭出来了但离“霍比屯的生日派对”相距很远。效果呈现上运镜支离破碎画面像是赶工出来的半成品。穿模很严重山坡上站的小人像是插了一堆棒棒糖。复盘了一圈把原因归结为提示词太长了列出的场景限制了模型的发挥。第二次把提示词砍到只剩目标读懂原文用Three.js搭出霍比屯生日派对的3D世界运镜按原文节奏走保存为完整可运行的HTML文件。场景要素、灯光、比例要求全部删掉。效果反转了。场景竟然一次就跑通洞屋、比尔博、弗罗多、宴会长桌、酒馆前议论的霍比特人该有的都有角色只有轻微漂浮和穿模属于“能看出是霍比屯”的范畴运镜叙事成立按原文节奏从俯瞰霍比屯推到比尔博再扫过议论的人群最后环绕宴会长桌。同一个模型同样的原文一个细致入微的提示词换来翻车一句直白的目标换来及格以上的结果。看来现在顶级的模型反而不需要详尽的提示词只需要用直白简洁的话告诉他目标就可以了说多了反而效果会变差。这不是孤例GPT-5.6 Sol刚发布时社区就有人反馈套上精心优化的提示词和流程skill反而会让模型陷入死循环。这个发现值得单独提出来提示词的作用正在从“写剧本”变成“定目标”给顶级模型写小作文的时代可能真的过去了。【DeepSeek Harness到底行不行】回到今天的正题DeepSeek Harness配自家的V4 Pro表现如何响应更快了。同样的测试DeepSeek Harness里的响应比前一天在Claude Code里接入时更快。缓存命中率涨了一个点。前一天在Claude Code接入是98%在DeepSeek Harness里是99%。这个提升看起来小但在长上下文任务里缓存命中率每涨一个点都是实打实地关系到成本和生成速度。再看测试本身第一次的长提示词翻车发生在DeepSeek Harness环境里第二次反转也在同样的环境。但全程没有环境相关的报错、卡顿、上下文丢失两轮测试的对比是干净的变量只有提示词本身。作为一个刚发布的开发者预览版这是很加分的稳定性而且DeepSeek Harness还会把运行过程中每一步都显式的呈现出来可以看到模型是怎么工作的这是一个很好的创新。短期内DeepSeek Harness所能产生的作用还很有限作为普通用户很难像使用WorkBuddy一样在工作中提效。但从长期来看DeepSeek Harness与DeepSeek系列模型形成了难以割裂的增强闭环。Harness作为完全开源的Agent框架定义了“模型如何被调用、工具如何被组合、任务如何被编排”的底层标准吸引了海量开发者和真实任务涌入。而这些真实任务的执行轨迹通过Harness内置的可观测体系源源不断地回流为DeepSeek模型下一轮训练与优化提供天然数据养料。反过来DeepSeek模型能力的每一次跃升Harness又能第一时间通过内置适配器将其能力释放到插件生态中。当这套飞轮转起来开发者的选择就变得不再困难。因为使用DeepSeek Harness就会得到一个始终与最强模型同步进化且无需二次适配的开箱即用系统。这正是DeepSeek所定义的“AgentModelHarness”的终极形态一个彼此增强又不可分割的完整个体。
返回列表