近日,人工智能领域迎来新动态,DeepSeek在官网悄然完成更新,备受瞩目的DeepSeek V4 Pro正式版模型闪亮登场。尽管目前DeepSeek尚未发布正式公告,但开机实验室从用户群获悉,该团队已确认DeepSeek V4 Pro正式版已更新至API,且调用模型名称保持不变。
从公开信息来看,DeepSeek V4 Pro具备强大性能。它支持1M上下文长度,最大输出长度可达384K Token,同时提供非思考模式和思考模式供用户选择。在API支持方面,涵盖JSON Output、Tool Calls、Responses API、Anthropic API,还支持Beta阶段的对话前缀续写与FIM补全。接入方式上,支持Responses API和Codex接入,满足不同用户的需求。
价格方面,DeepSeek V4 Pro一直是近期关注焦点。目前,其输入价格为3元/百万Tokens,若缓存命中则为0.025元/百万Tokens;输出价格为6元/百万Tokens。与DeepSeek V4 Flash相比,V4 Pro的输入、输出价格是后者的3倍。然而,将其置于同行队列中,价格优势依然明显。据开机实验室此前不完全统计,国内大模型中,输入价格在缓存未命中情况下,最贵的是阿里Kimi新推出的大模型K3,达20元/百万Tokens;最便宜的是阿里Qwen3.7 - Flash,仅需0.20元/百万Tokens。输出价格方面,最便宜的是阿里Qwen3.7 - Flash,为0.8元/百万Tokens;最贵的是K3,高达100元/百万Tokens。其他国产大模型价格在此区间内波动。
从DeepSeek公布的V4 Pro首批跑分情况可知,新版本亮点突出,尤其在Agent能力上显著增强。与预览版及其他大模型相比,表现可圈可点。开机实验室发现,正式版本在10项Agent能力评测中全部实现提升,提升最明显的集中在软件工程、网络安全等实战类评测。
在DeepSWE评测中,该评测主要考察AI智能体在复杂软件工程场景下的能力,V4 Pro得分从预览版的12.8分跃升至62.7分,近乎翻5倍。Cybergym评测考验Agent在真实世界的网络安全能力,V4 Pro得分从52.7分升至83.3分。将V4 Pro与国内外主流旗舰模型,如Kimi - K3、智谱GLM - 5.2、Anthropic的Opus 4.8、Fable 5对比,会发现这一代V4 Pro主打“能干活”。在Cybergym评测中,V4 Pro得分排名第一,略高于Fable 5(83.1分)和Kimi - K3(80.0分);AutomationBench评测主要测Agent业务流程自动化能力,V4 Pro以31.8分的成绩位列第一,高于Kimi - K3(30.8分)和Fable 5(29.1分)。不过,在知识推理(HLE)、代码仓库生成(NL2Repo)、长程工具调用(Toolathlon)等项目上,V4 Pro略低于友商的旗舰大模型。
与此同时,DeepSeek Harness团队的轮廓逐渐清晰。几天前有消息称,该团队已完成微信公众号注册。开机实验室查询发现,公众号DeepSeek Harness团队已注册,认证公司主体为北京深度求索人工智能基础技术研究有限公司。据DeepSeek官网介绍,该团队以研究、工程、产品相结合的方式,将DeepSeek的模型能力转化为前沿科研突破与领先的Agent产品。
那么,Harness究竟是什么呢?一个能干活的智能体Agent由大脑(模型)和手脚(Harness)组成。模型负责理解需求、推理和生成方案;Harness负责读写文件、调用工具、运行代码、记忆管理等,将模型能力落地到真实环境中,完成从理解需求到交付结果的完整闭环。目前,最为知名的两款Harness是OpenAI的Codex和Anthropic的Claude Code。
据多家媒体报道,DeepSeek Harness于2026年5月内部立项,独立组建Harness专项核心团队,由崔添翼担任负责人。公开信息显示,崔添翼毕业于浙江大学计算机系,加入DeepSeek前,曾在量化交易机构Jane Street任职约九年,后又以联合创始人身份在量化投资机构天市垣资本工作三年多,2026年3月加入DeepSeek Harness团队。此前,崔添翼在社交媒体发文称,DeepSeek Harness目前开放产品经理、研发工程师等岗位招聘。
开源证券计算机行业点评报告认为,DeepSeek Harness框架首次亮相,承载Agent运行时与持续学习能力,推动Agent应用从原型验证阶段走向规模化商用落地。海通国际指出,未来模型实际效果将越来越取决于“模型+Harness+工具+数据”的整体组合,单纯依靠基础模型能力建立壁垒的难度将进一步上升。











