| 信息分类 | 科技资讯 / 工业智能 |
| 信息来源 | 微信公众号「CXO卓越圈」(IDC) |
| 原文发布时间 | 2026-08-18 |
| 研究机构 | IDC(国际数据公司) |
| 本站采集时间 | 2026-08-18 |
| 原文链接 | 点击阅读原文 |
“R1推动的是’推理普惠’,V4正在尝试推动的,则可能是’行动普惠’。当AI从’回答问题’真正跨越到’完成工作’,企业AI大转型才真正进入下半场。”
2026年8月13日,DeepSeek正式发布V4-Pro GA版本。与过去强调参数规模、数学或推理榜单不同,这次官方把一个词放到了突出位置:Agent。
DeepSeek正在把大模型竞争的主战场,从”谁能生成更好的答案”,转向”谁能成为Agent执行任务时最稳定、最经济、最开放的智能底座”。
一、V4 Pro核心指标一览
| 指标 | V4 Pro | V4 Flash |
|---|---|---|
| 总参数 | 1.6万亿(1.6T) | 2840亿(284B) |
| 激活参数 | 约490亿(49B) | 约130亿(13B) |
| 上下文长度 | 100万Token(原生支持) | 100万Token |
| 长上下文推理成本 | 单Token FLOPs约为V3.2的27%,KV Cache约为V3.2的10% | — |
| 推理强度 | low / high / max 三档可选,按任务难度动态分配 | |
| 开源协议 | 开放权重,MIT License,支持本地部署、vLLM、SGLang | |
| API兼容 | OpenAI Chat Completions、OpenAI Responses API、Anthropic API;已适配Codex;Claude Code、OpenCode可直接使用 | |
Agent专项测试成绩
| Benchmark | V4 Pro GA | V4 Flash(7月底) | 提升 |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 82.7 | +5.2 |
| NL2Repo | 61.5 | 54.2 | +7.3 |
| DeepSWE | 62.7 | 54.4 | +8.3 |
| Toolathlon-Verified | 74.1 | — | — |
| AutomationBench | 31.8 | 25.1 | +6.7 |
二、为什么V4 Pro越来越像一个”Agent底座”?
一个模型要成为Agent核心引擎,必须同时解决六个问题:复杂推理、工具使用、长程任务、上下文管理、成本效率、生态兼容。V4 Pro正在同时向这几个方向推进。
Agent的工作模式与Chatbot本质不同:
| 传统大模型 | AI Agent |
|---|---|
| Prompt → Answer(一次推理) | 目标→分解→搜索→调用工具→观察→修正→执行→完成(几十到几百次连续推理与行动) |
| 核心能力:单点IQ | 核心能力:Reasoning × Planning × Tool Use × Execution × Reflection |
三、1M上下文的真正意义:让Agent能工作更久
V4 Pro原生支持100万Token上下文,但关键不是”能放进100万Token”,而是通过Compressed Sparse Attention和Heavily Compressed Attention等架构创新,将百万Token上下文下的单Token推理FLOPs降至V3.2的约27%,KV Cache降至约10%。
为什么对Agent至关重要?
一个软件开发Agent的工作流程:读取代码库→分析需求→修改代码→编译→测试失败→查看日志→再修改→再测试→阅读更多文档……所有历史操作不断进入上下文。传统模型长时间运行后,KV Cache、延迟和推理成本会变得极其昂贵。
新指标正在出现:Context Length正在让位于 Effective Agent Horizon——一个Agent能稳定、经济地持续工作多长时间。
四、推理与工具调用真正融合:从Reasoning Model到Reasoning+Acting Model
DeepSeek从V3.2开始训练”Thinking in Tool-Use”(Agent训练覆盖超1800个环境和8.5万条复杂指令),V4进一步强化。API原生支持Function Tool和Web Search,Responses API可输出function_call、custom tool call和web search call等结构化结果。
| 维度 | 过去 | 未来 |
|---|---|---|
| 软件逻辑 | Code defines Workflow(程序员写死流程) | Goal + Policy defines Agent Behavior(人定义目标和边界,Agent自主决策) |
| 模型角色 | Reasoning Model(只思考) | Reasoning + Acting Model(思考+行动) |
| 企业开发 | 模型负责”大脑”,程序员写绝大部分Workflow | Agent自主决定调用哪些Skill、什么顺序、失败后如何重新规划 |
五、”Pro + Flash”双层架构:AI FinOps的模型基础
DeepSeek形成了V4 Pro(旗舰)和V4 Flash(轻量)的产品矩阵,两者保持约3倍价差,配合low/high/max三档推理强度,以及非高峰半价策略。
| 定价(每百万Token,峰值) | V4 Pro | V4 Flash |
|---|---|---|
| 缓存未命中输入 | $1.32 | $0.44 |
| 输出 | $3.96 | $1.32 |
| 非高峰价格 | 进一步减半 | |
未来企业Agent的自然架构:简单任务→Flash,复杂推理→Pro,关键决策→Pro Max。一个Agent完成任务可能产生100次模型调用,但只有约10次需要旗舰模型。
AI FinOps核心正在变化:
不再只是”用了多少Token?”,而是”什么任务,用什么模型,以什么推理强度,在什么时间执行?“未来成熟的企业Agent平台必须拥有Agent Model Router。”所有任务统一调用最强模型”的时代即将过去。
六、降低模型切换成本:Agent生态的”云原生”走向
V4 API同时兼容OpenAI、Anthropic接口,适配Codex,Claude Code/OpenCode可直接使用,并推出DeepSeek Harness开发者预览。这意味着模型越来越容易被替换。
未来Agent生态将走向:Agent Framework + Model Router + Skill/MCP + Runtime。企业真正长期积累的资产不再是某个模型,而是数据、知识、业务流程、Skill、Agent、评测体系和治理规则。
七、但V4 Pro还不是完整的企业Agent平台
需要客观认识DeepSeek的定位边界:
| V4 Pro已提供 | 企业级Agent平台仍需 |
|---|---|
| Agent模型层(推理+工具调用) | 身份认证与权限体系 |
| 部分Agent接口层(Responses API) | 长期记忆、Agent编排 |
| Function Tool、Web Search | MCP/Skill管理、数据治理 |
| 多轮推理+工具调用结构输出 | 执行沙箱、安全控制、人机审批 |
| — | 日志与可观测性、成本管理、Agent评测、生命周期管理 |
| 定位:Agent时代的基础模型底座 | 差距即为数智化厂商的市场空间 |
注:Responses API目前不原生支持computer_use、file_search、code_interpreter和MCP等工具类型;API仍为stateless,不支持previous_response_id、conversation、store、background等完整状态能力。
八、对数智化厂商的五大能力转向
“模型能力”正在快速商品化。过去”我们的模型更懂金融/制造”这类差异化正在减弱,长期壁垒转向五种能力:
| 序号 | 能力 | 核心内涵 |
|---|---|---|
| 1 | Agent Runtime | 让Agent稳定运行几十分钟到数天;失败重试、上下文管理、中断恢复、多Agent协作。重要性超过Prompt Engineering |
| 2 | 企业Skill体系 | 未来企业AI平台的核心资产不是100个大模型,而是1000个Skill(查库存、生成报价、审批授信、检查合规、分析合同……)。模型通用化,Skill行业化 |
| 3 | Agent治理 | Chatbot答错是体验问题,Agent执行错是生产事故。治理从”内容安全”升级为”行动安全”:权限控制、Policy Engine、Human-in-the-loop、操作审计、风险分级 |
| 4 | Agent Observability | 回答”为什么这样决定?调用了哪些工具?花了多少Token?失败在哪?业务结果如何?”AgentOps将成为继MLOps、LLMOps之后新的基础软件赛道 |
| 5 | Agent Value Management | 从卖License/Token调用量,走向任务完成量、数字劳动力、业务结果甚至价值分成 |
九、对行业用户的五大建设转变
-
从”模型选型”转向”模型组合”——通用/专业/Pro/Flash/私有模型共存,建设Enterprise Model Gateway + Router,模型成为可插拔资源而非一次性战略下注。
-
从”知识库建设”转向”知识+Skill建设”——RAG解决”AI知道什么”,Agent时代必须解决”AI能做什么”。企业API、微服务和传统系统接口需重新封装为AI可安全调用的Skill,这是未来几年最大的IT基础工程之一。
-
从”Copilot”进入”数字员工”——Copilot:人做事AI帮人;Agent:人设定目标AI完成、人处理例外。价值从节省几分钟进入流程自动化、运营效率提升和组织重构。分水岭:多少核心业务流程已由人和Agent共同完成。
-
从”Token运营”升级到”Agent运营”——管理Agent数量、活跃度、任务完成率、一次成功率、人工接管率、单位任务成本、业务价值和风险事件。新指标:DAA(Daily Active Agents,日活智能体)。
-
从”AI治理”进入”AI行动治理”——建立Agent Authority Framework:哪些Agent只读数据?哪些可写数据?哪些可下单?哪些可支付?哪些必须人工批准?AI权限将成为继”人的权限”和”应用权限”之后企业第三类重要数字身份体系。
十、大模型产业的战略转向
| 时间 | 竞争焦点 | 核心问题 |
|---|---|---|
| 2023-2024 | 模型生成能力 | 谁写得更好、懂得更多 |
| 2025 | 推理能力 | 谁更会思考复杂问题 |
| 2026 | Agent能力 | 谁能稳定调用工具、执行长程任务、进入生产流程 |
| 竞争范式 | 从 Model Benchmark 进入 Agent Economics | |
未来评价一个模型,越来越不能只看MMLU、GPQA或数学成绩,而要看:能连续工作多久?能调用多少企业工具?复杂任务一次完成率是多少?单位成功任务成本是多少?需要多少人工干预?最终创造多少业务价值?
结语:行动时代来临
DeepSeek R1最大的意义,是让行业重新思考:高水平推理是否一定意味着极高成本?
V4 Pro正在提出另一个问题:高水平Agent是否也可以拥有一个开放、可部署、可组合并且成本足够低的基础模型?
V4 Pro开放权重(MIT License)、支持本地部署,如果这一方向继续发展,可能推动中国企业Agent市场快速跨过关键门槛:从”少数高价值Agent试点”,进入”大量数字智能体规模化生产”。
真正的问题不再是”我要不要部署V4 Pro?”
而是”当企业同时运行1000个、1万个Agent,我们的数据、流程、系统、权限和治理体系准备好了吗?”
来源:IDC CXO卓越圈微信公众号。研究机构:IDC(国际数据公司)。