DeepSeek V4:架构、价格、功能与风险 —— 2026年8月的现状
DeepSeek V4:在架构、成本和 AI 战略方面究竟带来了哪些变化 对 DeepSeek V4-Pro 和 DeepSeek V4-Flash 模型的权威分析。无虚假部署、未经证实的合作伙伴关系以及伪装成事实的预测。 信息状态:2026 年 8 月 1 日 · 价格和可用性可能会发生变化,因此在做出购买决策前请重新查阅官方文档。 30 秒结论 DeepSeek V4 是一个真实且具有技术意义的模型系列:它采用 Mixture-of-Experts 架构,拥有 100 万 token 的上下文窗口,在 MIT 许可下开放权重,且官方 API 价格极低。 然而,没有理由认为 V4 使用了 Engram 记忆、能在单张消费级显卡上流畅运行、已在 AWS Bedrock 上正式部署为 V4 或能保证本地安装后的 GDPR 合规性。最强劲的基准测试结果主要来自制造商,并需要在具体的业务流程中进行独立验证。 目录 具体发布了什么 V4 架构如何运作 V4 是否使用 Engram API 价格及其意义 基准测试究竟说明了什么 API 还是本地部署 隐私、GDPR 和安全性 已证实的业务影响 原文本中的误区与更正 企业内部的实际测试计划 1.
具体发布了什么内容 DeepSeek 于 2026 年 4 月 24 日宣布推出 V4 系列预览版。提供了两个模型:DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。两者均具备 100 万 token 的上下文窗口、推理模式和非推理模式、工具调用,以及与 OpenAI Chat Completions 和 Anthropic API 兼容的格式接口。[1][2] DeepSeek-V4-Pro 总计 160 亿参数,每个 token 约有 490 亿激活参数;根据 2026 年 7 月 31 日的更新,仍为预览版本。 DeepSeek-V4-Flash 总计 2840 亿参数,约 130 亿激活参数;2026 年 7 月 31 日,公共测试版中的 API 已更新至官方的 Flash-0731 版本。 上下文 两个模型在官方 API 中均提供 100 万 token 的上下文;最大响应长度可达 38.4 万 token。 权重许可 仓库和权重以 MIT 许可证发布,允许用于商业用途。 7 月 31 日的更新仅针对 Flash 版本。DeepSeek 表示 DeepSeek-V4-Flash-0731 版本保留了与之前的 Flash Preview 相同的架构和规模,但经过了重新后训练(post-training)。制造商表示,特别改进了代理能力(agentic capabilities)。API 中的 V4-Pro 以及在应用程序和网页服务中使用的模型在此次更新中未作变动。[3][4] 重要的命名修正: “MoE 2.0”并非 DeepSeek V4 架构的官方名称。在制造商提供的资料中,该模型被描述为具有混合注意力机制(mHC)、Muon 优化器和混合精度技术的 MoE 系列。因此,在修订后的文章版本中,我们不再将“MoE 2.0”作为技术名称。 2.
DeepSeek V4 架构如何运作 Mixture-of-Experts:大模型,较小的激活部分 DeepSeek V4 是 Mixture-of-Experts(专家混合)模型。简单来说,该模型拥有多个专门的模块,但对于给定的 token,仅激活其中的一部分。因此,虽然总参数数量可能非常高,但单次推理步骤的成本主要取决于激活部分。 然而,这并不意味着在自行托管时只需存储 130 亿或 490 亿个活跃参数。整个模型的权重必须在设备内存、主机内存或设计的分布式专家加载系统中可用。因此,“130 亿活跃参数”并不意味着 V4-Flash 的硬件要求与普通的 13B 模型相同。 针对长上下文的混合注意力机制 在技术描述中,V4 DeepSeek 展示了一种结合了 Compressed Sparse Attention 和 Heavily Compressed Attention 的混合注意力架构。其目的是在处理极长输入时降低计算成本和 KV 缓存的内存占用。制造商指出,在 100 万 token 的上下文下,V4-Pro 仅消耗约 27% 的单步推理操作和约 10% 的 DeepSeek V3.2 所需的 KV 缓存内存。对于 Flash 版本,声明的数值更低。这些是制造商提供的测量数据,而非独立审计结果。[5] 一百万 token 是输入的硬性技术限制,并不意味着模型能以相同的准确度利用整个文档中的每一条信息。在实践中,应针对实际案件、代码库或知识库,分别衡量事实检索、依赖关系理解、引用准确性以及生成响应的成本。 Manifold-Constrained Hyper-Connections V4 采用了 Manifold-Constrained Hyper-Connections(简称 mHC)。这是对网络层间连接的一种改进,旨在深层架构扩展时保持稳定的信息流。mHC 是 V4 的一个确认组件。然而,在不说明实验条件的情况下,不应为其赋予具体的成本优势或百分比开销。 Muon 与 FP4/FP8 混合精度 根据模型卡片,V4 在 16 亿参数规模下使用 Muon 优化器进行了训练。制造商还提到超过 320 亿的预训练 token 以及混合精度:MoE 专家的参数存储在 FP4 中,而大部分其他参数存储在 FP8 中。这种解决方案减少了对内存和带宽的需求,但并不会让 V4 变成可以在普通办公电脑上运行的模型。[5] DSpark 在官方 Flash-0731 中 Flash-0731 版本包含 DSpark 推测性解码模块。该技术旨在通过预测后续几个 token 并由主模型进行验证来加速生成过程。在 vLLM 中运行 V4-Flash-0731 的官方示例使用了配备四个 NVIDIA GB300 加速器的单节点。这是一个明确的信号,表明完整版本仍瞄准数据中心级基础设施。[4] 3.
DeepSeek V4 是否使用 Engram 记忆? 没有相关确认。 Engram 是 DeepSeek 的一个独立研究项目,在“Conditional Memory via Scalable Lookup”出版物中有所描述。该模块利用基于 n-gram 查询的记忆,旨在将模式的静态存储与主网络执行的计算分离。该出版物展示了 Engram 的实验结果,但并非 V4 架构的文档。[6] 在官方报告和 V4 模型卡中提到了混合注意力 mHC、Muon 以及 FP4/FP8 精度,但未提及 Engram。在官方仓库的讨论中,一名 DeepSeek 社区成员明确回答称,技术报告并未声明 V4 使用 Engram。[7] 已删除论点: 原文将 Engram 记忆、O(1) 时间复杂度查询以及将大部分记忆转移到 DRAM 的能力归功于 V4。这是另一条研究路线的描述,而非已部署的 V4 模型中的确认元素。 4.
API 价格:DeepSeek 真正的优势点 根据 2026 年 8 月 1 日生效的官方价格表,DeepSeek 按以下方式计费(每百万 token):[2] 模型 输入 — 命中缓存 输入 — 未命中缓存 输出 上下文 DeepSeek V4-Flash-0731 0.0028 USD 0.14 USD 0.28 USD 100 万 token DeepSeek V4-Pro Preview 0.003625 USD 0.435 USD 0.87 USD 100 万 token DeepSeek 预告将在高峰时段引入高出两倍的费率,但截至于文章撰写当日,官方文档指出该政策的生效日期尚未公布。因此,不应将常规价格、未来的高峰价格和之前的费率混为一谈。[2] 与选定闭源模型的参考对比 模型及官方标准费率 输入 / 100 万 token 输出 / 100 万 token 备注 > DeepSeek V4-Pro Preview 0.435 USD 0.87 USD 未命中缓存;DeepSeek 价格更新于 2026.08.01。 DeepSeek V4-Flash-0731 0.14 USD 0.28 USD 未命中缓存。 OpenAI GPT-5.6 Luna 1 USD 6 USD GPT-5.6 系列中最经济的变体。 OpenAI GPT-5.6 Terra 2.50 USD 15 USD 低于长输入阈值的上下文费率。 OpenAI GPT-5.6 Sol 5 USD 30 USD GPT-5.6 系列的旗舰变体。 Anthropic Claude Opus 5 5 USD 25 USD 标准 API 价格。 > 竞争对手价格来源:OpenAI 和 Anthropic 官方网站。Token 价格的比较并不等同于质量的比较。不同模型在生成的推理 token 数量、有效性、工具支持、延迟、企业协议、数据驻留以及支持级别方面存在差异。[8][9] 为什么仅凭 Token 价格不足以衡量 最便宜的模型并不一定能提供最低的最终处理成本。如果模型需要更多的尝试、更长的推理、额外的验证或者产生更多的错误,那么在 token 上节省的费用可能会被异常处理的成本所抵消。企业应当衡量正确完成任务的成本,而不仅仅是每百万个 token 的成本。 已证实的业务结论: DeepSeek 的官方价格远低于 OpenAI 和 Anthropic 旗舰模型的价格。这并不自动证明其质量相等,但为在大量任务中进行受控的对比测试提供了合理依据。 5.
基准测试:强劲的成绩,但主要源自厂商提供 DeepSeek 发布了关于 V4-Pro 和 V4-Flash 的广泛结果集。在 Pro 版本的模型卡片中,制造商报告的得分包括 SWE-bench Verified 中的 80.6 分。该结果与其它模型的表现进行了对比,但运行方法、代理框架(agent harness)、推理强度以及尝试次数都可能显著影响最终结果。[5] 在 Flash-0731 更新中,DeepSeek 给出的结果包括 Terminal Bench 2.1 中的 82.7、NL2Repo 中的 54.2、Cybergym 中的 76.7 以及 Toolathlon Verified 中的 70.3。制造商指出,代理任务是在 max 强度下并使用其专有的最小 DeepSeek Harness 环境运行的,该环境在发布时尚未公开。两个基准测试——DSBench-FullStack 和 DSBench-Hard——是 DeepSeek 的内部测试。[3][4] 因此,准确的描述应该是: DeepSeek 声称在选定的编码和代理任务中,其结果可与领先的闭源模型相媲美。 并不准确地说,已经独立证明了它在所有应用场景中与特定 Anthropic 或 OpenAI 模型完全持平或更胜一筹。 如何解读基准测试结果 检查该结果是由制造商、独立实验室还是聚合平台提供的。 对比相同的数据集、工具、Token 预算、尝试次数和推理强度。 将公开测试与内部测试区分开来。 不要将编码结果直接应用于波兰语、损害记录、客户沟通或法律分析。 在具有代表性且经过人工评估的样本上进行自己的测试。 6.
API 还是本地部署? 官方 API DeepSeek 提供与 OpenAI Chat Completions 兼容的格式,以及与 Anthropic API 兼容的独立格式。两个模型都支持 JSON、工具调用、推理模式和非推理模式。自 2026 年 8 月 1 日起,Responses API 支持 Flash,而对 Pro 的支持预计在 8 月初推出。[2][10] 接口的兼容性可能会减少集成代码中的更改数量,但这并不意味着可以在“十几分钟内”完成生产环境迁移。参数、推理格式、工具行为、JSON 架构、限制、错误语义、结果质量以及数据政策都可能有所不同。生产环境的模型更换需要进行回归测试、安全性测试、成本评估和容错性测试。 Chat Completions 接口在某种意义上是无状态的,即客户端必须在后续请求中发送对话历史。与此同时,DeepSeek 使用磁盘上的上下文缓存,并在隐私政策中说明了收集输入内容以及为开发服务而使用数据的情况。因此,“无状态 API”并不等同于保证不处理或不保留数据。[11][12][13] 开放权重与自有基础设施 在 MIT 许可下共享权重允许公司在自己的基础设施或选定的运营商处运行模型。如果环境确实是隔离的,并且已验证遥测、容器镜像和依赖关系,这可以限制将提示词发送到 DeepSeek 公共 API。 然而,对于并非所有组织来说,自有部署并不是廉价的云端替代方案。官方示例 V4-Flash-0731 在单个节点中使用四个 NVIDIA GB300 加速器。V4-Pro 则更大。社区量化可能会降低硬件要求,但与官方支持的生产配置并不相同。[4] 部署模型 主要优点 主要限制 DeepSeek 公共 API Token 成本极低且测试启动迅速。 数据由中国控制的服务处理;需要法律、合同和安全方面的分析。 自有权重托管 对处理位置和网络流量的控制。 高硬件要求、维护、更新、安全性以及缺乏自动合规保证。 外部欧洲运营商 无需构建自己的集群即可实现数据驻留在欧盟。 必须检查模型版本、委托协议、分包商、日志记录、保留期限和实际推理位置。 AWS Bedrock 当前的 AWS Bedrock 文档列出了 DeepSeek R1、V3.1 以及 V3.2。并未列出 DeepSeek V4。因此,原始文本中关于在 Bedrock 中部署 V4 的描述未被保留。[14] 7.
隐私、GDPR 和安全性 DeepSeek 政策规定了什么 2026 年 2 月 10 日的 DeepSeek 隐私政策指出,相关服务由一家在中国注册的公司运营。该公司可能会收集提示词、上传的文件、照片、对话历史、设备数据、IP 地址和使用日志。这些数据可用于提供服务以及训练和改进技术。用户有权反对将数据用于模型训练。[12] DeepSeek 还明确表示,其服务并非旨在处理敏感数据,如健康数据、儿童数据、生物识别信息、宗教信仰或精确位置,并建议不要发送此类数据。公司声明,它直接在中华人民共和国境内收集、处理和存储个人数据。[12] 对于基于开放平台开发的客户应用,DeepSeek 的政策指出,应用程序的开发商是最终用户数据的管理员,并应提供其自身的处理规则。然而,这并不取代协议、传输评估、法律基础或实施实体的义务。[12] GDPR:不可简化的内容 GDPR 并没有简单地禁止使用在中国开发的模型。然而,它要求包括合法处理基础、数据最小化、适当的安全措施、正确的控制者与处理者关系以及满足向第三国传输数据的相关要求等。[15] 2025年1月,意大利数据保护机构要求提供 DeepSeek 聊天机器人的公司紧急限制对意大利用户数据的处理,并启动了调查。原因包括认为提交给监管机构的信息不足。这是监管机构针对该消费服务的确认行动;并不意味着自动禁止在欧盟境内进行的任何权重部署。[16] 已删除的论点: 本地部署(on-premise)模型并不等同于“100% 符合 KNF 和 RODO”。本地托管可以限制数据传输,但公司仍需对处理目的和依据、访问控制、安全性、保留期限、决策质量、个人权利、文档记录以及人工监管负责。 AI Act AI Act 的义务取决于组织的角色和系统的使用方式,而非生产商的国籍。通用目的模型提供商的义务将于 2025 年 8 月 2 日生效,而欧盟委员会将于 2026 年 8 月 2 日获得执行这些要求的权力。在系统中将模型用于高风险场景的公司,可能会作为提供者或使用该系统的实体承担额外义务。[17][18] 已记录的安全事件 2025年1月,Wiz 研究人员发现了一个属于 DeepSeek 的公开可访问的 ClickHouse 数据库。据 Wiz 称,泄露内容包括超过一百万行日志、聊天记录、密钥和后台信息。在收到通知后,DeepSeek 已对数据库进行了加固。该事件并非涉及 V4 模型,但是评估供应商运营成熟度的重要因素。[19] 受监管公司的最低准则 在未经批准的法律和安全分析之前,不要向公共 API 发送健康数据、儿童数据、完整的损害记录或商业机密。 实施技术限制,而不仅仅是针对员工的规章制度。 在测试中使用合成数据或经过有效去标识处理的数据。 检查合同、处理地点、分包商、保留期、用于训练的数据以及执行个人权利的机制。 对于本地部署,要监控镜像、依赖项、出站流量、日志、管理员访问权限和权重更新。 8.