Tencent Hy3 —— 技术与市场分析

技术分析 · 2026年7月 Tencent Hy3:架构、基准测试及其对开源模型市场的意义 来自 Tencent AI Lab 的 Mixture-of-Experts 模型技术与市场分析 发布于:2026年7月 · 来源:Hugging Face, Artificial Analysis, Yahoo Tech / Decrypt 引言 2026年7月6日,Tencent 发布了开源模型 Hy3 —— 这是三个月前(4月23日)发布的 Hy3 preview 的完整版本。尽管这一发布在西方技术环境中并未引起太大关注,但其中的数据却不容忽视:该模型拥有 2950 亿总参数,而在推理过程中仅有 210 亿激活参数,其性能与规模大三倍的模型相当,但计算成本仅为后者的极小一部分。 Hy3 是由 Tencent Hy Team(原名为 Hunyuan)开发的产物,该研究团队负责中国最大的科技公司之一内部的 Hunyuan 系列。在 Apache 2.0 许可协议下发布该模型——允许自由进行商业使用——表明了 Tencent 超越中国市场的野心,并是对目前由 Meta (Llama)、Mistral 和 DeepSeek 主导的开源生态系统的直接挑战。 背景:为何 Hy3 至关重要 要准确评估 Hy3,有必要回顾过去的一年。当 DeepSeek 在 2025 年发布 R1 模型时,市场将其视为西方实验室对前沿模型垄断逐渐走向终结的信号。DeepSeek 表明,可以用远低于预期预算的计算资源构建出前沿级别的模型。 Hy3 在同样的逻辑下更进一步:不仅是成本效率,更是参数效率。前代产品 Hy2 拥有超过 4000 亿个参数。Tencent 有意识地将这一数字减少到 2950 亿,理由是这是一个平衡点——在此点上,推理能力已完全成熟,而增加额外参数带来的收益不再成比例。这不是一种妥协,而是一种架构上的宣言。 架构:实践中的 Mixture of Experts Hy3 是一个 Mixture-of-Experts (MoE) 模型——这是一种在推理过程中并非运行所有参数,而是将每个查询路由到被称为“专家”的专门子网络子集的架构。 参数 数值 总参数量 295B 推理时的激活参数量 21B (~7%) 专家数量 192 (routing top-8) 层数 80 注意力头数 64 (GQA, 8 KV heads, head dim 128) 隐藏层维度 4096 上下文窗口 256,000 token 词表大小 120,832 支持的精度 BF16 许可证 (完整版 Hy3) Apache License 2.0 关键数字是活跃参数与总参数的比例:21B 对 295B,仅约为 7%。这意味着在典型的推理过程中,模型所调用的参数数量与小型/中型类别模型(如 Mistral 7B、Llama 13B)相近,同时保留了全尺寸前沿模型的“知识储备”。 推理模式 Hy3 支持可配置的推理深度——这是开源模型中少见的功能: no-think (默认):不包含显式思维链的直接回答。速度最快,成本最低。 low :适度的思维链(chain-of-thought),适用于需要几个逻辑步骤的任务。 high :完整且详尽的逐步推理,推荐用于数学、编程和复杂的多步骤问题。 基准测试结果 编程与智能体 Hy2 与 Hy3 preview 之间最大的飞跃出现在编程任务中。SWE-bench Verified —— 一个测试模型修复 GitHub 仓库中真实错误能力的基准测试 —— 从 53.0%(Hy2)提升到了 74.4%(Hy3 preview)。这是在单一代际中实现了 40% 的增长。 模型 SWE-bench Verified Terminal-Bench 2.0 BrowseComp Claude Opus 4.6 80,8% — 77,2% GLM-5 77,8% — — Kimi-K2.5 76,8% — — Hy3 preview 74,4% 54,4% 67,1% Hy2 (前代产品) 53,0% 23,2% 28,7% STEM 推理 在清华大学的数学博士入学考试(2026年春季)中,Hy3 preview 取得了 88.4 的成绩(三次尝试的平均值),位居中国模型的第一名。在 GPQA Diamond —— 最具挑战性的专家知识基准测试之一中,它获得了 87.2。在 FrontierScience-Olympiad 中,完整的 Hy3 超越了 GPT-5.5。 Token 效率 腾讯的内部测试显示,Hy3 处理与文档相关任务时的 Token 消耗比 GLM-5.2 低 47.4% —— 这直接转化为生产环境中更低的成本。在 Artificial Analysis Intelligence Index 中,该模型获得了 41-42 分(同类模型的中位数为 25-29),在 83 个入选模型中排名第 16 位。 成本效益 模型 总参数量 激活参数 输入 ($/100万 token) 输出 ($/100万 token) Hy3 295B 21B ~$0.14 ~$0.58 GLM-5.2 753B ~32B 更高 更高 DeepSeek-V4-Pro ~1.6T ~37B 更高 更高 Kimi-K2.5 ~1T ~32B 更高 更高 Hy3 在提供与参数量大 2.5 至 5 倍的模型同等水平的性能时,其 API 成本处于同类产品中的最低水平。对于构建基于 LLM 产品的公司来说,这种差异在规模化应用中可能非常显著。 基础设施与部署 Hy3 preview 于 2026 年 1 月底开始训练,并在不到三个月内开源——对于前沿级(frontier)模型来说,这一速度极快。Tencent 将此归功于 2026 年 2 月进行的预训练和强化学习基础设施的全面重构。 该模型支持通过两个领先框架进行部署: vLLM vllm serve tencent/Hy3-preview \ --tensor-parallel-size 8 \ --speculative-config.method mtp \ --speculative-config.num_speculative_tokens 1 \ --tool-call-parser hy_v3 \ --reasoning-parser hy_v3 \ --enable-auto-tool-choice SGLang python3 -m sglang.launch_server \ --model tencent/Hy3-preview \ --tp 8 \ --tool-call-parser hunyuan \ --reasoning-parser hunyuan \ --speculative-num-steps 1 模型可在 Hugging Face( tencent/Hy3 和 tencent/Hy3-preview )、ModelScope 和 GitCode 上获取。 幻觉与事实准确性 “仅在有证据时回答;若无证据,请明确标注。” —— Tencent Hy Team 声明的训练原则 Tencent 明确描述了旨在减少“事实冲突”(上下文文档之间的矛盾信息)、“虚构”(虚假事实)和“逻辑不一致”的训练目标。这是为了应对企业级应用中日益增长的期望,因为产生幻觉的模型会带来运营成本——包括财务损失和声誉受损。 在 CL-bench 和 CL-bench-Life(基于公司真实业务场景构建的数据集)上的内部测试结果显示,模型在上下文跟踪和遵循复杂指令方面取得了显著提升。 生产应用 Hy3 已在腾讯的多个核心产品中投入生产使用: Yuanbao — 面向最终用户的 AI 助手 CodeBuddy — 编程助手(类似于 GitHub Copilot) WorkBuddy — 办公任务自动化代理 QQ 和腾讯文档 — 广受欢迎的沟通与协作应用 在 CodeBuddy 和 WorkBuddy 的内部测试中,Tencent 记录到:首个 token 的延迟缩短了 54%,端到端生成时间减少了 47%,并成功执行了多达 495 个步骤的代理工作流。 局限性 缺乏多模态能力。 该模型仅支持文本模式——不处理图像或其他类型的数据。在领先模型均为多模态的环境中,这是对于需要视觉分析的应用而言的一个实质性限制。 高冗余度(Verbality)。 在 Artificial Analysis Intelligence Index Hy3 preview 中,它生成了 1.2 亿个输出 token——而同类模型的中位数为 4,200 万。对于追求简洁的场景,这需要额外的提示词优化。 与领先者的差距。 在 WideSearch Hy3 preview 中,其得分为 70.2%,而 Claude Opus 4.6 为 77.2%。在 SWE-bench Verified 中——为 74.4% 对比 80.8%。对于每一个百分点都至关重要的应用场景,领先者仍保持着优势。 结论 Hy3 是一个值得认真技术评估的模型——无论是为构建自有基础设施的 ML 工程师,还是寻找具有成本效益的替代方案以取代闭源模型的企业解决方案架构师。 其核心优势包括:极高的参数效率(295B 总参数中包含 21B 激活参数)、可配置的推理深度、在代理任务和编程任务上的强劲表现、Apache 2.0 许可证以及极低的 API 成本。 Hy3 向市场提出的根本性问题不在于模型本身,而在于轨迹:如果 Tencent 能在三个月内构建出一个足以与耗资数亿美元的系统相媲美的模型——那么这种逻辑将以多快的速度普及? 本文基于 Tencent Hy Team 技术文档 (Hugging Face, GitHub)、Artificial Analysis 分析、Decrypt / Yahoo Tech 报告以及 Tencent AI Studio 官方网站。基准测试数据对应于 Hy3 preview 模型(2026 年 4 月)和 Hy3 模型(2026 年 7 月)。知识截止日期:2026 年 7 月。