腾讯开源Hunyuan-A13B:80B参数仅激活13B,快慢思考双模式
Hunyuan-A13B Technical Report作者Tencent Hunyuan Team, Ao Liu, Botong Zhou, Can Xu, Chayse Zhou, ChenChen Zhang, Chengcheng Xu, Chenhao Wang, Decheng Wu, Dengpeng Wu, Dian Jiao, Dong Du, Dong Wang, Feng Zhang, Fengzong Lian, Guanghui Xu, Guanwei Zhang, Hai Wang, Haipeng Luo, Han Hu, Huilin Xu, Jiajia Wu, Jianchen Zhu, Jianfeng Yan, Jiaqi Zhu, Jihong Zhang, Jinbao Xue, Jun Xia, Junqiang Zheng, Kai Liu, Kai Zhang, Kai Zheng, Kejiao Li, Keyao Wang, Lan Jiang, Lixin Liu, Lulu Wu, Mengyuan Huang, Peijie Yu, Peiqi Wang, Qian Wang, Qianbiao Xiang, Qibin Liu, Qingfeng Sun, Richard Guo, Ruobing Xie, Saiyong Yang, Shaohua Chen, Shihui Hu, Shuai Li, Shuaipeng Li, Shuang Chen, Suncong Zheng, Tao Yang, Tian Zhang, Tinghao Yu, Weidong Han, Weijie Liu, Weijin Zhou, Weikang Wang, Wesleye Chen, Xiao Feng, Xiaoqin Ren, Xingwu Sun, Xiong Kuang, Xuemeng Huang, Xun Cao, Yanfeng Chen, Yang Du, Zhen Yang, Yangyu Tao, Yaping Deng, Yi Shen, Yigeng Hong, Yiqi Chen核心发表机构Tencent论文链接arXiv:2609.27284v1发布于arXiv 预印本cs.AI一、核心贡献 / Core Contributions高参数效率的细粒度稀疏 MoE 架构Hunyuan-A13B 总参数 80B推理时仅激活 13B采用 1 个 shared expert 加 64 个 fine-grained non-shared experts 的结构每次仅激活 8 个 non-shared expert。该设计使模型在推理吞吐和部署成本上明显优于同等能力的 dense 模型同时保持了对齐更大规模 MoE 模型的能力上限。严格过滤的 20T-token 预训练语料与 STEM 增强通过复用并针对 Hunyuan-A13B 优化的数据整理管线含预处理、模型抽取与后处理三阶段论文额外成功提取了 250B 高质量 STEM token并设计 refined knowledge labeling system 与 multi-dimensional difficulty grading framework用于提高标签准确性和多维语料筛选效率。四步式后训练流程与大规模强化学习后训练分为 reasoning-oriented SFT、targeted RL、general-purpose SFT、generalized RL 四个阶段其中推理导向 RL 基于 GRPO引入 outcome reward model二元奖励r ∈ { 0 , 1 } r \in \{0,1\}r∈{0,1}与覆盖 36 种语言、支持超过 1000 并发执行的代码沙盒反馈全场景 RL 则统一了灵活 GRM 与领域专用奖励管线覆盖 16 个子主题与超过 30 个评分服务。统一训练的双模式 Chain-of-Thought通过统一的训练结构同时支持 fast-thinking 与 slow-thinking 两种推理模式以think块是否为空作为区分并通过/no_think与/think控制标签在推理时切换未提供控制标签时默认为 slow-thinking。面向延迟敏感场景的高推理吞吐论文报告了在 A16W16C16 精度下的吞吐测试结果batch1 时达到190.84 190.84190.84tokens/sbatch32 时达到1981.99 1981.991981.99tokens/s并支持与 vLLM、SGLang、TensorRT-LLM 等主流推理框架以及多种量化格式集成。二、研究背景与动机 / Background Motivation当前大语言模型的能力提升在很大程度上依赖于模型参数规模的扩张但参数规模的扩张同时带来了推理延迟上升、硬件成本增加以及部署门槛提高等问题。论文在 Introduction 中明确将 GPT-4o、o1、o3、Gemini 2.5、DeepSeek-R1、Qwen3 等列为先进系统并指出这些系统的部署通常伴随着很高的计算资源需求与推理延迟。对于需要实时响应、资源受限或要求快速可靠预测的应用场景而言这种能力—成本之间的矛盾构成了核心挑战。Mixture-of-ExpertsMoE架构被广泛视为缓解该矛盾的有效途径通过稀疏激活模型可以在保有较大参数容量的同时将单次推理的实际计算量控制在远低于总参数量的水平。Hunyuan-A13B 正是基于这一思路设计总参数 80B但单次推理仅激活 13B目标是在模型能力、计算效率与部署成本之间取得平衡。与论文中列出的 Hunyuan-Large-1116MoE激活 52B、总参 389B、Qwen2.5-72BDense72B、Qwen3-A22BMoE激活 22B、总参 235B相比Hunyuan-A13B 的激活参数只是其中最小的一档。论文的第二个动机来自预训练数据质量。摘要指出模型在严格过滤的 20T-token 语料上预训练并特别增强了 STEM 数据的整理以提升 factual reliability 与 reasoning ability。源代码笔记显示除了复用 Hunyuan-TurboS 的数据管线之外团队针对 STEM 数据做了额外的获取与清洗优化最终获得 250B 高质量 STEM token并通过 refined knowledge labeling system 与 multi-dimensional difficulty grading framework 支撑多维语料的筛选。第三个动机来自推理范式的效率问题。复杂多步问题往往需要长链推理而常规查询并不需要。若所有请求都走长链推理路径会造成不必要的 token 消耗和延迟。Hunyuan-A13B 因此引入 dual-mode Chain-of-Thoughtfast-thinking 模式用于常规查询、追求低延迟slow-thinking 模式用于复杂、多步问题、追求更深的推理步骤如 reflection 与 backtracking。用户可根据应用复杂度与资源约束灵活选择从而在效率与任务特定准确性之间取得平衡。三、方法 / Methodology3.1 总体框架 / Overall ArchitectureHunyuan-A13B 的方法体系可以分为预训练与后训练两大部分并辅以一个贯穿推理阶段的 dual-mode CoT 机制。预训练采用三阶段顺序流程。第一阶段是 Foundation Training Stage处理总量为 20T token上下文窗口固定为 4096。学习率调度分为三段先做线性 warmup将学习率升至最大值3 × 10 − 4 3 \times 10^{-4}3×10−4然后在 13.5 trillion tokens 内做 cosine decay降至最小值3 × 10 − 5 3 \times 10^{-5}3×10−5剩余训练步骤保持该最小值。第二阶段是 Fast Annealing Stage起始学习率3 × 10 − 5 3 \times 10^{-5}3×10−5在 300B tokens 上快速 cosine decay 至8 × 10 − 6 8 \times 10^{-6}8×10−6上下文窗口增加到 8192。第三阶段是 Long-Context Training Stage分两步扩展上下文先扩到 32K再扩到 256K位置编码采用与 Hunyuan-TurboS 相同的 NTK-aware 方案32K 阶段 alpha 取 50256K 阶段 alpha 取 1000。后训练采用结构化、多阶段的方法包含两类互补的微调reasoning-oriented fine-tuning 与 general-purposeall-scenariosfine-tuning。Introduction 给出的四步顺序为先做 reasoning-oriented SFT再做 targeted RL 以增强推理能力随后做 general SFT 覆盖多领域任务最后做 generalized RL 以增强更广泛的 instruction-following 能力。推理阶段的 dual-CoT 机制与上述后训练流程配套训练时两种模式采用共同的结构化格式区别仅在于think内容块中是否包含详细的逐步推理推理时用户通过控制标签选择模式。3.2 关键模块 / Key ModulesMoE 架构与专家配置。Hunyuan-A13B 采用 fine-grained MoE具体构成是 1 个 shared expert 与 64 个 fine-grained non-shared/specialized experts所有专家具有相同的 intermediate dimension。训练时 shared expert 始终激活只有 8 个 non-shared experts 同时激活由此得到 80B 总参数与 13B 激活参数的组合。该配置的确定基于作者对 MoE 架构 scaling laws 所做的大量实验没有 shared expert 的模型通常差于至少有 1 个 shared expert 的模型而 shared expert 数量超过 1 之后收益递减仅有边际改善甚至出现性能波动因此最终选择 1 个 shared expert。其他架构组件。激活函数采用 SWiGLU与 Hunyuan-Large、Hunyuan-TurboS 保持一致注意力机制采用 Grouped-Query AttentionGQA以提升 KV Cache 的内存效率Tokenizer 与 Hunyuan-Large 相同词表大小为 128K。表 1 给出的关键超参数包括层数 32、Attention heads 32、Key/Value heads 8、Shared Experts 1、Specialized Experts 64、Activated Specialized Experts 8、Hidden Size 4096、FFN Hidden Size 3072。预训练数据管线。复用 Hunyuan-TurboS 的数据整理管线包含三个模块Data preprocessing module 负责去重、低质量过滤、数据去噪与主题标注Model-based extraction module 从前一模块输出的数据中提取纯文本Post-processing module 对提取语料做低质量过滤与语义级去重。针对 Hunyuan-A13B 的优化集中在 STEM 数据的获取与清洗流程最终并入 250B 高质量 STEM token。推理导向 SFT 数据构建。该阶段目标是加强数学推理、逻辑推断、代码生成与科学分析等复杂推理任务使用精心策划的 instruction-response 数据集并要求包含显式推理过程与详细 CoT 解。数学数据来自教材、标准化考试与数学竞赛难度覆盖基础算术到高级奥林匹克级构建时使用 SOTA 生成奖励模型与自动解题验证机制迭代评估和精炼 CoT 示例只保留严格验证过的推理解答对。代码数据来自精心选择的开源仓库例如 GitHub采用引用 Magicoder 的成熟 pipeline 将代码片段系统转化为结构化指令推理对覆盖多种任务、编程语言与问题类型并通过涉及 critic models 与 sandbox execution tests 的多阶段验证确保正确性、逻辑连贯性与可执行性。逻辑数据来自版权和公开可用的谜题集合并采用受 ZebraLogic 启发的自动数据合成方法进行扩展按问题类型和难度系统分类质量保证分两层标准场景由自动 CoT 评估模型处理复杂案例由人工标注者验证。科学数据覆盖物理、化学、生物等学科难度从中学到研究生水平使用 LLM 评估问题难度与质量高级大学考试题与科学奥林匹克题经 advanced LLM-based verifier 严格审查验证重点是识别并纠正单位换算、数值近似、化学符号等细微科学差异最终只纳入通过 rejection sampling 的样本。推理导向 RL。在 SFT 模型基础上针对四个领域进一步 RL算法采用 Group Relative Policy OptimizationGRPO。奖励分两类一是 Outcome Reward Model即轻量语言模型 verifier评估生成答案与参考解之间的一致性奖励为二元值r ∈ { 0 , 1 } r \in \{0,1\}r∈{0,1}1 表示对齐、0 表示不对齐设计上刻意规范化格式、单位换算、同义词等表面差异以减少 false negatives应用于数学、逻辑与科学评估二是 Sandbox Feedback即多语言代码沙盒支持 36 种编程语言如 Python、C、Go、Java部署在分布式 CPU 集群上支持超过 1000 次并发执行并采取严格安全措施包括文件隔离与网络隔离防止恶意代码执行。RL 的 prompt 从 SFT 模型表现不稳定的案例中采样数据集规模为 150K samples领域比例为 Mathematics : Coding : Logic : Science 2 : 2 : 1 : 1 2:2:1:12:2:1:1与 SFT 训练数据的关系是 10% 重叠、90% 为新案例。题型方面排除了 multiple-choice、true/false 与 proof-based problems以避免奖励猜测、确保结果可验证。RL 训练分为两个上下文长度阶段灵感来自 deepscaler2025Phase 1 使用 24K 长度上下文Phase 2 扩展到 32K目的是系统性增强推理深度。训练配置上参考 yu2503dapo 移除了 KL divergence constraint使策略更新更灵活同时采用 on-policy learning strategy、大 batch、增加的 rollout 数量以及相对较低的采样温度0.6 0.60.6–0.8 0.80.8。论文的结论是这些措施 collectively benefit the RL training process。全场景 SFT。在模型已具备复杂推理能力的基础上该阶段从专门推理数据集中采样一部分并与通用领域样本混合进行 SFT。补充数据集覆盖八类能力Language Understanding Tasks 强调理解、准确翻译与流畅文本生成严格排除不清晰或歧义指令通过先进 response scoring models 验证响应且明确阻止 reward manipulation并对语言指令数据进行迭代专家重写Creative Writing 按 genre、style、tone、narrative structure 标注以保证多样性通过 discriminative reward modeling 过滤低质量或不稳定样本再用迭代自改进加专家辅助重写Multilingual Tasks 通过 advanced augmentation、instruction-evolution 与 back-translation 合成覆盖英语及其他多种语言的代表性指令数据集并由专门语言专家监督标注与验证Complex Instruction Scenarios 合成包含不同约束、需要广泛上下文整合与 agent-driven requirements 的数据集用基于规则的方法保证响应遵守约束长上下文任务要求跨不同文本片段综合信息复杂交互要求工具使用、战略规划、反思与多阶段推理Role-based Interaction 基于不同人格特质构建多样角色档案用复杂 prompt-engineering 生成符合人设的对话样本并以 trait accuracy、instruction adherence、emotional empathy 作为评估指标Knowledge-Based QA 采用多层验证策略由专门 critic models 系统过滤不准确与无根据的信息以缓解幻觉Multi-Turn Dialogues 整合开源数据、vendor-sourced materials、controlled data synthesis 与 advanced pseudo-dialogue techniques覆盖 task-oriented conversations、social dialogues 与 QA exchangesAgent 类数据的构建目标是增强 planning、tool invocation、reflection 等对话交互技能其中正文提到开发了一个包含 user、planner、tool、agent、checker 五个角色的多角色合成数据引擎以模拟真实多方对话并整合 sandbox tools、model context protocols (MCPs)、synthetic tools 三个数据源获取工具响应同时针对 fast/slow thinking 数据不平衡优化 prompt 策略并训练一个特殊模型生成思考过程设计超过 30 种 agent system instructions结合工具、动作、响应的格式变化创建20,000 20{,}00020,000种格式组合并重点增强 Excel 处理、deep search 等高频率任务。需要说明的是源代码笔记指出 Agent 的详细小节在源码中位于\iffalse ... \fi注释块内未作为正式排版内容且该注释版本的五角色命名为 User、Planner、Responser、Agent、Checker与正文版本user、planner、tool、agent、checker存在命名差异属于源码内部版本差异不代表同一套描述。注释版本的补充细节还包括环境反馈生成区分 sandbox tools通过受控环境收集真实信息、MCPs从开源工具包获得结构化反馈与 synthetic tools先生成多样工具再由 LLM 模拟响应前两者提供真实数据但成本高、工具多样性受限在思考过程生成上由于 fast-thinking 数据远多于 slow-thinking 数据团队将 fast-thinking 数据多样性转移到 slow-thinking、挖掘更高难度样本并附加思考过程并把 agent 执行过程抽象为 Markov 过程针对访问外部信息带来的低效思考生成与执行流扰乱两个问题先优化思考链生成 prompts再选择高质量 action-thinking chain 对训练专门模型模板泛化方面随机选择 20% 的训练数据为每个样本生成格式泛化版本特定能力增强上优化 Excel 处理、AI 搜索、基于代码的数学问题求解与 MCP 调用。注释版 RL 还给出了更细的奖励规则通过所有测试用例得 1 11错误或测试失败时为 0 或按错误类型为负例如语法错误− 0.5 -0.5−0.5、逻辑错误− 0.3 -0.3−0.3且奖励分配仅在固定代码通过单元测试后触发。全场景 RL。该阶段将优化扩展到通用任务重点是集成多样奖励机制与任务特定框架以确保鲁棒泛化。核心组件是 Generative Reward ModelGRM遵循 zhang2024generative、mahan2024generative、xu2025unifiedpairwiseframeworkrlhf 一类工作GRM 将候选答案与 reference answer 比较对创意写作等开放式任务reference answer 作为语义锚点对闭卷 QA 等确定性任务使用 ground-truthGRM 可选摄入 CoT reasoning traces 以提高多步推理任务的判断准确性并能调用外部工具、报告长度统计、检查输出是否符合任务约束从而通过精心构造的 prompts 评估正确性。每个 track 由 dedicated reward service、对应的 preference datasets and rules 与专门设计的数据构建管道支持Text Understanding 使用一致性模型客观 QA与比较 GRM主观或开放式任务Translation 由领域专家标注平行语料并据此训练 GRM 提供忠实奖励Long Context 增加 hallucination-focused reward model 与 online RL 以增强稳定性Creative Writing 使用基于相对偏好判断的成对 GRM 缓解 reward hacking并将创意奖励与自动化指令遵循检查混合Agents 使用 sandbox tools 与 MCPs 提供信息反馈并构建基于规则的奖励奖励函数含 format reward正确特殊标记与顺序为 1、否则为 0与 correctness reward评估预测与参考之间工具、参数、值的一致性两个组件Multi-Turn Dialogue 使用对话特定 critic models 与通用奖励Complex Instructions 使用约束提取与满足工具辅以通用 critic 与奖励模型Role-Playing 评估指令理解、角色一致性与共情Safety 使用分类器与拒绝启发式识别安全响应对并将安全对齐直接集成到偏好数据集Knowledge QA 使用有/无参考访问的幻觉检测模型与以用户体验为中心的模型联合优化Multilingual 使用 GRM 采样并评分 SFT 答案保留高多样性、答案方差和质量的 promptsFinance、Legal、Medical 领域则基于一致性的奖励从专业考试中识别不稳定项目提供偏好数据。整体上All-Scenarios RL 统一了灵活 GRM 与领域特定管道覆盖 16 个子主题与超过 30 个评分服务并通过对抗性 prompt 过滤与动态采样确保跨域泛化。Dual-Mode Chain-of-Thought。Fast-thinking 模式输出简洁高效、适合较简单任务需要速度与最小计算开销slow-thinking 模式包含更深、更全面的推理步骤如 reflection 与 backtracking导致更长 CoT 与更多 token 使用但显著提高复杂推理任务的准确性与鲁棒性。后训练采用统一训练结构同时优化两种模式两种训练示例采用共同结构化格式区别在于 dedicatedthink内容块中是否有详细推理步骤fast-thinking 的think块故意为空源码写作think\n\n/thinkslow-thinking 的think块显式包含逐步推理。推理时用户通过/no_think选择 fast-thinking、通过/think选择 slow-thinking未提供控制标签时系统默认 slow-thinking。四、实验 / Experiments4.1 数据集与评估指标 / Datasets Metrics预训练模型评测从四个核心能力维度展开general tasks、coding、mathematics、multilingual capabilities。具体基准设置为General Tasks 包括 MMLU5-shot、MMLU-Pro5-shot、MMLU-Redux5-shot、BBH3-shot、SuperGPQA5-shotCoTCoding Tasks 包括 EvalPlus0-shot、MultiPL-E0-shot语言含 Python、C、JAVA、PHP、TypeScript、C#、Bash、JavaScript、MBPP-3shot、CRUXEval1-shotMath STEM Tasks 包括 MATH4-shotCoT、CMATH、GSM8K4-shotCoT、GPQA5-shotCoT。对比模型为 Hunyuan-Large-1116MoE激活 52B总参 389B上下文 256K、Qwen2.5-72BDense72B128K、Qwen3-A22BMoE激活 22B总参 235B128K与 Hunyuan-A13BMoE激活 13B总参 80B256K。后训练模型评测覆盖数学、科学、编码、推理、指令遵循、文本生成、NLU、Agent 等能力。具体设置为Mathematics 使用 MATH、AIME 等高级竞赛数据集Science 使用 GPQA-Diamond、OlympiadBenchCoding 使用 LiveCodeBench、FullstackBench、McEval并引入用于评测 LLM 前端代码生成能力的 ArtifactsBench论文称即将公开Reasoning 使用 BBH、ZebraLogic、DROPF1 指标Instruction Following 使用 IFEval、SysBenchText Generation 使用两个内部基准 LengthCtrl衡量模型精确遵守预定义输出长度约束的能力与 InsCtrl评估模型准确理解和执行复杂文本指令的熟练度NLU 使用两个内部基准 ComplexNLU高级和长尾推理任务与 Word-Task词级细粒度词汇和语义理解Agents 使用 BFCL v3、τ-Bench、ComplexFuncBench、C³-Bench模拟多轮任务、长上下文、复杂工具交互与多样调用策略。长上下文评测使用四个基准PenguinScrolls 是高质量人工标注数据集面向真实用户体验场景覆盖 Information Extraction、Information Localization、Qualitative Analysis、Numerical Reasoning 四类长文本任务文本类型包括书籍、财务报告、法律文件与学术论文LongBench-v2 评估通用长上下文理解覆盖 single-document QA、multi-document QA、long in-context learning、long-dialogue history understanding、code repository understanding、long structured data understanding 六类任务强调深度理解与推理而非简单检索FRAMES 面向 Retrieval-Augmented GenerationRAG场景同时评估 factuality、retrieval accuracy 与 reasoning使用需要整合多来源信息的 multi-hop questionsRULER 用于理解模型性能如何随上下文长度增加而扩展可配置序列长度和任务复杂度论文选择 QA 子任务因为其更接近真实场景且任务捷径少。对比模型为 Gemini 2.5 Pro、DeepSeek R1、Qwen3-A22B 与 Hunyuan-A13B。效率评测使用表tab:performance_comparison标题为 Model Throughput of Hunyuan-A13B在 A16W16C16 精度设置下测试不同 batch size 与输出长度下的吞吐。需要说明的是源代码笔记明确表示片段中未给出 SFT 与 RL 的显式损失函数公式因此本节不涉及损失函数的描述。4.2 主实验结果 / Main Results预训练模型评测结果。论文称与 Hunyuan 团队早期开源 MoE 模型 Hunyuan-Large 相比Hunyuan-A13B 在 14 个评测基准中 12 个更好且仅使用约 1/4 激活参数与约 1/5 总参数与总参数规模相似的 Qwen2.5-72B 相比Hunyuan-A13B 在几乎所有评测基准上得分更高与总参数约 3 倍、激活参数约 2 倍的 Qwen3-A22B 相比Hunyuan-A13B 在 12 个评测基准中的 7 个超越。具体数值方面General Tasks 上 Hunyuan-A13B 的表现为 MMLU 88.17、MMLU-Pro 67.23、MMLU-Redux 87.67、BBH 87.56、SuperGPQA 41.32。其中 MMLU-Redux 为该组最高分MMLU 接近该组最高的 Hunyuan-Large-111688.40。Coding Tasks 上为 EvalPlus 78.64、MultiPL-E 69.33、MBPP 83.86、CRUX-I 70.13、CRUX-O 77.00其中 EvalPlus、MultiPL-E、MBPP、CRUX-I 均为该组最高分。Math STEM Tasks 上为 MATH 72.35、CMATH 91.17、GSM8k 91.83、GPQA 49.12其中 MATH 与 GPQA 为该组最高分。后训练模型评测结果——慢思考模式。对比模型为 OpenAI-o1-1217、Deepseek-R1-0120、Qwen3-A22B 与 Hunyuan-A13B。Hunyuan-A13B 在 AIME202487.3、BBH89.1、ZebraLogic84.7、BFCL v378.3、ComplexFuncBench61.2、C³-Bench63.5等基准上取得最高分在 DROP91.1、IF-Eval84.7、τ-Bench54.7等为第二好。在 MATH94.3、GPQA-Diamond71.2、OlympiadBench82.7、LiveCodeBench63.9、AIME202576.8、ArtifactsBench43.0、InsCtrl71.9、ComplexNLU61.2、Word-Task62.9等基准上则低于部分对比模型。论文给出的定性结论是慢思考模式下在多个数学、推理和 Agent 基准上取得领先或接近领先结果。后训练模型评测结果——快思考模式。对比模型为 Hunyuan-Large-1116、Qwen2.5-72B-instruct、Qwen3-A22B 与 Hunyuan-A13B。Hunyuan-A13B 在 FullstackBench58.3、BBH87.0、DROP86.5第二好、IF-Eval84.4第二好等基准上具有竞争力或领先但在多项基准上低于 Qwen3-A22B例如 AIME202430.6 对 40.1、AIME202519.2 对 24.7、MATH85.4 对 87.2、GPQA-Diamond61.8 对 62.9、OlympiadBench64.1 对 69.9、LiveCodeBench27.4 对 35.3、McEval59.6 对 63.5、ZebraLogic36.5 对 37.7、SysBench70.2 对 72.1、LengthCtrl53.9 对 54.7、InsCtrl68.9 对 71.2、ComplexNLU54.5 对 56.7、Word-Task53.4 对 56.4、BFCL v365.9 对 68.0。源码片段中快思考表在 BFCL v3 之后被截断可能还有其他 Agent 指标未显示因此不能对该模式的全部表现下完整结论。快思考模式下的工具调用与 Agent 任务。表tab:model_comparison2报告了 fast-thinking 模式下三个工具调用/Agent 基准的结果Hunyuan-A13B 均为最高分τ-Bench 为 42.6第二好 41.8片段中另两列数值为 17.3、36.4ComplexFuncBench 为 74.0第二好 40.1另两列 25.2、38.1C³-Bench 为 65.4第二好 52.1另两列 45.4、48.4。由于片段中未出现完整表头除加粗最高列外其余数值不能映射到具体模型。论文据此说明 Hunyuan-A13B 在 BFCL-v3、τ-Bench、ComplexFuncBench、C³-Bench 上领先具备强工具调用能力且 C³-Bench 模拟任务组合变化时仍保持高准确率证明其处理现实开放问题的能力。论文还指出在 AIME2024 上获得最高分在 ZebraLogic 与 BBH 上领先科学知识与指令跟随常排名第二并显著优于更大模型编程总体略低但在 FullstackBench 与 ArtifactsBench 上与显著更大的 LLM 结果可比体现了相对模型规模的高效率与能力。需要说明的是AIME2024、ZebraLogic、BBH、FullstackBench、ArtifactsBench、BFCL-v3 在 fast-thinking 表格中的具体分数并未在源代码片段 3 中给出。长上下文评测结果。在 PenguinScrolls 上Hunyuan-A13B 得分 87.7与 Gemini 2.5 Pro 的 88.3 表现相当并略优于 DeepSeek R1 的 87.5 与 Qwen3-A22B 的 87.1。在 LongBench-v2 上得分 55.0为表中第二高仅次于 Gemini 2.5 Pro 的 60.9优于 DeepSeek R1 的 53.8 与 Qwen3-A22B 的 48.4。在 FRAMES 上得分 81.1超过 Gemini 2.5 Pro 的 80.1但低于 DeepSeek R1 的 85.7 与 Qwen3-A22B 的 84.0论文明确指出其 RAG 专用长上下文处理能力仍有提升空间。RULER QA 子任务上Hunyuan-A13B 平均 76.7低于 Gemini 2.5 Pro 的 81.7高于 DeepSeek R1 的 72.0 与 Qwen3-A22B 的 73.0按长度分段为 0-8K 78.7、8K-32K 75.3、32K-64K 78.0、64K-128K 73.9其中 64K-128K 分段显著优于 DeepSeek R1 的 65.6 与 Qwen3-A22B 的 66.6说明其长程稳定性突出性能衰减仅次于 Gemini 2.5 Pro。推理效率结果。Hunyuan-A13B 使用 GQA MoE 架构提升推理效率与 vLLM、SGLang、TensorRT-LLM 等主流开源推理框架无缝集成支持 W16A16 精度推理的一键部署使用 Auto Prefix Caching 与 Chunk Prefill 等服务层特性支持 Weight Only INT8、W8A8、KV Cache FP8 等多种无损量化格式并可配合 Tensor ParallelTP、Expert ParallelEP、FusedMoE 等框架原生加速机制。吞吐测试结果A16W16C16为batch1、input length 2048、output length 14336 时为190.84 190.84190.84tokens/sbatch16 时为1246.54 1246.541246.54tokens/sbatch32、output length 14336 时为1981.99 1981.991981.99tokens/sbatch32、output length 22528 时为1725.95 1725.951725.95tokens/s。可见 batch 增大显著提升吞吐而当 batch32 时输出长度从 14336 增加到 22528吞吐从 1981.99 降至 1725.95 tokens/s。需要说明的是正文写 W16A16表题写 A16W16C16源代码笔记指出片段未解释二者是否为同一配置。4.3 消融实验 / Ablation Study源代码笔记明确指出所给片段没有正式的消融实验章节也没有给出消融表或逐项贡献数值。片段中可以确认的设计有效性结论主要有以下几项。Shared expert 数量。基于 MoE 架构 scaling laws 的大量实验论文观察到没有 shared expert 的模型通常差于至少有 1 个 shared expert 的模型当 shared expert 数量超过 1 后收益递减只有边际改善甚至性能波动。因此最终确定 1 个 shared expert 64 个 non-shared experts 的配置训练时 shared 始终激活仅 8 个 non-shared 激活。这是源代码笔记中唯一明确给出的架构消融结论。RL 训练配置。论文陈述 on-policy learning、大 batch、增加 rollout 数量、较低采样温度0.6 0.60.6–0.8 0.80.8等措施 collectively benefit the RL training process两阶段上下文长度24K 然后 32K受 deepscaler2025 启发用于系统增强推理深度移除 KL 约束参考 yu2503dapo。但这些均为定性陈述片段中没有给出对应的逐项消融数值因此不能归纳出具体消融表。长上下文训练阶段。上下文从 4096 依次扩展到 8192、32K、256K且 32K 与 256K 阶段分别采用 NTK-aware 的 alpha50 与 alpha1000。这是训练流程的设计但片段未给出各阶段对最终结果的单独贡献因此不构成可量化的消融证据。评估集污染控制。论文称评估同时覆盖广泛认可的公共 benchmarks 与新开发的内部测试集目的是严格评估并减少数据污染带来的潜在偏差。这属于评估设计说明不是消融实验。综合而言本节只能呈现 shared expert 数量这一项明确的消融结论其余配置描述不能被推断为带有数值结果的消融实验。五、相关工作 / Related Work与 Hunyuan 系列模型的关系。Hunyuan-A13B 与团队既有的 Hunyuan 系列共享多项设计数据整理管线复用 Hunyuan-TurboSTokenizer 与 Hunyuan-Large 相同词表大小 128K激活函数 SWiGLU 与 Hunyuan-Large、Hunyuan-TurboS 一致NTK-aware 位置编码与 Hunyuan-TurboS 相同。在预训练评测对比中论文称 Hunyuan-A13B 在 14 个基准中 12 个优于 Hunyuan-Large-1116而激活参数约为其 1/4、总参数约为其 1/5体现出代际效率的提升。与 sparse / dense 架构路线的关系。与 dense 架构 LLM 相比Hunyuan-A13B 采用稀疏 MoE总参数 80B 但每次输入仅激活 13B相比同规模 dense 模型降低推理延迟与计算开销。在 MoE 内部设计上模型采用 fine-grained MoE引用 DeepSeek-MoE 一类工作将专家拆分为多个细粒度单元。评测对比中的 Qwen2.5-72B 属于 dense 路线Qwen3-A22B 与 Hunyuan-Large-1116 属于 MoE 路线。与领先闭源/开源系统的关系。Introduction 引用 GPT-4o、o1、o3、Gemini 2.5、DeepSeek-R1、Qwen3 作为先进系统并指出这些系统部署通常计算资源需求大、推理延迟高、硬件成本高而 Hunyuan-A13B 定位为开源、高效、可扩展、低部署成本。后训练慢思考模式评测中直接对比对象为 OpenAI-o1-1217 与 Deepseek-R1-0120长上下文评测中直接对比对象为 Gemini 2.5 Pro 与 DeepSeek R1。与训练方法与数据构建相关工作的关系。代码数据生成 pipeline 引用 Magicoder逻辑数据自动合成受 ZebraLogic 启发RL 算法采用 GRPORL 的两阶段上下文长度受 deepscaler2025 启发移除 KL 散度约束参考 yu2503dapoGenerative Reward Model 的采用遵循 zhang2024generative、mahan2024generative、xu2025unifiedpairwiseframeworkrlhf 等工作。Dual-Mode CoT 的独特点。与常规单一推理模式的做法不同Hunyuan-A13B 用统一训练结构同时优化 fast 与 slow 两种模式以think块是否为空作为区分并通过/no_think、/think控制标签在推理时切换无标签时默认 slow-thinking。这一设计使同一模型可在效率与推理深度之间按任务复杂度灵活取舍。六、局限性与展望 / Limitations Future Work编码能力总体略低。源代码笔记 3 明确指出Hunyuan-A13B 的编程整体性能略低于对比模型在 FullstackBench 与 ArtifactsBench 等代码评估任务上虽与显著更大的 LLM 结果可比但总体 coding 仍略低。在后训练慢思考模式表中LiveCodeBench 的 63.9 也低于 Deepseek-R1-0120 的 65.9 与 Qwen3-A22B 的 70.7快思考模式下 LiveCodeBench 的 27.4 亦低于 Qwen3-A22B 的 35.3。RAG 专用长上下文处理仍有提升空间。在 FRAMES 上Hunyuan-A13B 得分 81.1虽超过 Gemini 2.5 Pro 的 80.1但低于 DeepSeek R1 的 85.7 与 Qwen3-A22B 的 84.0论文明确指出其 RAG 专用长上下文处理能力仍有提升空间。长上下文整体仍未超过 Gemini 2.5 Pro。RULER 全长度平均 76.7低于 Gemini 2.5 Pro 的 81.7在 0-8K、8K-32K、32K-64K、64K-128K 四个分段上也均低于 Gemini 2.5 Pro。虽然其在 64K-128K 分段显著优于 DeepSeek R1 与 Qwen3-A22B长上下文整体能力仍未达到 Gemini 的水平。源代码片段暴露的信息缺失。综合三份源代码笔记论文片段中未包含若干关键细节因而无法据此判断模型在这些方面的表现未给出 SFT 与 RL 的显式损失函数公式仅说明 RL 使用 GRPO、奖励为 outcome reward 与 sandbox feedback未给出 GRM 的具体训练细节、偏好数据规模与评分服务的实现细节未给出 general-purpose SFT 与 generalized RL 的完整数据、奖励与训练流程细节部分由源代码笔记 2 补充但部分内容在源码中位于\iffalse ... \fi注释块内未作为正式排版内容未给出 dual-CoT 的具体实现、切换机制与训练目标细节未给出推理优化与吞吐量在更广泛配置下的具体数字仅有 A16W16C16 下的四条吞吐记录未给出长上下文训练的数据配比、训练 token 数与更完整的长上下文评估结果未给出模型失败案例、安全对齐、偏差与部署限制等专门讨论后训练快思考表格在源代码片段中被截断BFCL v3 之后可能还有其他 Agent 指标未显示因此该模式的完整表现无法从片段判断。Dual-CoT 收益的量化证据缺失。源代码笔记 3 指出本片段未给出慢思考模式评估结果之外的详细对比无法判断双模式 CoT 中 slow thinking 的实际收益片段也未给出两种模式在计算成本、延迟、token 消耗上的详细对比。因此尽管 dual-CoT 是论文的核心设计之一其在效率与准确性之间的量化权衡仍需依赖完整论文中的其他部分才能判断。W16A16 与 A16W16C16 的一致性未说明。论文正文写支持 W16A16 精度推理的一键部署而吞吐表题写 A16W16C16源代码笔记指出片段未解释二者是否为同一配置这一点在解读吞吐结果时需注意。消融覆盖有限。如 4.3 节所述源代码片段中唯一明确的架构消融结论是 shared expert 数量RL 配置相关陈述为定性描述未配套逐项消融数值。因此论文各设计选择之间的相对贡献在片段范围内无法被完整评估。七、总结 / ConclusionHunyuan-A13B 是腾讯混元团队开源的一个基于 Mixture-of-Experts 架构的大语言模型总参数 80B、推理时仅激活 13B目标是在模型能力、计算效率与部署成本之间取得平衡。模型在严格过滤的 20T-token 语料上预训练并针对 STEM 数据整理了 250B 高质量 token预训练分 Foundation Training、Fast Annealing 与 Long-Context Training 三个阶段上下文从 4096 逐步扩展至 8192、32K 与 256K位置编码使用 NTK-aware 方案。后训练采用结构化、多阶段方案包含推理导向 SFT 与 RL、全场景 SFT 与 RL 共四个步骤。推理导向阶段覆盖数学、代码、逻辑与科学RL 使用 GRPO、二元 outcome reward 与覆盖 36 种语言、支持超过 1000 并发执行的代码沙盒。全场景阶段覆盖语言理解、创意写作、多语言、复杂指令、角色交互、知识 QA、多轮对话与 Agent 八类能力RL 侧统一了灵活 GRM 与领域专用奖励管线覆盖 16 个子主题与超过 30 个评分服务。模型还通过统一训练结构支持 fast-thinking 与 slow-thinking 双模式 CoT以think块是否为空作为区分并在推理时通过/no_think与/think控制切换。实验层面预训练模型在 14 个评测基准中的 12 个优于 Hunyuan-Large-1116且仅使用约 1/4 激活参数与约 1/5 总参数在 General、Coding、Math STEM 多个基准上取得该组最高分或接近最高分。后训练慢思考模式下在 AIME2024、BBH、ZebraLogic、BFCL v3、ComplexFuncBench、C³-Bench 等取得最高分快思考模式下在 FullstackBench、BBH、DROP、IF-Eval 等具有竞争力或领先且在三项工具调用/Agent 基准上均为最高分。长上下文方面PenguinScrolls 与 Gemini 2.5 Pro 相当LongBench-v2 为第二高FRAMES 超过 Gemini 2.5 ProRULER 长程稳定性仅次于 Gemini 2.5 Pro。效率方面在 A16W16C16 下 batch32、output length 14336 时吞吐达1981.99 1981.991981.99tokens/s。与此同时论文片段也暴露出编码整体略低、RAG 长上下文在 FRAMES 上仍有提升空间、RULER 平均低于 Gemini 2.5 Pro 等局限且 SFT/RL 损失函数、dual-CoT 量化收益、安全与部署限制等细节在所给片段中并未给出。总体而言Hunyuan-A13B 的核心价值在于以高参数效率的稀疏 MoE 架构、严格过滤并强化 STEM 的预训练语料、四步式大规模后训练与统一训练的双模式 CoT在开源模型中提供了一个兼顾能力、吞吐与部署成本的方案。原文摘要:We present Hunyuan-A13B, an open-source large language model based on a Mixture-of-Experts architecture. It contains 80 billion total parameters but activates only 13 billion during inference, balancing model capability, computational efficiency, and deployment cost. The model is pretrained on a rigorously filtered 20T-token corpus with enhanced STEM data curation, improving factual reliability and reasoning ability. High-quality supervised fine-tuning and large-scale reinforcement learning further enhance its overall performance. Hunyuan-A13B also introduces a dual-mode Chain-of-Thought framework that adapts reasoning depth to task complexity: fast thinking for routine queries and slow thinking for complex, multi-step problems. Evaluations show competitive performance across mathematics, science, programming, general language understanding, and agent tasks, often approaching that of much larger models. Its high inference throughput makes it suitable for latency-sensitive applications. We release Hunyuan-A13B to support open research and practical LLM deployment.PDF链接:https://arxiv.org/pdf/2609.27284v1部分平台可能图片显示异常请以我的博客内容为准