资讯详情

Group Causal Policy Optimization for Post-Training Large Language Models

📅 2026/10/6 18:43:55 | 华诺云谱 👁 阅读
Group Causal Policy Optimization for Post-Training Large Language Models
文章主要内容和创新点主要内容本文聚焦于大型语言模型(LLMs)的后训练优化,针对现有方法(如GRPO)忽略候选响应间语义交互(互补或矛盾)的问题,提出了Group Causal Policy Optimization(GCPO)方法。现有GRPO方法通过组内相对奖励提升效率,但假设候选响应独立,忽略了它们在实际推理任务中的语义关联;作者引入结构因果模型(SCM),揭示候选响应在“最终整合输出”的条件下形成“碰撞结构(collider structure)”,存在隐藏依赖关系;基于因果分析,GCPO通过两个关键组件整合因果结构:(1)因果调整的奖励机制,将响应投影到因果子空间;(2)KL正则化项,使策略与因果投影的参考分布对齐;实验表明,GCPO在数学推理(如AIME、AMC)和代码推理(如HumanEval)等多个基准上持续优于GRPO等现有方法。创新点因果视角下的候选响应依赖建模:发现候选响应在最终输出的条件下形成碰撞结构,证明将预测投影到因果子空间可降低测试误差,比仅基于查询的基准更可靠;因果感知的策略优化方法:提出GCPO,通过因果调整的奖励和KL正则化项,使模型学习组内响应的结构一致性,提升语义鲁棒性;跨基准的一致性能提升:在数学和代码推理任务中,GCP
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑