资讯详情

GEV-26B-Decide 部署指南:3步为 Gemma-4 的 tied lm_head 打 LoRA 补丁,快速起决策服务

📅 2026/10/9 13:19:49 | 华诺云谱 👁 阅读
GEV-26B-Decide 部署指南:3步为 Gemma-4 的 tied lm_head 打 LoRA 补丁,快速起决策服务
GEV-26B-Decide 部署指南3步为 Gemma-4 的 tied lm_head 打 LoRA 补丁快速起决策服务【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide 是基于 google/gemma-4-26B-A4B-it 的开源决策模型Decision Index 0.2.1 得分 62.48一次前向即可对 2–256 个选项输出校准概率并支持自适应思考adaptive thinking。要用 vLLM 部署它必须为 Gemma-4 的 tied lm_head 打上 LoRA 补丁——本指南将完整讲解这个补丁解决什么问题、如何打补丁以及如何 3 步把POST /v1/decide决策服务跑起来。为什么必须打补丁tied lm_head 是什么 先理解背景权重共享tied weightsGemma-4 把输出层的lm_head与输入嵌入层共用同一份权重矩阵而不是各自独立。决策头需要 lm_head LoRAGEV-26B-Decide 的 System 1 决策头在 vLLM 里被实现为lm_head 上的 LoRA见 adapter_vllm/decision_head.json决策概率直接从这个 LoRA 读出的 verbalizer token 概率计算。vLLM 原生不满足两个条件原 vLLM 的 LoRA 词表上限是 258048而 Gemma-4 词表为 262,144直接报vocab size must be 258048错误Gemma-4 的模型定义里缺少embedding_modules声明PEFT 的 lm_head LoRA 目标无法映射到 vLLM 的 logits-processor LoRA 包装器。此外还有一个更隐蔽的坑Gemma-4 的层路径存在别名model.layers.N与model.self_decoder.decoder_layers.N指向同一个物理模块激活 LoRA 时后一个别名会把刚加载的权重悄悄重置——这就是补丁第二个 commit 修复的LoRA 静默失效问题。部署前的环境准备清单 ✅项目要求GPU1 张 80 GB 或更大显存的 GPU如 B200 / RTX PRO 6000vLLM带 Gemma-4 支持的开发版构建官方测试使用 2026 年 9 月的 vLLM dev build模型文件本仓库全部权重约 26B 参数、每 token 激活约 4B 的 MoE补丁文件patches/vllm-gemma4-lm-head-lora.patch3步完成部署第 1 步获取模型与部署脚本git clone https://gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide或使用 HuggingFace CLIhf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide第 2 步为 vLLM 打补丁在你的 vLLM 源码目录下应用补丁共 2 个 commit、3 个文件、约 24 行改动cd /path/to/vllm git apply /path/to/GEV-26B-Decide/patches/vllm-gemma4-lm-head-lora.patch pip install -e . # 按你的构建方式重装/重编译第 3 步一键启动服务serve.sh 封装了全部启动参数直接运行bash GEV-26B-Decide/serve.sh # 默认监听 :8000它实际执行的是 serve_decide.py——一个标准 vLLM OpenAI 服务器外加POST /v1/decide路由关键参数包括--enable-lora --max-lora-rank 32 --lora-modules jev-decision.../adapter_vllm --max-logprobs 256。引擎只加载一次主干模型普通请求走 System 2OpenAI 接口带 LoRA 模块jev-decision的请求走 System 1决策头。补丁内容详解 补丁 vllm-gemma4-lm-head-lora.patch 由两部分组成Commit 1/2 —— 允许 lm_head LoRA在vllm/lora/layers/logits_processor.py中把 LoRA 词表上限从 258048 提高到262144与 Gemma-4 词表一致并已在 Gemma-4-26B-A4B 上验证输出一致性在vllm/model_executor/models/gemma4.py中新增声明embedding_modules { lm_head: output_embeddings, }这样 PEFT 的 lm_head LoRA 目标就能映射到 vLLM 的 logits-processor LoRA 包装器。由于 LoRA 增量只作用于输出 logits在 final-logit soft cap 之前不激活 LoRA 时输入嵌入与基础模型 logits 完全不变——System 2 不受任何影响。Commit 2/2 —— 别名模块去重在vllm/lora/model_manager.py激活逻辑中按物理模块去重优先选择有权重的路径避免别名把刚加载的 LoRA 权重重置掉上游 backport修复 Gemma-4 LoRA 静默失效。验证服务调用决策接口 服务起来后一条 curl 即可验证 System 1 自适应思考curl localhost:8000/v1/decide -H Content-Type: application/json -d { kind: choice, state: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball., question: How much does the ball cost?, options: [$0.10, $0.05, $1.00, $0.55], thinking: auto}返回每个选项的probabilities、choice及thinking信息GET /v1/decide/info可查看默认参数。System 2 则直接走标准/v1/chat/completions。 提示kind支持noul是/否、score0–5 评分、choice2–256 选项分类、检索、工具路由类任务建议thinking: off推理类任务用auto。可选用推测解码加速思考 如果以思考为主自适应思考/ System 2 推理加MTP1启动即可启用 Google 官方 draft 模型的推测解码MTP1 bash GEV-26B-Decide/serve.sh实测 System 2 速度提升约 1.8–1.9×单请求 247 → 438 tokens/s思考中位延迟从 13.4 s 降到 7.7 s。注意它不会改变输出分布但高并发下 System 1 吞吐会下降257 → 140 决策/秒所以大部分请求不思考的场景不要开。常见问题 FAQQ: 报错vocab size must be 258048A: 补丁 Commit 1 没有生效确认在带 Gemma-4 支持的 vLLM 开发版上应用了 补丁 并重新安装。Q: 决策概率明显不对 / LoRA 像没生效A: 很可能是补丁 Commit 2 缺失导致的别名重置问题——别名路径把刚加载的权重清空了。完整应用两个 commit 即可。Q: 一定要用 vLLM 吗A: 不。也可以走 transformers peft 路径加载 adapter/System 1 LoRA head.safetensors 决策头 judge_config.json calibration.json官方 README 有完整示例。vLLM 路径的优势是单引擎同时服务 System 1 与 System 2。Q: 为什么 vLLM 下要--max-logprobs 256A: System 1 靠读取 processed logprobs 还原完整概率分布256 足以覆盖最多 256 个选项serve.sh已内置该参数。文件速查 文件说明patches/vllm-gemma4-lm-head-lora.patch本文主角tied lm_head LoRA 补丁2 个 commitserve.sh一键启动脚本含全部 vLLM 参数serve_decide.pyvLLM 服务器 POST /v1/decide实现adapter_vllm/vLLM 用的 System 1主干 LoRA lm_head LoRA decision_head.jsonadapter/transformers/peft 路径的 System 1 LoRALoRA rank 32覆盖全部注意力与 MLP 投影层head.safetensors24-slot 决策头transformers 路径使用calibration.json / calibration_gold.json每类决策的温度系数默认 / 对照真值校准README.md完整模型卡基准成绩、延迟、使用示例按照以上步骤你就能在一台 80 GB 显存的机器上把一个引擎、两套系统、文本加图像的 GEV-26B-Decide 决策服务完整跑起来——System 1 约 45 ms 出一次决策需要深思时自动切换到 System 2 推理并折回概率。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑