资讯详情

NeoHorse-Jev开源第一后,决策模型会成下一波开源主线吗

📅 2026/10/11 17:58:41 | 华诺云谱 👁 阅读
NeoHorse-Jev开源第一后,决策模型会成下一波开源主线吗
NeoHorse-Jev开源第一后决策模型会成下一波开源主线吗【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B当行业还在围绕对话模型的榜单分数逐分肉搏时基元律动TokenRhythm正在用另一条叙事搅动开源社区先以 Agent-Native 模型 NeoHorse-1 同时放出 4B/9B 两个版本紧接着推出开源 Jev 综合评测第一的 NeoHorse-Jev随即又有 4B 量级的决策模型 NeoHorse-Jev-4B 跟上——一个多月内三连发且全部指向让模型做决定而非让模型聊天。这一节奏在社区激起了密集的二次创作仅 CSDN 上关于 NeoHorse-Jev-4B 的部署与微调实战文章在 9 月 30 日至 10 月 6 日一周内就出现十余篇覆盖 vLLM 生产部署、GGUF 量化、LoRA 微调、Codex Agent 集成等主题。抛开营销热度值得追问的是决策模型到底是特定厂商的差异化标签还是将取代对话模型成为下一波开源主线本文结合社区情报与仓库源码尝试给出一个可验证的回答。一、发布节奏复盘一个月内从 Agent-Native 到决策赛道先还原发布的时间线与定位这是判断主线转移的前提。第一棒NeoHorse-19 月 8 日前后。据澎湃新闻援引技术报告基元律动联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布首个 Agent-Native 模型 NeoHorse-1包含 4B 和 9B 两个版本。公司创始人王云鹤此前是华为诺亚方舟实验室主任、盘古大模型负责人团队开源的 Routing Harness 系统 OpenSquilla 用于在 Agent 执行任务时选择和组织不同模型NeoHorse 的训练语料正是以该 Harness 产生的执行轨迹为核心——轨迹保留了能力需求预测、路由选择、模型响应、工具调用和环境反馈经完整性检查与目标完成、证据一致性、错误恢复等质量评估后用于后训练。这等于把Agent 干活的过程变成了训练模型的数据。第二棒NeoHorse-Jev开源 Jev 综合评测第一。头条与多家媒体跟进报道了这一事件。Jev 是决策/规划类评测基准NeoHorse-Jev 在开源模型中拿下综合第一标志着这家公司正式把决策立为独立的模型产品线而非通用模型的附属能力。第三棒NeoHorse-Jev-4B4B 决策模型Apache-2.0。社区文章普遍强调三点40 亿参数量级、专注结构化决策任务、Apache-2.0 协议可商用。围绕它的实操内容从 vLLM 连续批处理与 guided decoding、到 Windows 下 llama.cpp GGUF 量化、再到通过 FastAPI 封装 OpenAI 兼容接口接入 Codex 等 Agent 工具说明社区已经把它当作可上生产的决策引擎在消费而不是停留在评测玩具层面。本文仓库里的 NeoHorse-1-4B 正是上述第一棒的 4B 权重版以 Qwen3.5-4B 为基座、专为文本型 Agent 环境做后训练Apache-2.0 许可权重为 BF16 Safetensors。它的存在让决策/执行型开源模型的讨论有了可以直接落地的工程样本。二、决策模型赛道的供需分析为什么偏偏是现在一个细分模型品类能否成为主线取决于供需两端是否同时成熟。决策模型恰好卡在了一个剪刀差上。需求侧Agent 规模化之后决定做什么成了瓶颈。对话模型擅长生成一个合理回答但 Agent 流水线真正缺的是在多个候选方案、工具和动作之间做出选择。社区实践文章反复提到的落地场景——客服工单自动分流、工业质检、风控判断、推荐/调度中的排序评分——本质上都是结构化决策任务输入是受限的上下文输出必须是可解析、可校验、可审计的结构化结果。这类任务对模型的约束是硬的格式必须稳定、规则必须遵循、推理最好可解释而这些恰恰是通用对话模型的弱项。仓库中的 chat_template.jinja 从对话层就体现了这种取向——它内置了tool_call/function.../tool_response的 XML 工具调用协议与think推理标记模型从词表到模板都是为调用工具、接收反馈、继续行动设计的而非为寒暄设计的。供给侧Harness 把决策数据变成了可规模化的资产。过去训练决策模型最大的障碍是没有标注好的决策轨迹数据。OpenSquilla 这类 Routing Harness 的工程意义在于路由过程天然记录任务→能力需求→模型选择→工具调用→环境反馈的完整闭环而 README.md 明确描述了这条数据资产的再利用路径路由 Harness 将任务分派给异构模型池记录工具交互与结果估计能力需求再用能力级反馈塑造下一轮训练混合新模型回到 Harness 服役形成评测—选择—更新的原型闭环向递归自我改进RSI延伸。也就是说决策模型的训练数据不是人工标注的而是从 Agent 运行基础设施里长出来的。配套侧4B 量级把决策模型推进了私有化部署的射程。决策场景大多发生在企业内部数据出不了内网。社区文章普遍给出 4B 模型的显存画像单卡 16GB 可训、4~8GB 可推理、GGUF int4/int8 后 CPU 也能跑。这与动辄 70B 的对话旗舰形成了互补而非竞争——决策模型卖的是低延迟、可私有化、可审计恰好是通用模型溢价最高的反面。仓库 config.json 的部署参数也印证了这种定位原生上下文 262,144 tokenSGLang/vLLM 启动命令直接配--reasoning-parser qwen3与--tool-call-parser qwen3_coderREADME 里的部署章节全部围绕本地 checkpoint 自托管展开。三、与对话模型主线的对比不是替代而是分叉对话模型这条主线之所以长盛不衰是因为它最大化覆盖了人机交互这一最普遍的需求决策模型主线的逻辑则完全不同两者的分化体现在三个层面。评测体系的分化。对话模型以聊天榜单和通用能力基准为核心社区文章则反复提醒决策模型必须用任务完成率而非对话榜单来评估。这一判断在 README.md 的十项基准评测里得到印证——NeoHorse-1-4B 的领先优势全部集中在 Agentic 能力带QwenClawBench 44.68对比组第一、WorkBuddy Bench 34.41第一、PinchBench 77.33第一、tau²-Bench 88.46第一十项综合宏平均 64.87较基座 Qwen3.5-4B 的 58.94 提升 5.93而在 HumanEval96.95等通用编码项上只是次优。换句话说这类模型的每一分能力都长在执行闭环上而不是长在百科式应答上。行为约束的分化。对话模型追求生成的自然度与多样性决策模型追求的是确定性社区实践里几乎一致地把采样参数压到 temperature0.1、配合 JSON Schema/guided decoding 强制结构化输出并在外层叠加规则校验。README 的评测协议同样体现了这一取向——报告给出了精确的采样配置SGLang v0.5.17、temperature1.0、top_p0.95、top_k20、presence_penalty1.5说明连评测本身都要在受控协议下进行。决策模型的可靠性来自约束而非自由。架构取舍的分化。对话模型拼长上下文时倾向于堆 full attention而仓库 config.json 显示 NeoHorse-1-4B 的 32 层中 28 层是 linear_attention、仅 8 层 full_attentionfull_attention_interval: 4每 4 层穿插 1 层全注意力并带 1 层 MTP 预测头。这种线性注意力为主、全注意力定点穿插的混合设计正是为了在 262K 长上下文与低显存推理之间找平衡点——社区对 NeoHorse 9B 在 4GB 显存上稳定推理、tau²-Bench 90.82 分的实测与这种架构取向一脉相承。决策场景往往要吞下完整工单历史、长对话轨迹或大段文档上下文效率与能力的权衡在这里比在对话场景更关键。四、押注方向与风险主线之争最终看什么判断决策模型能否成为下一波开源主线本质上是判断三个问题这条路有没有持续的燃料、有没有可复制的范式、有没有被证伪的风险。燃料RSI 闭环是否真的能转起来。README 把递归自我改进路径写在标题里当前交付的是评测—选择—更新原型环Harness 反馈驱动下一轮训练混合更新后的模型再回到 Harness。这个环每转一圈理论上决策数据与模型能力都会螺旋上升——这正是对话模型主线所没有的自举机制。如果后续迭代能展示模型提升→Harness 能力需求变化→新数据→再次提升的实证曲线决策赛道的叙事会比任何榜单都更有说服力。范式开源协议 4B 量级的组合拳。Apache-2.0 意味着企业可以无合规顾虑地私有化、微调、商用4B 量级意味着 LoRA 微调、内网推理、边缘部署的门槛低到普通团队也能承接。社区一周十几篇部署实战文章本质上是这套范式在被验证。开源对话模型主线当初也是这样起飞的——先靠小参数量级 宽松协议跑出社区生态再逐步上探规模。风险三个必须正视的裂缝。其一格式过拟合决策模型对 harness 格式的强对齐可能牺牲对未见场景的泛化社区实测也指出其多步规划准确率低于完整版 Jev其二评测自证的边界决策基准相对年轻若开源第一建立在自家数据管线与基准协议上含金量需要第三方复现背书其三小模型的决策天花板4B 能覆盖规则清晰、边界有限的结构化决策但面对开放性战略决策、长程多步规划时仍会碰壁决策主线若长期停留在小参数量级天花板肉眼可见。结语NeoHorse-Jev 的开源第一与其说是一个榜单结果不如说是一次赛道宣言模型的开源竞争正在从谁能聊得更像人转向谁能把事情做对、做得稳、做得便宜。决策模型的供给端Harness 数据闭环 4B 效率架构 宽松协议与需求端Agent 落地与私有化部署在这一时点同时成熟而对话模型主线并不会消失——它只是不再是唯一的主线。真正值得持续观察的是基元律动能否用 RSI 闭环把决策第一从一次性发布变成持续迭代的复利曲线。在那之前开源社区的务实者不妨先把 NeoHorse-1-4B 的权重拉下来用真实业务里的工单、质检与风控样本自己验证一次决策模型到底值不值得押注。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑