资讯详情

dsh-our-free-model 思考强度原理全解:为什么用输出预算而不是 reasoning_effort

📅 2026/10/8 19:44:31 | 华诺云谱 👁 阅读
dsh-our-free-model 思考强度原理全解:为什么用输出预算而不是 reasoning_effort
dsh-our-free-model 思考强度原理全解为什么用输出预算而不是 reasoning_effort【免费下载链接】dsh-our-free-model在 dsh 里装上这个插件即可无需登录、注册或填 API Key就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在内的前沿模型——完全免费不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.项目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-model在 dsh 里装上 dsh-our-free-model 插件后无需登录、注册或填 API Key就能免费、不限量地使用 DeepSeek V4.1 Flash、Kimi K3 等前沿模型。除了免费它还有一个容易被忽略的细节思考强度Effort是真的能生效的——而且实现方式与大多数客户端不同用的不是常见的reasoning_effort参数而是一套「输出 token 预算」机制。本文带你弄清楚这套思考强度预算的原理和来龙去脉。什么是思考强度三档真实的输出预算在输入框的 Effort 菜单中思考强度分三档每一档都对应一个硬性输出 token 上限档位中文输出预算含义Light精简2 048简短的思考出答案最快Balanced均衡8 192足够走完一次正常的推理Deep深思模型上限模型的全部输出能力这三档的定义就在 src/effort.js 中默认档位是balanced。有一个特殊规则对于思考无法关闭的模型如 MiMo V2.6三档预算会整体翻倍为 4 096 / 16 384 / 模型上限。为什么翻倍往下看答案藏在一个实测数据里。疑点reasoning_effort 为什么不能用按惯例控制思考深度最自然的做法是把reasoning_effort: low | medium | high之类的字符串发给上游。项目团队先做了实测探针脚本见 scripts/probes/reasoning-effort-probe.mjs 和 scripts/probes/effort-repeat-sampling.mjs结论出人意料免费车道的网关接受reasoning_effort、thinking.budget_tokens、enable_thinking、thinking_budget这些字段然后全部忽略对三个不同名义档位反复采样思考 token 数量在统计上无法区分——甚至出现过low档比xhigh档产出更多思考 token 的情况未识别的字段偶尔还会直接引发上游 503 错误。换句话说传reasoning_effort就像对不听话的调度器喊口号——口号照单全收行为纹丝不动。 插件的一条设计准则提供一个无效控件比不提供控件更糟。一个假装在调思考深度、实际毫无作用的 Effort 菜单只会误导用户。真正起作用的唯一阀门max_tokens 输出预算实测发现该车道上真正被执行的只有max_tokens输出上限而思考量与它直接挂钩把上限压到 64 token思考输出就从约 397 token 降到约 63 token放宽上限思考随之变多多组方言对照实验见 scripts/probes/budget-dialects.mjs。于是插件的思考强度设计变得非常直白用户选的档位 → 换算成一个真实的输出 token 上限以max_tokens的形式硬性下发给上游留痕的思考 token 随档位单调上升——每一档都是可测量、可验证的差异。预算解析的核心逻辑在 src/effort.js 的budgetFor()档位上限、模型容量、会话设置取三者中的最小值且任何情况下不低于 512 tokenMIN_BUDGET保证回答本身一定放得下。整条链路还有专门的回归测试 scripts/effort-test.mjs 守护。为什么「思考不可关闭」的模型要翻倍一个容易踩的坑思考 token 和可见回答共享同一个输出上限。以思考无法关闭的mimo-v2.6-flash-free为例实测一天 92 次调用中82% 的输出 token 都是思考。当「均衡」档的上限是 8192 时思考往往先吃掉大头留给正文的只有约 1500 token——长回答大约每三次就有一次被截断length结尾。解法很直接这类模型每一档预算翻倍系数见 ALWAYS_THINKING_FACTOR让「精简」档留给正文的空间约等于一个能彻底不思考的模型在「精简」档下的空间。设置页的每张模型卡上也标注了每档实际下发的数值所见即所得。两条车道两种语义需要区分的是免费车道匿名网关走的是上面这套 token 阶梯而 EAC 与 Kilo 渠道的模型自己声明了档位菜单Off / Low / Medium / High网关会把模型自己的 effort 字段真正透传上游——此时插件只做映射不再另设预算阶梯实现见 src/effort.js 的声明菜单分支。所以你在不同渠道看到的档位菜单不一样是正常的菜单形状跟着模型声明走。一句话总结reasoning_effort在免费车道上是无效操作——上游收而不理档位之间无差异输出 token 预算max_tokens才是被真正执行的阀门思考量随之单调变化三档 Light / Balanced / Deep 就是三个真实预算思考不可关闭的模型整体翻倍若回答被截断切到 Deep 或调高「单次输出上限」即可。更多细节可在仓库 README 的「为什么用预算而不是 reasoning_effort」一节README.md与 docs/issue-30-heatmap.md 等文档中查看。【免费下载链接】dsh-our-free-model在 dsh 里装上这个插件即可无需登录、注册或填 API Key就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在内的前沿模型——完全免费不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.项目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-model创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑