资讯详情

可复现度量 CLAUDE.md:claude-token-efficient benchmark 基准测试平台(token 与语义评估)完整指南

📅 2026/10/10 2:30:22 | 华诺云谱 👁 阅读
可复现度量 CLAUDE.md:claude-token-efficient benchmark 基准测试平台(token 与语义评估)完整指南
【免费下载链接】claude-token-efficientOne CLAUDE.md file. Keeps Claude responses terse. Reduces output verbosity on heavy workflows. Drop-in, no code changes.项目地址https://gitcode.com/gh_mirrors/cl/claude-token-efficient点击查看免费下载导读本篇技术指南围绕 claude-token-efficient 仓库中的 benchmark/CLAUDE.md 展开讲解如何用一套零 API Key、纯标准库 Python 的可复现基准测试框架客观度量一份CLAUDE.md规则文件对模型输出造成的真实影响既包括 token 成本output_tokens、费用也包括行为与正确性是否消除客套开场、谄媚、结尾废话同时不损失关键信息。读完本文你将掌握 token 基准run.py与语义评估eval.py的完整操作命令、全部命令行参数、底层实现原理以及如何用jq从原始 JSONL 数据中自行复算任何指标。一、为什么要给 CLAUDE.md 搭一套基准测试框架claude-token-efficient 的核心主张是把一份精简的CLAUDE.md放进项目根目录就能让模型回复更简洁、减少输出 token。但简洁本身是一个模糊的体验词——到底省了多少 token行为是否真的改变了正确性是否受到损伤只靠肉眼对比一两轮对话无法给出可信答案。benchmark 目录下的这套 harness 就是为了回答上述问题而设计在隔离环境下以同一批提示词分别运行无 CLAUDE.md与有 CLAUDE.md两种条件用真实计费数据做对比。整个框架只依赖本地claudeCLI 与已登录的会话OAuth不需要任何 API Key纯python3标准库实现任何机器上都能直接跑。二、实验方法论让 CLAUDE.md 成为唯一变量方法要点源自 benchmark/CLAUDE.md每个提示词都在全新的临时目录中运行这样CLAUDE.md就是唯一变量——baseline 为空目录treatment 为拷入一份CLAUDE.md--setting-sources project屏蔽全局设置与 hooks指标取自claude -p --output-format json返回的真实output_tokens与成本。该方法属于方向性directional指标而非受控实验建议使用-n 5及以上轮次并把均值当作信号来解读。2.1 五组测试提示词框架沿用了 BENCHMARK.md 中社区研究针对的五类失败模式在 run.py 中以PROMPTS常量硬编码编号提示词针对性验证T1-asyncExplain async/await in JavaScript冗长输出 / 开场白 / 空洞结尾T2-reviewReview this code: for(let i0; iarr.length; i)谄媚、越界建议应指出 off-by-one bugT3-restWhat is a REST API?em dash、as an AI 措辞、免责声明T4-promptGenerate a prompt for a meditation app多版本格式输出格式测试非长度测试T5-hallucPython was invented by James Gosling.幻觉纠正应纠正为 Guido van Rossum注意 T4 是格式测试不参与词数缩减统计——多版本结构化输出反而可能增加 token这正是 SUMMARY.md 中要把 T4 从长度对比中排除的原因。2.2 隔离执行的关键实现从 run.py 的_invoke源码可以看到单次调用链路创建前缀为cmd_bench_的临时目录若为 treatment 条件把指定 CLAUDE.mdshutil.copy进临时目录根部在临时目录中执行claude -p prompt --model model --output-format json --setting-sources project解析 JSON提取usage.output_tokens、词数、total_cost_usd并完整保留input_tokens、cache_read_input_tokens、cache_creation_input_tokens、num_turns、duration_ms、session_id、result_text作为实验记录。--setting-sources project是关键它保证只有目录内这份CLAUDE.md在两种条件之间变化用户全局的~/.claude/设置与 hooks 不会偷偷注入变量。每次调用都发生在全新目录天然隔绝了跨条件的上下文污染。2.3 重试与退避线上 API 调用难免遇到限流rate limit与过载。run_onerun.py为每次调用提供最多 4 次重试当错误信息包含rate、429、overload、limit时按 8 秒退避其他临时错误按 3 秒退避且退避时长随尝试次数线性增长最终仍失败则以{error: ..., attempts: n}记录不会静默丢弃或伪造数据。三、运行 token 基准run.py 完全操作手册3.1 基础命令# 默认baseline vs 仓库根 CLAUDE.mdhaiku 模型每格 3 轮 python3 run.py # 5 轮 x 每格指定模型 python3 run.py -n 5 --model haiku # 亦可 sonnet、opus # 对比变体相对仓库根路径可重复指定多个 --variant python3 run.py -n 5 --model sonnet --variant leanprofiles/M-drona23-v8/CLAUDE.md python3 run.py \ --variant leanprofiles/M-drona23-v8/CLAUDE.md \ --variant codingprofiles/CLAUDE.coding.md # A/B/C 多条件对比3.2 全部命令行参数参数默认值说明-n, --runs3每个条件 x 提示词单元格的重复运行次数建议 ≥5 以平滑波动--modelhaiku模型haiku/sonnet/opus--variant无namepath形式的变体规则文件可重复不指定时默认对比仓库根CLAUDE.md--outbenchmark/report-model.mdMarkdown 报告输出路径--rawbenchmark/raw-model.jsonl原始 JSONL 日志路径--workers3并发 API 调用数。甜点为 34 及以上会触发限流并在退避上浪费opus 建议降到 2--workers的取值直接影响耗时与稳定性从 run.py 看任务以ThreadPoolExecutor池化并行任务本身是网络阻塞型线程数并非越多越好——4 个并发在共享账号上极易撞上 rate limit退避反而拖慢整体。这正是文档强调4 trips rate limits and thrashes on backoff的源码依据。3.3 输出产物与报告解读运行结束后会生成两份文件raw-model.jsonl逐轮原始记录source of truthreport-model.md均值报告——每个提示词的均值 token括号内为词数及相对 baseline 的百分比、总计行、总成本。以仓库现成的 report-sonnet.md 为例报告表格每格形如584 (266w) -2%即 baseline 均值 584 token266 词CLAUDE.md 条件相对减少 2%。报告末尾固定附带方向性免责声明Directional only: single-session means, output varies run-to-run. Negative % fewer output tokens than baseline.3.4 三模型汇总结果SUMMARY.mdSUMMARY.md 汇总了 N5 的三模型实测当前最小化 CLAUDE.md 配置模型全部 5 个提示词仅 T1-T3,T5排除格式测试成本baseline → CLAUDE.mdhaiku2266 → 2254-1%1742 → 1706-2%$0.0585 → $0.0596sonnet1856 → 1524-18%1350 → 1200-11%$0.1609 → $0.1599opus1888 → 1799-5%1187 → 1102-7%$0.3850 → $0.3570同时同一套 harness 对激进变体 profiles/CLAUDE.compressed.md 单独测得的缩减为 haiku-22%、sonnet-32%、opus-62%。这一组数据引出几个重要结论均来自 SUMMARY.md方向性结论BENCHMARK.md 中发布的 63% 平均缩减在当前最小化 CLAUDE.md 上不可复现——真实效果约为 -2%haiku到 -11%opus排除 T4但在 opus 上改用压缩配置可以复现接近的幅度-62%。效果随模型默认冗长程度放大opus 基线最啰嗦可削减空间最大haiku 基线已经很简洁最小化配置几乎推不动。词数比 token 降得更稳Markdown 结构本身占用 token词数统计会高估实际的 token成本收益。短提示词场景下最小化配置大致成本中性每轮输入都要加载 CLAUDE.md输出节省需要足够大的输出量才能覆盖这笔持续输入成本。四、运行语义评估eval.py 如何验证行为变了但信号没丢token 基准只回答输出变短没有。语义评估则回答两个更核心的问题目标行为是否真的改变了preamble、sycophancy、closing fluff 等是否消失以及正确性是否存活零信号损失。与 run.py 不同eval.py 不再重跑任何提示词——它直接读取已捕获的result_text只做判定调用因此不产生新的提示词成本。# 机械标记检测纯正则免费、即时 python3 eval.py --no-judge # 追加中立 haiku judge 做正确性评分3 为并发甜点 python3 eval.py --workers 3 # 只评估指定 raw 文件 python3 eval.py --raw benchmark/raw-opus.jsonl4.1 两层检测机制第一层机械标记检测。由 eval.py 中的markers()实现全部为确定性正则preamble开头是否出现 Sure / Great / Absolutely / Id be happy / Let me help 等sycophancy是否出现 Youre absolutely right / Great catch / Excellent question 等closing_fluff结尾 220 字符内是否出现 Hope this helps / Feel free to / Dont hesitate 等as_an_ai是否出现 as an AI / as a language model / I am just an AIem_dash是否出现—、–或孤立的--smart_quotes是否出现弯引号version_count对 T4 粗略统计 Version 1/2/3 / Simple/Detailed/Creative 等版本块数量。标记值为 True 表示该不受欢迎的特质存在因此百分比越低越好。第二层LLM judge。以无 CLAUDE.md 的中立 haiku 模型对每份回答打分只评内容、忽略语气与长度。判定提示词要求模型只返回紧凑 JSON{accurate: bool, complete: bool, key_point_hit: bool, reason: 8 words}其中key_point_hit的依据来自 TESTS 字典——每个测试的关键语义点例如 T2 必须指出 off-by-one bug、T5 必须纠正Python 是 Guido van Rossum 发明的。judge 同样带重试退避限流不留下数据缺口。4.2 报告如何解读SEMANTIC.mdSEMANTIC.md 按模型输出表格列为pre / syc / close / ai / em / sq机械标记与acc / comp / keyjudge 三指标。仓库给出明确的解读规则真正的胜利 不受欢迎标记的百分比从 baseline 到 CLAUDE.md 下降同时key-point 保持在 ~100%纠正/找 bug/解释都保留 零信号损失。从实际数据看各模型在 pre/syc/close/ai/sq 多数为 0%部分最新模型的默认行为已比较克制而 em dash 的下降普遍明显如 opus 的 T3-rest 从 100% 降到 40%、haiku 的 T1/T3/T5 从 80%/100%/40% 降到 20%/20%/0%。judge 的key列除 T4格式测试judge 不认为其关键点被命中属预期现象外基本维持 100%佐证了行为收敛但信息不丢的核心主张。同时 SEMANTIC.md 也提醒当前 CLAUDE.md 并未包含 em-dash、as an AI、多版本格式等规则这些维度上的变化属于附带效应而非规则目标。五、从原始数据重新推导raw JSONL 是唯一事实来源raw-*.jsonl保存了每一次调用的完整记录任何报告指标都可以零 token 成本地从中重新计算不必重跑实验。每条记录包含字段model, condition, claude_md, prompt_id, prompt, run, ts, output_tokens, words, cost, input_tokens, cache_*_input_tokens, num_turns, duration_ms, session_id, result_text失败记录为errorattempts。文档给出的三组实用jq命令# 各条件下的平均输出 token jq -s group_by(.condition) | map({cond:.[0].condition, mean_out:(map(.output_tokens)|add/length)}) raw-sonnet.jsonl # 读取某个单元格背后的完整文本例如 opus 的 T2-review baseline 回答 jq -r select(.prompt_idT2-review and .conditionbaseline) | .result_text raw-opus.jsonl # 找出所有失败/重试记录 jq -c select(.error or .attempts) | {model,condition,prompt_id,run,error,attempts} raw-*.jsonl这套命令的实际价值在于报告是加工品而 raw 数据可以做任何自定义分析——例如按cache_read_input_tokens观察缓存命中、按duration_ms对比延迟、按prompt_id做分测试的方差分析。你甚至可以把它接进自己的统计脚本而不必依赖仓库预设的均值口径。六、端到端完整复现要完整重跑三模型 token 基准并追加语义评估一次执行for m in haiku sonnet opus; do w3; [ $m opus ] w2; python3 run.py -n 5 --model $m --workers $w; done python3 eval.py --workers 3要点回顾opus 用-w 2其调用更昂贵、更易撞限流每格 N5 以平滑单次运行的自然波动完成后 token 结果写入 SUMMARY.md由各report-model.md汇总、行为结果写入 SEMANTIC.md。若想对比自定义规则文件而非仓库根 CLAUDE.md用--variant即可例如复现压缩配置的测量python3 benchmark/run.py -n 5 --model opus --variant compressedprofiles/CLAUDE.compressed.mdprofiles/CLAUDE.compressed.md 自身也附带可复现说明其核心卖点句子压缩到 8-10 词、去填充语、工具优先、结果优先代价是放弃最小化配置中的防幻觉护栏适合 token 成本主导且低风险的工作负载。七、方法边界与使用须知这套 harness 是一把经过校准的尺子但读数据时必须清楚它的量程方向性而非受控实验单会话均值、模型输出天然波动、无统计控制。-n 5 只是让信号更稳不代表达到显著性检验水平只测单轮问答claude -p的一次性 QA 提示词并不能完全代表 agentic/coding 循环场景后者正是 CLAUDE.md 声称收益最大的领域本仓库说明中指向独立的外部复现词数与 token 的鸿沟词数口径会系统性高估收益Markdown 结构占用 token输入成本不可忽略CLAUDE.md 每次消息都要作为输入 token 加载短查询、低输出量的场景下净成本是增加的——这正是 README 与 SUMMARY.md 反复强调的诚实前提行为基线随模型漂移语义评估显示新模型默认行为已在 pre/syc/close 等维度趋近 0%针对这些行为的规则当前可能只付输入成本而不产生输出收益需要按实测裁剪规则。结语benchmark 目录给 claude-token-efficient 的核心主张装上了仪表盘用 run.py 度量 token 与成本、用 eval.py 验证行为收敛与零信号损失、用 SUMMARY.md 与 SEMANTIC.md 沉淀结论、用raw-*.jsonl保留每一份可复核的原始证据。这套一个文件、零 API Key、纯标准库的框架同样适用于你自己项目中的任何 CLAUDE.md 变体——改一版规则跑一次--variant让数据替你说出真实效果。赞分享【免费下载链接】claude-token-efficientOne CLAUDE.md file. Keeps Claude responses terse. Reduces output verbosity on heavy workflows. Drop-in, no code changes.项目地址https://gitcode.com/gh_mirrors/cl/claude-token-efficient点击查看免费下载相关推荐claude-token-efficient Benchmark Profile 指南为 token-to-green 编码基准测试定制 CLAUDE.mdclaude token efficient Benchmark Profile 指南为 token to green 编码基准测试定制 CLAUDE.mdclaude-token-efficient 验证基准深度解析5 项测试如何量化 CLAUDE.md 的 Token 压缩与行为修正claude token efficient 验证基准深度解析5 项测试如何量化 CLAUDE.md 的 Token 压缩与行为修正 本文以仓库根文档 BENclaude-token-efficient 实测CLAUDE.md 让 Sonnet 模型输出 token 缩减 18% —— 基准方法、逐题数据与可复现方案claude token efficient 实测CLAUDE.md 让 Sonnet 模型输出 token 缩减 18% —— 基准方法、逐题数据与可复现方上一篇tModPorter 使用与原理全解让 Terraria Mod 一键跟随 tModLoader API 演进下一篇Wox 窗口布局与工作区恢复实战分屏吸附命令与多显示器工作区管理创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑