AI Agent 每天烧掉多少 token?agent-beacon token-usage 成本归因完全解析
【免费下载链接】agent-beaconThe cross-harness, self-improving memory layer for AI agents.项目地址https://gitcode.com/gh_mirrors/ag/agent-beacon点击查看免费下载AI Agent 每天在 Claude Code、Cursor、Codex 等工具里烧掉多少 token这是每个重度使用者的困惑。开源项目 agent-beacon 用一条beacon token-usage命令把你所有 AI Agent 的 token 用量和成本归因汇总成一张本地账单哪个模型花了多少、哪个会话烧得最狠、哪个工具其实根本没上报数据。本文带你从零看懂这套成本归因机制。为什么跨工具的 token 账单这么难做大多数团队每天都在跑多个 Agent harness写代码用 Claude Code补全用 Cursor批处理任务用 Codex CLICI 里再跑一轮。问题在于每个工具上报 token 的口径不同——有的把缓存读取算进 input有的按任务汇总有的干脆不报价格账单分散在各家平台的后台没人能回答这台机器今天到底花了多少静默的工具和没使用的工具长得一模一样总数漏了都发现不了。agent-beacon 的做法是在本地持续采集各 harness 的会话事件归一化成统一的gen_ai.usage事件模型会话、提示词、工具调用、token 用量都在一条 trace 里然后在本地 JSONL 日志上聚合出报告。数据源在~/.beacon/endpoint/logs/runtime.jsonl报告完全离线计算。一条命令生成 AI Agent token 用量成本报告安装并配置好 endpoint 之后直接运行beacon token-usage输出按用户、模型、harness、会话、仓库、CI run 分组每行同时给出三列成本COST USDruntime 上报价、EST COST USD列表价估算和有效成本合计。常用过滤配方完整参数见 docs/cli/token-usage.mdx需求命令只看最近 24 小时beacon token-usage --since 2026-10-09T00:00:00Z按小时看用量曲线beacon token-usage --bucket 1h查某个模型烧了多少beacon token-usage --model gpt-5.5复盘单个会话beacon token-usage --session claude-session-123只看某个仓库beacon token-usage --repository ~/dev/agent-beaconCI 场景查某次 runbeacon token-usage --log-path ./beacon-runtime.jsonl --run-id github/123456机器可读 JSONbeacon token-usage --json同一份数据也可以打开本地仪表盘浏览页面会按 harness、模型、仓库聚合事件和用量三种成本口径reported、estimated、effective这是成本归因最容易踩坑的地方。agent-beacon 刻意把账单拆成三个字段避免你误读数字字段含义可信度cost_usdruntime 自己上报的费用Beacon 从不篡改最可信但很多工具不报estimated_cost_usd按 LiteLLM 公开 API 列表价内嵌目录重新估的价适用于订阅制/不报价的工具可做横向对比effective_cost_usd最佳单值同一 (endpoint, harness, session) 内只要 runtime 报过价就用上报价否则用估算价直接当账单看背后的规则见 cli/beacon/internal/tokens/cost.go很直白工具自己的数字赢因为它知道套餐、折扣和路由列表价不知道。cost_source字段会标明每行数字来自reported、estimated还是mixed没有可定价模型的 token 会被计入unpriced_tokens——未知模型保持未知而不是当免费。如果你的组织有协议价或网关自定义模型名可以写一个本地 overrides 文件~/.beacon/endpoint/pricing/overrides.json覆盖目录价报告里会记录文件路径和 SHA-256 摘要保证每个估算都能追溯。细节见 docs/cli/pricing.mdx。Token 计数为什么不会重复计算总数虚高是 token 账单最大的假象。agent-beacon 在归一化层做了三件硬功夫分项互斥input_tokens、output_tokens、cache_read、cache_creation四项不重叠总数 四项之和。Codex 的 input 自带缓存Beacon 会先减去缓存读数再存储OpenTelemetry GenAI 命名prompt_tokens系同理。重复通道去重Claude Code 会把同一份用量同时发到 logs 和 metrics 两个通道Beacon 只算一次live 采集和sync回填覆盖同一会话时以 live 通道为准。累加器做差fx、Hermes、Factory 等上报累计值的 runtime会被差分还原成单轮增量避免每个事件都把全量再算一遍。另外要分清花费和占用Cursor、Qwen Code 上报的上下文窗口占用gen_ai.context是某一时刻的液位不是支出永远不会被加进任何总额。完整字段映射见 docs/telemetry-schema/normalization.mdx。体检哪些 Agent 根本没上报 token用量报告回答花了多少回答不了这是全部吗。这就是--coverage存在的意义beacon token-usage --coverage输出给每个已配置的 runtime 打一个状态标签covered窗口内上报过用量无需处理silent产生了事件但没有用量——Beacon 本来能从它读到 token这是唯一需要排查的状态hook 没触发、OTLP 导出失效等inactive配置了但窗口内零事件通常就是没用过not_instrumented这个工具本身不暴露 token 数如 Cursor 的 hook 载荷不带 token属于预期行为而非故障。silent计数大于零就是可告警的条件。配合--json可以直接进监控。把报告变成可行动的成本账单拿到数字之后三个实用动作找烧钱点--top 5让每个分组只保留前 5 名快速定位最贵模型和会话按趋势管理--bucket 1h或15m把用量切成时间桶观察高峰时段进流水线CI 里用--log-path指向会话日志 --run-id过滤 --json输出把每次 Agent run 的 token 账单随构建归档。仪表盘侧还有开箱即用的 token lens逐条会话的 token 账单视图定义在 cli/beacon/internal/endpoint/dashboard/lenses/token-usage.lens.html你可以照这个模板写自己的视图beacon lenses spec/lint/preview。一句话总结agent-beacon 把AI Agent 每天烧掉多少 token从一个各平台后台拼凑的估算题变成了一条本地命令、三种可追溯的成本口径、一份覆盖体检报告。赞分享【免费下载链接】agent-beaconThe cross-harness, self-improving memory layer for AI agents.项目地址https://gitcode.com/gh_mirrors/ag/agent-beacon点击查看免费下载相关推荐ruflo cost-analyst Agent 实战指南Token 用量追踪、USD 成本归因与多级预算治理ruflo cost analyst Agent 实战指南Token 用量追踪、USD 成本归因与多级预算治理 ruflo cost tracker 是 ru人工智能AI Agent多智能体Agent 编排Agent 记忆工具调用代码智能体MCP 服务AI 评测ruflo-cost-tracker 成本报告cost-report技能全解析按 Agent / 模型 / Tier 归因的 Token 用量与预算洞察ruflo cost tracker 成本报告cost report技能全解析按 Agent / 模型 / Tier 归因的 Token 用量与预算洞察人工智能AI Agent多智能体Agent 编排Agent 记忆工具调用代码智能体MCP 服务AI 评测GPUStack 资源用量追踪Usage实战指南从 Token 计量到存储成本归因GPUStack 资源用量追踪Usage实战指南从 Token 计量到存储成本归因 GPUStack 的 Usage用量 页面是面向集群运维与成本归因后端人工智能模型推理服务集群管理可观测性创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考