资讯详情

LongHorizon-Harness 完整入门:一个命令让 AI Agent 连续工作数十小时的终极指南

📅 2026/10/10 20:22:39 | 华诺云谱 👁 阅读
LongHorizon-Harness 完整入门:一个命令让 AI Agent 连续工作数十小时的终极指南
人工智能AI AgentAgent 工作流Agent 评测GUI 自动化【免费下载链接】LongHorizon-HarnessThe long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.项目地址https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness点击查看免费下载LongHorizon-Harness 是一个面向长时程Long-Horizon计算机操作任务的开源 AI Agent 执行框架一条命令安装一条命令启动让 Claude Code、Codex、OpenCode 或 DeepSeek Harness 等现有 Agent 在桌面应用和终端 CLI 中连续工作数十小时。它通过「计划 → 执行 → 验证 → 检查点/恢复 → 重复」的闭环工程Loop Engineering保留已验证的任务状态让 AI Agent 在复杂工作流中可靠推进直到任务真正完成。 为什么 AI Agent 做长任务总是掉链子用过 Claude Code 或 Codex 做复杂任务的朋友都遇到过这些问题上下文丢失对话轮次一多Agent 忘了最初的目标开始跑偏幻觉式完成Agent 声称已完成但实际文件没改、测试没跑失败即归零一次报错或上下文刷新之前几十轮的进度全部作废。LongHorizon-Harness 的解决思路是模型决定 Agent 单轮能做什么而框架负责设计模型之外的循环——下一步做什么、如何在真实计算机上验证结果、保留哪些进度、失败后如何继续。 核心原理Manage-Execute-Audit 三角色闭环整个框架围绕一个闭环运转原始目标 已验证状态 → 规划下一个有界步骤 → 用新鲜上下文执行 → 在真实环境中验证 → 通过则打检查点失败则记录证据并恢复 → 重复直到任务完成。闭环中只有三个职责分明的角色它们不是三个各自为政的 Agent而是同一循环内的分工边界角色职责权限边界Manager管理器每轮从原始目标、已验证进度、失败证据中重建全局状态规划下一步只读全部报告不接触环境⚡Executor执行器用全新上下文完成一个明确定义的步骤GUI 点击或 CLI 命令可读可写工作区但看不到完整历史Auditor审计员独立检查真实文件、界面、日志和测试而不是听信执行器的自我汇报只读与工作区隔离关键设计只有通过独立审计验证的结果才会成为可信的任务状态被驳回的结果只作为证据保留。这就是 AI Agent 能连续跑几十小时而不迷路的根本原因。 三角色的提示词分别定义在 src/lh_harness/role_prompts.py、src/lh_harness/manager.py 和 src/lh_harness/auditor_agent.py想深入阅读可从这里入手。 快速上手从安装到跑通第一个 AI Agent 任务环境要求一览依赖用途Python ≥ 3.10运行框架本身一个 Agent CLIcodex/claude/opencode/dsh任选其一真正执行任务的手Node.js ≥ 20仅在需要 GUI 计算机操作插件时⚠️ 目前 macOS 已充分测试Windows 支持但尚未全面验证。第 1 步一条命令安装uv tool install lh-harness # 或者 pip install lh-harness后续升级用uv tool upgrade lh-harness即可。第 2 步可选为 GUI 任务安装计算机操作插件如果任务不涉及桌面 GUI可直接跳过。插件按你的 Agent 后端选择# 使用 Codex 时 lh-harness plugin install codex-computer-use # 使用 Claude Code或两者都用时 lh-harness plugin install open-computer-use插件安装是机器级的一次性操作覆盖所有项目。macOS 上需要手动在「隐私与安全性 → 辅助功能 / 屏幕录制」中授权。管理插件的源码见 src/lh_harness/plugins/。第 3 步生成项目配置cd /path/to/your/project lh-harness init会在项目下生成./.lh-harness/config.toml可打开后按需调整默认值Agent 后端、模型、最大轮数、超时等。每个字段的完整说明见 README.md 的「Configuration reference」章节中文用户可参考 README.zh-CN.md。第 4 步推荐浏览器工作台运行任务lh-harness web --workspace-root .浏览器会打开http://127.0.0.1:8799/的 Web 工作台一切都在页面里完成✅ 创建任务、为每个角色独立选择后端和模型✅ 回答审批请求Human-in-the-Loop✅ 运行中追加指令、随时停止或重启✅ 查看每一轮的计划 / 执行结果 / 审计证据 / 返工原因工作台前端源码在 frontend/Web 服务实现在 src/lh_harness/webapi/server.py审批门控逻辑在 src/lh_harness/dashboard/gate.py。第 5 步或直接从命令行运行lh-harness run --task Inspect the current directory and summarize its files. --agent codex更长的任务可以写成文件再用--task task.md引用。命令行参数会覆盖配置文件中的同名项方便临时换后端或模型。任务默认作用于启动命令所在的目录也就是你的真实项目。第 6 步随时体检——lh-harness doctorlh-harness doctor只读命令检查 Python 运行环境、各 Agent CLI通过实际执行--version而非仅查 PATH、Node.js 和插件状态缺什么一目了然。实现位于 src/lh_harness/utils/。 长时程任务的状态如何被可靠保存每次运行都存储在隔离目录./.lh-harness/runs/run-id/下形成完整的可审计、可恢复、可复现记录运行记录保存内容 任务状态原始目标、已验证进度、剩余工作 事件流运行全程发生了什么 审计报告每一轮的证据与验收决定 角色轨迹Manager / Executor / Auditor 的完整输入输出✅ 最终报告基于已验证状态得出的结论logs/report.json任务结束时你会收到一段纯语言回复只依据已验证状态回答你的请求——如果任务没完成也会如实说明。轨迹归档工具见 src/lh_harness/trajectory_artifacts.py。 基准测试实测长时程任务表现提升了多少同样的模型、同样的执行后端只加一个框架效果对比如下Qwen 3.7-Plus Claude Code 后端基准测试指标原生 Claude CodeLongHorizon-Harness提升WeaveBench114 个 GUICLI 混合任务PassRate51.880.728.9OSWorld 2.0108 个桌面任务完全完成率2.88.33 倍Terminal-Bench 2.1成功率69.777.27.5且省 24% tokenWeaveBench 是首个在真实操作系统上同时覆盖多通道、跨应用、轨迹级评判的计算机操作基准仓库自带三个可冻结复现的评测套件配置与启动说明见各自目录的 READMEeval/WeaveBench-harness/ — GUICLI 混合任务eval/OSWorldv2-harness/ — 桌面任务混合运行器eval/TB-harness/ — 纯 CLI 长时程任务️ 项目结构速览路径说明src/lh_harness/框架核心CLI、配置、三角色编排、运行边界src/lh_harness/adapters/各 Agent 后端适配器Claude Code / Codex / OpenCode / DeepSeek Harnesssrc/lh_harness/dashboard/Web 工作台的审批门控与规则src/lh_harness/supervisor/进程生命周期与控制总线frontend/Web 工作台前端Reacttests/单元与加固测试❓ 新手常见问题Q1必须训练或使用特定模型吗不需要。框架不绑定任何模型——Claude、GPT、Qwen 等都可以通过配置即可接入且三角色可用不同模型组合比如强模型做 Manager/Auditor、便宜模型做 Executor平衡质量与成本。Q2一个任务能在浏览器和终端之间来回切换吗可以。同一个任务可以从浏览器开始、转到命令行处理数据、再回到桌面软件产出成果全程目标、进度和证据都在同一套状态管理系统下。Q3Agent 会动我的项目文件吗会这正是它的用途——任务默认作用于启动目录。但./.lh-harness/本身被划为禁区运行日志和状态永远不会被误当成任务内容。Q4任务失败或超时怎么办超时或失败的轮次会保留部分轨迹和任务状态下一轮 Manager 会检查真实工作区后从最后一个已验证检查点继续而不是从头再来。多轮反复失败时Dashboard 会触发人工审核门控。 总结LongHorizon-Harness 的精髓就三句话操控整台计算机、保留已验证的进度、持续工作直到任务完成。如果你正被 AI Agent 长任务跑着跑着就忘了初心的痛点困扰一条lh-harness run命令就是让 AI Agent 稳定连续工作数十小时的最短路径。赞分享人工智能AI AgentAgent 工作流Agent 评测GUI 自动化【免费下载链接】LongHorizon-HarnessThe long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.项目地址https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness点击查看免费下载相关推荐ruflo 集成 MetaHarness在 CLI 与 MCP 中审计 Agent Harness 的十命令操作指南ruflo 集成 MetaHarness在 CLI 与 MCP 中审计 Agent Harness 的十命令操作指南 MetaHarness 是 ruflo人工智能AI Agent多智能体Agent 编排Agent 记忆工具调用代码智能体MCP 服务AI 评测终极wandb CLI命令大全从入门到精通的完整命令行操作指南终极wandb CLI命令大全从入门到精通的完整命令行操作指南 Weights Biases wandb 是一个强大的机器学习实验可视化与追踪工具其命令机器学习深度学习数据可视化可观测性OpenGUI 如何让 AI 手机 Agent 任务连续跑满 12 小时Plan Supervisor、Executor Graph 与 Summarizer 完整原理OpenGUI 如何让 AI 手机 Agent 任务连续跑满 12 小时Plan Supervisor、Executor Graph 与 Summarizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑