Skip to content

参考资料

外部资料用于解释设计背景,不覆盖仓库中的可执行事实。本页优先链接一手来源,并说明每项资料与 Harnesssmith 的关系。 链接与关键说明核对日期:2026-08-30。

当前项目契约

这一组直接定义 Harnesssmith 当前做什么:

如果本页其余资料与这些契约冲突,以当前代码、测试、schema 和 manifest 为准。

Agent 规则与渐进上下文

  • AGENTS.md:跨 Coding Agent 的开放规则入口。Harnesssmith 使用它作为主要人机分离入口,但额外 增加文档路由和安全安装生命周期。
  • Codex 的 AGENTS.md 发现规则:说明 Codex 如何发现全局和项目 指令;Harnesssmith 的 Codex Adapter 必须尊重宿主契约。
  • Agent Skills specification:技能目录、metadata 和渐进披露规范。它为 Harnesssmith 的“先发现、后读取”提供生态参照,但项目 playbook 不是该规范的替代实现。
  • OpenAI Harness Engineering:强调让仓库知识对 Agent 可读,以及用机械 约束执行架构边界。它支持 guidance 与 enforcement 分离的设计理由。

长任务、状态与交接

工具协议与安全

  • Model Context Protocol specification:工具与资源互操作协议。 Harnesssmith 不实现 MCP;宿主负责调度和认证。
  • MCP security best practices: token passthrough、会话、权限与本地服务风险。它说明“能连接工具”与“能安全授权”是两个问题。
  • OWASP Top 10 for Agentic Applications 2026: 提供 goal hijack、tool misuse、memory poisoning、cascading failures 等威胁语言,用于审视边界,不表示项目已经覆盖 全部类别。
  • NIST AI RMF 1.0: 自愿、非特定行业的风险管理框架。Harnesssmith 借鉴持续治理、测量与管理的思路,不声称合规认证。
  • SLSA specification:软件供应链来源与构建完整性框架,用于理解候选 artifact、CI 和 attestation 的信任差异。

评测与可观测

  • Wikipedia: Test harness:传统软件测试中用于提供固定输入、执行被测程序并 比较输出的辅助系统。它提供术语背景,不定义 Harnesssmith 的 Coding Agent 能力边界。
  • EleutherAI lm-evaluation-harness:语言模型评测框架,展示任务、模型 适配与可重复评测的 Harness 语义;Harnesssmith 不复用其 Runtime,也不把模型 benchmark 等同于 Host Eval。
  • OpenAI Evals:可执行评测与回归思路。
  • SWE-bench:真实仓库 issue 任务与 verifier 驱动评测的代表性基准。
  • OpenTelemetry:trace、metric 和 log 的开放可观测规范。Harnessmith 的 audit 只借鉴结构化元数据思想,并不是完整 OTel collector。

研究地图与历史资料

  • Agent Harness Engineering: A Survey(2026):覆盖 170 多个开源项目,并提出 ETCLOVG 七层分类。按当前资料状态尚未经过双盲评审,且作者声明语料和分类边界存在限制;本站将其作为研究地图, 不作为规范。
  • Lost in the Middle:长上下文中的信息位置影响,为渐进披露提供研究背景。

项目如何从手工维护 AGENTS.md 与跨项目搜索实践演变而来,见历史与思想来源

文档站点与交付

新增引用时,请同时写明它是当前契约、必须遵守的协议、实现依赖、历史输入还是设计启发;只列名字不能形成可追溯依据。

Released under the MIT License.