Documentation
README
评测工具链(Eval Harness)技能(Skill)
一个用于 Claude Code 会话的正式评测框架,实现了评测驱动开发(Eval-Driven Development, EDD)原则。
何时激活
- 为 AI 辅助工作流设置评测驱动开发(EDD)
- 为 Claude Code 任务完成定义通过/失败的标准
- 使用 pass@k 指标衡量智能体(Agent)的可靠性
- 为提示词(Prompt)或智能体(Agent)的变更创建回归测试套件
- 跨模型版本对智能体(Agent)性能进行基准测试
核心理念
评测驱动开发(Eval-Driven Development)将评测视为“AI 开发的单元测试”:
- 在实现之前定义预期行为
- 在开发过程中持续运行评测
- 追踪每次变更带来的回归(Regression)
- 使用 pass@k 指标进行可靠性衡量
评测类型
能力评测(Capability Evals)
测试 Claude 是否能够完成之前无法完成的任务:
[CAPABILITY EVAL: feature-name]
任务:描述 Claude 应该完成的目标
成功标准:
- [ ] 标准 1
- [ ] 标准 2
- [ ] 标准 3
预期输出:对预期结果的描述
This is the opening of the README. Read the full README on GitHub.