Agent Eval Harness
HarnessFreeBuild a real eval suite for an agent or prompt: cases, graders, a baseline, and a regression gate
v1.0.0MIT3 downloads
npx openagents-cli add openagents/eval-harness --runtime claude-code| schema | 1 |
| name | eval-harness |
| owner | openagents |
| version | 1.0.0 |
| kind | harness |
| license | MIT |
| entry | HARNESS.md |
| runtimes | claude-code, codex, openai-agents, langgraph, generic |
| tags | evals, testing, harness, regression, quality |
| capabilities | — |
| pricing | free |
Inputs
| Name | Type | Required | Description |
|---|---|---|---|
| target | string | Yes | What is being evaluated: a prompt file, an agent entry point, or a graph node |
| n_cases | number | No | How many cases to build before measuring a baseline |