792 B
yaml
| 1 | schema: 1 |
| 2 | name: eval-harness |
| 3 | owner: openagents |
| 4 | version: 1.0.0 |
| 5 | kind: harness |
| 6 | title: Agent Eval Harness |
| 7 | summary: "Build a real eval suite for an agent or prompt: cases, graders, a baseline, and a regression gate" |
| 8 | license: MIT |
| 9 | tags: [evals, testing, harness, regression, quality] |
| 10 | runtimes: [claude-code, codex, openai-agents, langgraph, generic] |
| 11 | pricing: |
| 12 | model: free |
| 13 | amount_cents: 0 |
| 14 | currency: usd |
| 15 | entry: HARNESS.md |
| 16 | files: |
| 17 | - HARNESS.md |
| 18 | - grading.md |
| 19 | - templates/cases.jsonl |
| 20 | inputs: |
| 21 | - name: target |
| 22 | type: string |
| 23 | required: true |
| 24 | description: "What is being evaluated: a prompt file, an agent entry point, or a graph node" |
| 25 | - name: n_cases |
| 26 | type: number |
| 27 | required: false |
| 28 | default: 30 |
| 29 | description: How many cases to build before measuring a baseline |
| 30 | requires: [] |
| 31 |