Harnesses
A harness is the program that drives a model through a coding task: Claude Code, Codex, Pi, OpenCode. Every harness a source has measured gets a row, and every source keeps its own column, never folded into one score. A cell is the harness’s best run on that source, with the model named, because part of a harness’s score belongs to the model it drives.A blank cell means that source never ran the harness, not a score of zero. Click a column head to sort by it; open a row to see every run.
| Harness | ||||
|---|---|---|---|---|
| 83.3%GPT 5.6 Sol · $0.42 per task | 96.7%Claude Fable 5 · $0.67 per task | — | — | |
| 78.9%GPT 5.6 Sol · $0.76 per task | 96.7%Claude Fable 5 · $0.89 per task | 0.629GPT 6.1 Sol · xhigh effort · $1.04 per task | 58.2%GPT 6 Astra · max effort · $9.90 per task | |
| 75.6%Claude Fable 5 · $1.55 per task | 97.8%Claude Fable 5 · $1.33 per task | 0.684Claude Sonnet 5.5 · max effort · $14.19 per task | 64.8%Claude Opus 5.5 · max effort · $14.30 per task | |
| — | — | 0.638Gemini 4 Argon · $5.84 per task | — | |
| — | — | 0.617Claude Fable 5.1 XHigh + SWE-2 Medium · $7.90 per task | — | |
| — | — | 0.563Grok 4.7 · xhigh effort · $8.82 per task | 37.6%Grok 4.7 · xhigh effort · $11.16 per task | |
| — | — | 0.543Muse Spark 1.3 · max effort · $3.98 per task | 14.6%Muse Spark 1.3 · xhigh effort | |
| — | — | 0.536GLM 5.3 · $4.24 per task | — | |
| — | — | 0.519Kimi K3 · $5.05 per task | — | |
| — | — | 0.419Gemini 3.8 Flash · Antigravity SDK v0.1.12 · high effort · $2.47 per task | — | |
| — | — | — | 19.1%Gemini 3.8 Flash · high effort · $5.54 per task |