harness eval
Per-model evaluation of LLM coding agents across the Omega harness suites — fast smoke tests, deep debugging tasks, and real-world GitHub issues. Pass rate, token cost, failure analysis.
Models
11
Total tasks
325
Overall pass rate
54%
Total tokens
57.9M
Total cost
$70.18
| # | Model | Pass rate | Tasks | Avg time | Tokens | Cost | Turns | Tools |
|---|---|---|---|---|---|---|---|---|
| 1 | nvidia/nemotron-3-ultra-550b-a55b:free | 100% | 1 | 48.9s | 45.1k | — | — | — |
| 2 | kimi-k3 | 100% | 2 | 2m 47s | 189.8k | — | — | — |
| 3 | deepseek-v4-pro+qwen3.8-max-preview | 100% | 10 | 3m 29s | 2.3M | — | — | — |
| 4 | agy+MiniMax-M3+deepseek-v4-pro | 100% | 36 | 3m 4s | 7.9M | $2.59 | — | — |
| 5 | default | 82% | 49 | 1m 37s | 2.2M | — | — | — |
| 6 | qwen3.8-max-preview | 70% | 20 | 2m 55s | 2.3M | $0.72 | — | — |
| 7 | agy | 64% | 47 | 2m 24s | - | — | — | — |
| 8 | deepseek-v4-pro | 39% | 59 | 2m 45s | 6.4M | $1.98 | — | — |
| 9 | MiniMax-M3 | 31% | 48 | 2m 34s | 5.0M | $1.71 | — | — |
| 10 | moonshot-v1-128k | 7% | 43 | 25m 1s | 31.6M | $63.17 | — | — |
| 11 | agy | 0% | 10 | 4.2s | - | — | — | — |
10 tasks
10 tasks
10 tasks
10 tasks
The harder suite contains 12 capability-focused tasks designed to differentiate agents that all pass the fast suite. Four categories:
12 tasks
10 tasks
10 tasks
2 tasks
2 tasks
6 tasks
6 tasks
16 failures
11 failures
10 failures
8 failures
2 failures
1 failure
1 failure