Median time per task · DeepSeek V4 Pro (0813)

Across 5 agent harnesses on 30 agentic tasks · lower is better

Claude Code
182s
DeepSeek Harness
252s
Hermes Agent
274s
OpenCode
281s
Pi Agent
363s
0s
100s
200s
300s
400s
ComposioBENCH
Source: Composio agentic eval