Median time per task · DeepSeek V4 Pro (0813)
Across 5 agent harnesses on 30 agentic tasks · lower is better
Claude Code
182s
DeepSeek Harness
252s
Hermes Agent
274s
OpenCode
281s
Pi Agent
363s
0s
100s
200s
300s
400s
Source: Composio agentic eval
Across 5 agent harnesses on 30 agentic tasks · lower is better