/ case study / agentarena

AgentArena

Локальный vendor‑neutral benchmark runner: несколько coding‑агентов получают одну и ту же инженерную задачу в одинаковых условиях, затем проходят проверки репозитория и сравниваются по прозрачному scoring.

CORE QUESTION

Your repo.
Same task. One winner.

Публичный benchmark не знает твою кодовую базу. AgentArena проверяет, какой агент лучше справляется именно с задачей в конкретном репозитории.

runtimeNode.js 20+
isolationGit worktrees
interfaceCLI + local dashboard
agentsCodex · Claude · Gemini · OpenCode
merge policyExplicit / guarded
runtime deps0 npm dependencies

Перед боем фиксируется текущий Git commit. Каждый contender получает отдельный worktree, поэтому агенты не делят рабочую директорию и не могут случайно перезаписать изменения друг друга.

Frozen base SHA
Isolated worktrees
Checks + scoring
Review winner

Вместо абстрактной benchmark‑метрики AgentArena может запускать существующие tests, lint, typecheck, build и произвольные shell checks. То есть качество связано с критериями, которые уже определяют корректность проекта.

Parallel contender execution
Repository-native checks
Transparent score breakdown
Blind mode for less biased human review

Результат — инструмент для решения, а не автоматическое доказательство правильности. Победивший diff сначала можно посмотреть. Применение происходит явно и только при безопасном состоянии рабочего дерева.

No silent merge
Guarded cherry-pick
Reports and local history
Custom adapters for shell-driven agents
root@hanxw:~# access granted
Konami route resolved. ROOT ACCESS achievement unlocked.