Your repo.
Same task. One winner.
Публичный benchmark не знает твою кодовую базу. AgentArena проверяет, какой агент лучше справляется именно с задачей в конкретном репозитории.
Локальный vendor‑neutral benchmark runner: несколько coding‑агентов получают одну и ту же инженерную задачу в одинаковых условиях, затем проходят проверки репозитория и сравниваются по прозрачному scoring.
Публичный benchmark не знает твою кодовую базу. AgentArena проверяет, какой агент лучше справляется именно с задачей в конкретном репозитории.
Перед боем фиксируется текущий Git commit. Каждый contender получает отдельный worktree, поэтому агенты не делят рабочую директорию и не могут случайно перезаписать изменения друг друга.
Вместо абстрактной benchmark‑метрики AgentArena может запускать существующие tests, lint, typecheck, build и произвольные shell checks. То есть качество связано с критериями, которые уже определяют корректность проекта.
Результат — инструмент для решения, а не автоматическое доказательство правильности. Победивший diff сначала можно посмотреть. Применение происходит явно и только при безопасном состоянии рабочего дерева.