UiPath/coder_eval

Evaluate & benchmark AI coding agents and Claude Code skills — sandboxed, reproducible YAML eval suites for Claude Code, Codex & Gemini, with A/B experiments and CI gates.

View on GitHub
Python
Stars 105
Forks 1
License Apache-2.0
Open Issues 10
Updated 1h ago