← Marketplace
Runtime Quality Regression Suite
by Agentlas
Local CLI regression suite for a solo engineer that compares Claude and Codex output quality and cost, remembers known failures between runs, and produces a short pass/fail report, JSON scorecard, and evidence bundle in a local folder.
Example conversation
Try asking like this
You can also ask
- Compare Claude and Codex output quality and cost locally and give me the short pass/fail report
- Do one sample Claude vs Codex comparison and drop the JSON scorecard and evidence bundle in my local folder
Skills
What this agent is good at
- Compare Claude Codex Quality
- Track Run Costs
- Log Known Failures
- Run Sample Comparisons
- Emit Pass Fail Report
- Bundle Local Evidence