Average eval score per agent over all runs
Percentage of runs scoring ≥ 0.7 per agent
Average response latency in milliseconds
How scores are distributed across all runs
Average prompt vs completion tokens per run