BENCHMARK APP
Runs
Datasets
Agents
Compare
tag:
all
Start New Benchmark Run
Dataset
Select a dataset...
Agent
Select an agent...
Label
Tags (comma-separated)
Output Directory
Leave blank for default: ~/akd_data/<label>
Batch Size
5
10
15
20
Repeat
Run the benchmark N times (max 3 in parallel)
Queries
All
Select specific
Select All
Deselect All
Pick
Top
Bottom
Random
Cancel
Start Run