Each run is a batch of trials of one model on one dataset.
Pick two trials of one task.
Compare needs JavaScript. Each trial page plays its own recording.