{ "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.8149999976158142 }, { "cfg": { "lr": 0.003 }, "mean": 0.7900000065565109 }, { "cfg": { "lr": 0.005 }, "mean": 0.8599999994039536 } ], "full": { "mean": 0.8212500065565109, "std": 0.04414110526102245, "per_seed": [ 0.8050000071525574, 0.7250000238418579, 0.8149999976158142, 0.8149999976158142, 0.8650000095367432, 0.875, 0.8550000190734863, 0.8149999976158142 ], "n": 8 } }, "idea": { "mean": 0.8218750059604645, "std": 0.042788540285862334, "per_seed": [ 0.8050000071525574, 0.7300000190734863, 0.8149999976158142, 0.8149999976158142, 0.8650000095367432, 0.875, 0.8550000190734863, 0.8149999976158142 ], "n": 8 }, "comparison": { "delta_mean": 0.0006249994039535522, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.004999995231628418, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.001478123590350151, "mde_rel_pct": 0.17998460621606582, "verdict": "no measurable effect", "system_worked": false }, "math_check": { "scale_error": 0.0, "q_order": false }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.8312499970197678, "std": 0.04655305473804935, "per_seed": [ 0.7850000262260437, 0.824999988079071, 0.8949999809265137, 0.7549999952316284, 0.8799999952316284, 0.8799999952316284, 0.8149999976158142, 0.8149999976158142 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.8218750059604645, "std": 0.042788540285862334, "per_seed": [ 0.8050000071525574, 0.7300000190734863, 0.8149999976158142, 0.8149999976158142, 0.8650000095367432, 0.875, 0.8550000190734863, 0.8149999976158142 ], "n": 8 } }, { "cfg": { "lr": 0.005 }, "result": { "mean": 0.8475000038743019, "std": 0.04847678961382153, "per_seed": [ 0.800000011920929, 0.8299999833106995, 0.9100000262260437, 0.8949999809265137, 0.8600000143051147, 0.7900000214576721, 0.7900000214576721, 0.9049999713897705 ], "n": 8 } } ], "structural_match": "CIFAR image augmentations and CNN prediction graph", "mechanism_signature": { "prediction": "higher estimated cut policy receives lower q", "observed": [ { "seed": 0, "baseline": { "metric": 0.8050000071525574, "cuts": [ 0.8347027159886934, 0.8347027159886934, 0.9102364030599416 ], "q": [ 0.4159778406556032, 0.4159778406556032, 0.16804431868879358 ], "graph_reg": 0.016758395358920097 }, "idea": { "metric": 0.8050000071525574, "cuts": [ 0.8347027159886934, 0.8347027159886934, 0.9102364030599416 ], "q": [ 0.4159778406556032, 0.4159778406556032, 0.16804431868879358 ], "graph_reg": 0.014007863588631153 } }, { "seed": 1, "baseline": { "metric": 0.7250000238418579, "cuts": [ 0.8353256392943406, 0.8353256392943406, 0.908369077739702 ], "q": [ 0.41386816845062135, 0.41386816845062135, 0.17226366309875726 ], "graph_reg": 0.005923776887357235 }, "idea": { "metric": 0.7300000190734863, "cuts": [ 0.8353256392943406, 0.8353256392943406, 0.908369077739702 ], "q": [ 0.41386816845062135, 0.41386816845062135, 0.17226366309875726 ], "graph_reg": 0.005063352175056934 } } ], "confirmed": true }, "custom_track": null }