{ "baseline": { "best_cfg": { "epochs": 35, "lr": 0.01, "width": 48 }, "full": { "mean": 0.1913430094718933, "n": 8, "per_seed": [ 0.21796821057796478, 0.18948782980442047, 0.18038326501846313, 0.17539961636066437, 0.2016671746969223, 0.19406883418560028, 0.18906868994235992, 0.18270045518875122 ], "std": 0.01265175674434216 }, "sweep": [ { "cfg": { "epochs": 35, "lr": 0.001, "width": 48 }, "mean": 0.2922794222831726 }, { "cfg": { "epochs": 35, "lr": 0.003, "width": 48 }, "mean": 0.2332044392824173 }, { "cfg": { "epochs": 35, "lr": 0.01, "width": 48 }, "mean": 0.1908097304403782 } ] }, "bench_version": 1, "comparison": { "delta_mean": -0.10181683763221372, "idea_wins": 6, "mde": 0.08970938035328954, "mde_rel_pct": 46.88406469663429, "n_pairs": 8, "p_value": 0.03805, "per_seed_diffs": [ -0.13966041058301926, -0.18819955282378942, -0.1548399105668068, -0.17267675884068012, 0.06887666881084442, 0.06751273572444916, -0.11764338612556458, -0.17790408665314317 ], "system_worked": true, "verdict": "idea better (significant)" }, "custom_track": { "domain": "graph", "file": "holonomy_track.py", "name": "directed_path_holonomy" }, "idea": { "mean": 0.08952617183967959, "n": 8, "per_seed": [ 0.07830779999494553, 0.0012882769806310534, 0.02554335445165634, 0.0027228575199842453, 0.2705438435077667, 0.26158156991004944, 0.07142530381679535, 0.004796368535608053 ], "std": 0.10572229702516253 }, "idea_best_cfg": { "epochs": 35, "lr": 0.01, "width": 48 }, "idea_sweep": [ { "cfg": { "epochs": 35, "lr": 0.001, "width": 48 }, "mean": 0.33307167142629623 }, { "cfg": { "epochs": 35, "lr": 0.003, "width": 48 }, "mean": 0.1860583908855915 }, { "cfg": { "epochs": 35, "lr": 0.01, "width": 48 }, "mean": 0.02696557223680429 } ], "mechanism_signature": { "confirmed": false, "observed_mean": { "baseline_test_rmse": 0.4371945932507515, "idea_test_rmse": 0.2369789406657219, "order_sensitivity": 0.36837229039520025, "system_gap": 0.3969488888978958 }, "prediction": "ordered holonomy should retain order: reversal sensitivity exceeds additive baseline gap" }, "metric_direction": "lower is better", "model": "matched_matrix_mlp", "n_seeds": 8, "notes": "Baseline and idea share edge encoder and head; only sum versus ordered matrix product differs.", "track": "directed_path_holonomy" }