{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 18 }, "sweep": [ { "cfg": { "lr": 0.0015, "epochs": 18 }, "mean": 16.413997888565063 }, { "cfg": { "lr": 0.003, "epochs": 18 }, "mean": 13.256237506866455 }, { "cfg": { "lr": 0.006, "epochs": 18 }, "mean": 10.138120174407959 } ], "full": { "mean": 10.593586206436157, "std": 1.1860413365771312, "per_seed": [ 9.266413688659668, 10.942156791687012, 10.532804489135742, 9.811105728149414, 9.271466255187988, 10.483624458312988, 11.298463821411133, 13.142654418945312 ], "n": 8 } }, "idea": { "mean": 24.50470805168152, "std": 1.4738344415396776, "per_seed": [ 25.35301971435547, 24.542402267456055, 26.259077072143555, 22.042612075805664, 22.800880432128906, 25.55665397644043, 23.438636779785156, 26.044382095336914 ], "n": 8, "best_cfg": { "lr": 0.003, "epochs": 18 }, "settings": [ { "cfg": { "lr": 0.0015, "epochs": 18 }, "mean": 48.017033100128174 }, { "cfg": { "lr": 0.003, "epochs": 18 }, "mean": 24.50470805168152 }, { "cfg": { "lr": 0.006, "epochs": 18 }, "mean": 24.52953600883484 } ] }, "comparison": { "delta_mean": 13.911121845245361, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 16.0866060256958, 13.600245475769043, 15.726272583007812, 12.23150634765625, 13.529414176940918, 15.073029518127441, 12.140172958374023, 12.901727676391602 ], "p_value": 0.0081, "mde": 1.2874798773006364, "mde_rel_pct": 12.153390289290563, "verdict": "idea worse (significant)", "system_worked": false }, "track_choice": "Friedman#1 is the built-in regression track and matches the idea's high-dimensional regression setting.", "custom_track": null, "parameter_counts": { "baseline": 4929, "idea": 7076 }, "mechanism_signature": { "definition": "trained accumulator behavior on tabular test predictions", "predicted": "context is transmitted unchanged and output corrections accumulate additively", "observed_mean_delta_norms": [ 0.9999635517597198, 0.9999598488211632 ], "observed_final_accumulator_norm": 2.128704696893692, "observed_prediction_std": 0.06401639571413398, "quantitative_tolerance": "nonzero branch corrections and finite accumulated state", "confirmed": true } }