{ "bench_version": 1, "track": "relational_block_graph", "model": "shared_node_encoder", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.21859551593661308 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.2186652570962906 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.19878213480114937 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.19875044003129005 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.21140450984239578 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 0.21123026683926582 } ], "full": { "mean": 0.194888049736619, "std": 0.01561744050651578, "per_seed": [ 0.17818164825439453, 0.2278975248336792, 0.2048080563545227, 0.18411453068256378, 0.2039090394973755, 0.18120922148227692, 0.18494731187820435, 0.194037064909935 ], "n": 8 } }, "idea": { "mean": 0.19668109714984894, "std": 0.01395659198231783, "per_seed": [ 0.18862538039684296, 0.22365549206733704, 0.20406734943389893, 0.1854495406150818, 0.20570962131023407, 0.18311351537704468, 0.17992492020130157, 0.20290295779705048 ], "n": 8 }, "comparison": { "delta_mean": 0.0017930474132299423, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.010443732142448425, -0.004242032766342163, -0.0007407069206237793, 0.0013350099325180054, 0.0018005818128585815, 0.0019042938947677612, -0.005022391676902771, 0.008865892887115479 ], "p_value": 0.38515, "mde": 0.004627252745979375, "mde_rel_pct": 2.374313228662745, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction_vs_observed": { "baseline_pred_mean": 0.36992982029914856, "idea_pred_mean": 0.35136160254478455, "observed_edge_label_mean": 0.36666667461395264, "baseline_abs_mean_calibration_error": 0.003263145685195923, "idea_abs_mean_calibration_error": 0.01530507206916809 }, "trained_model_parameter_counts": { "baseline": 1996, "idea": 937 }, "confirmed": true, "note": "Signature is measured on held-out predictions of trained paired systems; confirmed means the block system produces finite, label-calibrated relational predictions." }, "idea_sweep": [ { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "result": { "mean": 0.19953397288918495, "std": 0.012231897269365018, "per_seed": [ 0.1849757432937622, 0.225642591714859, 0.20098033547401428, 0.1886790692806244, 0.20687870681285858, 0.1936967372894287, 0.19104768335819244, 0.20437091588974 ], "n": 8 } }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "result": { "mean": 0.22159693762660027, "std": 0.035181132803443205, "per_seed": [ 0.19724169373512268, 0.22439901530742645, 0.3056352436542511, 0.20666202902793884, 0.2244376391172409, 0.19750705361366272, 0.18519867956638336, 0.23169414699077606 ], "n": 8 } }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "result": { "mean": 0.19668109714984894, "std": 0.01395659198231783, "per_seed": [ 0.18862538039684296, 0.22365549206733704, 0.20406734943389893, 0.1854495406150818, 0.20570962131023407, 0.18311351537704468, 0.17992492020130157, 0.20290295779705048 ], "n": 8 } } ], "custom_track": { "name": "relational_block_graph", "file": "graph_track.py", "domain": "graph-nn" } }