Maximum-Entropy Relational Block Kernel / report_bench_2026-08-31T163304.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "The registered relational_block_graph track used matched dense and block-kernel systems, an equal-budget baseline sweep, and eight paired seeds. The idea reduced parameters by 53.1% but slightly worsened test MSE, with no significant win.", "metrics": { "baseline": "mean test MSE 0.1948880497; best lr=0.003, weight_decay=0.0001; 1996 parameters", "idea": "mean test MSE 0.1966810971; best lr=0.01, weight_decay=0.0001; 937 parameters; paired delta +0.0017930474; permutation p=0.38515" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_run.py", "files": [ "graph_track.py", "bench_run.py", "bench_report.json", "/home/maxwelhelp/all/math2nn/bench/custom_tracks/relational_block_graph.py" ], "limitations": "This is a small synthetic relational edge-prediction task rather than Cora or ogbn-arxiv. Explicit entropy and motif constraint losses, full-node message passing, GPU dense-kernel memory, and propagation speed were not tested.", "bench_report": { "bench_version": 1, "track": "relational_block_graph", "model": "shared_node_encoder", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.2185955159 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.2186652571 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.1987821348 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.19875044 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.2114045098 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 0.2112302668 } ], "full": { "mean": 0.1948880497, "std": 0.0156174405, "per_seed": [ 0.1781816483, 0.2278975248, 0.2048080564, 0.1841145307, 0.2039090395, 0.1812092215, 0.1849473119, 0.1940370649 ], "n": 8 } }, "idea": { "mean": 0.1966810971, "std": 0.013956592, "per_seed": [ 0.1886253804, 0.2236554921, 0.2040673494, 0.1854495406, 0.2057096213, 0.1831135154, 0.1799249202, 0.2029029578 ], "n": 8, "best_cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.1995339729 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.2215969376 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 0.1966810971 } ] }, "comparison": { "delta_mean": 0.0017930474, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0104437321, -0.0042420328, -0.0007407069, 0.0013350099, 0.0018005818, 0.0019042939, -0.0050223917, 0.0088658929 ], "p_value": 0.38515, "mde": 0.0046272527, "mde_rel_pct": 2.3743, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction_vs_observed": { "baseline_pred_mean": 0.3699298203, "idea_pred_mean": 0.3513616025, "observed_edge_label_mean": 0.3666666746, "baseline_abs_mean_calibration_error": 0.0032631457, "idea_abs_mean_calibration_error": 0.0153050721 }, "trained_model_parameter_counts": { "baseline": 1996, "idea": 937 }, "confirmed": true }, "custom_track": { "name": "relational_block_graph", "file": "graph_track.py", "domain": "graph-nn" } }, "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }