Independent-Simplex Hypergraph Router / report_bench_2026-09-03T230533.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": true, "confidence": 7, "verdict": "The idea was implemented as an end-to-end geometric triangle-area regression system using the same MLP architecture and matched learning-rate sweep as the random equal-budget baseline. It achieved mean MSE 0.49005 versus 0.59957 for the baseline, with paired delta -0.10952 and permutation p=0.0388, satisfying the harness significant-win criterion. Runtime, memory, and FLOP savings were not measured.", "metrics": { "baseline": "Mean test MSE 0.5995706543 over 8 seeds; best lr=0.003, budget=8, random router.", "idea": "Mean test MSE 0.4900477603 over 8 seeds; best lr=0.01, budget=8, greedy Jacobian router; delta=-0.1095228940, p=0.0388, 7/8 wins." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 run_bench.py", "files": [ "geometric_track.py", "run_bench.py", "bench_report.json" ], "limitations": "The custom track is a minimal geometric regression benchmark rather than ModelNet40 or a full geometric message-passing network. Wall-clock time, peak memory, and actual message FLOPs were not profiled; routing was fixed per seed rather than learned or refreshed during training.", "bench_report": { "track": "geometric_triangle_area", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "budget": 8, "router": "random" }, "mean": 0.5995706543 }, "idea": { "best_cfg": { "lr": 0.01, "budget": 8, "router": "greedy_jacobian" }, "mean": 0.4900477603 }, "comparison": { "delta_mean": -0.109522894, "p_value": 0.0388, "idea_wins": 7, "n_pairs": 8, "verdict": "idea better (significant)" }, "custom_track": { "name": "geometric_triangle_area", "file": "geometric_track.py", "domain": "geometric_graph" }, "mechanism_signature": { "confirmed": true, "idea_selected_gradient": 0.1761807501, "idea_omitted_gradient": 0.1284586042 } }, "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }