Jacobian-Ranked Simplex Features / report_bench_2026-09-03T230431.md
Beats tuned baseline
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": true, "confidence": 8, "verdict": "The custom triangle/simplex track was accepted and registered by the official bench promotion utility, then rerun through bench.get_dataset with matched mlp_tiny systems and an equal shared learning-rate sweep. The Jacobian-weighted Heron-area idea won on all 8 paired seeds with lower MSE (0.006576 vs 0.010347), delta=-0.003771 and permutation p=0.0081, satisfying the bench verdict idea better (significant). The trained-model sensitivity signature was confirmed with observed/predicted response ratio 1.0029.", "metrics": { "baseline": "Best lr=0.01; full 8-seed MSE 0.010346994968131185 ± 0.002795628226111498", "idea": "Best shared lr=0.01; full 8-seed MSE 0.006576284009497613 ± 0.0011506745983477893", "paired_delta": -0.003770710958633572, "permutation_p_value": 0.0081, "idea_wins": "8/8", "mechanism_signature": { "mean_predicted_abs_output_delta": 0.00010509323328733444, "mean_observed_abs_output_delta": 0.00010509914136491716, "mean_observed_to_predicted_ratio": 1.002894401550293, "confirmed": true } }, "bench_report": { "bench_version": 1, "track": "jacobian_simplex_triangle", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.02803073776885867 }, { "cfg": { "lr": 0.003 }, "mean": 0.014160370687022805 }, { "cfg": { "lr": 0.01 }, "mean": 0.01129886822309345 } ], "full": { "mean": 0.010346994968131185, "std": 0.002795628226111498, "per_seed": [ 0.011259164661169052, 0.013376608490943909, 0.012956458143889904, 0.0076032415963709354, 0.011506251059472561, 0.006055573001503944, 0.013024956919252872, 0.006993705872446299 ], "n": 8 } }, "idea": { "mean": 0.006576284009497613, "std": 0.0011506745983477893, "per_seed": [ 0.005950353108346462, 0.007979393936693668, 0.007719683926552534, 0.005885654129087925, 0.005792700685560703, 0.00467478483915329, 0.008065154775977135, 0.006542546674609184 ], "n": 8 }, "comparison": { "delta_mean": -0.003770710958633572, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.00530881155282259, -0.00539721455425024, -0.00523677421733737, -0.0017175874672830105, -0.005713550373911858, -0.0013807881623506546, -0.004959802143275738, -0.00045115919783711433 ], "p_value": 0.0081, "mde": 0.0018236052438909767, "mde_rel_pct": 17.624491453873258, "verdict": "idea better (significant)", "system_worked": true }, "custom_track": { "name": "jacobian_simplex_triangle", "file": "simplex_track.py", "domain": "geometric_graph" }, "math_check": { "max_abs_autodiff_finite_difference": 3.032483153475596e-10, "jacobian_norm": 1.0437423273887312, "positive_sigma": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.027510648826137185, "std": 0.010645224655473157, "per_seed": [ 0.01384858600795269, 0.04354790970683098, 0.04501708908986664, 0.027162743732333183, 0.025257226079702377, 0.021136121824383736, 0.02710472047328949, 0.017010793089866638 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.010628473362885416, "std": 0.0050250987460242836, "per_seed": [ 0.006476277951151133, 0.016148243099451065, 0.020230555906891823, 0.007130751386284828, 0.00772904371842742, 0.007939266972243786, 0.013715370558202267, 0.005658277310431004 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "result": { "mean": 0.006576284009497613, "std": 0.0011506745983477893, "per_seed": [ 0.005950353108346462, 0.007979393936693668, 0.007719683926552534, 0.005885654129087925, 0.005792700685560703, 0.00467478483915329, 0.008065154775977135, 0.006542546674609184 ], "n": 8 } } ], "epochs": 25, "n_train": 400, "n_test": 400, "parameter_parity": true, "mechanism_signature": { "model_test_metric_seed0": 0.006476277951151133, "mean_predicted_abs_output_delta": 0.00010509323328733444, "mean_observed_abs_output_delta": 0.00010509914136491716, "mean_observed_to_predicted_ratio": 1.002894401550293, "finite_difference_agreement": 7.362902465501975e-08, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_runner.py", "files": [ "simplex_track.py", "bench_runner.py", "bench_report.json", "bench_report_registered.json", "bench_output_registered.txt", "/home/maxwelhelp/all/math2nn/bench/custom_tracks/jacobian_simplex_triangle.py" ], "limitations": "This is a small synthetic custom triangle regression track, not QM9, ModelNet40, or a full hypergraph/EGNN model. It tests scalar Heron-area weighting rather than the paper's multi-output 4x9 simplex-selection Jacobian, rank loss, attention aggregation, higher-dimensional volumes, or FLOP/speed tradeoffs. The custom track was accepted and registered by bench.promote.validate_and_promote; the shared bench source was not manually edited.", "system_verdict": "worked", "practical_verdict": "helps", "mechanism_ok": 1, "system_judged": true }