Distinct-kink complexity regularizer and merger / report_bench_2026-09-04T181008.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Built and ran the matched tabular MLP benchmark using the registered built-in track, with an equal-budget tuned baseline sweep and 8 paired seeds. The idea reached MSE 8.601595 versus baseline 8.617290, but the paired permutation p-value was 0.75635, so the result is not a significant win; trained models formed no duplicate kink clusters and the mechanism signature was not confirmed.", "metrics": { "baseline": "8-seed mean test MSE 8.6172895432; best lr=0.01, weight_decay=0.0.", "idea": "8-seed mean test MSE 8.6015948653; best lr=0.01, lambda_k=0.0001; paired delta=-0.0156946778; 6/8 wins; p=0.75635." }, "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 24.6458387375 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 13.6254827976 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 8.3380122185 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 13.6001644135 } ], "full": { "mean": 8.6172895432, "std": 0.7396086814, "per_seed": [ 8.3998823166, 7.7852244377, 7.8347668648, 9.3321752548, 7.8863143921, 8.6637763977, 9.9386854172, 9.0974912643 ], "n": 8 } }, "idea": { "mean": 8.6015948653, "std": 0.7732046695, "per_seed": [ 8.5181093216, 7.7648587227, 7.8012914658, 9.2565097809, 7.8806152344, 8.2638263702, 9.9045219421, 9.4230260849 ], "n": 8 }, "comparison": { "delta_mean": -0.0156946778, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ 0.118227006, -0.020365715, -0.033475399, -0.075665474, -0.005699158, -0.399950027, -0.034163475, 0.325534821 ], "p_value": 0.75635, "mde": 0.1691312343, "mde_rel_pct": 1.962696431, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "lambda_k": 0.0001 }, "mean": 23.8931441307 }, { "cfg": { "lr": 0.003, "lambda_k": 0.0001 }, "mean": 13.5349564552 }, { "cfg": { "lr": 0.01, "lambda_k": 0.0001 }, "mean": 8.3351923227 } ], "mechanism_signature": { "predicted_duplicate_fraction_mean": 0.0, "observed_duplicate_fraction_mean": 0.0, "probe_prediction_rms_mean": 15.1002993584, "confirmed": false } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "results/bench_report.json" ], "limitations": "Only the registered tabular/Friedman regression track was tested, not vision, sequence, or dynamics. The benchmark used mlp_tiny width 64 and 18 epochs; exact discrete merging and inference memory/latency reduction were not demonstrated because no duplicates formed. The soft proxy is an MVP approximation and was not shown to induce duplicate hyperplanes.", "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }