Zero-Augmented Double-Scoring / report_bench_2026-08-31T170403.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Zero-augmented double-scoring was implemented for frozen mlp_tiny weights on the registered tabular Friedman regression track. Baseline MSE was 224.903 and idea MSE was 225.713, giving delta_mean +0.810 and permutation p=0.16705, so the idea did not produce a significant win. The trained-model mechanism signature was confirmed: observed dummy fraction 0.50146 versus predicted 0.5 and observed effective real density 0.50350 versus predicted 0.5.", "metrics": { "baseline": "MSE 224.90276336669922; best lr=0.01, density=0.75", "idea": "MSE 225.713041305542; best lr=0.01, rho_aug=0.5", "paired": "delta_mean=0.8102779388427734; idea_wins=2/8; p_value=0.16705" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 run_bench.py", "files": [ "run_bench.py", "bench_report.json", "run.log" ], "limitations": "Only the registered tabular track was tested. Strong-ticket rewinding, post-selection weight training, and layerwise density curves were not tested.", "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "density": 0.75 }, "sweep": [ { "cfg": { "lr": 0.001, "density": 0.25 }, "mean": 235.12103271484375 }, { "cfg": { "lr": 0.001, "density": 0.5 }, "mean": 234.88482284545898 }, { "cfg": { "lr": 0.001, "density": 0.75 }, "mean": 234.4692726135254 }, { "cfg": { "lr": 0.003, "density": 0.25 }, "mean": 234.5323600769043 }, { "cfg": { "lr": 0.003, "density": 0.5 }, "mean": 233.07298278808594 }, { "cfg": { "lr": 0.003, "density": 0.75 }, "mean": 232.68642044067383 }, { "cfg": { "lr": 0.01, "density": 0.25 }, "mean": 232.15027618408203 }, { "cfg": { "lr": 0.01, "density": 0.5 }, "mean": 227.00447845458984 }, { "cfg": { "lr": 0.01, "density": 0.75 }, "mean": 226.18533325195312 } ], "full": { "mean": 224.90276336669922, "std": 11.172746066633566, "per_seed": [ 239.23036193847656, 226.6573944091797, 226.5115509033203, 212.34202575683594, 230.5985870361328, 209.33729553222656, 214.15821838378906, 240.3866729736328 ], "n": 8 } }, "idea": { "mean": 225.713041305542, "std": 11.455704812834473, "per_seed": [ 241.9227752685547, 225.7875518798828, 227.34036254882812, 211.91632080078125, 231.61343383789062, 209.4794921875, 217.06570434570312, 240.5786895751953 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.001, "rho_aug": 0.5 }, "mean": 234.92945861816406 }, { "cfg": { "lr": 0.003, "rho_aug": 0.5 }, "mean": 232.97465896606445 }, { "cfg": { "lr": 0.01, "rho_aug": 0.5 }, "mean": 226.74175262451172 } ] }, "comparison": { "delta_mean": 0.8102779388427734, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 2.692413330078125, -0.869842529296875, 0.8288116455078125, -0.4257049560546875, 1.0148468017578125, 0.1421966552734375, 2.9074859619140625, 0.1920166015625 ], "p_value": 0.16705, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "With iid initialized real and dummy scores and fixed Top-K, expected dummy fraction is 0.5 and expected real density is rho_aug=0.5.", "predicted_dummy_fraction": 0.5, "observed_dummy_fraction_mean": 0.5014583333333333, "predicted_real_density": 0.5, "observed_real_density_mean": 0.5034952799479167, "confirmed": true } }, "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }