# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 9, "verdict": "Resolution-Gated Dual Masking was implemented and evaluated on the registered Friedman#1 tabular track with the matched mlp_tiny architecture and identical train_model path. The idea obtained lower mean MSE (7.01413 vs 7.05324), but the paired permutation test was non-significant (delta=-0.03911, p=0.50145), so this is not a demonstrated win. The trained-model mechanism signature confirmed kappa=1.0 and fallback away from the entropy mask on all 8 seeds.", "metrics": { "baseline": "Best tuned baseline MSE=7.0532397628, lr=0.006, weight_decay=0.0001, epochs=12.", "idea": "Best gated-mask MSE=7.0141316056, paired delta=-0.0391081572, 4/8 wins, permutation p=0.50145." }, "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0001, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.0015, "weight_decay": 0.0, "epochs": 12 }, "mean": 13.675705671310425 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 12 }, "mean": 9.352656126022339 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0, "epochs": 12 }, "mean": 7.226524114608765 }, { "cfg": { "lr": 0.0015, "weight_decay": 0.0001, "epochs": 12 }, "mean": 13.609990000724792 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "epochs": 12 }, "mean": 9.076743841171265 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001, "epochs": 12 }, "mean": 7.0532397627830505 } ], "full": { "mean": 7.0532397627830505, "std": 0.2264412705403704, "per_seed": [ 6.572167873382568, 7.1756792068481445, 7.042057037353516, 7.032951831817627, 7.018033504486084, 7.022153854370117, 7.112776756286621, 7.450098037719727 ], "n": 8 } }, "idea": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0001, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.0015, "weight_decay": 0.0, "epochs": 12 }, "mean": 13.917831420898438 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 12 }, "mean": 9.332432746887207 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0, "epochs": 12 }, "mean": 7.183628082275391 }, { "cfg": { "lr": 0.0015, "weight_decay": 0.0001, "epochs": 12 }, "mean": 13.897738456726074 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "epochs": 12 }, "mean": 9.150044441223145 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001, "epochs": 12 }, "mean": 7.014131605625153 } ], "full": { "mean": 7.014131605625153, "std": 0.24308566746895208, "per_seed": [ 6.6641693115234375, 7.260889053344727, 6.737545013427734, 6.856451034545898, 6.927297592163086, 7.039077281951904, 7.303320407867432, 7.324303150177002 ], "n": 8 } }, "comparison": { "delta_mean": -0.03910815715789795, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.09200143814086914, 0.08520984649658203, -0.30451202392578125, -0.17650079727172852, -0.09073591232299805, 0.01692342758178711, 0.19054365158081055, -0.1257948875427246 ], "p_value": 0.50145, "mde": 0.13703746835599878, "mde_rel_pct": 1.9429010350546605, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "kappa>=0.90 routes away from entropy mask and avoids materially worse trained-model MSE", "observed": [ { "seed": 0, "kappa": 1.0, "gamma": 13.140283130679085, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.09200143814086914 }, { "seed": 1, "kappa": 1.0, "gamma": 16.30871552694337, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.08520984649658203 }, { "seed": 2, "kappa": 1.0, "gamma": 12.264759413539208, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.30451202392578125 }, { "seed": 3, "kappa": 1.0, "gamma": 13.648493168331017, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.17650079727172852 }, { "seed": 4, "kappa": 1.0, "gamma": 15.0961523290884, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.09073591232299805 }, { "seed": 5, "kappa": 1.0, "gamma": 11.799654276914342, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.01692342758178711 }, { "seed": 6, "kappa": 1.0, "gamma": 15.35830432998792, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": 0.19054365158081055 }, { "seed": 7, "kappa": 1.0, "gamma": 13.753987138531764, "used_entropy": false, "predicted_fallback": true, "observed_subset_minus_full_mse": -0.1257948875427246 } ], "high_kappa_n": 8, "high_kappa_observed_mean_delta": -0.03910815715789795, "confirmed": true } }, "how_to_run": "cd /home/maxwelhelp/all/math2nn/experiments/exp3124_resolution-gated-dual-masking && /home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the structurally matched registered tabular track was tested. Learned mixture-of-experts gating, broader threshold sweeps, speed/FLOP measurements, and larger datasets were not tested.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }