Hidden-Diffusion Irreversibility Monitor / report_bench_2026-09-02T172203.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Built the Hidden-Diffusion Irreversibility Monitor as a latent cross-diffusion regularizer for the benchmark's shared rnn_small dynamics model. Across 8 paired seeds, the idea was slightly worse: MSE 0.013573 versus baseline 0.013490, delta +8.26e-05, with permutation p=0.04575; therefore it does not give a win. The trained-model signature was not confirmed because hidden cross-diffusion variability decreased rather than showing the predicted independent variation, while output-power variability remained essentially unchanged.", "metrics": { "baseline": "dynamics/rnn_small test MSE mean 0.013490461744368076, std 0.0036455379141356633, per-seed [0.01656705141067505, 0.01134894136339426, 0.013825791887938976, 0.012965662404894829, 0.02068343572318554, 0.014116058126091957, 0.010448829270899296, 0.007967923767864704]; best cfg lr=0.006, weight_decay=0.0001", "idea": "dynamics/rnn_small test MSE mean 0.013573068077675998, std 0.0036332788661090037, per-seed [0.016753576695919037, 0.011368772946298122, 0.013876390643417835, 0.012907849624752998, 0.020729539915919304, 0.014167544431984425, 0.010720721445977688, 0.008060148917138577]; best cfg lr=0.006, weight_decay=0.0, lam=0.001", "delta_mean": 8.260633330792189e-05, "permutation_p_value": 0.04575, "mechanism_signature": { "predicted": "hidden cross diffusion can vary while observed output power is comparatively stable", "baseline_observed_output_power_std": 0.15846109952602266, "idea_observed_output_power_std": 0.15854744148375174, "baseline_hidden_dxy_std": 0.00042474186371430176, "idea_hidden_dxy_std": 2.490041131097002e-05, "idea_mean_reverse_forward_gap": 0.018812500281407442, "confirmed": false } }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.17645552940666676 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.17659775167703629 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.028942419216036797 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.028870720881968737 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 0.013678546762093902 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "mean": 0.013676861766725779 } ], "full": { "mean": 0.013490461744368076, "std": 0.0036455379141356633, "per_seed": [ 0.01656705141067505, 0.01134894136339426, 0.013825791887938976, 0.012965662404894829, 0.02068343572318554, 0.014116058126091957, 0.010448829270899296, 0.007967923767864704 ], "n": 8 } }, "idea": { "mean": 0.013573068077675998, "std": 0.0036332788661090037, "per_seed": [ 0.016753576695919037, 0.011368772946298122, 0.013876390643417835, 0.012907849624752998, 0.020729539915919304, 0.014167544431984425, 0.010720721445977688, 0.008060148917138577 ], "n": 8, "cfg": { "lr": 0.006, "weight_decay": 0.0, "lam": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0, "lam": 0.001 }, "mean": 0.16410381672903895 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "lam": 0.001 }, "mean": 0.02484322735108435 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0, "lam": 0.001 }, "mean": 0.013573068077675998 } ] }, "comparison": { "delta_mean": 8.260633330792189e-05, "idea_wins": 1, "n_pairs": 8, "per_seed_diffs": [ 0.00018652528524398804, 1.9831582903862e-05, 5.059875547885895e-05, -5.7812780141830444e-05, 4.610419273376465e-05, 5.14863058924675e-05, 0.00027189217507839203, 9.222514927387238e-05 ], "p_value": 0.04575, "mde": 8.579928619368267e-05, "mde_rel_pct": 0.635999625657748, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted": "hidden cross diffusion can vary while observed output power is comparatively stable", "baseline_observed_output_power_std": 0.15846109952602266, "idea_observed_output_power_std": 0.15854744148375174, "baseline_hidden_dxy_std": 0.00042474186371430176, "idea_hidden_dxy_std": 2.490041131097002e-05, "idea_mean_reverse_forward_gap": 0.018812500281407442, "confirmed": false } }, "how_to_run": "CUDA_VISIBLE_DEVICES='' OMP_NUM_THREADS=1 MKL_NUM_THREADS=1 /home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "The run used a reduced but complete 8-seed protocol with 400 training samples, 100 test samples, and 6 epochs to fit the runtime limit; it was CPU-only after the shared CUDA attempt failed. The intervention is a compact empirical hidden-state covariance penalty rather than a full learned stochastic RNN with explicit diffusion outputs, and no long-horizon calibration or delayed-copy experiment was tested.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }