Task-Gated Diverse Counterfactuals / report_bench_2026-09-02T235345.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Implemented and ran Task-Gated Diverse Counterfactuals on the registered built-in dynamics track with matched rnn_small systems, equal learning-rate sweeps, conflict projection, and eight paired seeds. The trained-model mechanism signature was confirmed, but idea MSE was worse than baseline (0.0041233 vs 0.0037854), with paired delta +0.0003379 and permutation p=0.74425; this is not a benchmark win.", "metrics": { "baseline": "Tuned random fixed-batch GRU, lr=0.006: mean test MSE 0.0037854407 over 8 seeds.", "idea": "Gated greedy log-det plus conflict projection, lr=0.006: mean test MSE 0.0041233150 over 8 seeds; paired delta +0.0003378742; 3/8 wins; p=0.74425." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.009494054596871138 }, { "cfg": { "lr": 0.003 }, "mean": 0.007336396723985672 }, { "cfg": { "lr": 0.006 }, "mean": 0.0022095837048254907 } ], "full": { "mean": 0.00378544072736986, "std": 0.0018989003917669266, "per_seed": [ 0.0012300906237214804, 0.0019167494028806686, 0.0025526732206344604, 0.0031388215720653534, 0.004292467143386602, 0.00429861294105649, 0.007524837274104357, 0.0053292736411094666 ], "n": 8 } }, "idea": { "mean": 0.004123314953176305, "std": 0.0015556940648881973, "per_seed": [ 0.006014678161591291, 0.004604061134159565, 0.001407440286129713, 0.004439032170921564, 0.004578539170324802, 0.0031774272210896015, 0.0025332134682685137, 0.006232128012925386 ], "n": 8 }, "comparison": { "delta_mean": 0.0003378742258064449, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.004784587537869811, 0.0026873117312788963, -0.0011452329345047474, 0.0013002105988562107, 0.0002860720269382, -0.0011211857199668884, -0.004991623805835843, 0.0009028543718159199 ], "p_value": 0.74425, "mde": 0.0024331336866401957, "mde_rel_pct": 64.27610050919348, "verdict": "no significant win", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.015245286282151937 }, { "cfg": { "lr": 0.003 }, "mean": 0.008033281657844782 }, { "cfg": { "lr": 0.006 }, "mean": 0.004123314953176305 } ], "protocol": { "epochs": 18, "subset_size": 200, "selection": "gated greedy logdet + robust conflict projection" }, "mechanism_signature": { "baseline": { "predicted_F": 14.561817117749369, "predicted_random_F": 14.561817117749369, "observed_hidden_mean": 1.2567352070726674, "observed_random_hidden_mean": 1.2567352070726674, "test_metric": 0.007888410240411758 }, "idea": { "predicted_F": 14.744862360963827, "predicted_random_F": 14.561817117749369, "observed_hidden_mean": 1.2605930268989836, "observed_random_hidden_mean": 1.2383987569238568, "test_metric": 0.005153946578502655 }, "predicted_gain_observed": true, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 run_bench.py", "files": [ "run_bench.py", "bench_report.json" ], "limitations": "Only the registered built-in dynamics forecast benchmark was tested. No obstacle-navigation environment, learned dynamics ensemble, explicit trusted-policy KL filter, real constraint model, wall-clock/model-call analysis, synthetic-data bias, or the tabular, vision, and sequence tracks were evaluated.", "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }