Braid-Monodromy Set State / report_bench_2026-09-04T212155.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 10, "verdict": "Implemented Braid-Monodromy transport with skew-symmetric generators and Cayley updates as a matched modification of the dynamics RNN system. The trained-model signature confirmed zero skew residual and 8.0e-8 mean transport-only norm drift. However, the idea had higher test MSE than the tuned baseline on all 8 seeds: 0.0016795 versus 0.0005452, paired delta +0.0011343, permutation p=0.0081; therefore the mechanism is numerically valid but gives no benchmark win.", "metrics": { "baseline": "dynamics/rnn_small; 8-seed tuned sweep best lr=0.01; test MSE mean=0.0005451723, std=0.0002036184; per_seed=[0.0004930912,0.0004765945,0.0004673649,0.0010376222,0.0005116638,0.0002723346,0.0005571768,0.0005455301]", "idea": "BraidDynamics; 8-seed idea sweep best lr=0.003; test MSE mean=0.0016794731, std=0.0005899470; per_seed=[0.0020148745,0.0009998990,0.0017773953,0.0030421584,0.0015461834,0.0013431071,0.0013974033,0.0013147637]", "paired_delta": "idea - baseline = +0.0011343008; idea wins=0/8; p=0.0081; verdict=idea worse (significant)" }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0021690295106964186 }, { "cfg": { "lr": 0.003 }, "mean": 0.001074885185516905 }, { "cfg": { "lr": 0.01 }, "mean": 0.00054517226817552 } ], "full": { "mean": 0.00054517226817552, "std": 0.00020361842727135583, "per_seed": [ 0.0004930912400595844, 0.0004765945195686072, 0.0004673648509196937, 0.0010376222198829055, 0.000511663849465549, 0.00027233464061282575, 0.0005571767687797546, 0.0005455300561152399 ], "n": 8 }, "protocol_note": "8 paired seeds; sweep grid shared with idea; baseline is canonical rnn_small." }, "idea": { "mean": 0.0016794730763649568, "std": 0.0005899470001703297, "per_seed": [ 0.00201487448066473, 0.0009998989989981055, 0.0017773952567949891, 0.0030421584378927946, 0.001546183368191123, 0.001343107083812356, 0.0013974033063277602, 0.0013147636782377958 ], "n": 8, "cfg": { "lr": 0.003 } }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.002948012319393457, "per_seed": [ 0.003085256787016988, 0.002189615275710821, 0.0050039333291351795, 0.0036421462427824736, 0.0022776462137699127, 0.001872690161690116, 0.0024267486296594143, 0.003086061915382743 ] }, { "cfg": { "lr": 0.003 }, "mean": 0.0016794730763649568, "per_seed": [ 0.00201487448066473, 0.0009998989989981055, 0.0017773952567949891, 0.0030421584378927946, 0.001546183368191123, 0.001343107083812356, 0.0013974033063277602, 0.0013147636782377958 ] }, { "cfg": { "lr": 0.01 }, "mean": 0.0018830011467798613, "per_seed": [ 0.0020360236521810293, 0.0009326969156973064, 0.00206544017419219, 0.0026314484421163797, 0.0011524695437401533, 0.0020754176657646894, 0.001974960323423147, 0.002195552457123995 ] } ], "comparison": { "delta_mean": 0.0011343008081894368, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0015217832406051457, 0.0005233044794294983, 0.0013100304058752954, 0.002004536218009889, 0.001034519518725574, 0.0010707724431995302, 0.0008402265375480057, 0.000769233622122556 ], "p_value": 0.0081, "mde": 0.0003928773272119451, "mde_rel_pct": 72.06480412636415, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted": "skew residual near zero and transport-only norm drift near zero", "observed_mean_skew_residual": 0.0, "observed_mean_transport_norm_drift": 7.996568260337789e-08, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 run_bench.py", "files": [ "braid_bench_adapter.py", "run_bench.py", "bench_report.json" ], "limitations": "Only the built-in dynamics pendulum track was tested; the benchmark input is not an unordered multi-object configuration, so transfer of explicit braid exchange behavior was not directly evaluated. No vision, sequence, long-horizon rollout beyond the fixed dynamics target, or parameter/FLOP matching beyond the shared base-task protocol was tested.", "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }