Directed-Path Synchronization Coupling / report_bench_2026-09-01T164146.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Implemented directed-path synchronization coupling as sparse directed coupling between four parallel GRU replicas on the registered dynamics track. The trained-model mechanism signature was confirmed: mean hidden disagreement decreased from 0.2476991 to 0.2377096, and the analytical threshold/rate check matched within 0.02%. However, the best idea configuration slightly worsened test MSE, with paired delta +0.0000674874 and permutation p=0.51155, so there was no significant task-level win.", "metrics": { "baseline": "Tuned uncoupled ParallelGRU, lr=0.006, eta=0: mean test MSE 0.006962434679735452 over 8 seeds.", "idea": "Directed n-1-edge star-coupled ParallelGRU, lr=0.006, eta=0.02: mean test MSE 0.007029922096990049 over 8 seeds; 3/8 paired wins." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "eta": 0.0 }, "sweep": [ { "cfg": { "lr": 0.0015, "eta": 0.0 }, "mean": 0.13071522302925587 }, { "cfg": { "lr": 0.003, "eta": 0.0 }, "mean": 0.01457755290903151 }, { "cfg": { "lr": 0.006, "eta": 0.0 }, "mean": 0.006850881385616958 } ], "full": { "mean": 0.006962434679735452, "std": 0.0022827002771013453, "per_seed": [ 0.007542507257312536, 0.00671812891960144, 0.006612597499042749, 0.0065302918665111065, 0.003842386417090893, 0.005645386874675751, 0.006438639014959335, 0.012369539588689804 ], "n": 8 } }, "idea": { "cfg": { "lr": 0.006, "eta": 0.02 }, "mean": 0.007029922096990049, "std": 0.002205360988149756, "per_seed": [ 0.007741106674075127, 0.006892496719956398, 0.006658521946519613, 0.0070778545923531055, 0.0037982785142958164, 0.005655689164996147, 0.0063418434001505375, 0.012073585763573647 ], "n": 8 }, "comparison": { "delta_mean": 6.748741725459695e-05, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0001985994167625904, 0.00017436780035495758, 4.592444747686386e-05, 0.000547562725841999, -4.410790279507637e-05, 1.0302290320396425e-05, -9.679561480789784e-05, -0.00029595382511615753 ], "p_value": 0.51155, "mde": 0.0002082852976156794, "mde_rel_pct": 2.991558372847722, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "math_check": { "gamma_G": 1.0, "L": 0.8, "threshold": 0.8, "rows": [ { "eta": 0.5, "predicted_slope": 0.6000000000000001, "observed_slope": 0.5999100179959524, "relative_error": 0.00014997000674606592 }, { "eta": 1.0, "predicted_slope": -0.3999999999999999, "observed_slope": -0.40004000533411915, "relative_error": 0.00010001333529810477 } ], "passed": true }, "idea_grid": [ { "cfg": { "lr": 0.006, "eta": 0.02 }, "result": { "mean": 0.007029922096990049, "std": 0.002205360988149756, "per_seed": [ 0.007741106674075127, 0.006892496719956398, 0.006658521946519613, 0.0070778545923531055, 0.0037982785142958164, 0.005655689164996147, 0.0063418434001505375, 0.012073585763573647 ], "n": 8 } }, { "cfg": { "lr": 0.006, "eta": 0.08 }, "result": { "mean": 0.00731758784968406, "std": 0.002062769628747506, "per_seed": [ 0.00851514283567667, 0.006746230181306601, 0.0072161052376031876, 0.009792596101760864, 0.004097180441021919, 0.005617870483547449, 0.005928367376327515, 0.010627210140228271 ], "n": 8 } }, { "cfg": { "lr": 0.006, "eta": 0.2 }, "result": { "mean": 0.008025791961699724, "std": 0.0031914273028467188, "per_seed": [ 0.009828031063079834, 0.006756746210157871, 0.0079221585765481, 0.015269015915691853, 0.004710389766842127, 0.005246929824352264, 0.005789421033114195, 0.00868364330381155 ], "n": 8 } } ], "trained_behavior": { "baseline_mean_disagreement": 0.2476990930736065, "idea_mean_disagreement": 0.23770959302783012 }, "prediction": "negative disagreement trend when eta*gamma_G exceeds L", "predicted_threshold": 0.8, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 directed_path_bench.py", "files": [ "directed_path_bench.py", "bench_report.json", "bench_stdout.txt" ], "limitations": "Only the registered dynamics track was tested, using 400 training and 400 test examples and 12 epochs. Longer horizons, larger replica counts, alternative strongly connected graphs, dense symmetric coupling, and wall-clock/FLOP measurements were not tested.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }