Poisson-Kernel Random Attractor Regularizer / report_bench_2026-08-31T112633.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Implemented the Poisson-Kernel hidden-state regularizer on the registered dynamics/rnn_small benchmark. The best idea setting had mean test MSE 0.000519053 versus the tuned baseline's 0.000519486, but paired delta was -4.33e-7 with permutation p=0.9775, so there was no significant task-metric win. Hidden-state spread decreased slightly, while phase KL to the estimated Poisson density worsened, so the predicted mechanism was not confirmed.", "metrics": { "baseline": "mean test MSE 0.0005194859513721894, std 0.0001693891077925739, best_cfg [0.006,0.0]", "idea": "mean test MSE 0.0005190527626837138, std 0.00016528570799671346, best_cfg [0.006,0.02], paired delta -4.3318868847563863e-07, p=0.9775" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_pk.py", "files": [ "bench_pk.py", "bench_report.json" ], "limitations": "Only the registered dynamics track was tested. The estimator uses finite deterministic affine disk maps rather than full random Blaschke products; no long-rollout calibration or larger ensembles were tested.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": [ 0.006, 0.0 ], "sweep": [ { "cfg": [ 0.001, 0.0 ], "mean": 0.0015310924500226974 }, { "cfg": [ 0.001, 0.0001 ], "mean": 0.0015161814808379859 }, { "cfg": [ 0.003, 0.0 ], "mean": 0.0008559521666029468 }, { "cfg": [ 0.003, 0.0001 ], "mean": 0.0008401070081163198 }, { "cfg": [ 0.006, 0.0 ], "mean": 0.0005687399534508586 }, { "cfg": [ 0.006, 0.0001 ], "mean": 0.000572658478631638 } ], "full": { "mean": 0.0005194859513721894, "std": 0.0001693891077925739, "per_seed": [ 0.0005914251087233424, 0.0007362987380474806, 0.00035295303678140044, 0.0005942829302512109, 0.0002958264376502484, 0.0005069610779173672, 0.00032333534909412265, 0.0007548049325123429 ], "n": 8 } }, "idea": { "mean": 0.0005190527626837138, "std": 0.00016528570799671346, "per_seed": [ 0.0005434696213342249, 0.0007388722151517868, 0.00032320327591151, 0.000590407638810575, 0.00030803284607827663, 0.0005485645961016417, 0.0003513387346174568, 0.0007485331734642386 ], "n": 8 }, "comparison": { "delta_mean": -4.3318868847563863e-07, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ -4.795548738911748e-05, 2.573477104306221e-06, -2.974976086989045e-05, -3.8752914406359196e-06, 1.2206408428028226e-05, 4.1603518184274435e-05, 2.8003385523334146e-05, -6.271759048104286e-06 ], "p_value": 0.9775, "mde": 2.429226669015372e-05, "mde_rel_pct": 4.67621244154673, "verdict": "no measurable effect", "system_worked": false, "idea_cfg_sweep": [ { "cfg": [ 0.006, 0.005 ], "result": { "mean": 0.0005225717504799832, "std": 0.0001655050714685202, "per_seed": [ 0.0005708694807253778, 0.0007390371174551547, 0.0003488508809823543, 0.0006015055696479976, 0.00029773524147458375, 0.0005109026096761227, 0.0003550440014805645, 0.0007566291023977101 ], "n": 8 } }, { "cfg": [ 0.006, 0.01 ], "result": { "mean": 0.0005221629617153667, "std": 0.00016535253075975801, "per_seed": [ 0.0005585983162745833, 0.0007406040094792843, 0.0003366354794707149, 0.0005960776470601559, 0.0003025302430614829, 0.0005268516251817346, 0.00035928949364461005, 0.0007567168795503676 ], "n": 8 } }, { "cfg": [ 0.006, 0.02 ], "result": { "mean": 0.0005190527626837138, "std": 0.00016528570799671346, "per_seed": [ 0.0005434696213342249, 0.0007388722151517868, 0.00032320327591151, 0.000590407638810575, 0.00030803284607827663, 0.0005485645961016417, 0.0003513387346174568, 0.0007485331734642386 ], "n": 8 } } ] }, "mechanism_signature": { "signature": { "prediction": "PK training should reduce recurrent ensemble spread and phase KL to P_x relative to unregularized rnn_small", "observed_baseline": { "pairwise_hidden_distance": 1.643260881304741, "phase_kl_to_Px": 0.6458364666976848, "phase_kl_to_uniform": 0.6656140625776023 }, "observed_idea": { "pairwise_hidden_distance": 1.6309331208467484, "phase_kl_to_Px": 2.571629603478935, "phase_kl_to_uniform": 2.7556800191465998 }, "confirmed": false }, "idea_cfg": [ 0.006, 0.02 ], "baseline_grid": [ [ 0.001, 0.0 ], [ 0.001, 0.0001 ], [ 0.003, 0.0 ], [ 0.003, 0.0001 ], [ 0.006, 0.0 ], [ 0.006, 0.0001 ] ], "idea_grid": [ [ 0.006, 0.005 ], [ 0.006, 0.01 ], [ 0.006, 0.02 ] ] } }, "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }