Delay-Kernel Bifurcation Scheduler / report_bench_2026-08-31T120551.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Implemented the delay-kernel scheduler on the structurally matched dynamics track using the shared rnn_small architecture and a root-controlled fractional-delay training intervention. The mechanism signature was confirmed: predicted crossing tau=0.6046, final scheduled tau=0.7027, and observed characteristic root -0.3933. The task metric did not improve: baseline MSE 0.00077124 versus idea MSE 0.00077674, paired delta +0.00000550 and permutation p=0.8404; therefore the idea did not win.", "metrics": { "baseline": "dynamics/rnn_small; best lr=0.006, weight_decay=0.0001, 18 epochs; test MSE mean=0.0007712391, std=0.0001576920", "idea": "best scheduler tau0=0.1, gamma=0.08, target=-0.05; test MSE mean=0.0007767368, std=0.0001517097; paired delta=+0.0000054977, p=0.8404, 4/8 wins" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 delay_bench.py", "files": [ "delay_bench.py", "bench_report.json" ], "limitations": "Only the built-in dynamics track was tested. Longer horizons, alternative delay kernels, explicit learned Jacobian-vector-product gain estimation, validation-triggered rollback, and deliberate post-crossing oscillatory targets were not tested.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 18, "wd": 0.0001 }, "full": { "mean": 0.0007712390506640077, "std": 0.00015769195775709773, "per_seed": [ 0.0006971143302507699, 0.0008527055033482611, 0.0005140206776559353, 0.0009294842020608485, 0.0005480053368955851, 0.0008613452082499862, 0.0008049127063713968, 0.0009623244404792786 ], "n": 8 }, "sweep": [ { "cfg": { "lr": 0.0015, "epochs": 18, "wd": 0.0 }, "mean": 0.0016401863540522754 }, { "cfg": { "lr": 0.0015, "epochs": 18, "wd": 0.0001 }, "mean": 0.0016229975590249524 }, { "cfg": { "lr": 0.003, "epochs": 18, "wd": 0.0 }, "mean": 0.00105226032610517 }, { "cfg": { "lr": 0.003, "epochs": 18, "wd": 0.0001 }, "mean": 0.0010288678167853504 }, { "cfg": { "lr": 0.006, "epochs": 18, "wd": 0.0 }, "mean": 0.0007705322786932811 }, { "cfg": { "lr": 0.006, "epochs": 18, "wd": 0.0001 }, "mean": 0.0007483311783289537 } ] }, "idea": { "mean": 0.0007767367897031363, "std": 0.00015170973680853395, "per_seed": [ 0.0007888000109232962, 0.0009194124140776694, 0.0004823579511139542, 0.0008317303727380931, 0.0005752710276283324, 0.0008502130513079464, 0.0008313465514220297, 0.000934762938413769 ], "n": 8 }, "comparison": { "delta_mean": 5.497739039128646e-06, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 9.168568067252636e-05, 6.670691072940826e-05, -3.16627265419811e-05, -9.775382932575534e-05, 2.726569073274731e-05, -1.113215694203972e-05, 2.6433845050632954e-05, -2.75615065509558e-05 ], "p_value": 0.8404, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "predicted_tau_c": 0.6045997880780726, "final_tau": 0.7026815647163405, "observed_final_root": -0.39328237958536605, "predicted_omega": 1.7320508075688772, "observed_sensitivity_peak_token": 6, "confirmed": true }, "idea_sweep": [ { "tau0": 0.1, "gamma": 0.08, "mean": 0.0007767367897031363 }, { "tau0": 0.6, "gamma": 0.08, "mean": 0.0007824423082638532 }, { "tau0": 0.6, "gamma": 0.16, "mean": 0.0007843925777706318 } ], "custom_track": null }, "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }