Mean-Square Proximal Relaxation Optimizer / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.0002686133266252
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 2.2429956516134553e-05
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 1.2719097412627889e-05
29 }
30 ],
31 "full": {
32 "mean": 1.3684802866009704e-05,
33 "std": 2.4297331089709535e-06,
34 "per_seed": [
35 1.0965275578200817e-05,
36 1.3063688129477669e-05,
37 1.363205592497252e-05,
38 1.321537001786055e-05,
39 1.694267484708689e-05,
40 1.790331407391932e-05,
41 1.3341849808057304e-05,
42 1.0414194548502564e-05
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.0005339367999113165,
49 "std": 0.0003344099304737304,
50 "per_seed": [
51 0.00038349704118445516,
52 0.0002837758220266551,
53 0.00047679623821750283,
54 0.000840833701658994,
55 0.00030266467365436256,
56 0.00031309283804148436,
57 0.0012979843886569142,
58 0.0003728496958501637
59 ],
60 "n": 8,
61 "chosen_cfg": {
62 "lr": 0.006,
63 "alpha": 0.75
64 },
65 "sweep": [
66 {
67 "cfg": {
68 "lr": 0.001,
69 "alpha": 0.25
70 },
71 "mean": 0.5652050226926804,
72 "per_seed": [
73 0.5019805431365967,
74 0.6064469218254089,
75 0.5146586894989014,
76 0.6377339363098145
77 ]
78 },
79 {
80 "cfg": {
81 "lr": 0.003,
82 "alpha": 0.5
83 },
84 "mean": 0.05728436540812254,
85 "per_seed": [
86 0.0478343702852726,
87 0.05792839825153351,
88 0.03978803753852844,
89 0.08358665555715561
90 ]
91 },
92 {
93 "cfg": {
94 "lr": 0.006,
95 "alpha": 0.75
96 },
97 "mean": 0.0004962257007719018,
98 "per_seed": [
99 0.00038349704118445516,
100 0.0002837758220266551,
101 0.00047679623821750283,
102 0.000840833701658994
103 ]
104 }
105 ]
106 },
107 "comparison": {
108 "delta_mean": 0.0005202519970453068,
109 "idea_wins": 0,
110 "n_pairs": 8,
111 "per_seed_diffs": [
112 0.00037253176560625434,
113 0.0002707121338971774,
114 0.0004631641822925303,
115 0.0008276183316411334,
116 0.00028572199880727567,
117 0.00029518952396756504,
118 0.001284642538848857,
119 0.00036243550130166113
120 ],
121 "p_value": 0.0081,
122 "mde": 0.00029926510858487807,
123 "mde_rel_pct": 2186.8426715023597,
124 "verdict": "idea worse (significant)",
125 "system_worked": false
126 },
127 "mechanism_signature": {
128 "prediction": "relaxation damps stochastic block-response updates approximately linearly in alpha",
129 "predicted_alpha": 0.75,
130 "observed_update_rms_mean": 0.0026733302263543613,
131 "observed_update_std_mean": 0.0019501892436788798,
132 "predicted_vs_observed_relation": "measured from trained rnn_small updates; no analytic/toy data used",
133 "confirmed": false,
134 "confirmation_note": "Not quantitatively confirmed: only one alpha was evaluated in the final trained-model signature, so linear alpha scaling was not tested."
135 },
136 "custom_track": null
137}