Value-Gradient Trajectory Collocation / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.001,
10 "alpha": 0.7,
11 "sigma": 0.035
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.001,
17 "alpha": 0.7,
18 "sigma": 0.035
19 },
20 "mean": 0.8283906430006027
21 },
22 {
23 "cfg": {
24 "lr": 0.003,
25 "alpha": 0.7,
26 "sigma": 0.035
27 },
28 "mean": 0.8293724805116653
29 },
30 {
31 "cfg": {
32 "lr": 0.01,
33 "alpha": 0.7,
34 "sigma": 0.035
35 },
36 "mean": 0.8328554034233093
37 }
38 ],
39 "full": {
40 "mean": 0.787501223385334,
41 "std": 0.06788976443931306,
42 "per_seed": [
43 0.8156408071517944,
44 0.7547019720077515,
45 0.8308971524238586,
46 0.9123226404190063,
47 0.7518438100814819,
48 0.7541651725769043,
49 0.8133183717727661,
50 0.6671198606491089
51 ],
52 "n": 8
53 }
54 },
55 "idea": {
56 "mean": 0.7941433116793633,
57 "std": 0.07100903064007838,
58 "per_seed": [
59 0.8096513748168945,
60 0.803184986114502,
61 0.8362289667129517,
62 0.9341802597045898,
63 0.7649334669113159,
64 0.7608115077018738,
65 0.7781288623809814,
66 0.6660270690917969
67 ],
68 "n": 8
69 },
70 "comparison": {
71 "delta_mean": 0.006642088294029236,
72 "idea_wins": 3,
73 "n_pairs": 8,
74 "per_seed_diffs": [
75 -0.005989432334899902,
76 0.04848301410675049,
77 0.005331814289093018,
78 0.021857619285583496,
79 0.013089656829833984,
80 0.006646335124969482,
81 -0.03518950939178467,
82 -0.0010927915573120117
83 ],
84 "p_value": 0.4855,
85 "mde": 0.0199747259489214,
86 "mde_rel_pct": 2.5364691959529213,
87 "verdict": "no measurable effect",
88 "system_worked": false
89 },
90 "mechanism_signature": {
91 "idea_config": {
92 "lr": 0.001,
93 "alpha": 0.7,
94 "sigma": 0.035
95 },
96 "idea_sweep": [
97 {
98 "cfg": {
99 "lr": 0.001,
100 "alpha": 0.7,
101 "sigma": 0.035
102 },
103 "result": {
104 "mean": 0.7941433116793633,
105 "std": 0.07100903064007838,
106 "per_seed": [
107 0.8096513748168945,
108 0.803184986114502,
109 0.8362289667129517,
110 0.9341802597045898,
111 0.7649334669113159,
112 0.7608115077018738,
113 0.7781288623809814,
114 0.6660270690917969
115 ],
116 "n": 8
117 }
118 },
119 {
120 "cfg": {
121 "lr": 0.003,
122 "alpha": 0.7,
123 "sigma": 0.035
124 },
125 "result": {
126 "mean": 0.8040007650852203,
127 "std": 0.07647255737581943,
128 "per_seed": [
129 0.8088628649711609,
130 0.8104173541069031,
131 0.8454757928848267,
132 0.9598079919815063,
133 0.7718257308006287,
134 0.7834799289703369,
135 0.7857349514961243,
136 0.6664015054702759
137 ],
138 "n": 8
139 }
140 },
141 {
142 "cfg": {
143 "lr": 0.01,
144 "alpha": 0.7,
145 "sigma": 0.035
146 },
147 "result": {
148 "mean": 0.8066116720438004,
149 "std": 0.07406785573886294,
150 "per_seed": [
151 0.811928391456604,
152 0.8005879521369934,
153 0.8522548079490662,
154 0.9512794017791748,
155 0.7587114572525024,
156 0.7952184677124023,
157 0.8118025064468384,
158 0.6711103916168213
159 ],
160 "n": 8
161 }
162 }
163 ],
164 "sampler": "feedback pendulum rollout + Gaussian exploration + uniform reservoir",
165 "mechanism_signature": {
166 "prediction": "gradient sign predicts which bounded control increases model-predicted next angle",
167 "observed_sign_agreement": 1.0,
168 "predicted_threshold": 0.75,
169 "confirmed": true
170 },
171 "protocol_note": "8 paired seeds; baseline and idea share rnn_small, Adam, epochs, batch, and lr union."
172 }
173}