Decision-Oriented Optimum Preservation / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 12
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 12
17 },
18 "mean": 0.004298779065720737
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 12
24 },
25 "mean": 0.0034615940821822733
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 12
31 },
32 "mean": 0.0018282315868418664
33 }
34 ],
35 "full": {
36 "mean": 0.002105819425196387,
37 "std": 0.000389436566226016,
38 "per_seed": [
39 0.002004395006224513,
40 0.001437882543541491,
41 0.0015748648438602686,
42 0.002295783953741193,
43 0.0024020641576498747,
44 0.0024898042902350426,
45 0.0020851334556937218,
46 0.0025566271506249905
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.7633235901594162,
53 "std": 0.05257852286312429,
54 "per_seed": [
55 0.746772825717926,
56 0.7365002632141113,
57 0.8016765713691711,
58 0.886947512626648,
59 0.735880434513092,
60 0.7473666071891785,
61 0.7420515418052673,
62 0.7093929648399353
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": 0.7612177707342198,
68 "idea_wins": 0,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 0.7447684307117015,
72 0.7350623806705698,
73 0.8001017065253109,
74 0.8846517286729068,
75 0.7334783703554422,
76 0.7448768028989434,
77 0.7399664083495736,
78 0.7068363376893103
79 ],
80 "p_value": 0.0081,
81 "mde": 0.04703323792024009,
82 "mde_rel_pct": 2233.4886532758533,
83 "verdict": "idea worse (significant)",
84 "system_worked": false
85 },
86 "mechanism_signature": {
87 "prediction": "decision-aware training reduces surrogate optimum displacement relative to MSE-only while preserving trajectory fit",
88 "measured_on_trained_models": true,
89 "decision_probe": {
90 "contexts": 32,
91 "multistart": 5,
92 "bounds": [
93 -1.5,
94 1.5
95 ]
96 },
97 "confirmed": false,
98 "note": "Standard task MSE is primary; probe is diagnostic only."
99 },
100 "idea_sweep": [
101 {
102 "cfg": {
103 "lr": 0.001,
104 "epochs": 12
105 },
106 "result": {
107 "mean": 0.7633235901594162,
108 "std": 0.05257852286312429,
109 "per_seed": [
110 0.746772825717926,
111 0.7365002632141113,
112 0.8016765713691711,
113 0.886947512626648,
114 0.735880434513092,
115 0.7473666071891785,
116 0.7420515418052673,
117 0.7093929648399353
118 ],
119 "n": 8
120 }
121 },
122 {
123 "cfg": {
124 "lr": 0.003,
125 "epochs": 12
126 },
127 "result": {
128 "mean": 0.7637511864304543,
129 "std": 0.05106457675677259,
130 "per_seed": [
131 0.748903214931488,
132 0.7398125529289246,
133 0.802194356918335,
134 0.8831914663314819,
135 0.7348660230636597,
136 0.7470683455467224,
137 0.7429152727127075,
138 0.7110582590103149
139 ],
140 "n": 8
141 }
142 },
143 {
144 "cfg": {
145 "lr": 0.006,
146 "epochs": 12
147 },
148 "result": {
149 "mean": 0.7635712027549744,
150 "std": 0.050801253101102256,
151 "per_seed": [
152 0.7507007122039795,
153 0.7397510409355164,
154 0.8021869659423828,
155 0.8825896382331848,
156 0.7341564297676086,
157 0.7471616268157959,
158 0.7382707595825195,
159 0.7137524485588074
160 ],
161 "n": 8
162 }
163 }
164 ],
165 "selected_idea_cfg": {
166 "lr": 0.001,
167 "epochs": 12
168 }
169}