Observable-Reduced Neural World Model / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 12
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 12
17 },
18 "mean": 0.0010860307957045734
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 12
24 },
25 "mean": 0.0005809691647300497
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 12
31 },
32 "mean": 0.0002912725685746409
33 }
34 ],
35 "full": {
36 "mean": 0.0002669833438631031,
37 "std": 8.681528355373122e-05,
38 "per_seed": [
39 0.00031876337016001344,
40 0.0002849859884008765,
41 0.00017326572560705245,
42 0.0003880751901306212,
43 0.00033014125074259937,
44 0.0003085587522946298,
45 0.00010380324238212779,
46 0.000228273231186904
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "best_cfg": {
53 "lr": 0.006,
54 "epochs": 12,
55 "penalty": 0.0
56 },
57 "sweep": [
58 {
59 "cfg": {
60 "lr": 0.001,
61 "epochs": 12,
62 "penalty": 0.0
63 },
64 "mean": 1.0584739413843636e-06,
65 "per_seed": [
66 1.0828274525920278e-06,
67 1.0643407222232781e-06,
68 1.100200734072132e-06,
69 1.1011246670022956e-06,
70 1.0659464351192582e-06,
71 1.0385464292994584e-06,
72 1.0149252602786873e-06,
73 9.99879830487771e-07
74 ]
75 },
76 {
77 "cfg": {
78 "lr": 0.003,
79 "epochs": 12,
80 "penalty": 0.0
81 },
82 "mean": 7.993562256558562e-08,
83 "per_seed": [
84 6.861665013957463e-08,
85 7.364582188529312e-08,
86 9.95038575979379e-08,
87 8.163866027643962e-08,
88 8.44757082063552e-08,
89 8.488292024821931e-08,
90 7.652040068251154e-08,
91 7.020096148835364e-08
92 ]
93 },
94 {
95 "cfg": {
96 "lr": 0.006,
97 "epochs": 12,
98 "penalty": 0.0
99 },
100 "mean": 5.279662751433989e-08,
101 "per_seed": [
102 4.7656406820806296e-08,
103 5.733669539154107e-08,
104 5.804359304306672e-08,
105 4.7830777560875504e-08,
106 5.6010112103876963e-08,
107 5.760812271660143e-08,
108 4.9883055908139795e-08,
109 4.800425656981133e-08
110 ]
111 }
112 ],
113 "mean": 5.279662751433989e-08,
114 "std": 4.5298604585404984e-09,
115 "per_seed": [
116 4.7656406820806296e-08,
117 5.733669539154107e-08,
118 5.804359304306672e-08,
119 4.7830777560875504e-08,
120 5.6010112103876963e-08,
121 5.760812271660143e-08,
122 4.9883055908139795e-08,
123 4.800425656981133e-08
124 ],
125 "n": 8
126 },
127 "comparison": {
128 "delta_mean": -0.00026693054723558873,
129 "idea_wins": 8,
130 "n_pairs": 8,
131 "per_seed_diffs": [
132 -0.00031871571375319263,
133 -0.000284928651705485,
134 -0.00017320768201400938,
135 -0.0003880273593530603,
136 -0.0003300852406304955,
137 -0.0003085011441719132,
138 -0.00010375335932621965,
139 -0.0002282252269303342
140 ],
141 "p_value": 0.0081,
142 "mde": 7.760323964174408e-05,
143 "mde_rel_pct": 29.066697015202376,
144 "verdict": "idea better (significant)",
145 "system_worked": true
146 },
147 "mechanism_signature": {
148 "prediction": "second-order structured dynamics improves extrapolative neural prediction",
149 "trained_model_signature": {
150 "output_target_corr_mean": 0.9999999671294927,
151 "output_rmse_mean": 0.00022956307111599017,
152 "confirmed": false,
153 "note": "This built-in task has no aggregate two-compartment ground truth, so the exact cy=beta*r invariant cannot be quantitatively retested."
154 },
155 "structural_match": "dynamics stability/control"
156 }
157}