Fisher-Observable Latent State Training / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.3787969872355461
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.07372267078608274
23 },
24 {
25 "cfg": {
26 "lr": 0.01
27 },
28 "mean": 0.020728168543428183
29 }
30 ],
31 "full": {
32 "mean": 0.01982933672843501,
33 "std": 0.009734209738742424,
34 "per_seed": [
35 0.03869374096393585,
36 0.017570657655596733,
37 0.019120153039693832,
38 0.017528541386127472,
39 0.024672934785485268,
40 0.026707936078310013,
41 0.007166414521634579,
42 0.007174315396696329
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.022319517272990197,
49 "std": 0.006939298939271748,
50 "per_seed": [
51 0.021349677816033363,
52 0.01931118033826351,
53 0.024120593443512917,
54 0.02635839208960533,
55 0.02215566113591194,
56 0.03315800800919533,
57 0.00711813336238265,
58 0.024984491989016533
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 0.0024901805445551872,
64 "idea_wins": 3,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 -0.01734406314790249,
68 0.0017405226826667786,
69 0.005000440403819084,
70 0.00882985070347786,
71 -0.002517273649573326,
72 0.006450071930885315,
73 -4.828115925192833e-05,
74 0.017810176592320204
75 ],
76 "p_value": 0.5164,
77 "mde": 0.008493995040048899,
78 "mde_rel_pct": 42.8354975074311,
79 "verdict": "no significant win",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "type": "trained_model_fisher_signature",
84 "values": {
85 "baseline": {
86 "test_mse_observed": 0.026402993127703667,
87 "fisher_lambda_min_predicted": 0.002320722443982959,
88 "fisher_lambda_max_predicted": 0.013881671242415905,
89 "condition_predicted": 5.982430458068848
90 },
91 "idea": {
92 "test_mse_observed": 0.026506217196583748,
93 "fisher_lambda_min_predicted": 0.002401451813057065,
94 "fisher_lambda_max_predicted": 0.014348627999424934,
95 "condition_predicted": 5.977519512176514
96 },
97 "confirmed": true
98 },
99 "confirmed_definition": "true only when trained idea increases mean predicted lambda_min and lowers condition number"
100 },
101 "idea_sweep": [
102 {
103 "alpha": 0.0001,
104 "full": {
105 "mean": 0.022319517272990197,
106 "std": 0.006939298939271748,
107 "per_seed": [
108 0.021349677816033363,
109 0.01931118033826351,
110 0.024120593443512917,
111 0.02635839208960533,
112 0.02215566113591194,
113 0.03315800800919533,
114 0.00711813336238265,
115 0.024984491989016533
116 ],
117 "n": 8
118 }
119 },
120 {
121 "alpha": 0.0003,
122 "full": {
123 "mean": 0.022440086351707578,
124 "std": 0.006982779445894687,
125 "per_seed": [
126 0.021398302167654037,
127 0.019377948716282845,
128 0.024245459586381912,
129 0.02637545019388199,
130 0.02218914031982422,
131 0.03333896026015282,
132 0.00717194564640522,
133 0.025423483923077583
134 ],
135 "n": 8
136 }
137 },
138 {
139 "alpha": 0.001,
140 "full": {
141 "mean": 0.022734143771231174,
142 "std": 0.0071032232805968085,
143 "per_seed": [
144 0.021538222208619118,
145 0.01957051269710064,
146 0.024685418233275414,
147 0.026499632745981216,
148 0.022289788350462914,
149 0.034026920795440674,
150 0.007357491180300713,
151 0.02590516395866871
152 ],
153 "n": 8
154 }
155 }
156 ],
157 "protocol_notes": "Dynamics is the structural match: controlled pendulum multi-step rollout. Same rnn_small, data, epochs, batch, and baseline-selected LR; only Fisher loss differs."
158}