Fisher-Observable Latent State Training / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.3787969872355461
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.07372267078608274
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.020728168543428183
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.01982933672843501,
 33      "std": 0.009734209738742424,
 34      "per_seed": [
 35        0.03869374096393585,
 36        0.017570657655596733,
 37        0.019120153039693832,
 38        0.017528541386127472,
 39        0.024672934785485268,
 40        0.026707936078310013,
 41        0.007166414521634579,
 42        0.007174315396696329
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.022319517272990197,
 49    "std": 0.006939298939271748,
 50    "per_seed": [
 51      0.021349677816033363,
 52      0.01931118033826351,
 53      0.024120593443512917,
 54      0.02635839208960533,
 55      0.02215566113591194,
 56      0.03315800800919533,
 57      0.00711813336238265,
 58      0.024984491989016533
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 0.0024901805445551872,
 64    "idea_wins": 3,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      -0.01734406314790249,
 68      0.0017405226826667786,
 69      0.005000440403819084,
 70      0.00882985070347786,
 71      -0.002517273649573326,
 72      0.006450071930885315,
 73      -4.828115925192833e-05,
 74      0.017810176592320204
 75    ],
 76    "p_value": 0.5164,
 77    "mde": 0.008493995040048899,
 78    "mde_rel_pct": 42.8354975074311,
 79    "verdict": "no significant win",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "type": "trained_model_fisher_signature",
 84    "values": {
 85      "baseline": {
 86        "test_mse_observed": 0.026402993127703667,
 87        "fisher_lambda_min_predicted": 0.002320722443982959,
 88        "fisher_lambda_max_predicted": 0.013881671242415905,
 89        "condition_predicted": 5.982430458068848
 90      },
 91      "idea": {
 92        "test_mse_observed": 0.026506217196583748,
 93        "fisher_lambda_min_predicted": 0.002401451813057065,
 94        "fisher_lambda_max_predicted": 0.014348627999424934,
 95        "condition_predicted": 5.977519512176514
 96      },
 97      "confirmed": true
 98    },
 99    "confirmed_definition": "true only when trained idea increases mean predicted lambda_min and lowers condition number"
100  },
101  "idea_sweep": [
102    {
103      "alpha": 0.0001,
104      "full": {
105        "mean": 0.022319517272990197,
106        "std": 0.006939298939271748,
107        "per_seed": [
108          0.021349677816033363,
109          0.01931118033826351,
110          0.024120593443512917,
111          0.02635839208960533,
112          0.02215566113591194,
113          0.03315800800919533,
114          0.00711813336238265,
115          0.024984491989016533
116        ],
117        "n": 8
118      }
119    },
120    {
121      "alpha": 0.0003,
122      "full": {
123        "mean": 0.022440086351707578,
124        "std": 0.006982779445894687,
125        "per_seed": [
126          0.021398302167654037,
127          0.019377948716282845,
128          0.024245459586381912,
129          0.02637545019388199,
130          0.02218914031982422,
131          0.03333896026015282,
132          0.00717194564640522,
133          0.025423483923077583
134        ],
135        "n": 8
136      }
137    },
138    {
139      "alpha": 0.001,
140      "full": {
141        "mean": 0.022734143771231174,
142        "std": 0.0071032232805968085,
143        "per_seed": [
144          0.021538222208619118,
145          0.01957051269710064,
146          0.024685418233275414,
147          0.026499632745981216,
148          0.022289788350462914,
149          0.034026920795440674,
150          0.007357491180300713,
151          0.02590516395866871
152        ],
153        "n": 8
154      }
155    }
156  ],
157  "protocol_notes": "Dynamics is the structural match: controlled pendulum multi-step rollout. Same rnn_small, data, epochs, batch, and baseline-selected LR; only Fisher loss differs."
158}