Lyapunov-Budgeted Neural MPPI / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "penalty": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "penalty": 0.0
 17        },
 18        "mean": 0.0012329648743616417
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "penalty": 0.0
 24        },
 25        "mean": 0.0007095315813785419
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "penalty": 0.0
 31        },
 32        "mean": 0.00044968911970499903
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.001,
 37          "penalty": 0.01
 38        },
 39        "mean": 0.0012329648743616417
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.003,
 44          "penalty": 0.01
 45        },
 46        "mean": 0.0007095315813785419
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.006,
 51          "penalty": 0.01
 52        },
 53        "mean": 0.00044968911970499903
 54      },
 55      {
 56        "cfg": {
 57          "lr": 0.001,
 58          "penalty": 0.05
 59        },
 60        "mean": 0.0012329648743616417
 61      },
 62      {
 63        "cfg": {
 64          "lr": 0.003,
 65          "penalty": 0.05
 66        },
 67        "mean": 0.0007095315813785419
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.006,
 72          "penalty": 0.05
 73        },
 74        "mean": 0.00044968911970499903
 75      }
 76    ],
 77    "full": {
 78      "mean": 0.0003913900891348021,
 79      "std": 0.00014032323399353638,
 80      "per_seed": [
 81        0.0004547900171019137,
 82        0.0005691215046681464,
 83        0.0002539993729442358,
 84        0.0005208455841057003,
 85        0.00024503248278051615,
 86        0.0003696440835483372,
 87        0.00018239273049402982,
 88        0.0005352949374355376
 89      ],
 90      "n": 8
 91    }
 92  },
 93  "idea": {
 94    "mean": 0.00039220192411448807,
 95    "std": 0.00014200637399208092,
 96    "per_seed": [
 97      0.0004564015252981335,
 98      0.0005712365382350981,
 99      0.0002526967437006533,
100      0.0005346102407202125,
101      0.00024299033975694329,
102      0.0003629707789514214,
103      0.00018514976545702666,
104      0.0005315594607964158
105    ],
106    "n": 8
107  },
108  "comparison": {
109    "delta_mean": 8.118349796859547e-07,
110    "idea_wins": 4,
111    "n_pairs": 8,
112    "per_seed_diffs": [
113      1.611508196219802e-06,
114      2.1150335669517517e-06,
115      -1.3026292435824871e-06,
116      1.3764656614512205e-05,
117      -2.042143023572862e-06,
118      -6.673304596915841e-06,
119      2.7570349629968405e-06,
120      -3.735476639121771e-06
121    ],
122    "p_value": 0.7761,
123    "mde": 5.127379977124008e-06,
124    "mde_rel_pct": 1.3100433862437537,
125    "verdict": "no measurable effect",
126    "system_worked": false
127  },
128  "idea_sweep": [
129    {
130      "cfg": {
131        "lr": 0.006,
132        "penalty": 0.01
133      },
134      "mean": 0.00039220192411448807,
135      "full": {
136        "mean": 0.00039220192411448807,
137        "std": 0.00014200637399208092,
138        "per_seed": [
139          0.0004564015252981335,
140          0.0005712365382350981,
141          0.0002526967437006533,
142          0.0005346102407202125,
143          0.00024299033975694329,
144          0.0003629707789514214,
145          0.00018514976545702666,
146          0.0005315594607964158
147        ],
148        "n": 8
149      }
150    },
151    {
152      "cfg": {
153        "lr": 0.006,
154        "penalty": 0.05
155      },
156      "mean": 0.00040307095150637906,
157      "full": {
158        "mean": 0.00040307095150637906,
159        "std": 0.0001521574206836284,
160        "per_seed": [
161          0.00046396625111810863,
162          0.0005876322975382209,
163          0.0002573703823145479,
164          0.0006015090038999915,
165          0.00024178977764677256,
166          0.0003508162626530975,
167          0.0001956480264198035,
168          0.00052583561046049
169        ],
170        "n": 8
171      }
172    },
173    {
174      "cfg": {
175        "lr": 0.002,
176        "penalty": 0.01
177      },
178      "mean": 0.0009269535221392289,
179      "full": {
180        "mean": 0.0009269535221392289,
181        "std": 0.0002406851422080141,
182        "per_seed": [
183          0.0007094648899510503,
184          0.0010170000605285168,
185          0.000680267927236855,
186          0.0011570906499400735,
187          0.0006066791247576475,
188          0.0008407899877056479,
189          0.0010742566082626581,
190          0.001330078928731382
191        ],
192        "n": 8
193      }
194    }
195  ],
196  "protocol_notes": "Dynamics is the structurally matched control/stability track; identical rnn_small systems and datasets, only training loss differs.",
197  "mechanism_signature": {
198    "prediction": "Lyapunov penalty lowers observed contraction-violation rate",
199    "predicted_direction": "lower",
200    "baseline_violation_rate": 0.8133333712816239,
201    "idea_violation_rate": 0.8095833584666252,
202    "baseline_mean_abs_prediction_over_theta": 1.1201488196849823,
203    "idea_mean_abs_prediction_over_theta": 1.1020578742027283,
204    "rho": 0.94,
205    "confirmed": true
206  },
207  "idea_selected_cfg": {
208    "lr": 0.006,
209    "penalty": 0.01
210  }
211}