Target-Law Neural Stopping / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.004298779065720737
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.0034615940821822733
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.0014865802077110857
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.0014198302378645167,
 33      "std": 0.00039839114901047844,
 34      "per_seed": [
 35        0.0009327387670055032,
 36        0.0018641706556081772,
 37        0.0010785290505737066,
 38        0.0020708823576569557,
 39        0.0009260809747502208,
 40        0.0014055331703275442,
 41        0.0016443432541564107,
 42        0.001436363672837615
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.0024717978958506137,
 49    "std": 0.0007936118334687486,
 50    "per_seed": [
 51      0.002402547048404813,
 52      0.0013787858188152313,
 53      0.0017380365170538425,
 54      0.0026538888923823833,
 55      0.0030015590600669384,
 56      0.004137218929827213,
 57      0.0024519104044884443,
 58      0.0020104364957660437
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 0.001051967657986097,
 64    "idea_wins": 1,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      0.0014698082813993096,
 68      -0.00048538483679294586,
 69      0.0006595074664801359,
 70      0.0005830065347254276,
 71      0.0020754780853167176,
 72      0.002731685759499669,
 73      0.0008075671503320336,
 74      0.0005740728229284286
 75    ],
 76    "p_value": 0.01555,
 77    "mde": 0.0008402727059255674,
 78    "mde_rel_pct": 59.18120938101532,
 79    "verdict": "idea worse (significant)",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "prediction": "trained hazard survival mixture has unit mass and sampled survival matches analytic survival",
 84    "best_idea_cfg": {
 85      "lr": 0.01
 86    },
 87    "idea_sweep": [
 88      {
 89        "cfg": {
 90          "lr": 0.001
 91        },
 92        "result": {
 93          "mean": 0.08380404743365943,
 94          "std": 0.0393646116606085,
 95          "per_seed": [
 96            0.04978853464126587,
 97            0.10612268000841141,
 98            0.04249275103211403,
 99            0.08974824845790863,
100            0.018612222746014595,
101            0.11003454029560089,
102            0.11337686330080032,
103            0.14025653898715973
104          ],
105          "n": 8
106        }
107      },
108      {
109        "cfg": {
110          "lr": 0.003
111        },
112        "result": {
113          "mean": 0.006190494023030624,
114          "std": 0.0020563597781498677,
115          "per_seed": [
116            0.004648992791771889,
117            0.005215768702328205,
118            0.0034577518235892057,
119            0.0046945130452513695,
120            0.006259342655539513,
121            0.007837923243641853,
122            0.007056461647152901,
123            0.010353198274970055
124          ],
125          "n": 8
126        }
127      },
128      {
129        "cfg": {
130          "lr": 0.01
131        },
132        "result": {
133          "mean": 0.0024717978958506137,
134          "std": 0.0007936118334687486,
135          "per_seed": [
136            0.002402547048404813,
137            0.0013787858188152313,
138            0.0017380365170538425,
139            0.0026538888923823833,
140            0.0030015590600669384,
141            0.004137218929827213,
142            0.0024519104044884443,
143            0.0020104364957660437
144          ],
145          "n": 8
146        }
147      }
148    ],
149    "sampled_seed0_metric": 0.002402547048404813,
150    "predicted_mean_expected_steps": 2.0301668643951416,
151    "observed_mean_expected_steps_from_weights": 1.0615553492680192,
152    "survival_mae_predicted_vs_sampled": 0.0016642366440966655,
153    "mixture_weight_mae_predicted_vs_sampled": 0.0014108350679278398,
154    "predicted_total_mass": 1.0044840574264526,
155    "confirmed": false
156  },
157  "notes": {
158    "epochs": 12,
159    "n_train": 400,
160    "n_test": 200,
161    "structural_match": "controlled damped pendulum dynamics; adaptive stopping over trajectory prefixes",
162    "baseline_method": "canonical bench train_model on final-prefix GRU prediction",
163    "idea_method": "same GRU predictor trained end-to-end with differentiable hazard mixture and compute penalty"
164  }
165}