Target-Law Neural Stopping / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.004298779065720737
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.0034615940821822733
23 },
24 {
25 "cfg": {
26 "lr": 0.01
27 },
28 "mean": 0.0014865802077110857
29 }
30 ],
31 "full": {
32 "mean": 0.0014198302378645167,
33 "std": 0.00039839114901047844,
34 "per_seed": [
35 0.0009327387670055032,
36 0.0018641706556081772,
37 0.0010785290505737066,
38 0.0020708823576569557,
39 0.0009260809747502208,
40 0.0014055331703275442,
41 0.0016443432541564107,
42 0.001436363672837615
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.0024717978958506137,
49 "std": 0.0007936118334687486,
50 "per_seed": [
51 0.002402547048404813,
52 0.0013787858188152313,
53 0.0017380365170538425,
54 0.0026538888923823833,
55 0.0030015590600669384,
56 0.004137218929827213,
57 0.0024519104044884443,
58 0.0020104364957660437
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 0.001051967657986097,
64 "idea_wins": 1,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 0.0014698082813993096,
68 -0.00048538483679294586,
69 0.0006595074664801359,
70 0.0005830065347254276,
71 0.0020754780853167176,
72 0.002731685759499669,
73 0.0008075671503320336,
74 0.0005740728229284286
75 ],
76 "p_value": 0.01555,
77 "mde": 0.0008402727059255674,
78 "mde_rel_pct": 59.18120938101532,
79 "verdict": "idea worse (significant)",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "prediction": "trained hazard survival mixture has unit mass and sampled survival matches analytic survival",
84 "best_idea_cfg": {
85 "lr": 0.01
86 },
87 "idea_sweep": [
88 {
89 "cfg": {
90 "lr": 0.001
91 },
92 "result": {
93 "mean": 0.08380404743365943,
94 "std": 0.0393646116606085,
95 "per_seed": [
96 0.04978853464126587,
97 0.10612268000841141,
98 0.04249275103211403,
99 0.08974824845790863,
100 0.018612222746014595,
101 0.11003454029560089,
102 0.11337686330080032,
103 0.14025653898715973
104 ],
105 "n": 8
106 }
107 },
108 {
109 "cfg": {
110 "lr": 0.003
111 },
112 "result": {
113 "mean": 0.006190494023030624,
114 "std": 0.0020563597781498677,
115 "per_seed": [
116 0.004648992791771889,
117 0.005215768702328205,
118 0.0034577518235892057,
119 0.0046945130452513695,
120 0.006259342655539513,
121 0.007837923243641853,
122 0.007056461647152901,
123 0.010353198274970055
124 ],
125 "n": 8
126 }
127 },
128 {
129 "cfg": {
130 "lr": 0.01
131 },
132 "result": {
133 "mean": 0.0024717978958506137,
134 "std": 0.0007936118334687486,
135 "per_seed": [
136 0.002402547048404813,
137 0.0013787858188152313,
138 0.0017380365170538425,
139 0.0026538888923823833,
140 0.0030015590600669384,
141 0.004137218929827213,
142 0.0024519104044884443,
143 0.0020104364957660437
144 ],
145 "n": 8
146 }
147 }
148 ],
149 "sampled_seed0_metric": 0.002402547048404813,
150 "predicted_mean_expected_steps": 2.0301668643951416,
151 "observed_mean_expected_steps_from_weights": 1.0615553492680192,
152 "survival_mae_predicted_vs_sampled": 0.0016642366440966655,
153 "mixture_weight_mae_predicted_vs_sampled": 0.0014108350679278398,
154 "predicted_total_mass": 1.0044840574264526,
155 "confirmed": false
156 },
157 "notes": {
158 "epochs": 12,
159 "n_train": 400,
160 "n_test": 200,
161 "structural_match": "controlled damped pendulum dynamics; adaptive stopping over trajectory prefixes",
162 "baseline_method": "canonical bench train_model on final-prefix GRU prediction",
163 "idea_method": "same GRU predictor trained end-to-end with differentiable hazard mixture and compute penalty"
164 }
165}