Conditional spacetime-cluster sampler for rare neural trajectories / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 18
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 18
17 },
18 "mean": 0.0018504196486901492
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 18
24 },
25 "mean": 0.00105226032610517
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 18
31 },
32 "mean": 0.0007705322786932811
33 }
34 ],
35 "full": {
36 "mean": 0.0007801908141118474,
37 "std": 0.000154764005468824,
38 "per_seed": [
39 0.0007548112771473825,
40 0.0008833256433717906,
41 0.0005147535703144968,
42 0.0009292386239394546,
43 0.0005692947888746858,
44 0.0008575883111916482,
45 0.0007604749407619238,
46 0.0009720393572933972
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.0015543624467682093,
53 "std": 0.0004092240958003843,
54 "per_seed": [
55 0.0015412603970617056,
56 0.0010829424718394876,
57 0.0010121178347617388,
58 0.0014807143015787005,
59 0.001438742270693183,
60 0.0017851066077128053,
61 0.0016824236372485757,
62 0.0024115920532494783
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": 0.0007741716326563619,
68 "idea_wins": 0,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 0.0007864491199143231,
72 0.0001996168284676969,
73 0.000497364264447242,
74 0.000551475677639246,
75 0.0008694474818184972,
76 0.000927518296521157,
77 0.0009219486964866519,
78 0.0014395526959560812
79 ],
80 "p_value": 0.0081,
81 "mde": 0.00030862416250668516,
82 "mde_rel_pct": 39.55752322693216,
83 "verdict": "idea worse (significant)",
84 "system_worked": false
85 },
86 "mechanism_signature": {
87 "prediction": "conditioning retains 100% of selected terminal-failure trajectories; replay should increase rare-event exposure",
88 "predicted_valid_fraction": 1.0,
89 "observed_valid_fraction": 1.0,
90 "predicted_replay_fraction": 0.5,
91 "observed_replay_fraction": 0.5,
92 "confirmed": true
93 },
94 "idea_sweep": [
95 {
96 "cfg": {
97 "lr": 0.006,
98 "epochs": 18
99 },
100 "result": {
101 "mean": 0.001735811325488612,
102 "std": 0.0007333066277889873,
103 "per_seed": [
104 0.001395401661284268,
105 0.0006777255330234766,
106 0.00144183577504009,
107 0.0015068890061229467,
108 0.0025884252972900867,
109 0.001887585036456585,
110 0.0012569716200232506,
111 0.003131656674668193
112 ],
113 "n": 8
114 }
115 },
116 {
117 "cfg": {
118 "lr": 0.001,
119 "epochs": 18
120 },
121 "result": {
122 "mean": 0.0015543624467682093,
123 "std": 0.0004092240958003843,
124 "per_seed": [
125 0.0015412603970617056,
126 0.0010829424718394876,
127 0.0010121178347617388,
128 0.0014807143015787005,
129 0.001438742270693183,
130 0.0017851066077128053,
131 0.0016824236372485757,
132 0.0024115920532494783
133 ],
134 "n": 8
135 }
136 },
137 {
138 "cfg": {
139 "lr": 0.003,
140 "epochs": 18
141 },
142 "result": {
143 "mean": 0.001693843849352561,
144 "std": 0.0009678744347819918,
145 "per_seed": [
146 0.0007645400473847985,
147 0.0025881300680339336,
148 0.0006857462576590478,
149 0.0029576336964964867,
150 0.0006684368127025664,
151 0.0008722841739654541,
152 0.0022166145499795675,
153 0.002797365188598633
154 ],
155 "n": 8
156 }
157 }
158 ],
159 "runtime_sec": 69.70142459869385
160}