Complete Interval Abstraction Training / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 10
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 10
17 },
18 "mean": 0.02098797250073403
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 10
24 },
25 "mean": 0.003764481545658782
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 10
31 },
32 "mean": 0.002816903230268508
33 }
34 ],
35 "full": {
36 "mean": 0.0035593539651017636,
37 "std": 0.001430033924501602,
38 "per_seed": [
39 0.003789895214140415,
40 0.0012226301478222013,
41 0.004499303642660379,
42 0.001755783916451037,
43 0.005420389119535685,
44 0.0051945955492556095,
45 0.0037620163056999445,
46 0.0028302178252488375
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.0036058283294551075,
53 "std": 0.0012201842547257958,
54 "per_seed": [
55 0.004097327124327421,
56 0.0013652343768626451,
57 0.0035981065593659878,
58 0.0025071303825825453,
59 0.0055099669843912125,
60 0.0048635597340762615,
61 0.0037585990503430367,
62 0.0031467024236917496
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": 4.6474364353343844e-05,
68 "idea_wins": 3,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 0.000307431910187006,
72 0.0001426042290404439,
73 -0.0009011970832943916,
74 0.0007513464661315084,
75 8.957786485552788e-05,
76 -0.000331035815179348,
77 -3.4172553569078445e-06,
78 0.0003164845984429121
79 ],
80 "p_value": 0.81695,
81 "mde": 0.00041109428784617027,
82 "mde_rel_pct": 11.549688282671736,
83 "verdict": "no significant win",
84 "system_worked": false
85 },
86 "sanity_check": {
87 "containment": [
88 1.0,
89 1.0,
90 1.0,
91 1.0
92 ],
93 "h": [
94 0.2,
95 0.1,
96 0.05,
97 0.025
98 ],
99 "mean_width": [
100 0.2894333333333333,
101 0.18980000000000002,
102 0.14003333333333334,
103 0.11466666666666667
104 ],
105 "all_contained": true,
106 "width_decreases": true
107 },
108 "idea_config_sweep": [
109 {
110 "cfg": {
111 "lr": 0.006,
112 "epochs": 10
113 },
114 "result": {
115 "mean": 0.0036058283294551075,
116 "std": 0.0012201842547257958,
117 "per_seed": [
118 0.004097327124327421,
119 0.0013652343768626451,
120 0.0035981065593659878,
121 0.0025071303825825453,
122 0.0055099669843912125,
123 0.0048635597340762615,
124 0.0037585990503430367,
125 0.0031467024236917496
126 ],
127 "n": 8
128 }
129 },
130 {
131 "cfg": {
132 "lr": 0.001,
133 "epochs": 10
134 },
135 "result": {
136 "mean": 0.023580193694215268,
137 "std": 0.009230619863742425,
138 "per_seed": [
139 0.0067050703801214695,
140 0.030281851068139076,
141 0.026058034971356392,
142 0.023178257048130035,
143 0.010180371813476086,
144 0.03046376071870327,
145 0.03332953527569771,
146 0.028444668278098106
147 ],
148 "n": 8
149 }
150 },
151 {
152 "cfg": {
153 "lr": 0.003,
154 "epochs": 10
155 },
156 "result": {
157 "mean": 0.004334091427153908,
158 "std": 0.0020653212924998296,
159 "per_seed": [
160 0.0013217671075835824,
161 0.005213679280132055,
162 0.0035173860378563404,
163 0.0064000352285802364,
164 0.0018205104861408472,
165 0.003039174247533083,
166 0.007091913837939501,
167 0.006268265191465616
168 ],
169 "n": 8
170 }
171 }
172 ],
173 "protocol_note": "Baseline and idea share rnn_small, dataset, lr/epoch union, batch and seeds; idea differs only by interval training loss.",
174 "mechanism_signature": {
175 "predicted": "smaller h should reduce interval width while residual inflation preserves containment",
176 "observed_containment_mean": 0.7031250298023224,
177 "observed_width_mean": 0.1384880207479,
178 "observed_violation_mean": 0.010517213333514519,
179 "confirmed": false
180 },
181 "custom_track": null
182}