Coverage-Controlled Adaptive Time Sampling / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 12
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 12
17 },
18 "mean": 0.004298779065720737
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 12
24 },
25 "mean": 0.0034615940821822733
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 12
31 },
32 "mean": 0.0018282315868418664
33 }
34 ],
35 "full": {
36 "mean": 0.002105819425196387,
37 "std": 0.000389436566226016,
38 "per_seed": [
39 0.002004395006224513,
40 0.001437882543541491,
41 0.0015748648438602686,
42 0.002295783953741193,
43 0.0024020641576498747,
44 0.0024898042902350426,
45 0.0020851334556937218,
46 0.0025566271506249905
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.0018193616560893133,
53 "std": 0.00037736014800368497,
54 "per_seed": [
55 0.0017986779566854239,
56 0.0012207203544676304,
57 0.0014683871995657682,
58 0.0016677540261298418,
59 0.0024448649492114782,
60 0.002230470534414053,
61 0.0020495401695370674,
62 0.0016744780587032437
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": -0.00028645776910707355,
68 "idea_wins": 7,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 -0.0002057170495390892,
72 -0.00021716218907386065,
73 -0.00010647764429450035,
74 -0.000628029927611351,
75 4.2800791561603546e-05,
76 -0.0002593337558209896,
77 -3.559328615665436e-05,
78 -0.0008821490919217467
79 ],
80 "p_value": 0.0224,
81 "mde": 0.0002620079869585246,
82 "mde_rel_pct": 12.442091844322785,
83 "verdict": "idea better (significant)",
84 "system_worked": true
85 },
86 "mechanism_signature": {
87 "signature": {
88 "q": 0.03,
89 "Gamma": 2.0,
90 "epsilon": 0.13,
91 "predicted_uniform_radius": 0.17285714285714285,
92 "observed_proxy_radius_mean": 0.1817476600408554,
93 "observed_proxy_radius_std": 0.02882220596075058,
94 "predicted_vs_observed_correlation": NaN,
95 "controller_refines_when_bound_exceeds_epsilon": true,
96 "confirmed": false,
97 "note": "trained benchmark models use adaptive resampling, but the conservative fixed-gap law is not empirically calibrated by this track"
98 },
99 "idea_sweep": [
100 {
101 "cfg": {
102 "lr": 0.001,
103 "epochs": 12
104 },
105 "result": {
106 "mean": 0.0052960661123506725,
107 "std": 0.0015572022789016526,
108 "per_seed": [
109 0.008267243392765522,
110 0.005108773708343506,
111 0.0028678099624812603,
112 0.004508262034505606,
113 0.005263541359454393,
114 0.004577877465635538,
115 0.0047037601470947266,
116 0.007071260828524828
117 ],
118 "n": 8
119 }
120 },
121 {
122 "cfg": {
123 "lr": 0.003,
124 "epochs": 12
125 },
126 "result": {
127 "mean": 0.002939960832009092,
128 "std": 0.0017693752721639644,
129 "per_seed": [
130 0.0019986729603260756,
131 0.002653212519362569,
132 0.0012997412122786045,
133 0.007327801547944546,
134 0.0022197901271283627,
135 0.0036344309337437153,
136 0.0022852604743093252,
137 0.002100776880979538
138 ],
139 "n": 8
140 }
141 },
142 {
143 "cfg": {
144 "lr": 0.006,
145 "epochs": 12
146 },
147 "result": {
148 "mean": 0.0018193616560893133,
149 "std": 0.00037736014800368497,
150 "per_seed": [
151 0.0017986779566854239,
152 0.0012207203544676304,
153 0.0014683871995657682,
154 0.0016677540261298418,
155 0.0024448649492114782,
156 0.002230470534414053,
157 0.0020495401695370674,
158 0.0016744780587032437
159 ],
160 "n": 8
161 }
162 }
163 ]
164 },
165 "idea_selected_cfg": {
166 "lr": 0.006,
167 "epochs": 12
168 },
169 "protocol_note": "Baseline and idea share rnn_small, data, seeds, epochs and learning-rate union; adaptive temporal resampling is the sole intervention."
170}