RG Pyramid Flow Matching / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "multitoken_diffusion",
4 "model": "custom_local_vs_rg_pyramid",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 12,
11 "hidden": 32
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.001,
17 "epochs": 12,
18 "hidden": 32
19 },
20 "mean": 0.5760585516691208
21 },
22 {
23 "cfg": {
24 "lr": 0.003,
25 "epochs": 12,
26 "hidden": 32
27 },
28 "mean": 0.5570157170295715
29 },
30 {
31 "cfg": {
32 "lr": 0.006,
33 "epochs": 12,
34 "hidden": 32
35 },
36 "mean": 0.552870586514473
37 }
38 ],
39 "full": {
40 "mean": 0.5488443523645401,
41 "std": 0.02526189879738744,
42 "per_seed": [
43 0.544949471950531,
44 0.5276203751564026,
45 0.5781564116477966,
46 0.5607560873031616,
47 0.5518556833267212,
48 0.5262078642845154,
49 0.5900437831878662,
50 0.5111651420593262
51 ],
52 "n": 8
53 }
54 },
55 "idea": {
56 "mean": 0.5474011525511742,
57 "std": 0.025686412604992322,
58 "per_seed": [
59 0.547066330909729,
60 0.5185491442680359,
61 0.5782044529914856,
62 0.5547541379928589,
63 0.5519959330558777,
64 0.5247784852981567,
65 0.5898048281669617,
66 0.5140559077262878
67 ],
68 "n": 8
69 },
70 "comparison": {
71 "delta_mean": -0.0014431998133659363,
72 "idea_wins": 4,
73 "n_pairs": 8,
74 "per_seed_diffs": [
75 0.002116858959197998,
76 -0.0090712308883667,
77 4.8041343688964844e-05,
78 -0.006001949310302734,
79 0.00014024972915649414,
80 -0.0014293789863586426,
81 -0.00023895502090454102,
82 0.00289076566696167
83 ],
84 "p_value": 0.40545,
85 "mde": 0.0034127227373531473,
86 "mde_rel_pct": 0.6218015586113622,
87 "verdict": "no measurable effect",
88 "system_worked": false
89 },
90 "mechanism_signature": {
91 "prediction": "coarse pooled conditioning transmits distant-token influence beyond a radius-1 local field",
92 "predicted_vs_observed": {
93 "predicted": "idea distant sensitivity > baseline",
94 "observed_idea_mean_distant_sensitivity": 0.0,
95 "observed_baseline_mean_distant_sensitivity": 0.0
96 },
97 "trained_model_observations": [
98 {
99 "params": 4673,
100 "mean_output_sensitivity": 0.017446190118789673,
101 "distant_sensitivity_0_to_7": 0.0,
102 "near_sensitivity_0_to_1": 0.04621781036257744,
103 "train_metric": 0.5470663905143738
104 },
105 {
106 "params": 4673,
107 "mean_output_sensitivity": 0.014791442081332207,
108 "distant_sensitivity_0_to_7": 0.0,
109 "near_sensitivity_0_to_1": 0.02925388514995575,
110 "train_metric": 0.5185490846633911
111 },
112 {
113 "params": 4673,
114 "mean_output_sensitivity": 0.02319423481822014,
115 "distant_sensitivity_0_to_7": 0.0,
116 "near_sensitivity_0_to_1": 0.038679420948028564,
117 "train_metric": 0.5782045125961304
118 },
119 {
120 "params": 4673,
121 "mean_output_sensitivity": 0.020275751128792763,
122 "distant_sensitivity_0_to_7": 0.0,
123 "near_sensitivity_0_to_1": 0.04100608453154564,
124 "train_metric": 0.5547541975975037
125 },
126 {
127 "params": 4673,
128 "mean_output_sensitivity": 0.015608072280883789,
129 "distant_sensitivity_0_to_7": 0.0,
130 "near_sensitivity_0_to_1": 0.023431016132235527,
131 "train_metric": 0.5519958734512329
132 },
133 {
134 "params": 4673,
135 "mean_output_sensitivity": 0.01546372752636671,
136 "distant_sensitivity_0_to_7": 0.0,
137 "near_sensitivity_0_to_1": 0.03454026207327843,
138 "train_metric": 0.5247784852981567
139 },
140 {
141 "params": 4673,
142 "mean_output_sensitivity": 0.020734351128339767,
143 "distant_sensitivity_0_to_7": 0.0,
144 "near_sensitivity_0_to_1": 0.04659464955329895,
145 "train_metric": 0.5898047685623169
146 },
147 {
148 "params": 4673,
149 "mean_output_sensitivity": 0.017892511561512947,
150 "distant_sensitivity_0_to_7": 0.0,
151 "near_sensitivity_0_to_1": 0.038680300116539,
152 "train_metric": 0.5140558481216431
153 }
154 ],
155 "confirmed": false
156 },
157 "idea_sweep": [
158 {
159 "cfg": {
160 "lr": 0.001,
161 "epochs": 12,
162 "hidden": 32
163 },
164 "result": {
165 "mean": 0.5708411112427711,
166 "std": 0.01710534526819156,
167 "per_seed": [
168 0.5729581713676453,
169 0.55045485496521,
170 0.594555139541626,
171 0.5791563987731934,
172 0.5713737607002258,
173 0.5566545128822327,
174 0.5941076874732971,
175 0.547468364238739
176 ],
177 "n": 8
178 }
179 },
180 {
181 "cfg": {
182 "lr": 0.003,
183 "epochs": 12,
184 "hidden": 32
185 },
186 "result": {
187 "mean": 0.5542507246136665,
188 "std": 0.020406232018671196,
189 "per_seed": [
190 0.5557947158813477,
191 0.5313525199890137,
192 0.5770509243011475,
193 0.5587972402572632,
194 0.5542395710945129,
195 0.5387598276138306,
196 0.590461015701294,
197 0.5275499820709229
198 ],
199 "n": 8
200 }
201 },
202 {
203 "cfg": {
204 "lr": 0.006,
205 "epochs": 12,
206 "hidden": 32
207 },
208 "result": {
209 "mean": 0.5474011525511742,
210 "std": 0.025686412604992322,
211 "per_seed": [
212 0.547066330909729,
213 0.5185491442680359,
214 0.5782044529914856,
215 0.5547541379928589,
216 0.5519959330558777,
217 0.5247784852981567,
218 0.5898048281669617,
219 0.5140559077262878
220 ],
221 "n": 8
222 }
223 }
224 ],
225 "custom_track": {
226 "name": "multitoken_diffusion",
227 "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/multitoken_diffusion.py",
228 "domain": "diffusion-sampling"
229 },
230 "architecture": {
231 "baseline": "local radius-1 convolutional velocity field",
232 "idea": "dyadic pooled coarse field plus local fine residual conditioning",
233 "baseline_params": 3361,
234 "idea_params": 4673
235 }
236}