Error-budgeted local log-signature tokens / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "sequence",
4 "model": "transformer_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.003,
10 "m": 8
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "m": 4
17 },
18 "mean": 0.8542857021093369
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "m": 8
24 },
25 "mean": 0.6984880715608597
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "m": 8
31 },
32 "mean": 0.8044749051332474
33 }
34 ],
35 "full": {
36 "mean": 0.7327230274677277,
37 "std": 0.08377880235319037,
38 "per_seed": [
39 0.6893054246902466,
40 0.6570264101028442,
41 0.6207273006439209,
42 0.826893150806427,
43 0.7129261493682861,
44 0.7505295276641846,
45 0.8937446475028992,
46 0.7106316089630127
47 ],
48 "n": 8
49 },
50 "idea_union_grid": [
51 {
52 "lr": 0.001,
53 "m": 4
54 },
55 {
56 "lr": 0.003,
57 "m": 8
58 },
59 {
60 "lr": 0.006,
61 "m": 8
62 }
63 ]
64 },
65 "idea": {
66 "mean": 0.8882134854793549,
67 "std": 0.053050946493547683,
68 "per_seed": [
69 0.9650673866271973,
70 0.8446772694587708,
71 0.9014532566070557,
72 0.8312016725540161,
73 0.9647780656814575,
74 0.8639494776725769,
75 0.9117944836616516,
76 0.822786271572113
77 ],
78 "n": 8
79 },
80 "comparison": {
81 "delta_mean": 0.1554904580116272,
82 "idea_wins": 0,
83 "n_pairs": 8,
84 "per_seed_diffs": [
85 0.2757619619369507,
86 0.1876508593559265,
87 0.28072595596313477,
88 0.004308521747589111,
89 0.2518519163131714,
90 0.11341995000839233,
91 0.01804983615875244,
92 0.11215466260910034
93 ],
94 "p_value": 0.0081,
95 "mde": 0.09260611707336146,
96 "mde_rel_pct": 12.638625183298233,
97 "verdict": "idea worse (significant)",
98 "system_worked": false
99 },
100 "mechanism_signature": {
101 "math_sanity": {
102 "tail_decreases_with_degree": true,
103 "equal_variation_error_decreases_with_m": true,
104 "tail_values": [
105 [
106 0.1487212707001282,
107 0.023721270700128194,
108 0.002887937366794935,
109 0.00028377070012819416,
110 2.33540334615423e-05
111 ],
112 [
113 0.7182818284590451,
114 0.2182818284590451,
115 0.05161516179237857,
116 0.009948495125712054,
117 0.0016151617923787498
118 ],
119 [
120 4.38905609893065,
121 2.3890560989306504,
122 1.0557227655973174,
123 0.3890560989306504,
124 0.1223894322639838
125 ]
126 ],
127 "equal_m_values": [
128 378.4287934927351,
129 23.171073846375336,
130 3.426756281352258,
131 0.6860001329013983,
132 0.15486263389122001
133 ],
134 "lie_dims_d2": [
135 2,
136 1,
137 2,
138 3,
139 6
140 ],
141 "cost_examples": [
142 5,
143 6,
144 12,
145 16
146 ]
147 },
148 "idea_trials": [
149 {
150 "cfg": {
151 "lr": 0.001,
152 "m": 4
153 },
154 "mean": 0.88559989631176
155 },
156 {
157 "cfg": {
158 "lr": 0.003,
159 "m": 8
160 },
161 "mean": 0.8925289064645767
162 },
163 {
164 "cfg": {
165 "lr": 0.006,
166 "m": 8
167 },
168 "mean": 0.9592751115560532
169 }
170 ],
171 "selected_cfg": {
172 "lr": 0.001,
173 "m": 4
174 },
175 "mechanism_signature": {
176 "prediction": "larger local Taylor tail should proxy larger CDE approximation error",
177 "predicted_tail_mean": 572838.6955113218,
178 "observed_test_mse_mean": 0.9075925201177597,
179 "seed_level_correlation": 0.32441424694383164,
180 "confirmed": false,
181 "note": "Both quantities are measured on trained benchmark systems; eight seed points do not establish the claimed quantitative relation."
182 }
183 }
184}