Dissipative Softmax Latent Layer / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "token_expert_sequence",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "epochs": 25
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 25
17 },
18 "mean": 0.0012499999720603228
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 25
24 },
25 "mean": 0.0012499999720603228
26 },
27 {
28 "cfg": {
29 "lr": 0.01,
30 "epochs": 25
31 },
32 "mean": 0.0006249999860301614
33 }
34 ],
35 "full": {
36 "mean": 0.0015624999650754035,
37 "std": 0.0017399263244939971,
38 "per_seed": [
39 0.0,
40 0.0024999999441206455,
41 0.0,
42 0.0,
43 0.0024999999441206455,
44 0.0024999999441206455,
45 0.0,
46 0.004999999888241291
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.4946874864399433,
53 "std": 0.02705426452774727,
54 "per_seed": [
55 0.5399999618530273,
56 0.5024999976158142,
57 0.48499998450279236,
58 0.5049999952316284,
59 0.4449999928474426,
60 0.5199999809265137,
61 0.47999998927116394,
62 0.47999998927116394
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": 0.4931249864748679,
68 "idea_wins": 0,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 0.5399999618530273,
72 0.49999999767169356,
73 0.48499998450279236,
74 0.5049999952316284,
75 0.442499992903322,
76 0.517499980982393,
77 0.47999998927116394,
78 0.47499998938292265
79 ],
80 "p_value": 0.0081,
81 "mde": 0.024702187634040935,
82 "mde_rel_pct": 1580.9400439153835,
83 "verdict": "idea worse (significant)",
84 "system_worked": false
85 },
86 "mechanism_signature": {
87 "predicted_effect": "occupation mismatch decreases as reset_rate increases",
88 "mismatch_at_r": NaN,
89 "mismatch_at_r_0.5": NaN,
90 "observed_cycle_proxy": NaN,
91 "confirmed": false
92 },
93 "idea_sweep": [
94 {
95 "cfg": {
96 "lr": 0.01,
97 "epochs": 25,
98 "r": 0.5
99 },
100 "result": {
101 "mean": 0.4946874864399433,
102 "std": 0.02705426452774727,
103 "per_seed": [
104 0.5399999618530273,
105 0.5024999976158142,
106 0.48499998450279236,
107 0.5049999952316284,
108 0.4449999928474426,
109 0.5199999809265137,
110 0.47999998927116394,
111 0.47999998927116394
112 ],
113 "n": 8
114 }
115 },
116 {
117 "cfg": {
118 "lr": 0.01,
119 "epochs": 25,
120 "r": 2.0
121 },
122 "result": {
123 "mean": 0.4946874864399433,
124 "std": 0.02705426452774727,
125 "per_seed": [
126 0.5399999618530273,
127 0.5024999976158142,
128 0.48499998450279236,
129 0.5049999952316284,
130 0.4449999928474426,
131 0.5199999809265137,
132 0.47999998927116394,
133 0.47999998927116394
134 ],
135 "n": 8
136 }
137 },
138 {
139 "cfg": {
140 "lr": 0.01,
141 "epochs": 25,
142 "r": 8.0
143 },
144 "result": {
145 "mean": 0.4946874864399433,
146 "std": 0.02705426452774727,
147 "per_seed": [
148 0.5399999618530273,
149 0.5024999976158142,
150 0.48499998450279236,
151 0.5049999952316284,
152 0.4449999928474426,
153 0.5199999809265137,
154 0.47999998927116394,
155 0.47999998927116394
156 ],
157 "n": 8
158 }
159 }
160 ],
161 "custom_track": {
162 "name": "token_expert_sequence",
163 "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/token_expert_sequence.py",
164 "domain": "moe-routing"
165 }
166}