State-Dependent Metric Projected Optimizer / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.003,
10 "beta2": 0.999
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.0003,
16 "beta2": 0.99
17 },
18 "mean": 219.74071502685547
19 },
20 {
21 "cfg": {
22 "lr": 0.001,
23 "beta2": 0.99
24 },
25 "mean": 133.59764099121094
26 },
27 {
28 "cfg": {
29 "lr": 0.003,
30 "beta2": 0.999
31 },
32 "mean": 16.845557928085327
33 }
34 ],
35 "full": {
36 "mean": 17.666198015213013,
37 "std": 2.17622036048186,
38 "per_seed": [
39 17.691715240478516,
40 14.373583793640137,
41 20.163808822631836,
42 15.15312385559082,
43 18.178590774536133,
44 15.800971031188965,
45 19.925329208374023,
46 20.042461395263672
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "per_seed": [
53 15.087238311767578,
54 12.6608247756958,
55 16.30777359008789,
56 14.145133972167969,
57 15.023676872253418,
58 15.424975395202637,
59 17.59527587890625,
60 18.863933563232422
61 ],
62 "mean": 15.638604044914246,
63 "best_cfg": {
64 "lr": 0.003,
65 "beta2": 0.999,
66 "metric_beta": -0.5
67 },
68 "nearby_settings": [
69 {
70 "cfg": {
71 "lr": 0.0003,
72 "beta2": 0.99,
73 "metric_beta": -0.5
74 },
75 "mean": 216.299165725708
76 },
77 {
78 "cfg": {
79 "lr": 0.001,
80 "beta2": 0.99,
81 "metric_beta": -0.5
82 },
83 "mean": 81.73757028579712
84 },
85 {
86 "cfg": {
87 "lr": 0.003,
88 "beta2": 0.999,
89 "metric_beta": -0.5
90 },
91 "mean": 15.638604044914246
92 }
93 ]
94 },
95 "comparison": {
96 "delta_mean": -2.027593970298767,
97 "idea_wins": 8,
98 "n_pairs": 8,
99 "per_seed_diffs": [
100 -2.6044769287109375,
101 -1.712759017944336,
102 -3.8560352325439453,
103 -1.0079898834228516,
104 -3.154913902282715,
105 -0.3759956359863281,
106 -2.3300533294677734,
107 -1.17852783203125
108 ],
109 "p_value": 0.0081,
110 "mde": 0.9805142418858956,
111 "mde_rel_pct": 5.550227847788975,
112 "verdict": "idea better (significant)",
113 "system_worked": true
114 },
115 "mechanism_signature": {
116 "predicted": "m decreases as observed v increases (inverse-variance metric)",
117 "observed_metric_mean": 3.7805249429075047,
118 "observed_log_metric_vs_negative_log_variance_corr": 0.8070462500798509,
119 "baseline_final_train_loss": 17.63215286254883,
120 "idea_final_train_loss": 15.715824356079102,
121 "max_constraint_violation": 0.0,
122 "confirmed": true
123 },
124 "protocol_note": "Baseline and idea use identical tabular task, mlp_tiny architecture, 12 epochs, batch 128, and the same lr union; baseline Adam beta2 was swept."
125}