r-Deformed Power Divergence Loss / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "vision",
4 "model": "cnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.0015
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.0015
15 },
16 "mean": 0.7512499988079071
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.7537499964237213
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 0.878125011920929
29 }
30 ],
31 "full": {
32 "mean": 0.7653124928474426,
33 "std": 0.035143397058649814,
34 "per_seed": [
35 0.7350000143051147,
36 0.7825000286102295,
37 0.7799999713897705,
38 0.7074999809265137,
39 0.8324999809265137,
40 0.7699999809265137,
41 0.7425000071525574,
42 0.7724999785423279
43 ],
44 "n": 8
45 },
46 "idea_union_sweep": [
47 {
48 "cfg": {
49 "lr": 0.0015
50 },
51 "mean": 0.7781250029802322
52 },
53 {
54 "cfg": {
55 "lr": 0.003
56 },
57 "mean": 0.7737499922513962
58 },
59 {
60 "cfg": {
61 "lr": 0.006
62 },
63 "mean": 0.7937500029802322
64 }
65 ]
66 },
67 "idea": {
68 "mean": 0.7856250032782555,
69 "std": 0.029993484958144172,
70 "per_seed": [
71 0.7699999809265137,
72 0.8374999761581421,
73 0.737500011920929,
74 0.75,
75 0.7975000143051147,
76 0.7975000143051147,
77 0.8050000071525574,
78 0.7900000214576721
79 ],
80 "n": 8
81 },
82 "comparison": {
83 "delta_mean": 0.020312510430812836,
84 "idea_wins": 2,
85 "n_pairs": 8,
86 "per_seed_diffs": [
87 0.034999966621398926,
88 0.0549999475479126,
89 -0.04249995946884155,
90 0.04250001907348633,
91 -0.034999966621398926,
92 0.027500033378601074,
93 0.0625,
94 0.01750004291534424
95 ],
96 "p_value": 0.17155,
97 "mde": 0.03277566818472898,
98 "mde_rel_pct": 4.282651660733112,
99 "verdict": "no significant win",
100 "system_worked": false
101 },
102 "parameterization": {
103 "alpha": 0.5,
104 "r": 0.0,
105 "epochs": 8,
106 "batch": 128,
107 "lr_union": [
108 0.0015,
109 0.003,
110 0.006
111 ],
112 "task": "CIFAR-10 subset classification"
113 },
114 "mechanism_signature": {
115 "quantity": "mean probability assigned to observed target event on trained test models",
116 "baseline_target_event_prob": 0.14888361282646656,
117 "idea_target_event_prob": 0.16992626152932644,
118 "prediction": "r=0, alpha=0.5 changes power-law gradient weighting and should reduce gradient variability",
119 "observed_baseline_grad_var": 3.603046359352762,
120 "observed_idea_grad_var": 0.48674841174291406,
121 "confirmed": true
122 }
123}