r-Deformed Power Divergence Loss / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "vision",
  4  "model": "cnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.0015
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.0015
 15        },
 16        "mean": 0.7512499988079071
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.7537499964237213
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.878125011920929
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.7653124928474426,
 33      "std": 0.035143397058649814,
 34      "per_seed": [
 35        0.7350000143051147,
 36        0.7825000286102295,
 37        0.7799999713897705,
 38        0.7074999809265137,
 39        0.8324999809265137,
 40        0.7699999809265137,
 41        0.7425000071525574,
 42        0.7724999785423279
 43      ],
 44      "n": 8
 45    },
 46    "idea_union_sweep": [
 47      {
 48        "cfg": {
 49          "lr": 0.0015
 50        },
 51        "mean": 0.7781250029802322
 52      },
 53      {
 54        "cfg": {
 55          "lr": 0.003
 56        },
 57        "mean": 0.7737499922513962
 58      },
 59      {
 60        "cfg": {
 61          "lr": 0.006
 62        },
 63        "mean": 0.7937500029802322
 64      }
 65    ]
 66  },
 67  "idea": {
 68    "mean": 0.7856250032782555,
 69    "std": 0.029993484958144172,
 70    "per_seed": [
 71      0.7699999809265137,
 72      0.8374999761581421,
 73      0.737500011920929,
 74      0.75,
 75      0.7975000143051147,
 76      0.7975000143051147,
 77      0.8050000071525574,
 78      0.7900000214576721
 79    ],
 80    "n": 8
 81  },
 82  "comparison": {
 83    "delta_mean": 0.020312510430812836,
 84    "idea_wins": 2,
 85    "n_pairs": 8,
 86    "per_seed_diffs": [
 87      0.034999966621398926,
 88      0.0549999475479126,
 89      -0.04249995946884155,
 90      0.04250001907348633,
 91      -0.034999966621398926,
 92      0.027500033378601074,
 93      0.0625,
 94      0.01750004291534424
 95    ],
 96    "p_value": 0.17155,
 97    "mde": 0.03277566818472898,
 98    "mde_rel_pct": 4.282651660733112,
 99    "verdict": "no significant win",
100    "system_worked": false
101  },
102  "parameterization": {
103    "alpha": 0.5,
104    "r": 0.0,
105    "epochs": 8,
106    "batch": 128,
107    "lr_union": [
108      0.0015,
109      0.003,
110      0.006
111    ],
112    "task": "CIFAR-10 subset classification"
113  },
114  "mechanism_signature": {
115    "quantity": "mean probability assigned to observed target event on trained test models",
116    "baseline_target_event_prob": 0.14888361282646656,
117    "idea_target_event_prob": 0.16992626152932644,
118    "prediction": "r=0, alpha=0.5 changes power-law gradient weighting and should reduce gradient variability",
119    "observed_baseline_grad_var": 3.603046359352762,
120    "observed_idea_grad_var": 0.48674841174291406,
121    "confirmed": true
122  }
123}