Patch-Consensus Weak Residual Training / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "pde_patch_consensus",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.001,
 10      "weight": 0.15,
 11      "epochs": 20,
 12      "lam": 0.002,
 13      "tau": 0.08
 14    },
 15    "sweep": [
 16      {
 17        "cfg": {
 18          "lr": 0.001,
 19          "weight": 0.15,
 20          "epochs": 20,
 21          "lam": 0.002,
 22          "tau": 0.08
 23        },
 24        "mean": 0.3015064224600792
 25      },
 26      {
 27        "cfg": {
 28          "lr": 0.003,
 29          "weight": 0.3,
 30          "epochs": 20,
 31          "lam": 0.002,
 32          "tau": 0.08
 33        },
 34        "mean": 0.3022902384400368
 35      },
 36      {
 37        "cfg": {
 38          "lr": 0.01,
 39          "weight": 0.15,
 40          "epochs": 20,
 41          "lam": 0.002,
 42          "tau": 0.08
 43        },
 44        "mean": 0.3018767833709717
 45      }
 46    ],
 47    "full": {
 48      "mean": 0.2986701726913452,
 49      "std": 0.01948377339633572,
 50      "per_seed": [
 51        0.2805998921394348,
 52        0.3210130035877228,
 53        0.2944689989089966,
 54        0.3099437952041626,
 55        0.3145343065261841,
 56        0.2926834225654602,
 57        0.26018649339675903,
 58        0.3159314692020416
 59      ],
 60      "n": 8
 61    }
 62  },
 63  "idea": {
 64    "mean": 0.2986989840865135,
 65    "std": 0.01941700283178657,
 66    "per_seed": [
 67      0.28059789538383484,
 68      0.3210127651691437,
 69      0.29445162415504456,
 70      0.30993232131004333,
 71      0.31450358033180237,
 72      0.2926560342311859,
 73      0.2604662775993347,
 74      0.31597137451171875
 75    ],
 76    "n": 8
 77  },
 78  "comparison": {
 79    "delta_mean": 2.8811395168304443e-05,
 80    "idea_wins": 6,
 81    "n_pairs": 8,
 82    "per_seed_diffs": [
 83      -1.996755599975586e-06,
 84      -2.384185791015625e-07,
 85      -1.7374753952026367e-05,
 86      -1.1473894119262695e-05,
 87      -3.072619438171387e-05,
 88      -2.7388334274291992e-05,
 89      0.0002797842025756836,
 90      3.9905309677124023e-05
 91    ],
 92    "p_value": 0.7982,
 93    "mde": 8.675913930736897e-05,
 94    "mde_rel_pct": 0.029048477966706267,
 95    "verdict": "no measurable effect",
 96    "system_worked": false
 97  },
 98  "mechanism_signature": {
 99    "prediction": "weak residual integration plus support consensus should reduce noisy residual variability and increase regional support agreement",
100    "observed_trained_models": {
101      "baseline_pointwise_pde_rms_mean": 0.022820161539129913,
102      "idea_pointwise_pde_rms_mean": 0.029661827720701694,
103      "baseline_observation_rms_mean": 0.5462089078210038,
104      "idea_observation_rms_mean": 0.5462374777264867,
105      "idea_local_support_rate_mean": 0.0625,
106      "idea_modal_terms_mean": 0.0
107    },
108    "confirmed": false
109  },
110  "custom_track": {
111    "name": "pde_patch_consensus",
112    "file": "pde_consensus_track.py",
113    "domain": "pde"
114  },
115  "idea_sweep": [
116    {
117      "cfg": {
118        "lr": 0.001,
119        "weight": 0.15,
120        "epochs": 20,
121        "lam": 0.002,
122        "tau": 0.08
123      },
124      "mean": 0.2986989840865135
125    },
126    {
127      "cfg": {
128        "lr": 0.003,
129        "weight": 0.3,
130        "epochs": 20,
131        "lam": 0.002,
132        "tau": 0.08
133      },
134      "mean": 0.2990812510251999
135    },
136    {
137      "cfg": {
138        "lr": 0.01,
139        "weight": 0.15,
140        "epochs": 20,
141        "lam": 0.002,
142        "tau": 0.08
143      },
144      "mean": 0.29942547529935837
145    }
146  ]
147}