Conditional-Transport Discrete Reverse Diffusion / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "conditional_multitoken_diffusion",
  4  "model": "transformer_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.001
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.09234148263931274
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.10227461904287338
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.13437412679195404
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.09546016063541174,
 33      "std": 0.0068981652474538425,
 34      "per_seed": [
 35        0.08567251265048981,
 36        0.08461520820856094,
 37        0.09914777427911758,
 38        0.09993043541908264,
 39        0.10520027577877045,
 40        0.09470903873443604,
 41        0.09319207072257996,
 42        0.1012139692902565
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.09004521276801825,
 49    "std": 0.0046136095927630846,
 50    "per_seed": [
 51      0.08257821947336197,
 52      0.08880516141653061,
 53      0.09218183159828186,
 54      0.09180948883295059,
 55      0.0943688154220581,
 56      0.08264964818954468,
 57      0.09331666678190231,
 58      0.09465187042951584
 59    ],
 60    "n": 8,
 61    "cfg": {
 62      "lr": 0.001,
 63      "components": 3
 64    }
 65  },
 66  "comparison": {
 67    "delta_mean": -0.005414947867393494,
 68    "idea_wins": 6,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      -0.003094293177127838,
 72      0.0041899532079696655,
 73      -0.006965942680835724,
 74      -0.00812094658613205,
 75      -0.010831460356712341,
 76      -0.012059390544891357,
 77      0.00012459605932235718,
 78      -0.006562098860740662
 79    ],
 80    "p_value": 0.0468,
 81    "mde": 0.004610854431296922,
 82    "mde_rel_pct": 4.830134791944282,
 83    "verdict": "idea better (significant)",
 84    "system_worked": true
 85  },
 86  "mechanism_signature": {
 87    "mean_component_spread": 1.1394079849123955,
 88    "residual_excess_kurtosis": 1.5870434984444928,
 89    "prediction": "multimodal conditional transport has separated learned components",
 90    "confirmed": true
 91  },
 92  "idea_sweep": [
 93    {
 94      "mean": 0.09004521276801825,
 95      "std": 0.0046136095927630846,
 96      "per_seed": [
 97        0.08257821947336197,
 98        0.08880516141653061,
 99        0.09218183159828186,
100        0.09180948883295059,
101        0.0943688154220581,
102        0.08264964818954468,
103        0.09331666678190231,
104        0.09465187042951584
105      ],
106      "n": 8,
107      "cfg": {
108        "lr": 0.001,
109        "components": 3
110      }
111    },
112    {
113      "mean": 0.11219676397740841,
114      "std": 0.012698939549116916,
115      "per_seed": [
116        0.10995763540267944,
117        0.10517711192369461,
118        0.10637346655130386,
119        0.10468488186597824,
120        0.1260760873556137,
121        0.09370528906583786,
122        0.11482667922973633,
123        0.13677296042442322
124      ],
125      "n": 8,
126      "cfg": {
127        "lr": 0.003,
128        "components": 3
129      }
130    },
131    {
132      "mean": 0.2344836015254259,
133      "std": 0.07579298087152198,
134      "per_seed": [
135        0.21607452630996704,
136        0.25600194931030273,
137        0.2064877152442932,
138        0.16402755677700043,
139        0.15939156711101532,
140        0.41217851638793945,
141        0.263763964176178,
142        0.19794301688671112
143      ],
144      "n": 8,
145      "cfg": {
146        "lr": 0.01,
147        "components": 3
148      }
149    }
150  ],
151  "math_check": {
152    "normal_inverse_cdf_pit_sup_deviation": 0.006606725739433772,
153    "expected_below": 0.02
154  },
155  "custom_track": {
156    "name": "conditional_multitoken_diffusion",
157    "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/conditional_multitoken_diffusion.py",
158    "domain": "diffusion-sampling"
159  },
160  "protocol_notes": "Matched eight-token diffusion task; independently trained shared transformer backbone; identical test MSE readout; baseline and idea share lr union."
161}