Lipschitz-Free Metric Pooling / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "sequence",
  4  "model": "transformer_tiny_pooling_mvp",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003,
 10      "epochs": 12,
 11      "batch": 128
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.0015,
 17          "epochs": 12,
 18          "batch": 128
 19        },
 20        "mean": 1.030422881245613
 21      },
 22      {
 23        "cfg": {
 24          "lr": 0.003,
 25          "epochs": 12,
 26          "batch": 128
 27        },
 28        "mean": 1.0044431388378143
 29      },
 30      {
 31        "cfg": {
 32          "lr": 0.006,
 33          "epochs": 12,
 34          "batch": 128
 35        },
 36        "mean": 1.0057344734668732
 37      }
 38    ],
 39    "full": {
 40      "mean": 1.0108022689819336,
 41      "std": 0.09233493114632767,
 42      "per_seed": [
 43        1.135109543800354,
 44        0.8252689242362976,
 45        1.0580546855926514,
 46        0.9993394017219543,
 47        1.0295724868774414,
 48        1.0314586162567139,
 49        1.09066903591156,
 50        0.9169454574584961
 51      ],
 52      "n": 8
 53    }
 54  },
 55  "idea": {
 56    "mean": 1.0283051505684853,
 57    "std": 0.09182080119670853,
 58    "per_seed": [
 59      1.1634190082550049,
 60      0.8420974612236023,
 61      1.050006628036499,
 62      1.0190545320510864,
 63      1.0613138675689697,
 64      1.0465973615646362,
 65      1.1009020805358887,
 66      0.9430502653121948
 67    ],
 68    "n": 8,
 69    "selected_cfg": {
 70      "lr": 0.006,
 71      "epochs": 12,
 72      "batch": 128
 73    }
 74  },
 75  "comparison": {
 76    "delta_mean": 0.017502881586551666,
 77    "idea_wins": 1,
 78    "n_pairs": 8,
 79    "per_seed_diffs": [
 80      0.02830946445465088,
 81      0.016828536987304688,
 82      -0.008048057556152344,
 83      0.01971513032913208,
 84      0.03174138069152832,
 85      0.015138745307922363,
 86      0.010233044624328613,
 87      0.02610480785369873
 88    ],
 89    "p_value": 0.0163,
 90    "mde": 0.010529986179047253,
 91    "mde_rel_pct": 1.0417454038417338,
 92    "verdict": "idea worse (significant)",
 93    "system_worked": false
 94  },
 95  "idea_sweep": [
 96    {
 97      "cfg": {
 98        "lr": 0.0015,
 99        "epochs": 12,
100        "batch": 128
101      },
102      "mean": 1.091338686645031,
103      "std": 0.09665476674907689,
104      "per_seed": [
105        1.2205655574798584,
106        0.9110400080680847,
107        1.1126540899276733,
108        1.0519979000091553,
109        1.12910795211792,
110        1.1222410202026367,
111        1.1943774223327637,
112        0.9887255430221558
113      ]
114    },
115    {
116      "cfg": {
117        "lr": 0.003,
118        "epochs": 12,
119        "batch": 128
120      },
121      "mean": 1.075037308037281,
122      "std": 0.09951274952114578,
123      "per_seed": [
124        1.2106199264526367,
125        0.8868147134780884,
126        1.1060532331466675,
127        1.03895902633667,
128        1.1129647493362427,
129        1.103129506111145,
130        1.173069715499878,
131        0.9686875939369202
132      ]
133    },
134    {
135      "cfg": {
136        "lr": 0.006,
137        "epochs": 12,
138        "batch": 128
139      },
140      "mean": 1.0283051505684853,
141      "std": 0.09182080119670853,
142      "per_seed": [
143        1.1634190082550049,
144        0.8420974612236023,
145        1.050006628036499,
146        1.0190545320510864,
147        1.0613138675689697,
148        1.0465973615646362,
149        1.1009020805358887,
150        0.9430502653121948
151      ]
152    }
153  ],
154  "selection_seeds": [
155    0,
156    1,
157    2,
158    3
159  ],
160  "epochs": 12,
161  "batch": 128,
162  "parameter_counts": {
163    "baseline": 321,
164    "idea": 337
165  },
166  "structural_match": "sequence-level window forecasting with token-set pooling",
167  "mechanism_signature": {
168    "quantity": "trained probe D_hat versus independent 1D Wasserstein-1",
169    "predicted": "D_hat <= W1 for every pair; positive geometric association",
170    "observed_mean_D_hat": 0.027728637424297632,
171    "observed_mean_W1": 0.31382585523523404,
172    "mean_ratio_D_hat_over_W1": 0.09807194932021986,
173    "pearson_correlation": 0.12651039453842908,
174    "violation_fraction": 0.0,
175    "confirmed": false
176  }
177}