Confidence-Tested LoRA Pruning / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny_factorized_first_layer",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "delta_fraction": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "delta_fraction": 0.0
 17        },
 18        "mean": 205.01904678344727
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "delta_fraction": 0.0
 24        },
 25        "mean": 18.50063133239746
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "delta_fraction": 0.0
 31        },
 32        "mean": 16.618733406066895
 33      }
 34    ],
 35    "full": {
 36      "mean": 16.327228546142578,
 37      "std": 0.907789506476808,
 38      "per_seed": [
 39        17.471485137939453,
 40        15.701416015625,
 41        16.48313331604004,
 42        16.818899154663086,
 43        16.06818199157715,
 44        17.633129119873047,
 45        15.67065715789795,
 46        14.770926475524902
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 16.319469451904297,
 53    "std": 0.9038104755432905,
 54    "per_seed": [
 55      17.471485137939453,
 56      15.701416015625,
 57      16.48313331604004,
 58      16.756826400756836,
 59      16.06818199157715,
 60      17.633129119873047,
 61      15.67065715789795,
 62      14.770926475524902
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": -0.00775909423828125,
 68    "idea_wins": 1,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      0.0,
 72      0.0,
 73      0.0,
 74      -0.06207275390625,
 75      0.0,
 76      0.0,
 77      0.0,
 78      0.0
 79    ],
 80    "p_value": 1.0,
 81    "mde": 0.018350257873535156,
 82    "mde_rel_pct": 0.11239052495452775,
 83    "verdict": "no measurable effect",
 84    "system_worked": false
 85  },
 86  "mechanism_signature": {
 87    "predicted_quantity": "sum of retained rank-one gradient contributions at pruning",
 88    "observed_quantity": "sum of retained rank-one absolute responses on held-out inputs",
 89    "predicted_example": 42.21419620513916,
 90    "observed_example": 0.8568963706493378,
 91    "confirmed": false
 92  },
 93  "idea_sweep": [
 94    {
 95      "cfg": {
 96        "lr": 0.001,
 97        "delta_fraction": 0.15
 98      },
 99      "mean": 204.1529769897461
100    },
101    {
102      "cfg": {
103        "lr": 0.001,
104        "delta_fraction": 0.25
105      },
106      "mean": 204.1529769897461
107    },
108    {
109      "cfg": {
110        "lr": 0.001,
111        "delta_fraction": 0.5
112      },
113      "mean": 204.1120777130127
114    },
115    {
116      "cfg": {
117        "lr": 0.003,
118        "delta_fraction": 0.15
119      },
120      "mean": 19.105027437210083
121    },
122    {
123      "cfg": {
124        "lr": 0.003,
125        "delta_fraction": 0.25
126      },
127      "mean": 19.105027437210083
128    },
129    {
130      "cfg": {
131        "lr": 0.003,
132        "delta_fraction": 0.5
133      },
134      "mean": 19.07418918609619
135    },
136    {
137      "cfg": {
138        "lr": 0.006,
139        "delta_fraction": 0.15
140      },
141      "mean": 16.34427547454834
142    },
143    {
144      "cfg": {
145        "lr": 0.006,
146        "delta_fraction": 0.25
147      },
148      "mean": 16.34427547454834
149    },
150    {
151      "cfg": {
152        "lr": 0.006,
153        "delta_fraction": 0.5
154      },
155      "mean": 16.319469451904297
156    }
157  ],
158  "selected_idea_cfg": {
159    "lr": 0.006,
160    "delta_fraction": 0.5
161  },
162  "protocol_note": "Official registered tabular track; baseline sweep and idea use shared lr union, 8 final paired seeds."
163}