Error-budgeted local log-signature tokens / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "sequence",
  4  "model": "transformer_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003,
 10      "m": 8
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "m": 4
 17        },
 18        "mean": 0.8542857021093369
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "m": 8
 24        },
 25        "mean": 0.6984880715608597
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "m": 8
 31        },
 32        "mean": 0.8044749051332474
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.7327230274677277,
 37      "std": 0.08377880235319037,
 38      "per_seed": [
 39        0.6893054246902466,
 40        0.6570264101028442,
 41        0.6207273006439209,
 42        0.826893150806427,
 43        0.7129261493682861,
 44        0.7505295276641846,
 45        0.8937446475028992,
 46        0.7106316089630127
 47      ],
 48      "n": 8
 49    },
 50    "idea_union_grid": [
 51      {
 52        "lr": 0.001,
 53        "m": 4
 54      },
 55      {
 56        "lr": 0.003,
 57        "m": 8
 58      },
 59      {
 60        "lr": 0.006,
 61        "m": 8
 62      }
 63    ]
 64  },
 65  "idea": {
 66    "mean": 0.8882134854793549,
 67    "std": 0.053050946493547683,
 68    "per_seed": [
 69      0.9650673866271973,
 70      0.8446772694587708,
 71      0.9014532566070557,
 72      0.8312016725540161,
 73      0.9647780656814575,
 74      0.8639494776725769,
 75      0.9117944836616516,
 76      0.822786271572113
 77    ],
 78    "n": 8
 79  },
 80  "comparison": {
 81    "delta_mean": 0.1554904580116272,
 82    "idea_wins": 0,
 83    "n_pairs": 8,
 84    "per_seed_diffs": [
 85      0.2757619619369507,
 86      0.1876508593559265,
 87      0.28072595596313477,
 88      0.004308521747589111,
 89      0.2518519163131714,
 90      0.11341995000839233,
 91      0.01804983615875244,
 92      0.11215466260910034
 93    ],
 94    "p_value": 0.0081,
 95    "mde": 0.09260611707336146,
 96    "mde_rel_pct": 12.638625183298233,
 97    "verdict": "idea worse (significant)",
 98    "system_worked": false
 99  },
100  "mechanism_signature": {
101    "math_sanity": {
102      "tail_decreases_with_degree": true,
103      "equal_variation_error_decreases_with_m": true,
104      "tail_values": [
105        [
106          0.1487212707001282,
107          0.023721270700128194,
108          0.002887937366794935,
109          0.00028377070012819416,
110          2.33540334615423e-05
111        ],
112        [
113          0.7182818284590451,
114          0.2182818284590451,
115          0.05161516179237857,
116          0.009948495125712054,
117          0.0016151617923787498
118        ],
119        [
120          4.38905609893065,
121          2.3890560989306504,
122          1.0557227655973174,
123          0.3890560989306504,
124          0.1223894322639838
125        ]
126      ],
127      "equal_m_values": [
128        378.4287934927351,
129        23.171073846375336,
130        3.426756281352258,
131        0.6860001329013983,
132        0.15486263389122001
133      ],
134      "lie_dims_d2": [
135        2,
136        1,
137        2,
138        3,
139        6
140      ],
141      "cost_examples": [
142        5,
143        6,
144        12,
145        16
146      ]
147    },
148    "idea_trials": [
149      {
150        "cfg": {
151          "lr": 0.001,
152          "m": 4
153        },
154        "mean": 0.88559989631176
155      },
156      {
157        "cfg": {
158          "lr": 0.003,
159          "m": 8
160        },
161        "mean": 0.8925289064645767
162      },
163      {
164        "cfg": {
165          "lr": 0.006,
166          "m": 8
167        },
168        "mean": 0.9592751115560532
169      }
170    ],
171    "selected_cfg": {
172      "lr": 0.001,
173      "m": 4
174    },
175    "mechanism_signature": {
176      "prediction": "larger local Taylor tail should proxy larger CDE approximation error",
177      "predicted_tail_mean": 572838.6955113218,
178      "observed_test_mse_mean": 0.9075925201177597,
179      "seed_level_correlation": 0.32441424694383164,
180      "confirmed": false,
181      "note": "Both quantities are measured on trained benchmark systems; eight seed points do not establish the claimed quantitative relation."
182    }
183  }
184}