{ "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.22030843049287796 }, { "cfg": { "lr": 0.003 }, "mean": 0.2290698178112507 }, { "cfg": { "lr": 0.01 }, "mean": 1.0897138714790344 } ], "full": { "mean": 0.22894670069217682, "std": 0.02468231743126849, "per_seed": [ 0.2348448932170868, 0.18358114361763, 0.2119988203048706, 0.25080886483192444, 0.21615827083587646, 0.258085697889328, 0.258510559797287, 0.21758535504341125 ], "n": 8 } }, "idea": { "mean": 0.23161649331450462, "std": 0.0217385249680007, "per_seed": [ 0.23855143785476685, 0.20657582581043243, 0.2038293331861496, 0.27797847986221313, 0.22990234196186066, 0.2412124127149582, 0.23263387382030487, 0.22224824130535126 ], "n": 8 }, "comparison": { "delta_mean": 0.0026697926223278046, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0037065446376800537, 0.02299468219280243, -0.008169487118721008, 0.027169615030288696, 0.013744071125984192, -0.016873285174369812, -0.025876685976982117, 0.0046628862619400024 ], "p_value": 0.6818, "mde": 0.015660083437405745, "mde_rel_pct": 6.8400563930646125, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.2317337691783905 }, { "cfg": { "lr": 0.003 }, "mean": 0.26143352687358856 }, { "cfg": { "lr": 0.01 }, "mean": 1.1830730140209198 } ], "selected_idea_cfg": { "lr": 0.001 }, "behavior": { "prediction": "ordered noncommuting updates preserve sphere norm and create order sensitivity", "predicted_norm_error": 0.0, "observed_max_norm_error": 1.3113021850585938e-06, "predicted_order_delta_nonzero": true, "observed_mean_reversal_spin_delta": 1.0346672534942627, "observed_axis_cross_norm": 0.9981767535209656, "confirmed": true, "note": "All values are measured from the trained benchmark spin model." } } }