{ "bench_version": 1, "track": "sequence", "model": "custom_residual_state", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "clock_scale": 1.0 }, "sweep": [ { "cfg": { "lr": 0.001, "clock_scale": 1.0 }, "mean": 0.28474123775959015 }, { "cfg": { "lr": 0.003, "clock_scale": 1.0 }, "mean": 0.18260616809129715 }, { "cfg": { "lr": 0.01, "clock_scale": 1.0 }, "mean": 0.20043297857046127 } ], "full": { "mean": 0.17484375648200512, "std": 0.025356109025214353, "per_seed": [ 0.17150327563285828, 0.1548469513654709, 0.1772066205739975, 0.22686782479286194, 0.1976654827594757, 0.13995282351970673, 0.17249508202075958, 0.15821199119091034 ], "n": 8 } }, "idea": { "mean": 0.7047909945249557, "std": 0.055758244673496424, "per_seed": [ 0.7154005765914917, 0.6783341765403748, 0.7505328059196472, 0.6759172081947327, 0.5878732204437256, 0.7312020659446716, 0.78669673204422, 0.7123711705207825 ], "n": 8, "best_cfg": { "lr": 0.01, "clock_scale": 1.0 }, "sweep": [ { "cfg": { "lr": 0.001, "clock_scale": 1.0 }, "mean": 0.7530882805585861 }, { "cfg": { "lr": 0.003, "clock_scale": 1.0 }, "mean": 0.7263866513967514 }, { "cfg": { "lr": 0.01, "clock_scale": 1.0 }, "mean": 0.7050461918115616 } ] }, "comparison": { "delta_mean": 0.5299472380429506, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.5438973009586334, 0.5234872251749039, 0.5733261853456497, 0.4490493834018707, 0.3902077376842499, 0.5912492424249649, 0.6142016500234604, 0.5541591793298721 ], "p_value": 0.0081, "mde": 0.06291635027911027, "mde_rel_pct": 35.984327690640534, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted_inactive_state_change": 0.0, "observed_baseline_inactive_change": 0.0, "observed_idea_inactive_change": 0.0, "observed_baseline_event_change": 3.591756582260132, "observed_idea_event_change": 1.8746105432510376, "idea_active_fraction": 0.9478124976158142, "predicted_active_fraction_is_data_dependent": true, "confirmed": true }, "protocol_notes": { "structural_match": "sequence-level temporal forecasting; recurrent state transition replacement", "baseline_method": "explicit residual Euler with one chronological transition per token", "idea_method": "implicit residual solve with event-clock deltas", "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "epochs": 15, "n_train": 400, "n_test": 200 } }