{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.0014785313687752932 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.0014645301271229982 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.0008221298194257542 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.0008076394879026338 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.00032767555967438966 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 0.00036696675670100376 } ], "full": { "mean": 0.0002959608482342446, "std": 0.0001316782688333712, "per_seed": [ 0.0004682304570451379, 0.0003980887704528868, 0.00017163399024866521, 0.0002727490209508687, 0.00015086510393302888, 0.00030392719781957567, 0.00012582281487993896, 0.00047636943054385483 ], "n": 8 } }, "idea": { "mean": 0.001754267912474461, "std": 0.00043015553066540066, "per_seed": [ 0.0012427795445546508, 0.001973426202312112, 0.0013205275172367692, 0.0024030047934502363, 0.002149099251255393, 0.0012187783140689135, 0.0020814703311771154, 0.0016450573457404971 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.024796552257612348, "std": 0.004088271419227938, "per_seed": [ 0.022675156593322754, 0.02744518220424652, 0.023942390456795692, 0.03346814215183258, 0.025026222690939903, 0.019205331802368164, 0.021013041958212852, 0.025596950203180313 ] }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.024904589634388685, "std": 0.004089925380114752, "per_seed": [ 0.022724661976099014, 0.02740549109876156, 0.024043483659625053, 0.03363170102238655, 0.025220675393939018, 0.01937870867550373, 0.021087665110826492, 0.025744330137968063 ] }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.006038541585439816, "std": 0.002237967748799504, "per_seed": [ 0.00579321151599288, 0.006784805096685886, 0.005182903725653887, 0.011018984019756317, 0.005261050537228584, 0.0027950687799602747, 0.00687775295227766, 0.004594556055963039 ] }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.006389912683516741, "std": 0.0023475474959639103, "per_seed": [ 0.006135317496955395, 0.007102395873516798, 0.005393301136791706, 0.011719641275703907, 0.005564150866121054, 0.0029893447645008564, 0.007032498717308044, 0.005182651337236166 ] }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.001754267912474461, "std": 0.00043015553066540066, "per_seed": [ 0.0012427795445546508, 0.001973426202312112, 0.0013205275172367692, 0.0024030047934502363, 0.002149099251255393, 0.0012187783140689135, 0.0020814703311771154, 0.0016450573457404971 ] }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 0.0017732195847202092, "std": 0.0004718425245521136, "per_seed": [ 0.001313930144533515, 0.002031040843576193, 0.0011662384495139122, 0.002488275757059455, 0.0022803107276558876, 0.0012248011771589518, 0.002009331015869975, 0.0016718285623937845 ] } ] }, "comparison": { "delta_mean": 0.0014583070642402163, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0007745490875095129, 0.001575337431859225, 0.001148893526988104, 0.0021302557724993676, 0.001998234147322364, 0.0009148511162493378, 0.0019556475162971765, 0.0011686879151966423 ], "p_value": 0.0081, "mde": 0.0004409319997531043, "mde_rel_pct": 148.98321936289327, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "basis_size": 25, "trained_model_observations": [ { "seed": 0, "metric": 0.0012427795445546508, "mean_coeff_norm": 0.28018829226493835, "max_coeff_norm": 0.6576406955718994, "mass_error": 2.384185791015625e-07 }, { "seed": 1, "metric": 0.001973426202312112, "mean_coeff_norm": 0.30172738432884216, "max_coeff_norm": 0.6713038086891174, "mass_error": 2.384185791015625e-07 }, { "seed": 2, "metric": 0.0013205275172367692, "mean_coeff_norm": 0.31470319628715515, "max_coeff_norm": 0.7678529024124146, "mass_error": 1.7881393432617188e-07 }, { "seed": 3, "metric": 0.0024030047934502363, "mean_coeff_norm": 0.3005197048187256, "max_coeff_norm": 0.6498276591300964, "mass_error": 2.384185791015625e-07 }, { "seed": 4, "metric": 0.002149099251255393, "mean_coeff_norm": 0.304610013961792, "max_coeff_norm": 0.6628603935241699, "mass_error": 2.384185791015625e-07 }, { "seed": 5, "metric": 0.0012187783140689135, "mean_coeff_norm": 0.28839680552482605, "max_coeff_norm": 0.5926362872123718, "mass_error": 1.7881393432617188e-07 }, { "seed": 6, "metric": 0.0020814703311771154, "mean_coeff_norm": 0.30479809641838074, "max_coeff_norm": 0.6872127056121826, "mass_error": 2.384185791015625e-07 }, { "seed": 7, "metric": 0.0016450573457404971, "mean_coeff_norm": 0.288260281085968, "max_coeff_norm": 0.6056498885154724, "mass_error": 1.7881393432617188e-07 } ], "predicted": "nonnegative unit-mass coefficients remain bounded", "observed_mean_mass_error": 2.1606683731079102e-07, "observed_max_coeff_norm": 0.7678529024124146, "confirmed": true, "math_sanity": { "mass_error": 2.220446049250313e-16, "rho": 1.0000000000000004, "observed_log_norm_slope": -3.223008136576186e-16, "predicted_log_rho": 4.440892098500625e-16, "slope_abs_error": 7.663900235076811e-16 } }, "protocol_notes": { "n_train": 800, "n_test": 400, "epochs": 12, "baseline_and_idea_lr_union": [ 0.001, 0.003, 0.01 ], "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "architecture": "same 64-unit GRU encoder; scalar linear head vs PF RBF expectation head" } }