{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0011778276093536988 }, { "cfg": { "lr": 0.003 }, "mean": 0.0007040829586912878 }, { "cfg": { "lr": 0.01 }, "mean": 0.00020319201576057822 } ], "full": { "mean": 0.00017096688088713563, "std": 0.00010126879946081006, "per_seed": [ 0.00029771021218039095, 0.0003086627402808517, 8.670530223753303e-05, 0.00011968980834353715, 6.000406574457884e-05, 0.00017784061492420733, 4.760668889502995e-05, 0.00026951561449095607 ], "n": 8 }, "idea_union_sweep_note": "baseline evaluated at every intervention learning rate; final baseline is its tuned best config" }, "idea": { "mean": 0.0006723387723468477, "std": 0.00030822213357971823, "per_seed": [ 0.000751153624150902, 0.0005644314223900437, 0.0010974465403705835, 0.0007808454683981836, 0.00016198267985600978, 0.0005583118181675673, 0.0003655186155810952, 0.0010990200098603964 ], "n": 8 }, "comparison": { "delta_mean": 0.0005013718914597121, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0004534434119705111, 0.000255768682109192, 0.0010107412381330505, 0.0006611556600546464, 0.00010197861411143094, 0.0003804712032433599, 0.00031791192668606527, 0.0008295043953694403 ], "p_value": 0.0081, "mde": 0.0002573449693961294, "mde_rel_pct": 150.52328735295612, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "A learned mixture should retain separated predictive modes and improve threshold-probability calibration when the trained task is multimodal.", "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0007984692638274282 }, { "cfg": { "lr": 0.003 }, "mean": 0.0057232904800912365 }, { "cfg": { "lr": 0.01 }, "mean": 0.012347540003247559 } ], "idea_nearby_full": { "0.001": { "mean": 0.0006723387723468477, "std": 0.00030822213357971823, "per_seed": [ 0.000751153624150902, 0.0005644314223900437, 0.0010974465403705835, 0.0007808454683981836, 0.00016198267985600978, 0.0005583118181675673, 0.0003655186155810952, 0.0010990200098603964 ], "n": 8 }, "0.003": { "mean": 0.07285039079579292, "std": 0.15517869917738045, "per_seed": [ 0.00048457394586876035, 0.00356022990308702, 0.0017170965438708663, 0.0171312615275383, 0.003046586411073804, 0.07597032189369202, 0.4785449206829071, 0.002348135458305478 ], "n": 8 }, "0.01": { "mean": 0.07427592801104765, "std": 0.17273816889805907, "per_seed": [ 0.04037663713097572, 0.0033035422675311565, 0.0027636890299618244, 0.002946291584521532, 0.0012332660844549537, 0.007603917736560106, 0.5301817059516907, 0.005798374302685261 ], "n": 8 } }, "trained_model_signature": { "n": 300, "test_mse": 0.000751153624150902, "predicted_mean_mode_separation": 0.5563346147537231, "predicted_mean_component_sd": 0.01935468427836895, "predicted_bimodal_fraction": 0.9566666483879089, "mixture_chance_abs_error": 0.015057117938995335, "moment_gaussian_chance_abs_error": 0.014270426034927342, "observed_event_rate": 0.47, "confirmed": false } }, "selection": { "idea_best_cfg": { "lr": 0.001 }, "epochs": 15, "n_train": 800, "n_test": 300, "structural_match": "dynamics: controlled pendulum multi-step target" } }