{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.005, "epochs": 20, "batch": 128 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 20, "batch": 128 }, "mean": 0.022121376357972622 }, { "cfg": { "lr": 0.002, "epochs": 20, "batch": 128 }, "mean": 0.016339546535164118 }, { "cfg": { "lr": 0.003, "epochs": 20, "batch": 128 }, "mean": 0.012747961794957519 }, { "cfg": { "lr": 0.005, "epochs": 20, "batch": 128 }, "mean": 0.009133224608376622 } ], "full": { "mean": 0.008694025862496346, "std": 0.0014232314536370147, "per_seed": [ 0.007357772905379534, 0.010028759948909283, 0.007755488622933626, 0.011390876956284046, 0.006608752999454737, 0.008554458618164062, 0.008871559053659439, 0.008984537795186043 ], "n": 8 } }, "idea": { "mean": 0.004228192905429751, "std": 0.000991539149802616, "per_seed": [ 0.003527658525854349, 0.0032258331775665283, 0.0044794389978051186, 0.00498495576903224, 0.0034572044387459755, 0.003025196958333254, 0.005306838545948267, 0.005818416830152273 ], "n": 8, "config": { "lr": 0.005, "epochs": 20, "batch": 128 }, "records": [ { "seed": 0, "lr": 0.005, "metric": 0.003527658525854349, "last_loss": 0.005181310921907425, "inverse_error": 1.1013007679139264e-05, "condition_mean": 1.57774817943573, "observed_latent_mutation_mean": 1.7316803932189941, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 1.1013007679139264e-05, "observed_exchange_mean": 5.360846996307373 } }, { "seed": 1, "lr": 0.005, "metric": 0.0032258331775665283, "last_loss": 0.002949269898235798, "inverse_error": 7.703845767537132e-06, "condition_mean": 4.959653377532959, "observed_latent_mutation_mean": 1.1563115119934082, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 7.703845767537132e-06, "observed_exchange_mean": 2.966520309448242 } }, { "seed": 2, "lr": 0.005, "metric": 0.0044794389978051186, "last_loss": 0.004607265554368496, "inverse_error": 1.0601612302707508e-05, "condition_mean": 8.03824234008789, "observed_latent_mutation_mean": 1.345355749130249, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 1.0601612302707508e-05, "observed_exchange_mean": 4.600798606872559 } }, { "seed": 3, "lr": 0.005, "metric": 0.00498495576903224, "last_loss": 0.0036369254160672428, "inverse_error": 7.407511475321371e-06, "condition_mean": 4.844733238220215, "observed_latent_mutation_mean": 1.294931173324585, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 7.407511475321371e-06, "observed_exchange_mean": 3.5481743812561035 } }, { "seed": 4, "lr": 0.005, "metric": 0.0034572044387459755, "last_loss": 0.0035951392445713283, "inverse_error": 8.508128303219564e-06, "condition_mean": 5.653021335601807, "observed_latent_mutation_mean": 3.2120485305786133, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 8.508128303219564e-06, "observed_exchange_mean": 17.611797332763672 } }, { "seed": 5, "lr": 0.005, "metric": 0.003025196958333254, "last_loss": 0.004070228198543191, "inverse_error": 9.308403605245985e-06, "condition_mean": 7.194035053253174, "observed_latent_mutation_mean": 0.8057935237884521, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 9.308403605245985e-06, "observed_exchange_mean": 1.7656463384628296 } }, { "seed": 6, "lr": 0.005, "metric": 0.005306838545948267, "last_loss": 0.0037229776568710802, "inverse_error": 6.436449439206626e-06, "condition_mean": 3.7536144256591797, "observed_latent_mutation_mean": 1.0492488145828247, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 6.436449439206626e-06, "observed_exchange_mean": 2.438058853149414 } }, { "seed": 7, "lr": 0.005, "metric": 0.005818416830152273, "last_loss": 0.004587573418393731, "inverse_error": 1.0803267286974005e-05, "condition_mean": 6.939658164978027, "observed_latent_mutation_mean": 0.627605140209198, "predicted_vs_observed_probe": { "predicted_inverse_error": 0.0, "observed_inverse_error": 1.0803267286974005e-05, "observed_exchange_mean": 1.0146958827972412 } } ], "sweep": [ { "cfg": { "lr": 0.001, "epochs": 20, "batch": 128 }, "mean": 0.02207344933412969 }, { "cfg": { "lr": 0.002, "epochs": 20, "batch": 128 }, "mean": 0.011823555920273066 }, { "cfg": { "lr": 0.003, "epochs": 20, "batch": 128 }, "mean": 0.007646026671864092 }, { "cfg": { "lr": 0.005, "epochs": 20, "batch": 128 }, "mean": 0.004228192905429751 } ] }, "comparison": { "delta_mean": -0.0044658329570665956, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.0038301143795251846, -0.006802926771342754, -0.0032760496251285076, -0.006405921187251806, -0.003151548560708761, -0.005529261659830809, -0.003564720507711172, -0.0031661209650337696 ], "p_value": 0.0081, "mde": 0.0012800509368697734, "mde_rel_pct": 14.723339418526043, "verdict": "idea better (significant)", "system_worked": true }, "protocol_note": "8 paired seeds; baseline sweep and idea sweep share lr union; official train_model", "mechanism_signature": { "predicted_inverse_error": 0.0, "observed_inverse_error_mean": 8.972778232418932e-06, "observed_inverse_error_max": 1.1013007679139264e-05, "observed_condition_mean": 5.370088264346123, "confirmed": true }, "custom_track": null }