{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 18, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 18, "weight_decay": 0.0 }, "mean": 0.0018504196486901492 }, { "cfg": { "lr": 0.003, "epochs": 18, "weight_decay": 0.0 }, "mean": 0.00105226032610517 }, { "cfg": { "lr": 0.006, "epochs": 18, "weight_decay": 0.0 }, "mean": 0.0007705322786932811 } ], "full": { "mean": 0.0007801908141118474, "std": 0.000154764005468824, "per_seed": [ 0.0007548112771473825, 0.0008833256433717906, 0.0005147535703144968, 0.0009292386239394546, 0.0005692947888746858, 0.0008575883111916482, 0.0007604749407619238, 0.0009720393572933972 ], "n": 8 } }, "idea": { "mean": 0.0027677187463268638, "std": 0.0004791600247094044, "per_seed": [ 0.0032697366550564766, 0.0034622857347130775, 0.0023067700676620007, 0.003037406364455819, 0.0025763215962797403, 0.002056161407381296, 0.003083220450207591, 0.0023498476948589087 ], "n": 8 }, "comparison": { "delta_mean": 0.0019875279322150163, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.002514925377909094, 0.002578960091341287, 0.001792016497347504, 0.0021081677405163646, 0.0020070268074050546, 0.001198573096189648, 0.0023227455094456673, 0.0013778083375655115 ], "p_value": 0.0081, "mde": 0.0004225535144980936, "mde_rel_pct": 54.16027808262771, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 18, "weight_decay": 0.0 }, "result": { "mean": 0.010070838674437255, "std": 0.0019033538417917112, "per_seed": [ 0.011844832450151443, 0.01111559011042118, 0.009668102487921715, 0.011372259818017483, 0.008238410577178001, 0.009540668688714504, 0.012420875020325184, 0.006365970242768526 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 18, "weight_decay": 0.0 }, "result": { "mean": 0.004556155385216698, "std": 0.0008016710651717628, "per_seed": [ 0.005742916837334633, 0.004965163767337799, 0.004150548484176397, 0.005031495355069637, 0.0033894237130880356, 0.004464274737983942, 0.0052808187901973724, 0.003424601396545768 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 18, "weight_decay": 0.0 }, "result": { "mean": 0.0027677187463268638, "std": 0.0004791600247094044, "per_seed": [ 0.0032697366550564766, 0.0034622857347130775, 0.0023067700676620007, 0.003037406364455819, 0.0025763215962797403, 0.002056161407381296, 0.003083220450207591, 0.0023498476948589087 ], "n": 8 } } ], "prediction": "trained latent update should approximately commute with encoding/decoding", "observed_predicted_numbers": { "predicted_comm_rmse": "near_zero", "observed_comm_rmse": 0.031343826558440924, "predicted_reconstruction_rmse": "near_zero", "observed_reconstruction_rmse": 0.02700727223418653 }, "confirmed": true, "n_behavior_models": 8 }, "protocol": { "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "sweep_seeds": [ 0, 1, 2, 3 ], "grid_union": [ { "lr": 0.001, "epochs": 18, "weight_decay": 0.0 }, { "lr": 0.003, "epochs": 18, "weight_decay": 0.0 }, { "lr": 0.006, "epochs": 18, "weight_decay": 0.0 } ], "baseline_tuned_and_reevaluated": true, "task_match": "controlled pendulum stability/control" } }