{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.0042995543335564435 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.003432174737099558 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.0014865802077110857 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 0.0014641905727330595 } ], "full": { "mean": 0.0014106978487689048, "std": 0.00038184104551606325, "per_seed": [ 0.0009313806658610702, 0.0018688973505049944, 0.0010692982468754053, 0.0019871860276907682, 0.0009491611272096634, 0.0014028067234903574, 0.0016651722835376859, 0.0014116803649812937 ], "n": 8 } }, "idea": { "mean": 0.0014106978487689048, "std": 0.00038184104551606325, "per_seed": [ 0.0009313806658610702, 0.0018688973505049944, 0.0010692982468754053, 0.0019871860276907682, 0.0009491611272096634, 0.0014028067234903574, 0.0016651722835376859, 0.0014116803649812937 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "definition": "trained-model endpoint work proxy vs endpoint squared error", "mean_work_proxy": -0.09426483511924744, "std_work_proxy": 0.24112743139266968, "mean_test_mse": 0.0009313806076534092, "corr_work_error": -0.5097475039344403, "predicted_direction": "work penalty should reduce endpoint energy change", "observed_direction": "reduced", "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "lambda": 0.0 }, "result": { "mean": 0.0014106978487689048, "std": 0.00038184104551606325, "per_seed": [ 0.0009313806658610702, 0.0018688973505049944, 0.0010692982468754053, 0.0019871860276907682, 0.0009491611272096634, 0.0014028067234903574, 0.0016651722835376859, 0.0014116803649812937 ], "n": 8 } }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "lambda": 0.01 }, "result": { "mean": 0.0022155136612127535, "std": 0.0009111505580800969, "per_seed": [ 0.0026169263292104006, 0.0008814591565169394, 0.002344637643545866, 0.001455318764783442, 0.0015512269455939531, 0.003643145551905036, 0.0034239226952195168, 0.0018074722029268742 ], "n": 8 } }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "lambda": 0.05 }, "result": { "mean": 0.020211070426739752, "std": 0.0041872810874073125, "per_seed": [ 0.0175981055945158, 0.014253576286137104, 0.024302082136273384, 0.020239518955349922, 0.014925491064786911, 0.025781074538826942, 0.02489893138408661, 0.019689783453941345 ], "n": 8 } }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "lambda": 0.05 }, "result": { "mean": 0.03044215077534318, "std": 0.008291443683791245, "per_seed": [ 0.045904748141765594, 0.022312993183732033, 0.031132273375988007, 0.03332684561610222, 0.03957861661911011, 0.025154752656817436, 0.025864429771900177, 0.020262546837329865 ], "n": 8 } }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "lambda": 0.05 }, "result": { "mean": 0.031030800193548203, "std": 0.008264055684726617, "per_seed": [ 0.030995534732937813, 0.030705397948622704, 0.023237835615873337, 0.049849774688482285, 0.0321778804063797, 0.034446511417627335, 0.022313375025987625, 0.024520091712474823 ], "n": 8 } } ], "protocol": { "epochs": 12, "n_train": 400, "n_test": 200, "batch": 128, "paired_seeds": [ 0, 1, 2, 3, 4, 5, 6, 7 ], "structural_match": "dynamics/control" } }