{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.001864717691205442 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.0018400110420770943 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.0010901302302954718 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.0010647484887158498 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0 }, "mean": 0.0006186682076076977 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001 }, "mean": 0.0005735916565754451 } ], "full": { "mean": 0.0005480735380842816, "std": 0.00014996990905603093, "per_seed": [ 0.00046045987983234227, 0.0004709371132776141, 0.0004756892449222505, 0.0008872803882695735, 0.0004885699599981308, 0.00037048623198643327, 0.0006456486880779266, 0.0005855167983099818 ], "n": 8 }, "idea_grid": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "lambda": 0.05 }, "mean": 0.0018400110420770943 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "lambda": 0.15 }, "mean": 0.0018400110420770943 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001, "lambda": 0.3 }, "mean": 0.0018400110420770943 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "lambda": 0.05 }, "mean": 0.0010647484887158498 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "lambda": 0.15 }, "mean": 0.0010647484887158498 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "lambda": 0.3 }, "mean": 0.0010647484887158498 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "lambda": 0.05 }, "mean": 0.0005735916565754451 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "lambda": 0.15 }, "mean": 0.0005735916565754451 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0001, "lambda": 0.3 }, "mean": 0.0005735916565754451 } ] }, "idea": { "mean": 0.0005480735380842816, "std": 0.00014996990905603093, "per_seed": [ 0.00046045987983234227, 0.0004709371132776141, 0.0004756892449222505, 0.0008872803882695735, 0.0004885699599981308, 0.00037048623198643327, 0.0006456486880779266, 0.0005855167983099818 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "adding the interval-zonotope loss should change the trained model task metric", "observed_nn": { "baseline_mean_test_mse": 0.0005480735380842816, "idea_mean_test_mse": 0.0005480735380842816, "observed_delta": 0.0, "best_cfg": { "lr": 0.01, "weight_decay": 0.0001, "lambda": 0.05 } }, "toy_numeric_check": { "max_radius_recurrence_error": 1.6653345369377348e-16, "confirmed": true }, "confirmed": false, "note": "The arithmetic radius recurrence is exact, but this does not establish the mechanism on the trained benchmark models." } }