{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "penalty": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "penalty": 0.0 }, "mean": 0.0012329648743616417 }, { "cfg": { "lr": 0.003, "penalty": 0.0 }, "mean": 0.0007095315813785419 }, { "cfg": { "lr": 0.006, "penalty": 0.0 }, "mean": 0.00044968911970499903 }, { "cfg": { "lr": 0.001, "penalty": 0.01 }, "mean": 0.0012329648743616417 }, { "cfg": { "lr": 0.003, "penalty": 0.01 }, "mean": 0.0007095315813785419 }, { "cfg": { "lr": 0.006, "penalty": 0.01 }, "mean": 0.00044968911970499903 }, { "cfg": { "lr": 0.001, "penalty": 0.05 }, "mean": 0.0012329648743616417 }, { "cfg": { "lr": 0.003, "penalty": 0.05 }, "mean": 0.0007095315813785419 }, { "cfg": { "lr": 0.006, "penalty": 0.05 }, "mean": 0.00044968911970499903 } ], "full": { "mean": 0.0003913900891348021, "std": 0.00014032323399353638, "per_seed": [ 0.0004547900171019137, 0.0005691215046681464, 0.0002539993729442358, 0.0005208455841057003, 0.00024503248278051615, 0.0003696440835483372, 0.00018239273049402982, 0.0005352949374355376 ], "n": 8 } }, "idea": { "mean": 0.00039220192411448807, "std": 0.00014200637399208092, "per_seed": [ 0.0004564015252981335, 0.0005712365382350981, 0.0002526967437006533, 0.0005346102407202125, 0.00024299033975694329, 0.0003629707789514214, 0.00018514976545702666, 0.0005315594607964158 ], "n": 8 }, "comparison": { "delta_mean": 8.118349796859547e-07, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 1.611508196219802e-06, 2.1150335669517517e-06, -1.3026292435824871e-06, 1.3764656614512205e-05, -2.042143023572862e-06, -6.673304596915841e-06, 2.7570349629968405e-06, -3.735476639121771e-06 ], "p_value": 0.7761, "mde": 5.127379977124008e-06, "mde_rel_pct": 1.3100433862437537, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.006, "penalty": 0.01 }, "mean": 0.00039220192411448807, "full": { "mean": 0.00039220192411448807, "std": 0.00014200637399208092, "per_seed": [ 0.0004564015252981335, 0.0005712365382350981, 0.0002526967437006533, 0.0005346102407202125, 0.00024299033975694329, 0.0003629707789514214, 0.00018514976545702666, 0.0005315594607964158 ], "n": 8 } }, { "cfg": { "lr": 0.006, "penalty": 0.05 }, "mean": 0.00040307095150637906, "full": { "mean": 0.00040307095150637906, "std": 0.0001521574206836284, "per_seed": [ 0.00046396625111810863, 0.0005876322975382209, 0.0002573703823145479, 0.0006015090038999915, 0.00024178977764677256, 0.0003508162626530975, 0.0001956480264198035, 0.00052583561046049 ], "n": 8 } }, { "cfg": { "lr": 0.002, "penalty": 0.01 }, "mean": 0.0009269535221392289, "full": { "mean": 0.0009269535221392289, "std": 0.0002406851422080141, "per_seed": [ 0.0007094648899510503, 0.0010170000605285168, 0.000680267927236855, 0.0011570906499400735, 0.0006066791247576475, 0.0008407899877056479, 0.0010742566082626581, 0.001330078928731382 ], "n": 8 } } ], "protocol_notes": "Dynamics is the structurally matched control/stability track; identical rnn_small systems and datasets, only training loss differs.", "mechanism_signature": { "prediction": "Lyapunov penalty lowers observed contraction-violation rate", "predicted_direction": "lower", "baseline_violation_rate": 0.8133333712816239, "idea_violation_rate": 0.8095833584666252, "baseline_mean_abs_prediction_over_theta": 1.1201488196849823, "idea_mean_abs_prediction_over_theta": 1.1020578742027283, "rho": 0.94, "confirmed": true }, "idea_selected_cfg": { "lr": 0.006, "penalty": 0.01 } }