{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.0045, "amp": 0.15 }, "sweep": [ { "cfg": { "lr": 0.0015, "amp": 0.15 }, "mean": 0.0011289938556728885 }, { "cfg": { "lr": 0.0015, "amp": 0.3 }, "mean": 0.0011289938556728885 }, { "cfg": { "lr": 0.0015, "amp": 0.45 }, "mean": 0.0011289938556728885 }, { "cfg": { "lr": 0.003, "amp": 0.15 }, "mean": 0.0007190718897618353 }, { "cfg": { "lr": 0.003, "amp": 0.3 }, "mean": 0.0007190718897618353 }, { "cfg": { "lr": 0.003, "amp": 0.45 }, "mean": 0.0007190718897618353 }, { "cfg": { "lr": 0.0045, "amp": 0.15 }, "mean": 0.0005692571285180748 }, { "cfg": { "lr": 0.0045, "amp": 0.3 }, "mean": 0.0005692571285180748 }, { "cfg": { "lr": 0.0045, "amp": 0.45 }, "mean": 0.0005692571285180748 } ], "full": { "mean": 0.0004823376857530093, "std": 0.00019029999594897276, "per_seed": [ 0.0004577531653922051, 0.00043891146196983755, 0.0004620451363734901, 0.0009183187503367662, 0.000296697486191988, 0.0002411661989754066, 0.000499835005030036, 0.0005439742817543447 ], "n": 8 } }, "idea": { "mean": 0.0007068453487590887, "std": 0.00016523085279349575, "per_seed": [ 0.0007048308616504073, 0.0005210391827858984, 0.000925735046621412, 0.0009892641101032495, 0.0005646041827276349, 0.0005265368381515145, 0.0006699995719827712, 0.0007527529960498214 ], "n": 8 }, "comparison": { "delta_mean": 0.00022450766300607938, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0002470776962582022, 8.21277208160609e-05, 0.00046368991024792194, 7.094535976648331e-05, 0.0002679066965356469, 0.00028537063917610794, 0.00017016456695273519, 0.00020877871429547668 ], "p_value": 0.0081, "mde": 0.00010498848390242133, "mde_rel_pct": 21.76659361345918, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "period": 8, "predicted_transverse_multiplier": 0.19839029955701754, "observed_trained_model_multiplier": 0.9998654896163849, "ratio_observed_to_predicted": 5.039891022136507, "confirmed": false, "seed": 0, "probe": "full_batch_gradient_on_trained_rnn", "idea_grid": [ { "cfg": { "lr": 0.0015, "amp": 0.15 }, "result": { "mean": 0.0011780593122239225, "std": 0.00032624222582114425, "per_seed": [ 0.001007628976367414, 0.0009621493518352509, 0.00144378119148314, 0.001640895614400506, 0.0007246441091410816, 0.0009201627690345049, 0.0010880414629355073, 0.001637171022593975 ], "n": 8 } }, { "cfg": { "lr": 0.0015, "amp": 0.3 }, "result": { "mean": 0.0011592258815653622, "std": 0.0003165982136162725, "per_seed": [ 0.0010295703541487455, 0.0009471527300775051, 0.0013883747160434723, 0.0016039481852203608, 0.0007215833757072687, 0.0008863679831847548, 0.0010725036263465881, 0.0016243060817942023 ], "n": 8 } }, { "cfg": { "lr": 0.0015, "amp": 0.45 }, "result": { "mean": 0.001143339708505664, "std": 0.0003078421194445482, "per_seed": [ 0.001056911307387054, 0.0009342115954495966, 0.0013383073965087533, 0.0015667646657675505, 0.0007180622196756303, 0.0008587845950387418, 0.0010603303089737892, 0.0016133455792441964 ], "n": 8 } }, { "cfg": { "lr": 0.003, "amp": 0.15 }, "result": { "mean": 0.0007068453487590887, "std": 0.00016523085279349575, "per_seed": [ 0.0007048308616504073, 0.0005210391827858984, 0.000925735046621412, 0.0009892641101032495, 0.0005646041827276349, 0.0005265368381515145, 0.0006699995719827712, 0.0007527529960498214 ], "n": 8 } }, { "cfg": { "lr": 0.003, "amp": 0.3 }, "result": { "mean": 0.0007164533963077702, "std": 0.00017887676692651688, "per_seed": [ 0.0007223670254461467, 0.000520958798006177, 0.0009306888096034527, 0.001032140338793397, 0.0005676168366335332, 0.0005160922301001847, 0.0006507713696919382, 0.0007909917621873319 ], "n": 8 } }, { "cfg": { "lr": 0.003, "amp": 0.45 }, "result": { "mean": 0.0007457361061824486, "std": 0.0001965598982264345, "per_seed": [ 0.0007489511044695973, 0.0005425239796750247, 0.0009634686284698546, 0.0010984869441017509, 0.0005722329951822758, 0.0005411882302723825, 0.0006400459678843617, 0.000858990999404341 ], "n": 8 } }, { "cfg": { "lr": 0.0045, "amp": 0.15 }, "result": { "mean": 0.0008661484971526079, "std": 0.00018684411923707776, "per_seed": [ 0.0008908140589483082, 0.0006379403057508171, 0.0011151200160384178, 0.0011663035256788135, 0.0006185474921949208, 0.0007536062621511519, 0.000888270209543407, 0.0008585861069150269 ], "n": 8 } }, { "cfg": { "lr": 0.0045, "amp": 0.3 }, "result": { "mean": 0.0008304821385536343, "std": 0.00018304739075372, "per_seed": [ 0.000872891687322408, 0.000613598502241075, 0.0010845665819942951, 0.001105351373553276, 0.0005852845497429371, 0.0006964662461541593, 0.000861739506945014, 0.0008239586604759097 ], "n": 8 } }, { "cfg": { "lr": 0.0045, "amp": 0.45 }, "result": { "mean": 0.0008041092150961049, "std": 0.00018305490521590442, "per_seed": [ 0.0008585874456912279, 0.0006087046931497753, 0.0010566454147920012, 0.0010790202068164945, 0.0005509810871444643, 0.0006521863397210836, 0.0008244491182267666, 0.0008022994152270257 ], "n": 8 } } ], "protocol_note": "8 paired seeds; baseline and idea share lr/amp union; 400/100 samples" } }