{ "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.8724999874830246 }, { "cfg": { "lr": 0.003 }, "mean": 0.8224999606609344 }, { "cfg": { "lr": 0.01 }, "mean": 0.8424999862909317 } ], "full": { "mean": 0.8362499698996544, "std": 0.05694021657567501, "per_seed": [ 0.7999999523162842, 0.8499999642372131, 0.9099999666213989, 0.7299999594688416, 0.8499999642372131, 0.8999999761581421, 0.8650000095367432, 0.7849999666213989 ], "n": 8 } }, "idea": { "mean": 0.7549999803304672, "std": 0.04500000261598574, "per_seed": [ 0.7149999737739563, 0.8100000023841858, 0.7899999618530273, 0.7649999856948853, 0.7299999594688416, 0.73499995470047, 0.8149999976158142, 0.6800000071525574 ], "n": 8 }, "comparison": { "delta_mean": -0.08124998956918716, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.08499997854232788, -0.039999961853027344, -0.12000000476837158, 0.0350000262260437, -0.12000000476837158, -0.16500002145767212, -0.050000011920928955, -0.10499995946884155 ], "p_value": 0.0152, "mde": 0.051725334839130825, "mde_rel_pct": 6.185391533746494, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "math_check": { "analytic_jacobian": [ 0.28400640000000005, 0.018753524999999997 ], "finite_difference": [ 0.28400640005137034, 0.01875352500860239 ], "max_abs_error": 5.137029690516215e-11, "cubic_gain_ratio": 0.5120000000000001 }, "trained_behavior": { "prediction": "local Jacobian controls perturbation amplification; cubic neutral derivative scales as lambda^3", "observed_trained_pool_perturbation_gain_mean": 2.372135490179062, "observed_trained_pool_perturbation_gain_std": 0.5063665608536517, "trained_coefficients": [ [ 0.31366875767707825, 0.6198698282241821 ], [ 0.3111434876918793, 0.6182912588119507 ], [ 0.3147978186607361, 0.6183661222457886 ], [ 0.3124944567680359, 0.6156984567642212 ], [ 0.3157919943332672, 0.6252565383911133 ], [ 0.3116231858730316, 0.6227443814277649 ], [ 0.3117213547229767, 0.6220788955688477 ], [ 0.3104568421840668, 0.6197155117988586 ] ], "predicted_lambda_cubic_gain": true, "confirmed": false }, "baseline_full_by_lr": { "0.001": { "mean": 0.8631249815225601, "std": 0.03141830539156022, "per_seed": [ 0.8650000095367432, 0.8700000047683716, 0.9099999666213989, 0.8449999690055847, 0.7999999523162842, 0.8899999856948853, 0.8449999690055847, 0.8799999952316284 ], "n": 8 }, "0.003": { "mean": 0.8362499698996544, "std": 0.05694021657567501, "per_seed": [ 0.7999999523162842, 0.8499999642372131, 0.9099999666213989, 0.7299999594688416, 0.8499999642372131, 0.8999999761581421, 0.8650000095367432, 0.7849999666213989 ], "n": 8 }, "0.01": { "mean": 0.8606249839067459, "std": 0.049588159207269375, "per_seed": [ 0.8849999904632568, 0.8799999952316284, 0.8700000047683716, 0.73499995470047, 0.8449999690055847, 0.8899999856948853, 0.8899999856948853, 0.8899999856948853 ], "n": 8 } }, "idea_sweep": [ { "lr": 0.001, "mean": 0.7549999803304672 }, { "lr": 0.003, "mean": 0.8287499770522118 }, { "lr": 0.01, "mean": 0.9049999788403511 } ] }, "protocol_note": "Vision selected because the idea changes convolutional hierarchical feature propagation; baseline and idea share convolution/classifier stages and differ only in pooling mechanism." }