{ "bench_version": 1, "track": "oriented_line_quotient", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.1999999973922968 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.1287499964237213 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.06999999936670065 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.13249999564141035 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 0.2887499984353781 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "mean": 0.358749995008111 } ], "full": { "mean": 0.16249999217689037, "std": 0.17727096625015212, "per_seed": [ 0.07000000029802322, 0.1599999964237213, 0.06499999761581421, 0.03500000014901161, 0.2149999886751175, 0.11499999463558197, 0.6049999594688416, 0.03500000014901161 ], "n": 8 }, "architecture_note": "fixed oriented Sobel bank + scalar mean + shared CNN" }, "idea": { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.10562499891966581, "std": 0.047265044108773906, "per_seed": [ 0.08999999612569809, 0.07999999821186066, 0.1550000011920929, 0.07999999821186066, 0.1899999976158142, 0.07000000029802322, 0.14000000059604645, 0.03999999910593033 ], "n": 8, "architecture_note": "fixed oriented Sobel bank + doubled-angle zR,zI,q + shared CNN", "trials": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.10750000039115548, "std": 0.057445627674003165, "per_seed": [ 0.04999999701976776, 0.03500000014901161, 0.17000000178813934, 0.08500000089406967, 0.03999999910593033, 0.17000000178813934, 0.17000000178813934, 0.14000000059604645 ], "n": 8 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.10999999684281647, "std": 0.06689543906243255, "per_seed": [ 0.03500000014901161, 0.02499999850988388, 0.1899999976158142, 0.11499999463558197, 0.029999999329447746, 0.1599999964237213, 0.19499999284744263, 0.12999999523162842 ], "n": 8 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 0.10562499891966581, "std": 0.047265044108773906, "per_seed": [ 0.08999999612569809, 0.07999999821186066, 0.1550000011920929, 0.07999999821186066, 0.1899999976158142, 0.07000000029802322, 0.14000000059604645, 0.03999999910593033 ], "n": 8 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001 }, "mean": 0.12499999906867743, "std": 0.02936835116105255, "per_seed": [ 0.1550000011920929, 0.1550000011920929, 0.09999999403953552, 0.08500000089406967, 0.07999999821186066, 0.14000000059604645, 0.14000000059604645, 0.14499999582767487 ], "n": 8 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 0.1518749939277768, "std": 0.08975443257541645, "per_seed": [ 0.09999999403953552, 0.125, 0.3349999785423279, 0.07000000029802322, 0.14000000059604645, 0.07999999821186066, 0.09999999403953552, 0.26499998569488525 ], "n": 8 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0001 }, "mean": 0.23749999701976776, "std": 0.10037429990025486, "per_seed": [ 0.22499999403953552, 0.3449999988079071, 0.3050000071525574, 0.125, 0.32499998807907104, 0.07999999821186066, 0.3449999988079071, 0.14999999105930328 ], "n": 8 } ] }, "comparison": { "delta_mean": -0.05687499325722456, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.019999995827674866, -0.07999999821186066, 0.09000000357627869, 0.044999998062849045, -0.024999991059303284, -0.044999994337558746, -0.4649999588727951, 0.004999998956918716 ], "p_value": 0.54375, "mde": 0.14480774970584148, "mde_rel_pct": 89.11246564751222, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "predicted": { "pi_rotation_mean_pool_error": 0.0, "q_pi_rotation_error": 0.0, "90deg_doubled_angle_relation": "zR,zI should sign-flip" }, "observed": { "pi_rotation_mean_pool_error": 0.09535165876150131, "q_pi_rotation_error": 0.007520223036408424, "90deg_relation_abs_error": 0.23041518032550812 }, "tolerance": { "pi_rotation_mean_pool_error": 0.03, "q_pi_rotation_error": 0.03, "90deg_relation_abs_error": 0.1 }, "confirmed": false, "measurement": "trained idea model on held-out CIFAR test images" }, "custom_track": { "name": "oriented_line_quotient", "file": "custom_orientation_lines.py", "domain": "vision_orientation" }, "protocol_note": "custom oriented-line subset, 400/200 samples, 8 epochs, 8 paired seeds; baseline sweep uses 4 seeds then full best config." }