{ "bench_version": 1, "track": "graph_context_budget", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.09124999865889549 }, { "cfg": { "lr": 0.003 }, "mean": 0.03874999890103936 }, { "cfg": { "lr": 0.01 }, "mean": 0.04374999878928065 } ], "full": { "mean": 0.0418749984819442, "std": 0.006091745648538752, "per_seed": [ 0.03500000014901161, 0.044999998062849045, 0.044999998062849045, 0.029999999329447746, 0.044999998062849045, 0.03999999910593033, 0.044999998062849045, 0.04999999701976776 ], "n": 8 } }, "idea": { "per_seed": [ 0.03500000014901161, 0.044999998062849045, 0.044999998062849045, 0.029999999329447746, 0.044999998062849045, 0.03999999910593033, 0.044999998062849045, 0.04999999701976776 ], "mean": 0.0418749984819442, "lr": 0.003, "mode": "anchored", "signature_observed_input_abs_mean": 0.7980227172374725, "trained_model_accuracy": 0.9581250015180558 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "custom_track": { "name": "graph_context_budget", "file": "bench_graph_context.py", "domain": "retrieval" }, "protocol_notes": "8 paired seeds; baseline and idea share task, MLP, epochs, batch, and lr union; lower err is better.", "mechanism_signature": { "predicted_D_over_B": 3.0, "observed_candidate_units": 24, "observed_budget_units": 8, "predicted_anchored_gold_recall": 1.0, "observed_anchored_gold_recall": 1.0, "observed_global_gold_recall": 0.3333333333333333, "trained_anchored_accuracy": 0.9581250015180558, "trained_baseline_accuracy": 0.0418749984819442, "repeated_context_identical": true, "confirmed": true } }