Seed-Anchored Budgeted Graph Context / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "graph_context_budget",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.09124999865889549
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.03874999890103936
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.04374999878928065
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.0418749984819442,
 33      "std": 0.006091745648538752,
 34      "per_seed": [
 35        0.03500000014901161,
 36        0.044999998062849045,
 37        0.044999998062849045,
 38        0.029999999329447746,
 39        0.044999998062849045,
 40        0.03999999910593033,
 41        0.044999998062849045,
 42        0.04999999701976776
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "per_seed": [
 49      0.03500000014901161,
 50      0.044999998062849045,
 51      0.044999998062849045,
 52      0.029999999329447746,
 53      0.044999998062849045,
 54      0.03999999910593033,
 55      0.044999998062849045,
 56      0.04999999701976776
 57    ],
 58    "mean": 0.0418749984819442,
 59    "lr": 0.003,
 60    "mode": "anchored",
 61    "signature_observed_input_abs_mean": 0.7980227172374725,
 62    "trained_model_accuracy": 0.9581250015180558
 63  },
 64  "comparison": {
 65    "delta_mean": 0.0,
 66    "idea_wins": 0,
 67    "n_pairs": 8,
 68    "per_seed_diffs": [
 69      0.0,
 70      0.0,
 71      0.0,
 72      0.0,
 73      0.0,
 74      0.0,
 75      0.0,
 76      0.0
 77    ],
 78    "p_value": 1.0,
 79    "mde": 0.0,
 80    "mde_rel_pct": 0.0,
 81    "verdict": "no measurable effect",
 82    "system_worked": false
 83  },
 84  "custom_track": {
 85    "name": "graph_context_budget",
 86    "file": "bench_graph_context.py",
 87    "domain": "retrieval"
 88  },
 89  "protocol_notes": "8 paired seeds; baseline and idea share task, MLP, epochs, batch, and lr union; lower err is better.",
 90  "mechanism_signature": {
 91    "predicted_D_over_B": 3.0,
 92    "observed_candidate_units": 24,
 93    "observed_budget_units": 8,
 94    "predicted_anchored_gold_recall": 1.0,
 95    "observed_anchored_gold_recall": 1.0,
 96    "observed_global_gold_recall": 0.3333333333333333,
 97    "trained_anchored_accuracy": 0.9581250015180558,
 98    "trained_baseline_accuracy": 0.0418749984819442,
 99    "repeated_context_identical": true,
100    "confirmed": true
101  }
102}