Particular-Integral Latent Reduction / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": "local_fallback_v1",
  3  "official_bench_available": false,
  4  "track": "dynamics_local_fallback",
  5  "model": "matched_mlp_vector_field",
  6  "metric_direction": "lower is better",
  7  "n_seeds": 8,
  8  "baseline": {
  9    "best_cfg": {
 10      "lr": 0.01
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001
 16        },
 17        "mean": 0.01556884746571896
 18      },
 19      {
 20        "cfg": {
 21          "lr": 0.003
 22        },
 23        "mean": 0.010132899816744612
 24      },
 25      {
 26        "cfg": {
 27          "lr": 0.01
 28        },
 29        "mean": 0.0029620238133835743
 30      }
 31    ],
 32    "full": {
 33      "mean": 0.0029620238133835743,
 34      "std": 0.0008645818873633603,
 35      "per_seed": [
 36        0.003073900949111419,
 37        0.0016451273987485137,
 38        0.0032487592544100607,
 39        0.004048458011050115,
 40        0.002277327041795729,
 41        0.00387901484680242,
 42        0.003407310436841726,
 43        0.0021162925683086086
 44      ],
 45      "n": 8
 46    }
 47  },
 48  "idea": {
 49    "best_cfg": {
 50      "lr": 0.01
 51    },
 52    "sweep": [
 53      {
 54        "cfg": {
 55          "lr": 0.001
 56        },
 57        "mean": 0.014254764885729543
 58      },
 59      {
 60        "cfg": {
 61          "lr": 0.003
 62        },
 63        "mean": 0.009376117992304955
 64      },
 65      {
 66        "cfg": {
 67          "lr": 0.01
 68        },
 69        "mean": 0.002827303512049362
 70      }
 71    ],
 72    "mean": 0.002827303512049362,
 73    "std": 0.0008420322490014024,
 74    "per_seed": [
 75      0.0029549427857062938,
 76      0.001637771580323033,
 77      0.003040002158883226,
 78      0.0036994233885366155,
 79      0.001987192630852519,
 80      0.00390026008958273,
 81      0.00334605700804218,
 82      0.002052778454468296
 83    ],
 84    "n": 8
 85  },
 86  "comparison": {
 87    "delta_mean": -0.00013472030133421237,
 88    "per_seed_diffs": [
 89      -0.0001189581634051251,
 90      -7.35581842548072e-06,
 91      -0.00020875709552683466,
 92      -0.00034903462251349975,
 93      -0.00029013441094321007,
 94      2.124524278031021e-05,
 95      -6.125342879954605e-05,
 96      -6.35141138403128e-05
 97    ],
 98    "p_value": 0.027237354085603113,
 99    "verdict": "idea better (significant)",
100    "system_worked": true
101  },
102  "math_check": {
103    "closure_zero_final_norm": 0.0,
104    "expected": 0.0
105  },
106  "mechanism_signature": {
107    "prediction": "closure model preserves zero gauge under rollout while baseline drifts",
108    "predicted_ratio_bound": 0.0,
109    "observed_baseline_max_drift": 0.05261170491576195,
110    "observed_idea_max_drift": 0.0,
111    "confirmed": true
112  }
113}