Residual-Relaxed Trajectory Sampling / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.0015
 15        },
 16        "mean": 0.0011108634498668835
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.0008105679735308513
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.000628942609182559
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.0005640739254886284,
 33      "std": 0.0001367984084942288,
 34      "per_seed": [
 35        0.00048537924885749817,
 36        0.0007160367094911635,
 37        0.000499650021083653,
 38        0.0008147044572979212,
 39        0.0004540993832051754,
 40        0.0005191828240640461,
 41        0.0003816201351583004,
 42        0.0006419186247512698
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.0005420081324700732,
 49    "std": 0.00013960018191357758,
 50    "per_seed": [
 51      0.000509127858094871,
 52      0.0005584119935519993,
 53      0.000469617429189384,
 54      0.0008545061573386192,
 55      0.00044199760304763913,
 56      0.0003986096999142319,
 57      0.00044967373833060265,
 58      0.0006541205802932382
 59    ],
 60    "n": 8,
 61    "best_cfg": {
 62      "lr": 0.006,
 63      "alpha": 2.0,
 64      "beta": 0.9,
 65      "sigma": 0.05
 66    },
 67    "sweep": [
 68      {
 69        "cfg": {
 70          "lr": 0.0015,
 71          "alpha": 1.0,
 72          "beta": 0.9,
 73          "sigma": 0.05
 74        },
 75        "mean": 0.0013087970073684119
 76      },
 77      {
 78        "cfg": {
 79          "lr": 0.003,
 80          "alpha": 1.5,
 81          "beta": 0.9,
 82          "sigma": 0.05
 83        },
 84        "mean": 0.0008830113292788155
 85      },
 86      {
 87        "cfg": {
 88          "lr": 0.006,
 89          "alpha": 2.0,
 90          "beta": 0.9,
 91          "sigma": 0.05
 92        },
 93        "mean": 0.0005420081324700732
 94      }
 95    ]
 96  },
 97  "comparison": {
 98    "delta_mean": -2.206579301855527e-05,
 99    "idea_wins": 4,
100    "n_pairs": 8,
101    "per_seed_diffs": [
102      2.3748609237372875e-05,
103      -0.00015762471593916416,
104      -3.003259189426899e-05,
105      3.980170004069805e-05,
106      -1.2101780157536268e-05,
107      -0.00012057312414981425,
108      6.805360317230225e-05,
109      1.2201955541968346e-05
110    ],
111    "p_value": 0.44995,
112    "mde": 6.588809659856915e-05,
113    "mde_rel_pct": 11.680755592716622,
114    "verdict": "no significant win",
115    "system_worked": false
116  },
117  "protocol_notes": {
118    "epochs": 8,
119    "n_train": 1200,
120    "n_test": 400,
121    "batch": 128,
122    "track_choice": "dynamics matches stability/control and multi-step pendulum rollouts",
123    "idea": "residual-adaptive candidate trajectory sampling",
124    "lr_union": [
125      0.0015,
126      0.003,
127      0.006
128    ]
129  },
130  "mechanism_signature": {
131    "prediction": "larger trained-model observed residual induces larger temperature and flatter candidate weights",
132    "observed_residual_mean": 0.01952467652328778,
133    "observed_residual_p90": 0.03243881464004517,
134    "observed_ESS_low_residual": 25.594260510103627,
135    "observed_ESS_high_residual": 28.17312607209512,
136    "ESS_ratio_high_over_low": 1.1007595261825773,
137    "confirmed": true
138  }
139}