Risk-Calibrated World-Model Gates / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 3.534919142111903e-05
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 7.330269568228687e-06
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 5.007404297430185e-06
 29      }
 30    ],
 31    "full": {
 32      "mean": 6.034935353227411e-06,
 33      "std": 2.324192087412265e-06,
 34      "per_seed": [
 35        3.5480811675370205e-06,
 36        5.396596407081233e-06,
 37        4.0187219383369666e-06,
 38        7.066217676765518e-06,
 39        3.6791009279113496e-06,
 40        7.341893251577858e-06,
 41        6.276848125708057e-06,
 42        1.0952023330901284e-05
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 7.2727560791463475e-06,
 49    "std": 3.341130715564463e-06,
 50    "per_seed": [
 51      6.330245923891198e-06,
 52      5.862209491169779e-06,
 53      3.913731234206352e-06,
 54      5.612296263279859e-06,
 55      6.7712248892348725e-06,
 56      1.0451367415953428e-05,
 57      4.5703227442572825e-06,
 58      1.467065067117801e-05
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 1.2378207259189367e-06,
 64    "idea_wins": 3,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      2.7821647563541774e-06,
 68      4.656130840885453e-07,
 69      -1.0499070413061418e-07,
 70      -1.4539214134856593e-06,
 71      3.092123961323523e-06,
 72      3.1094741643755697e-06,
 73      -1.7065253814507741e-06,
 74      3.7186273402767256e-06
 75    ],
 76    "p_value": 0.164,
 77    "mde": 1.8372299258490038e-06,
 78    "mde_rel_pct": 30.443241200031668,
 79    "verdict": "no significant win",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "critical_fraction": 0.2639999985694885,
 84    "baseline_critical_bad_rate": 0.0,
 85    "idea_critical_bad_rate": 0.0,
 86    "observed_bad_rate_reduction": 0.0,
 87    "required_rollouts_r_0.02_delta_0.05": 149,
 88    "confirmed": false
 89  },
 90  "idea_sweep": [
 91    {
 92      "cfg": {
 93        "lr": 0.001
 94      },
 95      "result": {
 96        "mean": 4.6562476200051606e-05,
 97        "std": 7.0209403088518815e-06,
 98        "per_seed": [
 99          3.4763717849273235e-05,
100          5.860313831362873e-05,
101          5.2090246754232794e-05,
102          4.800773604074493e-05,
103          3.818494951701723e-05,
104          4.759346120408736e-05,
105          4.485895624384284e-05,
106          4.839760367758572e-05
107        ],
108        "n": 8
109      }
110    },
111    {
112      "cfg": {
113        "lr": 0.003
114      },
115      "result": {
116        "mean": 1.1251939099565789e-05,
117        "std": 2.436469153192465e-06,
118        "per_seed": [
119          9.606156709196512e-06,
120          1.1305033694952726e-05,
121          6.192657565406989e-06,
122          1.2527690159913618e-05,
123          1.1936091141251381e-05,
124          1.4925769391993526e-05,
125          1.3000466424273327e-05,
126          1.0521647709538229e-05
127        ],
128        "n": 8
129      }
130    },
131    {
132      "cfg": {
133        "lr": 0.006
134      },
135      "result": {
136        "mean": 7.2727560791463475e-06,
137        "std": 3.341130715564463e-06,
138        "per_seed": [
139          6.330245923891198e-06,
140          5.862209491169779e-06,
141          3.913731234206352e-06,
142          5.612296263279859e-06,
143          6.7712248892348725e-06,
144          1.0451367415953428e-05,
145          4.5703227442572825e-06,
146          1.467065067117801e-05
147        ],
148        "n": 8
149      }
150    }
151  ],
152  "protocol_note": "Official registered dynamics track; baseline uses bench.train_model; idea changes only the training loss and shares model, data, epochs, batch, and lr grid."
153}