Risk-Calibrated World-Model Gates / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 3.534919142111903e-05
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 7.330269568228687e-06
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 5.007404297430185e-06
29 }
30 ],
31 "full": {
32 "mean": 6.034935353227411e-06,
33 "std": 2.324192087412265e-06,
34 "per_seed": [
35 3.5480811675370205e-06,
36 5.396596407081233e-06,
37 4.0187219383369666e-06,
38 7.066217676765518e-06,
39 3.6791009279113496e-06,
40 7.341893251577858e-06,
41 6.276848125708057e-06,
42 1.0952023330901284e-05
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 7.2727560791463475e-06,
49 "std": 3.341130715564463e-06,
50 "per_seed": [
51 6.330245923891198e-06,
52 5.862209491169779e-06,
53 3.913731234206352e-06,
54 5.612296263279859e-06,
55 6.7712248892348725e-06,
56 1.0451367415953428e-05,
57 4.5703227442572825e-06,
58 1.467065067117801e-05
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 1.2378207259189367e-06,
64 "idea_wins": 3,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 2.7821647563541774e-06,
68 4.656130840885453e-07,
69 -1.0499070413061418e-07,
70 -1.4539214134856593e-06,
71 3.092123961323523e-06,
72 3.1094741643755697e-06,
73 -1.7065253814507741e-06,
74 3.7186273402767256e-06
75 ],
76 "p_value": 0.164,
77 "mde": 1.8372299258490038e-06,
78 "mde_rel_pct": 30.443241200031668,
79 "verdict": "no significant win",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "critical_fraction": 0.2639999985694885,
84 "baseline_critical_bad_rate": 0.0,
85 "idea_critical_bad_rate": 0.0,
86 "observed_bad_rate_reduction": 0.0,
87 "required_rollouts_r_0.02_delta_0.05": 149,
88 "confirmed": false
89 },
90 "idea_sweep": [
91 {
92 "cfg": {
93 "lr": 0.001
94 },
95 "result": {
96 "mean": 4.6562476200051606e-05,
97 "std": 7.0209403088518815e-06,
98 "per_seed": [
99 3.4763717849273235e-05,
100 5.860313831362873e-05,
101 5.2090246754232794e-05,
102 4.800773604074493e-05,
103 3.818494951701723e-05,
104 4.759346120408736e-05,
105 4.485895624384284e-05,
106 4.839760367758572e-05
107 ],
108 "n": 8
109 }
110 },
111 {
112 "cfg": {
113 "lr": 0.003
114 },
115 "result": {
116 "mean": 1.1251939099565789e-05,
117 "std": 2.436469153192465e-06,
118 "per_seed": [
119 9.606156709196512e-06,
120 1.1305033694952726e-05,
121 6.192657565406989e-06,
122 1.2527690159913618e-05,
123 1.1936091141251381e-05,
124 1.4925769391993526e-05,
125 1.3000466424273327e-05,
126 1.0521647709538229e-05
127 ],
128 "n": 8
129 }
130 },
131 {
132 "cfg": {
133 "lr": 0.006
134 },
135 "result": {
136 "mean": 7.2727560791463475e-06,
137 "std": 3.341130715564463e-06,
138 "per_seed": [
139 6.330245923891198e-06,
140 5.862209491169779e-06,
141 3.913731234206352e-06,
142 5.612296263279859e-06,
143 6.7712248892348725e-06,
144 1.0451367415953428e-05,
145 4.5703227442572825e-06,
146 1.467065067117801e-05
147 ],
148 "n": 8
149 }
150 }
151 ],
152 "protocol_note": "Official registered dynamics track; baseline uses bench.train_model; idea changes only the training loss and shares model, data, epochs, batch, and lr grid."
153}