Cross-Partial Nash Compatibility Regularizer / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "multi_agent_critic_compatibility",
4 "model": "smooth_mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "weight_decay": 0.0
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "weight_decay": 0.0
17 },
18 "mean": 0.06973899155855179
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "weight_decay": 0.0
24 },
25 "mean": 0.027223403099924326
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "weight_decay": 0.0
31 },
32 "mean": 0.017718153772875667
33 }
34 ],
35 "full": {
36 "mean": 0.01805280230473727,
37 "std": 0.003010278601654062,
38 "per_seed": [
39 0.013723039999604225,
40 0.01541468221694231,
41 0.020424267277121544,
42 0.021310625597834587,
43 0.02256813645362854,
44 0.015233941376209259,
45 0.01891121082007885,
46 0.016836514696478844
47 ],
48 "n": 8
49 },
50 "union_grid": [
51 {
52 "lr": 0.001,
53 "weight_decay": 0.0
54 },
55 {
56 "lr": 0.003,
57 "weight_decay": 0.0
58 },
59 {
60 "lr": 0.006,
61 "weight_decay": 0.0
62 }
63 ]
64 },
65 "idea": {
66 "mean": 0.014739889767952263,
67 "std": 0.002197491715824413,
68 "per_seed": [
69 0.012573308311402798,
70 0.013758777640759945,
71 0.017280390486121178,
72 0.018282605335116386,
73 0.013562905602157116,
74 0.011569413356482983,
75 0.01632225140929222,
76 0.01456946600228548
77 ],
78 "n": 8
79 },
80 "comparison": {
81 "delta_mean": -0.0033129125367850065,
82 "idea_wins": 8,
83 "n_pairs": 8,
84 "per_seed_diffs": [
85 -0.0011497316882014275,
86 -0.0016559045761823654,
87 -0.003143876791000366,
88 -0.0030280202627182007,
89 -0.009005230851471424,
90 -0.0036645280197262764,
91 -0.0025889594107866287,
92 -0.002267048694193363
93 ],
94 "p_value": 0.0081,
95 "mde": 0.0020403039006823757,
96 "mde_rel_pct": 11.30186807699642,
97 "verdict": "idea better (significant)",
98 "system_worked": true
99 },
100 "mechanism_signature": {
101 "prediction": "compatibility penalty lowers trained-NN cross-partial residual; task MSE may trade off against fit",
102 "baseline_mean_residual": 0.22950219362974167,
103 "idea_mean_residual": 0.055686311796307564,
104 "predicted_vs_observed": {
105 "predicted_direction": "lower residual",
106 "observed_direction": "lower residual"
107 },
108 "confirmed": true
109 },
110 "idea_sweep": [
111 {
112 "cfg": {
113 "lr": 0.001,
114 "lambda": 0.0
115 },
116 "mean": 0.06973899155855179
117 },
118 {
119 "cfg": {
120 "lr": 0.001,
121 "lambda": 0.01
122 },
123 "mean": 0.0697520337998867
124 },
125 {
126 "cfg": {
127 "lr": 0.001,
128 "lambda": 0.05
129 },
130 "mean": 0.06980521325021982
131 },
132 {
133 "cfg": {
134 "lr": 0.003,
135 "lambda": 0.0
136 },
137 "mean": 0.027223403099924326
138 },
139 {
140 "cfg": {
141 "lr": 0.003,
142 "lambda": 0.01
143 },
144 "mean": 0.026897789910435677
145 },
146 {
147 "cfg": {
148 "lr": 0.003,
149 "lambda": 0.05
150 },
151 "mean": 0.026794631499797106
152 },
153 {
154 "cfg": {
155 "lr": 0.006,
156 "lambda": 0.0
157 },
158 "mean": 0.017718153772875667
159 },
160 {
161 "cfg": {
162 "lr": 0.006,
163 "lambda": 0.01
164 },
165 "mean": 0.016406191745772958
166 },
167 {
168 "cfg": {
169 "lr": 0.006,
170 "lambda": 0.05
171 },
172 "mean": 0.015473770443350077
173 }
174 ],
175 "custom_track": {
176 "name": "multi_agent_critic_compatibility",
177 "file": "compat_track.py",
178 "domain": "dynamics/control"
179 },
180 "runtime_sec": 103.8862133026123
181}