Qwen3.5-9B — Studied Variants vs Original
DSPy
accuracy (%)
DSPy Qwen. Lenient: original 3.3/9.0/11.6 (forced 28.0); SFT + OPSD 9.4/7.4/8.5 (forced 21.0); CPT(code) 5.1/7.4/7.0 (forced 14.3); CPT(doc) 3.8/7.2/6.2 (forced 14.6). Strict: original 0.0/0.0/2.0 (forced 0.8); SFT + OPSD 1.1/0.0/0.0 (forced 2.2); CPT(code) 0.8/0.9/1.0; CPT(doc) 0/0/0.
max ReAct iterations
OpenClaw
accuracy (%)
OpenClaw Qwen. Lenient: original 2.3/6.9/15.8 (forced 17.6); CPT(code) 2.2/8.8/15.3 (forced 14.1). Strict: original 0.0/0.0/6.6 (forced 6.4); CPT(code) 0.0/4.5/6.7 (forced 6.3).
max ReAct iterations
original SFT + OPSD CPT(code) CPT(doc) | lenient strict | no early exit, lenient no early exit, strict
Figure 5. Qwen3.5-9B studied variants (continual pre-training; synthetic SFT + on-policy distillation) versus the original model.