Qwen3.5-9B — Studied Variants vs Original
DSPy
accuracy (%)
max ReAct iterations
OpenClaw
accuracy (%)
max ReAct iterations
original
SFT + OPSD
CPT(code)
CPT(doc)
|
lenient
strict
|
no early exit, lenient
no early exit, strict
Figure 5. Qwen3.5-9B studied variants (continual pre-training; synthetic SFT + on-policy distillation) versus the original model.