The RL method behind Sapiens AI's reasoning work (co-authored by founder Bruce Yang). Dynamic-filter Sequence-level Policy Optimization (DSPO) trains agents to interleave multi-turn search with reasoning purely via reinforcement learning — no supervised demonstrations — using sequence-level optimization plus dynamic sample filtering for training stability. A 7B model reports a 34.1% improvement over comparable prior work and beats a 14B predecessor on complex multi-hop tasks like HotpotQA. Builds on GSPO. Sapiens AI's only arXiv paper.

Paper

reasoningagenticpost-trainingresearch