STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training 文章

ArXiv CS.AI2026-07-07PAPERen作者: Qiuyi Qi, Tian Liang, Mutian Bao, Jinjian Zhang, Dongnan Liu, Wei Zhou, Linjian Mo, Ming Kong, Jie Liu, Feng Zhang, Qiang Zhu

STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training · 相关事件

暂无数据