StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning

类型
出版物
ArXiv
Daoyu Wang
Daoyu Wang
Master Student
Qingchuan Li
Qingchuan Li
Master Student
Mingyue Cheng
Mingyue Cheng
Associate Researcher
Jie Ouyang
Jie Ouyang
Master Student
Shuo Yu
Shuo Yu
Master Student
Qi Liu
Qi Liu
Professor
Enhong Chen
Enhong Chen
Professor