2 papers
cs.LG2026
CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning
Tianshi Xu, Yuteng Chen, Meng Li
Agentic Reinforcement Learning (RL) has empowered Large Language Models (LLMs) to utilize tools like Python interpreters for complex problem-solving. However, for parameter-constra…
cs.CV2026
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
Shuimu Chen, Yuteng Chen, Yuanshen Guan +7
Current multimodal reflection mechanisms for long video understanding predominantly rely on closed-loop self-reflection within internal parameters. Lacking objective external evide…