2 papers
cs.LG2025
Gradient Imbalance in Direct Preference Optimization
Qinwei Ma, Jingzhe Shi, Can Jin +3
Direct Preference Optimization (DPO) has been proposed as a promising alternative to Proximal Policy Optimization (PPO) based Reinforcement Learning with Human Feedback (RLHF). How…
cs.CV2024
Graph Canvas for Controllable 3D Scene Generation
Libin Liu, Shen Chen, Sen Jia +6
Spatial intelligence is foundational to AI systems that interact with the physical world, particularly in 3D scene generation and spatial comprehension. Current methodologies for 3…