2 papers
cs.AI2025
STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization
Yuhan Chen, Yuxuan Liu, Long Zhang +3
Multi-turn interaction remains challenging for online reinforcement learning. A common solution is trajectory-level optimization, which treats each trajectory as a single training…
q-bio.QM2024
MIN: Multi-channel Interaction Network for Drug-Target Interaction with Protein Distillation
Shuqi Li, Shufang Xie, Hongda Sun +4
Traditional drug discovery processes are both time-consuming and require extensive professional expertise. With the accumulation of drug-target interaction (DTI) data from experime…