16 citations · 18 across the 8 of their papers we have counts for
Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Hindsight Preference Optimization for Financial Time Series Advisory
Yanwei Cui, Guanghui Wang, Xing Zhang +7
Time series models predict numbers; decision-makers need advisory -- directional signals with reasoning, actionable suggestions, and risk management. Training language models for s…
cs.LG2021★ 16 cited
RMIX: Learning Risk-Sensitive Policies for Cooperative Reinforcement Learning Agents
Wei Qiu, Xinrun Wang, Runsheng Yu +5
Current value-based multi-agent reinforcement learning methods optimize individual Q values to guide individuals' behaviours via centralized training with decentralized execution (…