6 papers
Revealing Safety-Critical Scenarios for UTM via Transformer
Huaze Tang, Bill Zeng, Chao Wang +3
Unmanned Traffic Management (UTM) systems are cloud-based platforms designed to manage and coordinate multiple aerial vehicles remotely. UTM systems are safety-critical which canno…
Global Policy-Space Response Oracles for Two-Player Zero-Sum Games
Junyu Zhang, Feihong Yang, Jian Wang +2
The Policy-Space Response Oracles (PSRO) framework scales equilibrium computation to large zero-sum games by iteratively expanding a restricted strategy set using deep reinforcemen…
The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence
MiniMax, :, Aili Chen +219
We introduce the MiniMax-M2 series, a family of Mixture-of-Experts language models built around the principle that mini activations can unleash maximum real-world intelligence. The…
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
Ming Xie, Zizheng Huang, Xudong Tan +6
While streaming omni-video understanding demands continuous perception and proactive, real-time interaction, this crucial area remains largely under-explored. Current omni-modal me…
RUMAD: Reinforcement-Unifying Multi-Agent Debate
Chao Wang, Han Lin, Huaze Tang +2
Multi-agent debate (MAD) systems leverage collective intelligence to enhance reasoning capabilities, yet existing approaches struggle to simultaneously optimize accuracy, consensus…
Policy Newton Algorithm in Reproducing Kernel Hilbert Space
Yixian Zhang, Huaze Tang, Chao Wang +1
Reinforcement learning (RL) policies represented in Reproducing Kernel Hilbert Spaces (RKHS) offer powerful representational capabilities. While second-order optimization methods l…