787 citations · 1.8k across the 55 of their papers we have counts for
6 papers · 1 filter
Block-diagonal Hessian-free Optimization for Training Neural Networks
Huishuai Zhang, Caiming Xiong, James Bradbury +1
Second-order methods for neural network optimization have several advantages over methods based on first-order gradient descent, including better scaling to large mini-batch sizes…
Hierarchical and Interpretable Skill Acquisition in Multi-task Reinforcement Learning
Tianmin Shu, Caiming Xiong, Richard Socher
Learning policies for complex tasks that require multiple different skills is a major challenge in reinforcement learning (RL). It is also a requirement for its deployment in real-…
Improved Regularization Techniques for End-to-End Speech Recognition
Yingbo Zhou, Caiming Xiong, Richard Socher
Regularization is important for end-to-end speech models, since the models are highly flexible and easy to overfit. Data augmentation and dropout has been important for improving e…
Improving End-to-End Speech Recognition with Policy Learning
Yingbo Zhou, Caiming Xiong, Richard Socher
Connectionist temporal classification (CTC) is widely used for maximum likelihood learning in end-to-end speech recognition models. However, there is usually a disparity between th…
DCN+: Mixed Objective and Deep Residual Coattention for Question Answering
Caiming Xiong, Victor Zhong, Richard Socher
Traditional models for question answering optimize using cross entropy loss, which encourages exact answers at the cost of penalizing nearby or overlapping answers that are sometim…
Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning
Victor Zhong, Caiming Xiong, Richard Socher
A significant amount of the world's knowledge is stored in relational databases. However, the ability for users to retrieve facts from a database is limited due to a lack of unders…