5 papers
FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering
Jijun Chi, Zhenghan Tai, Hanwei Wu +21
Financial question answering over U.S. Securities and Exchange Commission (SEC) filings requires retrieving and synthesizing heterogeneous evidence dispersed across long, standardi…
HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models
Xinyu Wang, Mingze Li, Sicheng Lyu +6
Vision-Language-Action (VLA) models unify perception, reasoning, and control in a single policy, but their multi-billion-parameter backbones and diffusion-based action heads make o…
Enhancing Table Reasoning with Deterministic Table-State Rewards
Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He +9
Large Language Models (LLMs) struggle with multi-step reasoning over structured tables. The primary reason is the lack of explicit supervision for intermediate reasoning states. Ex…
TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering
Tung Sum Thomas Kwok, Xinyu Wang, Xiaofeng Lin +7
Multimodal reasoning has emerged as a powerful framework for enhancing reasoning capabilities of reasoning models. While multi-turn table reasoning methods have improved reasoning…
: A Route-to-Rerank Post-Training Framework for Multi-Domain Decoder-Only Rerankers
Xinyu Wang, Hanwei Wu, Qingchen Hu +13
Decoder-only rerankers are central to Retrieval-Augmented Generation (RAG). However, generalist models miss domain-specific nuances in high-stakes fields like finance and law, and…