2 papers
cs.CL2026
Hint-Guided Diversified Policy Optimization for LLM Reasoning
Zhiyu Cao, Kaixin Wu, Mingjie Zhong +4
Recent developments in Large Language Models (LLMs) have showcased impressive reasoning capabilities, with Reinforcement Learning with Verifiable Rewards (RLVR) being a promising e…
cs.LG2026
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
Ke Li, Dong An, Xiaoling Zang +6
Low-bit activation quantization remains a major bottleneck in efficient large language model (LLM) deployment. The difficulty is not only that activations contain outliers, but tha…