Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Experience Augmented Policy Optimization for LLM Reasoning
Jinda Lu, Kexin Huang, Junkang Wu +7
Reinforcement Learning with Verifiable Rewards (RLVR) is a powerful paradigm for improving the reasoning capabilities of large language models (LLMs). However, existing RLVR method…
cs.LG2026
Balancing Image Compression and Generation with Bootstrapped Tokenization
Haozhe Chi, Jinghan Li, Hao Jiang +4
Despite progress in image tokenization, standard methods encode redundant information by mixing all granularities within each token, thus redundancy persists between tokens. The mi…