Showing cs.AIShow all
3 papers · 1 filter
cs.AI2026
Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning
Xuanzhi Feng, Zhengyang Li, Zeyu Liu +6
Reinforcement Learning with Verifiable Rewards (RLVR) has significantly advanced Large Language Model (LLM) reasoning; however, it faces a fundamental optimization instability: uni…
cs.AI2026
READER: Dynamic LLM Provenance from Query-Varying Interactions
Jiaxu Liu, Sunnan Mu, Dong Huang +3
Existing black-box LLM provenance methods achieve comparability by querying every candidate model with the same diagnostic prompts. In deployment, auditors inherit a different evid…
cs.AI2026
What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
Haoxi Li, Qinglin Hou, Jianfei Ma +6
To navigate partially observable visual environments, recent VLM agents increasingly internalize world modeling capabilities into their policies via explicit CoT reasoning, enablin…