2 papers
cs.LG2026
Rubrics as Privileged Information for Open-Ended Generation
Deepika Bablani, Ajay Gupta, Wanming Chen
On-policy self-distillation (OPSD), where a single model acts as both student and teacher with different contexts, has shown promise in verifiable domains like math, where hard pri…
cs.LG2025
SiLQ: Simple Large Language Model Quantization-Aware Training
Steven K. Esser, Jeffrey L. McKinstry, Deepika Bablani +2
Large language models can be quantized to reduce inference time latency, model size, and energy consumption, thereby delivering a better user experience at lower cost. A challenge…