6 papers
An Exam for Active Observers
Jiarui Zhang, Muzi Tao, Shangshang Wang +3
Human vision is a closed loop: gaze is continuously redirected by intermediate hypotheses rather than a single snapshot. Decades of psychophysics and cognitive science have argued…
FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
Chiyu Ma, Shuo Yang, Kexin Huang +7
We present Future-KL Influenced Policy Optimization (FIPO), a reinforcement learning algorithm designed to overcome reasoning bottlenecks in large language models. While GRPO style…
Resa: Transparent Reasoning Models via SAEs
Shangshang Wang, Julian Asilis, Ãmer Faruk Akgül +4
How cost-effectively can we elicit strong reasoning in language models by leveraging their underlying representations? We answer this question with Resa, a family of 1.5B reasoning…
Tina: Tiny Reasoning Models via LoRA
Shangshang Wang, Julian Asilis, Ãmer Faruk Akgül +3
How cost-effectively can strong reasoning abilities be achieved in language models? Driven by this fundamental question, we present Tina, a family of tiny reasoning models achieved…
AI University: An LLM-Powered Learning Assistant for Engineering---A Finite Element Method Case Study
Mostafa Faghih Shojaei, Rahul Gulati, Benjamin A. Jasperson +6
We introduce AI University (AI-U), a flexible framework for AI-driven course content delivery that adapts to a course's instructional style. AI-U combines a fine-tuned large langua…
METAGENE-1: Metagenomic Foundation Model for Pandemic Monitoring
Ollie Liu, Sami Jaghouar, Johannes Hagemann +4
We pretrain METAGENE-1, a 7-billion-parameter autoregressive transformer model, which we refer to as a metagenomic foundation model, on a novel corpus of diverse metagenomic DNA an…