4 papers
Remember to Forget: Gated Adaptive Positional Encoding
Riccardo Ali, Alessio Borgi, Christopher Irwin +2
Rotary Positional Encoding (RoPE) is widely used in modern large language models. However, when sequences are extended beyond the range seen during training, rotary phases can ente…
Algebraic Priors for Approximately Equivariant Networks
Riccardo Ali, Pietro Liò, Jamie Vicary
Equivariant neural networks incorporate symmetries through group actions, embedding them as an inductive bias to improve performance. Existing methods learn an equivariant action o…
Entropy-Lens: Uncovering Decision Strategies in LLMs
Riccardo Ali, Francesco Caso, Christopher Irwin +1
In large language models (LLMs), each block operates on the residual stream to map input token sequences to output token distributions. However, most of the interpretability litera…
Metric Learning for Clifford Group Equivariant Neural Networks
Riccardo Ali, Paulina Kulytė, Haitz Sáez de Ocáriz Borde +1
Clifford Group Equivariant Neural Networks (CGENNs) leverage Clifford algebras and multivectors as an alternative approach to incorporating group equivariance to ensure symmetry co…