2 papers
cs.CV2026
P-JEPA: Procedural Video Representation Learning via Joint Embedding Predictive Architecture
Felix Tristram, Stefano Gasperini, Benjamin Killeen +4
The increasing maturity of embodied AI platforms has driven a growing interest in procedural video representation learning to support intelligent assistance systems for complex, mu…
cs.CV2026
OR-Action: Multi-Role Video Understanding with Fine-Grained Actions
Felix Tristram, Ege Ãzsoy, Christian Benz +3
Fine-grained understanding of operating room (OR) activity could enable workflow-aware assistance, yet remains difficult due to clutter, occlusions, and limited sensing. The prevai…