works on

From the 2 of 7 linked papers with an AI index.

collaborators

7 papers

cs.LG2026

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

Alexi Gladstone, Heng Ji, Yilun Du

The paper proposes Explorative Modeling, a new training paradigm that selects the best among multiple candidate generations to improve generative models, adding a third pretraining…

cs.RO2026

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

Dwip Dalal, Shivansh Patel, Chahit Jain +7

The paper introduces Anchor-Align, a method that adds representation anchoring and language-action alignment to behavior‑cloning finetuning of vision‑language models for robot mani…

cs.AI2026

Securing Multimodal AI through Internal Information Decomposition

Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan +1

Multimodal large language models introduce attack surfaces absent in unimodal systems: adversaries can distribute malicious intent across modalities to evade unimodal safeguards. T…

cs.CV2026

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra +6

Multimodal large language models (MLLMs) often miss small details and spatial relations in cluttered scenes, leading to errors in fine-grained perceptual grounding. We introduce At…

cs.CL2026

Must Read: A Comprehensive Survey of Computational Persuasion

Nimet Beyza Bozdag, Shuhaib Mehri, Xiaocheng Yang +7

Persuasion is a fundamental aspect of communication, influencing decision-making across diverse contexts, from everyday conversations to high-stakes scenarios such as politics, mar…

cs.AI2026

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

Qiusi Zhan, Hyeonjeong Ha, Rui Yang +7

Recent advances in Vision-Language Models (VLMs) have propelled embodied agents by enabling direct perception, reasoning, and planning task-oriented actions from visual inputs. How…