Publications (67)
3D representation in 512-Byte:Variational tokenizer is the key for autoregressive 3D generation
Jinzhi Zhang, Feng Xiong, Mu Xu
CLoD-GS: Continuous Level-of-Detail via 3D Gaussian Splatting
Zhigang Cheng, Mingchao Sun, Yu Liu +5
Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report
Xufeng Zhao, Fuzhi Yang, Jianhui Chen +17
Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation
Junjin Xiao, Dongyang Li, Yandan Yang +9
Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis
Jintao Chen, Chengyu Bai, Junjun Hu +2
FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation
Yunpeng Zhang, Qiang Wang, Fan Jiang +3
AstraNav-Memory: Contexts Compression for Long Memory
Botao Ren, Junjun Hu, Xinda Xue +5
G3PT: Unleash the power of Autoregressive Modeling in 3D Generation via Cross-scale Querying Transformer
Jinzhi Zhang, Feng Xiong, Mu Xu
ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
Dongjie Huo, Haoyun Liu, Guoqing Liu +10
SeqGrowGraph: Learning Lane Topology as a Chain of Graph Expansions
Mengwei Xie, Shuang Zeng, Xinyuan Chang +4
World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
Junjin Xiao, Yandan Yang, Xinyuan Chang +5
Connecting Lyapunov Vectors with the Pattern Dynamics of Chaotic Rayleigh-Bénard Convection
Rachel Levanger, Mu Xu, Jacek Cyranka +3
Analysis of Kolmogorov Flow and Rayleigh-Bénard Convection using Persistent Homology
Miroslav Kramar, Rachel Levanger, Jeffrey Tithof +5
VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora
Yuting Xu, Jiayi Tian, Jian Liang +4
ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs
Jiangyang Li, Cong Wan, Changjie Wu +8
Nav- Dual-Relation Reasoning for Generalizable Open-Vocabulary Object-Goal Navigation
Wentao Xiang, Haokang Zhang, Tianhang Yang +10
HumanRig: Learning Automatic Rigging for Humanoid Character in a Large Scale Dataset
Zedong Chu, Feng Xiong, Meiduo Liu +5
From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images
Fei Yu, Yu Liu, Luyang Tang +10
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
Jing Zuo, Lingzhou Mu, Fan Jiang +3
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
Ziyi Chen, Yingnan Guo, Zedong Chu +14
ABot-M0.5: Unified Mobility-and-Manipulation World Action Model
Ronghan Chen, Yandan Yang, Zuojin Tang +18
Bridging the Indoor-Outdoor Gap: Vision-Centric Instruction-Guided Embodied Navigation for the Last Meters
Yuxiang Zhao, Yirong Yang, Yanqing Zhu +6
POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation
Ruiyan Gong, Meisheng Zhang, Yuxiang Zhao +12
AstraNav-World: World Model for Foresight Control and Consistency
Jintao Chen, Junjun Hu, Haochen Bai +11
Persistent Autoregressive Mapping with Traffic Rules for Autonomous Driving
Shiyi Liang, Xinyuan Chang, Changjie Wu +8
Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models
Haoyun Liu, Jianzhuang Zhao, Xinyuan Chang +11
FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
Shuang Zeng, Xinyuan Chang, Mengwei Xie +6
DLAM: Distributional Latent Actions with Temporal Constraints
Zuojin Tang, Feifan Luo, Haoyun Liu +10
The paper introduces DLAM, a distributional latent-action model that encodes video transitions as diagonal Gaussians with temporal constraints, improving reconstruction consistency…
Global-guided Focal Neural Radiance Field for Large-scale Scene Rendering
Mingqi Shao, Feng Xiong, Hang Zhang +4
FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework
Lingzhou Mu, Qiang Wang, Fan Jiang +4
Controllable Longer Image Animation with Diffusion Models
Qiang Wang, Minghua Liu, Junjun Hu +2
MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving
Lingjun Zhang, Yujian Yuan, Changjie Wu +7
FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction
Yixiang Dai, Fan Jiang, Chiyu Wang +2
ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space
Mingchao Sun, Luyang Tang, Yu Liu +34
The paper introduces ABot-3DWorld 0, a multimodal system that converts text, images, or video into high‑fidelity, explorable 3D worlds using a compact spatial representation and pa…
OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation
Xinda Xue, Junjun Hu, Minghua Luo +7
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
Zedong Chu, Shichao Xie, Xiaolong Wu +41
FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers
Qiang Wang, Mengchao Wang, Fan Jiang +3
Seeing Space and Motion: Enhancing Latent Actions with Geometric and Dynamic Awareness for Vision-Language-Action Models
Zhejia Cai, Yandan Yang, Xinyuan Chang +5
PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping
Qiming Li, Tianlun Li, Xiaolong Cheng +5
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
Shuang Zeng, Dekang Qi, Xinyuan Chang +7
EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence
Jiaxu Wan, Xu Wang, Mengwei Xie +6
ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment
Yuzhi Chen, Ronghan Chen, Dongjie Huo +11
UniMapGen: A Generative Framework for Large-Scale Map Construction from Multi-modal Data
Yujian Yuan, Changjie Wu, Xinyuan Chang +6
Online Navigation Refinement: Achieving Lane-Level Guidance by Associating Standard-Definition and Online Perception Maps
Jiaxu Wan, Xu Wang, Mengwei Xie +7
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
Fei Liu, Shichao Xie, Minghua Luo +4
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
Mingxin Wang, Bin Hu, Bin Qian +12
AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation
Kai Yang, Zedong Chu, Yingnan Guo +6
ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
Jiahang Wang, Yirong Yang, Yanqing Zhu +4
The paper introduces ReflectVLN, a vision-language navigation framework that uses separate intention and execution agents to iteratively decompose tasks, reflect on progress, and g…
DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving
Lingjun Zhang, Changjie Wu, Linzhe Shi +6
Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation
Dongyi Lv, Qiuyu Ding, Heng-Da Xu +4
FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis
Mengchao Wang, Qiang Wang, Fan Jiang +5
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
Fan Jiang, Zhaoxu Sun, Mengchao Wang +38
FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation
MengChao Wang, Qiang Wang, Fan Jiang +1
MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation
Dekang Qi, Shuang Zeng, Xinyuan Chang +4
MVPainter: Accurate and Detailed 3D Texture Generation via Multi-View Diffusion with Geometric Control
Mingqi Shao, Feng Xiong, Zhaoxu Sun +1
ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning
Yandan Yang, Shuang Zeng, Tong Lin +11
ABot-OCR Technical Report
Kaitao Jiang, Ruiyan Gong, Xiaolong Cheng +3
PriorDrive: Enhancing Online HD Mapping with Unified Vector Priors
Shuang Zeng, Xinyuan Chang, Xinran Liu +5
WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models
Ting-Bing Xu, Jiacheng Sui, Zhe Gao +12
CE-Nav: Flow-Guided Reinforcement Refinement for Cross-Embodiment Local Navigation
Kai Yang, Tianlin Zhang, Zhengbo Wang +4
ABot-N1: Toward a General Visual Language Navigation Foundation Model
Ruiyan Gong, Yingnan Guo, Junjun Hu +44
The paper presents ABot-N1, a visual‑language navigation foundation model that separates high‑level reasoning from low‑level control via a slow‑fast architecture and pixel‑based go…
Why Users Go There: World Knowledge-Augmented Generative Next POI Recommendation
Qiuyu Ding, Heng-Da Xu, Wei Zhang +4
AMap: Distilling Future Priors for Ahead-Aware Online HD Map Construction
Ruikai Li, Xinrun Li, Mengwei Xie +12
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
Jiayi Tian, Shiao Liu, Yuting Xu +31
The paper introduces ABot-AgentOS, a general operating system layer for robotic agents that adds deliberative planning, multi‑modal memory, verification, and cloud‑edge collaborati…
Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents
Xu Chen, Shichao Xie, Zhining Gu +7
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
Zuojin Tang, Haoyun Liu, Xinyuan Chang +11
ABot-Earth 0.5: Generative 3D Earth Model
Ming Qian, Tianjian Ouyang, Mingchao Sun +25