collaborators

6 papers

cs.SD2025

Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models

Yi Yang, Haowen Li, Tianxiang Li +4

Text-to-music generation technology is progressing rapidly, creating new opportunities for musical composition and editing. However, existing music editing methods often fail to pr…

cs.CV2025

Depth-Consistent 3D Gaussian Splatting via Physical Defocus Modeling and Multi-View Geometric Supervision

Yu Deng, Baozhu Zhao, Junyan Su +2

Three-dimensional reconstruction in scenes with extreme depth variations remains challenging due to inconsistent supervisory signals between near-field and far-field regions. Exist…

cs.CV2025

TraGraph-GS: Trajectory Graph-based Gaussian Splatting for Arbitrary Large-Scale Scene Rendering

Xiaohan Zhang, Sitong Wang, Yushen Yan +3

High-quality novel view synthesis for large-scale scenes presents a challenging dilemma in 3D computer vision. Existing methods typically partition large scenes into multiple regio…

cs.AI2025

Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables

Yitong Zhou, Mingyue Cheng, Qingyang Mao +7

With the widespread application of multimodal large language models in scientific intelligence, there is an urgent need for more challenging evaluation benchmarks to assess their a…

cs.CV2025

Metamon-GS: Enhancing Representability with Variance-Guided Densification and Light Encoding

Junyan Su, Baozhu Zhao, Xiaohan Zhang +1

The introduction of 3D Gaussian Splatting (3DGS) has advanced novel view synthesis by utilizing Gaussians to represent scenes. Encoding Gaussian point features with anchor embeddin…

cs.CV2024

Toy-GS: Assembling Local Gaussians for Precisely Rendering Large-Scale Free Camera Trajectories

Xiaohan Zhang, Zhenyu Sun, Yukui Qiu +2

Currently, 3D rendering for large-scale free camera trajectories, namely, arbitrary input camera trajectories, poses significant challenges: 1) The distribution and observation ang…