6 papers
Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
Yi Yang, Haowen Li, Tianxiang Li +4
Text-to-music generation technology is progressing rapidly, creating new opportunities for musical composition and editing. However, existing music editing methods often fail to pr…
Depth-Consistent 3D Gaussian Splatting via Physical Defocus Modeling and Multi-View Geometric Supervision
Yu Deng, Baozhu Zhao, Junyan Su +2
Three-dimensional reconstruction in scenes with extreme depth variations remains challenging due to inconsistent supervisory signals between near-field and far-field regions. Exist…
TraGraph-GS: Trajectory Graph-based Gaussian Splatting for Arbitrary Large-Scale Scene Rendering
Xiaohan Zhang, Sitong Wang, Yushen Yan +3
High-quality novel view synthesis for large-scale scenes presents a challenging dilemma in 3D computer vision. Existing methods typically partition large scenes into multiple regio…
Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables
Yitong Zhou, Mingyue Cheng, Qingyang Mao +7
With the widespread application of multimodal large language models in scientific intelligence, there is an urgent need for more challenging evaluation benchmarks to assess their a…
Metamon-GS: Enhancing Representability with Variance-Guided Densification and Light Encoding
Junyan Su, Baozhu Zhao, Xiaohan Zhang +1
The introduction of 3D Gaussian Splatting (3DGS) has advanced novel view synthesis by utilizing Gaussians to represent scenes. Encoding Gaussian point features with anchor embeddin…
Toy-GS: Assembling Local Gaussians for Precisely Rendering Large-Scale Free Camera Trajectories
Xiaohan Zhang, Zhenyu Sun, Yukui Qiu +2
Currently, 3D rendering for large-scale free camera trajectories, namely, arbitrary input camera trajectories, poses significant challenges: 1) The distribution and observation ang…