Skip to yearly menu bar Skip to main content


ECCV 2026 Accepted Papers:

This paper list is preliminary pending publisher checks.

Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight
Yifei Dong ⋅ Fengyi Wu ⋅ Guangyu Chen ⋅ Lingdong Kong ⋅ Xu Zhu ⋅ Qiyu Hu ⋅ Yuxuan Zhou ⋅ Jingdong Sun ⋅ Jun-Yan He ⋅ Qi Dai ⋅ Alexander Hauptmann ⋅ Yifei Dong
PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas
Chan Lee ⋅ Kimin Yun ⋅ Yuseok Bae ⋅ Seong Tae Kim ⋅ Jung Uk Kim
AIMold: An Autonomous AI-based Pipeline for Complex Mold Design
Pengyun Qiu ⋅ Shuo Wang ⋅ Zeyuan Chen ⋅ Yihao Zhi ⋅ Chongjie Ye ⋅ XIAOGUANG HAN
FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry
Muxin Liu ⋅ Xiaoyang Lyu ⋅ Tianhe Ren ⋅ Peng Dai ⋅ Xiaoshan Wu ⋅ Zhiyue Zhang ⋅ Jiaqi Zhang ⋅ Jiehong Lin ⋅ Shaoshuai Shi ⋅ Qi Xiaojuan
Learning to Deny: Action Denial in Multimodal Large Language Models
Raiyaan Abdullah ⋅ Shehreen Azad ⋅ Yogesh Rawat
RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration
Jiahao Luo ⋅ Hao Zhang ⋅ Jianqi Chen ⋅ Yijie He ⋅ Jiaxu Zou ⋅ Michael Vasilkovsky ⋅ Sergei Korolev ⋅ Sergey Tulyakov ⋅ Chaoyang Wang ⋅ Peter Wonka ⋅ James Davis ⋅ Jian Wang
Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams
Weihao Bo ⋅ Shan Zhang ⋅ Yanpeng Sun ⋅ Jie Liu ⋅ Yongke Yao ⋅ Jinhao Du ⋅ Wei He ⋅ KAI ZOU ⋅ Zechao Li ⋅ Jingdong Wang
ChronoFlow Policy: Unifying Past-Future Interaction Flow in Visuomotor Policy Learning
Bokai Lin ⋅ Yifu Xu ⋅ Xinyu Zhan ⋅ Hongjie Fang ⋅ Jialin Tian ⋅ Fu-Cheng Zhang ⋅ Yong-Lu Li ⋅ Cewu Lu ⋅ Lixin Yang
C3-Bench: A Context-Aware Change Captioning Benchmark
JAEWOO KIM ⋅ Hyeongbeom Kim ⋅ Ue-Hwan Kim
MCVL: Multi-Space Cross-View Learning for Aerial-Ground Person Re-Identification
Wajahat Khalid ⋅ Bin Liu ⋅ Xulin Li ⋅ Yubo Wang ⋅ MUHAMMAD SHER AFGAN
Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing
Minh Quan Dao ⋅ Xiaoxiao He ⋅ Ligong Han ⋅ Ngan Nguyen ⋅ Amin Nobari ⋅ Han Zhang ⋅ Faez Ahmed ⋅ Viet Anh Nguyen ⋅ Dimitris N. Metaxas
Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
Jonas Klotz ⋅ Cassio F. Dantas ⋅ Pallavi Jain ⋅ Diego Marcos ⋅ Begüm Demir
MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction
Haitian Li ⋅ Haozhe Xie ⋅ Junxiang Xu ⋅ Beichen Wen ⋅ Fangzhou Hong ⋅ Ziwei Liu
Reconstructing 3D Human-Object Interaction via a Unified Triplane Space
Yuhang Chen ⋅ Chenxing Wang
SPARC: Scalable Path-Specific Counterfactual Fairness via Causal Conditional Independence
Bowei Tian ⋅ Yexiao He ⋅ Ziyao Wang ⋅ Meng Liu ⋅ Yongkai Wu ⋅ Ang Li
ECHO: Ego-centric Modeling of Human-Object Interactions
Ilya A. Petrov ⋅ Vladimir Guzov ⋅ Riccardo Marin ⋅ Emre Aksan ⋅ Xu Chen ⋅ Daniel Cremers ⋅ Thabo Beeler ⋅ Gerard Pons-Moll
InstGS: Shared-Template Gaussian Instancing for Object-Redundancy-Free Rendering
Zi'ang Lu ⋅ Qian Zhang ⋅ Kang Du ⋅ Dong Liang ⋅ John Li ⋅ Xinyao Wei ⋅ Zeyu Wang ⋅ Jinyuan Jia
Geodesic Flow Matching on a Riemannian Degradation Manifold for Blind Image Restoration
Akshay Bankar ⋅ Ankita Chatterjee ⋅ Sayan Banerjee ⋅ Shreyas Pandith ⋅ Kalakonda Shashank ⋅ Amit Unde
Comprehensive Robustness Analysis of LiDAR-based 3D Object Detection in Autonomous Driving
Adwait Chandorkar ⋅ Kai Krink ⋅ Yerdana Maulenbay ⋅ Hasan Tercan ⋅ Tobias Meisen
RAU: Reference-based Anatomical Understanding with Vision-Language Models
Yiwei Li ⋅ Yikang Liu ⋅ Jiaqi Guo ⋅ Lin Zhao ⋅ Zheyuan Zhang ⋅ Xiao Chen ⋅ Boris Mailhe ⋅ Ankush Mukherjee ⋅ Terrence Chen ⋅ Shanhui Sun
MSEditor: Toward Consistent Multi-Shot Video Editing
Kunyu Feng ⋅ Yue Ma ⋅ Bingyuan Wang ⋅ Yuefeng Wang ⋅ Zhiyuan Qin ⋅ Hao Cheng ⋅ Hao Li ⋅ Qifeng Chen ⋅ Zeyu Wang
From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting
Zizhao Chen ⋅ Ping Wei ⋅ Guang Dai ⋅ Jingdong Wang ⋅ Mengmeng Wang
Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training
Shangbo Yuan ⋅ Jie Xu ⋅ Xiaofeng Zhu ⋅ Na Zhao
WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment
Xujie Zhang ⋅ Runyan Du ⋅ Song Chang ⋅ Jiang Li ⋅ Dongliang Shao ⋅ Liping Wu ⋅ Luo Wei ⋅ Xiaochao Qu ⋅ Luoqi Liu ⋅ Xiaodan Liang
SemLight: Distilled Semantic–Geometric Fusion for Efficient Local Feature Matching
Guanglu Shi ⋅ Xiangzeng Liu ⋅ Yunan LI ⋅ Tuo Pang ⋅ Qiguang Miao
Identifiable Gated Residual Personalization for Federated Parameter-Efficient Fine-Tuning
Huimin Huang ⋅ Wenhan Hu ⋅ Gang Yan
P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling
Le Xiang ⋅ Chenxi Zhai ⋅ Shu Wei ⋅ Jingjing Wu ⋅ Qunyi Xie ⋅ Xiao Tan ⋅ KunbinChen KunbinChen ⋅ Wei He
360° Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method
Huyen Thi Thanh Tran ⋅ Van-Quang Nguyen ⋅ Farros Alferro ⋅ Kang-Jun Liu ⋅ Takayuki Okatani
Rethinking Temporal Modeling in Visual Object Tracking via Decoupled Auxiliary Supervision
Dailing Zhang ⋅ Shiyu Hu ⋅ Honghao Fu ⋅ Xiaokun Feng ⋅ Yipei Wang ⋅ Kang Cheong ⋅ Kaiqi Huang
NeSy-Route: A Neural-Symbolic Benchmark for Constrained Route Planning in Remote Sensing
Ming Yang ⋅ Zhi Zhou ⋅ Shi-Yu Tian ⋅ Kun-Yang Yu ⋅ Lan-Zhe Guo ⋅ Yu-Feng Li
CaPCL: Caption-Preserved Continual Learning for Text-to-Image Retrieval
Naoya Sogi ⋅ Ren Ohkubo ⋅ Takashi Shibata ⋅ Makoto Terao ⋅ Yusuke Hosoya ⋅ Takayuki Okatani
ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding
Chen Kai ⋅ Ming Dai ⋅ Wenxuan Cheng ⋅ Wankou Yang
EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation
Min Lin ⋅ Xiwen Liang ⋅ Bingqian Lin ⋅ Jingzhi Liu ⋅ Zijian Jiao ⋅ Kehan Li ⋅ Ziang Yan ⋅ Yu Sun ⋅ Weijia Liufu ⋅ Yuhan Ma ⋅ Jiarui Hu ⋅ Yuecheng Liu ⋅ Shen Zhao ⋅ Yuzheng Zhuang ⋅ Xiaodan Liang
Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows
Janne Perini ⋅ Rafael Bischof ⋅ Moab Arar ⋅ Ayça Duran ⋅ Michael Kraus ⋅ Siddhartha Mishra ⋅ Bernd Bickel
Local Spacing-Aware Hungarian Matching for Stable Point-Supervised Crowd Counting
Kai Jiang ⋅ Yiming Lin ⋅ Zurui Ao
From Minimal Clinical Prompts to 3D: Spacing-Aware Prompt Propagation for Multimodal Prostate Lesion Segmentation in bpMRI
Jiacheng Wang ⋅ Heinrich von Busch ⋅ Robert Grimm ⋅ Ipek Oguz ⋅ Dorin Comaniciu ⋅ Ali Kamen ⋅ Bin Lou
ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion
Lifeng Chen ⋅ tianqi you ⋅ Hao Liu ⋅ Zhimin Bao ⋅ Jile Jiao ⋅ Xiao Han ⋅ Zhicai Ou ⋅ Tao Sun ⋅ Mou XiaoFeng ⋅ Xiaojie Jin ⋅ Yi Xu
Geometrically Consistent Multi-View Scene Generation from Freehand Sketches
Ahmed Bourouis ⋅ Savas Ozkan ⋅ Andrea Maracani ⋅ Yi-Zhe Song ⋅ Mete Ozay
Dynamic-V2C: Editable and Continual Vision-to-Concept Bottleneck Models via Influence Functions
Songning Lai ⋅ Shaofeng Liang ⋅ Jiayu Yang ⋅ Ninghui Feng ⋅ Yuxuan Fan ⋅ Wenshuo Chen
IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment
Jinjian Wu ⋅ Jiaqi Tang ⋅ Wei Wei ⋅ Yingying Yan ⋅ Jianmin Chen ⋅ Botong Geng ⋅ Lei Zhang ⋅ Qifeng Chen
TopoFuse: Topology-Aware Tri-Planar Fusion for 3D Cryo-Electron Tomography Segmentation
Rohit Kumar Salla ⋅ Neelesh Gupta ⋅ Xingjian Li ⋅ Min Xu
Drop-In Perceptual Optimization for 3D Gaussian Splatting
Ezgi Ozyilkan ⋅ Zhiqi Chen ⋅ Oren Rippel ⋅ Jona Ballé ⋅ Kedar Tatwawadi
Co-Steer: Cross-Modal Collaborative Steering for Jailbreaking MLLMs
Jingmin Zhu ⋅ Rollin Omari ⋅ Tamas Abraham ⋅ Junae Kim ⋅ Amardeep Kaur ⋅ Trung Le ⋅ Dinh Q Phung ⋅ Qiuhong Ke
Vero: Open Reinforcement Learning Recipes for Visual Reasoning
Gabriel Sarch ⋅ Linrong Cai ⋅ Qunzhong Wang ⋅ Haoyang Wu ⋅ Danqi Chen ⋅ Zhuang Liu
Rethinking Prototype-based Similarity Learning for Few-Shot Object Detection
KunHo Heo ⋅ Seungjae Kim ⋅ Wongyu Lee ⋅ SuYeon Kim ⋅ MyeongAh Cho
S3-Prune: Stability-Aware Token Budgeting for Long-Form Video-Language Models
gilha lee ⋅ Seungil Lee ⋅ Hyun Kim
CogniCred: A Dataset and Benchmark for Cognitive Credential Forgery Detection
Junchi Li ⋅ Jiasheng Sun ⋅ Weizhi Chen ⋅ Ziwei Wang ⋅ Sheng Zhou ⋅ Jiajun Bu ⋅ Chenfan Qu ⋅ Bohan Yu ⋅ Jian liu ⋅ Weiqiang Wang
UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer
Tianchen Deng ⋅ Chen Xun ⋅ Ziming Li ⋅ Hongming Shen ⋅ Shuhao Zhai ⋅ Danwei Wang ⋅ Javier Civera ⋅ Hesheng Wang
Robust Zero-shot Anomaly Detection under Limited Auxiliary Anomaly Priors
Guanyu Lu ⋅ Fang Zhou ⋅ Cheqing Jin
DynEval: Holistic Evaluations of T2I Generative Models in the Wild
Shyam Marjit ⋅ Dheeraj Baiju ⋅ Anuj Shikarkhane ⋅ Akhil Sakthieswaran ⋅ Sayak Paul ⋅ Anirban Chakraborty
Intra-Class Consistency Guided Class-Agnostic Event Segmentation
Zhipeng Sui ⋅ Haiqing Hao ⋅ Weihua He ⋅ Wenhui Wang
Beyond Disjoint Tasks: Towards More Natural Continual Learning for Vision-Language Models
Xiang Xu ⋅ Yiyang Su ⋅ Tianchen Zhao ⋅ Zheng Zhang ⋅ Zhuowen Tu ⋅ Anil Jain ⋅ Jonathan Wu
ODONet: Online Dynamic Offset Network for Visual Object Tracking
Qinghua Liu ⋅ Wanli Xue ⋅ Shengyong Chen
Masked BRep Autoencoder via Hierarchical Graph Transformer
Yifei Li ⋅ Kang Wu ⋅ Wenming Wu ⋅ Xiao-Ming Fu
Improving Reasoning in Vision-Language Models via Perception Verified Self-Training
Sourabh Sharma ⋅ Sonam Gupta ⋅ Sadbhawna Sadbhawna
Hyperbolic Hierarchical Clustering for Visual Representation Learning
Jianan Wei ⋅ Guikun Chen ⋅ Zhiyuan Weng ⋅ Chunchao Guo ⋅ Yujia Wang ⋅ Wenguan Wang
Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning
Tiantian He ⋅ Yihang Chen ⋅ Keyue Jiang ⋅ Ka Lee ⋅ Kaiwen Zhou ⋅ Kun Shao ⋅ Shuai Wang
SP-TransientBench: A Real-Captured Single Photon Perception Benchmark
Hongzhou Dong ⋅ Zili Zhang ⋅ Ziting Wen ⋅ Yiheng Qiang ⋅ Runrong Deng ⋅ Wenle Dong ⋅ Ziwen Jiang ⋅ Xinyang Li ⋅ Rui Lu ⋅ Shuoyao Sun ⋅ Wenyu Wang ⋅ Ziyi Xia ⋅ Haitao Zheng ⋅ Guodong Shi ⋅ Xiaoqiang Ren
EGM: Efficient Visual Grounding Language Models
Guanqi Zhan ⋅ Changye Li ⋅ Zhijian Liu ⋅ Yao Lu ⋅ Yi Wu ⋅ Song Han ⋅ Ligeng Zhu
TriSplat: Adaptive Triplane for Sparse-View Large-Scale Scene Reconstruction
Ryo Umagami ⋅ Tomohiro Hashimoto ⋅ Xuangeng Chu ⋅ Ziteng Cui ⋅ Yusuke Mukuta ⋅ Jia Deng ⋅ Tatsuya Harada
VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation
Chinmay Prabhakar ⋅ Bastian Wittmann ⋅ Tamaz Amiranashvili ⋅ Paul Büschl ⋅ Ezequiel De la Rosa ⋅ Julian McGinnis ⋅ Benedikt Wiestler ⋅ Bjoern Menze ⋅ Suprosanna Shit
Leveraging Dark Knowledge for Intrinsic Multimodal Out-of-Distribution Detection
Nimeshika Udayangani Hewa Dehigahawattage ⋅ Sarah Erfani ⋅ Christopher Leckie
MPO: Single-Stream Policy Optimization for Efficient Text-to-Image Alignment
Lishuai Gao ⋅ Jie Hu ⋅ Cong Wei ⋅ Yujie Zhong ⋅ Yibo Zhao ⋅ Zan Gao ⋅ Xiaoming Wei
Video Generation Models are General-Purpose Vision Learners
Letian Wang ⋅ Chuhan Zhang ⋅ Rishabh Kabra ⋅ Jasper Uijlings ⋅ Steven Waslander ⋅ Andrew ZISSERMAN ⋅ Joao Carreira ⋅ Cristian Sminchisescu ⋅ Kaiming He ⋅ Mykhaylo Andriluka ⋅ Eduard Gabriel Bazavan ⋅ Andrei Zanfir
DiNBV-Grasp: Real-Time Distance-Aware Two-Stage Next-Best-View for Robotic Grasping
Zilong Xie ⋅ Jingyu Gong ⋅ Xin Tan ⋅ Zhizhong Zhang ⋅ Yanyun Qu ⋅ Lizhuang Ma ⋅ Yuan Xie
BioMTBee: Biologically Constrained Multi-View Template-Based 3D Reconstruction of Bumblebee
Yi Zhang ⋅ Minchen Ye ⋅ Nenggan Zheng
Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training
Mingliang Liang ⋅ Zhuoran Liu ⋅ Arjen P. de Vries ⋅ Martha Larson
EVEE: Event-Based Online Adaptation for Matching on Unknown Targets
Zejing Zhao ⋅ Cheng Ju ⋅ Yanwen Zhang ⋅ Akio NAMIKI
Dotting the Eye: An Intent-Driven Image Retouching Agent for Visual Focus Enhancement
Chujie Qin ⋅ Zilong Zhang ⋅ Zewei Chang ⋅ Chun-Le Guo ⋅ Ruixing Wang ⋅ Tao Hu ⋅ Ming-Ming Cheng ⋅ Chongyi Li
Introspective Attention Modulation for Safe Text-to-Image Generation
Basim Azam ⋅ Hossein Rahmani ⋅ NAVEED AKHTAR
FedDO: Dynamic Client Optimization for Adaptive Federated Learning
Peixuan Tang ⋅ Xuehe Wang
S2-FracMix: Self-Saliency Fractal Mixup
Khawar Islam ⋅ Arif Mahmood ⋅ Xin Jin ⋅ NAVEED AKHTAR
Video Can Teach PAN-Sharpening: PSF-Aware Cross-Domain Supervision
Hyun-Ho Kim ⋅ Munchurl Kim ⋅ Jaehyup Lee
Escaping the Low-Frequency Bias: Adversarial Frequency Perturbation for Generalisable Gaze Estimation
Yang Xu ⋅ Feng Lu
Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition
Zoey Shu ⋅ Jiacheng Yang ⋅ Yang Lu ⋅ Waishan Qiu ⋅ Chuan Li ⋅ Da Chen
HSFM: Hard-Set-Guided Feature-Space Meta-Learning for Robust Classification under Spurious Correlations
Aryan Yazdan Parast ⋅ Khawar Islam ⋅ Soyoun Won ⋅ Basim Azam ⋅ NAVEED AKHTAR
Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment
Soyoun Won ⋅ Aryan Yazdan Parast ⋅ Basim Azam ⋅ Jean Honorio ⋅ NAVEED AKHTAR
JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation
Mingyeong Song ⋅ Jungbin Cho ⋅ Jisoo Kim ⋅ Ananya Bal ⋅ Kartik Sharma ⋅ Youngjae Yu ⋅ Laszlo Jeni ⋅ Junhyug Noh
Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations
Ludovica Schaerf ⋅ Antonio Purificato ⋅ Piera Riccio ⋅ Fabrizio Silvestri ⋅ Noa Garcia
AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation
Xuanhua Yin ⋅ CHUANZHI XU ⋅ Haoxian Zhou ⋅ Boyu Wei ⋅ Weidong Cai
Circuit-MLLM: Topological Logic-Guided Latent-Space Visual Reasoning for Circuit Schematic Understanding
Jinyuan Deng ⋅ Yuqi Jiang ⋅ Wenjing Huang ⋅ Xin Li ⋅ Qi Sun ⋅ Cheng Zhuo
Asymmetric Anchoring: Opening the Black Box of MLLMs for Forgery Detection
Zhiqiang Yang ⋅ Renshuai Tao ⋅ Chunjie Zhang ⋅ Zhaoxiang Liu ⋅ Xiaolong Zheng ⋅ Yao Zhao
SGMatch: Semantic-Guided Non-Rigid Shape Matching with Flow Regularization
Tianwei Ye ⋅ Xiaoguang Mei ⋅ Yifan Xia ⋅ Fan Fan ⋅ Jun Huang ⋅ Jiayi Ma
EgoPHI: Estimating 3D Hand-Object Contact and Force from Egocentric Vision
Andela Ilic ⋅ Rachel Schuchert ⋅ Yijing Jiang ⋅ Christian Holz
Q-REAL: Towards Naturalness and Distortion Evaluation for AI-Generated Content
Shushi Wang ⋅ Zicheng Zhang ⋅ Chunyi Li ⋅ Wei Wang ⋅ Liya Ma ⋅ Xiaoyu Li ⋅ Fengjiao Chen ⋅ Xuezhi Cao ⋅ Guangtao Zhai ⋅ Xiaohong Liu
DualResPS: Dual-Resolution Photometric Stereo Using a Frame-Event Hybrid Camera
Haotian Zhuang ⋅ Bohan Yu ⋅ Zhuofeng Wang ⋅ Boxin Shi
Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes
Victoria Chen ⋅ Emery Pierson ⋅ Léopold Maillard ⋅ Maks Ovsjanikov
Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion
yang yang ⋅ Tianyi Zhang ⋅ Wei Huang ⋅ Jinwei Chen ⋅ Boxi Wu ⋅ Xiaofei He ⋅ Deng Cai ⋅ Bo Li ⋅ Peng-Tao Jiang
Towards Alias-Free 4D Gaussian Representations with Motion-Aware Filtering
Ankit Dhiman ⋅ Kunal A Kathare ⋅ Pranav Vignesh ⋅ LOKESH BOREGOWDA ⋅ Venkatesh Babu Radhakrishnan
UNet-Twice: A Simple Structured Reference-based Inpainting Framework
Junda Lu ⋅ zhiqiao xu ⋅ Houkun Wu ⋅ Wei Cui ⋅ Bo Huang ⋅ Mingyang Chen ⋅ Bing Li
Zero-Shot Inference-Time Rectification for Real-World Arbitrary-Scale Super-Resolution
Yifan Zuo ⋅ tianlin zhu ⋅ zhenlong xia ⋅ Jiebin Yan ⋅ Xiaoshui Huang ⋅ Sanqian Li ⋅ Yuming Fang ⋅ Qiang Wu
GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth
Joaquin Gajardo ⋅ Michele Volpi ⋅ Marko Mihajlovic ⋅ Siyu Tang ⋅ Lukas Roth ⋅ Sergey Prokudin
PoseImageNet: Pose Estimation for Extensive Classes Based on Rich Structure Prototypes
Junjie Chen ⋅ Hong Cao ⋅ Weixiang Tao ⋅ Yuming Fang ⋅ Jiebin Yan ⋅ Yifan Zuo
A Simple Baseline with Placement Prior for Point-Supervised Oriented Object Detection
Runxiang Liu ⋅ Kaikai Xie ⋅ Qianxi Cao ⋅ Yuming Fang ⋅ Jiebin Yan ⋅ Junjie Chen
FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion
Yuang Meng ⋅ Chenyang Wu ⋅ Xianshun Liu ⋅ Chun-Le Guo ⋅ Zichen Liang ⋅ Lina Lei ⋅ Jie Liang ⋅ Hui Zeng ⋅ Chongyi Li ⋅ Yabin Zhang
Hierarchical Prompt Injector for Domain Generalization Segmentation
Xin Kun Lin ⋅ Ruoyu Guo ⋅ Jiaqi Guo ⋅ Maurice Pagnucco ⋅ Yang Song
VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
Tengjiao Yin ⋅ Jinglei Shi ⋅ Heng Guo ⋅ Xi WANG
Gripper-aware Vision Language Action Models
Hanyi Zhang ⋅ Zihong Luo ⋅ Tianyu Li ⋅ Khang Nguyen ⋅ Basu Hela ⋅ Shreyas Kumar ⋅ Ngoc Tran ⋅ Feng Dai ⋅ Charith Munasinghe ⋅ Jorge Queralta ⋅ Giovanni Toffetti ⋅ Khoa Vo ⋅ Ngan Le ⋅ Ravi Prakash ⋅ Quan Vuong ⋅ Tung Ta ⋅ Long Hu ⋅ Anh Nguyen ⋅ Baoru Huang
One Trap to Block Them All: Defending Encoder Stealing via Isotropic Uniformity
YITONG SHI ⋅ Kang Wei ⋅ Fushuo Huo ⋅ Shuchi Wu ⋅ Chuan Ma
LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization
Md Raqib Khan ⋅ Santosh Vipparthi ⋅ Subrahmanyam Murala
SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark
Sania Bano ⋅ Shahzad Ahmad ⋅ Santosh Vipparthi ⋅ Sukalpa Chanda ⋅ Subrahmanyam Murala
Linear Scaling Video VLMs for Long Video Understanding
Cristobal Eyzaguirre ⋅ Jiajun Wu ⋅ Juan Carlos Niebles
HiPolicy: Hierarchical Multi-Frequency Action Chunking for Policy Learning
Jiyao Zhang ⋅ Zimu Han ⋅ Junhan Wang ⋅ Xionghao Wu ⋅ Shihong Lin ⋅ Jinzhou Li ⋅ Hongwei Fan ⋅ Ruihai Wu ⋅ Dongjiang Li ⋅ Hao Dong
VD-LoRA: Adaptive Reuse of Low-Rank Directions for Continual Learning
Luqiong Ding ⋅ Jiayao Tan ⋅ Chenggong Ni ⋅ Fuyuan Hu ⋅ Fan Lyu
ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA
Minkuk Kim ⋅ Suyong Yun ⋅ Young Kim ⋅ Jinyoung Moon ⋅ Jinwoo Choi ⋅ Seong Tae Kim
UniDynamics: Event-RGB Fusion for Unified Future 4D Dynamic Scene Generation
Daikun Liu ⋅ Xin Zhan ⋅ Teng Wang ⋅ Xiaoping Wang ⋅ Changyin Sun
RL from Physical Feedback: Aligning Large Motion Models with Humanoid Control
Junpeng Yue ⋅ Zepeng Wang ⋅ Jiangxing Wang ⋅ Yuxuan Wang ⋅ Yu Zhang ⋅ Xinrun Xu ⋅ Bin Cao ⋅ Sipeng Zheng ⋅ gang ding ⋅ Zongqing Lu
Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time
Xinyi Wang ⋅ Yuyang Huang ⋅ Yalin Su ⋅ Pengcheng Luan ⋅ Tao Zhang ⋅ FEIMING WEI ⋅ Wenxian Yu
HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions
Yukang Cao ⋅ Haozhe Xie ⋅ Fangzhou Hong ⋅ Long Zhuo ⋅ Zhaoxi Chen ⋅ Liang Pan ⋅ Ziwei Liu
InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization
Ronghui Li ⋅ zhongyuan hu ⋅ Li Siyao ⋅ youliang zhang ⋅ Haozhe Xie ⋅ Mingyuan Zhang ⋅ Jie Guo ⋅ Xiu Li ⋅ Ziwei Liu
Correlation-Weighted Multi-Reward Optimization for Compositional Generation
Jungmyung Wi ⋅ Hyunsoo Kim ⋅ Donghyun Kim
Stylized Video Generation via Decoupled Data Synthesis and Gated Style Token Injection
Xin Wei ⋅ Yijie Fang ⋅ Yanjia Li ⋅ Liangyi Wu ⋅ Qin Yang ⋅ Mingrui Zhu ⋅ Nannan Wang ⋅ Xinbo Gao
Where and What: Long-Term Object Tracking in Egocentric Videos
Jacob Chalk ⋅ Saptarshi Sinha ⋅ Dima Damen ⋅ Yannis Kalantidis ⋅ Larlus Diane
PDF-Omni: Poincaré Dual Disk Distortion Field-based Recurrent Update for Omnidirectional Stereo Matching
Yunseok Yang ⋅ Eunjin Son ⋅ Sang Lee
MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization
Jingchen Ni ⋅ Cangjin Yu ⋅ Zytang Jiang ⋅ Quan Zhang ⋅ Keyu Lv ⋅ Shannan Yan ⋅ Linyue Pan ⋅ Ke Zhang ⋅ Chun Yuan
Fast and Scalable LiDAR Data Generation for Autonomous Driving Simulation without Raycasting
Irfan Nafiz Shahan ⋅ Al-Mubin Nabil ⋅ Arpan Kusari
Hybrid Event–Frame Sensors: Modeling, Calibration, and Simulation
yunfan lu ⋅ Nico Messikommer ⋅ Xiaogang Xu ⋅ Liming Chen ⋅ Yuhan Chen ⋅ Nikola Zubic ⋅ Davide Scaramuzza ⋅ Hui Xiong
Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
Yu Qi ⋅ Xinyi Xu ⋅ Ziyu Guo ⋅ Siyuan Ma ⋅ Renrui Zhang ⋅ Xinyan Chen ⋅ Ruichuan An ⋅ Ruofan Xing ⋅ Jiayi Zhang ⋅ Haojie Huang ⋅ Pheng-Ann Heng ⋅ Jonathan Tremblay ⋅ Lawson Wong
Robust onion: Peeling Open Vocab Object Detectors Under Noise
Priyank Pathak ⋅ Mukilan Karuppasamy ⋅ Aaditya Baranwal ⋅ Shruti Vyas ⋅ Yogesh Rawat
Attention is Case-Sensitive
Maximilian Dillitzer ⋅ Tin Stribor Sohn ⋅ Jason Corso ⋅ Michael Auerbach
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
Kaisi Guan ⋅ Xihua Wang ⋅ Zhengfeng Lai ⋅ Xin Cheng ⋅ Peng Zhang ⋅ Xiaojiang Liu ⋅ Ruihua Song ⋅ Meng Cao
RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios
Tianyi Zhao ⋅ Jiawen Xi ⋅ Linhui Xiao ⋅ Junnan Li ⋅ Xue Yang ⋅ Maoxun Yuan ⋅ Xingxing Wei
SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning
Tin Stribor Sohn ⋅ Maximilian Dillitzer ⋅ Jason Corso ⋅ Johannes Bach ⋅ Eric Sax
ELHINN: Unifying Dense Crowd Simulation Across Scales via Eulerian–Lagrangian Hydrodynamics
Yanshan Zhou ⋅ Pingrui Lai ⋅ Jiaqi Yu ⋅ Cunyan Li ⋅ Hua Yang ⋅ Xiaoyun Zhang
Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs
Deniz Bickici ⋅ Michael Pabst ⋅ Shohei Mori ⋅ Dieter Schmalstieg
Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics
Tim Alexander Bader ⋅ Tim Eberhardt ⋅ Maximilian Dillitzer ⋅ Wilhelm Stork
GridVQA-X: A Diagnostic Framework for Evaluating Multimodal Explainability Methods
Sujay Belsare ⋅ Sushant Kumar ⋅ Sudarshan Nikhil ⋅ Ponnurangam Kumaraguru ⋅ Chirag Agarwal
DIVA: Instruction-Aware Vision Token Pruning via Dual-Probe Attention Discrepancy
Hyunwoo Kim ⋅ Kisu Lee ⋅ Yuna Shin ⋅ Ha Young Kim
ECTraj: Enhanced Consistency Training for Multi-Agent Trajectory Prediction
Alen Mrdovic ⋅ Qingze Liu ⋅ Danrui Li ⋅ Mathew Schwartz ⋅ Kaidong Hu ⋅ Sejong Yoon ⋅ Mubbasir Kapadia ⋅ Vladimir Pavlovic
DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models
Zhengming Yu ⋅ Li Ma ⋅ Mingming He ⋅ Leo Isikdogan ⋅ Yuancheng Xu ⋅ Dmitriy Smirnov ⋅ Pablo Salamanca ⋅ Dao Mi ⋅ Pablo Delgado ⋅ Ning Yu ⋅ Julien Philip ⋅ Xin Li ⋅ Wenping Wang ⋅ Paul Debevec
Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation
Jialu Huang ⋅ Yingxuan You ⋅ Fei Wang ⋅ Zheng Dang
TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging
Guangyu Meng ⋅ Pengfei Gu ⋅ Xueyang Li ⋅ Yiyu Shi ⋅ Erin Chambers ⋅ Danny Chen
MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction
Jinqian Yang ⋅ Yichen Wu ⋅ Wanhua Li ⋅ Haokun Lin ⋅ Renzhen Wang ⋅ Xiangchu Feng ⋅ Xixi Jia
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
Lingxiao Li ⋅ Yifan Wang ⋅ Xinyan Gao ⋅ Chen Tang ⋅ Xiangyu Yue ⋅ Chenyu You
Multi-Anchor Distillation with Text-Guided Analytic Classifier for Continual Learning
Qier Meng ⋅ De Cheng ⋅ Jiahao Li ⋅ Cheng Deng
REALM: An RGB and Event Aligned Latent Manifold for Cross-Modal Perception
Vincenzo Polizzi ⋅ David Lindell ⋅ Jonathan Kelly
Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning
Jingyun Chen ⋅ Linghan Cai ⋅ Zhikang Wang ⋅ Yi Huang ⋅ Songhan Jiang ⋅ Shenjin Huang ⋅ Hongpeng Wang ⋅ Yongbing Zhang
GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing
Zifeng Zhu ⋅ Jiaming Han ⋅ Jiaxiang Zhao ⋅ Minnan Luo ⋅ Xiangyu Yue
OpenPanoD: Aligning Multimodal Prompts and Spherical Representations for Open-Vocabulary Panoramic Detection
Hang Xu
A Comprehensive Analysis about Unsupervised Outlier Detection for Images
Zhonghang Liu ⋅ Siyuan Chen ⋅ Jingwen Yu ⋅ Changshuo Wang ⋅ Kunyang Li ⋅ Jiangbo Lu
MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents
Dannong Xu ⋅ zhongyu yang ⋅ Jun Chen ⋅ Yingfang Yuan ⋅ Ming Hu ⋅ Lei Sun ⋅ Luc Van Gool ⋅ Danda Paudel ⋅ Chun-Mei Feng
Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning
Yifan Wu ⋅ Yiqi Wang ⋅ Xichen Ye ⋅ Wenjing Yan ⋅ Xiaoqiang Li ⋅ Cheng Jin ⋅ WEIZHONG ZHANG ⋅ Xiangyu Yue
X-Stream: Benchmarking MLLMs as Multiplexers for Multi-Stream Understanding
Peiwen Sun ⋅ Xudong LU ⋅ Huadai Liu ⋅ Yang Bo ⋅ Dongming Wu ⋅ Huankang Guan ⋅ Minghong Cai ⋅ Jinpeng Chen ⋅ Xintong Guo ⋅ Shuhan LI ⋅ FANG LIU ⋅ Rui Liu ⋅ Xiangyu Yue
SyncVL: Synchronizing Vision ⟷ Language Using Unsupervised Adaptation
Maria Marrium ⋅ Muhammad Haris Khan ⋅ Sajid Javed ⋅ Arif Mahmood
Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection
Shashank Kotyan ⋅ Makoto Shing ⋅ Yuki Imajuku ⋅ Rujikorn Charakorn ⋅ Tarin Clanuwat
∂DIBR: Differentiable Depth Image-based Rendering for Fast Novel View Synthesis
Armand Losfeld ⋅ Sarah Dury ⋅ Gauthier Lafruit ⋅ Mehrdad Teratani ⋅ Daniele Bonatto
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
Haonan Jiang ⋅ Yuji Wang ⋅ Yongjie Zhu ⋅ Xin Lu ⋅ Wenyu Qin ⋅ Meng Wang ⋅ Pengfei Wan ⋅ Yansong Tang
CFM: Language-aligned Concept Foundation Model for Vision
Kai Wittenmayer ⋅ Sukrut Rao ⋅ Amin Parchami-Araghi ⋅ Bernt Schiele ⋅ Jonas Fischer
SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization
Jiun Lee ⋅ Jaekwang Kim ⋅ Sangmin Lee
Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning
Guoqiang Liang ⋅ Jianyi Wang ⋅ Zhonghua Wu ⋅ Shangchen Zhou ⋅ Chen Change Loy
Small Vision-Language Models are Smart Compressors for Long Video Understanding
Junjie Fei ⋅ Jun Chen ⋅ Zechun Liu ⋅ Yunyang Xiong ⋅ Chong Zhou ⋅ Wei Wen ⋅ Junlin Han ⋅ Mingchen Zhuge ⋅ Saksham Suri ⋅ Qi Qian ⋅ Shuming Liu ⋅ Lemeng Wu ⋅ Raghuraman Krishnamoorthi ⋅ Vikas Chandra ⋅ Mohamed Elhoseiny ⋅ Chenchen Zhu
MobileManiBench: Simplifying Model Verification for Mobile Manipulation
Wenbo Wang ⋅ Fangyun Wei ⋅ Qixiu Li ⋅ Xi Chen ⋅ Yaobo Liang ⋅ Chang Xu ⋅ Jiaolong Yang ⋅ Baining Guo
Multi-label Instance-level Generalised Visual Grounding in Agriculture
Mohammadreza Haghighat ⋅ Alzayat Saleh ⋅ Mostafa Azghadi
HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding
jiha jang ⋅ Hayeon Kim ⋅ Junghun James Kim ⋅ Chulwon Lee ⋅ Se Young Chun
LaMP: Learning Vision-Language-Action Policies with 3D Scene Flow as Latent Motion Prior
Xinkai Wang ⋅ Chenyi Wang ⋅ Yifu Xu ⋅ Mingzhe Ye ⋅ Fu-Cheng Zhang ⋅ Jialin Tian ⋅ Xinyu Zhan ⋅ Lifeng Zhu ⋅ Cewu Lu ⋅ Lixin Yang
AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution
Zehao Wang ⋅ Yihan Zeng ⋅ Zidong Gong ⋅ Yuanfan Guo ⋅ Feng Zhu ⋅ Hongzhi Zhang ⋅ Wei Zhang ⋅ Wangmeng Zuo
Repurposing Geometric Foundation Models for Multi-view Diffusion
Wooseok Jang ⋅ Seonghu Jeon ⋅ Jisang Han ⋅ Jinhyeok Choi ⋅ Minkyung Kwon ⋅ Seungryong Kim ⋅ Saining Xie ⋅ Sainan Liu
Proto-Gaussian: MRI Modality Translation Based on Learnable Structural Prototypes and 2D Gaussian Splatting
Zizheng Li ⋅ RenDong Xie ⋅ Huadeng Wang ⋅ Zhifen He ⋅ Bin Liu ⋅ Bo Li ⋅ Xiaonan Luo
QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding
Wei Ao ⋅ Lan Wang ⋅ Vishnu Boddeti
LoRC: Detecting AI-Generated Images via Low-Rank Collapse in the Semantic-Residual Space
Haozhen Yan ⋅ Ruoxin Chen ⋅ Jiahui Zhan ⋅ Taiping Yao ⋅ Bo Wang ⋅ Youchang xiao ⋅ Shouhong Ding ⋅ Liqing Zhang ⋅ Jianfu Zhang
ActionPlan: Future-Aware Streaming Motion Synthesis via Frame-Level Action Planning
Eric Nazarenus ⋅ Chuqiao Li ⋅ Yannan He ⋅ Xianghui Xie ⋅ Jan Eric Lenssen ⋅ Gerard Pons-Moll
Proteus: Model Leakage-Induced Adversarial Attack in Federated Learning
Junjie Shan ⋅ Yue Zhang ⋅ Ziqi Zhao ⋅ Ka Ho Chow
StrucTab: A Structured Optimization Framework for Table Parsing
Gengluo Li ⋅ Shangpin Peng ⋅ Chengquan Zhang ⋅ Binghong Wu ⋅ Hao Feng ⋅ Weinong Wang ⋅ Pengyuan Lyu ⋅ Huawen Shen ⋅ Xingyu Wan ⋅ Zhuotao Tian ⋅ Han Hu ⋅ Can Ma ⋅ Yu ZHOU
SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
Olaf Dünkel ⋅ Basavaraj Sunagad ⋅ Haoran Wang ⋅ David Hoffmann ⋅ Christian Theobalt ⋅ Adam Kortylewski
340 FPS Reflection-free Video from Spikes Modulated by a Rapidly Rotating Polarizer
Lishuai Huang ⋅ Yeliduosi Xiaokaiti ⋅ Youwei Lyu ⋅ Langyue Chang ⋅ Boxin Shi ⋅ Shikui Wei ⋅ Yao Zhao ⋅ Meng Jian ⋅ Yashen Wang ⋅ Yakun Chang
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
Sitong Gong ⋅ Tianyu Yan ⋅ Caixin Kang ⋅ Bo Zheng ⋅ Xiang Ruan ⋅ Huchuan Lu ⋅ Kaipeng Zhang ⋅ Yoichi Sato ⋅ Yifei Huang
NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation
HAIYANG YAN ⋅ Jinyue Guo ⋅ Yanchao Zhang ⋅ Bingqing Wang ⋅ Zhenchen Li ⋅ Jing Liu ⋅ Jiazheng Liu ⋅ linlin li ⋅ Hua Han
Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation
Jin Wang ⋅ Jianxiang Lu ⋅ Comi Chen ⋅ Guangzheng Xu ⋅ Haoyu Yang ⋅ Peng Chen ⋅ Na Zhang ⋅ Yifan Xu ⋅ Longhuang Wu ⋅ Shuai Shao ⋅ Qinglin Lu ⋅ Ping Luo
DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis
Cheng-You Lu ⋅ Yi-Shan Hung ⋅ Wei Chi ⋅ Hao Ping Wang ⋅ Charlie Tsai ⋅ Yu-Cheng Chang ⋅ Yu-Lun Liu ⋅ Thomas Do ⋅ Chin-teng Lin
Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models
Ziqi Ma ⋅ Mengzhan Liufu ⋅ Georgia Gkioxari
Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations
Alex Costanzino ⋅ Pierluigi Zama Ramirez ⋅ Giuseppe Lisanti ⋅ Luigi Di Stefano
World-in-Loop: Online Correction via Event-Triggered World Models for Robust VLA Policies
Shaoqing Xu ⋅ Fang Li ⋅ Zhi-Xin Yang ⋅ Qimao Chen ⋅ Yuechen Luo ⋅ Zhixiang Duan ⋅ Yifan Yang ⋅ Long Chen
Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
Jacky Kwok ⋅ Xilun Zhang ⋅ Mengdi Xu ⋅ Yuejiang Liu ⋅ Azalia Mirhoseini ⋅ Chelsea Finn ⋅ Marco Pavone
Compact Low-Cost Hyperspectral Imaging via Angular-to-Spectral Diversity Conversion
Kazuma Fujiwara ⋅ Takuya Funatomi ⋅ Kazuya Kitano ⋅ Yuki Fujimura ⋅ Yasuhiro Mukaigawa
TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs
Yanqi Wu ⋅ Runhe Lai ⋅ Xinhua Lu ⋅ Qichao Chen ⋅ Zhiping Zhou ⋅ Jia-Xin Zhuang ⋅ Weijiang Yu ⋅ Ruixuan Wang
Large-Scale High-Quality 3D Gaussian Head Reconstruction from Multi-View Captures
Evan Ntavelis ⋅ Sean Wu ⋅ Mohamad Shahbazi ⋅ Fabio Maninchedda ⋅ Dmitry Kostiaev ⋅ Artem Sevastopolsky ⋅ Mehak Gupta ⋅ Vittorio Megaro ⋅ Trevor Phillips ⋅ Thomas Etterlin ⋅ Jeronimo Bayer ⋅ Simon Schaefer ⋅ Matthias Vestner ⋅ Shridhar Ravikumar ⋅ Christian Zimmermann ⋅ Alejandro Blumentals ⋅ Reinhard Knothe ⋅ Mathias Deschler ⋅ Alexey Artemov ⋅ Stefan Brugger ⋅ Peter Kaufmann ⋅ Sebastian Martin ⋅ Brian Amberg ⋅ Tom Runia
Visual Prompt Discovery via Semantic Exploration
Jaechang Kim ⋅ Yotaro Shimose ⋅ Zhao Wang ⋅ Kuang-Da Wang ⋅ Jungseul Ok ⋅ Shingo Takamatsu
DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models
Francesco Taioli ⋅ Daniel Coelho ⋅ Iaroslav Melekhov ⋅ Roberto Alcover-Couso ⋅ Jose Saiz ⋅ Virginia Arguedas ⋅ Artur Bekasov
Enlightening Photographic Style Transfer with a Self-Supervised Photographic Embedding
Chengxuan Zhu ⋅ Jiacong Fang ⋅ Shuchen Weng ⋅ Youwei Lyu ⋅ Jiajun Tang ⋅ Qingnan Fan ⋅ Chao Xu ⋅ Boxin Shi
Environmental Change Detection for Real-World Change Analysis
Kyusik Cho ⋅ Suhan Woo ⋅ Hongje Seong ⋅ Euntai Kim
SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs
Bo Yin ⋅ Xiaobin Hu ⋅ Chengming Xu ⋅ Ruolin Shen ⋅ Mo Yang ⋅ Jiangning Zhang ⋅ Peng-Tao Jiang ⋅ Cheng Tan ⋅ Shuicheng Yan
StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring
Jianfang Li ⋅ Xiangyue Zhang ⋅ Jiaxu Zhang ⋅ Kaixing Yang ⋅ Steven Hoi
ViewSplat: View-Adaptive Dynamic Gaussian Splatting for Feed-Forward Synthesis
Moonyeon Jeong ⋅ Seunggi Min ⋅ Suhyeon Lee ⋅ Hongje Seong
TORA: Topological Representation Alignment for 3D Shape Assembly
Nahyuk Lee ⋅ Zhiang Chen ⋅ Marc Pollefeys ⋅ Sunghwan Hong
DiffPro: Joint Timestep and Layer-Wise Precision Optimization for Efficient Diffusion Inference
Farhana Amin ⋅ Sabiha Afroz ⋅ Kanchon Gharami ⋅ Mona Moghadampanah ⋅ Dimitrios Nikolopoulos
Bayesian Self-Attention with Local Pixel Correlations for Lightweight Denoising Transformers
Runyang He ⋅ Zuowei Shen ⋅ Hui JI
InstantRetouch: Personalized Image Retouching without Test-time Fine-tuning
Temesgen Muruts Weldengus ⋅ Binnan Liu ⋅ Fei Kou ⋅ Youwei Lyu ⋅ Jinwei Chen ⋅ Changqing Zou ⋅ Qingnan Fan
Driving is a Game: Combining Planning and Prediction with Bayesian Iterative Best Response
Aron Distelzweig ⋅ Yiwei Wang ⋅ Faris Janjos ⋅ Marcel Hallgarten ⋅ Mihai Dobre ⋅ Alexander Langmann ⋅ Joschka Boedecker ⋅ Johannes Betz
Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT–Quantization Embedding
Mohamed Dhouib ⋅ Ye Zhu ⋅ Sonia Vanier ⋅ Aymen Shabou
CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models
Li Gao ⋅ Liu Liu ⋅ Mingyang Lyu ⋅ Yang Cai
DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition
Jiaying Lin ⋅ Shiman Wu ⋅ Jinfu Liu ⋅ Can Wang ⋅ Mengyuan Liu
TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation
Jini Yang ⋅ Eunbeen Hong ⋅ Soowon Son ⋅ Hyunkoo Lee ⋅ Sunghwan Hong ⋅ Sunok Kim ⋅ Seungryong Kim
Learning from Primitive: Probing Visual Reasoning of LVLMs via Counting
Liwei Che ⋅ Zhiyu Xue ⋅ Yihao Quan ⋅ Benlin Liu ⋅ Zeru Shi ⋅ Ruixiang Tang ⋅ Ranjay Krishna ⋅ Vladimir Pavlovic
Test-Time Registers as Global Priors for Tokenized Image Generation
Cheng-Yao Hong ⋅ Yifan Wang ⋅ Yuewei Lin ⋅ Chenyu You
PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment
Aymeric Fleith ⋅ Julian Zirbel ⋅ Daniel Cremers ⋅ Niclas Zeller
Guiding the Blind: Generalizing GUI Agents to Unseen Websites via Multimodal Tutorials
Xinwei Long ⋅ Kai Tian ⋅ Peng Xu ⋅ Weibo Gao ⋅ Yihua Shao ⋅ Guoli Jia ⋅ Haozhe Geng ⋅ Sa Yang ⋅ Jingxuan Li ⋅ Huayong Hu ⋅ Kaiyan Zhang ⋅ Jiaqi Wang ⋅ Bowen Zhou
CascadeProto: Cascaded Cross-Modal Prototype Purification via Entropy-Aware Learning for Few-Shot 3D Point Cloud Segmentation
Changshuo Wang ⋅ Weijun Li ⋅ Fan Mo ⋅ Zhonghang Liu ⋅ Shuting He ⋅ Prayag Tiwari ⋅ Dimitrios Kanoulas
OmniNWM: Unifying the State-Action-Reward Triad for Closed-Loop Panoramic Driving Navigation World Models
Bohan Li ⋅ Zhuang Ma ⋅ Dalong Du ⋅ Baorui Peng ⋅ Zhujin Liang ⋅ Zhenqiang Liu ⋅ Xianda Guo ⋅ Chao Ma ⋅ Yueming Jin ⋅ Zheng Zhu ⋅ HAO ZHAO ⋅ Wenjun Zeng ⋅ Xin Jin
Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents
Sangwon Baik ⋅ Gunhee Kim ⋅ Mingi Choi ⋅ Hanbyul Joo
ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
Binjie Zhang ⋅ Mike Zheng Shou
HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization
Tao Cheng ⋅ Shi-Zhe Chen ⋅ Hao Zhang ⋅ Yixin Qin ⋅ Jinwen Luo ⋅ Zheng Wei
Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation
Xing Xie ⋅ Jiawei Liu ⋅ Shijun Zhou ⋅ Huijie Fan ⋅ Zhi Han ⋅ Yandong Tang ⋅ Liangqiong Qu
DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding
zhengbo zhang ⋅ Mark H. Huang ⋅ Zhigang Tu ⋅ Ming-Hsuan Yang
HASSL: Hierarchy-Aware Self-Supervised Learning Framework for Single Cell Microscopy
Julius Riel ⋅ Vishwa Mohan Singh ⋅ SAI ANIRUDH ARYASOMAYAJULA ⋅ Anuun Chinbat ⋅ Hannes Leonhard ⋅ Moritz Ladenburger ⋅ Frederik Alexander ⋅ Vishisht Choudhary ⋅ Fabio Laredo ⋅ Giacomo Masserdotti ⋅ Thorben Prein ⋅ Amirhossein Kardoost ⋅ Carsten Marr
MANGO: Unleashing Image Generation Capability of Unified Multimodal Models
Yi Wang ⋅ Mushui Liu ⋅ Wanggui He ⋅ Hanyang Yuan ⋅ Ziwei Huang ⋅ Guanghao Zhang ⋅ Wenkai Fang ⋅ Haoze Jiang ⋅ Shengxuming Zhang ⋅ Weilong Dai ⋅ Haofei Zhang ⋅ Mingli Song ⋅ Hao Jiang ⋅ Jie Song
FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration
Thiru Thillai Nadarasar Bahavan ⋅ Sachith Seneviratne ⋅ Saman Halgamuge
CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection
Wen Dong ⋅ Zhao Wang ⋅ Shuangqing Zhang ⋅ Kai Sun ⋅ Ben Li ⋅ Guosen Xie ⋅ Caifeng Shan ⋅ Fang Zhao
On the real-world generalisability of Optical Flow models
Petter Reijalt ⋅ Alexander Gielisse ⋅ Rickard Karlsson ⋅ Jan van Gemert
OCTOPUS: Multi‑Agentic Universal Compositional Visual Retrieval
Zhangtao Cheng ⋅ Bozhu Zheng ⋅ Ting Zhong ⋅ Fan Zhou
Stealthy Multi-task Adversarial Attacks
Jiacheng Guo ⋅ Tianyun Zhang ⋅ Lei Li ⋅ Haochen Yang ⋅ Hongkai Yu ⋅ Minghai Qin
3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement
Deyin Liu ⋅ Jicheng Xu ⋅ Lin Wu ⋅ Xiaowei Zhao ⋅ Xiatian Zhu ⋅ Anjan Dutta ⋅ Zhe Jin
ATP-Bench: Towards the Agentic Tool Planning for MLLM Interleaved Generation
Yinuo Liu ⋅ Zi Qian ⋅ Heng Zhou ⋅ Jiahao Zhang ⋅ Yajie Zhang ⋅ Zhihang Li ⋅ Mengyu Zhou ⋅ Erchao Zhao ⋅ xiaoxi jiang ⋅ Guanjun Jiang
Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
Hau-Shiang Shiu ⋅ Chin-Yang Lin ⋅ Zhixiang Wang ⋅ Chi-Wei Hsiao ⋅ Po-Fan Yu ⋅ Yu-Chih Chen ⋅ Yu-Lun Liu
Fully Rotation-Equivariant Spectral-Spatial Learning for Multispectral Object Detection
Peng Zhang ⋅ Tingfa Xu ⋅ Shuaihao Han ⋅ Jianan Li
TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization
Siwoo Lim ⋅ Sunjae Yoon ⋅ Gwanhyeong Koo ⋅ Hyeonseo Yun ⋅ Chang Yoo
White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation
Jiyun Im ⋅ SuBeen Lee ⋅ Miso Lee ⋅ Jae-Pil Heo
Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
Na Min An ⋅ Inha Kang ⋅ Minhyun Lee ⋅ Hyunjung Shim
Consistent Feature Transport for Image Relighting
Bohan Zhang ⋅ huanweiliang huanweiliang ⋅ Yuhan He ⋅ Hongteng Xu ⋅ Xiaochao Qu ⋅ Luoqi Liu ⋅ Dixin Luo ⋅ Ting Liu
DART: Deformable Adaptive Reasoning with Temporal Queries for Online Skeleton-Based Action Recognition
Chaoyang Zheng ⋅ Yang Xiao ⋅ Tingbing Yan ⋅ Jinfang Gan ⋅ Xintao Zhang ⋅ Ran Wang ⋅ Zhiguo Cao ⋅ Joey Tianyi Zhou
OREO: Fidelity Alignment in 3D Generation via On-the-fly Rendering-Editing Optimization
Zhiyuan MA ⋅ WENBO HU ⋅ Wang Zhao ⋅ Pengfei Wang ⋅ Ying Shan ⋅ Yabin Zhang
CoDePose: Multi-View 3D Human Pose Estimation via Coupled 2D-3D Denoising Diffusion
Yanlu Cai ⋅ Yuxuan Liu ⋅ WEIZHONG ZHANG ⋅ Yuan Wu ⋅ Cheng Jin
Kinematics-Agnostic 3D Human Motion Prediction via Equivariant Latent Diffusion
Cecilia Curreli ⋅ Florian Hofherr ⋅ Dominik Muhle ⋅ Abhishek Saroha ⋅ Riccardo Marin ⋅ Daniel Cremers
GAP-Track: Bridging the Resolution Gap for Cross-Resolution RGBT Tracking
Shiyu Zhang ⋅ Tianyang Xu ⋅ Zhangyong Tang ⋅ Wang He ⋅ Xiao-Jun Wu ⋅ Josef Kittler
WALL-EVE: World Alignment with Rule Learning in Visual Environments
Siyu Zhou ⋅ Tianyi Zhou ⋅ Yijun Yang ⋅ Deheng Ye ⋅ Chengqi Zhang ⋅ Jing Jiang ⋅ Guodong Long
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
Hejun Dong ⋅ Junbo Niu ⋅ Bin Wang ⋅ Weijun Zeng ⋅ Wentao Zhang ⋅ Conghui He
3D Gaussian Texture for Real-time Mesoscale Appearance Synthesis and Rendering
Xiang Chen ⋅ Jia Li ⋅ Lu Wang ⋅ Beibei Wang
ORACLE-3D: Open-world Region-aligned Cross-modal Learning for Label-efficient 3D Scene Understanding
Yuru Wang ⋅ Pei Liu ⋅ Songtao Wang ⋅ Zehan Zhang ⋅ Xinyan Lu ⋅ Changwei Cai ⋅ Hao Li ⋅ Haipeng LIU ⋅ Qingtian Ning ⋅ Jun Ma
2D Features Are All You Need for 3D Shape Understanding
Jinfan Zhou ⋅ Richard Liu ⋅ Itai Lang ⋅ Rana Hanocka
Residual-Guided Expert Specialization for Incomplete Multimodal Learning
Seunghun Baek ⋅ Jihwan Park ⋅ Jaeyoon Sim ⋅ Minjae Jeong ⋅ Hoseok Lee ⋅ Won Hwa Kim
Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning
Jiajie Mi ⋅ Xinyu Liu ⋅ Mengke Song ⋅ Chenglizhao Chen
GeoWorld: Providing Full-frame Geometry Features to Facilitate 3D Scene Generation
Yuhao Wan ⋅ Lijuan Liu ⋅ Jingzhi Zhou ⋅ Zihan Zhou ⋅ Xuying Zhang ⋅ dongbo zhang ⋅ Shaohui Jiao ⋅ Qibin Hou ⋅ Ming-Ming Cheng
LACON: Training Text-to-Image Model from Uncurated Data
Zhiyang Liang ⋅ Ziyu Wan ⋅ Hongyu Liu ⋅ DONG CHEN ⋅ Qiu Shen ⋅ Hao Zhu ⋅ Dongdong Chen
HIDA: A Human-Intuition-Guided Depth-Aware Framework for Zero-Shot Amodal Segmentation
PENG LI ⋅ Kelin Wang ⋅ Bingchuan Chen ⋅ Ya-Li Hou ⋅ Mingxia Shen ⋅ Bo Li
Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models
Niklas Schweiger ⋅ Karnik Ram ⋅ Daniel Cremers
HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion
Di Chang ⋅ Ji Hou ⋅ Aljaz Bozic ⋅ Assaf Neuberger ⋅ Felix Juefei-Xu ⋅ Olivier Maury ⋅ Gene Lin ⋅ Tuur Stuyck ⋅ Doug Roble ⋅ Mohammad Soleymani ⋅ Stéphane Grabli
Learning Ego-Centric BEV Representations from a Perspective-Privileged View: Cross-View Supervision for Online HD Map Construction
Daniel Lengerer ⋅ Mathias Pechinger ⋅ Klaus Bogenberger ⋅ Carsten Markgraf
Spectral Consistent Flow for One-step 3D Medical Image Translation
Haoqing Li ⋅ Jun Shi ⋅ Mingchao Li ⋅ Zehua Zhu ⋅ Qiwei Jia ⋅ Jiong SHI ⋅ Hong An
G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation
Hojun Song ⋅ Chae-yeong Song ⋅ Jeong-hun Hong ⋅ chaewon moon ⋅ Soo Ye Kim ⋅ Yiyi Liao ⋅ Jaehyup Lee ⋅ Sang-hyo Park
StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production–Living Simulations with Stardew Valley
Weihao Tan ⋅ Changjiu Jiang ⋅ Yu Duan ⋅ Mingcong Lei ⋅ Li JiaGeng ⋅ Yitian Hong ⋅ Xinrun Wang ⋅ Bo An
Face Anything: 4D Face Reconstruction from Any Image Sequence
Umut Kocasarı ⋅ Simon Giebenhain ⋅ Richard Shaw ⋅ Matthias Niessner
Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction
Feng Li ⋅ Chaokun Zhang ⋅ Gong Chen
Zero-Shot Quantization for Object Detectors using Off-the-Shelf Generative Models
Hyunho Lee ⋅ Kyomin Hwang ⋅ Hyeonjin Kim ⋅ Suyoung Kim ⋅ Sunghyun Wee ⋅ Nojun Kwak
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
Jun Zhang ⋅ Xin Zhang ⋅ Jie Feng ⋅ Long Chen ⋅ Junhui Wang ⋅ Zhicheng Liu ⋅ Depeng Jin ⋅ Yong Li
Foundation-Guided Representation Alignment for Multimodal Medical Image Registration
Mengjie Guo ⋅ Xinxing Cheng ⋅ Wenqi Lu ⋅ Qingjie Meng ⋅ Guanyu Yang ⋅ Yang Chen ⋅ Ziyun Ding ⋅ Alejandro Frangi ⋅ Jinming Duan
InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation
YICHEN PENG ⋅ Jyun-Ting Song ⋅ Chen-Chieh Liao ⋅ Kris Kitani ⋅ Hideki Koike ⋅ Erwin Wu
Pixel-wise Planarity for High-Precision Monocular Plane Segmentation
Ahmetcan Yavuz ⋅ Alpay Ozkan ⋅ Rémi Pautrat ⋅ Shaohui Liu ⋅ Marc Pollefeys
AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion
Xirui Liang ⋅ Jingkai Xu ⋅ Jiaqi Liang ⋅ Yuran Wang ⋅ Ruochong Li ⋅ Yuanpei Chen ⋅ Masayoshi TOMIZUKA ⋅ Wei Zhan ⋅ Ruihai Wu
Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift
Longtian Wang ⋅ Chenhao Lin ⋅ Zhengyu Zhao ⋅ Le Yang ⋅ Shiwei Wang ⋅ Yuhan Zhi ⋅ Xiaofei Xie ⋅ Chao Shen
Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs
Wenjie Zhu ⋅ Yabin Zhang ⋅ Liang Xu ⋅ Xin Jin ⋅ Wenjun Zeng ⋅ Yabin Zhang
HippoCamp: Benchmarking Contextual Agents on Personal Computers
Zhe YANG ⋅ Shulin Tian ⋅ Kairui Hu ⋅ Shuai Liu ⋅ Hoang-Nhat Nguyen ⋅ Yichi Zhang ⋅ Zujin Guo ⋅ Mengying Yu ⋅ Zinan Zhang ⋅ Jingkang Yang ⋅ Chen Change Loy ⋅ Ziwei Liu
REON-NVS: Real-Time Online Novel-View Synthesis from Sparse-View Videos
Daeyeon Kim ⋅ Jinhyeok Kim ⋅ Gangmin Kwon ⋅ Seungjoo Shin ⋅ Sunghyun Cho
Disentangling and Reusing Interaction Cues for Zero-Shot HOI Detection
Jie Gu ⋅ He-Yang Xu ⋅ Hongxiang Gao ⋅ Chengyu Liu
Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
Yijie Qian ⋅ Juncheng Wang ⋅ Chao Xu ⋅ Huihan Wang ⋅ Yuxiang Feng ⋅ Yang Liu ⋅ Baigui Sun ⋅ Yong Liu ⋅ Shujun Wang
Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies
Yuxiang Feng ⋅ Juncheng Wang ⋅ Chao Xu ⋅ Wenlong Hou ⋅ Huihan Wang ⋅ Yijie Qian ⋅ Yang Liu ⋅ Baigui Sun ⋅ Yong Liu ⋅ Shujun Wang
SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection
Wenlin Wu ⋅ Sheng Zhou ⋅ Peipei Song ⋅ Wenhao Wang ⋅ Junbin Xiao ⋅ Xun Yang
MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling
Jin Xu ⋅ Xiaojian Huang ⋅ zhang zhihong ⋅ Luo Zhuodong ⋅ Xuejin Chen ⋅ Jie Zhao ⋅ Xin Liu ⋅ Wang Xinzhi ⋅ Jiansheng Wei
Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection
Zijian Zhuang ⋅ Yixiong Zou ⋅ Yuhua Li ⋅ Ruixuan Li
Point2Pose: Occlusion-Recovering 6D Pose Tracking and 3D Reconstruction for Multiple Unknown Objects Via 2D Point Trackers
Tzu-Yuan Lin ⋅ Ho Lee ⋅ Kevin Doherty ⋅ Yonghyeon Lee ⋅ Sangbae Kim
Rethinking Attention Reallocation for Multimodal Emotion Recognition
Yazhe Lyu ⋅ Yixiong Zou ⋅ Jinghan Hu ⋅ Yuhua Li ⋅ Ruixuan Li
Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting
Xiaobiao Du ⋅ YuAn Wang ⋅ Hao Li ⋅ Bosheng Wang ⋅ Xun Sun ⋅ Xin Yu
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
Haodong Yu ⋅ Yabo Zhang ⋅ Donglin Di ⋅ Ruyi Zhang ⋅ Wangmeng Zuo
CL4D: Contrastive Language–4D Pretraining for Vision-Language Reasoning in Dynamic Scenes
Kumal Hewagamage ⋅ Isuranga Senavirathne ⋅ Yattowita Withanage Sasika Pamith Amarasinghe ⋅ Hasitha Gallella ⋅ Dulanga Weerakoon ⋅ Vigneshwaran Subbaraju ⋅ Ranga Rodrigo
Dual Masked Generative Adversarial Transformer for Unsupervised Domain Adaptation
Lei Zhu ⋅ Xinxing Xu ⋅ Jun Zhou ⋅ Qiegen Liu ⋅ Rick Siow Mong Goh ⋅ Yong Liu
SLAIR: Structured Latent Flow Matching for All-in-One Image Restoration
Shuyi Liang ⋅ Yixin Yang ⋅ Hanyue Lou ⋅ Yuning Cui ⋅ Boxin Shi
Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving
Zongzheng Zhang ⋅ Jijun Wang ⋅ Saining Zhang ⋅ Wang Shuo ⋅ Yiru Wang ⋅ Hai Yang ⋅ Yang Chen ⋅ Yuwen Heng ⋅ HAO SUN ⋅ Jiang anqing ⋅ HAO ZHAO
One Video, One World: Turning Monocular Video into Physical 4D Scenes
Junhao Chen ⋅ Boran Zhang ⋅ Mingjin Chen ⋅ Henghaofan Zhang ⋅ Saining Zhang ⋅ Congcong Zhu ⋅ HAO ZHAO ⋅ Ruqi Huang ⋅ Zhihao Li ⋅ Yufei Wang
TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation
Ziqian Wang ⋅ Yonghao He ⋅ Licheng Yang ⋅ Wei Zou ⋅ Hongxuan Ma ⋅ Liu.Liu Liu.Liu ⋅ Wei Sui ⋅ Yuxin Guo ⋅ Hu Su
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
Jiawei Mao ⋅ Yuhan Wang ⋅ Lifeng Chen ⋅ Can Zhao ⋅ Yucheng Tang ⋅ Dong Yang ⋅ Liangqiong Qu ⋅ Daguang Xu ⋅ Yuyin Zhou
LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models
Rongxu Cui ⋅ Zongzheng Zhang ⋅ Jingrui Pang ⋅ Haohan Chi ⋅ Jinbang Guo ⋅ Saining Zhang ⋅ shaoxuan Xie ⋅ Xin Jin ⋅ Yao Mu ⋅ Jiaolong Yang ⋅ Guocai Yao ⋅ Xianyuan Zhan ⋅ Ya-Qin Zhang ⋅ HAO ZHAO
PKINet-v2: Towards Powerful and Efficient Poly-Kernel Remote Sensing Object Detection
Xinhao Cai ⋅ Liulei Li ⋅ Gensheng Pei ⋅ Zeren Sun ⋅ Yazhou Yao ⋅ Wenguan Wang
VectorReLoc: Reliable Vectorized SD Map Visual Re-localization with Contrastive Feature Alignment
Ziming Liu ⋅ Quanjie Xiang ⋅ Wang yun ⋅ wang yiting ⋅ chao wen ⋅ Zhuanjian XU ⋅ Leichen Wang ⋅ HAO SUN ⋅ Guangyu Gao
Ceptor: Vision-Language Model-Infused Diverse Guidance for Detecting Anything
Jinyang Li ⋅ Bin-Bin Gao ⋅ Weifu Fu ⋅ Jingnan Luo ⋅ Hanqiu Deng ⋅ Yue Guo ⋅ Jun Liu ⋅ Yong Liu ⋅ Chengjie Wang ⋅ Wenbing Tao
ReSplat: Learning Recurrent Gaussian Splatting
Haofei Xu ⋅ Daniel Barath ⋅ Andreas Geiger ⋅ Marc Pollefeys
PhysPO: Physics-Aware Local Preference Optimization for Physically Consistent Video Diffusion
Zhuoran Yang ⋅ Yanyong Zhang
LumiTokens: 3D Relighting via Token-Space Lighting Transformation
Yiwen Chen ⋅ Matheus Gadelha ⋅ Huaizu Jiang
Consistent Monocular Depth Estimation with Contact Region Boundary-Aware Refinement
Yinuo Wang ⋅ QingMiao QingMiao ⋅ Wangmeng Zuo
GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
Frédéric Fortier-Chouinard ⋅ Yannick Hold-Geoffroy ⋅ Valentin Deschaintre ⋅ Matheus Gadelha ⋅ Jean-Francois Lalonde
Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting
Chenjian Gao ⋅ Linning Xu ⋅ Tianfan Xue
DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering
Yiran Qiao ⋅ Yiren Lu ⋅ Yunlai Zhou ⋅ Rui Yang ⋅ Linlin Hou ⋅ Yu Yin ⋅ Jing Ma
Semantic Browsing: Controllable Diversity for Image Generation
Sara Dorfman ⋅ Maya Vishnevsky ⋅ Omer Dahary ⋅ Or Patashnik ⋅ Danny Cohen-Or
SAEdit: Token-Level Control for Continuous Image Editing via Sparse Autoencoder
Ronen Kamenetsky ⋅ Sara Dorfman ⋅ Daniel Garibi ⋅ Roni Paiss ⋅ Or Patashnik ⋅ Danny Cohen-Or
TaskTok: Delving into Task Tokens for Task-driven Image Restoration
Hongjae Lee ⋅ Sojung Kang ⋅ Jaeseong Yu ⋅ Seung-Won Jung
ReflectCAP: Detailed Image Captioning with Reflective Memory
Kyungmin Min ⋅ Minbeom Kim ⋅ Kang-il Lee ⋅ Seunghyun Yoon ⋅ Kyomin Jung
Debiased Textual Prompt Tuning for Enhancing Unknown Class Discovery
Yuxin Fan ⋅ Junbiao Cui ⋅ Changhao Liu ⋅ Xingwang Zhao ⋅ Jiye Liang
SGC-Lane: Monocular 3D Lane Detection with Standard-Definition Map Guidance and Lane Completion
Fuqiang Jiang ⋅ Wei Li ⋅ Tianyao Zhao ⋅ Yu Hu
Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation
Zhizhong Wang ⋅ Tianyi Chu ⋅ Richard Wang ⋅ Nanyang Wang ⋅ Kehan Li
Latent Visual Diffusion Reasoning with Monte Carlo Tree Search
Xirui Teng ⋅ Nan Xi ⋅ Junsong Yuan
DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models
Chunnan Shang ⋅ Zhizhong Wang ⋅ Xin Zhang ⋅ Hongwei Wang
SCORE: SubDistribution-aware Collaborative Knowledge Reinforcing for Cloth-Hybrid Lifelong Person Re-Identification
Kunlun Xu ⋅ Liangyu Ma ⋅ Jiangmeng Li ⋅ Xin Tong ⋅ Xiaode Liu ⋅ Yufei Guo ⋅ Jiahuan Zhou
Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution
Shuang Cui ⋅ Fan Ji ⋅ Guanglong Sun ⋅ Yufei Guo ⋅ Xiongxin Tang ⋅ Jiangmeng Li ⋅ Fanjiang Xu
SPQR: A Multi-Dimensional Benchmark for Safety Alignment under Benign Model Adaptation
Mohammed Talha Alam ⋅ Nada Saadi ⋅ Fahad Shamshad ⋅ Nils Lukas ⋅ Karthik Nandakumar ⋅ Fakhri Karray ⋅ Samuele Poppi
OmniColor: A Unified Framework for Multi-modal Lineart Colorization
Xulu Zhang ⋅ Haoqian DU ⋅ Xiao-Yong Wei ⋅ Li Qing
ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Reconstruction
Chaojun Ni ⋅ Guosheng Zhao ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Wenkang Qin ⋅ Chen Xinze ⋅ Guanghong Jia ⋅ Guan Huang ⋅ Wenjun Mei
HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving
Wenhao Yao ⋅ Xinglong Sun ⋅ Zhenxin Li ⋅ Shiyi Lan ⋅ Zi Wang ⋅ Jose M Alvarez ⋅ Zuxuan Wu
ZTRS: Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer
Zhenxin Li ⋅ Nadine Chang ⋅ Wenhao Yao ⋅ Xinglong Sun ⋅ Zi Wang ⋅ Maying Shen ⋅ Jingde Chen ⋅ Jingyu Song ⋅ Kailin Li ⋅ Zuxuan Wu ⋅ Shiyi Lan ⋅ Jose M Alvarez
MomentSeg: Moment-Centric Sampling for Enhanced Referring Video Object Segmentation
Ming Dai ⋅ Sen Yang ⋅ Boqiang Duan ⋅ Wankou Yang ⋅ Jingdong Wang
SuperFlex: Deformable Superquadrics for Point Cloud Decomposition
Gabriel Tavernini ⋅ Elisabetta Fedele ⋅ Tiago Novello ⋅ Leonidas Guibas ⋅ Marc Pollefeys ⋅ Francis Engelmann
SwiftWA: An Efficient Action-Centered World-Action Model
Chaojun Ni ⋅ Xinyu Zhou ⋅ YuKun Zhou ⋅ Jingyu Liu ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Yang Wang ⋅ Qiuping Deng ⋅ Yun Ye ⋅ Hao Li ⋅ Zhichao Liu ⋅ Jindi Lv ⋅ Boyuan Wang ⋅ Guosheng Zhao ⋅ Guan Huang ⋅ Min Cao ⋅ Wenjun Mei
ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video
Boyuan Wang ⋅ Xiaofeng Wang ⋅ Yongkang Li ⋅ Zheng Zhu ⋅ Yifan Chang ⋅ Angen Ye ⋅ Guosheng Zhao ⋅ Chaojun Ni ⋅ Guan Huang ⋅ Yijie Ren ⋅ Yueqi Duan ⋅ Xingang Wang
InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics
Erich Liang ⋅ Caleb Kha-Uong ⋅ Chinmaya Saran ⋅ Sreemanti Dey ⋅ David Liu ⋅ Junhan Ouyang ⋅ Benjamin Zhou ⋅ Jia Deng
Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models
Yusuke Hirota ⋅ Michael Boone ⋅ Arun Zachariah ⋅ Jibin Rajan Varghese ⋅ Yu-Chiang Frank Wang ⋅ Boyi Li ⋅ Ryo Hachiuma
One Slide, Many Views: Unifying Complementary Foundation Model Perspectives for WSI Analysis
Yihui WANG ⋅ Yingxue Xu ⋅ Shu Yang ⋅ Yequan Bie ⋅ Jiabo MA ⋅ Fengtao Zhou ⋅ Hao Chen
UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound
Weiying Chen ⋅ Yuchong Gao ⋅ Siyuan Li ⋅ Marek Reformat ⋅ Rui Zheng ⋅ Edmond Lou
Parametric SDF for Dynamic Surface Reconstruction
Chong Gao ⋅ Kai Ye ⋅ Qiyu Dai ⋅ Yiming Shao ⋅ Qiong Zeng ⋅ Ding Liang ⋅ Yanpei Cao ⋅ Guanbin Li ⋅ Wenzheng Chen
Learning Probabilistic Embeddings for Unsupervised Action Segmentation
Shuai Li ⋅ Duc Vu ⋅ Juergen Gall
DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
Tianjiao (Joey) Yu ⋅ Xinzhuo Li ⋅ Muntasir Wahed ⋅ Jerry Xiong ⋅ Yifan Shen ⋅ Ying Shen ⋅ Ismini Lourentzou
Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition
Lars Doorenbos ⋅ Duc Vu ⋅ Serdar Ozsoy ⋅ Juergen Gall
EDM:Event-guided Diffusion Model for Video Shadow Detection in Complex Dynamic Scenes
boyang gao ⋅ jiayi guo ⋅ Ziyu Wang ⋅ Yingbin Cui ⋅ Zhan Tu
SGP2: Coarse-to-Fine Controllable Multimodal Remote Sensing Image Generation
Pengyu Chen ⋅ Xi Yang ⋅ Nannan Wang
Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers
Edwin Kwadwo Tenagyei ⋅ Lei Wang ⋅ Ugochukwu Akpudo ⋅ Jun Zhou ⋅ Yongsheng Gao
LogicIR: Logic Gate Networks for Image Restoration
Hongjae Lee ⋅ Myungjun Son ⋅ Jaeseong Yu ⋅ Seung-Won Jung
MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens
Youngrae Kim ⋅ Qixin Hu ⋅ C.-C. Jay Kuo ⋅ Peter Beerel
A Dual-space Patch-driven Complementary Learning Framework for Semi-supervised Multi-organ Segmentation
Baixi Liang ⋅ Shuohong Xia ⋅ Sihao Li ⋅ Yunyun Yang
Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation
Tianyu Zhu ⋅ Yingping Liang ⋅ Hesong Li ⋅ Ying Fu
VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
Qiang Wang ⋅ XINYUAN GAO ⋅ SongLin Dong ⋅ Jizhou Han ⋅ Jiangyang Li ⋅ Yuhang He ⋅ Zhiheng Ma ⋅ Yihong Gong
OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents
Akashah Shabbir ⋅ Muhammad Umer Sheikh ⋅ Muhammad Akhtar Munir ⋅ Hiyam Debary ⋅ Mustansar Fiaz ⋅ Muhammad Zaigham Zaheer ⋅ Paolo Fraccaro ⋅ Fahad Shahbaz Khan ⋅ Muhammad Haris Khan ⋅ Xiao Xiang Zhu ⋅ Salman Khan
Molecular Identifier Visual Prompting and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing
Jiahe Song ⋅ Chuang Wang ⋅ Yinfan Wang ⋅ Hao Zheng ⋅ Bowen Jiang ⋅ Rui Nie ⋅ Xingjian Wei ⋅ Junyuan Gao ⋅ Yubin Wang ⋅ Bin Wang ⋅ Lijun Wu ⋅ Jiang Wu ⋅ Qian Yu ⋅ Conghui He
SPHERE: From MRI Sampling Mechanisms to Spatial Priors for Generalizable Brain Tumor Segmentation
JiaCheng Lu ⋅ Shiyu Zhang ⋅ Hui Ding ⋅ junhui xin ⋅ Guoping Huo
Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints
Hojun Choi ⋅ Seulbin Hwang ⋅ Dae Kim ⋅ Kisung Kim ⋅ Hyunjung Shim ⋅ Jinhan Lee
Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent
Binger Chen ⋅ Tacettin Bök ⋅ Behnood Rasti ⋅ Volker Markl ⋅ Begüm Demir
Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility
honglin lin ⋅ Chonghan Qin ⋅ Zheng Liu ⋅ Qizhi Pei ⋅ Yu Li ⋅ Zhanping Zhong ⋅ Xin Gao ⋅ Wei Li ⋅ Wentao Zhang ⋅ Yanfeng Wang ⋅ Conghui He ⋅ Lijun Wu
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
Huanyu Wang ⋅ Jushi Kai ⋅ Haoli Bai ⋅ Lu Hou ⋅ Bo Jiang ⋅ Ziwei He ⋅ Zhouhan Lin
Condensing Large-Scale Datasets Directly with Minimal Information Loss
Xinyi Shang ⋅ Peng Sun ⋅ Bei Shi ⋅ Zixuan Wang ⋅ Tao Lin
A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR
Lin Chen ⋅ Jingping Fang ⋅ Hairui Liu ⋅ Chenyang Xu ⋅ Junhao Chen ⋅ Xiaorui Li ⋅ Weidong Cai ⋅ Xiaoming Chen
HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks
Jingyu Guo ⋅ Ziye Chen ⋅ Ziwen Li ⋅ Zhengqing Gao ⋅ Jiaxin Huang ⋅ Hanlue Zhang ⋅ Fengming Huang ⋅ Yu Yao ⋅ Tongliang Liu ⋅ Mingming Gong
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
Ce Chen ⋅ Yi Ren ⋅ Yuanming Li ⋅ Viktor Goriachko ⋅ Zhenhui Ye ⋅ Zujin Guo ⋅ Zhibin Hong ⋅ Mingming Gong
SWIFT: Spatial-Window Integrated Frequency-aware Token Pruning for Efficient MLLMs on Edge Devices
Guanglai Liu ⋅ Jubo Chen ⋅ Xiaosheng Yu
Decoding Multimodal Causality: End-to-End Multimodal Mediation Pathways Inference
Yulong Li ⋅ Xiwei Liu ⋅ Niranjana Menon ⋅ Yuxuan Zhang ⋅ Jianxu Chen ⋅ Rong Xia ⋅ Haolin Yang ⋅ Peixin Guo ⋅ Yutong Xie ⋅ Imran Razzak
CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates
Shresth Grover ⋅ Priyank Pathak ⋅ Akash Kumar ⋅ Yogesh Rawat
MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein
Hong-Han Wang ⋅ Yuntao Wang ⋅ Hu Ding
Noise-Robust Facial Expression Recognition via Mamba-driven Neighbor Weight Refinement
Yuzhuang Yang ⋅ Xiaolin Tian ⋅ Qigong Sun
OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents
Yang Chen ⋅ Yufan Shen ⋅ Yunwen Li ⋅ Minghao Liu ⋅ Tuney Tianyu ⋅ Bin Fu ⋅ Qunshu Lin ⋅ Zhi Yu ⋅ Botian Shi
In-context Region-based Drag: Drag Any Region to Any Shape
Jiacheng Sui ⋅ Tianyu Hao ⋅ Bingjie Gao ⋅ Li Niu ⋅ Guangtao Zhai
LaGen: Towards Autoregressive LiDAR Scene Generation
Sizhuo Zhou ⋅ Xiaosong Jia ⋅ Fanrui Zhang ⋅ Junjie Li ⋅ Juyong Zhang ⋅ Yukang Feng ⋅ Jianwen Sun ⋅ Songbur Wong ⋅ Junqi You ⋅ Junchi Yan
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Based Video Editing
Haoyang He ⋅ Jie Wang ⋅ Jiangning Zhang ⋅ Zhucun Xue ⋅ Xingyuan Bu ⋅ Qiangpeng Yang ⋅ Min Zheng ⋅ Lei Xie
EvoWorld: A World-Model-Centric Framework for Continuous Self-Evolution of Modular Embodied Skills
boshi zhang ⋅ Sen Cui ⋅ Baohua Yin ⋅ Youyi Kou ⋅ Junyu Wu ⋅ Zuo Pu ⋅ TAO XUE ⋅ Zhikang Chen ⋅ Shanshan Wei ⋅ Min Zhang ⋅ Miao Liu ⋅ Changshui Zhang ⋅ Zhang Tao
Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection
Fanrui Zhang ⋅ Qiang Zhang ⋅ Sizhuo Zhou ⋅ Jianwen Sun ⋅ Chuanhao Li ⋅ Jiaxin Ai ⋅ Yukang Feng ⋅ Yujie Zhang ⋅ Wenjie Li ⋅ Zizhen Li ⋅ Yifan Chang ⋅ Jiawei Liu ⋅ Kaipeng Zhang
Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation
Beom Young Kim ⋅ Sung Hwang
Improving Sparse-View 3DGS Generalization via Flat Minima Optimization
Kangmin Seo ⋅ Sangeek Hyun ⋅ MinKyu Lee ⋅ Jae-Pil Heo
OPAL: Orthonormal Prototype Alignment Learning for Interpretable Image Classification
Ilán Carretero ⋅ Gustavo ANGULO ⋅ Rocío Amor ⋅ Valery Naranjo
Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment
Ziyao Wang ⋅ Maonan Wang ⋅ Yucheng He ⋅ Xianping Ma ⋅ Ziyi Wang ⋅ Hongyang Zhang ⋅ Yirong Chen ⋅ Man On Pun
Raw-JPEG Adapter: Efficient Raw Image Compression with JPEG
Mahmoud Afifi ⋅ Ran Zhang ⋅ Michael S Brown
RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes
Yuan-Kang Lee ⋅ Kuan-Lin Chen ⋅ Chia-Che Chang ⋅ Yu-Lun Liu
BrainRiem: Riemannian Prototype Learning for Source-Free Cross-Site Brain Network Diagnosis
Kunyu Zhang ⋅ Tianxiang Xu
Caption Bottleneck Models
Seref Baris Cagliyan ⋅ Umut Ozdemir ⋅ Merve Tapli ⋅ Emre Akbas
AgentVLN: Towards Agentic Vision-and-Language Navigation
Zihao Xin ⋅ Wentong Li ⋅ Yixuan Jiang ⋅ Ziyuan Huang ⋅ Bin Wang ⋅ Piji Li ⋅ Jianke Zhu ⋅ Jie Qin ⋅ Sheng-Jun Huang
Finding Highlight Images In Your Albums:From Benchmark To MLLM
Rong Qin ⋅ Congcong Sun ⋅ Yaopeng Dong ⋅ Yanbin Sun ⋅ Chensen Ding ⋅ Chenxi Zhao ⋅ Biao Wang ⋅ Qian Zhang ⋅ Eunil Park ⋅ Chi Man VONG ⋅ Jufeng Yang
Complex-Valued 2D Gaussian Representation for Computer-Generated Holography
Yicheng Zhan ⋅ Xiangjun Gao ⋅ Long Quan ⋅ Kaan Akşit
Optimization-Guided Diffusion for Interactive Scene Generation
Shihao Li ⋅ Naisheng Ye ⋅ Tianyu Li ⋅ Kashyap Chitta ⋅ Tuo An ⋅ Peng Su ⋅ Boyang Wang ⋅ Haiou Liu ⋅ Chen Lv ⋅ Hongyang Li
STEP: Spatial Thinking and Egocentric Pointing for Embodied Instruction Following
Hanxuan Li ⋅ Bin Fu ⋅ Zeyuan Lin ⋅ Ruiping Wang ⋅ Xilin CHEN
From Masks to Pixels and Meaning: A New Taxonomy, Benchmark and Metrics for VLM Image Tampering
Xinyi Shang ⋅ Yi Tang ⋅ Jiacheng Cui ⋅ Ahmed Elhagry ⋅ Salwa Al Khatib ⋅ Sondos Bsharat ⋅ Jiacheng Liu ⋅ Xiaohan Zhao ⋅ Jing-Hao Xue ⋅ Hao Li ⋅ Salman Khan ⋅ Zhiqiang Shen
Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation
Rui Wang ⋅ Quentin Lohmeyer ⋅ Siyu Tang ⋅ Mirko Meboldt
Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation
Naixin Zhai ⋅ Weihua Cheng ⋅ Dexu Yu ⋅ Yikai Gu ⋅ Hanwen Du ⋅ Junchen Fu ⋅ Chenxi Huang ⋅ Yingwei Song ⋅ Liyuan Ma ⋅ Yang Ran ⋅ Youhua Li ⋅ Yongxin Ni
Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting
Ziyuan Xia ⋅ Jingyi Xu ⋅ Chong Cui ⋅ Yuanhong Yu ⋅ Jiazhao Zhang ⋅ Qingsong Yan ⋅ Ni Tao ⋅ Junbo Chen ⋅ Xiaowei Zhou ⋅ Hujun Bao ⋅ Ruizhen Hu ⋅ Sida Peng
MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
Junzhe Li ⋅ Yutao Cui ⋅ Tao Huang ⋅ Chuxuan Zeng ⋅ Weijie Kong ⋅ Yinping Ma ⋅ Chun Fan ⋅ Miles Yang ⋅ Zhao Zhong ⋅ Liefeng Bo
ORBIT: Overcoming Hallucination Risks via Bi-manifold Interaction and Traction
Zhehan Kan ⋅ Yanlin Liu ⋅ Xiaochen Yang ⋅ Hongyang Yu ⋅ Qingmin Liao ⋅ Wenming Yang
Don’t Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance
Pradhaan Bhat ⋅ Rishubh Parihar ⋅ Abhijnya Bhat ⋅ Venkatesh Babu Radhakrishnan
AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors
Aymen Mir ⋅ Riza Alp Guler ⋅ Xiangjun Tang ⋅ Peter Wonka ⋅ Gerard Pons-Moll
Pathryoshka: Compressing Pathology Foundation Models via Multi-Teacher Knowledge Distillation with Nested Embeddings
Christian Grashei ⋅ Christian Brechenmacher ⋅ Rao Umer ⋅ Jingsong Liu ⋅ Carsten Marr ⋅ Peter Schüffler ⋅ Ewa Szczurek
Tri-Efficient Transfer Learning for Point Cloud Videos
Yiding Sun ⋅ Dongxu Zhang ⋅ Jihua Zhu ⋅ Haozhe Cheng ⋅ Zhengqiao Li ⋅ Pengcheng Li ⋅ Chaowei Fang ⋅ Yonghao Dong ⋅ Lin Chen
E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation
Wen Ye ⋅ Peiyan Li ⋅ Tingyu Yuan ⋅ Yuan Xu ⋅ Xiangnan Wu ⋅ Chaoyang Zhao ⋅ Jing Liu ⋅ Nianfeng Liu ⋅ Yan Huang ⋅ Liang Wang
Freqformer: Image-Demoiréing Transformer via Effective Frequency Decomposition
Xiaoyang Liu ⋅ Bolin Qiu ⋅ Zheng Chen ⋅ Libo Zhu ⋅ Zihan Zhou ⋅ Kai Liu ⋅ Jiezhang Cao ⋅ Yulun Zhang
Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints
Chenyangguang Zhang ⋅ Botao Ye ⋅ Boqi Chen ⋅ Alexandros Delitzas ⋅ Fangjinhua Wang ⋅ Marc Pollefeys ⋅ Xi Wang
StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation
Guanlong Jiao ⋅ Chenyangguang Zhang ⋅ Jia Xian ⋅ Zewei Zhang ⋅ Renjie Liao
SAFE-EQA: Semantic-Aware Efficient Exploration for Embodied Question Answering
Yijie Tang ⋅ Ke Xia ⋅ Jiazhao Zhang ⋅ Zhinan Yu ⋅ Zhiyuan Yu ⋅ Dezun Dong ⋅ Renjiao Yi ⋅ Chenyang Zhu ⋅ Kai Xu
MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation
Zhiyuan Xia ⋅ Haojie Li ⋅ Jingyu Lin ⋅ Yiguo Qiao ⋅ Cunjian Chen
What You Ask is What You Ground: Bridging Question Intent to Temporal Evidence for Grounded VideoQA
Jinhwan Seo ⋅ Kyu Han ⋅ Jumin Lee ⋅ Junhyug Noh ⋅ Sung-eui Yoon
Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces
Xinggang Hu ⋅ Chenyangguang Zhang ⋅ Alexandros Delitzas ⋅ Xiangkui Zhang ⋅ Marc Pollefeys ⋅ Francis Engelmann ⋅ Xiangyang Ji
ConceptWeaver: Weaving Disentangled Concepts with Flow
Jintao Chen ⋅ Aiming Hao ⋅ Xiaoqing Chen ⋅ Chengyu Bai ⋅ Chubin Chen ⋅ Yanxun Li ⋅ Jiahong Wu ⋅ Xiangxiang Chu ⋅ Shanghang Zhang
OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data
Kaixing Yang ⋅ Jiashu Zhu ⋅ Xulong Tang ⋅ Ziqiao Peng ⋅ Xiangyue Zhang ⋅ Chubin Chen ⋅ Puwei Wang ⋅ Jiahong Wu ⋅ Xiangxiang Chu ⋅ Hongyan Liu ⋅ Jun He
Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction
Hao Tian ⋅ Chenyangguang Zhang ⋅ Rui Liu ⋅ Wen Shen ⋅ Xiaolin Qin
OmniX: From Unified Panoramic Generation and Perception To Graphics-Ready 3D Scenes
Yukun Huang ⋅ Jiwen Yu ⋅ Yanning Zhou ⋅ Jianan Wang ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Xihui Liu
Uncertainty-aware tree height change regression
Max Gaber ⋅ Dimitri Gominski ⋅ Jaime Revenga ⋅ Stefan Oehmcke ⋅ Rasmus Fensholt ⋅ Martin Brandt
Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
Xianjin Wu ⋅ Dingkang Liang ⋅ Tianrui Feng ⋅ Kui Xia ⋅ Yumeng Zhang ⋅ Xiaofan Li ⋅ Xiao Tan ⋅ Xiang Bai
SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models
Hongxiang Li ⋅ Hongxu chen ⋅ chenyang zhu ⋅ Xiaoshuang Huang ⋅ Jiayin Cai ⋅ Xiaolong Jiang ⋅ Yao Hu ⋅ Long Chen
3DWay: Generalizing Robot Manipulation via 3D Consistent Waypoints
Huang Ziqin ⋅ Yingyue Li ⋅ Chenyangguang Zhang ⋅ Ruida Zhang ⋅ Yuxin Chen ⋅ Gu Wang ⋅ Xingyu Liu ⋅ Masayoshi TOMIZUKA ⋅ Xiangyang Ji
Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization
chenyang zhu ⋅ Hongxiang Li ⋅ Xiu Li ⋅ Long Chen
Denoising the Deep Sky: Physics-Based CCD Noise Formation for Astronomical Imaging
Shuhong Liu ⋅ Xining Ge ⋅ Ziying Gu ⋅ Quanfeng Xu ⋅ Ziteng Cui ⋅ Lin Gu ⋅ Xuangeng Chu ⋅ Jun Liu ⋅ Dong Li ⋅ Tatsuya Harada
OrthoTailor: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation
Zhaotong Yang ⋅ Ying Tai ⋅ Jiahui Zhan ⋅ Yu Zheng ⋅ Jianjun Qian ⋅ Jian Yang
GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images
Jiahao Sun ⋅ Dingkun Wei ⋅ Zehong Shen ⋅ Hongyu Zhou ⋅ Yujun Shen ⋅ Liang Li
Verifying Cancer Segmentation in Vision Transformers via Internal Concepts
Mengmeng Ma ⋅ Yunxiang Peng ⋅ Tang Li ⋅ Lu Lin ⋅ Binsheng Zhao ⋅ Oguz Akin ⋅ Xi Peng
EvDiff: High Quality Video with an Event Camera
Weilun Li ⋅ Lei Sun ⋅ Ruixi Gao ⋅ Qi Jiang ⋅ Yuqin Ma ⋅ Kaiwei Wang ⋅ Ming-Hsuan Yang ⋅ Luc Van Gool ⋅ Danda Paudel
Discovering Geometric Biases in 3D Face Reconstruction: A Curvature-Aware Spectral Framework for Fairness Evaluation
Veronika Shilova ⋅ Emmanuel Malherbe ⋅ Giovanni Palma ⋅ Panagiotis-Alexandros Bokaris ⋅ Laurent Risser ⋅ Jean-Michel Loubes
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
haoyu fu ⋅ Diankun Zhang ⋅ Zongchuang Zhao ⋅ Jianfeng Cui ⋅ Hongwei Xie ⋅ Bing Wang ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Dingkang Liang ⋅ Xiang Bai
Towards Interactive Global Geolocation Assistant
Zhiyang Dou ⋅ Zipeng Wang ⋅ Xumeng Han ⋅ Guorong Li ⋅ Zhenjun Han ⋅ Zhipei Huang
Temporally Stable Generative Illumination with a One-Step Diffusion Model
Harish Anand ⋅ Alexandr Kuznetsov ⋅ Sungye Kim ⋅ Wojciech Uss ⋅ Wojciech Kaliński ⋅ Rama Harihara
Kilometer-Vision: A New Frontier for Large-Scale Spatial Awareness in VLMs
Aravindh Mahendran ⋅ Michael King ⋅ Matthew Grimes ⋅ Antoine Yang ⋅ Tyler Zhu ⋅ Joseph Heyward ⋅ Tengda Han ⋅ Shiry Ginosar ⋅ Chen Sun ⋅ Dima Damen ⋅ Simon Osindero ⋅ Noah Snavely ⋅ Simon Lynen ⋅ Joao Carreira ⋅ Viorica Patraucean
EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning
Youtan Yin ⋅ Yanning Zhou ⋅ Jiacheng Wei ⋅ Xiaofeng Yang ⋅ Jun Zhang ⋅ Jiayang Bai ⋅ Jingwen Ye ⋅ Weidong Zhang ⋅ Guosheng Lin
AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs
Yuan Zhang ⋅ Chun-Kai Fan ⋅ Sicheng Yu ⋅ Junwen Pan ⋅ Tao Huang ⋅ Ming Lu ⋅ Kuan Cheng ⋅ Qi She ⋅ Shanghang Zhang
Let ViT Speak: Generative Language-Image Pre-training
Yan Fang ⋅ Mengcheng Lan ⋅ Zilong Huang ⋅ Weixian Lei ⋅ Yunqing Zhao ⋅ Yujie Zhong ⋅ Yingchen Yu ⋅ Qi She ⋅ Yao Zhao ⋅ Yunchao Wei
Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models
Yusuf Dalva ⋅ Hidir Yesiltepe ⋅ Pinar Yanardag
Online Segment 3D Gaussians via Launching Virtual Drones
Liwei Liao ⋅ Rongjie Wang ⋅ Ronggang Wang
TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects
Tahmina Khanam ⋅ Hamid Laga ⋅ Mohammed Bennamoun ⋅ Guanjin Wang ⋅ Ferdous Sohel ⋅ Farid Boussaid ⋅ Anuj Srivastava
AnyGround3D: Towards Grounding Any 3D Object in the Wild via 2D-to-3D Lifting
Yingping Liang ⋅ Wenxuan Guo
Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring
Samira Malek ⋅ Haichuan Zhang ⋅ Chul Lee ⋅ Vishal Monga
Thinking in Streaming Video
Zikang Liu ⋅ Longteng Guo ⋅ Handong Li ⋅ Ru Zhen ⋅ Xingjian He ⋅ Ruyi Ji ⋅ Xiaoming Ren ⋅ Yanhao Zhang ⋅ Haonan Lu ⋅ Jing Liu
Unified Multi-plane Autoregressive Diffusion for 3D Multi-Contrast MRI Synthesis
Yejee Shin ⋅ Geonhui Son ⋅ Jinglu Wang ⋅ Minwoo Jung ⋅ Yan Lu ⋅ Dosik Hwang
Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability
Emirhan Bilgiç ⋅ Baptiste Caramiaux ⋅ Zhi Yan ⋅ Gianni Franchi
O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
Mei Yuan ⋅ Qi Long ⋅ Qifeng Wu ⋅ Zhenyang Li ⋅ Yizhou Zhao ⋅ Lei Wang ⋅ Yang Liu ⋅ Min Xu
NumColor: Precise Numeric Color Control in Text-to-Image Generation
Muhammad Atif Butt ⋅ Diego Hernández ⋅ Alex Gomez-Villa ⋅ Kai WANG ⋅ Javier Vazquez-Corral ⋅ Joost Van de Weijer
TaxoGrasp: Taxonomy-Guided Human Grasp Synthesis with Sparse Contact Constraint
Haitian Liu ⋅ Yin Wang ⋅ Zhiying Leng ⋅ Kanglei Zhou ⋅ Yan Wang ⋅ Frederick W. B. Li ⋅ Xiaohui Liang
CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection
Hojun Choi ⋅ Youngsun Lim ⋅ Jaeyo Shin ⋅ Hyunjung Shim
AMCoNav: Asynchronous Multi-module Collaborative Framework for Embodied Visual Navigation
Jiaquan Yan ⋅ Fang Zhao ⋅ Yushi Chen ⋅ Long wang ⋅ Haiyong Luo ⋅ Dan Luo
DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery
Peiyan Gu ⋅ Zixin Teng ⋅ Xuming He
CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose
Li Jin ⋅ Yuchen Yang ⋅ Weikai Chen ⋅ Yujie Wang ⋅ Dehao Hao ⋅ Tanghui Jia ⋅ Yingda Yin ⋅ Zeyu HU ⋅ Runze Zhang ⋅ Keyang Luo ⋅ Li Yuan ⋅ Long Quan ⋅ Xin Wang ⋅ Xueying Qin
i-Design: Step-by-Step Graphic Layout Design with Progressive Aesthetic Policy Optimization
Sohan Patnaik ⋅ Rishabh Jain ⋅ Balaji Krishnamurthy ⋅ Mausoom Sarkar
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
ZhengXian Wu ⋅ Hangrui Xu ⋅ Kai Shi ⋅ Zhuohong Chen ⋅ Yunyao Yu ⋅ Chuanrui Zhang ⋅ ZIRUI LIAO ⋅ JunYang JunYang ⋅ Zhenyu Yang ⋅ Haonan Lu ⋅ Haoqian Wang
Neuromorphic X-ray Computed Tomography
Hongjian Wang ⋅ Goran Lovric ⋅ Benjamín Béjar
Don’t Teach Instability, Teach Robustness: Selective Sensitivity Gating for Adversarial Robust Distillation
Jingqi Ji ⋅ Quan Kong ⋅ Chaojie Gu ⋅ Yuanchao Shu ⋅ Cong Wang
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
Xuanlang Dai ⋅ Yujie Zhou ⋅ Long Xing ⋅ Jiazi Bu ⋅ Xilin Wei ⋅ Yuhong Liu ⋅ Beichen Zhang ⋅ Kai Chen ⋅ Yuhang Zang
Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models
Chen Siyao ⋅ Jiakang Yuan ⋅ Jiaxin Wang ⋅ Tao Chen
On the Faithfulness of Post-Hoc Concept Bottleneck Models
Laines Schmalwasser ⋅ Jan Blunk ⋅ Niklas Penzel ⋅ Julia Niebling ⋅ Joachim Denzler
Bridging Online and Offline Handwriting via Differentiable Physical Rendering
Seonmi Park ⋅ Seunghyun Shin ⋅ Vihaan Misra ⋅ Dongmin Shin ⋅ Ukcheol Shin ⋅ Jean Oh ⋅ Hae-Gon Jeon
Wavelet-Driven Cross-Domain Consistency for Mixed-Supervised 3D Tumor Segmentation
Tianzhong Lan ⋅ Weili Jiang ⋅ Yisong Liu ⋅ Yi Zhou ⋅ Junqi Bai ⋅ Si Yong Yeo ⋅ Xulei Yang ⋅ Min Zhu
Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots
Jeongwan On ⋅ Muhammad Salman Ali ⋅ Muneeb Khan ⋅ Sunwoo Park ⋅ Inwoong Moon ⋅ Hyung Jin Chang ⋅ Jaekwang Kim ⋅ Seong Jong Ha ⋅ Seungryul Baek
DriveVA: Video Action Models are Zero-Shot Drivers
Mengmeng Liu ⋅ Diankun Zhang ⋅ Jiuming Liu ⋅ Jianfeng Cui ⋅ Hongwei Xie ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Michael Yang ⋅ Francesco Nex ⋅ Hao Cheng
Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes
Yuling Xi ⋅ Haokai Zhang ⋅ Muzhi Zhu ⋅ Hao Zhong ⋅ Zongze Du ⋅ Hengyu Zhao ⋅ Chenchen Jing ⋅ Yufei Yin ⋅ Bin Qin ⋅ Yongjie Yang ⋅ Zhenbo Luo ⋅ Hao Chen ⋅ Chunhua Shen
Racing in Volume with Flow Ensembles
Saswat Subhajyoti Mallick ⋅ Riu Cherdchusakulchai ⋅ Marc Ruiz ⋅ Albert Mosella-Montoro ⋅ Jose Ribeiro-Gomes ⋅ Francisco Vicente Carrasco ⋅ Fernando de la Torre
LOOM: Weaving Geometry-Consistent Human-Object Interaction Videos via Progressive Curriculum Learning
Bangya Liu ⋅ Zelin Zhao ⋅ Ziyang Song ⋅ Suman Banerjee ⋅ Xinyu Gong
D-VLAM: Differential Vision and Language Mixing for Rehearsal Free Continual Learning
Muhammad Anwar Ma'sum ⋅ Mohsen Guizani ⋅ Waseem Ullah
One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
Xiaohao Xu ⋅ Feng Xue ⋅ Xiang Li ⋅ Haowei Li ⋅ Shusheng Yang ⋅ Tianyi Zhang ⋅ Matthew Johnson-Roberson ⋅ Xiaonan Huang
Thermo-JEPA: Learning a Geometry-Grounded Thermal World Model via Cross-Modal Privileged Masking
Biwen Yang ⋅ Jin Zhang ⋅ Zhe Cao ⋅ Ruiheng Zhang
A Mechanism-Driven Theory of Phase Transitions in Active Learning
Julia Machnio ⋅ Mads Nielsen ⋅ MOSTAFA MEHDIPOUR GHAZI
Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection
Aoting Zhang ⋅ Dongbao Yang ⋅ Chang Liu ⋅ Xiaopeng Hong ⋅ Can Ma ⋅ Yu ZHOU
3D-Aware VLMs with Implicit and Explicit Geometries
Wenhao Li ⋅ Xueying Jiang ⋅ Quanhao Qian ⋅ Deli Zhao ⋅ Ran Xu ⋅ Shijian Lu ⋅ Gongjie Zhang
Linear Fusion MultiDiffusion for Fast Training-Free Spherical Panorama Generation
Akio Hayakawa ⋅ Yusuke Mukuta ⋅ Tatsuya Harada
ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving
Zihao Sheng ⋅ Xin Ye ⋅ Jingru Luo ⋅ Sikai Chen ⋅ Liu Ren
Spatiotemporal Flux Probing for Single-Photon Videography
Jerry Yan ⋅ Matteo Forlivesi ⋅ Bowen Tan ⋅ Andrew Xie ⋅ Siddharth Somasundaram ⋅ Sotiris Nousias
Bridging Theory and Practice in Source-Free Domain Adaptation via Adversarial Proxy Perturbation
Dexuan Zhang ⋅ Qianyu Zhou ⋅ Thomas Westfechtel ⋅ Yusuke Mukuta ⋅ Tatsuya Harada
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
Xike Zhang ⋅ Maoyuan Ye ⋅ Juhua Liu ⋅ Bo Du
Boosting Correspondence Learning with Structure-Aware Estimator
Tianyu Yan ⋅ Wei An ⋅ Pu Wang ⋅ Yingqian Wang
Head Avatars with Dynamic Explicit Hair
Vanessa Sklyarova ⋅ Haonan Chen ⋅ Berna Kabadayi ⋅ Tobias Kirschstein ⋅ Zicong Fan ⋅ Xi Wang ⋅ Gerard Pons-Moll ⋅ Matthias Niessner ⋅ Marc Pollefeys ⋅ Michael Black ⋅ Justus Thies
SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models
Jingfeng Mao ⋅ Xuyang Chen ⋅ Qilin Zhang ⋅ Oussema Dhaouadi ⋅ Guangming Wang ⋅ Brian Sheil ⋅ Daniel Cremers ⋅ Yan Xia ⋅ Olaf Wysocki
Frames2Residual: Spatiotemporal Decoupling for Self-Supervised Video Denoising
Mingjie Ji ⋅ Zhan Shi ⋅ Kailai Zhou ⋅ Zixuan Fu ⋅ Xun Cao
NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment
Jisung Hwang ⋅ Yunhong Min ⋅ Jaihoon Kim ⋅ I-Chao Shen ⋅ Minhyuk Sung
Entropy-Controlled Flow Matching
Chika Maduabuchi
Learning Physics-based Forward Model Corrections in Unrolled Networks for Diffuser-based Imaging
Yoko Sogabe ⋅ Shiori Sugimoto ⋅ Shoichiro Saito ⋅ Masaki Kitahara
CLDefocus: Physically Grounded Compound-Lens Defocus Blur Synthesis
Yunkyu Lee ⋅ Woohyeok Kim ⋅ Sunghyun Cho
Learning Probabilistic Prompt for Continual Learning
Hyekang Park ⋅ Sanghoon Lee ⋅ Geon Lee ⋅ Jongyoun Noh ⋅ BUMSUB HAM
Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision
Jinnyeong Kim ⋅ Juhyung Choi ⋅ Woohyeok Kim ⋅ Sunghyun Cho ⋅ Seung-Hwan Baek
Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation
Yichen Zhang ⋅ Da Peng ⋅ Zonghao Guo ⋅ zijian zhang ⋅ Xuesong Yang ⋅ Tong Sun ⋅ Shichu Sun ⋅ Yidan Zhang ⋅ Yanghao Li ⋅ Haiyan Zhao ⋅ Wang Xu ⋅ Qi Shi ⋅ Yangang Sun ⋅ Chi Chen ⋅ Shuo Wang ⋅ Yukun Yan ⋅ Xu Han ⋅ Qiang Ma ⋅ Wei Ke ⋅ Liang Wang ⋅ Zhiyuan Liu ⋅ Maosong Sun
Matryoshka Gaussian Splatting
Zhilin Guo ⋅ Boqiao Zhang ⋅ Hakan Aktas ⋅ Kyle Fogarty ⋅ Jeffrey Hu ⋅ Nursena Aslan ⋅ Wenzhao Li ⋅ Canberk Baykal ⋅ Albert Miao ⋅ Josef Bengtson ⋅ Chenliang Zhou ⋅ Weihao Xia ⋅ Cristina Vasconcelos ⋅ Cengiz Oztireli
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
Junho Kim ⋅ Hosu Lee ⋅ James Rehg ⋅ Minsu Kim ⋅ Yong Man Ro
Low-latency Event-based Object Detection with Spatially-Sparse Linear Attention
Haiqing Hao ⋅ Zhipeng Sui ⋅ Rong Zou ⋅ Zijia Dai ⋅ Nikola Zubic ⋅ Davide Scaramuzza ⋅ Wenhui Wang
Different Changes Require Different Reasoning: Change-Type-Specialized Experts for Robust Change Captioning
Jiyoung Park ⋅ InJae Oh ⋅ Jung Uk Kim
Sound-based Multi-Person 3D Pose Estimation
Yusuke Oumi ⋅ Yuto Shibata ⋅ Go Irie ⋅ Akisato Kimura ⋅ Yoshimitsu Aoki ⋅ Mariko Isogawa
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
yueying li ⋅ Fengxiang Wang ⋅ Yan Li ⋅ Mingshuo Chen ⋅ Mengying Zhao ⋅ Long Lan
SelfMOTR: Revisiting MOTR with Self-Generating Detection Priors
Fabian Gülhan ⋅ Emil Mededovic ⋅ Yuli Wu ⋅ Johannes Stegmaier
Setting the Stage: Text-Driven Scene-Consistent Image Generation
Cong Xie ⋅ Che Wang ⋅ Yan Zhang ⋅ Ruiqi Yu ⋅ Han Zou ⋅ Zheng Pan ⋅ Zhenpeng Zhan
Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos
Ziqi Gao ⋅ Jieyu Zhang ⋅ Wisdom Ikezogwo ⋅ Jae Sung Park ⋅ Tario You ⋅ Daniel Ogbu ⋅ Chenhao Zheng ⋅ Weikai Huang ⋅ Yinuo Yang ⋅ Winson Han ⋅ Quan Kong ⋅ Rajat Saini ⋅ Ranjay Krishna
Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
Tianci Liu ⋅ Zihan Dong ⋅ Linjun Zhang ⋅ Haoyu Wang ⋅ Jing Gao ⋅ Emre Kiciman ⋅ Ranveer Chandra ⋅ Wei-Ting Chen
DE2TR: Dual Evidence Detection Transformer for Video Temporal Grounding
Yifan Zhang ⋅ Chengxu Liu ⋅ Yujie Dun ⋅ Xueming Qian
IACD: Iterative Adversarial Collaborative Detection via Dual-Perspective Blind Spot Discovery
Xiaoyan Li ⋅ Cuicui Jiang ⋅ Jiaoping Chen ⋅ Rumei Yang
Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray
Yonathan Michael ⋅ Mohamad Alansari ⋅ Natnael Takele ⋅ Andreas Henschel ⋅ Naoufel Werghi
Region-Aware Multimodal Interleaving for Animal Re-Identification
Yihao Wu ⋅ Di Zhao ⋅ Wayne Getz ⋅ Lingqiao Liu ⋅ Gillian Dobbie ⋅ Daniel Wilson ⋅ Yun Sing Koh
ParaFlow: Parallel Sampling for Flow Matching Models
Jianrong Lu ⋅ Bangwei Li ⋅ Haomin Zhang ⋅ Zhuoya Gu ⋅ Yongqing Lu ⋅ Jianhai Chen ⋅ Qinming He
Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
Shihao Wang ⋅ Shilong Liu ⋅ Yuanguo Kuang ⋅ Xinyu Wei ⋅ Yangzhou Liu ⋅ Zhiqi Li ⋅ Yunze Man ⋅ Guo Chen ⋅ Andrew Tao ⋅ Guilin Liu ⋅ Jan Kautz ⋅ Yabin Zhang ⋅ Zhiding Yu
Beyond Linear Shortcuts: Rectifying Diffusion Preference Optimization with Intrinsic Generative Geometry
Pin Wang ⋅ Huaibo Huang ⋅ Jiayang Sun ⋅ Hongbo Wang ⋅ Wentao Jiang ⋅ Tiezheng Ge ⋅ Jie Cao ⋅ Ran He
Seeing Through the Weights: Privacy Leakage in Scene Coordinate Regression
Oleksii Nasypanyi ⋅ Jaemin Cho ⋅ Utku Ozbulak ⋅ Byungkon Kang ⋅ Francois Rameau
Revisiting Scene Graph Generation from the Perspective of Detector-Conditioned Reachability
Runfeng Qu ⋅ Pia Bideau ⋅ Ole Hall ⋅ Julie Ouerfelli-Ethier ⋅ Klaus Obermayer ⋅ Olaf Hellwich
DeRA: Decoupled Representation Alignment for Video Tokenization
Pengbo Guo ⋅ Junke Wang ⋅ Zhen Xing ⋅ Chengxu Liu ⋅ Daoguo Dong ⋅ Xueming Qian ⋅ Zuxuan Wu
Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning
Zhenyu Yu ⋅ yangchen zeng ⋅ Chunlei Meng ⋅ Guangzhen Yao ⋅ Shuigeng Zhou
Track4World: Feedforward World-centric Dense 3D Tracking of All Pixels
Jiahao Lu ⋅ Jiayi Xu ⋅ WENBO HU ⋅ Ruijie Zhu ⋅ Chengfeng Zhao ⋅ Sai Kit Yeung ⋅ Ying Shan ⋅ Yuan Liu
EMOTE: Expressive Motion and Shape Disentanglement for Human Animation
Dongbin Zhang ⋅ Hao Liu ⋅ Bingquan Dai ⋅ Kangjie Chen ⋅ Chuming Wang ⋅ Chen Li ⋅ Jing LYU ⋅ Haoqian Wang
Incremental Online Scene Reconstruction by 3D Gaussian Triangulation
Yanjin Zhu ⋅ Shaofan Liu ⋅ Jianke Zhu
Seeing What Matters: Lesion-Aware High-Resolution Patch Discovery and Fusion for Chest X-ray Report Generation
Yingshu Li ⋅ YUNYI LIU ⋅ Zhenghao Chen ⋅ Tong Chen ⋅ Zailong Chen ⋅ Lingqiao Liu ⋅ Lei Wang ⋅ Luping Zhou
Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
Boyu Mi ⋅ Mengchen Ma ⋅ Yifei Yao ⋅ Xing Gao ⋅ Hanqing Wang ⋅ Junting Chen ⋅ Yangzi Li ⋅ Zihou Zhu ⋅ Guohao Li ⋅ Zhenfei Yin ⋅ Tai Wang ⋅ Yao Mu ⋅ Jiangmiao Pang
OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection
David Schneider ⋅ Zdravko Marinov ⋅ Moritz Mistol ⋅ Zeyun Zhong ⋅ Alexander Jaus ⋅ Rodi Düger ⋅ Rafael Baur ⋅ M. Saquib Sarfraz ⋅ Rainer Stiefelhagen
Single-Query Person-Centric Bimanual Hand-Object Interaction Detection
Jonghyun Kim ⋅ Junho Roh ⋅ Yubin Yoon ⋅ Jaechul Kim ⋅ Jungho Lee ⋅ Hyotae Lee ⋅ Jongkuk Park ⋅ Taehwan Hwang
Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding
Bingxuan Li ⋅ Jiahao Wu ⋅ Yuan Xu ⋅ Zezheng Zhu ⋅ Yunxiang Zhang ⋅ Kenneth Chen ⋅ Yanqi Liang ⋅ Nanfang Yu ⋅ Qi Sun
Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation
Jingqi Tian ⋅ Yiheng Du ⋅ Haoji Zhang ⋅ Yuji Wang ⋅ Isaac Ning Lee ⋅ Xulong Bai ⋅ Tianrui Zhu ⋅ Jingxuan Niu ⋅ Yansong Tang
Y-diff: Structure-Texture Decoupled Diffusion Distillation for H&E-to-pCLE Translation
Haodong Wang ⋅ Yan Wen ⋅ Hongen Liao ⋅ Fang Chen ⋅ Tianqi Huang
VGEdit: Unlocking Video Generation Priors for Reasoning-Informed Image Editing
Haiquan Lu ⋅ Gongfan Fang ⋅ Xinyin Ma ⋅ Xinchao Wang
Online Reasoning Video Object Segmentation
jinyuan Liu ⋅ Yang Wang ⋅ Zeyu Zhao ⋅ Weixin Li ⋅ Song Wang ⋅ Ruize Han
History-Aware Transformation of ReID Features for Multiple Object Tracking
Ruopeng Gao ⋅ Yuyao Wang ⋅ Chunxu Liu ⋅ Limin Wang
SlowBA: An efficiency backdoor attack towards VLM-based GUI agents
Junxian Li ⋅ Tu Lan ⋅ Haozhen Tan ⋅ Yan Meng ⋅ Haojin Zhu
VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
Tianxiang Jiang ⋅ Sheng Xia ⋅ Yicheng Xu ⋅ Linquan Wu ⋅ Xiangyu Zeng ⋅ Limin Wang ⋅ Yu Qiao ⋅ Yi Wang
X-SG2S: Safe and Generalizable Gaussian Splatting with X-dimensional Watermarks
Zihang Cheng ⋅ Wentao Bao ⋅ HUIPING ZHUANG ⋅ Chun Li ⋅ Xin Meng ⋅ Ziqian Zeng ⋅ Cen Chen ⋅ Ming Li ⋅ Fei Yu
UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer
Shuai Wang ⋅ Liang Li ⋅ Yang Chen ⋅ Ruopeng Gao ⋅ Yao Teng ⋅ Limin Wang
MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
Yang Chen ⋅ Xiaowei Xu ⋅ Shuai Wang ⋅ Xinwen Zhang ⋅ Qiushi Guo ⋅ Tiezheng Ge ⋅ Limin Wang
G-ZAP: A Generalizable Zero-Shot Framework for Arbitrary-Scale Pansharpening
Zhiqi Yang ⋅ Shan Yin ⋅ Jingze Liang ⋅ Liang-Jian Deng
Topology-Weighted Effective Rank: A Zero-Cost Proxy for Training Dynamics Stability in Neural Architecture Search
Haojie Zhang ⋅ Yeming Yang ⋅ Songbai Liu ⋅ Lijia Ma ⋅ Ka-Chun Wong ⋅ Qiuzhen Lin
MemLearner: Learning to Query Context Memory for Video World Models
Jiwen Yu ⋅ Jianxiong Gao ⋅ Jianhong Bai ⋅ Yiran Qin ⋅ Kaiyi Huang ⋅ Quande Liu ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Kun Gai ⋅ Xihui Liu
NearID: Identity Representation Learning via Near-identity Distractors
Aleksandar Cvejic ⋅ Rameen Abdal ⋅ Abdelrahman Eldesokey ⋅ Bernard Ghanem ⋅ Peter Wonka
Real-Time Source-Free Object Detection
Sairam V C Rebbapragada ⋅ Varun Gopal ⋅ Poornima Jain ⋅ Vineeth N Balasubramanian ⋅ Muhammad Haris Khan
Tuning-free Visual Effect Transfer across Videos
Maxwell Jones ⋅ Rameen Abdal ⋅ Or Patashnik ⋅ Ruslan Salakhutdinov ⋅ Sergey Tulyakov ⋅ Jun-Yan Zhu ⋅ Kuan-Chieh Wang
Ex-Sim(3)-Reg: 2D-3D Correspondence Pruning via Extended Sim(3) Registration
Pei An ⋅ Muyao Peng ⋅ Junfeng Ding ⋅ Jiaqi Yang ⋅ Liangliang Nan
GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction
Pradyumna YM ⋅ Yuxuan Xue ⋅ Yue Chen ⋅ Nikita Kister ⋅ István Sárándi ⋅ Gerard Pons-Moll
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
Wenkun He ⋅ Yuchao Gu ⋅ Junyu Chen ⋅ Junyi Wu ⋅ Wenhang Ge ⋅ Dongyun Zou ⋅ Yujun Lin ⋅ Zhekai Zhang ⋅ Haocheng Xi ⋅ Muyang Li ⋅ Ligeng Zhu ⋅ Jincheng YU ⋅ Junsong Chen ⋅ Enze Xie ⋅ Song Han ⋅ Han Cai
LUCE: Constrained Curve-Domain Guidance for Training-Free Low-Light Enhancement with Hue-Preserving Decoupling
Yijie Wei ⋅ Weiran Li ⋅ Yeqiang Liu ⋅ Mina Han ⋅ Xue Liu ⋅ Zhenbo Li
GCMRD: Global Consistency Multi-teacher Robustness Distillation
Yuhang Zhou ⋅ Zhongyun Hua ⋅ Rushi Lan ⋅ Qing Liao ⋅ Wei Jiang
Forecasting Animal Motion
Neerja Thakkar ⋅ Shiry Ginosar ⋅ Jacob Walker ⋅ Jitendra Malik ⋅ Joao Carreira ⋅ Carl Doersch
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
Yexin Liu ⋅ Manyuan Zhang ⋅ Yueze Wang ⋅ Hongyu Li ⋅ Dian Zheng ⋅ WEIMING ZHANG ⋅ Changsheng Lu ⋅ Harry Yang
REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection
Huangsen Cao ⋅ Qin Mei ⋅ Zhiheng Li ⋅ Yuxi Li ⋅ Zhan Meng ⋅ Ying Zhang ⋅ Chen Li ⋅ Zhimeng Zhang ⋅ Xin Ding ⋅ Yongwei Wang ⋅ Jing LYU ⋅ Fei Wu
HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
Jiaxin Li ⋅ Yuxiang Wu ⋅ Zhenkai Zhang ⋅ Xinrui Shi ⋅ wang haoyuan ⋅ Yichen Zhao ⋅ Su Linxiang ⋅ Chenyang chenyang ⋅ Mingyu Zhang ⋅ Yifan Ding ⋅ Boran Wen ⋅ li zhang ⋅ Ruiyang Liu ⋅ Yong-Lu Li
Is Monitoring Enough? Strategic Agent Selection For Stealthy Attack in Multi-Agent Discussions
Qiuchi Xiang ⋅ Haoxuan Qu ⋅ Hossein Rahmani ⋅ Jun Liu
Stochastic Optimal Control Sampling for Diffusion Inverse Problems
Jie Zhang ⋅ Youmei Qiu ⋅ Hanling Tian ⋅ Jingyuan Zhang ⋅ Xiang Yin ⋅ Xiaolin Huang
Make Geometry Matter for Spatial Reasoning
Shihua Zhang ⋅ Qiuhong Shen ⋅ Shizun Wang ⋅ Tianbo Pan ⋅ Xinchao Wang
AeroVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control
Peng Xu ⋅ Zhengnan Deng ⋅ Jiayan Deng ⋅ Zonghua Gu ⋅ Peng Xu
Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering
Zhongpai Gao ⋅ Benjamin Planche ⋅ Meng Zheng ⋅ Anwesa Choudhuri ⋅ Van Nguyen ⋅ Terrence Chen ⋅ Ziyan Wu
LensStyle: Learning the Optical Aesthetics for Controllable Stylized Lens Effect Rendering
Yachuan Huang ⋅ Liwen Xiao ⋅ Liao Shen ⋅ Qiwen Wang ⋅ Huiqiang Sun ⋅ Zhiyu Pan ⋅ Zhiguo Cao
ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation
Sanghyun Jo ⋅ Wooyeol Lee ⋅ Ziseok Lee ⋅ Jonghyun Choi ⋅ Jaesik Park ⋅ Kyungsu Kim
TinyHistory: Lightweight Video History Embeddings via Two-Stage Context Learning
lvmin zhang ⋅ Shengqu Cai ⋅ Muyang Li ⋅ Chong Zeng ⋅ Beijia Lu ⋅ Anyi Rao ⋅ Song Han ⋅ Gordon Wetzstein ⋅ Maneesh Agrawala
Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning
Xu Yan ⋅ Huiqun Wang ⋅ Chen Wang ⋅ Lei Ren ⋅ Di Huang
Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models
Kang MinSeok ⋅ Hyunwoo Kim ⋅ Chanyoung Kim ⋅ Minwoo Kim ⋅ Jaekoo Lee ⋅ Dahuin Jung
FlexiBrain: Resolution-Agnostic Voxel-Level Encoding for Native fMRI
mo wang ⋅ Wenhao Ye ⋅ Junfeng Xia ⋅ Minghao Xu ⋅ Hongkai Wen ⋅ Quanying Liu
GTR: Guide-Then-Refine Token Compression for Training-Free Acceleration of Video-LLMs
Sijin Zhou ⋅ wei feng ⋅ Zhuang Qi ⋅ Zhonghua Wang ⋅ Lie Ju ⋅ Xiang An ⋅ Mehrtash Harandi ⋅ Zongyuan Ge
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
Shai Yehezkel ⋅ Shahar Yadin ⋅ Noam Elata ⋅ Yaron Ostrovsky-Berman ⋅ Bahjat Kawar
Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
Hyunmin Cho ⋅ Jaejun Yoo ⋅ Kyong Hwan Jin
On the Reliability of Cue Conflict and Beyond
Pum Jun Kim ⋅ Seung-Ah Lee ⋅ Seongho Park ⋅ Dongyoon Han ⋅ Jaejun Yoo
Improving Adversarial Robustness via Activation Amplification and Attenuation
Taïga Gonçalves ⋅ Yongsong Huang ⋅ Tomo Miyazaki ⋅ Shinichiro Omachi
Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention
Weichen Zhou ⋅ Yawen Zou ⋅ Chunzhi Gu ⋅ Ran Dong ⋅ Haoran Xie ⋅ Chao Zhang
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
Yiwei Guo ⋅ Shaobin Zhuang ⋅ Zhipeng Huang ⋅ Canmiao Fu ⋅ Chen Li ⋅ Jing LYU ⋅ Yali Wang
Self-Improving Diffusion Classifiers with Minority Preference Optimization
Hyunsoo Kim ⋅ Jungmyung Wi ⋅ Soobin Um ⋅ Donghyun Kim ⋅ Suhyun Kim
Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation
Jaehyun Jang ⋅ Eunseop Yoon ⋅ Hee Suk Yoon ⋅ SooHwan Eom ⋅ Mark Hasegawa-Johnson ⋅ Chang Yoo
Thinking Ahead: Foresight Intelligence in MLLMs and World Model
Zhantao Gong ⋅ Liaoyuan Fan ⋅ Qing Guo ⋅ Xun Xu ⋅ Xulei Yang ⋅ Shijie Li
SplitHDR: Saturation-Aware HDR Recovery and Denoising for Real-Time Detection
Jaewon Kim ⋅ Sol Namkung ⋅ Dongsuk Jeon
TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy
Hao Sun ⋅ Hao Yan ⋅ Mengting Chen ⋅ Quanjian Song ⋅ Yu Li ⋅ Juan Cao ⋅ Jinsong Lan ⋅ Xiaoyong Zhu ⋅ Bo Zheng ⋅ Sheng Tang
Reconstructing Dense Depth of Dark Scenes with Sparse LiDAR, Noisy Events, and Blurry RGB
Jianbo Cao ⋅ Yuqi Han ⋅ Siming Zheng ⋅ Bo Wang ⋅ Tong Guo ⋅ Jinli Suo
VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension
Zeyu Ling ⋅ Bo Han ⋅ Shiyang Li ⋅ Jikang Cheng ⋅ Hongdeng Shen ⋅ Changqing Zou
Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection
Adhémar de Senneville ⋅ Xavier Bou ⋅ Jérémy Anger ⋅ Rafael Grompone von Gioi ⋅ Gabriele Facciolo
DARL: Efficient Document-to-Markup Generation via Look-Ahead Diffusion Trajectory Sampling
Wentao Yang ⋅ Yongxin Shi ⋅ Rui Tang ⋅ Peirong Zhang ⋅ Shihang Wu ⋅ Huiguo He ⋅ Zheng Huang ⋅ Dezhi Peng ⋅ Minghui Liao ⋅ Lianwen Jin
QVAM: Query-guided View-aware Adaptive Modulation for Aerial-Ground Person Re-Identification
Mengfei Zhou ⋅ Lin Wan
LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
Kexian Tang ⋅ Junyao Gao ⋅ Yanhong Zeng ⋅ Haodong Duan ⋅ Sun Yanan ⋅ Zhening Xing ⋅ Wenran Liu ⋅ Kai Chen ⋅ Kaifeng Lyu
Occlusion-Resilient Category-Agnostic Pose Estimation with Conditional Flow Matching
Jiyong Rao ⋅ Shengjie Zhao ⋅ Yu Wang ⋅ Hao Deng
Direct Autoregressive Diffusion Distillation via Error-aware Causal Pretraining
Jiaxing Li ⋅ Kaichen Huang ⋅ Baixin Xu ⋅ Zexiang Liu ⋅ Xianglong He ⋅ Zile Wang ⋅ Junyao Gao ⋅ Yang Liu ⋅ Ying He ⋅ Bo An ⋅ Yangguang Li
MaterialFlow: Attribute-Disentangled Material Transfer via Trajectory-Aware Velocity Modulation
Sung-Lin Tsai ⋅ Bo-Kai Ruan ⋅ Yu-Hsuan Chen ⋅ Wen-Huang Cheng ⋅ Hong-Han Shuai
ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA
Aviad Dahan ⋅ Moran Yanuka ⋅ Noa Kraicer ⋅ Lior Wolf ⋅ RAJA GIRYES
PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding
Seongmin Jung ⋅ Seongho Choi ⋅ Gunwoo Jeon ⋅ Minsu Cho ⋅ Jongwoo Lim
Learning Global Camera Poses from Noisy View-Graphs for Structure from Motion
Fadi Khatib ⋅ Meirav Galun ⋅ Ronen Basri
Prefill-Time Interventions against Adversarial Attacks on Large Vision-Language Models
Zhewen Yao ⋅ Yao Zhu ⋅ Shiliang Zhang
Visual Spatial Tuning
Rui Yang ⋅ ziyu zhu ⋅ Yanwei Li ⋅ Jingjia Huang ⋅ Shen Yan ⋅ Siyuan Zhou ⋅ Zhe Liu ⋅ Xiangtai Li ⋅ Shuangye Li ⋅ Wenqian Wang ⋅ Yi Lin ⋅ Hengshuang ZHAO
SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting
Xudong Xie ⋅ Yuzhe Li ⋅ Jing Shi ⋅ Zhifei Zhang ⋅ Curtis Wigington ⋅ Zhaowen Wang
Editing Everything Everywhere All at Once
Fabio Quattrini ⋅ Carmine Zaccagnino ⋅ Enis Simsar ⋅ Marta Gazulla ⋅ Rita Cucchiara ⋅ Alessio Tonioni ⋅ Silvia Cascianelli
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
Quanjian Song ⋅ Yiren Song ⋅ Kelly Peng ⋅ Yuan Gao ⋅ Mike Zheng Shou
General Incomplete Multimodal Learning via Dynamic Quality Perception
Xiangyu Meng ⋅ shicai wei
GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation
Rui Xie ⋅ Zhi Gao ⋅ Chenrui Shi ⋅ Zirui Shang ⋅ Lu Chen ⋅ Qing Li
Towards Practical Lossless Neural Compression for LiDAR Point Clouds
pengpeng yu ⋅ Haoran Li ⋅ Runqing Jiang ⋅ Dingquan Li ⋅ Jing Wang ⋅ Liang Lin ⋅ Yulan Guo
UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction
Xinqiang Yu ⋅ Zekun Qi ⋅ Jiawei He ⋅ Wenyao Zhang ⋅ Xuchuan Chen ⋅ Guocai Yao ⋅ Li Yi ⋅ Zhaoxiang Zhang ⋅ HE WANG
DiTex4D: Direct Text-Driven 4D Generation with Structured Latent Diffusion
Xiaozhe Chen ⋅ Mengqi Rong ⋅ Jian Liu ⋅ Shuhan Shen
DisRM: Reward Modeling as Discriminative Prediction
Runtao Liu ⋅ Jiahao Zhan ⋅ Yuxuan GUO ⋅ Yingqing He ⋅ Chen Wei ⋅ Alan Yuille ⋅ Qifeng Chen
SV-TAD: Native Sparse Convolutions for Efficient Temporal Action Detection
Ricardo Ignacio Pizarro Carreño ⋅ Roberto Valle ⋅ José Buenaposada ⋅ Luis M. Bergasa ⋅ Luis Baumela
HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
Dairu Liu ⋅ Zekun Qi ⋅ Jiayu Zeng ⋅ Yu Guan ⋅ Chenghuai Lin ⋅ Xuchuan Chen ⋅ Xinqiang Yu ⋅ Wenyao Zhang ⋅ HE WANG ⋅ Li Yi
Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning
Wenxuan Zhang ⋅ Yuhui Wang ⋅ Donggang Jia ⋅ Xiaoqian Shen ⋅ Jian Ding ⋅ Ivan Viola ⋅ Jürgen Schmidhuber ⋅ Mohamed Elhoseiny
When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization
Tianqi Li ⋅ Wenyu Fang ⋅ Xin He ⋅ Xue Geng ⋅ Xu Cheng ⋅ Yun Liu
AnaPFL: When Closed-Form Solutions Meet Generalizationand Personalization in Personalized Federated Learning
Kejia Fan ⋅ Jianheng Tang ⋅ Zhirui Yang ⋅ Feijiang Han ⋅ Yajiang Huang ⋅ Run He ⋅ Jiaxu Li ⋅ Songning Lai ⋅ Anfeng Liu ⋅ Houbing Herbert Song ⋅ Yunhuai Liu ⋅ HUIPING ZHUANG
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
Koya Sakamoto ⋅ Taiki Miyanishi ⋅ Daichi Azuma ⋅ Shuhei Kurita ⋅ Shu Morikuni ⋅ Naoya Chiba ⋅ Motoaki Kawanabe ⋅ Yusuke Iwasawa ⋅ Yutaka Matsuo
LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
Shunya Kato ⋅ Taiki Miyanishi ⋅ Shuhei Kurita ⋅ Mahiro Ukai ⋅ Nakamasa Inoue ⋅ Chenhui Chu
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP
Sicheng Zhang ⋅ Muhammad Muzammal Naseer ⋅ Binzhu Xie ⋅ Naufal Suryanto ⋅ Shi Qiu ⋅ Jamal Bentahar ⋅ NAVEED AKHTAR ⋅ Shah Mubarak
From Predictions to Embeddings: Dual Knowledge Distillation for Instance-Dependent Partial Label Learning
Lilong Duan ⋅ Ke Wang ⋅ Yao Zhang ⋅ Jun Tang
EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics
Jiayu Chen ⋅ Hengyi Zhang ⋅ Maoliang Li ⋅ Minyu Li ⋅ Zihao Zheng ⋅ Xuanzhe Liu ⋅ Guojie Luo ⋅ Xiang Chen
Straight-Path Flow Matching for Incomplete Multi-View Clustering
Yiteng Yuan ⋅ Junyan Wang ⋅ Zheyuan Liu ⋅ Hong Jia ⋅ Lei Fan ⋅ Zhulin Tao ⋅ Lianbo Guo
HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework
Jiacheng Yang ⋅ Anqi Chen ⋅ Yunkai Dang ⋅ Qi Fan ⋅ Cong Wang ⋅ Wenbin Li ⋅ Feng Miao ⋅ Yang Gao
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
Zhe Gao ⋅ Shiyu Shen ⋅ Taifeng Chai ⋅ Weinong Wang ⋅ Haotian Xu ⋅ Xing W ⋅ Wenbin Li ⋅ Qi Fan ⋅ Yang Gao ⋅ Dacheng Tao
Stokes-Informed Diffusion for Robust Linear Polarization Estimation
Yidong Luo ⋅ Chenggong Li ⋅ Yuchao Feng ⋅ Boxin Shi ⋅ Junchao Zhang ⋅ Xin Yuan
PolarAPP: Beyond Polarization Demosaicking for Polarimetric Applications
Yidong Luo ⋅ Chenggong Li ⋅ Yunfeng Song ⋅ Ping Wang ⋅ Boxin Shi ⋅ Junchao Zhang ⋅ Xin Yuan
Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion
Dean Hazineh ⋅ Luca Sacchi ⋅ Davide Cassara ⋅ Federico Capasso ⋅ Todd Zickler
Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis
Federico Lincetto ⋅ Gianluca Agresti ⋅ Mattia Rossi ⋅ Piergiorgio Sartor ⋅ Pietro Zanuttigh
Multi-Hypothesis Test-Time Adaptation to Mitigate Underspecification
Afshar Shamsi ⋅ Xiao-Yu Guo ⋅ Hamid Alinejad-Rokny ⋅ Arash Mohammadi ⋅ Damien Teney ⋅ Ehsan Abbasnejad
DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning
JIAJIAN HUANG ⋅ Dongliang Zhu ⋅ Zitong Yu ⋅ Hui Ma ⋅ Jiayu Zhang ⋅ Chunmei Zhu ⋅ Xiaochun Cao
Posterior Samplings are Missing Modalities Generators for Medical Image Translation
Jonghun Kim
MeanTalker: Efficient and Expressive Speech-Driven 3D Facial Animation via Geometric-Aware Mean Flow
Zhongyuan Zhao ⋅ Zhihao Li ⋅ Qing Li ⋅ Leidong Fan ⋅ KANGLIN LIU
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
Yiran Guan ⋅ Liang Yin ⋅ Dingkang Liang ⋅ Jianzhong Ju ⋅ Zhenbo Luo ⋅ Jian Luan ⋅ Yuliang Liu ⋅ Xiang Bai
ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval
Yuhan Liu ⋅ Pei Fu ⋅ Hang Li ⋅ Yukun Qi ⋅ Chao Jiang ⋅ Jingwen Fu ⋅ Zhen Liu ⋅ Bin Qin ⋅ Zhenbo Luo ⋅ Jian Luan ⋅ Jingmin Xin
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
Hao Shao ⋅ Letian Wang ⋅ Yang Zhou ⋅ Yuxuan Hu ⋅ Zhuofan Zong ⋅ Steven Waslander ⋅ Wei Zhan ⋅ Hongsheng LI
Same Person, Different Depiction: Counterfactual Evaluation of Vision-Language Models on Individuals with Limb Deficiencies
Heming Du ⋅ Jiaying Ying ⋅ Xin Chen ⋅ Sen Wang ⋅ Xue Li ⋅ Xin Yu
Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation
Ziyu Zhang ⋅ Yi Yu ⋅ Simeng Zhu ⋅ Ahmed Aly ⋅ Yunhe Gao ⋅ Ning Gu ⋅ Yuan Xue
STANCE: Controllable Video Generation for Structured Dynamics via Sparse-To-dense ANChored Encoding
ZhiFei Chen ⋅ Tianshuo Xu ⋅ Leyi Wu ⋅ Luozhou Wang ⋅ Dongyu Yan ⋅ Zihan You ⋅ Wenting Luo ⋅ Yingcong Chen
Pose Anything Anywhere: Model-free Object Poses from Arbitrary References
Hongli XU ⋅ Jiaqi Hu ⋅ Junwen Huang ⋅ Boyang Zhong ⋅ Peter Yu ⋅ Nassir Navab ⋅ Benjamin Busam ⋅ Slobodan Ilic
MMAgent-R2: Learning to Rerank and Reject for Agentic mRAG
Tao Zhang ⋅ Ziqi Zhang ⋅ Zongyang Ma ⋅ Yuxin Yang ⋅ Bing Li ⋅ Chunfeng Yuan ⋅ Kang Rong ⋅ Fengyun Rao ⋅ Jing LYU ⋅ Weiming Hu
Identity-Preserving Human Reconstruction from a Single Image via 3D Token Inference
Yanqi Bao ⋅ Jiaxiang Shang ⋅ Yang Gao ⋅ Yingchun Liu ⋅ Jing Huo ⋅ Jing Liao
MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction
Dehao Hao ⋅ Kaiyi Zhang ⋅ Tanghui Jia ⋅ Xiangjun Gao ⋅ Dongyu Yan ⋅ Weikai Chen ⋅ Zeyu HU ⋅ Lingting Zhu ⋅ Yingda Yin ⋅ Runze Zhang ⋅ Li Yuan ⋅ Xin Wang ⋅ Long Quan
GeoV2V: Geometry-Grounded Video Diffusion Model for Driving Scene Generation
Yuchen Xi ⋅ tippy guo ⋅ Chenwei Hou ⋅ Zixu Liu ⋅ Jin Fang ⋅ Jason Liu ⋅ Ruigang Yang
Prototype Normalization: Optimizing Prototype Separation for Heterogeneous Federated Learning
Daeyoung Choi ⋅ Jihwan Shin ⋅ Gyuejeong Lee
DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces
Mohammad Sadil Khan ⋅ Muhammad Usama ⋅ Rolandos Alexandros Potamias ⋅ Didier Stricker ⋅ Muhammad Zeshan Afzal ⋅ Jiankang Deng ⋅ Ismail Elezi
RadarGen: Automotive Radar Point Cloud Generation from Cameras
Tomer Borreda ⋅ Fangqiang Ding ⋅ Sanja Fidler ⋅ Shengyu Huang ⋅ Or Litany
InclusiveHuman-10K: Towards Inclusive Human Parsing Beyond the Intact-Limb Assumption
Heming Du ⋅ Jiaying Ying ⋅ Xiaofeng Cao ⋅ Zhu Li ⋅ Yuanyuan Liu ⋅ Kaihao Zhang ⋅ Xin Chen ⋅ Xin Yu
Hi-DREAM: Brain Inspired Hierarchical Diffusion for fMRI-to-image Reconstruction via ROI Encoder And visual Mapping
Guowei Zhang ⋅ Yun Zhao ⋅ Kai Sun ⋅ Moein Khajehnejad ⋅ Adeel Razi ⋅ Dinh Q Phung ⋅ Levin Kuhlmann
NUN: Nested Unfolding Network for Real-World Concealed Object Segmentation
Chunming He ⋅ Rihan Zhang ⋅ Longxiang Tang ⋅ Dingming Zhang ⋅ Bojian Zhang ⋅ Fengyang Xiao ⋅ Jingjia Feng ⋅ Sina Farsiu
FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Arbitrary Images
Jianjiang Yao ⋅ Ke Xian ⋅ Renxiang Dai ⋅ Robert Qiu
Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training
Quan Kong ⋅ Yanru Xiao ⋅ Yuhao Shen ⋅ Cong Wang
When Specialists Meet Generalists: Segmenter-Coordinated Asymmetric Learning for Label-Deficient Concealed Object Segmentation
Chunming He ⋅ Dingming Zhang ⋅ Longxiang Tang ⋅ Ziyun Yang ⋅ Fengyang Xiao ⋅ Sina Farsiu
From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation
Yibin Liu ⋅ Yaxing Lyu ⋅ Daqi Gao ⋅ Zhixuan Liang ⋅ Weiliang Tang ⋅ Shilong Mu ⋅ Xiaokang Yang ⋅ Mingyu Ding ⋅ Yao Mu
R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation
Yuhao Zhang ⋅ Wanxi Dong ⋅ Yue Shi ⋅ Yi Liang ⋅ Jingnan Gao ⋅ Qiaochu Yang ⋅ Yaxing Lyu ⋅ Zhixuan Liang ⋅ Yibin Liu ⋅ Congsheng Xu ⋅ Xianda Guo ⋅ Wei Sui ⋅ Yaohui Jin ⋅ Xiaokang Yang ⋅ Yanyan Xu ⋅ Yao Mu
QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration
Fengyang Xiao ⋅ Jingjia Feng ⋅ Peng Hu ⋅ Yuhan Chen ⋅ Dingming Zhang ⋅ Lei Xu ⋅ Guanyi Qin ⋅ Lu Li ⋅ Chunming He ⋅ Sina Farsiu
Rethinking Real-World MRI Denoising: Learning from Physical Noise
Sebastian Rassmann ⋅ David Kügler ⋅ Sascha Brunheim ⋅ Philipp Ehses ⋅ Martin Reuter
CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport
Peng Ling ⋅ Yingda Yin ⋅ Lingting Zhu ⋅ Weikai Chen ⋅ Shengju Qian ⋅ Zeyu HU ⋅ Xin Wang ⋅ Wenming Yang
Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
Heethanjan Kanagalingam ⋅ Thenukan Pathmanathan ⋅ Mokeeshan Vathanakumar ⋅ Basim Azam ⋅ Sarah Erfani ⋅ NAVEED AKHTAR
LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching
Jinshan Liu ⋅ Haoran Qin ⋅ Xiaobing Tu ⋅ Jiacheng Liu ⋅ Jiahui Hu ⋅ zhengan yan ⋅ Yukun Xie ⋅ Kerui Shen ⋅ Jinkui Ren ⋅ Yuqi Lin ⋅ Xiantao Zhang ⋅ Linfeng Zhang
CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA
Hanseok Oh ⋅ Parishad BehnamGhader ⋅ Benno Krojer ⋅ Hyunji Lee ⋅ Paul Pu Liang ⋅ Siva Reddy ⋅ Verna Dankers
NutriBench-Kitchen: Benchmarking Embodied AI for Nutrition Management
YuLin Wei ⋅ Xiangchen Wang ⋅ Jianhui Pan ⋅ Jinyu Xiao ⋅ Zheng Tan ⋅ Ruozai Tian ⋅ Guanhua Chen ⋅ Feng Zheng
TR-MoE: Temporal Reliability-Aware Mixture-of-Experts for Robust Tracking
Tianle Wang ⋅ Xiangyang Yang ⋅ Jihua Zhu ⋅ Binrui Liu ⋅ Yanzhao Li ⋅ Shuiwang Li
HEM: a margin-based loss for visual categorisation tasks
Michael Spratling ⋅ Heiko Schütt
Physics-Guided Deep Learning for Linear Mueller Matrix Acquisition
Yuan Liang ⋅ Shaoli Liu ⋅ Jiachun Huang
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
Lunbin Zeng ⋅ Jingfeng Yao ⋅ Bencheng Liao ⋅ Hongyuan Tao ⋅ Wenyu Liu ⋅ Xinggang Wang
ESCAPE: Episodic Spatial Memory and Adaptive Execution Policy for Long-Horizon Mobile Manipulation
Jingjing Qian ⋅ Zeyuan He ⋅ Chen Shi ⋅ Lei Xiao ⋅ Li Jiang
WorldCache: Content-Aware Caching for Accelerated Video World Models
Umair Nawaz ⋅ Ahmed Heakl ⋅ Ufaq Khan ⋅ ABDELRAHMAN YOUSSIEF ⋅ Salman Khan ⋅ Fahad Shahbaz Khan
Agent-OBJ: Prompt-Driven 3D Adversaries for Multi-Modal Perception
Bing Li ⋅ Sean Du ⋅ Xuhong Ren ⋅ Luqi Gong ⋅ Wee Peng Tay ⋅ Qing Guo
Learning 1-Bit LiDAR-based Localization with Auxiliary Objective
Kaijie Yin ⋅ Zhiyuan Zhang ⋅ Tian Gao ⋅ Wentao Zhu ⋅ Cheng-zhong Xu ⋅ Hui Kong
GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
Wei Zhang ⋅ Chaoqun Wang ⋅ Zixuan Guan ⋅ Ping Kao ⋅ Pengfei Zhao ⋅ Peng Wu ⋅ Sifeng He
Learn to Rank: Visual Attribution by Learning Importance Ranking
David Schinagl ⋅ Christian Fruhwirth-Reisinger ⋅ Alexander Prutsch ⋅ Samuel Schulter ⋅ Horst Possegger
SPEAR: A Simulator for Photorealistic Embodied AI Research
Mike Roberts ⋅ Renhan Wang ⋅ Rushikesh Zawar ⋅ Rachith Dey-Prakash ⋅ Quentin Leboutet ⋅ Stephan Richter ⋅ Matthias Müller ⋅ German Ros ⋅ Rui Tang ⋅ Stefan Leutenegger ⋅ Yannick Hold-Geoffroy ⋅ Kalyan Sunkavalli ⋅ Vladlen Koltun
AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer
Yongwen Lai ⋅ Chaoqun Wang
AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting
Dexu Zhu ⋅ Jiangnan Shao ⋅ Xiaofeng Wang ⋅ Junxian Duan ⋅ Jie Cao ⋅ Zheng Zhu ⋅ Huaibo Huang
MoE-KD: Your Teacher Model is Worth Mixture-of-Experts for Knowledge Distillation
Kuo Shi ⋅ Wenjie Zhu ⋅ Bo Peng
JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising
Siang Ling Zhang ⋅ Huai-Hsun Cheng ⋅ Tsung-Ju Yang ⋅ Yu-Lun Liu
HandSCS: Structural Coordinate Space for Animatable Hand Gaussian Splatting
Yilan Dong ⋅ Wenqing WANG ⋅ Qing Wang ⋅ Jiahao Yang ⋅ Haohe Liu ⋅ Xiatian Zhu ⋅ Greg Slabaugh ⋅ Shanxin Yuan
DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
Zhenyu Hu ⋅ Qing Wang ⋅ Cao Te ⋅ Kuo Liao ⋅ Longfei Lu ⋅ Liqun Liu ⋅ Shuang Li ⋅ Hang Chen ⋅ Mengge Xue ⋅ Yuan Chen ⋅ Chao Deng ⋅ Peng Shu ⋅ Huan Yu ⋅ Jie Jiang
YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation
Jaekyun Ko ⋅ Byung Wan Lim ⋅ Dongjin Kim ⋅ Soomin Lee ⋅ Tae Hyun Kim
DINO-SLAM: DINO-Informed RGB-D SLAM for Neural Implicit and Explicit Representations
ZIREN GONG ⋅ Xiaohan Li ⋅ Fabio Tosi ⋅ Youmin Zhang ⋅ Stefano Mattoccia ⋅ Jun Wu ⋅ Matteo Poggi
Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection
Wenkui Yang ⋅ chao jin ⋅ Haisu Zhu ⋅ Weilin Luo ⋅ Derek Yuen ⋅ Kun Shao ⋅ Junxian Duan ⋅ Huaibo Huang ⋅ Jie Cao ⋅ Ran He
Grounding World Simulation Models in a Real-World Metropolis
Junyoung Seo ⋅ Hyunwook Choi ⋅ Minkyung Kwon ⋅ Jinhyeok Choi ⋅ Siyoon Jin ⋅ Gayoung Lee ⋅ Junho Kim ⋅ JoungBin Lee ⋅ Geonmo Gu ⋅ Dongyoon Han ⋅ Sangdoo Yun ⋅ Seungryong Kim ⋅ Jin-Hwa Kim
Contrastive Conditional–Unconditional Alignment for Long-tailed Diffusion Model
Fang Chen ⋅ Alex Villa ⋅ Gongbo Liang ⋅ Li Fuxin ⋅ Xiaoyi Lu ⋅ Meng Tang
Towards Temporal Compositional Reasoning in Long-Form Sports Videos
Siyu Cao ⋅ Lu Zhang ⋅ Ruizhe Zeng ⋅ Zhi-yong Liu
Geometric Probing for Isotropic Optimization Manifold in Sparse-View 3D Gaussian Splatting
Yunlong Zhao ⋅ Xiaoheng Deng ⋅ Hongyan Xu ⋅ Yichao Cao ⋅ Keke Huang ⋅ Shuo Yang ⋅ Xiangjian He ⋅ Lei Fan ⋅ Zhuohua Qiu ⋅ Xiu Su
MobileSAM2: Lightweight Segment Anything in Images and Videos via Hypergraphical Knowledge Distillation
Kai Jiang ⋅ Jiaxing Huang ⋅ Jingyi Zhang ⋅ Weiying Xie ⋅ Yunsong Li ⋅ Yufei Wang ⋅ Aoran Xiao ⋅ Dacheng Tao
DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
Ruizhe Zeng ⋅ Siyu Cao ⋅ Lu Zhang ⋅ Zhi-yong Liu
AiSCREAM: Absolute Target Localization with Language-Conditioned Cross-View Alignment for Autonomous Vehicles
Kei Katsumata ⋅ Jun Piao ⋅ Naoki Hosomi ⋅ Kentaro Yamada ⋅ Komei Sugiura
PGCR: Pose–Geometry Coupled Reasoning for Image-to-Point Cloud Registration
Xinjun Li ⋅ Wenfei Yang ⋅ Yihan Chen ⋅ Zhixin Cheng ⋅ Shifeng Zhang ⋅ Xu Zhou ⋅ Tianzhu Zhang
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation
Kangyi Wu ⋅ Pengna Li ⋅ Kailin Lyu ⋅ Xi Lin ⋅ Lin Zhao ⋅ Qingrong He ⋅ Jinjun Wang ⋅ Jianyi Liu
UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving
Bo Zhao ⋅ Xinting Zhao ⋅ Naifan Li ⋅ Erkang Cheng ⋅ Haibin Ling
Optimizing Mesh Animation from Video via Shape Flow Guidance
Jingqiao Xiu ⋅ Yicong Li ⋅ Angela Yao
Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
Pengcheng Wang ⋅ Zhiquan Wang ⋅ Jayoung Lee ⋅ Zhuoyan Xu ⋅ Ran Xu ⋅ Saurabh Bagchi ⋅ Yin Li ⋅ Somali Chaterji
Auto3R: Automated 3D Reconstruction and Scanning via Data-driven Uncertainty Quantification
Chentao Shen ⋅ Sizhe Zheng ⋅ Bingqian Wu ⋅ Yaohua Feng ⋅ Yuanchen Fei ⋅ Mingyu Mei ⋅ Hanwen Jiang ⋅ Xiangru Huang
Enhancing Embodied Reasoning and Grounding by Novel View Synthesis
Yu-Ji Kim ⋅ Dahye Lee ⋅ Kim Jun-Seong ⋅ Nam Hyeon-Woo ⋅ GeonU Kim ⋅ Yongjin Kwon ⋅ Yu-Chiang Frank Wang ⋅ Jaesung Choe ⋅ Tae-Hyun Oh
Urban Boundaries, Social Barriers: A Benchmark and Vision-Centric Framework for Mapping Gated Communities and Equity Implications
Minwei Zhao ⋅ WEIMING ZHANG ⋅ Jiawang DU ⋅ Qiming LIU ⋅ Weiming Zhuang ⋅ Pei Nie ⋅ Cai Wu
MobileOcc: A Human-Aware Semantic Occupancy Dataset for Mobile Robots
Junseo Kim ⋅ Guido Dumont ⋅ Xinyu Gao ⋅ Gang Chen ⋅ Holger Caesar ⋅ Javier Alonso-Mora
SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks
Zhewen He ⋅ Junyi Hu ⋅ Haomian Huang ⋅ Zhenhua Li ⋅ Yushen Liu ⋅ Yi Fang
Robust and Efficient Monocular 3D Gaussian SLAM for Kilometer-Scale Outdoor Scenes
Sicheng Yu ⋅ Dongxu Shen ⋅ Beizhen ZHAO ⋅ Ding Guanzhi ⋅ Hao Wang
Video-Text Alignment Model for Sign Language Translation
Junyi Hu ⋅ Zhewen He ⋅ Haomian Huang ⋅ Yi Fang ⋅ Aoxiang Yang
Schroedinger’s Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics
Timy Phan ⋅ Jannik Wiese ⋅ Bjorn Ommer
BRepFacetGen: Reverse Engineering B-Reps By Generative Face Segmentation
Ka Hei Hui ⋅ Vikas Thamizharasan ⋅ Pradeep Kumar Jayaraman ⋅ Xiang Xu
Warp-free Cross-view Geo-localization via Feature-space Consensus Mining
Zhuo Song ⋅ Lian Xu ⋅ Runqing Jiang ⋅ Kunhong Li ⋅ Yongjian Zhang ⋅ Ye Zhang ⋅ Yulan Guo
Unordered Landmark Visual Navigation
Hao Ren ⋅ Junzhe Zhu ⋅ Yihan Li ⋅ Zetong Bi ⋅ Le Zheng ⋅ Zhi Li ⋅ Yiqing Yuan ⋅ Zhaoliang Wan ⋅ Dizhe Zhang ⋅ Lu Qi ⋅ HUI CHENG
Fragmented Text Is Insufficient for Image Representation: Fine-Grained Correspondence in Multimodal Dataset Distillation
Jingwei Fang ⋅ Yaxin Hou ⋅ Bo Han ⋅ Xu Zhang ⋅ Hui LIU ⋅ Junhui Hou ⋅ Yuheng Jia
Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning
Zhen Zeng ⋅ Leijiang Gu ⋅ Zhangling Duan ⋅ Feng Li ⋅ Zenglin Shi ⋅ Cees Snoek ⋅ Meng Wang
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
Bozhou Li ⋅ Sihan Yang ⋅ Yushuo Guan ⋅ Ruichuan An ⋅ Xinlong Chen ⋅ Yang Shi ⋅ Pengfei Wan ⋅ Wentao Zhang ⋅ Yuanxing Zhang
Beyond the Boundary: RL-Driven Solution Space Exploration for Blind Face Restoration
Bin WU ⋅ Wei Wang ⋅ Yahui Liu ⋅ Chi Zhang ⋅ Yao Zhao
PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models
Xianghui Wang ⋅ Feng Chen ⋅ Wenbo Zhang ⋅ Hua Yan ⋅ Zixuan Wang ⋅ Changsheng Li ⋅ Yinjie Lei
Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation
Peixin Chen ⋅ Guoxi Zhang ⋅ Jianwei Ma ⋅ Qing Li
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models
Shaokang Wang ⋅ Pei Fu ⋅ Ruoceng Zhang ⋅ Shaojie Zhang ⋅ Xiuwen Xi ⋅ Jiahui Yang ⋅ Bin Qin ⋅ Ying Huang ⋅ Zhenbo Luo ⋅ Jian Luan
DriveFine: Refining-Augmented Masked Diffusion VLA for Accurate and Robust Driving
Chenxu Dang ⋅ Sining Ang ⋅ Yongkang Li ⋅ Haochen Tian ⋅ Jie Wang ⋅ Guang Li ⋅ Hangjun Ye ⋅ Jie Ma ⋅ Long Chen ⋅ Yan Wang
Push–Pull Attentional Anchoring for Diffusion Concept Erasure
Nattanat Chatthee ⋅ Tagon Sompong ⋅ Ekapol Chuangsuwanich ⋅ Supasorn Suwajanakorn
RePer-360: Releasing Perspective Priors for 360° Depth Estimation via Self-Modulation
Cheng Guan ⋅ Chunyu Lin ⋅ Zhijie Shen ⋅ Junsong Zhang ⋅ Jiyuan Wang
Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space
Yue Cao ⋅ Jianyang Gu ⋅ Vyacheslav Kungurtsev ⋅ Yu Hu ⋅ Jozsef Hamari ⋅ Zheng Liu ⋅ Mohsen Zardadi
Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time
Sooyoung Jeon ⋅ Hongjie Tian ⋅ Lemeng Wang ⋅ Zheda Mai ⋅ Vidhi Bakshi ⋅ Jiacheng Hou ⋅ Ping Zhang ⋅ Arpita Chowdhury ⋅ Jianyang Gu ⋅ Wei-Lun Chao
MARché: Fast Masked Autoregressive Image Generation with Cache-Aware Attention
Chaoyi Jiang ⋅ Sungwoo Kim ⋅ Lei Gao ⋅ Hossein Zarch ⋅ Won Woo Ro ⋅ Murali Annavaram
Motion Style Slider: Endpoint-Supervised Continuous Style Control for Human Motion Diffusion
Chen-Chieh Liao ⋅ YICHEN PENG ⋅ YIYI CAI ⋅ Yûi Ono ⋅ Hiroki Hanaoka ⋅ Erwin Wu ⋅ Hideki Koike ⋅ Shuichi Kurabayashi
Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation
Sunggu Kyung ⋅ Jinyoung Seo ⋅ Hyunseok Lim ⋅ Dongyeong Kim ⋅ Hyungbin Park ⋅ Jimin Sung ⋅ Wooyoung Jo ⋅ Yoojin Nam ⋅ Namkug Kim
Dynamic-Robust Photometric–Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding
Boyu xxx ⋅ Li Yang ⋅ Yan Xu ⋅ Wei Liu ⋅ Nian Liu ⋅ Sikui Zhang ⋅ Yan Wang ⋅ Chunfeng Yuan ⋅ Weiming Hu
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
Dayong Liu ⋅ Chao Xu ⋅ Weihong Chen ⋅ Suyu Zhang ⋅ Juncheng Wang ⋅ Jiankang Deng ⋅ Baigui Sun ⋅ Yang Liu
SCoT: Similarity-guided Conflict-aware Task Consolidation for Continual VQA
Anand Patel ⋅ Moloud Abdar ⋅ Biplab Banerjee
Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching
Jiuzhou Lin ⋅ Fei Zuo ⋅ Huan Ouyang ⋅ Junlong Wu ⋅ Dewen Fan ⋅ Boheng Zhang ⋅ Huaiqing Wang ⋅ Jia Sun ⋅ Fan Yang ⋅ Houde Liu ⋅ Kehai Chen ⋅ Min Zhang ⋅ Tingting Gao ⋅ Han Li
Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection
Chanhui Lee ⋅ Donggyu Choi ⋅ Seunghyun Shin ⋅ Hae-Gon Jeon ⋅ Jeany Son
Scaling Multi-Reference Image Generation with Dynamic Reward Optimization
Wenwang Huang ⋅ Yusen Fu ⋅ Mengfei Huang ⋅ Junjie Wang ⋅ Yulin Li ⋅ Gan Liu ⋅ Jing Cai ⋅ Yancheng He ⋅ Zhuotao Tian
UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion
Aryan Das ⋅ Koushik Biswas ⋅ Moloud Abdar ⋅ Vinay Kumar Verma
Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis
HAKSU LIM ⋅ Myeongjin Lee ⋅ Wonjoon Chang ⋅ Jaesik Choi
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
Xingjian Tao ⋅ Yiwei Wang ⋅ Yujun Cai ⋅ Yifan Song ⋅ Jing Tang
Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache
Zhirong Shen ⋅ Rui Huang ⋅ Chang Zou ⋅ Shikang Zheng ⋅ Jiacheng Liu ⋅ Peiliang Cai ⋅ zhengyi shi ⋅ Yaosong Du ⋅ Liang Feng ⋅ Xiaobing Tu ⋅ Jinkui Ren ⋅ Xiantao Zhang ⋅ Linfeng Zhang
HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task
Xiaoya Lu ⋅ Yijin Zhou ⋅ Zeren Chen ⋅ Ruocheng Wang ⋅ Bingrui Sima ⋅ Enshen Zhou ⋅ Lu Sheng ⋅ Dongrui Liu ⋅ Jing Shao
Real-Time LiDAR Gaussian Splatting SLAM via Geometry-Aware Covariance Coupling
SeungJun Tak ⋅ Yewon Jeon ⋅ Hwang Jaeik ⋅ Suk Min Hwang ⋅ SeongboHa SeongboHa ⋅ Hyeonwoo Yu
Learning to Balance: Decoupled Siamese Diffusion Transformer for Reference-Based Remote Sensing Image Super-Resolution
Bin Luo ⋅ Runmin Dong ⋅ Zhaoyang Luo ⋅ Jinxiao Zhang ⋅ Jiyao Zhao ⋅ Fan Wei ⋅ Haohuan Fu
StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views
Jia-Chen Zhao ⋅ Beiqi Chen ⋅ Xinyang Chen ⋅ Guangcong Wang ⋅ Liqiang Nie
Adaptive Spectrum-Aware Feature Disentangled Network for Small Object Detection
Yang Guo ⋅ Zihan Yang ⋅ Feifei Kou ⋅ Yulan Hu ⋅ Ran Zhang ⋅ Siyuan Yao
When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models
Dasol Choi ⋅ Jihwan Lee ⋅ Minjae Lee ⋅ Minsuk Kahng
HieDG: A Hierarchical Discrete Geometry-Guided Framework for Multi-Animal Tracking
Chenxun Deng ⋅ Zhongde Zhang ⋅ Ye Yuan ⋅ Chengyang Zhang ⋅ Yifan Zhang ⋅ Bohao Chen ⋅ Hongying Yan ⋅ Hang Zhou ⋅ Hua Han ⋅ Xi Chen
CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance
Hana Kim ⋅ Minje Kim ⋅ Tae-Kyun Kim
DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution
Yoonseok Choi ⋅ Eun-Gyu Ha ⋅ Daniel Kim ⋅ Mohammed Al-masni ⋅ Ming-Hsuan Yang ⋅ Dong-Hyun Kim
RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion
Zhe Li ⋅ Boan Zhu ⋅ Yangyang Wei ⋅ Shuanghao Bai ⋅ Yuheng Ji ⋅ Tao Huang ⋅ Pengwei Wang ⋅ Zhongyuan Wang ⋅ Gary Chan ⋅ Chang Xu ⋅ Cheng Chi ⋅ Jianfei Yang ⋅ Shanghang Zhang
TRINITY: A Multi-Perspective Benchmark for Personal-Style Video Highlight Detection
Qianqian Chen ⋅ Hyun Bin Kim ⋅ Denzel Wijaya ⋅ Yang Yi ⋅ Bo LIU ⋅ Yangkai Ding
Learning to Attract and Repel: Dual Quality Margin Learning for Face Recognition (DQM-Face)
El Ouanas Belabbaci ⋅ Bhavesh Wani ⋅ Philipp Terhörst
FaCT-GS: Fast and Scalable CT Reconstruction with Gaussian Splatting
Pawel Pieta ⋅ Rasmus Juul Pedersen ⋅ Sina Borgi ⋅ Jakob S. Jørgensen ⋅ Jens Wenzel Andreasen ⋅ Vedrana Dahl
EGGS: Explicitly Granular 3D Gaussian Splatting via Luma-Aware and Volume-Preserving Attribute Factorization
InGyu Jeong ⋅ Hyunmin Jung
Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning
Songtao Tian ⋅ Guhan Chen ⋅ Bohan Li ⋅ Jingyi Ma ⋅ Zixiong Yu
RawGen: Learning Camera Raw Image Generation
Dongyoung Kim ⋅ Junyong Lee ⋅ Abhijith Punnappurath ⋅ Mahmoud Afifi ⋅ Sangmin Han ⋅ Alex Levinshtein ⋅ Michael S Brown
ClusterStyle: Modeling Intra-Style Diversity with Prototypical Clustering for Stylized Motion Generation
Kerui Chen ⋅ Jianrong Zhang ⋅ Ming Li ⋅ Zhonglong Zheng ⋅ Hehe Fan
UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset
Yi Wang ⋅ Fan Wang ⋅ Prabin Gyawali ⋅ Ziyang Xu ⋅ Anna Klimkowska ⋅ Yixiong Jing ⋅ Wanru Yang ⋅ Filip Biljecki ⋅ Christoph Holst ⋅ Benjamin Busam ⋅ Brian Sheil ⋅ Olaf Wysocki
Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis
Zicheng Kong ⋅ Dehua Ma ⋅ Zhenbo Xu ⋅ Anwen Yang ⋅ Yiwei Ru ⋅ Haoran Wang ⋅ Zixuan Zhou ⋅ Fuqing Bie ⋅ Liuyu Xiang ⋅ Huijia Wu ⋅ Jian Zhao ⋅ Zhaofeng He
Diffusion-based dual-view reflection removal
Tianyi Xu ⋅ Zifeng Wang ⋅ Boyang Lyu ⋅ Shuchen Weng ⋅ Boxin Shi
LIIFusion: Coarse-to-fine Framework for Generative MEF via Implicit Neural Representation
Sangmin Han ⋅ Jinho Kim ⋅ Jinwoo Kim ⋅ Dongyoung Kim ⋅ Seon Joo Kim
CAR-MIL: Counterfactual Attention Regularization for Multiple Instance Learning
Imane Chraki ⋅ Pierre Marza ⋅ Stergios Christodoulidis ⋅ Maria Vakalopoulou
FitControler: Toward Fit-Aware Virtual Try-On
Lu Yang ⋅ Yicheng Liu ⋅ Letian Zhou ⋅ Yanan Li ⋅ Xiang Bai ⋅ Hao Lu
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models
Byung-Kwan Lee ⋅ Ryo Hachiuma ⋅ Yong Man Ro ⋅ Yu-Chiang Frank Wang ⋅ Yueh-Hua Wu
Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset
Zhiyan Zhang ⋅ Peipei Song ⋅ Jinpeng Hu ⋅ Jingyang Jia ⋅ Xun Yang ⋅ Xiaojun Chang
What Matters in RL-Based Methods for Object-Goal Navigation? An Empirical Study and A Unified Framework
Hongze Wang ⋅ Boyang Sun ⋅ Jiaxu Xing ⋅ Fan Yang ⋅ Marco Hutter ⋅ Dhruv Shah ⋅ Davide Scaramuzza ⋅ Marc Pollefeys
Fisher-Routed Mixture of Experts for Federated Class-Incremental Learning
Wenhao Yuan ⋅ Chenchen Lin ⋅ Jian Chen ⋅ Jinfeng Xu ⋅ Zewei Liu ⋅ Edith C. H. Ngai
CS-TTA: Preserving Concept Sensitivity in Test-Time Adaptation
Junah Jung ⋅ YeonGyu Han ⋅ Chang Min Park ⋅ Dongheon Lee
ScenarioControl: Vision-language Controllable Vectorized Latent Scenario Generation
Lili Gao ⋅ Yanbo Xu ⋅ William Koch ⋅ Samuele Ruffino ⋅ Luke Rowe ⋅ Behdad Chalaki ⋅ Dmitriy Rivkin ⋅ Julian Ost ⋅ Roger Girgis ⋅ Mario Bijelic ⋅ Felix Heide
DRPO: Disentangling Demographic Bias from Rewards for Fair Diffusion Alignment
YeonGyu Han ⋅ Junah Jung ⋅ Dongheon Lee
Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation
Chang Liu ⋅ Mingwen Shao ⋅ Xiang Lv ⋅ Xinyuan Chen ⋅ lingzhuang meng ⋅ Qiao Zhang ⋅ Zhengyi Gong ⋅ Jinghao Hu
MagnetGS-Mesh: High-Quality Multi-Object Mesh Reconstruction via Adaptive Surface Optimization
Min-Su Park ⋅ Yeonho Han ⋅ Uijoon Jeong ⋅ Jun-Hyeong Park ⋅ Eun-Seok Ryu
ReynoldsFlow: Physics-Inspired Spatiotemporal Flow Representation for Video Understanding
Yu-Hsi Chen ⋅ Ching-Kai Lin ⋅ PingKong Huang ⋅ Chin-Tien Wu
PartCHOI: Part-Aware Guidance for Clothed Human-Object Interaction Generation
Mingwen Shao ⋅ Xinyuan Chen ⋅ Qiao Zhang ⋅ Xiang Lv ⋅ lingzhuang meng ⋅ Qinglin Zhan ⋅ Chang Liu ⋅ Chao Dong
Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
Xin Zhang ⋅ Haochen Wang ⋅ Yikang Zhou ⋅ Zhuochen Wang ⋅ Robby T. Tan ⋅ Xiangtai Li
RASA: Disentangled Spatial-Motional Priors for Cross-Identity Character Animation
Zhen Xiao ⋅ Zhen Shen ⋅ Zhaofan Qiu ⋅ Ting Yao ⋅ Xueliang Liu ⋅ Tao Mei
D3F-IR: Dual-Domain Deterministic Flow Matching for Visible-to-Infrared Translation
Peiyi Zeng ⋅ Diedong Feng ⋅ Zhen Liu ⋅ Zhenming Peng ⋅ Bing Zeng ⋅ Shuaicheng Liu
Training-Free Refinement of Flow Matching with Divergence-based Sampling
Yeonwoo Cha ⋅ Jaehoon Yoo ⋅ Semin Kim ⋅ Yunseo Park ⋅ Jinhyeon Kwon ⋅ Seunghoon Hong
Attribute Token Arithmetic: Disentangled and Continuous Semantic Control for Visual Autoregressive Models
Xindi Yang ⋅ Yicheng Wu ⋅ Cheng Zhang ⋅ Jianfei Cai ⋅ Tien-Tsin Wong
MotionAtlas: A High-Quality Dataset and Benchmark for Dense Motion Captioning
Weisong Liu ⋅ Haochen Wang ⋅ Gaokuan Gaokuan ⋅ Yuhao Wang ⋅ Yikang Zhou ⋅ Zhongwei Ren ⋅ Guangcan Mai ⋅ Anran Wang ⋅ Yanwei Li ⋅ Xiangtai Li ⋅ Zhaoxiang Zhang
SRRA: Stable-Rank-Based Residual Adaptation for Generalizable Deepfake Detection
Huakun Liu ⋅ Wenjie Li ⋅ Changsheng Xu
GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces
Xinyu Geng ⋅ Yanjing Xiao ⋅ Yuyang Zhang ⋅ Hanwen Wang ⋅ Xinyan Liu ⋅ Rui Min ⋅ Tianqing Fang ⋅ Yi Ren Fung
HighlightBench: Benchmarking and Diagnosing Markup-Driven Table Reasoning in Scientific Documents
Lexin Wang ⋅ Shenghua Liu ⋅ Yiwei Wang ⋅ Yujun Cai ⋅ Yuyao Ge ⋅ Jiayu Yao ⋅ Jiafeng Guo ⋅ Xueqi Cheng
Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution
Jingkai Wang ⋅ Yixin Tang ⋅ Jue Gong ⋅ Jiatong Li ⋅ Shu Li ⋅ Libo Liu ⋅ Jianliang Lan ⋅ Yutong Liu ⋅ Yulun Zhang
Robust Trajectory Distillation: Hybrid Reweighting Meets Teacher-Inspired Targets
KaifengChen KaifengChen ⋅ Lechao Cheng ⋅ Jiyang Li ⋅ Shengeng Tang ⋅ FanZhang FanZhang ⋅ Yantao Pan ⋅ Yaxiong Wang ⋅ Tianrui Hui ⋅ Zhun Zhong
Safe Generalization: Mitigating Catastrophic Forgetting in Single-Source Multi-Organ Segmentation via Collaborative Causal Learning
Yucheng Song ⋅ Ruoxi Yu ⋅ Feng Shu ⋅ Cheng Huang ⋅ HaoKang Ding ⋅ Zhifang Liao
NAPA: Natively Multimodal Autoregressive Perception Architecture
Phuc Le Khac Hong ⋅ Yasser Dahou ⋅ Sanath Narayan ⋅ Ankit Singh ⋅ Wamiq Para ⋅ Ngoc Dung Huynh ⋅ Sofian Chaybouti ⋅ Hakim Hacid
Diffusion Model as a Generalized Segmentation Learner
Haoxiao Wang ⋅ Antao Xiang ⋅ Haiyang Sun ⋅ Peilin Sun ⋅ Changhao Pan ⋅ Yifu Chen ⋅ Minjie Hong ⋅ Weijie Wang ⋅ Shuang Chen ⋅ Yue Chen ⋅ ZHOU ZHAO
Scaling Dense Prediction with Latent Decoding
Xiaoyang Wu ⋅ Yixing Lao ⋅ Chengyao Wang ⋅ Senqiao Yang ⋅ Yujia Zhang ⋅ Hengshuang ZHAO
Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
Yiqian Liu ⋅ Iuliia Kotseruba ⋅ John K. Tsotsos
Zero-Shot Image Personalization from Personas
Harini S I ⋅ Somesh Singh ⋅ Yaman K Singla ⋅ David Doermann ⋅ Rajiv Shah
LumiDepth: Stable Monocular Depth in Multi-Illumination Scenes
Anqi Cheng ⋅ Zhiyuan Yang ⋅ Tianjiao Li ⋅ Haiyue Zhu ⋅ Kezhi Mao
Event-LiDAR: 3D Eventification for Efficient Point Cloud Processing
Masatoshi Murakami ⋅ Eisho Tsuji ⋅ Ken Sakurada
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
Qi Li ⋅ Yanzhe Zhao ⋅ Yongxin Zhou ⋅ Yameng Wang ⋅ Yandong Yang ⋅ Yuanjia Zhou ⋅ Jinxiang Liu
IoUCert: Robustness Verification for Anchor-based Object Detectors
Benedikt Brückner ⋅ Alejandro J. Mercado ⋅ Yanghao Zhang ⋅ Panagiotis Kouvaros ⋅ Alessio Lomuscio
YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos
Haoming Chen ⋅ Lichen Yuan ⋅ TianFang Sun ⋅ Jingyu Gong ⋅ Zhizhong Zhang ⋅ Xin Tan ⋅ Yanyun Qu ⋅ Yuan Xie
Grounding Sim-to-Real Generalization in Dexterous Manipulation: An Empirical Study with Vision-Language-Action Models
Ruixing Jin ⋅ ZiCheng Zhu ⋅ Ruixiang Ouyang ⋅ Sheng Xu ⋅ Bo Yue ⋅ Zhizheng Wu ⋅ Guiliang Liu
PIC: Revisiting INR for Image Coding with Fast Encoding and Sub-Millisecond Decoding
Xiang Liu ⋅ Jinxiang Wang ⋅ Bin Chen ⋅ Zimo Liu ⋅ Mingyao Hong ⋅ Jiawei Li ⋅ Yaowei Wang ⋅ Shu-Tao Xia
Robustness Emerges Early in Training Dynamics, but Is Not Preserved
Jiangang Yang ⋅ Wenhui Shi ⋅ Lu Hu ⋅ Jing Xing ⋅ Jian Liu
Do Multimodal LLMs Understand Intraoral Dental Data? Dataset, Platform, and Baselines
Luca Lumetti ⋅ Federico Rizzo ⋅ Francesca Cremonini ⋅ Ettore Candeloro ⋅ Lombardo Luca ⋅ Costantino Grana ⋅ Federico Bolelli
Unsupervised Source-Free Ranking of Biomedical Segmentation Models Under Distribution Shift
Joshua Talks ⋅ Kevin Marchesini ⋅ Luca Lumetti ⋅ Federico Bolelli ⋅ Anna Kreshuk
OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models
Huanlin Gao ⋅ Fang Zhao ⋅ Qiang Hui ⋅ Fuyuan Shi ⋅ Shaoan Zhao ⋅ Yantao Li ⋅ Chao Tan ⋅ Ting Lu ⋅ Yuren You ⋅ Kai Wang ⋅ Shiguo Lian
PhysDrape: Learning Explicit Forces and Collision Constraints for Physically Realistic Garment Draping
Minghai Chen ⋅ Mingyuan Liu ⋅ Ning Ma ⋅ Jianqing LI ⋅ Yuxiang Huan
Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
Qi Song ⋅ Ziyuan Luo ⋅ Haoliang Han ⋅ Renjie Wan
360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents
Kenta Watanabe ⋅ Atsuyuki Miyai ⋅ Mizuki Takenawa ⋅ Kiyoharu Aizawa ⋅ Toshihiko Yamasaki
Agentic Collaborative Cognition for Zero-Shot 3D Understanding
Wenxin Wang ⋅ Bo Zhang ⋅ Feng Chen ⋅ Zixuan Wang ⋅ Wen Li ⋅ Changsheng Li ⋅ Yinjie Lei
Plug-and-Play Attention Linearization for Pretrained Transformers
Kenan Kassab ⋅ Alexey Kashevnik ⋅ Ammar Ali ⋅ Stamatios Lefkimmiatis
GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation
Nicolas von Lützow ⋅ Barbara Roessle ⋅ Katharina Schmid ⋅ Matthias Niessner
MegaFlow: Zero-Shot Large Displacement Optical Flow
Dingxi Zhang ⋅ Fangjinhua Wang ⋅ Marc Pollefeys ⋅ Haofei Xu
CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views
Alexey Gavryushin ⋅ Dingxi Zhang ⋅ Zhao Huang ⋅ Alexandros Delitzas ⋅ Jiaqi Chen ⋅ Ben Ellis ⋅ Cedric Zöllner ⋅ Manthan Patel ⋅ Manuel Kaufmann ⋅ Marc Pollefeys ⋅ Xi Wang
Gaussians on Fire: High-Frequency Reconstruction of Flames
Jakob Nazarenus ⋅ Dominik Michels ⋅ Wojciech Palubicki ⋅ Simin Kou ⋅ Fang-Lue Zhang ⋅ Soren Pirk ⋅ Reinhard Koch
BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure
Zijian Dong ⋅ Yi Lin ⋅ Fang Ji ⋅ Jianxiong Zhou ⋅ Eric Kwun Kei NG ⋅ Juan Zhou
OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence
Jianhui Liu ⋅ Haoze Sun ⋅ Wenbo Li ⋅ Yanbing Zhang ⋅ Rui Yang ⋅ zhiliang zhu ⋅ Yijun Yang ⋅ Shenghe Zheng ⋅ Nan Jiang ⋅ Jiaxiu Jiang ⋅ Haoyang Huang ⋅ Tien-Tsin Wong ⋅ Nan Duan ⋅ Qi Xiaojuan
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Understanding
Yijun Yang ⋅ Shenghe Zheng ⋅ Wenbo Li ⋅ Jianhui Liu ⋅ Haoze Sun ⋅ Yanbing Zhang ⋅ Jiaxiu Jiang ⋅ Lin Song ⋅ Haoyang Huang ⋅ Nan Duan ⋅ Lei Zhu
C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation
Jinlong Wang ⋅ Xun Huang ⋅ Qiming Xia ⋅ Shijia Zhao ⋅ Chenglu Wen
Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding
Yuheng Jiang ⋅ Yiwen Cai ⋅ Zihao Wang ⋅ Yize Wu ⋅ Sicheng Li ⋅ Zhuo Su ⋅ Lan Xu ⋅ Shaohui Jiao
Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-shot Real-World Deployment
Ningyu YAN ⋅ Shuai Wang ⋅ Xing Shen ⋅ Hui Wang ⋅ Hanqing Wang ⋅ Yang Xiang ⋅ Jiangmiao Pang
Sim, Yet Same: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds
Yunsong Zhou ⋅ Hangxu Liu ⋅ Xuekun Jiang ⋅ Xing Shen ⋅ Yuanzhen Zhou ⋅ Hui Wang ⋅ Baole Fang ⋅ Yang Tian ⋅ Mulin Yu ⋅ Qiaojun Yu ⋅ Li Ma ⋅ Hengjie Li ⋅ Hanqing Wang ⋅ Jia Zeng ⋅ Jiangmiao Pang
Stand Up and Move: Benchmarking Interactive Spatial Intelligence in WalkerBench
Zhiqi Ge ⋅ Gang Yang ⋅ Ziyang Pan ⋅ Jingzhe Zhu ⋅ Yuancheng Gu ⋅ Juncheng Li ⋅ Qizhou Wang ⋅ Rui Tang ⋅ Siliang Tang ⋅ Jun Xiao ⋅ Yueting Zhuang
TriNLOS: Triplane Representations for Neural Non-Line-of-Sight Imaging
Bonmu Do ⋅ Ji Hyun Nam
Fair and Faithful: A Diffusion-Enhanced Dataset and Hybrid State-Space Mamba for Face Super-Resolution
Tao Wang ⋅ Peiwen Xia ⋅ Bowen Tang ⋅ Jinwei Chen ⋅ Kaihao Zhang ⋅ Bo Li
REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation
Li Guo ⋅ Anas Tahir ⋅ Z. Jane Wang
SynLF: Zero-Shot Metric Depth from Light Field Cameras via Physics-Grounded Synthesis
Zhexuan Cao ⋅ Yuduo Guo ⋅ Peisheng Ding ⋅ Zhan Shi ⋅ Hui Qiao
Why Feature Magnitude Deceives OOD Detectors: An Angular Separation Perspective
Hanlin Li ⋅ Jing Ma ⋅ Zehang Wei ⋅ Jiamin Yan ⋅ Xiang Xiang
Walking in the Implicit: Interactive World Exploration via Neural Scene Representation
Zhiqi Li ⋅ Chengrui Dong ⋅ Zhenhua Du ⋅ Hangning Zhou ⋅ Cong Qiu ⋅ Hailong Qin ⋅ Mu Yang ⋅ Dongxu Wei ⋅ Peidong Liu
Iterative Refinement of Semantic and Spatial Representations for Open-Vocabulary Camouflaged Object Segmentation
Fangyan Wang ⋅ Ge Jiao ⋅ Guowen Yue
CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion
Pan Wang ⋅ Yihao Hu ⋅ Xiujin Liu
Learning to Recover Task Experts from a Multi-Task Merged Model
Jinwook Jung ⋅ Taegyu Kim ⋅ Kumju Jo ⋅ Sungyong Baik
CORE-V: Chain-Of-thought REasoning for Image Editing with Visual Interaction
Tianyang Yan ⋅ Peisen Zhao ⋅ Guanghao Zheng ⋅ Mingxing Xu ⋅ Zhibo Zhang ⋅ Wenrui Dai ⋅ Junni Zou ⋅ Hongkai Xiong ⋅ Xiaopeng Zhang ⋅ Qi Tian
AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation
Eric Ji ⋅ Qiran Hu ⋅ Wufei Ma ⋅ Sarthak Jain ⋅ Yingying Li ⋅ Minh Do ⋅ Yaoyao Liu
Rapidly Deploying On-Device Eye Tracking by Distilling Visual Foundation Models
Cheng Jiang ⋅ Jogendra Nath Kundu ⋅ David Colmenares ⋅ Fengting Yang ⋅ Joseph Robinson ⋅ Yatong An ⋅ Ali Behrooz
Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding
Junlin Chang ⋅ Longhao Zou ⋅ Rui Li
Under One Sun: Multi-Object Generative Perception of Materials and Illumination
Nobuo Yoshii ⋅ Xinran (Nicole) Han ⋅ Ryo Kawahara ⋅ Todd Zickler ⋅ Ko Nishino
Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer
Bo Wei ⋅ Xianhui Lin ⋅ Yi Dong ⋅ Zhongzhong Li ⋅ Zonghui Li ⋅ Zirui Wang ⋅ Jiachen Yang ⋅ Xing Liu ⋅ Hong Gu ⋅ Xiaoming Li ⋅ Wangmeng Zuo
ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video
Xiaozhong Lyu ⋅ Gen Li ⋅ Zhiyin Qian ⋅ Xucong Zhang ⋅ Marc Pollefeys ⋅ Siyu Tang
WaterGen: Decoupling Scene and Medium in Underwater Image Generation
Jiayi Wu ⋅ Tianfu Wang ⋅ Tianyi Xiong ⋅ Dehao Yuan ⋅ Xiaomin Lin ⋅ Md Jahidul Islam ⋅ Cornelia Fermuller ⋅ Christopher Metzler ⋅ Yiannis Aloimonos
Event-Driven Video Generation
Chika Maduabuchi ⋅ Jindong Wang
SHINE-PPG: Non-Lambertian Intrinsic Decomposition for Illumination-Robust rPPG
Shih-Yu Yang ⋅ Yen-Chun Chou ⋅ Pei-Kai Huang ⋅ Chiou-Ting Hsu
COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models
Ziqi Zhou ⋅ Weize Quan ⋅ Mining Tan ⋅ Zhihan Chen ⋅ Dandan Zheng ⋅ Jingdong Chen ⋅ JUN ZHOU ⋅ Weiming Dong ⋅ Dong-ming Yan
RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution
Yushuai Song ⋅ Weize Quan ⋅ Weining Wang ⋅ Jiahui Sun ⋅ Jing Liu ⋅ Meng Li ⋅ Pengbin Yu ⋅ Zhentao Chen ⋅ Wei Shen ⋅ Lunxi Yuan ⋅ Dong-ming Yan
Continuous Speculative Decoding for Autoregressive Image Generation
Zili Wang ⋅ Zheng Zhang ⋅ Kun Ding ⋅ Qi Yang ⋅ Fei Li ⋅ SHIMING XIANG
Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding
Lin Chen ⋅ Bolin Ni ⋅ Qi Yang ⋅ Zili Wang ⋅ Kun Ding ⋅ Ying Wang ⋅ Houwen Peng ⋅ SHIMING XIANG
DRS-VPT: Directly Re-localizing in Scenes using a Vision and Point Transformer
Lanke Fu ⋅ Maurice Fallon
SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation
Kyuwon Kim ⋅ Sunjae Yoon ⋅ Chang Yoo
RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation
Ding Yuchuan ⋅ Linfei Li ⋅ Lin Zhang ⋅ Ying Shen
InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image
Gwanhyeong Koo ⋅ Hyunsu Kim ⋅ Youngji Kim ⋅ Taejae Lee ⋅ Siwoo Lim ⋅ Sunjae Yoon ⋅ Suyong Yeon ⋅ Chang Yoo
Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection
Yewon Han ⋅ Yumin Seol ⋅ Minsoo Jo ⋅ EunGyung Kong ⋅ Taesup Kim
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
Xiangyu Sun ⋅ Shijie Wang ⋅ Fengyi Zhang ⋅ Lin Liu ⋅ Caiyan Jia ⋅ Ziying Song ⋅ Zi Helen Huang ⋅ Yadan Luo
Rank-Aware Hyperbolic Alignment for Vision–Language Dataset Distillation
Jongoh Jeong ⋅ Sun-Kyung Lee ⋅ KUK-JIN YOON
Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
Futa Waseda ⋅ Shojiro Yamabe ⋅ Daiki Shiono ⋅ Kento Sasaki ⋅ Tsubasa Takahashi
RECO: Region-Aware Compensation for Extrinsic Perturbations in Roadside 3D Detection
Junsheng Du ⋅ Yuhuan Lu ⋅ Zhaocheng He
FD²: A Dedicated Framework for Fine-Grained Dataset Distillation
Hongxu Ma ⋅ Guang Li ⋅ Shijie Wang ⋅ DONGZHAN ZHOU ⋅ Baoli Sun ⋅ Takahiro Ogawa ⋅ Miki Haseyama ⋅ Zhihui Wang
RefracGS: Novel View Synthesis Through Refractive Water Surfaces with 3D Gaussian Ray Tracing
Yiming Shao ⋅ Qiyu Dai ⋅ Chong Gao ⋅ Guanbin Li ⋅ Yequan Wang ⋅ He Sun ⋅ Qiong Zeng ⋅ Baoquan Chen ⋅ Wenzheng Chen
LibraGen: Playing a Balance Game in Subject-Driven Video Generation
Jiahao Zhu ⋅ Shanshan Lao ⋅ Lijie Liu ⋅ Gen Li ⋅ Tianhao Qi ⋅ hanwei hanwei ⋅ Bingchuan Li ⋅ FangfangLiu FangfangLiu ⋅ Zhuowei Chen ⋅ Tianxiang Ma ⋅ Qian HE ⋅ Yi Zhou ⋅ Xiaohua Xie
SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation
Yuan Li ⋅ Congyi Zhang ⋅ Xifeng Gao ⋅ Xiaohu Guo
LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory
Junyi Zhang ⋅ Charles Herrmann ⋅ Junhwa Hur ⋅ Chen Sun ⋅ Ming-Hsuan Yang ⋅ Forrester Cole ⋅ Trevor Darrell ⋅ Deqing Sun
UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras
Yipeng Zhu ⋅ Huajian Huang ⋅ Tristan Braud ⋅ Sai Kit Yeung
LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
Bowen Yuan ⋅ Zijian Wang ⋅ Yadan Luo ⋅ Shijie Wang ⋅ Zi Helen Huang
Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction
Xilai Li ⋅ Xiaosong Li ⋅ Haishu Tan ⋅ Tao Ye ⋅ Huafeng Li ⋅ Hongbin Wang
OmniRen: Neural Rendering wih Heterogeneous Scene Primitives
Chong Zeng ⋅ Yue Dong ⋅ Pieter Peers ⋅ lvmin zhang ⋅ Maneesh Agrawala
MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction
Xilai Li ⋅ Weijun Jiang ⋅ Xiaosong Li ⋅ Yang Liu ⋅ Hongbin Wang ⋅ Tao Ye ⋅ Huafeng Li ⋅ Haishu Tan
ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance
Hyojin Park ⋅ Yi Li ⋅ Janghoon Cho ⋅ Sungha Choi ⋅ Jungsoo Lee ⋅ TAOTAO JING ⋅ shuai zhang ⋅ Munawar Hayat ⋅ Dashan Gao ⋅ Ning Bi ⋅ Fatih Porikli
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning
Tianyu Xu ⋅ Jiawei Chen ⋅ Jiazhao Zhang ⋅ Wenyao Zhang ⋅ Zekun Qi ⋅ Minghan Li ⋅ Jiahang Liu ⋅ Lu Yue ⋅ Zhizheng Zhang ⋅ HE WANG
Learning to Suppress SPAD-based LiDAR Flare
Xuanya Zhu ⋅ Linghao Shen
S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight
Haodong Yan ⋅ Zhide Zhong ⋅ Jiaguan Zhu ⋅ Junjie He ⋅ Weilin Yuan ⋅ Wenxuan Song ⋅ Xin Gong ⋅ Yingjie CAI ⋅ Guanyi Zhao ⋅ Xu Yan ⋅ Liu Bingbing ⋅ Yingcong Chen ⋅ Haoang Li
Beyond Artifacts: Real-Centric Envelope Modeling for Reliable AI-Generated Image Detection
Ruiqi Liu ⋅ Yi Han ⋅ Zhengbo Zhang ⋅ Liwei Yao ⋅ Zhiyuan Yan ⋅ Jialiang Shen ⋅ ZhiJin Chen ⋅ Manni Cui ⋅ Boyi Sun ⋅ Lubin Weng ⋅ Jing Dong ⋅ Yan Wang ⋅ Shu Wu
QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding
Jun Peng ⋅ Baiyang Song ⋅ Jie Li ⋅ Hui Li ⋅ Yiyi Zhou ⋅ Rongrong Ji ⋅ Yonghong Tian
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
Yuan Xiong ⋅ Miao Ziqi ⋅ Lijun Li ⋅ Chen Qian ⋅ Jie Li ⋅ Jing Shao
How Far Are Video Models from True Multimodal Reasoning?
Xiaotian Zhang ⋅ Jianhui Wei ⋅ Yuan Wang ⋅ Jie Tan ⋅ Yichen Li ⋅ Yan Zhang ⋅ Ziyi Chen ⋅ Daoan Zhang ⋅ DEZHI YU ⋅ Wei Xu ⋅ Songtao Jiang ⋅ Zuozhu Liu
CAST3D: Customizing Arbitrary 2D Assets into 3D World
Yukai Sun ⋅ Hao Qin ⋅ Ming Kong ⋅ Luyuan Chen ⋅ Zhijie Xu ⋅ Jinjian Zhang ⋅ Jie Liu ⋅ Feng Zhang ⋅ Qiang Zhu
DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data
Bartosz Stachowiak ⋅ Dariusz Brzezinski
Spectral Gradient Orthogonalization Improves Differentially Private Training at Scale
Sabari Shanmugam ⋅ Nick Barnes ⋅ Kerry Taylor
ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling
Daowen Li ⋅ Ruixiao Dong ⋅ Ying Chen ⋅ Kai Li ⋅ Ding Ding ⋅ Li Li
ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling
Konstantinos Georgiou ⋅ Maofeng Tang ⋅ Hairong Qi
SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for RGB+Thermal 3D Reconstruction
Vsevolod Skorokhodov ⋅ Chenghao Xu ⋅ Shuo Sun ⋅ Olga Fink ⋅ Malcolm Mielle
PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation
Peng Yun ⋅ Shouwang Huang ⋅ Hao Li ⋅ Jinxi Li ⋅ Jianan Wang ⋅ Bo Yang
SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception–Memory Integration in Embodied Environments
Chih-Ting Liao ⋅ Xi Xiao ⋅ Chunlei Meng ⋅ Zhangquan Chen ⋅ Yitong Qiao ⋅ Weilin Zhou ⋅ Tianyang Wang ⋅ Xu Zheng ⋅ Xin Cao
SupIR-GS: Thermal Infrared Super-Resolution Novel View Synthesis with Imaging-Calibrated 3D Gaussian Splatting
Jin Liu ⋅ Haodong Li ⋅ Jiagang Chen ⋅ Dabin leng ⋅ Jiguang Li ⋅ Zhao Huang ⋅ Xiaoshuai Zhang ⋅ Qi Xu ⋅ Zhiwen Zheng ⋅ Xingru Huang
Physically Grounded Dual-Opacity Gaussian Splatting for Joint RGB-TIR Reconstruction
Jin Liu ⋅ Dabin leng ⋅ Jiagang Chen ⋅ Haodong Li ⋅ Jiguang Li ⋅ Zhao Huang ⋅ Xiaoshuai Zhang ⋅ Zhiwen Zheng ⋅ Xingru Huang ⋅ Qi Xu
CoReLIN: Constraint-based Reasoning for Zero-shot Lifelong Interactive Navigation
Apoorva Vashisth ⋅ Manav Kulshrestha ⋅ Pranav Bakshi ⋅ Damon Conover ⋅ Guillaume Sartoretti ⋅ Aniket Bera
Instance Segmentation as Tracking: A New Paradigm for Multi-Small-Object Tracking with Event Cameras
Nuo Chen ⋅ Shiman He ⋅ Boyang Li ⋅ Yingqian Wang ⋅ Chao Xiao ⋅ QianYin QianYin ⋅ Ruojing Li ⋅ Yihang Luo ⋅ Wei An ⋅ Miao Li
FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs
Wenlong Cheng ⋅ Yuan Gan ⋅ Yunqiu Xu ⋅ Jiaxu Miao
FUSE: A Flow-based Mapping Between Shapes
Lorenzo Olearo ⋅ Giulio Viganò ⋅ Daniele Baieri ⋅ Filippo Maggioli ⋅ Simone Melzi
OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction
Zeyu CAI ⋅ Yuliang Xiu ⋅ renke wang ⋅ Zhijing Shao ⋅ Xiaoben Li ⋅ YU Siyuan ⋅ Chao Xu ⋅ Yang Liu ⋅ Baigui Sun ⋅ Jian Yang ⋅ zhenyu zhang
EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis
Huaqiu Li ⋅ Jiahao Wang ⋅ Sijia Cai ⋅ Hualian Sheng ⋅ Bing Deng ⋅ Jieping Ye ⋅ Wenhan Luo
MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment
Elena Camuffo ⋅ Francesco Barbato ⋅ Mete Ozay ⋅ Simone Milani ⋅ Umberto Michieli
Reinforcing Video Reasoning with Focused Thinking
Jisheng Dang ⋅ Jingze Wu ⋅ Teng Wang ⋅ Xuanhui Lin ⋅ Nannan Zhu ⋅ Hongbo Chen ⋅ WEISHI ZHENG ⋅ Meng Wang ⋅ Tat-Seng Chua
Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling
Meimingwei Li ⋅ Stefan Andreas Baumann ⋅ Felix Krause ⋅ Bjorn Ommer
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
Yibin Yan ⋅ Jilan Xu ⋅ Shangzhe Di ⋅ Haoning Wu ⋅ Weidi Xie
BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming
Jiaxiang Liu ⋅ Tianxiang Hu ⋅ Juwei Guan ⋅ Yujie Wu ⋅ Yusong Wang ⋅ Yao Mu ⋅ Zuozhu Liu ⋅ Mingkun Xu
Continuous Heart Rate Variability Estimation from Egocentric Systems for Skill Assessment
Berken Utku Demirel ⋅ Christian Holz
ROSE: Real-Time Open-World Scene Understanding from Monocular Video via Compact Multimodal 4D Scene Graphs
Ziyue Qiu ⋅ Yong Wang ⋅ Jin Pan
Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback
Guotao Liang ⋅ Zhangcheng Wang ⋅ Juncheng Hu ⋅ Haitao Zhou ⋅ Ziteng Xue ⋅ Jing Zhang ⋅ Dong Xu ⋅ Qian Yu
TiltDiff: Tilted Weight-Space Diffusion for Neural Network Generation
En-Ni Chuang ⋅ Hanjuan Huang ⋅ Hao-Jia Song ⋅ Hsing-Kuo Kenneth Pao ⋅ Tyng-Luh Liu
PrimitiveUDF: Primitive-Based Unsigned Distance Fields for Surface Reconstruction from Point Clouds
Xin Deng ⋅ Bo Yang ⋅ Yifei Shi ⋅ Bing Wang
CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming
ruixun liu ⋅ Lingyu Zhang ⋅ Lanxuan Xue ⋅ Kaiyu Li ⋅ Bowen Fu ⋅ Xiangyong Cao
ATOMIC: A Domain-Specific Vision-Language Model for Transmission Electron Microscopy
Chong-ren Tu ⋅ HUNG-WEI HSUEH ⋅ Shu-han Hsu
Human-Level Accuracy, Non-Human Strategies: Revealing Model-Human Divergence in Video Physical Reasoning
Fanhong Li ⋅ Shurui Zheng ⋅ Yinzi Yinzi ⋅ Junbo Cui ⋅ Lei Ji ⋅ Jia Liu
ModuSeg: Decoupling Object Discovery and Semantic Retrieval for Training-Free Weakly Supervised Segmentation
Qingze He ⋅ Fagui Liu ⋅ Dengke Zhang ⋅ Qingmao Wei ⋅ Quan Tang
Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning
Hanqing Wang ⋅ Zhenhao Zhang ⋅ Kaiyang Ji ⋅ Mingyu Liu ⋅ Wenti Yin ⋅ yuchao chen ⋅ Zhirui Liu ⋅ Xiangyu Zeng ⋅ Tianxiang Gui ⋅ Hangxing Zhang ⋅ Jiahao Yuan ⋅ Zhiqing Cui ⋅ Jiaxin Liu ⋅ Zhiyuan Ma ⋅ Hui Xiong
EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
Minjoon Jung ⋅ Junbin Xiao ⋅ Junghyun Kim ⋅ Byoung-Tak Zhang ⋅ Angela Yao
Motion-aware Sparse Pipeline for Lightweight Object Tracking
Qingmao Wei ⋅ Fagui Liu ⋅ Dengke Zhang ⋅ Qingze He ⋅ Quan Tang
Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval
Kyeongmo Chae ⋅ Jihoon Lee ⋅ Sangtae Ahn
M2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
Chunpu Xu ⋅ Zhixuan Liang ⋅ Yuhao Zhang ⋅ Chi-Min Chan ⋅ Jiashuo Wang ⋅ Yang Xiao ⋅ Mengkang Hu ⋅ Xiaokang Yang ⋅ Yao Mu
Per‑Object IoU Forecasting for Deadline‑Aware Real‑Time Embedded Detection Control
Erfan Foorginejad ⋅ Akshar Chavan ⋅ Marco Brocanelli
GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
Yijia Weng ⋅ Zhicheng Wang ⋅ Songyou Peng ⋅ Saining Xie ⋅ Howard Zhou ⋅ Leonidas Guibas
Sparse auto-regressive modeling for scene generation from multi-view images
Thomas Lucas ⋅ Maxime Pietrantoni ⋅ Wonjune Cho ⋅ Bardienus Duisterhof ⋅ Philippe Weinzaepfel ⋅ Vincent Leroy ⋅ Jerome Revaud
Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition
Prajwal Gatti ⋅ Simon Jenni ⋅ Fabian Caba ⋅ Dima Damen
Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-View Videos
Yingdong Hu ⋅ YISHENG HE ⋅ Jinnan Chen ⋅ Weihao Yuan ⋅ Kejie Qiu ⋅ Zehong Lin ⋅ Siyu Zhu ⋅ Zilong Dong ⋅ Steven Hoi ⋅ Jun Zhang
StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics
Bingliang Li ⋅ Zhenhong Sun ⋅ Jiaming Bian ⋅ Yuehao Wu ⋅ Yifu Wang ⋅ HONGDONG LI ⋅ Yatao Bian ⋅ Huadong Mo ⋅ Daoyi Dong
HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching
Zerui Chen ⋅ Rolandos Alexandros Potamias ⋅ Shizhe Chen ⋅ Jiankang Deng ⋅ Cordelia Schmid ⋅ Stefanos Zafeiriou
Dual-Prior Guided Null-Space Learning with Mixture-of-Splines for Arbitrary Medical Slice Super-Resolution
Haofei Song ⋅ Siyuan Xu ⋅ Xintian Mao ⋅ ShaoJie Guo ⋅ Qingli Li ⋅ Yan Wang
GuideMe: Benchmarking Multi-Domain Task Guidance and Intervention in Streaming Video
FANG LIU ⋅ Jinpeng Chen ⋅ Ke Xu ⋅ Yuhao LIU ⋅ Huankang Guan ⋅ Xudong LU ⋅ Yang Bo ⋅ Gerhard P. Hancke ⋅ Rui Liu ⋅ Rynson Lau
Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs
Jouwon Song ⋅ Woohyeong Kim ⋅ Kyeongbo Kong
Granular Semantic Cognition for Visible-Infrared Person Re-Identification
Haifeng Yang ⋅ Jinjia Peng ⋅ Huibing Wang
Fast and Accurate Image Restoration with Rank Enhanced Linear Attention
Yuang Ai
Wat3R: Underwater 3D Geometry Learning without Underwater Annotations
Jiangwei Ren ⋅ Xingyu Jiang ⋅ Zijie Song ⋅ Wei Xu ⋅ Hongkai Lin ⋅ Dingkang Liang ⋅ Xiang Bai
ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving
Dingyi Yao ⋅ Xinqi Zhang ⋅ Lihui Peng ⋅ Jianming HU ⋅ Danya Yao ⋅ Yi ZHANG
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
Yikai Zheng ⋅ Xin Ding ⋅ Yifan Yang ⋅ Shiqi Jiang ⋅ Hao Wu ⋅ Qianxi Zhang ⋅ Weijun Wang ⋅ Ting Cao ⋅ Yunxin Liu
Integrated Forward–Inverse Network for Reconstruction for Lensless Image Reconstruction
Donggeon Bae ⋅ Jaewoo Jung ⋅ Yong Guk Kang ⋅ Kyung Chul Lee ⋅ Taeyoung Kim ⋅ Jongho Kim ⋅ Sangjun Byun ⋅ Joonsik Park ⋅ Seung Ah Lee
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
Yulin Luo ⋅ Chun-Kai Fan ⋅ Menghang Dong ⋅ Jiayu Shi ⋅ Xiangju Mi ⋅ Mengdi Zhao ⋅ Bo-Wen Zhang ⋅ Cheng Chi ⋅ Jiaming Liu ⋅ Gaole Dai ⋅ Rongyu Zhang ⋅ Ruichuan An ⋅ Kun Wu ⋅ Zhengping Che ⋅ shaoxuan Xie ⋅ Guocai Yao ⋅ Zhongxia Zhao ⋅ Pengwei Wang ⋅ Guang Liu ⋅ Zhongyuan Wang ⋅ Tiejun Huang ⋅ Shanghang Zhang
RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation
Yue Chang ⋅ Rufeng Chen ⋅ Zhaofan ZHANG ⋅ Yi Chen ⋅ Yifan Tian ⋅ Sihong Xie
TIIF-Bench: How Does Your T2I Model Follow Your Instructions?
Xinyu Wei ⋅ Jinrui Zhang ⋅ Zeqing Wang ⋅ Hongyang Wei ⋅ Zhen Guo ⋅ Bairui Li ⋅ Yabin Zhang
Rethinking Detection Calibration: A Coordinate Perspective
Juyong Lee ⋅ Seungjin Jung ⋅ Jungmin Lee ⋅ Sunju Lee ⋅ Jongwon Choi
InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars
Quanyue Song ⋅ Yishan He ⋅ Guo Zhi ⋅ yanfei zhang ⋅ Shihao Cheng ⋅ Zhixiang He ⋅ Chi Zhang ⋅ Caigui Jiang ⋅ Xuelong Li
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
Shihao Cheng ⋅ Jiaxu Zhang ⋅ Quanyue Song ⋅ Shansong Liu ⋅ Guo Zhi ⋅ Xiao-Lei Zhang ⋅ Chi Zhang ⋅ Xuelong Li ⋅ Zhigang Tu
Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
Lucy Lin ⋅ Ayush Jain ⋅ Yifan Liu ⋅ Katerina Fragkiadaki
Contrastive-Guided Self-Supervised Latent Visual Reasoning for Hallucination Mitigation
Aoxue Dai ⋅ Ningning Wang
Self-supervised Garment Dynamics with Persistent Wrinkles
Xiaoyuan Yang ⋅ Deshan Gong ⋅ Taku Komura ⋅ He Wang
LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection
Johannes Meier ⋅ Jonathan Michel ⋅ Oussema Dhaouadi ⋅ Yung-Hsu Yang ⋅ Christoph Reich ⋅ Zuria Bauer ⋅ Stefan Roth ⋅ Marc Pollefeys ⋅ Jacques Kaiser ⋅ Daniel Cremers
Do Vision Language Models Recognize Visual Ambiguity?
Huy Ta ⋅ Trang Nguyen ⋅ Townim Chowdhury ⋅ ANKIT YADAV ⋅ Minh-Son To ⋅ Zhibin Liao ⋅ Johan Verjans ⋅ Vu Phan
Every Dog Has Its Day, Probably: A Balanced Synthetic Benchmark and Probabilistic Modeling for 3D Dog Pose Estimation
Joo Young Choi ⋅ Wonkwang Lee ⋅ Juhyeong Seon ⋅ Gunhee Kim
ReDesign: Recovering Editable Design Structures from Raster Images via Agentic Decomposition
Jooyeol Yun ⋅ Jintae Park ⋅ Hyesu Lim ⋅ Junha Hyung ⋅ Hyungjin Chung ⋅ Choo Jaegul
MVGS: Multi-view Regulated Gaussian Splatting for Novel View Synthesis
Xiaobiao Du ⋅ Yida Wang ⋅ Xin Yu
Steerable Vision Transformers
Jona Ruthardt ⋅ Manu Gaur ⋅ Deva Ramanan ⋅ Makarand Tapaswi ⋅ Yuki Asano
Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning
Kazi Sajeed Mehrab ⋅ Hani Alomari ⋅ Najibul Sarker ⋅ Zaber Abdul Hakim ⋅ Chia-Wei Tang ⋅ Anuj Karpatne ⋅ Chris Thomas
GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models
Zekai Gu ⋅ Shuoxuan Feng ⋅ Yansong Wang ⋅ Hanzhuo Huang ⋅ Zhongshuo Du ⋅ Chengfeng Zhao ⋅ Chengwei Ren ⋅ Peng Wang ⋅ Yuan Liu
Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?
Zhaoyang Wei ⋅ Zipeng Wang ⋅ Yushe Cao ⋅ Chenhui Qiang ⋅ Shuaibing Cheng ⋅ Xuesong Yang ⋅ Sen Nie ⋅ Bowen Jiang ⋅ Wenchao Ding ⋅ Yanchao Hao ⋅ Zheng Wei ⋅ Xuehui Yu ⋅ Zhenjun Han
StreetForward: Perceiving Dynamic Street with Feedforward Causal Dynamics
Zhongrui Yu ⋅ Zhao Wang ⋅ Yida Wang ⋅ Xueyang Zhang ⋅ Yifei Zhan ⋅ Kun Zhan
Mechanistic interventions for explainable digital pathology uncovers adversarial vulnerabilities
Arijit Patra ⋅ Samiran Dey ⋅ Ajitha Rajan ⋅ Greg Slabaugh ⋅ Tapabrata Chakraborti
Holo360D: A Large-Scale Real-World Dataset with Continuous Trajectories for Advancing Panoramic 3D Reconstruction and Beyond
Jing OU ⋅ Zidong Cao ⋅ Yinrui Ren ⋅ Zhuoxiao Li ⋅ Jinjing Zhu ⋅ Tongyan Hua ⋅ Shuai Zhang ⋅ Hui Xiong ⋅ Wufan Zhao
LEAP-VLA: Latent-Enhanced Action Prototyping via Continuous Residual Latent Spaces for Vision-Language-Action Models
Bo-Yun Yu ⋅ Jun Hsieh ⋅ KUAN-CHUAN PENG
PASDiff: Physics-Aware Semantic Guidance for Joint Real-world Low-Light Face Enhancement and Restoration
Yilin Ni ⋅ Wenjie Li ⋅ Zhengxue Wang ⋅ Juncheng Li ⋅ Guangwei Gao ⋅ Jian Yang
EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation
Yinrui Ren ⋅ Jinjing Zhu ⋅ Kanghao Chen ⋅ Zhuoxiao Li ⋅ Jing OU ⋅ Zidong Cao ⋅ Tongyan Hua ⋅ Peilun Shi ⋅ Yingchun Fu ⋅ Wufan Zhao ⋅ Hui Xiong
PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation
Yuhang Wu ⋅ Shuxiang Zhang ⋅ WEE CHING ⋅ Chi Zhang ⋅ Miao Liu
SkyLume: A Large-Scale Multi-Illumination Aerial Benchmark for Urban Scene Reconstruction and Beyond
Zhuoxiao Li ⋅ Wenzong Ma ⋅ Taoyu Wu ⋅ Jinjing Zhu ⋅ Shuai Zhang ⋅ Jing OU ⋅ Tongyan Hua ⋅ Yinrui Ren ⋅ Rongjun Qin ⋅ Hui Xiong ⋅ Wufan Zhao
CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels
Jirong Li ⋅ Satoshi Ikehata ⋅ Shuhei Kurita ⋅ Ikuro Sato
Retrieving and Refining Winning Noise Tickets for Diffusion-Based Motion Generation
Sakuya Ota ⋅ Qing Yu ⋅ Kent Fujiwara ⋅ Satoshi Ikehata ⋅ Ikuro Sato
Improved Immiscible Diffusion: Accelerating Diffusion Training by Reducing Miscibility
Yiheng Li ⋅ Feng Liang ⋅ Dan Kondratyuk ⋅ Masayoshi TOMIZUKA ⋅ Kurt Keutzer ⋅ Chenfeng Xu
SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning
ChanYeong Hwang ⋅ Miso Choi ⋅ Sunghyun On ⋅ Jinkyu Kim ⋅ Jungbeom Lee
IP-SAM: Rethinking Prompt-Conditioned Segmentation for Prompt-Absent Deployment
Huiyao Zhang ⋅ Jin Bai ⋅ Rui Guo ⋅ Jianwen Tan ⋅ Hongfei Wang ⋅ Ye Li
SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing
Xuanyi Zhou ⋅ Qiuyang Mang ⋅ Shuo Yang ⋅ Haocheng Xi ⋅ Jintao Zhang ⋅ Huanzhi Mao ⋅ Joseph E Gonzalez ⋅ Kurt Keutzer ⋅ Ion Stoica ⋅ Alvin Cheung
Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
FANGFU LIU ⋅ Diankun Wu ⋅ Jiawei Chi ⋅ Yimo Cai ⋅ Yi-Hsin Hung ⋅ Xumin Yu ⋅ Hao Li ⋅ Han Hu ⋅ Yongming Rao ⋅ Yueqi Duan
Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
Haomin Wang ⋅ Qi Wei ⋅ Qianli Ma ⋅ Shengyuan Ding ⋅ Jinhui Yin ⋅ Kai Chen ⋅ hongjie Zhang
PhysAlign: Learning Physical Priors for Dynamical Event-Driven Video Generation via Representation Alignment
Mengxian Li ⋅ Zhan Wang ⋅ Fan Qi ⋅ Changsheng Xu
Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis
YUCHENG XING XING ⋅ Ling Huang ⋅ Pei Liu ⋅ Jingying Ma ⋅ Jiaxing Xu ⋅ Kai He ⋅ Mengling Feng
Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
Jiho Choi ⋅ Seonho Lee ⋅ Seojeong Park ⋅ Hyunjung Shim
FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility
Yihalem Yimolal Tiruneh ⋅ Muhammad Salman Ali ⋅ Uyoung Jeong ⋅ Muneeb Khan ⋅ MD Sayem ⋅ ALLANUR BAYRAMGELDIYEV ⋅ Binod Bhattarai ⋅ Seungryul Baek
Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation
Shengqi Xu ⋅ Yang Liu ⋅ Guojin Zhong ⋅ Fanjie Wang ⋅ Hu Luo ⋅ Hanyu Zhou ⋅ WeiYao Zhang ⋅ Ziyi Ye ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
StreamSpatial: A Benchmark and Framework for Streaming 3D Visual-Spatial Reasoning
Junlin Xie ⋅ Keyang Zhong ⋅ Quanlong Zheng ⋅ Ruifei Zhang ⋅ Kuo Wang ⋅ Yanhao Zhang ⋅ Haonan Lu ⋅ Xiang Wan ⋅ Guanbin Li
Probe, Anchor, and Amend: Active Test-Time Adaptation of Vision-Language Models
Jiaqi Lin ⋅ Chaoqi Chen ⋅ Xiasi Wang ⋅ Mingfu Yan ⋅ Jiancheng Huang ⋅ Jianzhuang Liu ⋅ Wenming Yang ⋅ Qingmin Liao
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
Ruiying Li ⋅ Yunlang Zhou ⋅ Yuyao Zhu ⋅ Kylin Chen ⋅ Sukai Wang ⋅ Kongtao Hu ⋅ Minhui Yu ⋅ Bowen Jiang ⋅ Jiayao Ma ⋅ Zhan Su ⋅ Yongjian Shen ⋅ Yang Yang ⋅ Guanghui Ren ⋅ Maoqing Yao ⋅ Wenhao Wang ⋅ Yao Mu
Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation
Qiang Hu ⋅ Yuxuan Luo ⋅ Yingjie Guo ⋅ Hao Wang ⋅ Qimei Wang ⋅ Qiang Li ⋅ Zhiwei Wang
FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation
Kaixing Yang ⋅ Xulong Tang ⋅ Ziqiao Peng ⋅ Xiangyue Zhang ⋅ Chubin Chen ⋅ xukun zhou ⋅ Puwei Wang ⋅ Hongyan Liu ⋅ Jun He
Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models
Changlin Li ⋅ Jiawei Zhang ⋅ Zeyi Shi ⋅ Zhihui Li ⋅ Xiaojun Chang
Task-driven Processing with Coarse-to-Fine Glimpse-based Active Perception
Oleh Kolner ⋅ Thomas Ortner ⋅ Stanislaw Wozniak ⋅ Angeliki Pantazi
SkySplat-OV: Generalizable Language Gaussian Splatting for Open-Vocabulary Scene Understanding from Sparse Satellite Views
Xuejun Huang ⋅ Yi Wan ⋅ Lei Yu ⋅ Xinyi Liu ⋅ Zhi Zheng ⋅ Bin Zhang ⋅ Yingying Pei ⋅ Yi Liu ⋅ Changjun Zhu ⋅ Yi Liu ⋅ Xiangyuan Cai ⋅ Hongwei Hu ⋅ Xin Zhang ⋅ Yongjun Zhang
Deep Noise Label Learning via Effective Rank Reduction
Changyi Ma ⋅ Zihan Fang ⋅ Lihua Zhou ⋅ Tao Li ⋅ Wenyu Liu ⋅ Runsheng Yu ⋅ Xuan Song
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
Qiyao Xue ⋅ Haoming Wang ⋅ Weichen Liu ⋅ Shiqi Wang ⋅ Yuyang Wu ⋅ Wei Gao
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Yubo Huang ⋅ Hailong Guo ⋅ Fangtai Wu ⋅ Weiqiang Wang ⋅ Shijie Huang ⋅ Qijun Gan ⋅ Shifeng Zhang ⋅ Lin Liu ⋅ Sirui Zhao ⋅ Enhong Chen ⋅ Jiaming Liu ⋅ Steven Hoi
Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation
Baiqin Wang ⋅ Sen Chen ⋅ Jiankuo Zhao ⋅ Xiangyu Liu ⋅ Zhen Lei ⋅ Xiangyu Zhu
CollectionLoRA: Collecting 50 Effects in 1 LoRA for Deployment
Fangtai Wu ⋅ Hailong Guo ⋅ Shijie Huang ⋅ Jiayi Song ⋅ Yubo Huang ⋅ Mushui Liu ⋅ Zhao Wang ⋅ Yunlong Yu ⋅ Jiaming Liu ⋅ Ruihua Huang
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
Lu Wang ⋅ Zhuoran Jin ⋅ Yupu Hao ⋅ Yubo Chen ⋅ Kang Liu ⋅ Yulong Ao ⋅ Jun Zhao
Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning
Yinan ZHOU ⋅ Haokun Lin ⋅ Yichen Wu ⋅ Yuxin Chen ⋅ Teng Wang ⋅ Caifeng Shan ⋅ Zhenan Sun ⋅ Chen Ma ⋅ Li Zhu ⋅ Ying Shan
Unified and Efficient Point-Line Local Features
François Costa ⋅ Raphael Kreft ⋅ Felix Möller ⋅ Hardik Shah ⋅ Ramanathan Rajaraman ⋅ Eckhard Goedeke ⋅ Shaohui Liu ⋅ Rémi Pautrat ⋅ Marc Pollefeys
DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving
Ziyi Song ⋅ Chen Xia ⋅ Hang Yu ⋅ Sheng Zhou ⋅ Zhisheng Niu
M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection
Chao Wang ⋅ Wei Lu ⋅ Xiang Li ⋅ Jian Yang ⋅ Lei Luo
Gaussian Volumetric Representation for Efficient Shear–Warp Visualization
Mayuri Mathur ⋅ Ojaswa Sharma
Reconstruction by Generation: 3D Multi-Object Scene Reconstruction from Sparse Observations
Andrii Zadaianchuk ⋅ Leonardo Barcellona ⋅ Lennard Schuenemann ⋅ Christian Gumbsch ⋅ Zehao Wang ⋅ Muhammad Zubair Irshad ⋅ Fabien Despinoy ⋅ Rahaf Aljundi ⋅ Efstratios Gavves ⋅ Sergey Zakharov
Infinite Gaze Generation for Videos with Autoregressive Diffusion
JENNA KANG ⋅ Colin Groth ⋅ Tong Wu ⋅ Finley Torrens ⋅ Patsorn Sangkloy ⋅ Gordon Wetzstein ⋅ Qi Sun
BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension
Abu Tyeb Azad ⋅ Ishita Apan ⋅ Fahim Ahmed ⋅ Sumaiya Katha ⋅ Ezharuddin Jubaer ⋅ Armun Alam ⋅ Pranjal Nandi ⋅ Amin Ali ⋅ Aman Chadha ⋅ Md Mofijul Islam ⋅ A K M Mahbubur Rahman
VC-VAE: Leveraging Video Codecs for Training-Efficient and High-Fidelity Video VAE
Xinxu Ge ⋅ Shang Chai ⋅ Litong Gong ⋅ Zitong Yu ⋅ Xin Liu ⋅ Tiezheng Ge
RobustRDP: Advancing Reaction Diagram Parsing via Synthetic-to-Real Data Scaling and Robustness-Oriented Training
Jianting Tang ⋅ zezhong wu ⋅ Linli Xu
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
Wanjun Du ⋅ Zifeng Yuan ⋅ Tingting Chen ⋅ Fucai Ke ⋅ Beibei Lin ⋅ Shunli Zhang
Unifying CNNs and ViTs for Learning-Efficient and Scalable Variational AutoEncoder
Zhiying Lu ⋅ Shang Chai ⋅ Chuanbin Liu ⋅ Litong Gong ⋅ Pandeng Li ⋅ Tiezheng Ge ⋅ Hongtao Xie
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
Xiaokun Sun ⋅ Yubo Wang ⋅ Haoyu Cao ⋅ Linli Xu
HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection
Jiyong Boo ⋅ ByeongIn Joung ⋅ Hyemin Yang ⋅ KUK-JIN YOON
VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-Simulation
Hoonhee Cho ⋅ Jae-young Kang ⋅ Giwon Lee ⋅ Hyemin Yang ⋅ Heejun Park ⋅ KUK-JIN YOON
FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection
Md Redwanul Haque ⋅ Manzur Murshed ⋅ Manoranjan Paul ⋅ Tsz-Kwan Lee
Staying VIGILant: Mitigating Visual Laziness in MLLMs via Information-Theoretic Alignment
Xi Xiao ⋅ Chen Liu ⋅ Chih-Ting Liao ⋅ Yunbei Zhang ⋅ Qizhen Lan ⋅ YUXIANG WEI ⋅ Lin Zhao ⋅ Janet Wang ⋅ Jianyang Gu ⋅ Muchao Ye ⋅ Tianyang Wang ⋅ Hao Xu
iSyncTab: Learning Cross-Modal Feature Sequencing for Image-Tabular Data via Neural Synchrony
Al Zadid Sultan Bin Habib ⋅ Md Younus Ahamed ⋅ Prashnna Gyawali ⋅ Gianfranco Doretto ⋅ Donald Adjeroh
Event-based Gaze Control Systems for Real-time Spin Estimation in Professional Ball Games
Yunpu Hu ⋅ Fabian Schilling ⋅ Valentina Cavinato ⋅ Asude Aydin ⋅ Agis Politis ⋅ Ricardo Morales ⋅ Kirk Scheper ⋅ Peter Dürr ⋅ Naoya Takahashi
FaceArmor: A Universal Facial Image Protection Against Diffusion-Based Manipulations
Yiming Wang ⋅ Jiahao Chen ⋅ Qingming Li ⋅ Chunyi Zhou ⋅ Zhi Chen ⋅ Lingzhong Meng ⋅ Jinbao Li ⋅ Shouling Ji
Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
Sunqi Fan ⋅ Qingle Liu ⋅ Runqi Yin ⋅ Meng-Hao Guo ⋅ Shuojin Yang
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
Gur Elkin ⋅ Ofir I Shahar ⋅ Ohad Ben-Shahar
UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment
Yecheng Zhang ⋅ RONG ZHAO ⋅ Zhizhou Sha ⋅ Yong Li ⋅ Lei Wang ⋅ Ce Hou ⋅ Wen Ji ⋅ HUANG HAO ⋅ yunshan wan ⋅ Jian Yu ⋅ Junhao Xia ⋅ Yuru Zhang ⋅ Chunlei Shi
MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization
Zaibin Zhang ⋅ Junlan Xiao ⋅ Zhongbo Zhang ⋅ Yifan Wang ⋅ Li Kang ⋅ Yiran Qin ⋅ Changxing Xia ⋅ Heng Zhou ⋅ Talas Fu ⋅ Enshen Zhou ⋅ Ruimao Zhang ⋅ Zhenfei Yin ⋅ Huchuan Lu ⋅ Lijun Wang
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
Gautam Rajendrakumar Gare ⋅ Neehar Peri ⋅ Matvei Popov ⋅ Shruti Jain ⋅ John Galeotti ⋅ Deva Ramanan
MASS: Motion-Aligned Selective Scan for Flow-Based Video Frame Interpolation
Jun-Sang YOO ⋅ Seung-Won Jung
Attention-DP3: Spatially Object-aware 3D Diffusion Policy via Geometry-aligned Attentional Conditioning
Changbo Yan ⋅ Zhongbo Zhang ⋅ Zaibin Zhang ⋅ Yifan Wang ⋅ Lijun Wang ⋅ Huchuan Lu
OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding
Wenyuan Huang ⋅ zhenyu zhang ⋅ Zhao Wang ⋅ Zhou Wei ⋅ Ting Huang ⋅ Fang Zhao ⋅ Jian Yang
Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching
Guanbo Huang ⋅ Jingjia Mao ⋅ Fanding Huang ⋅ fengkai liu ⋅ Xiangyang Luo ⋅ Yaoyuan Liang ⋅ Jiasheng Lu ⋅ xiaoe Wang ⋅ Pei Liu ⋅ Ruiliu Fu ⋅ Ruqi Huang ⋅ Shao-Lun Huang
ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
Ting Huang ⋅ zhenyu zhang ⋅ Wenyuan Huang ⋅ Hao Tang ⋅ Jian Yang
On-Orbit Real-Time Wildfire Detection Under On-Board Constraints
Matthias Rötzer ⋅ Veronika Pörtge ⋅ Martin Ickerott ⋅ Jayendra Chorapalli ⋅ Dimitri Scheftelowitsch ⋅ Max Bereczky ⋅ Dmitry Rashkovetsky ⋅ Sai Appalla ⋅ Julia Gottfriedsen
MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations
Hejia Chen ⋅ Haoxian Zhang ⋅ Xu He ⋅ Xiaoqiang Liu ⋅ Pengfei Wan ⋅ Shoulong Zhang ⋅ Shuai Li
Markov-Renewal Single-Photon LiDAR Simulator
Weijian Zhang ⋅ PRATEEK CHENNURI ⋅ Hashan Weerasooriya ⋅ Bole Ma ⋅ Stanley Chan
Decoupling Complexity from Scale in Latent Diffusion Model
Tianxiong Zhong ⋅ Xingye Tian ⋅ Xuebo Wang ⋅ Boyuan Jiang ⋅ Xin Tao ⋅ Pengfei Wan
MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control
Kaiqi Liu ⋅ Yunyao Mao ⋅ Ziqi Cai ⋅ Zheng Geng ⋅ Jing Wang ⋅ Qiulin Wang ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Kun Gai ⋅ Shuchen Weng ⋅ Boxin Shi
P²Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation
Yi Shi ⋅ Huichao Xie ⋅ Yuqing Wang ⋅ Mingyu Wang ⋅ Kaihui Yang ⋅ Yu Liu ⋅ Lu Ruitao ⋅ Lizhe Li ⋅ Junwei Han ⋅ Dingwen Zhang
Break Visual-Linguistic Asymmetry: Unleashing VLM's Cross-Modal Potential for General Face Forgery Detection
Guilin Pang ⋅ Yiu-ming Cheung ⋅ Ruiqi Li ⋅ Weifeng Su
Manifold-Aware Spectral Compaction: A Graph Signal Processing Perspective on Online Gaussian Reduction for 3DGS SLAM
Jiayi Tian ⋅ Jiaze Wang ⋅ Tian Xia ⋅ Wenzhe zhao ⋅ Pengju Ren
Learning from Reliable Negatives: Confidence-Anchored Test-Time Adaptation for GUI Grounding
Yizhou Liu ⋅ Fei Tang ⋅ Yuchen Yan ⋅ Zhengxi Lu ⋅ Songqin Nong ⋅ Tao Jiang ⋅ Wenhao Xu ⋅ Wenqi Zhang ⋅ Weiming Lu ⋅ Jun Xiao ⋅ Jun Xiao
Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration
Aoru Xue ⋅ Yujing Sun ⋅ yiming ren ⋅ Kwok-Yan Lam ⋅ Mao Ye ⋅ Yuexin Ma
Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives
Junli Wang ⋅ HuaZhihua HuaZhihua ⋅ Xueyi Liu ⋅ Zebin Xing ⋅ Wei Zhang ⋅ Kun Ma ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Long Chen ⋅ Pengxuan Yang
IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video
Rasul Khanbayov ⋅ Mohamed Rayan Barhdadi ⋅ Erchin Serpedin ⋅ HASAN KURBAN
FedMental: Topology-Aware Federated Prototype Learning for Polymorphic Multimodal Psychiatry
Haoyu Li ⋅ He Li ⋅ Wenke Huang ⋅ Yujing Rao ⋅ Xiaofen Zong ⋅ Mang Ye
OrthoEraser: Coupled-Neuron Orthogonal Projection for Concept Erasure
Chuancheng Shi ⋅ Wenhua Wu ⋅ Fei Shen ⋅ Xiaogang Zhu ⋅ Kun Hu ⋅ Zhiyong Wang
Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language Translation
Liqian Feng ⋅ Lintao Wang ⋅ Xiaochen Liu ⋅ Anusha Withana ⋅ Ken-Tye Yong ⋅ Dehui Kong ⋅ Zhiyong Wang ⋅ Kun Hu
Confidence-Based Mesh Extraction from 3D Gaussians
Lukas Radl ⋅ Felix Windisch ⋅ Andreas Kurz ⋅ Thomas Köhler ⋅ Michael Steiner ⋅ Markus Steinberger
Trajectory-Level Continuous Action Representation for Robotic Manipulation
Tong Yang ⋅ Jingkai Jia ⋅ Yuecheng Xu ⋅ Xueyao Chen ⋅ Chi Zhang ⋅ Wenqiang Zhang
Rethinking Pseudo-Labels: Multi-Granularity Supervision for Domain Adaptive Object Detection
Haohao Ma ⋅ Weimin Lu ⋅ Qiqi Ge
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
Ziyi Wang ⋅ Xinshun Wang ⋅ Shuang Chen ⋅ Yang Cong ⋅ Mengyuan Liu
Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples
Shiyu Wu ⋅ Shuyan Li ⋅ Jing Li ⋅ Jing Liu ⋅ Yequan Wang
UECP: Uncertainty-Enhanced Collaborative Perception
Kang Yang ⋅ Tianci Bu ⋅ Peng Wang ⋅ Deying Li ⋅ Jie Wen ⋅ Yongcai Wang
Locality-Aware Continual Unlearning for Diffusion Models
Naveen George ⋅ Naoki Murata ⋅ Yuhta Takida ⋅ Konda Reddy Mopuri ⋅ Yuki Mitsufuji
UniTemp: Unlocking Video Generation in Any Temporal Order via Autoregressive Distillation
Lin Zhang ⋅ Sicheng Mo ⋅ Zefan Cai ⋅ Jinhong Lin ⋅ Zihao Lin ⋅ Jiuxiang Gu ⋅ Krishna Kumar Singh ⋅ Yuheng Li ⋅ Yin Li
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video-LLMs
Wenhao Xu ⋅ Xin Dong ⋅ Yue Li ⋅ Haoyuan Shi ⋅ Yueyi Zhang ⋅ Zhiwei Xiong
TRAM: Finetuning-Free Test-Time Adaptation for Generalized Face Anti-Spoofing with Only a Few Bonafide Samples
Wang QIRUI ⋅ SI-QI LIU
Noise-Robust Face Recognition via Non-target Similarity Distribution Guided Sample Selection
Fanglong Wu ⋅ Youqiang Gui ⋅ Cheng Peng
Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks
Mei Chee Leong ⋅ Gu Ying ⋅ Hui Tan ⋅ Liyuan Li ⋅ Nancy Chen
ReTarget: Representation Transformation via Adversarial Regularization for Geometric Misalignment
Jia-You Chen ⋅ Shang-Tse Chen
MedGSSR: Generalizable Medical Image Super-Resolution 3D Reconstruction via Hierarchical Feed-forward Gaussian Splatting
Chengkai Wang ⋅ Luoyu Hong ⋅ Yiting Zhao ⋅ Jiamin Wang ⋅ Xiang Feng ⋅ Feiwei Qin ⋅ Zhenzhong Kuang ⋅ Xuefei Yin ⋅ Ali Bashashati ⋅ Yanming Zhu
LiDAR-EVS: Enhance Extrapolated View Synthesis for 3D Gaussian Splatting with Pseudo-LiDAR Supervision
Yiming Huang ⋅ Xin Kang ⋅ Sipeng Zhang ⋅ Hongliang Ren ⋅ Weihua Zhang ⋅ Junjie Lai
InnoText: A Unified Model for Visual Text Generation and Editing
Haowei Liu ⋅ Runze He ⋅ Jian Lu ⋅ Ao Ma ⋅ Run Ling ⋅ Ke Cao ⋅ Jiasong Feng ⋅ Wei Feng ⋅ Shuo Lu ⋅ Yexing Xu ⋅ WANG Yun ⋅ Jing Wang ⋅ Zhanjie Zhang
Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
Xueqiao Sun ⋅ Yuhui Zhang ⋅ Xiaohan Wang ⋅ Ludwig Schmidt ⋅ Serena Yeung-Levy
InstrAct: Towards Action-Centric Understanding in Instructional Videos
Zhuoyi Yang ⋅ Jiapeng Yu ⋅ Reuben Tan ⋅ Boyang Albert Li ⋅ Huijuan Xu
VLTR: Vision-Language Tool Reasoning for Instruction-Guided Image Editing
Yike Wang ⋅ Yitao Yu ⋅ Shaohua Sun ⋅ Ping Luo
Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation
Yeonghwan Song ⋅ Chanhui Lee ⋅ Jinsoo Park ⋅ Jeany Son
CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning
Julien Mérand ⋅ Boris Meden ⋅ Liming Chen ⋅ Mathieu GROSSARD
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
Yuhuan Wu ⋅ Haozhe Wang ⋅ Cong Wei ⋅ Chong Peng ⋅ Fangzhen Lin ⋅ Wenhu Chen
Exploiting Local Flatness for Efficient Out-of-Distribution Detection
Seonghwan Park ⋅ Hyunji Jung ⋅ Dongyeop Lee ⋅ Namhoon Lee
GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data
Roger Ferrod ⋅ Maël Lecene ⋅ Krishna Sapkota ⋅ George Leifman ⋅ Vered Silverman ⋅ Genady Beryozkin ⋅ Sylvain Lobry
JacobianAvatar: Temporally Consistent Semi-rigid Avatar Reconstruction from a Monocular Video
Changyeon Won ⋅ Min-Gyu Park ⋅ Seonghwan Park ⋅ Ju Yoon ⋅ Hae-Gon Jeon
Geometric Regularization for Long-Tailed Semi-Supervised Learning via Gaussian Feature Bridges
Hongyang He ⋅ Xinyuan Song ⋅ Yan Zhong ⋅ Daizong Liu ⋅ Yanbin Li ⋅ Yangfan He ⋅ Wenqiao Zhang
VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations
Fucai Ke ⋅ Zhixi Cai ⋅ Boying Li ⋅ Long Chen ⋅ Beibei Lin ⋅ Weiqing Wang ⋅ Pari Delir Haghighi ⋅ Gholamreza Haffari ⋅ Hamid Rezatofighi
AGE: Agentic Gaussian Editing in 3D Scenarios
Hao Qin ⋅ Tesi Lin ⋅ Mingwei Wei ⋅ Yukai Sun ⋅ Mengxu Lu ⋅ Ming Kong ⋅ Qiang Zhu
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
Yikun Liu ⋅ Yuan Liu ⋅ Shangzhe Di ⋅ Haicheng Wang ⋅ Zhongyin Zhao ⋅ Le Tian ⋅ Zhou Xiao ⋅ Jie Zhou ⋅ Jiangchao Yao ⋅ Yanfeng Wang ⋅ Weidi Xie
Towards Robustness against Typographic Attack with Training-free Concept Localization
Bohan Liu ⋅ Wenqian Ye ⋅ Guangzhi Xiong ⋅ Zhenghao He ⋅ Sanchit Sinha ⋅ Aidong Zhang
Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption
Xiaomeng Fu ⋅ Jia Li ⋅ Yiming Hu ⋅ Yong Wang ⋅ Hayden So ⋅ Jiao Dai ⋅ Xiangxiang Chu ⋅ Jizhong Han
Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
Valentin Gabeff ⋅ Baptiste Maquignaz ⋅ Jiaxian Shan ⋅ Sepideh Mamooler ⋅ Gencer Sumbul ⋅ Blair Costelloe ⋅ Devis TUIA ⋅ Alexander Mathis
ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion
Yao Liu ⋅ Lishen Qu ⋅ Jie Liang ⋅ shihao zhou ⋅ Hui Zeng ⋅ Yabin Peng ⋅ Huipeng Lin ⋅ Yabin Zhang ⋅ Jufeng Yang
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
Hui Zhang ⋅ Juntao Liu ⋅ Zongkai Liu ⋅ liqiang niu ⋅ Fandong Meng ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Learning with Bilevel-Minimax Optimization for Efficient and Reliable Transfer Attacks
Yaohua Liu ⋅ Yifan Guo ⋅ Jiaxin Gao
Open-Vocabulary Long Term Action Anticipation
Syed Talal Wasim ⋅ Jinhui Yi ⋅ Hamid Suleman ⋅ Ahmad Javed ⋅ Yanan Luo ⋅ Muhammad Muzammal Naseer ⋅ Juergen Gall
MemPose: Category-level Object Pose Estimation with Memory
Xiao Lin ⋅ Minghao Zhu ⋅ Yun Peng ⋅ Liuyi Wang ⋅ Qiyi Wang ⋅ Chengju Liu ⋅ Qijun Chen
MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learning
Wenhao Wang ⋅ Franziska Boenisch ⋅ Michael Backes ⋅ Adam Dziedzic
Task Alignment: A simple and effective proxy for model merging in computer vision
Pau de Jorge Aranda ⋅ César DE SOUZA ⋅ Björn Michele ⋅ Mert Bulent SARIYILDIZ ⋅ Philippe Weinzaepfel ⋅ Florent Perronnin ⋅ Larlus Diane ⋅ Yannis Kalantidis
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
Duo Li ⋅ Zuhao Yang ⋅ Xiaoqin Zhang ⋅ Ling Shao ⋅ Shijian Lu
Scalable Cross-embodiment Dexterous Grasping via Morphology-Prior Diffusion
Sihang Li ⋅ Zheming Zhou ⋅ Marcelino Almeida ⋅ Omid Alizadeh ⋅ Luca Carlone ⋅ Min Sun ⋅ Chen Feng ⋅ Cheng-Hao Kuo
PhysFlowNet: Learning Canonical Latent Manifolds via Spatio-Spectral Physics Priors for Underwater Object Detection
XUETING Liu ⋅ Haoyu Ji ⋅ Wenze Huang ⋅ Zhihao Yang ⋅ Yu Gao ⋅ Weihong Ren ⋅ Zhiyong Wang ⋅ Honghai Liu
Diffusion Image Generation with Explicitly Modeling of Data Manifold Geometry
Duoduo Xue ⋅ Zhiyu Zhu ⋅ Junhui Hou
Geometry-Aware Spatio-Temporal Context Modeling for 4D Occupancy Forecasting
Mingkui Tan ⋅ Zhuangwei Zhuang ⋅ Hui Luo ⋅ Qingyao Wu ⋅ Mingkui Tan
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
Yurou Yang ⋅ Muyuan Lin ⋅ Roberto Martín-Martín ⋅ Labrie Martin ⋅ Shreekant Gayaka ⋅ Cheng-Hao Kuo ⋅ Luca Carlone
Audio-Visual Continual Test-Time Adaptation without Forgetting
Sarthak Kumar Maharana ⋅ Akshay Mehra ⋅ Bhavya Ramakrishna ⋅ Yunhui Guo ⋅ Guan-Ming Su
LoCA: Spatially-Aware Low-Rank Convolutional Adaptation of Vision Foundation Models
Sojung An ⋅ Junha Lee ⋅ Sujeong You ⋅ Nam Ik Cho ⋅ Donghyun Kim
Multiple Images Distract Large Multimodal Models via Attention Fragmentation
Tingrui Qiao ⋅ Di Zhao ⋅ Yuzhuo Li ⋅ Bo Pang ⋅ Caroline Walker ⋅ Chris Cunningham ⋅ Yun Sing Koh
MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI
Rozain Shakeel ⋅ Abdul Ali ⋅ Muneeb Ganie ⋅ Tausifa Jan Saleem ⋅ Tajamul Ashraf
HiChor: Hierarchical Choreography Generation from Pop Music with Choreographic Primitives
Jungsu Kim ⋅ Jungwoo Huh ⋅ Jeongwook Choi ⋅ Wen-Huang Cheng ⋅ Jian-Yu Jiang-Lin ⋅ Weisi Lin ⋅ Sanghoon Lee
Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation
Lingrui Li ⋅ Nan Pu ⋅ Dong Zhao ⋅ Wenjing Li ⋅ Andrew French ⋅ Xin Chen ⋅ Zhun Zhong
EgoExoMoCap: Distributed Human Motion Capture via Ego- and Exocentric Body Tracking from Head-Mounted Devices
Jiaxi Jiang ⋅ Bharat Bhatnagar ⋅ Nan Yang ⋅ Lingni Ma ⋅ Sebastian Starke ⋅ Robin Kips ⋅ Nadine Bertsch ⋅ Christian Holz ⋅ Federica Bogo
Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion
Bowen Xue ⋅ Brandon Feng ⋅ Chenguo Lin ⋅ Yuchen Lin ⋅ Yujia Zeng ⋅ lvmin zhang ⋅ Maneesh Agrawala ⋅ Honglei Yan ⋅ Panwang Pan
MUSE: Unlocking Timestep as Native Task Steering for One-Step Dense Prediction
Shuo Zhou ⋅ Zhaoxin Li ⋅ Xiujuan Chai
Fast and Flexible Robustness Certificates for Semantic Segmentation
Thomas Massena ⋅ Corentin Friedrich ⋅ Franck Mamalet ⋅ Mathieu Serrurier
VIGS-SLAM: Visual Inertial Gaussian Splatting SLAM
Zihan Zhu ⋅ Wei Zhang ⋅ Moyang Li ⋅ Norbert Haala ⋅ Marc Pollefeys ⋅ Daniel Barath
DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion
jiakun li ⋅ Li Fang ⋅ Hao Zhu ⋅ Fei Hu ⋅ Long Ye ⋅ Yuan Zhang ⋅ Jinyao Yan
Towards Reconfigurable Visual Feature Compression
Jiahang Zhang ⋅ Wenhan Yang ⋅ Minghao Liu ⋅ Jiaying Liu
Allo{SR}2: Rectifying One-Step Super-Resolution to Stay Real via Allomorphic Generative Flows
Zihan Wang ⋅ XUDONG HUANG ⋅ Junbo Qiao ⋅ WEI LI ⋅ jie hu ⋅ Xinghao Chen ⋅ Shaohui Lin
Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts
Nuoyan Zhou ⋅ Zhijun Tu ⋅ Lei Yu ⋅ Kun Cheng ⋅ jie hu ⋅ Nannan Wang ⋅ Xinghao Chen
HybridSim: A Physics–Learning Hybrid Digital Twin for mmWave Human Sensing
Weitao Xiong ⋅ Tianyu Liu ⋅ Peng Li ⋅ KOK CHUNG CHUA ⋅ Chean Khim Toa ⋅ Pu Wang ⋅ Hongfei Xue
Unlocking Complex Image Editing via Natively Interleaved Visual Textual CoT with Deep Confidence Reasoning
Zhentao Zou ⋅ Zhengrong Yue ⋅ Kunpeng Du ⋅ Binglei Bao ⋅ Hanting Li ⋅ Haizhen Xie ⋅ Guozheng Xu ⋅ Yue Zhou ⋅ jie hu ⋅ Xue Jiang ⋅ Xinghao Chen
Music-to-Dance Generation via Atomic Movements
Xinhao Cai ⋅ Yixuan Sun ⋅ Minghang Zheng ⋅ Qingchao Chen ⋅ Xin Jin ⋅ Song-Chun Zhu ⋅ Yang Liu
AffoGato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale
Junha Lee ⋅ Eunha Park ⋅ Chunghyun Park ⋅ Dahyun Kang ⋅ Minsu Cho
Delaunay Canopy: Building Wireframe Reconstruction from Airborne LiDAR Point Clouds via Delaunay Graph
Donghyun Kim ⋅ Chanyoung Kim ⋅ YoungJoong Kwon ⋅ Seong Jae Hwang
Controlling Motion Transfer in Diffusion Transformers via Attention Heads
Sunyoung Jung ⋅ Jiwoo Park ⋅ Yoonseok Choi ⋅ Kyobin Choo ⋅ Ming-Hsuan Yang ⋅ Seong Jae Hwang
No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs
Haojian Huang ⋅ Harold Haodong Chen ⋅ Meng Luo ⋅ Junjia Du ⋅ Shanqing Xu ⋅ Ziheng Chen ⋅ Yanxiang Huang ⋅ Yinchuan Li ⋅ Yingcong Chen
QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers
Kyobin Choo ⋅ Youngmin Kim ⋅ Hyunkyung Han ⋅ Geunrip Park ⋅ Chanyoung Kim ⋅ Sunyoung Jung ⋅ Seong Jae Hwang
DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
Hongfei Zhang ⋅ Kanghao Chen ⋅ Zixin Zhang ⋅ Harold Haodong Chen ⋅ Yuanhuiyi Lyu ⋅ Kun Zhou ⋅ Yuqi Zhang ⋅ Shuai Yang ⋅ Yingcong Chen
Temporal and Cross-modal Alignment for Enhanced Audiovisual Video Captioning
Chen Zhao ⋅ Jiajun Ma ⋅ Qilong Huang ⋅ Tiehan Fan ⋅ Hongyu Li ⋅ Zhuoliang Kang ⋅ Xiaoming Wei ⋅ Jian Yang ⋅ Ying Tai
FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
Zhenqi He ⋅ Ziqi Jiang ⋅ Yuanpei Liu ⋅ Yanghao Wang ⋅ Teng Wang ⋅ Long Chen
MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning
Tuan-An To ⋅ Yuk Kwan Wong ⋅ Tuan-Anh Vu ⋅ Ziqiang Zheng ⋅ Sai Kit Yeung
UniH3: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration
Zhiwen Yang ⋅ Jiayin Li ⋅ Chengyu Liu ⋅ Hui Zhang ⋅ Bingzheng Wei ⋅ Yan Xu
Counting Trees from Satellite Imagery with Noisy Supervision
Dimitri Gominski ⋅ Maurice Mugabowindekwe ⋅ Qiue XU ⋅ Xiaowei Tong ⋅ Martin Brandt ⋅ Hieu Le ⋅ Rasmus Fensholt ⋅ Dimitris Samaras ⋅ Loic Landrieu
Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation
Houzhang Fang ⋅ Ruixuan Huang ⋅ Qiuhuan Chen ⋅ Xiaolin Wang ⋅ Yi Chang ⋅ Luxin Yan
Learning to Tessellate: Point Cloud Generation via Recursive Spectral Partitioning
Monan Sun ⋅ Bangzhen Liu ⋅ Huaidong Zhang ⋅ Shengfeng He
Quick ViTs: Speeding up Vision Transformers through Equivariance
David Nordström ⋅ Johan Edstedt ⋅ Fredrik Kahl ⋅ Georg Bökman
LoMa: Local Feature Matching Revisited
David Nordström ⋅ Johan Edstedt ⋅ Georg Bökman ⋅ Jonathan Astermark ⋅ Anders Heyden ⋅ Viktor Larsson ⋅ Mårten Wadenbäck ⋅ Michael Felsberg ⋅ Fredrik Kahl
R-ESC: Robustly Erasing Space Concepts via Stochastic Feature Remapping
Kang Eun Jeon ⋅ Yunsung Kang ⋅ Do Kang ⋅ Tae-Young Lee ⋅ Gyeong-Moon Park ⋅ Jong Hwan Ko
RoMa v2: Harder Better Faster Denser Feature Matching
Johan Edstedt ⋅ David Nordström ⋅ Yushan Zhang ⋅ Georg Bökman ⋅ Jonathan Astermark ⋅ Viktor Larsson ⋅ Anders Heyden ⋅ Fredrik Kahl ⋅ Mårten Wadenbäck ⋅ Michael Felsberg
Extreme Face Super-Resolution through Identity Fitting and Decoupling
Jiarui Yang ⋅ Hang Guo ⋅ Wen Huang ⋅ Shu-Tao Xia ⋅ Tao Dai
EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents
Yu Zhang ⋅ Kaiyuan Shen ⋅ Yang Li
Rolling Shutter Camera Self-Calibration
Yongcong Zhang ⋅ Navid Rabbani ⋅ Bangyan Liao ⋅ Chengbo Wang ⋅ Yizhen Lao ⋅ Adrien Bartoli
h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform
ZeHui Guo ⋅ Zhen Wang ⋅ Junwei Shu ⋅ Changbo Wang ⋅ Long Chen ⋅ Yang Li
TecoPrompt: Temporal-Conservative Prompt Learning for Vision-Language Models
zeyi shao ⋅ Haowen Hua ⋅ Jiaxin Zhang ⋅ John See ⋅ Zeyd Boukhers ⋅ Cong Yang
Vision Bridge Transformer at Scale
Zhenxiong Tan ⋅ Zeqing Wang ⋅ Xingyi Yang ⋅ Songhua Liu ⋅ Xinchao Wang
FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
Yunfeng Wu ⋅ Jiayi Song ⋅ Zhenxiong Tan ⋅ Zihao He ⋅ Songhua Liu
TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
Yisheng Zhang ⋅ Guoli Jia ⋅ Haote Hu ⋅ Shanxu Zhao ⋅ Kaikai Zhao ⋅ Long Sun ⋅ Xinwei Long ⋅ Kai Tian ⋅ Che Jiang ⋅ Zhaoxiang Liu ⋅ Kai Wang ⋅ Shiguo Lian ⋅ Kaiyan Zhang ⋅ Bowen Zhou
MoMCE: Mixture of Modality and Cue Experts for Multimodal Deception Detection
Dongliang Zhu ⋅ Ruimin Hu ⋅ Zitong Yu ⋅ Xiaobao Guo ⋅ Mei Wang ⋅ Shuo Ye ⋅ Fei Ma ⋅ Xiaochun Cao
Multi-Block-Attention-based Color Constancy
Oguzhan Ulucan ⋅ Diclehan Ulucan ⋅ Marc Ebner
LaVPR: Benchmarking Language and Vision for Place Recognition
Ofer Idan ⋅ Dan Badur ⋅ yosi keller ⋅ Yoli Shavit
Achieving Subcategorical Erasure in Text-to-Image Models
Pranav Singh Chib ⋅ Pravendra Singh
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
Xinlong Chen ⋅ Weihong Lin ⋅ Jingyun Hua ⋅ Linli Yao ⋅ Yue Ding ⋅ Bozhou Li ⋅ Bohan Zeng ⋅ Yang Shi ⋅ Qiang Liu ⋅ Yuanxing Zhang ⋅ Pengfei Wan ⋅ Liang Wang
LGD-Net: Leader-Guided Cross-Modal Dynamics for Hyperspectral and Panchromatic Image Fusion
Raj kumar ⋅ Balasubramanian Raman ⋅ Pravendra Singh
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
Shuimu Chen ⋅ Yuteng Chen ⋅ Yuanshen Guan ⋅ Zebang Cheng ⋅ Zeyu Zhang ⋅ shengqian qin ⋅ Bin Xia ⋅ Jiaran Li ⋅ Wenming Yang ⋅ Fei Ma
Data Circuit Breaker: Identifying Training, Test, and Generated Data in Image Generative Models
Bihe Zhao ⋅ Michel Meintz ⋅ Juangui Xu ⋅ Franziska Boenisch ⋅ Adam Dziedzic
Geo-DPO: Aligning Semantic Intent with Geometry for 3D Affordance Segmentation
Ziqian Yang ⋅ Xiaolei Wang ⋅ Xianglin Qiu ⋅ Weiguang Zhao ⋅ Quan Zhang ⋅ Jimin Xiao
Ada-VNNs: Adaptive Equivariance for Vector Neural Networks
Bing Han ⋅ Ruitao Pan ⋅ Yumin Chen ⋅ Peixin Hong ⋅ Weiyuan Liu ⋅ Zhibin Zhao ⋅ Chenxi Wang ⋅ Zhi Zhai
Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning
Jai Bardhan ⋅ Patrik Drozdík ⋅ Josef Sivic ⋅ Vladimir Petrik
Free-Range Gaussians: Non-Grid-Aligned Generative 3D Gaussian Reconstruction
Akhmedkhan Shabanov ⋅ Peter Hedman ⋅ Ethan Weber ⋅ Zhengqin Li ⋅ Denys Rozumnyi ⋅ Gael Le Lan ⋅ Naina Dhingra ⋅ Lei Luo ⋅ Andrea Vedaldi ⋅ Christian Richardt ⋅ Andrea Tagliasacchi ⋅ Bo Zhu ⋅ Numair Khan
Latent Fusion: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents
Laura Fink ⋅ Linus Franke ⋅ George Kopanas ⋅ Marc Stamminger ⋅ Peter Hedman
SFM: Taming State Space Models for Text-to-Motion via Spatial-Frequency Modeling
Shang Gao ⋅ Haicheng Liao ⋅ Wenshuo Chen ⋅ Yumu Xie ⋅ Jiaxun Zhang ⋅ Bin Rao ⋅ Chengyue Wang ⋅ Yanchen Guan ⋅ Zhiyong Cui ⋅ Shiqi Ou ⋅ Yutao Yue ⋅ Zhenning Li
Penetration-Free Compositional 3D Generation via Gaussian Surface Offset
Yilin Shao ⋅ Licheng Jiao ⋅ Lingling Li ⋅ Xu Liu ⋅ Fang Liu ⋅ Wenping Ma ⋅ Long Sun ⋅ Jiaxuan Zhao
HHA: Hierarchical Hyperbolic Constraints for Imperceptible Point Cloud Attacks
Keke Tang ⋅ Yu Liao ⋅ Weilong Peng ⋅ Xiaofei Wang ⋅ Daizong Liu ⋅ Zhongyun Hua ⋅ Peican Zhu ⋅ Zhihong Tian
TerrainGraphNet: Terrain-Constrained Graph Reasoning for Landslide Segmentation
SHAHID SHAFI DAR ⋅ Pranjal Pandey ⋅ Nagendra Kumar
IRIS: Intersection-aware Ray-based Implicit Editable Scenes
Grzegorz Wilczyński ⋅ Mikołaj Zieliński ⋅ Krzysztof Byrski ⋅ Joanna Waczynska ⋅ Dominik Belter ⋅ Przemysław Spurek
EgoMAN: Interaction-Structured Reasoning for Egocentric 3D Hand Trajectory Prediction
Mingfei Chen ⋅ Yifan Wang ⋅ Zhengqin Li ⋅ Homanga Bharadhwaj ⋅ Yujin Chen ⋅ Chuan Qin ⋅ Ziyi Kou ⋅ Yuan Tian ⋅ Eric Whitmire ⋅ Rajinder Sodhi ⋅ Hrvoje Benko ⋅ Eli Shlizerman ⋅ Yue Liu
Auto-Prompting: Layer-Specific Prompt Fusion Discovery via Differentiable Search
Xi Xiao ⋅ Xingjian Li ⋅ Yunbei Zhang ⋅ Cheng Han ⋅ Tianming Liu ⋅ Tianyang Wang ⋅ Runmin Jiang ⋅ Jihun Hamm ⋅ Xiao Wang ⋅ Min Xu
Towards Long-Form Spatio-Temporal Video Grounding
Xin Gu ⋅ Bing Fan ⋅ Jiali Yao ⋅ Zhipeng Zhang ⋅ Yan Huang ⋅ Cheng Han ⋅ Heng Fan ⋅ Libo Zhang
VVSim: A Large-Scale Aerial-Ground Dataset and Benchmark for Cooperative Perception
Zengle Zhu ⋅ Zhen LI ⋅ Tianyi Huai ⋅ Tianshun Li ⋅ Zihang Xu ⋅ Liuqing Yang ⋅ Rongqing Zhang ⋅ Xinhu Zheng
MorphGS: Morphology-Adaptive Articulated Motion Transfer from Videos
Taeyeon Kim ⋅ Youngju Na ⋅ Jumin Lee ⋅ Sebin Lee ⋅ Minhyuk Sung ⋅ Sung-eui Yoon
Clue Matters: Empower Video Reasoning with Brain-Inspired Latent Clue Learning
Kaixin Zhang ⋅ Xiaohe Li ⋅ Jiahao Li ⋅ Haohua Wu ⋅ Xinyu Zhao ⋅ Zide Fan ⋅ Lei Wang
Zero-shot Depth from Defocus
Yiming Zuo ⋅ Hongyu Wen ⋅ Venkat Subramanian ⋅ Patrick Chen ⋅ Karhan Kayan ⋅ Mario Bijelic ⋅ Felix Heide ⋅ Jia Deng
FusionTrack: Collaborative Multi-Object Tracking with Arbitrary Multi-UAVs
Xiaohe Li ⋅ Pengfei Li ⋅ Kaixin Zhang ⋅ Jiahao Li ⋅ Zide Fan
Curvature-Guided Mixing for MLLM Adaptation
Jinglong Yang ⋅ Jiaxuan He ⋅ Wenjian Huang ⋅ Zhan Zhuang ⋅ Jianguo Zhang
NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling
Jaehyun Cho ⋅ YOUNGJOON YOO
SCALE: Semantic-Calibrated Guidance Enhancement for Prompt-Faithful Diffusion
Tianhang Lu ⋅ Sudong Cai ⋅ Bingzhi Chen ⋅ Shao-Dong Shen ⋅ Chunting Liu ⋅ Longguang Wang ⋅ Bing Wang
Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation
junxin lu ⋅ Tengfei Song ⋅ Zhanglin Wu ⋅ Lipengfei Lipengfei ⋅ Xiaowei Liang ⋅ Hui Yang ⋅ Kun Chen ⋅ NING XIE ⋅ Yunfei Lu ⋅ Jing Zhao ⋅ Shiliang Sun ⋅ Daimeng Wei
VQT: Vector Quantization Tuning for Efficient Fine-tuning and Compression of Pre-trained Vision Transformers
Yinglong Li ⋅ jiyuan Xia ⋅ Jingcheng Xie ⋅ Zhiwei Xiong
Decoding Children’s Gait Behavior
Yifan Shen ⋅ Boyi Li ⋅ Meihuan Huang ⋅ Yuanzhe Liu ⋅ Xu Cao ⋅ Jinyang Jin ⋅ Zhengyuan Li ⋅ Anglin Liu ⋅ Junho Kim ⋅ Jingyuan Zhu ⋅ Lan Fangzhou ⋅ Jianguo Cao ⋅ Jintai Chen ⋅ Ismini Lourentzou ⋅ James Rehg
Dynamic World Generation Made Efficient
Fengrui Tian ⋅ Jinqi Luo ⋅ Uday Kiran Reddy Tadipatri ⋅ Hancheng Min ⋅ Rene Vidal
F⁴Splat: Feed-Forward Predictive Densification for Feed-Forward 3D Gaussian Splatting
Injae Kim ⋅ Chaehyeon Kim ⋅ Minseong Bae ⋅ Minseok Joo ⋅ Hyunwoo Kim
TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution
Xiang Gao ⋅ Chenxin Zhu ⋅ Yushun Fang ⋅ Qiang Hu ⋅ Xiaoyun Zhang
OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer
Si-yu Lu ⋅ Po-Ting Chen ⋅ Hui-Che Hsu ⋅ Sin-Ye Jhong ⋅ Wen-Huang Cheng ⋅ Yung-Yao Chen
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
Peng Wu ⋅ Yuting Yan ⋅ Guansong Pang ⋅ Yujia Sun ⋅ Qingsen Yan ⋅ Peng Wang ⋅ Yanning Zhang
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
Haoyu Zhen ⋅ Xiaolong Li ⋅ Yilin Zhao ⋅ Han Zhang ⋅ Sifei Liu ⋅ Kaichun Mo ⋅ Chuang Gan ⋅ Subhashree Radhakrishnan
Towards Generalizable Robotic Manipulation in Dynamic Environments
Heng Fang ⋅ Shangru Li ⋅ Shuhan Wang ⋅ Xuanyang Xi ⋅ Dingkang Liang ⋅ Xiang Bai
SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
Zhiyuan Ma ⋅ Zhengfeng Shi ⋅ Yuning An ⋅ Peize Li ⋅ Jiabao Wei ⋅ Ruijie Li ⋅ Junhao Xiao ⋅ Jianjun Li ⋅ Bowen Zhou
Towards Spatial Supersensing in the Wild
Tianjun Gu ⋅ Tianyu Xin ⋅ Kuan Zhang ⋅ Bowen Yang ⋅ Yinan Han ⋅ Peize Li ⋅ Yucheng Lu ⋅ Jianhang Liu ⋅ Xinran Zhang ⋅ KOK CHUNG CHUA ⋅ Qiyue Zhao ⋅ Qinlei Xie ⋅ Yupeng Chen ⋅ Marco Pavone ⋅ Yiming Li
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
Yawen Luo ⋅ Xiaoyu Shi ⋅ Jun-hao Zhuang ⋅ Yutian Chen ⋅ Quande Liu ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Tianfan Xue
Holo-Captioning: A Comprehensive Textual View of 3D Scenes
Kun-Yu Lin ⋅ Chengke Bu ⋅ Zhenguo Li ⋅ Kai Han
Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
Chonghuinan Wang ⋅ Zhikai Chen ⋅ Chunwei Wang ⋅ Yecong Wan ⋅ Junwei Yang ⋅ Zhixin Wang ⋅ Wei Zhang ⋅ Jiaqi Xu ⋅ Renjing Pei ⋅ Xiaohe Wu ⋅ FAN LI ⋅ Wangmeng Zuo
HERO: Enhancing Multimodal Faithfulness via Dynamic Entropy-Aware Reinforcement Learning
Xiongfeng Yang ⋅ Qingan Zhang ⋅ Yuheng Zhang ⋅ Kun-Yu Lin ⋅ Jian-Fang Hu ⋅ Dongmei Jiang ⋅ WEISHI ZHENG
H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks
Seulgi Jeong ⋅ Yunseong Cho ⋅ Sanghun Park
Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding
Linghao Meng ⋅ Qiankun Li ⋅ Junyuan Mao ⋅ Pujin Liao ⋅ Zhicheng He ⋅ Enbo Zhang ⋅ Kun Wang ⋅ Yang Liu ⋅ Huazhu Fu ⋅ Yueming Jin
Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?
Lingchen Sun ⋅ Rongyuan Wu ⋅ zhengqiang ZHANG ⋅ Ruibin LI ⋅ Yujing Sun ⋅ Shuaizheng LIU ⋅ Yabin Zhang
EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation
Jiayi Luo ⋅ Hanxin Zhu ⋅ Chen Gao ⋅ Jiankun Wang ⋅ Cong Wang ⋅ Tianyu He ⋅ Jianxin Li ⋅ Zhibo Chen
MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving
Zhijing Cheng ⋅ Xuancheng Zhang ⋅ Donglin Di ⋅ Lei Fan ⋅ Baorui Ma ⋅ Hao Li ⋅ Xun Yang
Selective Synergistic Learning for Video Object-Centric Learning
WonJun Moon ⋅ Jae-Pil Heo
FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation
Qijian Tian ⋅ Xin Tan ⋅ Jiayu Ying ⋅ Xuhong Wang ⋅ Yuan Xie ⋅ Lizhuang Ma
MonoSR: Open-Vocabulary Spatial Reasoning on Monocular Images
Qirui Wang ⋅ Jingyi He ⋅ Yining Pan ⋅ Si Yong Yeo ⋅ Xulei Yang ⋅ Shijie Li
Teaching Vision-Language-Action Models What to See and Where to Look
Yuguang Yang ⋅ Canyu Chen ⋅ Zhewen Tan ⋅ Yizhi Wang ⋅ Zichao Feng ⋅ Chunyang Liu ⋅ Kehua Sheng ⋅ Bo Zhang ⋅ Yan Wang ⋅ Juan Zhang ⋅ Linlin Yang ⋅ Baochang Zhang ⋅ Xianbin Cao
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
Xiaohan Wang ⋅ Mingze Yin ⋅ Yilin Zhao ⋅ sinbadliu sinbadliu ⋅ Dian Li
Panoramic Affordance Prediction
Zixin Zhang ⋅ Chenfei Liao ⋅ Hongfei Zhang ⋅ Harold Haodong Chen ⋅ Kanghao Chen ⋅ Zichen Wen ⋅ Litao Guo ⋅ Bin Ren ⋅ Xu Zheng ⋅ Yinchuan Li ⋅ Xuming Hu ⋅ Nicu Sebe ⋅ Yingcong Chen
Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum
Zhizhao Liang ⋅ Yi-Lin Wei ⋅ Xuhang Chen ⋅ Mu Lin ⋅ Yi-Xiang He ⋅ Zhexi Luo ⋅ Jun-Hui Liu ⋅ Kun-Yu Lin ⋅ WEISHI ZHENG
OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning
Haocong He ⋅ Chenfei Liao ⋅ Zichen Wen ⋅ Zihao Dongfang ⋅ Xu Zheng ⋅ Bin Ren ⋅ Chang Su ⋅ Zixin Zhang ⋅ Harold Haodong Chen ⋅ Hongfei Zhang ⋅ Weijia Li ⋅ Kailun Yang ⋅ Conghui He ⋅ Xuming Hu ⋅ Nicu Sebe ⋅ Linfeng Zhang
A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning
Zixin Zhang ⋅ Kanghao Chen ⋅ Hanqing Wang ⋅ Hongfei Zhang ⋅ Harold Haodong Chen ⋅ Chenfei Liao ⋅ Litao Guo ⋅ Yinchuan Li ⋅ Yingcong Chen
EffiDINO: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency
Jianjian Yin ⋅ Liulei Li ⋅ Tao Chen ⋅ Yi Chen ⋅ Yazhou Yao ⋅ Wenguan Wang
MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation
Yinhan Zhang ⋅ DINGWEI TAN ⋅ Xianghao Kong ⋅ Yue Ma ⋅ Yeying Jin ⋅ Anyi Rao
FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control
Songchun Zhang ⋅ Sitong Guo ⋅ Xianghao Kong ⋅ Pengwei Liu ⋅ Yuwei Guo ⋅ lvmin zhang ⋅ Anyi Rao
Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval
Jihyun Lee ⋅ Cheol-Ho Cho ⋅ Woojin Jun ⋅ Woojin Jeong ⋅ Jae-Pil Heo
GMODiff: One-Step Gain Map Refinement with Diffusion Priors for Efficient HDR Reconstruction
Tao Hu ⋅ Weiyu Zhou ⋅ Yanjie Tu ⋅ Wei Dong ⋅ Peng Wu ⋅ Qingsen Yan ⋅ Yanning Zhang
Beyond the Embedding Bottleneck: Adaptive Retrieval-Augmented 3D CT Report Generation
Renjie Liang ⋅ Yiling Ma ⋅ Yang Xing ⋅ Zhengkang Fan ⋅ Chengkun Sun ⋅ Jinqian Pan ⋅ Li Li ⋅ Kuang Gong ⋅ Jie Xu
Swap the Right Identity: Spatio-Temporal Preference Optimization for Identity Swapping
Hongdeng Shen ⋅ Xiongzheng Li ⋅ Jikang Cheng ⋅ Duo Li ⋅ Yunlong FENG ⋅ Jing Li
LiFlow: Flow Matching for 3D LiDAR Scene Completion
Andrea Matteazzi ⋅ Dietmar Tutsch
CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation
Chenglong Liu ⋅ Xin Zhang ⋅ Yimeng Zhu ⋅ Liyang He ⋅ Yixiao Ma ⋅ Yu Su ⋅ Zhenya Huang ⋅ Qi Liu
KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding
Zeyu Liu ⋅ Zhangzhe Zhu ⋅ Yang Zhang ⋅ Chenyou Fan ⋅ Chenjia Bai ⋅ Xuelong Li
OmniLife360: A Benchmark for 3D Reconstruction from In-the-Wild 360° Captures
Zonglin Zhao ⋅ Bowen Zhang ⋅ Yatai Li ⋅ Chao.Liang Chao.Liang ⋅ Zhipeng Zhang
OmniX: Any-view and Any-time 4D reconstruction via Feed-forward Trajectory Fields
Yanqin Jiang ⋅ Tengfei Wang ⋅ Zhenwei Wang ⋅ Chenjie Cao ⋅ Junta Wu ⋅ Wenhan Luo ⋅ Weiming Hu ⋅ Jin Gao ⋅ Chunchao Guo
EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation
Nan Wang ⋅ Zhiyi Xia ⋅ Yiming Li ⋅ Shi Tang ⋅ Zoe Fan ⋅ Xi Fang ⋅ Haoyi Tao ⋅ ZHANG SIYUAN ⋅ Guolin Ke ⋅ Yanhui Hong
μFlow: Leveraging Average Images for Improving Generalisation of Deepfake Faces Detectors
Orazio Pontorno ⋅ Mattia Litrico ⋅ Luca Guarnera ⋅ Mario Valerio Giuffrida ⋅ Sebastiano Battiato
QASA: Quality-Guided K-Adaptive Slot Attention for Unsupervised Object-Centric Learning
Tianran Ouyang ⋅ Xingping Dong ⋅ Jing Zhang ⋅ Mang Ye ⋅ Kaihao Zhang ⋅ Bo Du
FreqPhys: Repurposing Implicit Physiological Frequency Prior for Robust Remote Photoplethysmography
Wei Qian ⋅ Dan Guo ⋅ Jinxing Zhou ⋅ Bochao Zou ⋅ Zitong Yu ⋅ Meng Wang
FeatTracker: Short- and Long-Range Temporal Feature Consistency for Robust Underwater Object Tracking
Jiaqing Li ⋅ Bin Lin ⋅ Chaocan Xue ⋅ Wu Ai ⋅ Qingping Zheng
OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder
Sensen Gao ⋅ Zhaoqing Wang ⋅ Qihang Cao ⋅ Dongdong Yu ⋅ Changhu Wang ⋅ Tongliang Liu ⋅ Mingming Gong ⋅ Jiawang Bian
BIP: Bi-level Information Transfer and Completion Prompting for Visual Recognition with Missing Modalities
Haoran Fan ⋅ Xu Han ⋅ Xianglong Bao ⋅ Zheng Gao ⋅ Qi Fan ⋅ Yang Song ⋅ Jiaojiao Jiang
Raymap-Guided Coupling for Drift-Robust Unposed Feed-Forward 3D Reconstruction
Xiangyu Sun ⋅ Liu.Liu Liu.Liu ⋅ Seungkwon Yang ⋅ Jingbing Han ⋅ Seungtae Nam ⋅ Zhizhong Su ⋅ Eunbyung Park
DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation
Ziyu Shan ⋅ Zhenyu Wu ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Ziwei Wang
InsertAnywhere: Geometrically Grounded and Optics-Aware Video Object Insertion
Hoiyeong Jin ⋅ Hyojin Jang ⋅ Junha Hyung ⋅ Jeongho Kim ⋅ Kinam Kim ⋅ Dongjin Kim ⋅ Huijin choi ⋅ Hyeonji Kim ⋅ Choo Jaegul
Enhancing prompt-image alignment evaluations via cyclic mutual information maximization
Xingran Liao ⋅ Duanyu Feng ⋅ Mingliang Zhou ⋅ Sam Kwong ⋅ Weisi Lin
MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting
Aman Anand ⋅ Partha Pratim Roy ⋅ Palaiahnakote Shivakumara ⋅ Umapada Pal
GEO-Detective: Unveiling Location Privacy Risks in Images with LLM Agents
Xinyu Zhang ⋅ Yixin Wu ⋅ Boyang Zhang ⋅ Chenhao Lin ⋅ Chao Shen ⋅ Michael Backes ⋅ Yang Zhang
ZAP: Zero-Shot Assembly Planning with Large Language Models
Linpeng Peng ⋅ Yanbo WANG ⋅ Chuanjie Lv ⋅ Wencan Jiang ⋅ Liming Xu ⋅ Jianbiao Mei ⋅ Xinyue Yao ⋅ Yong Liu
Bridge-UniPS: Bridging Calibrated Photometric Stereo toward Universal Photometric Stereo
Minzhe Xu ⋅ Xiaoyan Liu ⋅ YuJie Xing ⋅ Qian Chen
PixVOD: Pixel-Distributed Direct Visual Odometry and Depth Estimation
Shinjeong Kim ⋅ Ignacio Alzugaray ⋅ Callum Rhodes ⋅ Paul Kelly ⋅ Andrew Davison
Recurrent Cross-View Object Geo-Localization
Xiaohan Zhang ⋅ Siyuan Cao ⋅ Xiaokai Bai ⋅ Yiming Li ⋅ Zhangkai Shen ⋅ Zhe Wu ⋅ Lun Luo ⋅ Qi Ming ⋅ Xiaoxi Hu ⋅ Hui-Liang Shen
Geometry-Propagated Gaussian Splatting for Aerial Sparse Novel View Synthesis
Yijing Wang ⋅ Xu Tang ⋅ Jingjing Ma ⋅ Xiangrong Zhang
Exclusivity-Guided Mask Learning for Semi-Supervised Crowd Instance Segmentation and Counting
Jiyang Huang ⋅ Hongru Chen ⋅ Wei Lin ⋅ Jia Wan ⋅ Antoni Chan
Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs
Huan Zheng ⋅ Yucheng Zhou ⋅ Tianyi Yan ⋅ Dubing Chen ⋅ Hongbo Lu ⋅ Wenlong Liao ⋅ Tao He ⋅ Pai Peng ⋅ Shen Jianbing
VisWordBench: Bridging the Gap in Cross-modal Reasoning for Multimodal Large Language Models
Tianshu Zhang ⋅ Junzhe Chen ⋅ Yean Cheng ⋅ Demin Zhu ⋅ Haoze Zheng ⋅ Lijie Wen
FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction
Dubing Chen ⋅ Huan Zheng ⋅ Tianyi Yan ⋅ Yucheng Zhou ⋅ Runzhou Tao ⋅ Zhongying Qiu ⋅ Jianfei Yang ⋅ Shen Jianbing
Unmasking-Time Visual Calibration for Hallucination Mitigation in Multimodal Discrete Diffusion Language Models
Tian Qin ⋅ Junzhe Chen ⋅ Tianshu Zhang ⋅ Lijie Wen
CausalDrive: Real-time Causal World Models for Autonomous Driving
Tianyi Yan ⋅ Huan Zheng ⋅ Dubing Chen ⋅ Meizhi Qu ⋅ Yingying Shen ⋅ Lijun Zhou ⋅ Mingfei Tu ⋅ Bing Wang ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Haiyang Sun ⋅ Cheng-zhong Xu ⋅ Shen Jianbing
OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space
Zhuding Liang ⋅ Tianyi Yan ⋅ Dubing Chen ⋅ Jiasen Zheng ⋅ Huan Zheng ⋅ Cheng-zhong Xu ⋅ Yida Wang ⋅ Kun Zhan ⋅ Shen Jianbing
Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints
Lijun Guo ⋅ Haoyu Zhao ⋅ Xingyue Zhao ⋅ Rong Fu ⋅ Linghao Zhuang ⋅ Siteng Huang ⋅ Zhongyu Li ⋅ Hua Zou
SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation
Juncheng Ma ⋅ Yuxuan Du ⋅ Sun Yanan ⋅ Zhening Xing ⋅ Changlin Li ⋅ Zhenyu Tang ⋅ Bo Li ⋅ Peng-Tao Jiang ⋅ Li Yuan ⋅ Daquan Zhou ⋅ Yonghong Tian
Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation
Weijia Dou ⋅ Wenzhao Zheng ⋅ Weiliang Chen ⋅ Yu Zheng ⋅ Jie Zhou ⋅ Jiwen Lu
SynHMR: Synergistic Joint-Mesh Modeling for LiDAR-based Human Mesh Reconstruction
Rui Shi ⋅ Xiaoqi An ⋅ Lin Zhao ⋅ Di Wang ⋅ Chen Gong ⋅ Le Zhang
Revisiting Autoregressive Models for Generative Image Classification
Ilia Sudakov ⋅ Artem Babenko ⋅ Dmitry Baranchuk
NEOMAP: Novel-View Synthesis via Noise Initialization by Manifold Alternating Projection
Jinxi Li ⋅ Tianyi Zhang ⋅ Yafei YANG ⋅ Zihui Zhang ⋅ Peng Huang ⋅ Koon Lin ⋅ Bo Yang
Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision
Jiyeong Kim ⋅ Yerim So ⋅ Hyesong Choi ⋅ Uiwon Hwang ⋅ Dongbo Min
DiffProxy: Multi-View Human Mesh Recovery via Diffusion-Generated Dense Proxies
renke wang ⋅ zhenyu zhang ⋅ Ying Tai ⋅ Jun Li ⋅ Jian Yang
Reliability-Aware 3D Geometric Injection for Universal Person Re-identification
Bohan Su ⋅ Jiashuo Wang ⋅ Fangyi Liu ⋅ Mang Ye
CHARTSTYLE-100K: A Large-Scale Dataset for Structured Visualization Style Transfer
Yuwei Yang ⋅ Tianchi Xie ⋅ Jinhong Ni ⋅ Yukai Guo ⋅ Jing Zhang ⋅ Liang Zheng ⋅ Yalong Bai ⋅ YUHUI YUAN
TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On
Dingbao Shao ⋅ Song Wu ⋅ Shenyi Wang ⋅ Ye Wang ⋅ Ziheng Tang ⋅ Fei Liu ⋅ Jiang Lin ⋅ Xinyu Chen ⋅ Qian Wang ⋅ Ying Tai ⋅ Jian Yang ⋅ Zili Yi
Spatial Amsan: A Benchmark for Perception-Grounded Spatial Reasoning and Action Evaluation in Egocentric Manipulation
Changsoo Jung ⋅ Jack Fitzgerald ⋅ Ethan Seefried ⋅ Mariah Bradford ⋅ Nathaniel Blanchard
BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning
Mingi Kim ⋅ Yongjun Kim ⋅ Jungwoo Kang ⋅ Hyungki Kim
From Script to Shot: A Benchmark for Grounding Screenplays in Movies
jungu cho ⋅ Young-Jae Park ⋅ Seong Jong Ha ⋅ Siyeol Kim ⋅ Seungho Park ⋅ Jisu Shin ⋅ Junmyeong Lee ⋅ Chaemin Hwang ⋅ Hyunjun Jung ⋅ Sangeyl Lee ⋅ Hae-Gon Jeon
COVERT: Privacy-Preserving Covariant Obfuscation for VLMaaS via Exact Reparameterization and Tailored Tuning
Wenqiang Ruan ⋅ ZiRui Huang ⋅ Yu Lin ⋅ Qizhi Zhang ⋅ Yunlong Mao ⋅ Quanwei Cai ⋅ Jue Hong ⋅ Sheng Zhong ⋅ Ye Wu
CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation
Li Haodong ⋅ Chunmei Qing ⋅ Huanyu Zhang ⋅ Dongzhi Jiang ⋅ Yihang Zou ⋅ Hongbo Peng ⋅ Dingming Li ⋅ Yuhong Dai ⋅ ZePeng Lin ⋅ Juanxi Tian ⋅ Yi Zhou ⋅ Siqi Dai
CURE: Contextual Debiasing and Unbiased Refinement for Training-Free Open-Vocabulary Semantic Segmentation
Jiean Wang ⋅ Sanqing Qu ⋅ Fan Lu ⋅ Huanhuan Bao ⋅ Wei Tian ⋅ Bo Jin ⋅ Jiangtong Li ⋅ Junqiao Zhao ⋅ Guang Chen
NeuIDO: Neural Intrinsic Dynamics Operator for Physics-Informed 4D World Models
Jiajing Lin ⋅ Xin Zhang ⋅ Jianhua Sun
Decoupling Moment from Event for Video Temporal Grounding
Yuda Zou ⋅ Boxiang Zhou ⋅ Xin Zhou ⋅ YIBO CHEN ⋅ Dejia Song ⋅ Xu Tang ⋅ Yao Hu ⋅ Yongchao Xu
G2FM: A Geodesic Flow Matching Framework with Geometric Prior for Category-Level 9-DoF Pose Estimation
Qianyu Chen ⋅ Xiaogang Zhang ⋅ Yangyi Wan ⋅ Zhengzhao Pan ⋅ Kai Wang ⋅ Yuqi Cai ⋅ Wenbin Yan ⋅ feng yang ⋅ Hua Chen
Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments
Jinwoo Jang ⋅ Daniel Rho ⋅ Sihyung Yoon ⋅ Hyunsuk Cho ⋅ Honguk Woo
From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models
Zongzhao Li ⋅ Xiangzhe Kong ⋅ Jiahui Su ⋅ Zongyang Ma ⋅ Mingze Li ⋅ Songyou Li ⋅ Yuelin Zhang ⋅ Yu Rong ⋅ Tingyang Xu ⋅ Deli Zhao ⋅ Wenbing Huang
Boosting 3D Foundation Models with Featureless Pose Optimization
Mattia D'Urso ⋅ Christian Sormann ⋅ Mattia Rossi ⋅ Friedrich Fraundorfer
SkelEM: Explicit Decoupling of Topology and Details for Self-supervised Axial Super-Resolution in Volume Microscopy
Bohao Chen ⋅ Yanchao Zhang ⋅ Yanan Lv ⋅ Chenxun Deng ⋅ Hua Han ⋅ Xi Chen
BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal
Yiğit Ekin ⋅ Enes Şanlı ⋅ Aykut Erdem ⋅ Erkut Erdem ⋅ Aysegul Dundar
Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute
Daneul Kim ⋅ Jingxu Zhang ⋅ Wonjoon Jin ⋅ Sunghyun Cho ⋅ Qi Dai ⋅ Jaesik Park ⋅ Chong Luo
RCEdit-500K: Reference Completion for Image-Conditioned Image Editing
Jingxu Zhang ⋅ Daneul Kim ⋅ Yueming Pan ⋅ DONG CHEN ⋅ Kai Qiu ⋅ Yang Liu ⋅ Yifan Yang ⋅ Qi Dai ⋅ Xiaoyan Sun ⋅ Chong Luo
XSemanticFlow: Cross Object Semantic Alignment for Zero-shot Manipulation
Junyu Nan ⋅ Noam Eshed ⋅ Brian Okorn ⋅ Kris Kitani
Driving like yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving
Xiaoru Dong ⋅ Ruiqin Li ⋅ Xiao Han ⋅ Zhenxuan Wu ⋅ Jiamin Wang ⋅ Jian Chen ⋅ Qi Jiang ⋅ SM Yiu ⋅ Xinge Zhu ⋅ Yuexin Ma
Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
Yuhao Shen ⋅ Jiahe Qian ⋅ Zhangtianyi Chen ⋅ Juexiao Zhou
Reflection-Aware Reasoning for Non-Line-of-Sight Pedestrian Localization
Byeonggyu Park ⋅ Mingu Jeon ⋅ Seong-Woo Kim
Proximity-Constrained Counterfactual Decoding for Hallucination-Robust Medical VQA
Dwarikanath Mahapatra ⋅ Abhijit Das ⋅ Manish Pandey ⋅ Joy Dhar ⋅ Sudipta Roy ⋅ Zongyuan Ge ⋅ Behzad Bozorgtabar ⋅ Imran Razzak
AViTS:Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation
Haoran Qin ⋅ zhengan yan ⋅ Shikang Zheng ⋅ Xiaobing Tu ⋅ Jiacheng Liu ⋅ Yuqi Lin ⋅ Chang Zou ⋅ Jinshan Liu ⋅ Peiliang Cai ⋅ Xiantao Zhang ⋅ Jinkui Ren ⋅ Linfeng Zhang
Geometry-Preserving Image Generation for 6D Object Pose Estimation
Jiafeng Zhang ⋅ Rui Song ⋅ Zhengtai Zhang ⋅ Jiaojiao Li ⋅ Kailang Cao ⋅ Lizhang Peng ⋅ David Ferstl ⋅ Yinlin Hu
Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation
Numair Nadeem ⋅ Saeed Anwar ⋅ Muhammad Asad ⋅ Abdul Bais
Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation
Arthème Gauthier-Villars ⋅ Guodong Ding ⋅ Angela Yao
WildWorld: A Large-Scale Dataset for Action-Conditioned World Modeling with Explicit State Annotations
Zhen Li ⋅ Zian Meng ⋅ Chuanhao Li ⋅ SHUWEI SHI ⋅ Wenshuo Peng ⋅ Yuwei Wu ⋅ Bo Zheng ⋅ Yunde Jia ⋅ Kaipeng Zhang
VarProtoAD: Variational Prototype-Conditioned Prompting for Zero-Shot Anomaly Detection
Mengyang Zhao ⋅ Zhuolin He ⋅ Haiyang Yu ⋅ Teng Fu ⋅ Ke Niu ⋅ Xiangyang Xue
Surprise Forcing: What to Remember, When to Skip in Long Video Generation
SHUWEI SHI ⋅ Zhen Li ⋅ Muyao Niu ⋅ Chuanhao Li ⋅ Bo Zheng ⋅ Kaipeng Zhang ⋅ zheng yinqiang
Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction
Jorge Condor ⋅ Nicolas Moënne-Loccoz ⋅ Merlin Nimier-David ⋅ Piotr Didyk ⋅ Zan Gojcic ⋅ Qi Wu
PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
Heyuan Gao ⋅ Bangxun Tang ⋅ Yiren Song ⋅ Guian Fang ⋅ Zijian He ⋅ Jie Yang ⋅ Mike Zheng Shou
CLARITY: Medical World Model for Guiding Treatment Decisions by Simulating Context-Aware Disease Trajectories in Latent Space
Tianxingjian Ding ⋅ Yuanhao Zou ⋅ Chen Chen ⋅ Shah Mubarak ⋅ Yu Tian
GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion
Jing Wang ⋅ Haoran Xiong ⋅ Zihao Yan ⋅ Minglun Gong ⋅ Hui Huang
SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning
Xi Ye ⋅ Wenjia Yang ⋅ Yangyang Xu ⋅ Xiaoyang Liu ⋅ Duo Su ⋅ Mengfei Xia ⋅ Jun Zhu
VoCa: Unified Autoregressive Modeling for Talking Audio-Video Generation
Zhuofan Zong ⋅ Jiale Yuan ⋅ Yufei Liu ⋅ Dongzhi Jiang ⋅ Hao Shao ⋅ Zimu Lu ⋅ Ke Wang ⋅ Yunqiao Yang ⋅ Mingjie Zhan ⋅ Hongsheng LI
The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning
Brent Griffin ⋅ Jason Corso
NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation
Cheng Wan ⋅ Yongsen Mao ⋅ Wenzheng Wu ⋅ Yuxuan Xie ⋅ Chucheng Xiang ⋅ Runze Wang ⋅ Xiang Zhang ⋅ zhongyuan liu ⋅ Rushi Dai ⋅ Yuan Liu
From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models
Meng Luo ⋅ Yicheng Liu ⋅ Jiahao Wang ⋅ Yuanxing Zhang ⋅ Xin Tao ⋅ Pengfei Wan ⋅ Kun Gai ⋅ Hao Fei
Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval
Jingjing Zhang ⋅ Lei Zhang ⋅ Zheren Fu ⋅ Zhendong Mao
Region-Aware Test-Time Scaling for Compositional Image Generation
Mingzhu Shen ⋅ Peng Ye ⋅ Xinyin Ma ⋅ Gongfan Fang ⋅ Christos-Savvas Bouganis ⋅ Yiren Zhao ⋅ Xinchao Wang
Learning Structurally Consistent Representations for Multi-View Radar Semantic Segmentation
ALI ZIA ⋅ Muhammad Ramzan ⋅ Abdelwahed Khamis ⋅ Usman Ali ⋅ Abdul Rehman
Mitigate Modality-Asymmetric Forgetting via Stabilizing Visual Representations in CLIP-Based Class-Incremental Learning
Yuanhong Zhang ⋅ Yanan Chen ⋅ Xin Zhang ⋅ Zhaoyang Wang ⋅ Weizhan Zhang ⋅ Muyao Yuan ⋅ Hongjin Niu ⋅ LAN MA ⋅ Yuan Gao ⋅ Joey Tianyi Zhou
Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention
Bingde Liu ⋅ Wu Ran ⋅ Jinglei Zhang ⋅ Huanhuan Yuan ⋅ Chao Ma
Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition
zhibin ma ⋅ Pengwen Dai ⋅ Yi Liu ⋅ Xugong Qin ⋅ Chenyun Yu ⋅ Xiaochun Cao
DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture
Xiangteng He ⋅ Shunsuke SAKAI ⋅ Shivam Chandhok ⋅ Sara Beery ⋅ Kun yuan ⋅ Nicolas Padoy ⋅ Tatsuhito Hasegawa ⋅ Leonid Sigal
Streaming Dense Voxel Representations for 3D Occupancy Prediction
Seokha Moon ⋅ Janghyun Baek ⋅ Yujin Jeong ⋅ Daewon Chae ⋅ Giseop Kim ⋅ Jungbeom Lee ⋅ Jinkyu Kim ⋅ Sunwook Choi
CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection
Junhao Cai ⋅ Deyu Zeng ⋅ Junhao Pang ⋅ JunYu Chen ⋅ Qiwei Liang ⋅ Xiaopin ZHONG ⋅ Zongze Wu
EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography
Darya Taratynova ⋅ Ahmed Aly ⋅ Numan Saeed ⋅ Mohammad Yaqub
TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts
Boyuan Chen ⋅ Zichen Dang ⋅ Chuang Yang ⋅ Lap-Pui Chau ⋅ Yi Wang
SSBP: Stage-Specialized Block Pruning for Video Diffusion Models
Mengmeng Ge ⋅ Takashi Isobe ⋅ Dong Zhou ⋅ Dong Li ⋅ Emad Barsoum
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
Finn Rasmus Schäfer ⋅ Yuan Gao ⋅ Dingrui Wang ⋅ Thomas Stauner ⋅ Stephan Günnemann ⋅ Mattia Piccinini ⋅ Sebastian Schmidt ⋅ Johannes Betz
Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?
Dingrui Wang ⋅ Zhihao Liang ⋅ Hongyuan Ye ⋅ Zhexiao Sun ⋅ Zhaowei Lu ⋅ Yuchen Zhang ⋅ Yuyu Zhao ⋅ Yuan Gao ⋅ Marvin Seegert ⋅ Finn Rasmus Schäfer ⋅ Haotong Qin ⋅ Wei Li ⋅ Luigi Palmieri ⋅ Felix Jahncke ⋅ Mattia Piccinini ⋅ Johannes Betz
S2Gest: Split-Scan State Space Models for Dynamic Hand Gesture Recognition
KeFan Chen ⋅ Yong Gu ⋅ bo li ⋅ Longjie Huang ⋅ Jiajun Zhang
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
Zirui Zheng ⋅ Takashi Isobe ⋅ Tong Shen ⋅ XU JIA ⋅ Xiaomin Li ⋅ Jianbin Zhao ⋅ Mengmeng Ge ⋅ Baolu Li ⋅ Qinghe Wang ⋅ Haiwen Diao ⋅ Dong Li ⋅ Yunzhi Zhuge ⋅ Dong Zhou ⋅ Huchuan Lu ⋅ Emad Barsoum
ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space
Peiming Li ⋅ Yifan Wang ⋅ Xiaotian Zhang ⋅ Zhiyuan Hu ⋅ Shiyu Li ⋅ Zheng Wei ⋅ Yang Tang
Unpaired Geometry-Guided Sim2Real Translation for Autonomous Driving
Xinzhuo Chen ⋅ Shijie Wang ⋅ Chao Gao ⋅ Jinguang Gu ⋅ Gongjin Lan
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
Dingming Li ⋅ Hongxing Li ⋅ Zixuan Wang ⋅ Yuchen Yan ⋅ Hang Zhang ⋅ Siqi Chen ⋅ Guiyang Hou ⋅ Shengpei Jiang ⋅ Wenqi Zhang ⋅ Jun Xiao ⋅ Weiming Lu ⋅ Yueting Zhuang
InceptionGS: Generative Bootstrapping for Large-Scale Gaussian Splatting under Unstructured View Sampling
Tianheng Lu ⋅ Guangyu Wang ⋅ Ruqi Huang ⋅ Lu Fang
DANTE-W: Diffuse Albedo Neural Texturing in the Wild
Guangyu Wang ⋅ Tianheng Lu ⋅ Ruqi Huang ⋅ Lu Fang
DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation
Junzhe Jiang ⋅ Zipei Ma ⋅ Zijie Pan ⋅ Li Zhang
RBE-Flow:Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration
Mengzhu Ding ⋅ Xin Song ⋅ Xiaoke Ding ⋅ Hongwei Ding ⋅ Xuecong Liu
Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes
Xi Li ⋅ Linyuan Li ⋅ Yan Wu ⋅ Tong Rao ⋅ Kai Zhang ⋅ Xinchen Hui ⋅ Cihui Pan
Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers
Anh Nguyen ⋅ Ngan Nguyen ⋅ Hong Duc Vu ⋅ Trung Dao ⋅ Viet Nguyen ⋅ Minh Quan Dao ⋅ Kien Nguyen ⋅ Tran Bao Chi Tran ⋅ Phong Nguyen ⋅ Khoi Nguyen ⋅ Cuong Pham ⋅ Dimitris N. Metaxas ⋅ Vishal Patel ⋅ Anh Tran
Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras
Ruijun Zhang ⋅ Hang Su ⋅ Kostas Daniilidis ⋅ Ziyun Wang
Frequency Director: Learnable Mixture of Frequency Experts for Unified Concealed Scene Segmentation
Guangqian Guo ⋅ Aixi Ren ⋅ Xuehui Yu ⋅ Pengxu Wei ⋅ Yong Guo ⋅ shan gao
Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization
Byungoh Ko ⋅ Jinyoung Park ⋅ Jongha Kim ⋅ Jeehye Na ⋅ Jaewon Cho ⋅ Hyunwoo Kim
ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation
Liudi Yang ⋅ George Eskandar ⋅ Fengyi Shen ⋅ Mohammad Altillawi ⋅ Yang Bai ⋅ Chi zhang ⋅ Ziyuan Liu ⋅ Abhinav Valada
Rectified Embedding Flow Learning for Aerial Multi-view  Geo-localization
Hao Ruan ⋅ Jinliang Lin ⋅ Yingxin Lai ⋅ Zhiming Luo ⋅ Shaozi Li ⋅ Yu Zang ⋅ Cheng Wang
CabinSI: Omni-Cabin Spatial Reasoning through Explicit Visual Cognitive Maps
Mengxue Qu ⋅ Hengrui Hu ⋅ Mingming Ma ⋅ Ming Lei ⋅ Jie Gao ⋅ Henghui Ding ⋅ Yao Zhao ⋅ Kenn wu ⋅ Yunchao Wei
Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
Yeonkyeong Lee ⋅ Hyunsung Go ⋅ Jongmin Kim ⋅ Lim Sewoong ⋅ Donghoon Lee
CtrlCoMo: Controllable Co-Speech Motion Generation with Gesture–Action Disentanglement
Xinghan Wang ⋅ Ming Zhou ⋅ Yanbo Zheng ⋅ Youjiang Xu ⋅ Yuan Zhang ⋅ Mingyuan Gao ⋅ Nan Zhuang ⋅ Yadong Mu
VLMSysTrojan: Stealthy System-Aware Backdoor Attacks Against Vision-Language Models
Yezheng Cheng ⋅ Zexin Li ⋅ Jiaqi Wu ⋅ Zhihong Zhang ⋅ Simin Chen
Point Diffusion Mamba: Unified Diffusion-State-Space Modeling for Single-View 3D Reconstruction under Data Scarcity
Wei Zhou ⋅ Xinzhe Shi ⋅ Xingxing Hao ⋅ Xing Hao ⋅ Kang Li ⋅ Jinye Peng ⋅ Ying He
A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world
Steeven Janny ⋅ Leonid Antsfeld ⋅ Christian Wolf
Unified Multi-Layer Subspace Modeling for Cross-Domain OOD Detection
Gerhard Krumpl ⋅ Henning Avenhaus ⋅ Horst Possegger
PMGC-SimVP: Parametric Multi-scale Gated Convolution for Global Ionospheric TEC Prediction
Yu Xia ⋅ Yingkui Gong ⋅ Hao Zhang
SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting
YU SONG ⋅ Hao Sun ⋅ TENG SHIYU ⋅ Ikuko Nishikawa ⋅ Yen-wei Chen
FaceMoE: Mixture of Experts for Low-Resolution Face Recognition
Kartik Narayan ⋅ Vishal Patel
Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection
Ke Chen ⋅ Ling Zhou ⋅ Yi Liu ⋅ Guangqi Jiang ⋅ Gengshen Wu ⋅ Shoukun Xu
PhenoLIP: Phenotype Guided Medical Vision–Language Pretraining
Cheng Liang ⋅ Chaoyi Wu ⋅ Weike Zhao ⋅ Ya Zhang ⋅ Yanfeng Wang ⋅ Weidi Xie
SegFly: A 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale
Markus Gross ⋅ Sai Matha ⋅ Rui Song ⋅ Viswanathan Muthuveerappan ⋅ Conrad Christoph ⋅ Julius Huber ⋅ Daniel Cremers
RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing
Chenfeng Wei ⋅ Chun Wang ⋅ Boyang Zhao ⋅ Si Zuo ⋅ Shenhong WANG ⋅ Chenguang Yang
Text-based Tactile Graphics Generation for the Visually Impaired
Ruihan Gao ⋅ Joonghyuk Shin ⋅ Ava Pun ⋅ Jaesik Park ⋅ Wenzhen Yuan ⋅ Jun-Yan Zhu
FingerCap: Fine-grained Finger-level Hand Motion Captioning
Xin Shen ⋅ Rui Zhu ⋅ Lei Shen ⋅ Zhuojie Wu ⋅ Xinyu Wang ⋅ Kaihao Zhang ⋅ Tianqing Zhu ⋅ Shuchen Wu ⋅ Chenxi Miao ⋅ Weikang Li ⋅ Deguo Xia ⋅ Jizhou Huang ⋅ Xin Yu
SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model
Zhennan Chen ⋅ Tianxing Shi ⋅ Pengcheng Xu ⋅ Kepan Nan ⋅ Qian Wang ⋅ Zili Yi ⋅ Jian Yang ⋅ Ying Tai
Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing
Luca Barsellotti ⋅ Martin Sundermeyer ⋅ Mattia Segu ⋅ Nikita Araslanov ⋅ Muhammad Ferjad Naeem ⋅ Marcella Cornia ⋅ Yongqin Xian ⋅ Maxim Berman
Sticking Information in Plain Sight: Encoding and Detecting Hidden Stickers in the Real World
Christina Shatford ⋅ Szymon Rusinkiewicz
XYZ-IBD: Benchmarking Robust 6D Object Pose Estimation under Real-World Industrial Complexity
Junwen Huang ⋅ Jiaqi Hu ⋅ Peter Yu ⋅ Slobodan Ilic ⋅ Martin Sundermeyer ⋅ Benjamin Busam
PyraE2E: Enhancing End-to-End WSI Analysis via Cross-Scale Super-Resolution
Yuechuan Lin ⋅ yujian liu ⋅ Weipeng Zhang ⋅ Yanyu Fan ⋅ Zikang Wang ⋅ Dongxu Shen ⋅ Liqin Fei ⋅ Xiaoli Liu ⋅ Shidang Xu
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
Haoyuan Li ⋅ Rui Liu ⋅ Hehe Fan ⋅ Yi Yang
SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation
Hiba Dahmani ⋅ Nathan Piasco ⋅ Moussab Bennehar ⋅ Luis G Roldao Jimenez ⋅ Dzmitry Tsishkou ⋅ Laurent Caraffa ⋅ Jean-Philippe Tarel ⋅ Roland Brémond
Robust 3DGS-based SLAM via Adaptive Kernel Smoothing
Shouhe Zhang ⋅ Dayong Ren ⋅ WEN LI ⋅ Piaopiao Yu ⋅ Sensen Song ⋅ Kaikai Shao ⋅ Yurong Qian
ContextFlow: In-Context Flow Matching for Robot Manipulation
Jian Ding ⋅ Xianjie DAI ⋅ Roei Herzig ⋅ Nussair Hroub ⋅ Jinjie Mai ⋅ Dengxin Dai ⋅ Bernard Ghanem ⋅ Mohamed Elhoseiny
LayerVerse: Finding the Sweet Spot for KV-Injection in Training-Free Image Editing
Mikhail Zhirnov ⋅ Arsen Kuzhamuratov ⋅ Andrey Kuznetsov ⋅ Ivan Oseledets ⋅ Konstantin Sobolev
LESV:Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding
Fusang WANG ⋅ Nathan Piasco ⋅ Moussab Bennehar ⋅ Luis G Roldao Jimenez ⋅ Dzmitry Tsishkou ⋅ Fabien Moutarde
DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes
Chunggi Lee ⋅ Seonwook Park ⋅ Wanhua Li ⋅ Umar Iqbal ⋅ Hanspeter Pfister
AdaBridge-SR: Adaptive Bridge Matching for Real-World Image Super-Resolution
Jiangang Wang ⋅ Shangquan Sun ⋅ Aiping Zhang ⋅ Yuning Cui ⋅ Wenqi Ren
Instant Expressive Gaussian Head Avatars at Over 100 FPS
Kaiwen Jiang ⋅ Xueting Li ⋅ Seonwook Park ⋅ Ravi Ramamoorthi ⋅ Shalini De Mello ⋅ Koki Nagano
GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness
HUI YANG ⋅ Wei Sun ⋅ Jian Liu ⋅ Jian Xiao ⋅ Tao Xie ⋅ Hossein Rahmani ⋅ Ajmal Mian ⋅ Nicu Sebe ⋅ Gim Hee Lee
SignRefine: Adapting Foundational Video Models for Sign Language Generation
Anton Pelykh ⋅ Edward Fish ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
Marshall Thomas ⋅ Edward Fish ⋅ Richard Bowden
Incentive Noise and Structural Prior Infusion for Multi-Modal Object Re-Identification
Weixiang Zhou ⋅ Yuhao Wang ⋅ Xingguo Xu ⋅ Cong Wang ⋅ Weizhen Zhou ⋅ Zhixun Su ⋅ Jinshan Pan
Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models
David McAllister ⋅ Miika Aittala ⋅ Tero Karras ⋅ Janne Hellsten ⋅ Angjoo Kanazawa ⋅ Timo Aila ⋅ Samuli Laine
MapDreamer: Aerial Imagery Conditioned Latent Diffusion For Lane Level Map Generation
Julian Brandes ⋅ Philipp Crocoll ⋅ Wolfram Burgard
TAQ: Static-Deployable Temporal-Aware Quantization for Real-World Video Super-Resolution
Jinwoo Chung ⋅ Sangho An ⋅ Sungyeop Jung ⋅ Jangho Kim
FlowFace: Rectifying Identity Conditioning with Riemannian Geometry for Face Generation
Xinran Deng ⋅ Yiling Wu ⋅ Ye Tian ⋅ Libo Zhang
Multi-view Multi-vehicle Driving Dataset for Novel View Synthesis
Sanjay Dharavath ⋅ Hanvitha Mukkamala ⋅ Faizan Khan ⋅ Ioannis Kakogeorgiou ⋅ Aditya Arun ⋅ Zakaria Laskar ⋅ C. V. Jawahar
REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion
Giorgos Petsangourakis ⋅ Christos Sgouropoulos ⋅ Bill Psomas ⋅ Theodoros Giannakopoulos ⋅ Giorgos Sfikas ⋅ Ioannis Kakogeorgiou
From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology
Basit Alawode ⋅ Moshira Abdalla ⋅ Dwarikanath Mahapatra ⋅ Muhammad Muzammal Naseer ⋅ Sajid Javed
Learning Video Dynamics with Predictive Differentiable Rendering
Yujin Tang ⋅ Tian Zhou ⋅ Xin Lin ⋅ Cheng Tan ⋅ Yifan Hu ⋅ Rong Jin ⋅ SouYoung Jin ⋅ Liang Sun
OmniFace: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
Xu Guo ⋅ Fulong Ye ⋅ Xinghui Li ⋅ Pengqi Tu ⋅ Pengze Zhang ⋅ Qichao Sun ⋅ Songtao Zhao ⋅ Xiangwang Hou ⋅ Qian HE
Wavelet-Guided Semantic Signal Compensation for Inversion-Free Image Editing
Anqi Tang ⋅ Wenhao Sun ⋅ Zhaoqiang Liu
Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens
Ziran Qin ⋅ Youru Lv ⋅ Mingbao Lin ⋅ Zeren Zhang ⋅ chaofan gan ⋅ Tieyuan Chen ⋅ Liquan Shen ⋅ Junhui Hou ⋅ Chern Hong Lim ⋅ Fei Wen ⋅ Weiyao Lin
DepWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors
Seok-Young Kim ⋅ Abdelrahman Elskhawy ⋅ TAEWOOK HA ⋅ Dooyoung Kim ⋅ Eunjae Shin ⋅ Benjamin Busam ⋅ Woontack Woo
RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics
Yuzhi Huang ⋅ Jie Wu ⋅ Weijue Bu ⋅ Ziyi Xiong ⋅ Gaoyang Jiang ⋅ Ye Li ⋅ Kangye Ji ⋅ Shuzhao Xie ⋅ Yue Huang ⋅ Chenglei Wu ⋅ Jingyan Jiang ⋅ Zhi Wang
Event-based Sparse-view Background-Oriented Schlieren Tomography
Xinyu Zhou ⋅ Shihao Hu ⋅ Peiqi Duan ⋅ Chao Xu ⋅ Boxin Shi
UEval: A Benchmark for Unified Multimodal Generation
Bo Li ⋅ Yida Yin ⋅ Wenhao Chai ⋅ Xingyu Fu ⋅ Zhuang Liu
MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images
Qinyue Tong ⋅ Ziqian Lu ⋅ Jun Liu ⋅ Rui Zuo ⋅ Zheming Lu ⋅ Yueming Jin
Silhouette-based Gait Foundation Model
Dingqiang Ye ⋅ Chao Fan ⋅ Kartik Narayan ⋅ Bingzhe Wu ⋅ Chengwen Luo ⋅ Jianqiang Li ⋅ Vishal Patel
InstantHDR: Single-forward Gaussian Splatting for High Dynamic Range 3D Reconstruction
Dingqiang Ye ⋅ Jiacong Xu ⋅ Jianglu Ping ⋅ Yuxiang Guo ⋅ Chao Fan ⋅ Vishal Patel
Nexus-Vid: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
Jiazheng Xing ⋅ Hangjie Yuan ⋅ Lingling Cai ⋅ Xinyu Liu ⋅ Yujie Wei ⋅ Fei Du ⋅ Tao Feng ⋅ Hai Ci ⋅ Jiasheng Tang ⋅ Weihua Chen ⋅ Fan Wang ⋅ Yong Liu
Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation
Haoyun Chen ⋅ Fenghe Tang ⋅ Wenxin Ma ⋅ S Kevin Zhou
VPA-WM: Vision-Priors-Aligned World Models for Robust Visual Reinforcement Learning
Xu Zhang ⋅ Sicong Liu ⋅ Liwei Guo ⋅ Chenjuan Guo ⋅ Bin Yang ⋅ Yang Shu
CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models
Yucheng Zhou ⋅ Peng Luo ⋅ Qianning Wang ⋅ Cheng-zhong Xu ⋅ Shen Jianbing
Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
Jiaqi Li ⋅ Shuntian Zheng ⋅ Yixian Shen ⋅ JIA-HONG HUANG ⋅ Xiaoman Lu ⋅ Minzhe Ni ⋅ Yu Guan
EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder
Jaehun Jung ⋅ Wonjun Kim
D²R²OSR: Degradation-Disentangled Representation for Real-World Omnidirectional Image Super-Resolution
Hongyu An ⋅ Xinfeng Zhang ⋅ Xu Fan ⋅ Shijie Zhao ⋅ Li Zhang ⋅ Ruiqin Xiong
Masked Depth Modeling for Spatial Perception
Bin Tan ⋅ CHANGJIANG SUN ⋅ Xiage Qin ⋅ Hanat Adai ⋅ Zelin Fu ⋅ Tianxiang Zhou ⋅ Han Zhang ⋅ YINGHAO XU ⋅ Xing Zhu ⋅ Yujun Shen ⋅ Nan Xue
Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models
Hongyu Li ⋅ Wanjia Fu ⋅ Xiaoyan Cong ⋅ Zekun Li ⋅ Binghao Huang ⋅ Hanxiao Jiang ⋅ Xintong He ⋅ Yiqing Liang ⋅ Rao Fu ⋅ Tao Lu ⋅ Srinath Sridhar ⋅ Kevin Smith ⋅ George Konidaris ⋅ Yunzhu Li
BrepLLM: Enabling Large Language Models to Understand Boundary Representations
Liyuan Deng ⋅ Hao Guo ⋅ Yongkang Dai ⋅ Yunpeng Bai ⋅ Yifan Zhu ⋅ Yuanyuan Gao ⋅ Huaxi Huang ⋅ Yilei Shi
Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline
Xingyu Liu ⋅ Zewei He ⋅ Yu Chen ⋅ Chunyu Zhu ⋅ Zixuan Chen ⋅ Xing Luo ⋅ Zheming Lu
AlignMorph: Tuning-Free Diffusion Image Morphing via Explicit Semantic Transport
Wuyi Liu ⋅ Xu Han ⋅ Yuren Chen ⋅ Yige Mao ⋅ Zishuo Peng ⋅ Xianzhi Li
ASSCG: Just-Right Gating over Chattering for Fast–Slow LLM Planning in Autonomous Driving
Sining Ang ⋅ Yuan Chen ⋅ Liu Haiyan ⋅ Xuanyao Mao ⋅ jason bao ⋅ Xuliang Xuliang ⋅ Bingchuan Sun ⋅ Yan Wang
Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
Sanghwan Kim ⋅ Rui Xiao ⋅ Stephan Alaniz ⋅ Yongqin Xian ⋅ Zeynep Akata
From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs
Boyong Wu ⋅ Sanghwan Kim ⋅ Zeynep Akata
When Sinks Help or Hurt: Unified Framework for Attention Sink in MLLMs
Jiho Choi ⋅ Jaemin Kim ⋅ JINHWI PARK ⋅ Seunghoon Hong ⋅ Sanghwan Kim
Amplify, Aggregate, and Adjust: VideoMAE-based Holistic-Subtle Aggregation for Micro-Action Recognition
Yan Zhang ⋅ Nan Pu ⋅ Wenjing Li ⋅ Zhun Zhong ⋅ Meng Wang
Minute4D: Training High-Fidelity 4D Gaussian Splatting in One Minute
BINJIAN XIE ⋅ Chenhui Shi ⋅ Pengju Zhang ⋅ Yihong Wu
MambaRaw: Selective State Space Modeling for Efficient 4K RAW Image Reconstruction
Peize Li ⋅ Fanhu Zeng ⋅ Tongda Xu ⋅ XINJIE ZHANG ⋅ Xingtong Ge ⋅ Haotian Zhang ⋅ Xingguo Xu ⋅ Yan Wang
Denoising-GS: Gaussian Splatting with Spatial-aware Denoising
Qingyuan Zhou ⋅ Xinyi Liu ⋅ WEIDONG YANG ⋅ Ning Wang ⋅ Shuquan Ye ⋅ Ben Fei ⋅ Ying He ⋅ Wanli Ouyang
VOCA: Visual Odometry with Codec Awareness
Nouri Alexander Hilscher ⋅ Mateo de Mayo ⋅ Dominik Muhle ⋅ Christoph Hermes ⋅ Daniel Cremers
RT-SDGOD: Real-Time Single-Domain Generalized Object Detection
Yupeng Zhang ⋅ Fangzhuo Gao ⋅ Ruize Han ⋅ Wei Feng ⋅ Liang Wan
Physics Meets Perception: A Reinforcement Learning Framework for Unpaired Real-World Image Dehazing
Yunwei Lan ⋅ Zhigao Cui ⋅ Chang Liu ⋅ Menglin Zhang ⋅ Nian Wang ⋅ Cong Zhang ⋅ Dong Liu
GEM: Generative Supervision Helps Embodied Intelligence
Ruowen Zhao ⋅ Bangguo Li ⋅ ZUYAN LIU ⋅ Yinan Liang ⋅ junliang ye ⋅ FANGFU LIU ⋅ Diankun Wu ⋅ Zhengyi Wang ⋅ Xumin Yu ⋅ Yongming Rao ⋅ Han Hu ⋅ Jun Zhu
Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation
Hong Chen ⋅ Daqi Liu ⋅ Zehan Zhang ⋅ Haiguang Wang ⋅ Tianhao Lu ⋅ Longfei Yan ⋅ Haiyang Sun ⋅ Fangzhen Li ⋅ Hongwei Xie ⋅ Bing Wang ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Yihua Tan
Iterative Perceptual Alignment for VLMs via Deterministic Reconstruction Feedback
Xiaorui Chen ⋅ Hanzhong Guo ⋅ Nizhe Cai ⋅ Jieliang Luo
StyleFusion360: View-Consistent Head Stylization via Adaptive Style Modulation
Furkan Guzelant ⋅ Arda Goktogan ⋅ Tarık Kaya ⋅ Aysegul Dundar
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
Yufei Cai ⋅ Xuesong Niu ⋅ Guosheng Lin ⋅ Hao LU ⋅ Kai Wu ⋅ Kun Gai
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
Yiming Qin ⋅ Bomin Wei ⋅ Jiaxin Ge ⋅ Konstantinos Kallidromitis ⋅ Stephanie Fu ⋅ Trevor Darrell ⋅ XuDong Wang
Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models
Purui Bai ⋅ Junxian Duan ⋅ Pin Wang ⋅ Jinhua Hao ⋅ Ming Sun ⋅ Chao Zhou ⋅ Huaibo Huang
Fast Dynamic Prototypes for Unsupervised Anomaly Detection and Localization
Mingliang Li ⋅ Hanxi Li ⋅ Lin Wu ⋅ Changhong Liu ⋅ Xiaowei Zhao
SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery
Da Li ⋅ Ji-Ping Jin ⋅ Xiaodong Cun ⋅ Xuanlong Yu ⋅ Wei LIU ⋅ Rui Fan ⋅ Jiangang Kong ⋅ Kai Chen ⋅ Xi SHEN
SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation
Sung-Yeon Park ⋅ Adam Lee ⋅ Juanwu Lu ⋅ Can Cui ⋅ Luyang Jiang ⋅ Rohit Gupta ⋅ Kyungtae Han ⋅ Ahmadreza Moradipari ⋅ Ziran Wang
DR-GS: Physically-Based Deformable and Relightable 2D Gaussians
Jiaxin LI ⋅ Tong Wu ⋅ Yi Wei ⋅ Tailin Wu ⋅ Li Zhang
FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing
Fengjian Xue ⋅ Xuecheng Wu ⋅ Heli Sun ⋅ Yunyun Shi ⋅ Shi Chen ⋅ Liangyu Fu ⋅ Jinheng Xie ⋅ Dingkang Yang ⋅ Hao Wang ⋅ Junxiao Xue ⋅ Liang He
FEEL (Force-Enhanced Egocentric Learning): A Dataset for Physical Action Understanding
Eadom Dessalene ⋅ Botao He ⋅ Michael Maynord ⋅ Yonatan Tussa ⋅ Pavan Mantripragada ⋅ Yianni Karabatis ⋅ Nirupam Roy ⋅ Yiannis Aloimonos
Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen
Chengming Feng ⋅ Hesam Araghi ⋅ Liming Zheng ⋅ Julien Dupeyroux ⋅ Xucong Zhang ⋅ Jan van Gemert ⋅ Nergis Tomen
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
Zitong Xu ⋅ Huiyu Duan ⋅ Zhongpeng Ji ⋅ Xinyun Zhang ⋅ Yutao Liu ⋅ Xiongkuo Min ⋅ Ke Gu ⋅ Jian Zhang ⋅ Shusong Xu ⋅ Jinwei Chen ⋅ Bo Li ⋅ Guangtao Zhai
Multi-Modal Controlled Coherent Motion Generation
Yifei Liu ⋅ Qiong Cao ⋅ Hongwei Yi ⋅ Huaiguang Jiang ⋅ Changxing Ding
Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation
Yifei Liu ⋅ Changxing Ding ⋅ Ling Guo ⋅ Huaiguang Jiang ⋅ Qiong Cao
ESC: Emotional Self-Correction for Reliable Vision-Language Models
Tien-Huy Nguyen ⋅ Nhat Nguyen ⋅ Nhat-Huy Nguyen ⋅ Hung Nguyen ⋅ Huy Nguyen ⋅ Thanh-Huy Nguyen ⋅ Cuong Nguyen ⋅ Hoang Le ⋅ Dat Nguyen ⋅ Phat Huynh ⋅ Min Xu ⋅ Ulas Bagci
Less is More: Reducing Complexity in Vision-Language-Action Systems
Jinhui Ye ⋅ Ning Gao ⋅ Senqiao Yang ⋅ Jinliang Zheng ⋅ Zixuan Wang ⋅ Yuxin Chen ⋅ Pengguang Chen ⋅ Yilun Chen ⋅ Shu Liu ⋅ Jiaya Jia
CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement
Zhihao Yang ⋅ Zhiyu Xiang ⋅ Peng Xu ⋅ Tianyu Pu ⋅ Kai Wang ⋅ Eryun Liu ⋅ Dongping Zhang ⋅ Yong Ding
Enhancing Pretrained Model-based Continual Representation Learning via Guided Random Projection
Ruilin Li ⋅ Heming Zou ⋅ Xiufeng Yan ⋅ Zheming Liang ⋅ Jie Yang ⋅ Chenliang Li ⋅ Xue Yang
EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation
Yan Li ⋅ Ning Liao ⋅ Xiangyu Zhao ⋅ Shaofeng Zhang ⋅ Xiaoxing Wang ⋅ Yifan Yang ⋅ Junchi Yan ⋅ Xue Yang
MCPNet:Masked Coordinate Pooling-based Attention Network for Medical Landmark Detection
Gyu-Sung Ham ⋅ Gi Hyun Lim ⋅ Kanghan Oh
GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing
Mingxin Liu ⋅ Ziqian Fan ⋅ Zhaokai Wang ⋅ Leyao Gu ⋅ Zirun Zhu ⋅ YiguoHe YiguoHe ⋅ Yuchen Yang ⋅ Changyao Tian ⋅ Xiangyu Zhao ⋅ Ning Liao ⋅ Shaofeng Zhang ⋅ Qibing Ren ⋅ Zhihang Zhong ⋅ Xuanhe Zhou ⋅ Junchi Yan ⋅ Xue Yang
Calibrated Harmonic Overlaid Implicit Neural Representations for Multi-Dimensional Data
Honghang Chen ⋅ XIUJUN ZHANG ⋅ Xiaoli Sun ⋅ MINGQING XIAO
Bridging the Geometry Mismatch: Frequency-Aware Anisotropic Serialization for Thin-Structure SSMs
Jin Bai ⋅ Huiyao Zhang ⋅ Qi Wen ⋅ Ningyang Li ⋅ Shengyang Li ⋅ Atta ur Rahman ⋅ Xiaolin Tian
GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure
Bin Yang ⋅ Mohamed Abdelsamad ⋅ Miao Zhang ⋅ Michael Ulrich ⋅ Yakov Miron ⋅ Abhinav Valada ⋅ Alexandru Paul Condurache
From Local to Global: A Progressive Reconstruction Network for Diffractive Snapshot Spectral Imaging
Zhengyue Zhuge ⋅ Shiqi Chen ⋅ Chi Zhang ⋅ Jiahui Xu ⋅ Tianchen Qiu ⋅ Dingchuan Yu ⋅ Yueting Chen
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
Yukun Wang ⋅ Ruihuang Li ⋅ Jiale Tao ⋅ Shiyuan Yang ⋅ Liyi Chen ⋅ Zhantao Yang ⋅ Handz Handz ⋅ Yulan Guo ⋅ Shuai Shao ⋅ Qinglin Lu
CMDer: Controllable Mode Decomposition-Based Single Motion Synthesis with Diffusion
Junliang Chen ⋅ Sihang Chen ⋅ Xiaojuan Gu ⋅ Yoonsang Lee ⋅ Kevin Romond ⋅ Fang-Lue Zhang
2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction
Tianbao Zhang ⋅ Zhenyu Liang ⋅ Zhenbo Song ⋅ Nana Wang ⋅ Xiaomei Zhang ⋅ Xudong Cai ⋅ Zheng Zhu ⋅ Kejian Wu ⋅ Gang Wang ⋅ Zhaoxin Fan
Histogram-constrained Image Generation
Haoming Liu ⋅ Yuanhe Guo ⋅ Yijia Cao ⋅ Shenji Wan ⋅ Hongyi Wen
EvoVLA: Self-Evolving Vision-Language-Action Model
Zeting Liu ⋅ ZIDA YANG ⋅ Zeyu Zhang ⋅ Hao Tang
OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution
Shijie Zhao ⋅ Xuanyu Zhang ⋅ Bin Chen ⋅ Weiqi Li ⋅ Qunliang Xing ⋅ Kexin Zhang ⋅ Yan Wang ⋅ Junlin Li ⋅ Li Zhang ⋅ Jian Zhang ⋅ Tianfan Xue
SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning
xiuwei chen ⋅ Wentao Hu ⋅ Hanhui Li ⋅ Yongxin Wang ⋅ Jun Zhou ⋅ Zisheng Chen ⋅ Meng Cao ⋅ Yihan Zeng ⋅ Kui Zhang ⋅ Yu-Jie Yuan ⋅ Jianhua Han ⋅ Hang Xu ⋅ Xiaodan Liang
From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion
pengpeng Zeng ⋅ Yuyu Guo ⋅ Pengpeng Zeng ⋅ Jingkuan Song ⋅ Peng Di ⋅ Hang Yu ⋅ Lianli Gao
SLER-IR: Spherical Layer-wise Expert Routing for All-in-One Image Restoration
Shurui Peng ⋅ Xin Lin ⋅ Shi Luo ⋅ Jincen Ou ⋅ Dizhe Zhang ⋅ Lu Qi ⋅ Truong Nguyen ⋅ Chao Ren
VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling
Yuqi Zhang ⋅ pengpeng Zeng ⋅ Yuyu Guo ⋅ Wenjie Yang ⋅ Lingchen Meng ⋅ Peng Di ⋅ Hang Yu ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Sentinel: Embodied Cooperative Spatial Reasoning and Planning
Xiangye Lin ⋅ Hongxin Zhang ⋅ Ruxi Deng ⋅ Qinhong Zhou ⋅ Chuang Gan
Rethinking Reward Signals in Video GRPO: When Scores Become Targets
Rui Li ⋅ Yuanzhi Liang ⋅ Ziqi Ni ⋅ Haibin Huang ⋅ Chi Zhang ⋅ Xuelong Li
BackTranslation2.0 - A Linguistically Motivated Metric to Assess Sign Language Production
Oliver Cory ⋅ Maksym Ivashechkin ⋅ Oline Ranum ⋅ Jian He Low ⋅ Edward Fish ⋅ Anton Pelykh ⋅ Karahan Sahin ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
GraphCPD: Coherent Point Drift for Point Cloud Registration via Graph Signal Processing
Yingcheng Lai ⋅ Xingjian Wang ⋅ Li Chai
Enhanced Neural Video Representation Compression with High Scalability
Ho Man Kwan ⋅ Tianhao Peng ⋅ Fan Zhang ⋅ Mike Nilsson ⋅ Andrew Gower ⋅ David Bull
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing
Hao-Xuan Ma ⋅ Guannan Lai ⋅ Han-Jia Ye
PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion
Zipeng Guo ⋅ Lichen Ma ⋅ Yu He ⋅ Xiaolong Fu ⋅ Jingling Fu ⋅ Junshi Huang ⋅ Yan Li
Syn4D: A Multiview Synthetic 4D Dataset
Zeren Jiang ⋅ Yushi Lan ⋅ Yihang Luo ⋅ Yufan Deng ⋅ Zihang Lai ⋅ Edgar Sucar ⋅ Christian Rupprecht ⋅ Iro Laina ⋅ Larlus Diane ⋅ Chuanxia Zheng ⋅ Andrea Vedaldi
Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors
Songlin Yang ⋅ Tianyi Wei ⋅ Yushi Lan ⋅ Zeqi Xiao ⋅ Anyi Rao ⋅ Xingang Pan
From Local Windows to Adaptive Candidates via Individualized Exploratory: Rethinking Attention for Image Super-Resolution
Chunyu Meng ⋅ Wei Long ⋅ Shuhang Gu
InterEdit: Navigating Text-Guided Multi-Human 3D Motion Editing
Yebin Yang ⋅ Di Wen ⋅ Lei Qi ⋅ Weitong Kong ⋅ Junwei Zheng ⋅ Ruiping Liu ⋅ Yufan Chen ⋅ Chengzhi Wu ⋅ Kailun Yang ⋅ Yuqian Fu ⋅ Danda Paudel ⋅ Luc Van Gool ⋅ Kunyu Peng
DeCoPatch: Revealing Causal Latent Subspaces in Vision-Language Models for GUI Grounding
Yongkang Zhang ⋅ Linjia Kang ⋅ Zhimin Wang ⋅ Duo Wu ⋅ Zhi Wang
EVAR: Edge Visual Autoregressive Models via Principled Pruning
Zefang Wang ⋅ Ying Li ⋅ Yanyu Li ⋅ Mingluo Su ⋅ Simin Xu ⋅ Guanzhong Tian ⋅ Huan Wang
Accelerating Diffusion Models via Equal-Risk Caching
Can Zhang ⋅ Liangshun Zou
Comprehensive language–image pre-training for 3D medical image understanding
Tassilo Wald ⋅ Ibrahim Ethem Hamamci ⋅ Yuan Gao ⋅ Sam Bond-Taylor ⋅ Harshita Sharma ⋅ Maximilian Ilse ⋅ Cynthia Lo ⋅ Olesya Melnichenko ⋅ Anton Schwaighofer ⋅ Noel Codella ⋅ Maria Teodora Wetscherek ⋅ Klaus Maier-Hein ⋅ Panagiotis Korfiatis ⋅ Valentina Salvatelli ⋅ Javier Alvarez-Valle ⋅ Fernando Pérez-García
SFKD: Spatial–Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction
Cuipeng Wang ⋅ Haipeng Wang
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
Lorenzo Mur Labadia ⋅ Matthew Muckley ⋅ Amir Bar ⋅ Mido Assran ⋅ Koustuv Sinha ⋅ Michael Rabbat ⋅ Yann LeCun ⋅ Nicolas Ballas ⋅ Adrien Bardes
MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning
Revant Teotia ⋅ Adrien Bardes ⋅ Michael Rabbat ⋅ Sumit Chopra ⋅ Matthew Muckley ⋅ Nicolas Ballas
URHead: A Unified UV-Space Representation for Joint Mesh–3DGS Optimization in Head Avatars
Seonghak Lee ⋅ Junhee Cho ⋅ Jisoo Park ⋅ Min-Gyu Park ⋅ Jongmin Lee ⋅ Ju Yoon ⋅ Junseok Kwon
InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation
Qing Yu ⋅ Kent Fujiwara
Text-Conditioned Background Generation for Editable Multi-Layer Documents
Taewon Kang ⋅ Joseph K J ⋅ Christopher Tensmeyer ⋅ Jihyung Kil ⋅ Wanrong Zhu ⋅ Ming C Lin ⋅ Vlad Morariu
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
Shijie Zhou ⋅ Viet Lai ⋅ Hao Tan ⋅ Jihyung Kil ⋅ Wanrong Zhu ⋅ Changyou Chen ⋅ Ruiyi Zhang
Follow-Your-Mind: Towards Inversion-Free Brain-Driven Visual Context Synthesis and Editing
Haodong Jing ⋅ Panqi Yang ⋅ Rongchao Zhang ⋅ Zhipeng Liu ⋅ Yajun Liu ⋅ Xuehai Bai ⋅ Yongqiang Ma ⋅ Nanning Zheng
Hi-Nav: Hierarchical Framework for Continuous Vision-Language Navigation via Map Guidance and Waypoint Reasoning
Zhiyu Zhou ⋅ Bin Guan ⋅ Wenbin Yang ⋅ Zhi Gao ⋅ Hao Fang
Token-Based Affordance Grounding with Large Vision-Language Models
Seung Il Lee ⋅ Qinqian Lei ⋅ Daguang Xu ⋅ Dong Yang ⋅ Robby T. Tan ⋅ Yixin Chen ⋅ Bo Wang
IndoorSplat: Enhanced Indoor Scene Reconstruction with Structured 2D Gaussian Splatting
Min Shi ⋅ Tao Yang ⋅ Xigang Zhao ⋅ Qi Wang ⋅ Dengming Zhu ⋅ Zhaoxin Li
Task-Agnostic Incremental Vision-Language Object Detection via Prompt Augmentation and Distribution-Aware Fusion
Yonghan Jiang ⋅ Zhengyuan Xie ⋅ Wenchu Liu ⋅ Linlan Huang ⋅ Fei Yang ⋅ Xialei Liu
NanoGS: Training-Free and Lightweight Gaussian Splat Simplification
Butian Xiong ⋅ Rong Liu ⋅ Tiantian Zhou ⋅ Meida Chen ⋅ Zhiwen Fan ⋅ Andrew Feng
SLAM-Former: Putting SLAM into One Transformer
Yijun Yuan ⋅ Zhuoguang Chen ⋅ Kenan Li ⋅ Weibang Wang ⋅ Minghui Qin ⋅ Zhijian Fang ⋅ Weicheng Zheng ⋅ Hang Zhao
StructPolicy: Structure-Guided Imitation Learning Robust to Visual Domain Shifts
Zehao Du ⋅ Jiude Wei ⋅ Cewu Lu ⋅ Jianhua Sun
Frozen CLIP Priors for Robust Self-Supervised Poisson Inverse Problems
Laura C. Diaz-Delgado ⋅ Emmanuel Martinez ⋅ Henry Arguello
LDC-MTL: Balancing Multi-Task Learning through Scalable Loss Discrepancy Control
Peiyao Xiao ⋅ Chaosheng Dong ⋅ Shaofeng Zou ⋅ Kaiyi Ji
Expert Weaving: Marrying Masked AutoRegressive and Diffusion Models for Unified Image Restoration
Xin Lu ⋅ Jie Huang ⋅ Jie Xiao ⋅ Dong Li ⋅ Xueyang Fu
SplatCtrlA: Generalizable Single Image to Fully Controllable 3D Avatar
Jun Xiang ⋅ Yudong Guo ⋅ Boyang Guo ⋅ Yancheng Yuan ⋅ Juyong Zhang
RaPTGS: Render-Agnostic Post-Training Compression of 3D Gaussian Splatting
Asif Jawad ⋅ K. M. Azwad Hossain
DiscoVL: Unveiling Disentangled Cross-Modal Representation Learning via Orthogonal Adversarial Regularization for Vision-Language Models
Mengping Dong ⋅ Jinbao Li ⋅ Fei Li
Explicit Semantic–Spatial Alignment for Open-Vocabulary Object Detection
Pengyang Su ⋅ Weihong Ren ⋅ Shuhuan Han ⋅ Qian Dong ⋅ Haoran Xu ⋅ Xi Ai ⋅ Zijian Wang ⋅ Zhiyong Wang ⋅ Honghai Liu
Context-Interactive Reasoning for Group Activity Detection
Xi Ai ⋅ Weihong Ren ⋅ Shuhuan Han ⋅ Haoran Xu ⋅ Qian Dong ⋅ Pengyang Su ⋅ Zijian Wang ⋅ Shengchun Lin ⋅ Zhiyong Wang ⋅ Honghai Liu
MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting
Jianwei Hu ⋅ Tingxuan Huang ⋅ Hengyu Zhou ⋅ Ningna Wang ⋅ Xiaohu Guo ⋅ Jinshan Lai ⋅ Bin Wang
Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval
Tong Wang ⋅ Yunhan Zhao ⋅ Shu Kong
DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection
Shiyi Mu ⋅ Zichong Gu ⋅ Zhiqi Ai ⋅ Yilin Gao ⋅ Shugong Xu
SGQA: Semantic-Geometric Quality Alignment for Training-Free Few-Shot Instance Segmentation
Yuhao Qing ⋅ Liuyan Feng ⋅ Haoyuan Li
Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking
Tomislav Dobrički ⋅ Byung-Woo Hong
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
Jingwen Sun ⋅ Wenyao Zhang ⋅ Zekun Qi ⋅ Shaojie Ren ⋅ Zezhi Liu ⋅ Hanxin Zhu ⋅ Guangzhong Sun ⋅ Xin Jin ⋅ Zhibo Chen
ProAct: Agentic Lookahead in Interactive Environments
Yangbin Yu ⋅ Mingyu Yang ⋅ junyou li ⋅ Yiming Gao ⋅ Feiyu Liu ⋅ Yijun Yang ⋅ Zichuan Lin ⋅ Jiafei Lyu ⋅ Zhicong Lu ⋅ Deheng Ye ⋅ Jie Jiang
Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning
Sen Wang ⋅ Huaiyi Dong ⋅ Jingyi Tian ⋅ lijiayi lijiayi ⋅ Zhuo Yang ⋅ Tongtong Cao ⋅ Anlin Chen ⋅ Shuang Wu ⋅ Sanping Zhou ⋅ Le Wang
What is the Right Embedding Space for Contrastive Learning in Referring Expression Counting?
Kostas Triaridis ⋅ Panagiotis Kaliosis ⋅ E-Ro Nguyen ⋅ Jingyi Xu ⋅ Dimitris Samaras ⋅ Hieu Le
4D-VGGT: A SpatioTemporal Foundation Model for Dynamic Scene Geometry Estimation
Haonan Wang ⋅ Hanyu Zhou ⋅ Haoyue Liu ⋅ Luxin Yan
HuCollisionField: Resolving Self-Collisions via Neural Fields for Human Prediction
Zhengyuan Li ⋅ Zeyun Deng ⋅ Yifan Shen ⋅ Liang-Yan Gui ⋅ Miaolan Xie ⋅ Joseph Campbell ⋅ Xifeng Gao ⋅ Kui Wu ⋅ Zherong Pan ⋅ Aniket Bera
AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation
Qingda Hu ⋅ Ziheng Qiu ⋅ Jieru Zhao ⋅ Zhongxue Gan ⋅ Wenchao Ding
Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis
Xianhao Chen ⋅ Jiarui Hu ⋅ Yuanbo Yang ⋅ Xiyu Zhang ⋅ Tengyue Wang ⋅ Hujun Bao ⋅ Guofeng Zhang ⋅ Zhaopeng Cui
Gaussian Belief Propagation Network for Depth Completion
Jie Tang ⋅ Pingping Xie ⋅ Jian Li ⋅ Ping Tan
VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction
Weijie Wang ⋅ Yeqing Chen ⋅ Zeyu Zhang ⋅ Hengyu Liu ⋅ Haoxiao Wang ⋅ ZhiYuan Feng ⋅ Wenkang Qin ⋅ Feng Chen ⋅ Jiawang Bian ⋅ Zheng Zhu ⋅ Donny Y. Chen ⋅ Bohan Zhuang
BEVOpen3D: Towards Open-World 3D Object Detection in Bird's-Eye-View
Huyue Zeng ⋅ Jiaqi Yang ⋅ Xian-Feng Han
Degradation-Robust and Temporally Consistent Infrared–Visible Video Fusion via One-step Diffusion Framework
Songcheng Du ⋅ HaoYuan Xu ⋅ Xingyuan Li ⋅ Yang Zou ⋅ Jinyuan Liu ⋅ YUNPENG BAI ⋅ Ying Li
FlowInOne: Unifying Multimodal Generation as Image-in, Image-out Flow Matching
Junchao Yi ⋅ Rui Zhao ⋅ Jiahao Tang ⋅ Weixian Lei ⋅ Linjie Li ⋅ Qisheng Su ⋅ Zhengyuan Yang ⋅ Lijuan Wang ⋅ Xiaofeng Zhu ⋅ Alex Jinpeng Wang
HER-Count: Learning Hyper-Exemplar Representation for Generalized Zero-Shot Object Counting
Jianing Li ⋅ Xiaobin Liu ⋅ Ruihan Xu
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
Ikechukwu D Adebi ⋅ Sagnik Majumder ⋅ Kristen Grauman
ETCH-X: Robustify Expressive Body Fitting to Clothed Humans with Composable Synthetic Data
Xiaoben Li ⋅ Jingyi Wu ⋅ Zeyu CAI ⋅ YU Siyuan ⋅ Boqian Li ⋅ Yuliang Xiu
Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning
Jiahe Chen ⋅ Qian Shao ⋅ Qiyuan Chen ⋅ Jiaying He ⋅ Jintai Chen ⋅ Hongxia Xu ⋅ Jian Wu
EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding
Yijia Lei ⋅ Jinzhao Li ⋅ Yichi Zhang ⋅ Jiacheng Hua ⋅ Yin Li ⋅ Miao Liu
UniBYD: A Unified Framework for Learning Robotic Manipulation Across Embodiments Beyond Imitation of Human Demonstrations
Tingyu Yuan ⋅ Biaoliang Guan ⋅ Wen Ye ⋅ Ziyan Tian ⋅ Yi Yang ⋅ Weijie Zhou ⋅ Zhaowen Li ⋅ Yan Huang ⋅ Peng Wang ⋅ Chaoyang Zhao ⋅ Jinqiao Wang
PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided VLM
Siwei Meng ⋅ Yawei Luo ⋅ Ping Liu
Dual-End Consistency Model
linwei dong ⋅ Ruoyu Guo ⋅ Ge Bai ⋅ Zehuan Yuan ⋅ Yawei Luo ⋅ Changqing Zou
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
Wengyi Zhan ⋅ Mingbao Lin ⋅ Zhihang Lin ⋅ Rongrong Ji
Preserving Knowledge across Space and Time for Continual Video Deepfake Detection
Taehoon Kim ⋅ Jongwook Choi ⋅ Heejae Jo ⋅ Byungmin Park ⋅ Jongwon Choi
GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis
Yishen Liu ⋅ Hongchang Chen ⋅ Pengcheng Zhao ⋅ Yunfan Bao ⋅ Yuxi Tian ⋅ Jieming Zhang ⋅ HAO CHEN ⋅ Zhi Zheng ⋅ Yongchun Liu ⋅ Ying Li ⋅ Dongpu Cao
Color Pass-Through via Camera-Display Coupling
Ruikang Li ⋅ Molin Li ⋅ Jiarui Wu ⋅ Zhe Wei ⋅ Pengpeng Liu ⋅ Tianfan Xue
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
Linquan Wu ⋅ Tianxiang Jiang ⋅ Yifei Dong ⋅ Haoyu Yang ⋅ Fengji Zhang ⋅ Shichang Meng ⋅ AI Xuan ⋅ Linqi Song ⋅ Jacky Keung
TDSR-VLA: Transition-aware Denoising Sequence Representations for Vision-Language-Action
Dong-Woo Kim ⋅ KEUNHO SONG ⋅ Seungmin Lee ⋅ Hwanhee Ju ⋅ Eun Cha ⋅ Daekyum Kim
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations
Jiyao Liu ⋅ Junzhi Ning ⋅ Chenglong Ma ⋅ Wanying Qu ⋅ Jianghan Shen ⋅ Siqi Luo ⋅ Jinjie Wei ⋅ Jin Ye ⋅ Pengze Li ⋅ Tianbin Li ⋅ Jiashi Lin ⋅ Hongming Shan ⋅ Xinzhe Luo ⋅ Xiaohong Liu ⋅ Lihao Liu ⋅ Junjun He ⋅ Ningsheng Xu
CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization
Bo Wu ⋅ Ruoshen Mo ⋅ Justin Yue ⋅ Yanyu Zhang ⋅ Janice Nguyen ⋅ Guoyuan Wu ⋅ Amit Roy-Chowdhury ⋅ Matthew Barth ⋅ Hang Qiu
ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting
Jiayu Ding ⋅ Meilu Song ⋅ Xiaoyi Zhang ⋅ Hongbo Jin ⋅ Yichen Jin ⋅ Xiangtian Si
V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
Chenrui Fan ⋅ Yijun Liang ⋅ Shweta Bhardwaj ⋅ Kwesi Cobbina ⋅ Ming Li ⋅ Tianyi Zhou
Transferability Between Understanding and Generation in Unified Multimodal Models
Jiwon Kang ⋅ Heeji Yoon ⋅ Jaewoo Jung ⋅ Jaewon Min ⋅ Minkyeong Jeon ⋅ Biyeon Hwang ⋅ Sangwon Jung ⋅ Seungryong Kim
StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors
Wenhao Yuan ⋅ Yiyuan Ge ⋅ Deli Cai
An Inverse-Adversarial and Difficulty-Adaptive Robust Vision-Language Model
Ruobing Xu ⋅ Junhao Dong ⋅ Xiaohua Xie
ProSR: Semantic-Prototype-Guided Discrete Modeling for Physically Consistent SAR Super-Resolution
Byoungwoo Kim ⋅ Munchurl Kim
TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration
Yang Zhou ⋅ Wenxue Li ⋅ Peng Zhang ⋅ Yifei Chen ⋅ Fei Wang ⋅ Daiguo Zhou
LISA: Locality-Informed Speculative Decoding for Accelerating Autoregressive Image Generation
Ying Li ⋅ Siyong Jian ⋅ Zhaode Wang ⋅ Zhiwen Chen ⋅ Chengfei Lyu ⋅ Huan Wang
CloSeR: Unified Relational Distillation from Closed-Set Teachers for Category Discovery
Yuanpei Liu ⋅ Zhenqi He ⋅ Jialu Tang ⋅ Kai Han
Ranked Activation Shift for Post-hoc Out-of-Distribution Detection
Gianluca Guglielmo ⋅ Marc Masana
WiFlow: Estimating Optical Flow using WiFi Channel State Information
Thomas Weigel ⋅ Simon Kiefhaber ⋅ Fabian Portner ⋅ Matthias Hollick ⋅ Simone Schaub-Meyer
Free‑CD: Probabilistically Decoupled Training-Free Open-Vocabulary Change Detection with Resolution-Invariant Feature Inversion
Yongshuo Zhu ⋅ LU LI ⋅ Keyan Chen ⋅ Zhenwei Shi ⋅ ZHOU Fugen
WAFT-Stereo: Warping-Alone Field Transforms for Stereo Matching
Yihan Wang ⋅ Jia Deng
RiO-DETR: DETR for Real-time Oriented Object Detection
Zhangchi Hu ⋅ Yifan Zhao ⋅ Yansong Peng ⋅ Wenzhang SUN ⋅ Xiangchen Yin ⋅ Jie Chen ⋅ Peixi Wu ⋅ Hebei Li ⋅ xinghao wang ⋅ Dongsheng Jiang ⋅ Xiaoyan Sun
Unsupervised Semantic Segmentation Facilitates Model Understanding
Xiaoyan Yu ⋅ Lisa Mais ⋅ Peter Hirsch ⋅ Nick Lechtenbörger ⋅ Jannik Franzen ⋅ Andreas Mardt ⋅ Dagmar Kainmueller
TriMotion: Modality-Agnostic Camera Control for Video Generation
Seunghyun Shin ⋅ Song Jifei ⋅ Wooseok Jeon ⋅ Hae-Gon Jeon ⋅ Jiankang Deng
VCBench: A Streaming Counting Benchmark for Spatial-Temporal State Maintenance in Long Videos
Pengyiang Liu ⋅ Zhongyue Shi ⋅ Hongye Hao ⋅ Qi Fu ⋅ Xueting BI ⋅ Siwei Zhang ⋅ Xiaoyang Hu ⋅ Zitian Wang ⋅ Linjiang Huang ⋅ Si Liu
Dual-Generalization-aware Minimization for Continual Fine-Tuning of Vision-Language Models
Yanan Chen ⋅ Tieliang Gong ⋅ Yanle Lyu ⋅ Yuanhong Zhang ⋅ Weizhan Zhang
Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics
Enshen Zhou ⋅ Yibo Li ⋅ Jingkun An ⋅ Jiayuan Zhang ⋅ Shanyu Rong ⋅ Mengzhen Liu ⋅ Yi Han ⋅ Yuheng Ji ⋅ Huajie Tan ⋅ Jiawei He ⋅ Pengwei Wang ⋅ Zhongyuan Wang ⋅ Cheng Chi ⋅ Lu Sheng ⋅ Shanghang Zhang
Degradation-Agnostic Clarity Learning for Unpaired Image Dehazing
Zhiyuan Song ⋅ Hannan Lu ⋅ Haiqian Han ⋅ Bo Li ⋅ Chang Liu ⋅ Pengxu Wei ⋅ Xiangyang Ji ⋅ Liang Lin
MG2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation
Sijun Dai ⋅ Qiang Huang ⋅ Xiaoxing You ⋅ Jun Yu
Stabilizing Deep Reconstruction Operators with Contractive Anchoring
Arghya Sinha ⋅ Trishit Mukherjee ⋅ Kunal Chaudhury
MuCHeR: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking
Guénolé Fiche ⋅ Philippe Weinzaepfel ⋅ Romain Brégier ⋅ Fabien Baradel
BLASt3R: Bundle Adjustment of Any Image Set with Multi-View Matching and Monocular priors
Vincent Leroy ⋅ Philippe Weinzaepfel ⋅ Lojze Zust ⋅ Yohann Cabon ⋅ Jerome Revaud
Human Mesh Modeling for Anny Body
Romain Brégier ⋅ Guénolé Fiche ⋅ Matthieu Armando ⋅ Laura Bravo-Sánchez ⋅ Thomas Lucas ⋅ Philippe Weinzaepfel ⋅ Grégory Rogez ⋅ Fabien Baradel
Boxer: Robust Lifting of Open-World 2D Bounding Boxes to 3D
Daniel DeTone ⋅ Tianwei Shen ⋅ Fan Zhang ⋅ Lingni Ma ⋅ Julian Straub ⋅ Richard Newcombe ⋅ Jakob Engel
V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising
Han Lin ⋅ Xichen Pan ⋅ Zun Wang ⋅ Yue Zhang ⋅ Chu Wang ⋅ Jaemin Cho ⋅ Mohit Bansal
Graph Coloring for Multi-Task Learning
Santosh Patapati ⋅ Ian Noronha
ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency
Shih-Po Lee ⋅ Reza Ghoddoosian ⋅ Faizan Siddiqui ⋅ Enna Sachdeva ⋅ Behzad Dariush
EgoSim: Egocentric World Simulator for Embodiment Interaction Generation
Jinkun Hao ⋅ Mingda Jia ⋅ Xudong Xu ⋅ Ruiyan Wang ⋅ Xihui Liu ⋅ Ran Yi ⋅ Lizhuang Ma ⋅ Jiangmiao Pang
HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training
Maciej Wozniak ⋅ Jesper Ericsson ⋅ Hariprasath Govindarajan ⋅ Truls Nyberg ⋅ Thomas Gustafsson ⋅ Patric Jensfelt ⋅ Olov Andersson
RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video
Ulrich Prestel ⋅ Stefan Andreas Baumann ⋅ Nick Stracke ⋅ Bjorn Ommer
IDeaL: Data-Free Multi-Teacher Distillation via Improved Dead Leaves
Feyza Yavuz ⋅ Mert Bulent SARIYILDIZ ⋅ Larlus Diane
Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features
Marcus Valtonen Örnhag ⋅ Alberto Jaenal Gálvez ⋅ Stefan Adalbjörnsson
Diffusion-Based Material Regularization for Physics-Based Inverse Rendering
Jingwang Ling ⋅ Lifan Wu ⋅ Feng Xu ⋅ Shuang Zhao
DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
Yunyi Li ⋅ Yu Qiao ⋅ Yaohui Wang ⋅ Xinyuan Chen
NeLU3D: Neural Inverse Structured Light without Modeling the Projector
Giancarlo Pereira ⋅ David Fouhey ⋅ Claudio Silva ⋅ Daniele Panozzo
MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation
Sajjad Ghiasvand ⋅ Haniyeh Oskouie ⋅ Mahnoosh Alizadeh ⋅ Ramtin Pedarsani
PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models
Zeqing Wang ⋅ Keze Wang ⋅ Yabin Zhang
RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
Hanan Gani ⋅ Tejal Kulkarni ⋅ Madhoolika Chodavarapu ⋅ Nicklas Hansen ⋅ Manmohan Chandraker
VOID: Video Object and Interaction Deletion
Saman Motamed ⋅ William Harvey ⋅ Benjamin Klein ⋅ Luc Van Gool ⋅ Zhuoning Yuan ⋅ Ta-Ying Cheng
A second-order theory of texture for depth from focus
Sreekar Ranganathan ⋅ Ioannis Gkioulekas
PointLAM: Local Attentive Mamba for Efficient Point-based 3D Object Detection
Xuanming Shang ⋅ Weijia Zhang ⋅ Chao Ma
GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
Jiaxin Zhang ⋅ Junjun Jiang ⋅ Haijie LI ⋅ Youyu Chen ⋅ Kui Jiang ⋅ Dave Zhenyu Chen
ComplexMimic: Human–Scene Interaction Imitation in Complex 3D Environments
Lu Pan ⋅ Hongwei Zhao
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
Gaoxiang Cong ⋅ Liang Li ⋅ Jiaxin Ye ⋅ Zhedong Zhang ⋅ Hongming Shan ⋅ Yuankai Qi ⋅ Qingming Huang
UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Driving
Siyi Li ⋅ Qingwen Zhang ⋅ Ishan Khatri ⋅ Kyle Vedder ⋅ Eric Eaton ⋅ Deva Ramanan ⋅ Neehar Peri
From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space
Jiazi Bu ⋅ Pengyang Ling ⋅ Yujie Zhou ⋅ Yibin Wang ⋅ Yuhang Zang ⋅ Tianyi Wei ⋅ Xiaohang Zhan ⋅ Jiaqi Wang ⋅ Tong Wu ⋅ Xingang Pan ⋅ Dahua Lin
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
Geo Ahn ⋅ Inwoong Lee ⋅ Taeoh Kim ⋅ Minho Shim ⋅ Dongyoon Wee ⋅ Jinwoo Choi
Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space
Zhibing Li ⋅ Amogh Gupta ⋅ Behnoosh Parsa ⋅ Dan Casas
ReMoMask: Retrieval-Augmented Masked Motion Generation
Zhengdao Li ⋅ siheng wang ⋅ Zeyu Zhang ⋅ Hao Tang
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
Liyang Li ⋅ Wen Wang ⋅ Canyu Zhao ⋅ Tianjian Feng ⋅ Zhiyue Zhao ⋅ Hao Chen ⋅ Chunhua Shen
EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage
Max Saez-Diez ⋅ Jihoon Chung ⋅ Adam D. Wolsky ⋅ Greg Lanzalotto ⋅ Dean Knox ⋅ Jonathan Mummolo ⋅ Brandon Stewart ⋅ Olga Russakovsky
SALT: Self-Consistent Distribution Matching with Cache-Aware Training for Few-Step Video Generation
Xingtong Ge ⋅ Yi ZHANG ⋅ Yushi Huang ⋅ Dailan He ⋅ Xiahong Wang ⋅ Bingqi Ma ⋅ Guanglu Song ⋅ Yu Liu ⋅ Jun Zhang
Obliviate: Erasing Concepts from Autoregressive Image Generation Models
Hossein Shakibania ⋅ Jonas Henry Grebe ⋅ Tobias Braun ⋅ Ege Aktemur ⋅ Saleh Aslani ⋅ Mehmet Yiğit ⋅ Marcus Rohrbach
ORION: Ordinal Neural Collapse as a Representation Prior for Visual Navigation
E In Son ⋅ Jung-Taak Kim ⋅ Seung-Woo Seo
This Looks Distinctly Like That: Grounding Interpretable Recognition in Stiefel Geometry against Neural Collapse
Junhao Jia ⋅ Jiaqi Wang ⋅ Yunyou Liu ⋅ Haodong Jing ⋅ Yueyi Wu ⋅ Xian Wu ⋅ Yefeng Zheng
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video
Xinyao Zhang ⋅ Wenkai Dong ⋅ YuXin Song ⋅ Bo Fang ⋅ Qi Zhang ⋅ Jing Wang ⋅ Fan Chen ⋅ Hui Zhang ⋅ Haocheng Feng ⋅ Yu Lu ⋅ Hang Zhou ⋅ Chun Yuan ⋅ Jingdong Wang
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
YuXin Song ⋅ Wenkai Dong ⋅ Shizun Wang ⋅ Qi Zhang ⋅ Song Xue ⋅ Tao Yuan ⋅ Hu Yang ⋅ Haocheng Feng ⋅ Hang Zhou ⋅ Xinyan Xiao ⋅ Jingdong Wang
RAGrasp: A Retrieval-Augmented Framework with Diversity-Aware Modeling for Dexterous Grasp Generation
Zhuo Yang ⋅ Sanping Zhou ⋅ Sen Wang ⋅ Jingyi Tian ⋅ lijiayi lijiayi ⋅ Gang Hua ⋅ Le Wang
Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field
Licheng Zhong ⋅ Gim Hee Lee
What Moves? Localized Motion Representations for Compositional Scene Control
Frank Fundel ⋅ Malek Ben Alaya ⋅ Thomas Ressler-Antal ⋅ Stefan Andreas Baumann ⋅ Bjorn Ommer
Geometric Context Transformer for Streaming 3D Reconstruction
Lin-Zhuo Chen ⋅ Jian Gao ⋅ Shangzhan Zhang ⋅ Yihang Chen ⋅ Nan Xue ⋅ Jianyuan Wang ⋅ Christian Rupprecht ⋅ Xun Cao ⋅ Xing Zhu ⋅ Yujun Shen ⋅ Yao Yao ⋅ YINGHAO XU
MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model
Taiga Yamane ⋅ Satoshi Suzuki ⋅ Ryo Masumura ⋅ Shota Orihashi ⋅ Tomohiro Tanaka ⋅ Mana Ihori ⋅ Naoki Makishima
NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control
Chia-Wen Chen ⋅ Yan Wu ⋅ Korrawe Karunratanakul ⋅ Siyu Tang
VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
Zhaochong An ⋅ Orest Kupyn ⋅ Théo Uscidda ⋅ Andrea Colaco ⋅ Karan Ahuja ⋅ Serge Belongie ⋅ Mar Gonzalez Franco ⋅ Marta Gazulla
Divide and Align: Disentangled Vision-Language Learning for Text-Based Person Anomaly Search
Alex Ergasti ⋅ Tomaso Fontanini ⋅ Claudio Ferrari ⋅ Massimo Bertozzi ⋅ Andrea Prati
Shared LoRA Subspaces for almost Strict Continual Learning
Prakhar Kaushik ⋅ Ankit Vaidya ⋅ Shravan Sunil Chaudhari ⋅ Rama Chellappa ⋅ Alan Yuille
ReSWD: ReSTIR‘d, not shaken. Combining Reservoir Sampling and Sliced Wasserstein Distance for Variance Reduction.
Mark Boss ⋅ Andreas Engelhardt ⋅ Simon Donné ⋅ Varun Jampani
GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence
Junwei Zhou ⋅ Yu-Wing Tai
SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection
Kim Jun-Seong ⋅ Tae-Hyun Oh ⋅ Eduardo Pérez Pellitero ⋅ Youngkyoon Jang
STEP: Score-Based Temporal Energy for Human Pose Video Anomaly Detection
Jakub Micorek ⋅ Mateusz Kozinski ⋅ Horst Possegger
Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics
Alara Dirik ⋅ Stefanos Zafeiriou
UltraGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention
Yuyao Zhang ⋅ Yu-Wing Tai
GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models
Sai Karthikey Pentapati ⋅ Shashank Gupta ⋅ Rajesh Sureddi ⋅ Yuezhi Yang ⋅ Alan Bovik ⋅ Qixing Huang
Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions
Chad Weatherly ⋅ Sen Lin
Event-driven Motion Deblurring via Trajectory-based Kernel Reconstruction
Zhiwei Zhong ⋅ Peilin CHEN ⋅ Wei Dong ⋅ Bo Li ⋅ Anmin Liu ⋅ Shiqi Wang
Inference-Time Scaling of Diffusion Models via Progressive Pruning Search
Rogério Guimarães ⋅ Pietro Perona
ShellMaker: Language-Guided Exterior Completion under Structural Constraints
Ruiqi Xu ⋅ Daniel Aliaga
FoundYou: A Unified Model for Personalized Segmentation and Retrieval
Gabriele Trivigno ⋅ Marcos Alfaro Perez ⋅ Claudia Cuttano ⋅ Gabriele Berton ⋅ Luis Payá ⋅ Carlo Masone
Trustworthy Image Authentication using Forensic Knowledge Graphs
Tai Nguyen ⋅ Matthew Stamm
Capacity Overflow: A Blind Spot for Backdoor Attacks in Vision MoE
Xiaolin Xu ⋅ Tiancheng Zheng ⋅ Xiaolin Xu ⋅ Ruyi Ding
Diffusion-Based Immersive Visual Reasoning
Yifeng Zhang ⋅ Ming Jiang ⋅ Qi Zhao
MixCompress: Mixture of Experts for Variable Rate Learned Image Compression
Calvin-Khang Ta ⋅ Praneet Singh ⋅ Tong Shao ⋅ Peng Yin
Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation
Sungjune Kim ⋅ Sangpil Kim ⋅ Honglak Lee
DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation
Junyi Ouyang ⋅ Wenbin Teng ⋅ Gonglin Chen ⋅ Yajie Zhao ⋅ Haiwei Chen
Taming LLMs for Codematic Indoor Scene Generation
yixun liang ⋅ Qianyi Wu ⋅ Chuan Fang ⋅ Rui Chen ⋅ Jiahang Liu ⋅ Jianfeng Zhang ⋅ Ping Tan
On the Diffusibility of High-Dimensional Latents
Chao Feng ⋅ Zhiyang Xu ⋅ Bowei Chen ⋅ Yuanjun Xiong ⋅ Xiyao Wang ⋅ Jui-Hsien Wang ⋅ Richard Zhang ⋅ Zhe Lin ⋅ Andrew Owens ⋅ Yijun Li
Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors
Yunuo Chen ⋅ Chuqin Zhou ⋅ Jiangchuan Li ⋅ Xiaoyue Ling ⋅ Bing He ⋅ Jincheng Dai ⋅ Li Song ⋅ Guo Lu
MetaPoint: Unlocking Precise Spatial Control in Visual Generation
Dewei Zhou ⋅ Xinyu Huang ⋅ Xun Wang ⋅ Ji Xie ⋅ Yabo Zhang ⋅ Liang Li ⋅ Kunchang Li ⋅ Zongxin Yang ⋅ Yi Yang
Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors
Hanxun Yu ⋅ Xuan Qu ⋅ Lei Ke ⋅ Boqiang Zhang ⋅ YUXIN WANG ⋅ Jianke Zhu ⋅ Dong Yu
AirSplat: Alignment and Rating for Robust Feed-Forward 3D Gaussian Splatting
Minh-Quan Bui ⋅ Jaeho Moon ⋅ Munchurl Kim
Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers
Jaeah Lee ⋅ Hyunjin Kim ⋅ Jaewoong Cho ⋅ Gihyun Kwon
STARLINC: Satellite Trail Artifact Removal using Inter-Frame Correlation
Shingeon Kim ⋅ Hyeyoon Lee ⋅ Dain Kwon ⋅ Kanghyun Choi ⋅ SunJong Park ⋅ Mi-Ryang Kim ⋅ Jeong-Eun Lee ⋅ Jinho Lee
TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution
Sicheng Gao ⋅ Yixuan Liu ⋅ Tong Shen ⋅ Zhuyun Zhou ⋅ Zongwei Wu ⋅ Radu Timofte
SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation
Anbang Wang ⋅ AO Yuzhuo ⋅ Elliott (Shangzhe) Wu ⋅ Chi-Keung Tang
Back-Tracking from Clarity: Self-Learning to See Text from Afar
Duc Tri Tran ⋅ Phi Le Nguyen ⋅ Minh Hoai Nguyen
What Images Cannot Say: Language-Guided Olfactory Representation Learning
Eleftherios Tsonis ⋅ Xi WANG ⋅ Vicky Kalogeiton
OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization
Sakib Reza ⋅ Gauri Jagatap ⋅ Mohsen Moghaddam ⋅ OCTAVIA CAMPS ⋅ Andrea Fanelli
RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction
Aymen Mir ⋅ Riza Alp Guler ⋅ Jian Wang ⋅ Peter Wonka ⋅ Bing Zhou ⋅ Gerard Pons-Moll
Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning
Xuehui Wang ⋅ Xuankun Yang ⋅ Wei Shen
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
Marcel Gröpl ⋅ Jaewoo Jung ⋅ Seungryong Kim ⋅ Marc Pollefeys ⋅ Sunghwan Hong
Structured-Noise Masked Modeling for Video, Audio and Beyond
Aritra Bhowmik ⋅ Carlos Hinojosa ⋅ Fida Mohammad Thoker ⋅ Bernard Ghanem ⋅ Cees Snoek
RePL: Pseudo-label Refinement for Semi-supervised LiDAR Semantic Segmentation
Donghyeon Kwon ⋅ Taegyu Park ⋅ Suha Kwak
ARVAR: Accelerating Visual Autoregressive Model via Attention Retrospect
Jiedong Zhuang ⋅ Lu Lu ⋅ Ming Dai ⋅ Jian Chen ⋅ Qiang Liu ⋅ Haoji Hu
Scaling Laws for Black-box Adversarial Attacks
Chuan Liu ⋅ Huanran Chen ⋅ Yichi Zhang ⋅ Jun Zhu ⋅ Yinpeng Dong
GaINeR: Geometry-Aware Implicit Neural Representation for Image Editing
Weronika Jakubowska ⋅ Mikołaj Zieliński ⋅ Rafał Tobiasz ⋅ Krzysztof Byrski ⋅ Maciej Zieba ⋅ Dominik Belter ⋅ Przemysław Spurek
Consistent Video-to-Video Translation via Explicit Correspondences
Gaurav Parmar ⋅ Zhengqi Li ⋅ Richard Zhang ⋅ Jun-Yan Zhu ⋅ Srinivasa G. Narasimhan ⋅ Eli Shechtman ⋅ Yotam Nitzan
ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images
Yunfeng Wu ⋅ Hongying Cheng ⋅ Zihao He ⋅ Songhua Liu
Distribution-Aware Feature Selection for Post-hoc Out-of-Distribution Detection
Max Gutbrod ⋅ David Rauber ⋅ Christoph Palm
Test-time Counterfactual Calibration for Hallucination-Resistant Temporal Grounding
Chufan YI ⋅ Hongyu Qu ⋅ Shiyu Xuan ⋅ Rui Yan ⋅ Xiangbo Shu ⋅ Fang Zhao ⋅ Guosen Xie
AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
Dailan He ⋅ Guanlin Feng ⋅ Xingtong Ge ⋅ Yi ZHANG ⋅ Bingqi Ma ⋅ Guanglu Song ⋅ Yu Liu ⋅ Hongsheng LI
MoScale: Autoregressive Next-Scale Prediction for Human Motion Generation and Editing
Inwoo Hwang ⋅ Hojun Jang ⋅ Bing Zhou ⋅ Jian Wang ⋅ Young Min Kim ⋅ chuan guo
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
Zengqun Zhao ⋅ Ziquan Liu ⋅ Yu Cao ⋅ Shaogang Gong ⋅ Zhensong Zhang ⋅ Song Jifei ⋅ Jiankang Deng ⋅ ioannis Patras
TACO-Net: Topological Signatures Triumph in 3D Object Classification
Anirban Ghosh ⋅ Ayan Dutta
Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth
Jung-Hee Kim ⋅ Xiaoming Liu
WildProp: Visual Estimation of Wildlife Body Proportions at Scale
Mustafa Chasmai ⋅ Aaron Sun ⋅ Subhransu Maji
Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts
Weicheng Dai ⋅ Chenyu Wang ⋅ Shantanu Ghosh ⋅ Kayhan Batmanghelich
Narrative-Driven Paper-to-Slide Generation via ArcDeck
Tarik Can Ozden ⋅ SACHIDANAND VISHNUKUMAR SARMINI ⋅ Furkan Horoz ⋅ Ozgur Kara ⋅ Junho Kim ⋅ James Rehg
PercepTax: Benchmarking Cross-Property Reasoning in Vision-Language Models
Jonathan Lee ⋅ Xingrui Wang ⋅ Jiawei Peng ⋅ Luoxin Ye ⋅ Zehan Zheng ⋅ Tiezheng Zhang ⋅ Tao Wang ⋅ Wufei Ma ⋅ Siyi Chen ⋅ Yu-Cheng Chou ⋅ Prakhar Kaushik ⋅ Alan Yuille
LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models
Arpita Nema ⋅ Hanwei Zhu ⋅ Xi Zhang ⋅ Weisi Lin
SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving
Wenchao Sun ⋅ Xuewu Lin ⋅ Keyu Chen ⋅ Zixiang Pei ⋅ Xiang LI ⋅ Yining Shi ⋅ Sifa ZHENG
Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild
Trang Nguyen ⋅ Sidong Zhang ⋅ Shiv Shankar ⋅ Gauri Jagatap ⋅ Deepak Chandran ⋅ Andrea Fanelli ⋅ Madalina Fiterau
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
Shaofeng Yin ⋅ Jiaxin Ge ⋅ Zora Wang ⋅ Xiuyu Li ⋅ Chenyang Wang ⋅ Michael Black ⋅ Trevor Darrell ⋅ Angjoo Kanazawa ⋅ Haiwen Feng
High-Throughput Event-Based Feature Detection and Tracking on an Embedded CPU
Ethan Elms ⋅ Yasir Latif ⋅ Tat-Jun Chin
LogiCo: A Unified Framework for Logical and Structural Anomaly Detection
Ximiao Zhang ⋅ Min Xu ⋅ Xiuzhuang Zhou
Rethink Backdoor Robustness in Vision Transformers
Yichuan Mo ⋅ Dongxian Wu ⋅ Yifei Wang ⋅ Yisen Wang
PanoLess: Environment Reconstruction from Partial Reflective Views
Ahitagni Das ⋅ Ashok Veeraraghavan ⋅ Vivek Boominathan
Meric: A Unified Framework for Multimodal Music Generation and Retrieval via Representation Space Anchoring
Xihua Wang ⋅ Yinbo Wang ⋅ Jingchao Zhang ⋅ Ruihua Song
Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models
Juhong Min ⋅ Lazar Valkov ⋅ Vitali Petsiuk ⋅ Hossein Souri ⋅ Deen Dayal Mohan
Spectral Evolution-Guided Token Pruning in Large Multimodal Models
Bin Chen ⋅ Yuxiang Cai ⋅ Yadan Luo ⋅ Yi Zhang ⋅ Jianwei Yin ⋅ Zhi Chen
CARA: Collision-Aware Resolution Adaptation for Multiresolution Hash Encoding Based Image Fitting
Linfeng Ye ⋅ Zhixiang Chi ⋅ Shayan Mohajer Hamidi ⋅ En-Hui Yang ⋅ Konstantinos Plataniotis
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
yuhang han ⋅ Yuyang Wu ⋅ Zhengbo Jiao ⋅ Yiyu Wang ⋅ Xuyang Liu ⋅ Shaobo Wang ⋅ Hanlin xu ⋅ Xuming Hu ⋅ Linfeng Zhang
Fabric Image Demoiréing Benchmark from Synthesis to Restoration
Pengchao Wei ⋅ Xiaojie Guo
MiNQVIS: Mitigating Noisy Queries for Robust Online Video Instance Segmentation
Jie Qiao ⋅ Jianxu Chen ⋅ Xiaowei Xu
FillGS: Filling Observation Gaps in 4D Gaussian Splatting via Viewpoint-Time Selection and Generative Refinement
Takashi Otonari ⋅ Toshihiko Yamasaki
JSON: Jigsaw Self-play Optimization for Normalizing Flows
Fengxiang Yang ⋅ Tianyi Zheng ⋅ Jinwei Chen ⋅ Bo Li
Multi-dimensional Preference Alignment by Conditioning Reward Itself
JIHO JANG ⋅ Jin-Young Kim ⋅ Kyungjune Baek ⋅ Nojun Kwak
OCA: ODE-Driven Cross-Attention for Image-to-Point-Cloud Registration
Pei An ⋅ Jiaqi Yang ⋅ Yulong Wang ⋅ Quan Siwen ⋅ Liangliang Nan
FSD-Net: Foundation-Guided Spatiotemporal Distillation for Video Polyp Segmentation
Yahang Leng ⋅ Shiquan Min ⋅ Chengzhou Li
RoMan-4D: Learning Robot Arm Manipulation from 4D World Models
Kaichen Zhou ⋅ Yuzhen Chen ⋅ Fangneng Zhan ⋅ Hang Hua ⋅ Grace Chen ⋅ Xinhai Chang ⋅ Ao Qu ⋅ Yilun Du ⋅ Zhuang Liu ⋅ Paul Pu Liang ⋅ Mengyu Wang
ConTrack: Constrained Hand Motion Tracking with Adaptive Trade-off Control
Yutong Liang ⋅ Quanquan Peng ⋅ Rizhao Qiu ⋅ Xiaolong Wang
HolisticSemGes: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching
Lanmiao Liu ⋅ Esam Ghaleb ⋅ asli ozyurek ⋅ Zerrin Yumak
CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation
Ke Li ⋅ Kaidi Liang ⋅ Yuxin Ding ⋅ Debojyoti Biswas ⋅ Xianbiao Hu ⋅ Ruwen Qin
Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction
Zengjie Chen ⋅ Yuxiang Cai ⋅ Jingcai Guo ⋅ Taotao Cai ⋅ Jianwei Yin ⋅ Zhi Chen
The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
Weichen Fan ⋅ Haiwen Diao ⋅ Quan Wang ⋅ Dahua Lin ⋅ Ziwei Liu
From Visual Primitives to Semantic Masks: Fine-Grained Visual-Linguistic Alignment for Open-Vocabulary Remote Sensing Image Segmentation
Yuchen Deng ⋅ Yang Xu ⋅ Zhihui Wei ⋅ Zebin Wu
Generative Refinement Network for Visual Synthesis
Jian Han ⋅ Jinlai Liu ⋅ Jiahuan Wang ⋅ BINGYUE PENG ⋅ Zehuan Yuan
When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators
Jintao Rong ⋅ Xin Xie ⋅ Xinyi Yu ⋅ Linlin Ou ⋅ Xinyu Zhang ⋅ Chunhua Shen ⋅ Dong Gong
Histocomponent-driven Universal Model for Virtual Immunohistochemistry Multiplex Staining via Joint Manifold Evolution
Jiajun Cen ⋅ Siyuan Xu ⋅ Lili Gao ⋅ Yan Wang
LlamaSeg: Image Segmentation via Autoregressive Mask Generation
Jiru Deng ⋅ Tengjin Weng ⋅ Tianyu Yang ⋅ Wenhan Luo ⋅ Zhiheng Li ⋅ Wenhao Jiang
UniStitch: Unifying Semantic and Geometric Features for Image Stitching
Yuan Mei ⋅ Lang Nie ⋅ Kang Liao ⋅ Yunqiu Xu ⋅ Chunyu Lin ⋅ Bin Xiao
Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE
Haoyou Deng ⋅ Keyu Yan ⋅ Chaojie Mao ⋅ Xiang Wang ⋅ Yu Liu ⋅ Changxin Gao ⋅ Nong Sang
HNDiff: Haze-Noise Diffusion for Image Dehazing
Jin-Ting He ⋅ Fu-Jen Tsai ⋅ Yan-Tsung Peng ⋅ Min-Hung Chen ⋅ Chia-Wen Lin ⋅ Yen-Yu Lin
Prosthesis-Aware 3D Human Pose Estimation: A Dataset and Benchmark for RSP Users
Yilin Wen ⋅ Kechuan Dong ⋅ Fumiya Suginaka ⋅ Ken Endo ⋅ Yusuke Sugano
Denoised Variance-Based Pruning with Optimal Brain Bias Compensation
Geon Tack Lee ⋅ Choo Jaegul ⋅ Kang Eun Jeon
Heat Kernel Textures -- the Geodesic Gaussians That Do Not Splat
Simone Foti ⋅ Caner Korkmaz ⋅ Stefanos Zafeiriou ⋅ Tolga Birdal
Adaptive Neural Dynamics for Robust Geometric LiDAR-Inertial State Estimation on UAVs
Sitian Peng ⋅ Rui Wang
Learning Transferable Dynamics Priors from Action to World Modeling
Ze Huang ⋅ Zhang Jiahui ⋅ Hairuo Liu ⋅ Chenxi Zhang ⋅ Ran Cheng ⋅ Li Zhang
MArFE: Multi-Contrast MRI Arbitrary Scale Super-Resolution with Fourier Enhancement
ZHIWEN SHI
Multi-modal Knowledge Preserving Adapter for Embedding Backward Compatibility
Jaeseok Byun ⋅ Gukyeong Kwon ⋅ Han-Kai Hsu ⋅ MEHER GITIKA KARUMURI ⋅ Zhikang Zhang ⋅ Hao Yang ⋅ Davide Modolo
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
Luyu Yang ⋅ Yutong Dai ⋅ An Yan ⋅ Viraj Prabhu ⋅ Ran Xu ⋅ Zeyuan Chen
PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking
Kai Luo ⋅ Fei Teng ⋅ Mengfei Duan ⋅ Wanjun Jia ⋅ Xu Wang ⋅ Hao Shi ⋅ Kunyu Peng ⋅ Zhiyong Li ⋅ Kailun Yang
Learning to Stylize by Learning to Destylize: A Scalable Paradigm for Supervised Style Transfer
Ye Wang ⋅ Zili Yi ⋅ Yibo Zhang ⋅ Peng Zheng ⋅ Xuping Xie ⋅ Jiang Lin ⋅ Yijun Li ⋅ Yilin Wang ⋅ Rui Ma
Prompt2Effect: Training-Free LoRA Synthesis for Controllable Video Effects
Xiaomeng Yang ⋅ Yanyu Li ⋅ Gordon Qian ⋅ Ivan Skorokhodov ⋅ Viacheslav Ivanov ⋅ Avalon Vinella ⋅ Xuan Zhang ⋅ Yanzhi Wang ⋅ Sergey Tulyakov ⋅ Anil Kag
ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation
Hanxiao Sun ⋅ Mingxin Yang ⋅ Shuhui Yang ⋅ Zebin He ⋅ Xintong Han ⋅ Hongbo Fu ⋅ Chunchao Guo ⋅ Wenhan Luo
360Anything: Geometry-Free Lifting of Images and Videos to 360°
Ziyi Wu ⋅ Daniel Watson ⋅ Andrea Tagliasacchi ⋅ David Fleet ⋅ Marcus Brubaker ⋅ Saurabh Saxena
PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models
Qiyuan Zhang ⋅ Biao Gong ⋅ Shuai Tan ⋅ Zheng Zhang ⋅ Xing Zhu ⋅ Yujun Shen ⋅ Yuyuan Li ⋅ kelu Yao ⋅ Chunhua Shen ⋅ Changqing Zou
ARC-Loc: Leveraging Azimuthal Ray Convergence as a Geometric Cue for Direct Cross-View Localization
Hyeongsik Kim ⋅ Mincheol Kim ⋅ Heejoon Moon ⋅ Je Hyeong Hong
GKDT: General Keypoint Detection Transformer
Changsheng Lu ⋅ Yuxin Chen ⋅ Haokun GUI ⋅ Rong Wang ⋅ Jie Yang ⋅ Harry Yang ⋅ Anton van den Hengel ⋅ Jiaya Jia
On the Vulnerability of Parameter-Level Defenses to Model Merging
Kuangpu Guo ⋅ Jian Liang ⋅ Qingyan Zheng ⋅ Yu Yongcan ⋅ Zilei Wang ⋅ Ran He ⋅ Tieniu Tan
Kiroshi: An Agentic Perception System for High-Accuracy Image Parsing
Haipeng ZHOU ⋅ Jinshan Liu ⋅ He Zhang ⋅ Xuequan Lu ⋅ Jun Ma ⋅ Lei Zhu
DA-F2F: Domain-Adaptive Object Detection with Feature-to-Feature Modulation and Alignment
HoTaek Oh ⋅ Hee-Jun Kim ⋅ Hyo-Jun Lee
Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods
Xingsong Ye ⋅ Yongkun Du ⋅ Jiaxin Zhang ⋅ Haojie Zhang ⋅ Chong Sun ⋅ Chen Li ⋅ Jing LYU ⋅ Zhineng Chen
ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation
Hao ZHANG ⋅ Lue Fan ⋅ Weikang Bian ⋅ Zehuan Wu ⋅ Lewei Lu ⋅ Zhaoxiang Zhang ⋅ Hongsheng LI
FedNASP: Federated Vision-Language Navigation with Adaptive Step-wise Personalization
Qingqian Yang ⋅ Hao Wang ⋅ Sai Qian Zhang ⋅ Jian Li ⋅ Yang Hua ⋅ Miao Pan ⋅ Tao Song ⋅ Zhengwei Qi ⋅ Haibing Guan
A Benchmark for Heterogeneous Stereo Deblurring with Physically- and Epipolar-constrained Cross Attention
Jiah Kim ⋅ Hoju Shin ⋅ Seung-Wook Kim ⋅ Seowon Ji
VSDiffusion: Taming Ill-Posed Shadow Generation via Visibility-Constrained Diffusion
Jing Li ⋅ Jing Zhang
Evidence-Backed Video Question Answering
Shijie Wang ⋅ Honglu Zhou ⋅ Ziyang Wang ⋅ Ran Xu ⋅ Caiming Xiong ⋅ Silvio Savarese ⋅ Chen Sun ⋅ Juan Carlos Niebles
SeekFlow: Synergizing Radiology and Pathology Foundation Models for Precision Oncology via Knowledge-Guided Evidence Flow
Peixiang Huang ⋅ Yanyan Huang ⋅ Yihang Chen ⋅ Maximus Yeung ⋅ Yuming Jiang ⋅ Lequan Yu
Bottom-up modeling of repeated elements via single image analysis-by-synthesis
syrine kalleli ⋅ Alexei Efros ⋅ Mathieu Aubry
Learning to Generate Rigid Body Interactions with Video Diffusion Models
David Orlando Romero Mogrovejo ⋅ Ariana Bermudez ⋅ Viacheslav Iablochnikov ⋅ Hao Li ⋅ Fabio Pizzati ⋅ Ivan Laptev
Rethinking IRSTD: Single-Point Supervision Guided Encoder-only Framework is Enough for Infrared Small Target Detection
Rixiang Ni ⋅ Boyang Li ⋅ Chen Jun ⋅ Zhijie Chen ⋅ Feiyu Ren ⋅ Yuji Wang ⋅ Haoyang Yuan ⋅ Wujiao He ⋅ Wei An
HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising
Kai Zou ⋅ Dian Zheng ⋅ Hongbo Liu ⋅ Tiankai Hang ⋅ Bin Liu ⋅ Nenghai Yu
Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing
Jiyuan Wang ⋅ Chunyu Lin ⋅ Lei Sun ⋅ Zhi Cao ⋅ Yuyang Yin ⋅ Lang Nie ⋅ Zhenlong Yuan ⋅ Xiangxiang Chu ⋅ Yunchao Wei ⋅ Kang Liao ⋅ Guosheng Lin
Towards Unsupervised Multi-modal Semantic Segmentation
Haitian Zhang ⋅ Thai Nguyen ⋅ Xiangyuan Wang ⋅ Mohan Liu ⋅ Addison Wang
Recognizing Co-Speech Gestures in-the-Wild
Sindhu Hegde ⋅ K R Prajwal ⋅ Andrew ZISSERMAN
Difficulty-Conditioned Attribute-Specific Restoration for Low-Light Image Enhancement
Mingzhu Zhang ⋅ Shuang Li ⋅ Jiaxu Leng ⋅ Long Sun ⋅ Can Zhang ⋅ Miaoqing Wang ⋅ Xinbo Gao
ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation
Yu-Hsiang Chen ⋅ WEI-JER Chang ⋅ Yi-Ting Chen ⋅ Masayoshi TOMIZUKA
SemGAN: A Semantic and Hierarchical Adversarial Network for 3D Human Pose Estimation
Haodong Feng ⋅ Yu Xin ⋅ Guoqing Li
Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization
Swarnim Maheshwari ⋅ Syed Imam Ali ⋅ Vineeth N Balasubramanian
Composing Driving Worlds through Disentangled Control for Adversarial Scenario Generation
Yifan Zhan ⋅ Zhengqing Chen ⋅ Qingjie Wang ⋅ Zhuo He ⋅ Muyao Niu ⋅ Xiaoyang Guo ⋅ Wei Yin ⋅ Weiqiang Ren ⋅ Qian Zhang ⋅ zheng yinqiang
To Adapt or Not to Adapt? Selective Adaptation for Vision-Language Models
Siru Jiang ⋅ Yuwei Liang ⋅ Jian Liang ⋅ Ran He ⋅ Tieniu Tan
From smooth to sharp: Frequency-Decoupled Latent Optimization for Realistic Image Generation
Tejaswini Medi ⋅ Hsien-Yi Wang ⋅ Arianna Rampini ⋅ Margret Keuper
SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence
Yulu Pan ⋅ Han Yi ⋅ Seongsu Ha ⋅ Mohaiminul Islam ⋅ Benjamin Zhang ⋅ Lorenzo Torresani ⋅ Gedas Bertasius
From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
Zhixing Li ⋅ Yinan Yu
Axolotl3D: a Unified Framework for Faithful 3D Shape Completion
Anita Hu ⋅ Maria Shugrina
Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering
Oriol Jiménez-Ayguadé ⋅ Antonio Agudo
OpenCVL: An Open, Diverse, and Large-Scale Dataset for Fine-Grained Cross-View Localization
Zimin Xia ⋅ Mubariz Zaffar ⋅ Junsheng Fu ⋅ Alexandre ALahi ⋅ Julian Kooij
SpecEyes: Accelerating Agentic Multimodal LLM via Speculative Planning and Perception
Haoyu Huang ⋅ Jinfa Huang ⋅ Zhongwei Wan ⋅ Xiawu Zheng ⋅ Rongrong Ji ⋅ Jiebo Luo
SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision
Avigail Cohen Rimon ⋅ Amir Mann ⋅ Mirela Ben-Chen ⋅ Or Litany
Rolling Shutter Relative Pose Estimation Made Practical
Daniel Barath
Training-free Controllable Motion Generation under Heterogeneous Constraints
Xiaofei Hui ⋅ Bo Yan ⋅ Haoxuan Qu ⋅ Hossein Rahmani ⋅ Jun Liu
SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification
Xiaoying Wang ⋅ Yumeng He ⋅ Jingkai Shi ⋅ Jiayin Lu ⋅ Yin Yang ⋅ Ying Jiang ⋅ Chenfanfu Jiang
Walk through Paintings : Ego-centric World models from Internet Priors
Anurag Bagchi ⋅ Zhipeng Bao ⋅ Homanga Bharadhwaj ⋅ Yu-Xiong Wang ⋅ Pavel Tokmakov ⋅ Martial Hebert
EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis
Xiefan Guo ⋅ Xinzhu Ma ⋅ Haoxiang Ma ⋅ Zihao Zhou ⋅ Di Huang
NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation
Yujiang Pu ⋅ Yu Kong
TEX-Drive: Temporal Perception Meets Experience-Guided Mixture-of-Experts for End-to-End Autonomous Driving
Yitong Li ⋅ Xuchong Zhang ⋅ Fanjie Kong ⋅ Weihuang Chen ⋅ Haonan Hou ⋅ Hongbin Sun
Do Flat Minima Improve Sparse Novel View Synthesis?
Youngsik Yun ⋅ Dongjun Gu ⋅ Youngjung Uh
Enhancing Interpretability in CLIP with Optimal Transport-based Submodular Optimization for Ophthalmic Imaging
Sihong Lu ⋅ Jian Yang ⋅ Lei Luo
SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination
Athanasios Tragakis ⋅ Marco Aversa ⋅ Daniela Ivanova ⋅ Chaitanya Kaul ⋅ Roderick Murray-Smith ⋅ Daniele Faccio ⋅ Paul Henderson
Progressively Spiral Mamba Fusion for Multimodal Tracking
Zixuan Wang ⋅ Baojie Fan ⋅ Jiajun Ai ⋅ Wenzhang Zhou
DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation
Sung-Hoon Yoon ⋅ Hoyong Kwon ⋅ Changgyoon Oh ⋅ KUK-JIN YOON
Learning Active Perception for Pixel-Space Reasoning via Visual-Intent Stratified GRPO
Mingkang Zhu ⋅ Xi Chen ⋅ Senqiao Yang ⋅ Bei Yu ⋅ Hengshuang ZHAO ⋅ Jiaya Jia
FPicker: Topology-Guided Evolution for Filament Tracing in Low-SNR Microscopy
Tingyin Zhao ⋅ Mingtao Huang ⋅ Yuan Shen
Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Synthesis
Chenghao Qian ⋅ Nedko Savov ⋅ Lingdong Kong ⋅ Yeying Jin ⋅ Rui Song ⋅ Wenjing Li ⋅ Zhun Zhong ⋅ Jiaqi Ma ⋅ Gustav Markkula ⋅ Luc Van Gool
Domain Generalization via Text-Anchored Information Bottleneck
Eunyi Lyou ⋅ YUNJEONG CHOI ⋅ Junho Lee ⋅ Lee Joonseok
VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On
XIAOYE LIANG ⋅ Zhiyuan Qu ⋅ Mingye Zou ⋅ Jiaxin Liu ⋅ Lai Jiang ⋅ Mai Xu ⋅ Yiheng Zhu
If It's Not Efficient, It's Not Usable: Real-Time OOD Detection with Latent De-Biasing and High-Quality Negative Samples
Yuchuan Li ⋅ Jae-Mo Kang ⋅ Il-Min Kim
Efficient Quantization-Aware Adaptation for Visual Foundation Models
Yinglong Li ⋅ Xiaoyu Liu ⋅ Yutong Liu ⋅ Yueyi Zhang ⋅ Zhiwei Xiong
Learning to Corrupt for Better Restoration
Joonkyu Park ⋅ Wooseok Lee ⋅ Jaeha Kim ⋅ Sehoon Kim ⋅ Bokyeung Lee ⋅ Kyoung Mu Lee
FontCopilot: Towards Generalist Multimodal Large Language Models for Holistic Chinese Font Engineering
Yu Liu ⋅ Yang Liu ⋅ Ying Gao ⋅ Yang Ding ⋅ Cunrui Wang
MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos
ZIREN GONG ⋅ Xiaohan Li ⋅ Fabio Tosi ⋅ Ninghui Xu ⋅ Stefano Mattoccia ⋅ Jianfei Cai ⋅ Matteo Poggi
MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution
Chunzheng Zhu ⋅ Jiaqi Zeng ⋅ Junyu Jiang ⋅ Jianxin Lin ⋅ Yijun Wang
Fast and Compact 3D Gaussian Splatting with Polarized Opacity Prior
Zi-Ming Wang ⋅ Kevin Duan ⋅ Ko Wei Huang ⋅ Akihiro Sugimoto ⋅ Shang-Hong Lai
Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation
Hyun-Kurl Jang ⋅ Jihun Kim ⋅ Hyeokjun Kweon ⋅ KUK-JIN YOON
Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations
Shunqi Mao ⋅ Wei Guo ⋅ Chaoyi Zhang ⋅ Jieting Long ⋅ Ke Xie ⋅ Weidong Cai
Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout
Haozhuang Chi ⋅ Daosheng Qiu ⋅ Hao Su ⋅ Haochen Liu ⋅ Zirui Li ⋅ Haoruo Zhang ⋅ Chen Lv
GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction
Enpeng Li ⋅ Yunzhou Zhang ⋅ Zhiyao Zhang ⋅ Dexuan Lyu ⋅ Chenyu Wang ⋅ Chiyuan Cui ⋅ Cheng Cheng
Semantic Generative Tuning for Unified Multimodal Models
Songsong Yu ⋅ Yuxin Chen ⋅ Ying Shan ⋅ Yanwei Li
Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs
Yung-Hsu Yang ⋅ Luigi Piccinelli ⋅ Samuel Rota Bulò ⋅ Sunghwan Hong ⋅ Denys Rozumnyi ⋅ Johannes Schönberger ⋅ Zuria Bauer ⋅ Hermann Blum ⋅ Peter Kontschieder ⋅ Marc Pollefeys
Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT
Aujasvit Datta ⋅ Jiayun Wang ⋅ Asad Aali ⋅ Anima Anandkumar
RefAlign: Representation Alignment for Reference-to-Video Generation
Lei Wang ⋅ YuXin Song ⋅ Ge Wu ⋅ Haocheng Feng ⋅ Hang Zhou ⋅ Jingdong Wang ⋅ Yaxing Wang ⋅ Jian Yang
Hierarchical Hyperbolic Representation Learning for Aerial-Ground Person Re-Identification
QiWei Yang
Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization
Liyao Wang ⋅ Ruipu Wu ⋅ Haojun Xu ⋅ Lei Shi ⋅ Linjiang Huang ⋅ Si Liu
Training-Free Multi-Concept Image Editing
Niki Maria Foteinopoulou ⋅ Ignas Budvytis ⋅ Stephan Liwicki
Online Versatile Incremental Learning: Towards Class and Domain-Agnostic Adaptation at Any Time
Jaeho Lee ⋅ Jun-Yeong Moon ⋅ Min-Yeong Park ⋅ Jung Uk Kim ⋅ Gyeong-Moon Park
DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing
Jaeho Lee ⋅ Jeongeun Lee ⋅ Gyeong-Moon Park
Any to Full: Prompting Depth Anything for Depth Completion in One Stage
Zhiyuan Zhou ⋅ Ruofeng Liu ⋅ TAICHI LIU ⋅ Weijian Zuo ⋅ Shanshan Wang ⋅ Zhiqing Hong ⋅ Desheng Zhang
ID-PreFeR: ID-Preserving Face Restoration with Mixed Data Quality
Chengxuan Zhu ⋅ Yuchen Hong ⋅ Qingnan Fan ⋅ Qi Zhang ⋅ Bingtao Fu ⋅ Jinxiu Liang ⋅ Jinwei Chen ⋅ Huaqi Zhang ⋅ Chao Xu ⋅ Boxin Shi
Triangular Consistency as a Universal Constraint for Learning Optical Flow
Yi Xiao ⋅ Carlos Coronel ⋅ Jing Zhan ⋅ Haniyeh Oskouie ⋅ Alex Wong ⋅ DONG LAO
COSY: Compositional 3DGS Synthesis for Disentangled Human Head Editing
Florian Barthel ⋅ Shalini De Mello ⋅ Koki Nagano ⋅ Wieland Morgenstern ⋅ Anna Hilsmann ⋅ Peter Eisert
OmniPoser: Flexible Human Motion Recovery in the Wild with Masked Flow Matching
Minghao Liu ⋅ Tutian Tang
3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism
Weston Bondurant ⋅ Srijan Das ⋅ Hieu Le ⋅ Stephanie Schuckers
Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal
Radim Špetlík ⋅ David Futschik ⋅ Radek Danecek ⋅ Feitong Tan ⋅ Ziqian Bai ⋅ Rohit Pandey ⋅ Yinda Zhang
Honey, I Shrunk the Arc de Triomphe!
Yuanbo Xiangli ⋅ Hanyu Chen ⋅ Xueqing Tsang ⋅ Noah Snavely
Exo2EgoPolicy: Pose-Aligned Cross-View Policy Learning
Hritam Basak ⋅ Hadi Tabatabaee ⋅ Xin Yang ⋅ Shreekant Gayaka ⋅ Nan Qiao ⋅ Yuyin Sun ⋅ Cheng-Hao Kuo ⋅ Zhaozheng Yin ⋅ Min Sun
VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models
Dominick Reilly ⋅ Manish Govind ⋅ Le Xue ⋅ Srijan Das
Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision
Dominick Reilly ⋅ Manish Govind ⋅ Le Xue ⋅ Srijan Das
LangLoc: “Tell Me What You See”
Shaurya Kishore Panwar ⋅ Roham Zendehdel Nobari ⋅ Shirley Lau ⋅ Abu Bakr Rahman Shaik ⋅ Manuel Günther ⋅ Marc Pollefeys ⋅ Daniel Barath
Reconstructing Humans and Objects in Interaction using Large Reconstruction Models
Agniv Chatterjee ⋅ Georgios Pavlakos
DnA: Denoising Attention for Visual Tasks
Ron Campos ⋅ Subhajit Maity ⋅ Xin Li ⋅ Srijan Das ⋅ Aritra Dutta
Kirin: Animal Motion Generation from In-the-Wild Video
Brian Nlong Zhao ⋅ Zhuoyang Pan ⋅ James Rehg ⋅ Jiajun Wu ⋅ Elliott (Shangzhe) Wu
CHIMERA: Adaptive Cache Injection and Semantic Anchor Prompting for Zero-shot Image Morphing with Morphing-oriented Metrics
Dahyeon Kye ⋅ Jeahun Sung ⋅ Minkyu Jeon ⋅ Jihyong Oh
Beyond Attention: Convolutional Global Context for Remote Sensing Change Detection
Zhenyu Yang ⋅ Gensheng Pei ⋅ Junzhu Mao ⋅ Xinhao Cai ⋅ Tao Chen ⋅ Yazhou Yao
RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models
Ritika Allada ⋅ Pinar Yanardag
Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention
Sounak Mondal ⋅ Dimitris Samaras ⋅ Gregory Zelinsky ⋅ Minh Hoai Nguyen
Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models
Wenyue Chen ⋅ Wenjue Chen ⋅ Peng Li ⋅ Qinghe Wang ⋅ XU JIA ⋅ Heliang Zheng ⋅ Rongfei Jia ⋅ Yuan Liu ⋅ Ronggang Wang
Benchmarking Federated Learning & Knowledge Distillation for Point Cloud Classification
Aizierjiang Aiersilan
ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering
Zhentao Guo ⋅ Chen Duan ⋅ Tongkun Guan ⋅ Zining Wang ⋅ Kai zhou ⋅ Pengfei Yan
Active View Selection with Perturbed Gaussian Ensemble for Tomographic Reconstruction
Yulun Wu ⋅ Ruyi Zha ⋅ Wei Cao ⋅ Yingying Li ⋅ Yuanhao Cai ⋅ Yaoyao Liu
OctWorld: Long-Range World-Consistent Video Generation with Octree-based 3D Mapping
Zelong Lv ⋅ Sicheng Xu ⋅ Jianfeng Xiang ⋅ Yue Dong ⋅ Ruicheng Wang ⋅ Yu Deng ⋅ Guangzhong Sun ⋅ Jiaolong Yang
VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors
Atif Belal ⋅ Heitor Medeiros ⋅ Marco Pedersoli ⋅ Eric Granger
LiteGS: a high-performance framework to train 3dgs in subminutes via system and algorithm codesign
Kaimin Liao ⋅ Hua Wang ⋅ Zhi Chen ⋅ Luchao Wang ⋅ Yaohua Tang
Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision
Dacheng Qi ⋅ Chenyu Wang ⋅ Jingwei Xu ⋅ Yi Ma ⋅ Shenghua Gao
From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation
Baixuan Zhao ⋅ Xinyu Zhang ⋅ 华渝 郑 ⋅ Shuaicheng Liu ⋅ Xiongkuo Min ⋅ Guangtao Zhai ⋅ Xiaohong Liu
REFINE: Super-efficient Pruning for 3D Gaussian Splatting via Rendering-Free Primitive Importance
Zhang Chen ⋅ Shuai Wan ⋅ MengtingYu MengtingYu ⋅ Fuzheng Yang ⋅ Junhui Hou
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision
Sun Lang ⋅ Ronghao Fu ⋅ Zhuoran Duan ⋅ Haoran Liu ⋅ Xueyan Liu ⋅ Bo Yang
Interact3D: Compositional 3D Generation of Interactive Objects
Hui Shan ⋅ Keyang Luo ⋅ Ming Li ⋅ Sizhe Zheng ⋅ Yanwei Fu ⋅ Zhen Chen ⋅ Xiangru Huang
Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs
Hung-Jen Chen ⋅ Yu-Heng Ho ⋅ Ting-Yao Huang ⋅ Po-Hsiang Hsu ⋅ LIYU CHEN ⋅ Chun-Yi Lee ⋅ Min Sun
Unsupervised Point Cloud Registration via Training-Time Semantic Guidance
Kezheng Xiong ⋅ Shiyun Xu ⋅ Sheng Ao ⋅ Siqi Shen ⋅ Cheng Wang ⋅ Chenglu Wen
Learning Accurate Segmentation Purely from Self-Supervision
Zuyao You ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Revisiting Avatar-As-Image: High-Fidelity Registration is All You Need
Margaret Kostyrko ⋅ Yuxuan Xue ⋅ Garvita Tiwari ⋅ Gerard Pons-Moll
Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs
Haochen Han ⋅ Jue Wang ⋅ Alex Jinpeng Wang ⋅ Fangming Liu
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
Zhaoqing Wang ⋅ Xiaobo Xia ⋅ Zhuolin Bie ⋅ Jinlin Liu ⋅ Dongdong Yu ⋅ Jiawang Bian ⋅ Changhu Wang
InfraNet: Quality-Aware RGB Guidance for Infrared Object Detection
Zichao Feng ⋅ Haodong Zhu ⋅ JingYing Yang ⋅ Linlin Yang ⋅ Yangyang Ren ⋅ Sheng Xu ⋅ Yuguang Yang ⋅ Xuhui Liu ⋅ Juan Zhang ⋅ Tian Wang ⋅ Baochang Zhang
Beyond Inpainting: Unleash 3D Understanding for Stable Camera-Controlled Video Re-rendering
Dongyu Chen ⋅ Yixin Guo ⋅ Shuojin Yang ⋅ Tai-Jiang Mu ⋅ Shimin Hu
GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis
Minjun Kang ⋅ Inkyu Shin ⋅ Taeyeop Lee ⋅ Myungchul Kim ⋅ In Kweon ⋅ KUK-JIN YOON
Glance: Accelerating Diffusion Models with 1 Sample
Zhuobai Dong ⋅ Rui Zhao ⋅ songjie wu ⋅ Suyang Hou ⋅ Junchao Yi ⋅ Zhengyuan Yang ⋅ Lijuan Wang ⋅ Alex Jinpeng Wang
RePlan: Reasoning-Guided Region Planning for Complex Instruction-Based Image Editing
Tianyuan Qu ⋅ Lei Ke ⋅ Xiaohang Zhan ⋅ Longxiang Tang ⋅ Yuqi Liu ⋅ Bohao PENG ⋅ Bei Yu ⋅ Dong Yu ⋅ Jiaya Jia
Hierarchical Style Aggregation for Versatile Chinese Handwriting Generation
Jiangpeng Wang ⋅ Fei Gao ⋅ Nannan Wang
Inference-time Motion Calibration for Video Generation
Zile Huang ⋅ Ser-Nam Lim
Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations
Xiaoyu Dong ⋅ Jiahuan Li ⋅ Ziteng Cui ⋅ Naoto Yokoya
UniGeo: Unifying Geometric Constraints for Camera-Controllable Image Editing via Video Priors
Hong Jiang ⋅ Wensong Song ⋅ Zongxin Yang ⋅ Ruijie Quan ⋅ Yi Yang
GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos
Yiqian Wu ⋅ Rawal Khirodkar ⋅ Egor Zakharov ⋅ Timur Bagautdinov ⋅ Lei Xiao ⋅ Zhaoen Su ⋅ Shunsuke Saito ⋅ Xiaogang Jin ⋅ Junxuan Li
HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits
Leyang Jin ⋅ Yujian Zheng ⋅ Bingkui Tong ⋅ Yuda Qiu ⋅ Zhenyu Xie ⋅ Hao Li
LogFA: Efficient Feature-Space Data Augmentation for Egocentric Temporal Action Segmentation
Zijia Lu ⋅ Ehsan Elhamifar
Compact and Structurally Transparent Cervical Cytology with Geometry-Driven Features and Closed-Form Attention
Dichao Liu
Nexels: Neurally-Textured Surfels for Real-Time Novel View Synthesis with Sparse Primitives
Victor Rong ⋅ Jan Held ⋅ Victor Chu ⋅ Daniel Rebain ⋅ Marc Van Droogenbroeck ⋅ Kyros Kutulakos ⋅ Andrea Tagliasacchi ⋅ David Lindell
PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
Pin Tang ⋅ Guoqing Wang ⋅ Xiangxuan Ren ⋅ Zhongdao Wang ⋅ Guodongfang Zhao ⋅ Bailan Feng ⋅ Chao Ma
See Only When Needed: Context-Aware Attention Intervention for Hallucination-Free LVLMs
Yuqing Lei ⋅ Wenbo Lyu ⋅ Yingjun Du ⋅ Xiantong Zhen ⋅ Cees Snoek ⋅ Ling Shao
SPAR: A Sequential Primacy and Attribution Ranking Framework for Skill Determination
Hui Yu ⋅ Xiao Ke ⋅ Zhihong Zeng ⋅ Huangbiao Xu ⋅ Huanqi Wu ⋅ Yaru Su
Doe-2: 3D Representation World Model for Unified Driving Scene Forecasting
Dong Zhuo ⋅ Wenzhao Zheng ⋅ Sicheng Zuo ⋅ Yuanhui Huang ⋅ Siming Yan ⋅ Lu Hou ⋅ Jie Zhou ⋅ Jiwen Lu
X2SAM: Any Segmentation in Images and Videos
Hao Wang ⋅ Limeng Qiao ⋅ Chi Zhang ⋅ Lin Ma ⋅ Guanglu Wan ⋅ Xiangyuan Lan ⋅ Xiaodan Liang
Analyzing and Improving Training-Free Fast Sampling of Text-to-Image Diffusion Models
Zhenyu Zhou ⋅ Defang Chen ⋅ Siwei Lyu ⋅ Chun Chen ⋅ Can Wang
Multi-View Foundation Models
Leo Segre ⋅ Or Hirschorn ⋅ Shai Avidan
YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Reasoning
Quansheng Hu ⋅ Qin Sun ⋅ Qiansen Dai ⋅ Jin Ding ⋅ Wan Zhang ⋅ Xue Zhou ⋅ Jianxiao Zou
RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
Yelin Wang ⋅ Zijia Song ⋅ Shuo Ye ⋅ Chuanguang Yang ⋅ Miaoyu Wang ⋅ Yong Xu ⋅ Zhulin An ⋅ Yongjun Xu ⋅ Zitong Yu
AV2T-Gen: Aerial Visible to Thermal Generation with Environment and Vehicle State Guidance
Kun Yang ⋅ Yuxiang Liu ⋅ Yihan Wang ⋅ Shen Yan ⋅ Maojun Zhang ⋅ Yu Liu ⋅ Xue Wang ⋅ Qing Wang
OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
Yupeng Zhou ⋅ Zhen Li ⋅ Yuming Chen ⋅ Ziheng Ouyang ⋅ Ruoyi Du ⋅ Daquan Zhou ⋅ Bin Fu ⋅ Yihao Liu ⋅ Peng Gao ⋅ Ming-Ming Cheng ⋅ Qibin Hou
A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation
Peixuan Zhang ⋅ Chang Zhou ⋅ Ziyuan Zhang ⋅ Hualuo Liu ⋅ Chunjie Zhang ⋅ Jingqi Liu ⋅ Xiaohui Zhou ⋅ Xi Chen ⋅ Shuchen Weng ⋅ Si Li ⋅ Boxin Shi
ThermoGS: Decoupling Physical Surface Attributes for Spatio-Temporal Thermal Field Emulation via 4D Gaussian Splatting
Kun Yang ⋅ Yuxiang Liu ⋅ Zeyu Cui ⋅ Shen Yan ⋅ Maojun Zhang ⋅ Yu Liu ⋅ Xue Wang ⋅ Qing Wang
Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models
Yiwen Liang ⋅ Hui Chen ⋅ Yizhe Xiong ⋅ Mengyao Lyu ⋅ Yuhan Cao ⋅ Zijia Lin ⋅ SHUAICHENG NIU ⋅ Sicheng Zhao ⋅ Jungong Han ⋅ Guiguang Ding
CountEx: Fine-Grained Counting via Exemplars and Exclusion
Yifeng Huang ⋅ Gia Nguyen ⋅ Minh Hoai Nguyen
CameraAnything: Refilming Videos with Arbitrary Camera Control
Yixuan Li ⋅ Yanhong Zeng ⋅ Ka Leong Cheng ⋅ Jiayi Zhu ⋅ Hanlin Wang ⋅ Wen Wang ⋅ Yihao Meng ⋅ Hao Ouyang ⋅ Qiuyu Wang ⋅ Yue Yu ⋅ Zidong Wang ⋅ Yiyuan Zhang ⋅ Yujun Shen ⋅ Dahua Lin
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
ye junyan ⋅ Leqi Zhu ⋅ Yuncheng Guo ⋅ Dongzhi Jiang ⋅ Zilong Huang ⋅ Yifan Zhang ⋅ Zhiyuan Yan ⋅ Haohuan Fu ⋅ Conghui He ⋅ Weijia Li
Ray-Path-Aware Virtual Point Removal on 2D Layer-Wise Nearest Point Map
DAEHYEON JEON ⋅ Kyungdon Joo ⋅ Jae-Young Sim
RA-SOD: Reliability-Aware RGB-T Salient Object Detection under Modality Degradation
Hongbo Gao ⋅ Zhengyu Li ⋅ XUERU NIE ⋅ Dihao Zhu ⋅ lijun zhao ⋅ Yunke Wang ⋅ Chang Xu
SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation
Haidong Cao ⋅ Wenjun Cao ⋅ Quanhao Li ⋅ Sicheng Xie ⋅ Zhiying Du ⋅ Jiaqi Leng ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Scaling Whole-Slide Pathology Foundation Model Pretraining with Billions Off-the-Shelf Tokens
Honglin Li ⋅ Zhongyi Shui ⋅ Chenglu Zhu ⋅ Lin Yang
NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models
Yingjie Zhang ⋅ Shuai Li ⋅ Peng Wang
REDistill: Robust Estimator Distillation for Balancing Robustness and Efficiency
Ondrej Tybl ⋅ Lukas Neumann
Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation
Siddhant Bansal ⋅ Zhifan Zhu ⋅ Shashank Tripathi ⋅ Jiahe Zhao ⋅ Michael Black ⋅ Dima Damen
Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution
Yu-Syuan Xu ⋅ Hao-Lun Sun ⋅ Hao-Wei Chen ⋅ Hsien-Kai Kuo ⋅ Chun-Yi Lee
3DGS3: Joint Super Sampling and Frame Interpolation for Real-Time Large-Scale 3DGS Rendering
Yibo Zhao ⋅ Fan Gao ⋅ Youcheng Cai ⋅ Ligang Liu
GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition
Takaya Kawakatsu ⋅ Ryo Ishiyama
InstaPano: Zero-shot Instance Layout Controlled Panorama Generation Via Global Attention Fusion
Zejian Li ⋅ Rui Huang ⋅ Lefan Hou ⋅ Pei Chen ⋅ Heyuan Xu ⋅ Shengyuan Zhang ⋅ Kewen Zhu ⋅ Huanghuang Deng ⋅ Li Liu ⋅ Lingyun Sun
FreeGen: Feed-Forward Reconstruction–Generation Co-Training for Free-Viewpoint Driving Scene Synthesis
Shijie Chen ⋅ Peixi Peng
Holistic Optimal Label Selection for Robust Prompt Learning under Partial Labels
Yaqi Zhao ⋅ Haoliang Sun ⋅ Yating Wang ⋅ Yongshun Gong ⋅ Yilong Yin
PointSplat: Compact Gaussian Splatting via Human-Centric Prediction
Yujie Guo ⋅ Yudong Jin ⋅ Lingteng Qiu ⋅ Zehong Shen ⋅ Zhen Xu ⋅ Zhang Jing ⋅ Xianchao Shen ⋅ Hujun Bao ⋅ Sida Peng ⋅ Xiaowei Zhou
Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation
Yanran Zhang ⋅ Ziyi Wang ⋅ Wenzhao Zheng ⋅ Zheng Zhu ⋅ Jie Zhou ⋅ Jiwen Lu
MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
Haotian Xue ⋅ Qi Chen ⋅ Zhonghao Wang ⋅ Xun Huang ⋅ Eli Shechtman ⋅ Jinrong Xie ⋅ Yongxin Chen
Prototype-Conditioned Imagination for Compositional Zero-Shot Learning
Yifan Zhu ⋅ Haofeng Zhang
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
Ting Huang ⋅ Dongjian Li ⋅ Rui Yang ⋅ Zeyu Zhang ⋅ ZIDA YANG ⋅ Hao Tang
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
Kaixun Jiang ⋅ Yuzheng Wang ⋅ Junjie Zhou ⋅ Pandeng Li ⋅ Zhihang Liu ⋅ Chen-Wei Xie ⋅ Zhaoyu Chen ⋅ Yun Zheng ⋅ Wenqiang Zhang
Detect by Track: Making Detector-Free Matcher Trackable
Yusuke Sekikawa ⋅ HIDEKI SHIRAI ⋅ Ruka Eto ⋅ Yuzhe Hao ⋅ Kengo Mitsui ⋅ Nakamasa Inoue
NavWM: A Unified Navigation World Model for Foresight-Driven Planning
Yanghong Mei ⋅ Longteng Guo ⋅ MingMing Yu ⋅ Guiyu Zhao ⋅ Xingjian He ⋅ Jing Liu
Adaptive Noise Covariance Scheduling under Riemannian Metrics for Diffusion Models
Bolin Deng ⋅ Die Hu ⋅ Bin Tan ⋅ Jun Wu
IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation
Yuanming Li ⋅ Qize Yang ⋅ Nan Lei ⋅ Shenghao Fu ⋅ Ling-An Zeng ⋅ Jian-Fang Hu ⋅ Xihan Wei ⋅ WEISHI ZHENG
MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing
Zesong Yang ⋅ Yuanhang Lei ⋅ Yihang Chen ⋅ Jiaer Huang ⋅ liyuan cui ⋅ Boming Zhao ⋅ Peter Yichen Chen ⋅ Hujun Bao ⋅ Zhaopeng Cui
CerDETR: Cell-Prior Empowered DETR for Cervical Lesion Detection
Linyun Zhou ⋅ Jin Chen ⋅ Weihan Li ⋅ Hengrui Lou ⋅ Lingxiang Jia ⋅ Weijun Qin ⋅ Xiuming Zhang ⋅ Zunlei Feng
FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model
Yuhwan Jeong ⋅ HYEONSEONG KIM ⋅ Daehyun We ⋅ Seonkyu Song ⋅ Jinnyeong Yang ⋅ Hyun-Kurl Jang ⋅ Youngho Yoon ⋅ KUK-JIN YOON
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
Yuandong Pu ⋅ Le Zhuo ⋅ Kaiwen Zhu ⋅ Liangbin Xie ⋅ Wenlong Zhang ⋅ Xiangyu Chen ⋅ Peng Gao ⋅ Yu Qiao ⋅ Chao Dong ⋅ Yihao Liu
IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion
Lei Hu
AVSplat:Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning
MUYU XU ⋅ Fangneng Zhan ⋅ Yu Wei ⋅ Hanspeter Pfister ⋅ Shijian Lu
FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation
Vladislav Bargatin ⋅ Alexander Yakovenko ⋅ Khaled Abud ⋅ Dmitriy Vatolin
Towards Scalable Pre-training of Visual Tokenizers for Generation
Jingfeng Yao ⋅ Yuda Song ⋅ Yucong Zhou ⋅ Xinggang Wang
ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning
Xuanhua He ⋅ JIAXIN XIE ⋅ Mingzhe Zheng ⋅ Qifeng Chen
LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation
Guanjie Wang ⋅ Zehua Ma ⋅ Han Fang ⋅ Weiming Zhang
FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation
Yufei Zhang ⋅ Changhao Chen
ChronusOmni: Improving Time Awareness of Omni-Modal Large Language Models
Yijing Chen ⋅ Yihan Wu ⋅ Kaisi Guan ⋅ Wenhui Tan ⋅ Yuchen Ren ⋅ Yuyue Wang ⋅ Ruihua Song ⋅ Liyun Ru
Modeling and Compensating Phase Error in High-speed 3D Reconstruction
Yuchong Chen ⋅ Jian Yu ⋅ Pengcheng Yao ⋅ Shaoyan Gai ⋅ Feipeng Da
Stabilizing Real-World Visual Active Tracking with Action-Smooth Test-Time Adaptation
Haowei Sun ⋅ Shiteng Zhang ⋅ Jinwu Hu ⋅ Kaining Chen ⋅ Mingkui Tan
Making Partial-Label Datasets Easier: A Simple Yet Highly Effective Data Augmentation for Deep Partial-Label Learning
Dong-Dong Wu ⋅ Zhaoyi Li ⋅ Xiang Li ⋅ Zhiqiang Shen
CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction
Yuzhou Ji ⋅ Xiaotian Yang ⋅ Zhipeng Zhang
VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection
Songsong Duan ⋅ Xi Yang ⋅ Nannan Wang
AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World
Zhongqiang Song ⋅ Guanying Chen ⋅ Yuqi Zhang ⋅ Yin Zou ⋅ Chuanyu Fu ⋅ Zhiyuan Yuan ⋅ Chuan Huang ⋅ Shuguang Cui ⋅ Xiaochun Cao
Rethinking Adversary in Semantic Segmentation: An Out-of-Distribution Perspective
Shuchang Wang ⋅ Shuchang Wang ⋅ Xiaoman Liu ⋅ Zhenbo Shi ⋅ Zhidong Yu ⋅ weisongjn weisongjn ⋅ Wei Yang
SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion
Paul Engstler ⋅ Iro Laina ⋅ Christian Rupprecht ⋅ Andrea Vedaldi
PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS
Yunseo Yang ⋅ Youngho Yoon ⋅ KUK-JIN YOON
CustomX: Unified Character, Action, and Scene Customization in Video World Models
Yitong Wang ⋅ Fangyun Wei ⋅ Hongyang Zhang ⋅ Bo Dai ⋅ Yan Lu
Video Generation Models Are Inherent Lighting Estimators
Ziqi Cai ⋅ Shuchen Weng ⋅ Kaiqi Liu ⋅ Zifeng Wang ⋅ Zhiquan Zhang ⋅ Minggui Teng ⋅ Han Jiang ⋅ Boxin Shi
Adversarial Score Distillation for Stable One-Step Diffusion in Real-World Image Super-Resolution
Wei Zhu ⋅ Kai Zhang ⋅ Yu Zheng ⋅ Lei Luo ⋅ Jian Yang
Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion
CHAO TIAN ⋅ Zikun Zhou ⋅ Chao Yang ⋅ guoqing zhu ⋅ Zhenyu He
SD3.5-Flash: Distribution-Guided Distillation of Generative Flows
Hmrishav Bandyopadhyay ⋅ Rahim Entezari ⋅ Jim Scott ⋅ Reshinth Adithyan ⋅ Yi-Zhe Song ⋅ Varun Jampani
From Noise to Events: Conditional Diffusion for Event Data Augmentation
Ruofei Wang ⋅ Ziyuan Luo ⋅ Peiqi Duan ⋅ Xiufeng HUANG ⋅ Boxin Shi ⋅ Renjie Wan
Quantile‑Adaptive Temperature Scaling for Confidence Calibration
Omprakash Chakraborty ⋅ Leo Fillioux ⋅ Ismail Ayed ⋅ Jose Dolz
RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation
Guodong Zhang ⋅ Qichen He ⋅ Wenyuan Xie ⋅ Shaokai Wu ⋅ Yanbiao Ji ⋅ Qiuchang Li ⋅ Bayram Bayramli ⋅ Yue Ding ⋅ Hongtao Lu
A²-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks
华渝 郑 ⋅ Guangzhao Li ⋅ Baixuan Zhao ⋅ Siqi Luo ⋅ Hantao Jiang ⋅ Guangtao Zhai ⋅ Xiaohong Liu
IC-World: In-Context Generation for Shared World Modeling
FAN WU ⋅ Jiacheng Wei ⋅ Ruibo Li ⋅ Yi Xu ⋅ junyou li ⋅ Deheng Ye ⋅ Guosheng Lin
RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
Zijun Liao ⋅ Yian Zhao ⋅ Xin Shan ⋅ Yu Yan ⋅ Chang Liu ⋅ lei lu ⋅ Xiangyang Ji ⋅ Jie Chen
Controlling Embedding Spaces with Text-Conditioned Transformations
Joseph Fioresi ⋅ Fabian Caba ⋅ Pankaj Nathani ⋅ Shah Mubarak ⋅ Kushal Kafle
Hyper-Network Neural Functional Maps for Unsupervised Robust 3D Shape Matching
Dongliang Cao ⋅ Florian Bernard
LoGAN: Multilingual Font Localization with Generative Agents
Zhuoning Yuan ⋅ Ta-Ying Cheng ⋅ Benjamin Klein
ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search
Myungchul Kim ⋅ Kwanyong Park ⋅ Junmo Kim ⋅ In Kweon
Reflection-aware generative novel view synthesis
GeonU Kim ⋅ Shin Dong-Yeon ⋅ Tae-Hyun Oh
Dive into the implicit biases of low-rank vision-language alignment
Mingjia Shi ⋅ Shuo Wang ⋅ Xiaobo Wang ⋅ Sifan Zhou ⋅ Kai Wang ⋅ Tianyu Fu ⋅ Chenxu Zhao ⋅ Anyang Su ⋅ Ping Jiang ⋅ Minghui Wu
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models
Ruchit Rawal ⋅ Reza Shirkavand ⋅ Sayak Paul ⋅ Yuxin Wen ⋅ Heng Huang ⋅ Yizheng Chen ⋅ Tom Goldstein ⋅ Gowthami Somepalli
APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images
Suhyeon Ha ⋅ Woo Jae Kim ⋅ Joonsung Jeon ⋅ Sooel Son ⋅ Sung-eui Yoon
RGB-Pointmap Pretraining for Unified 3D Scene Understanding
Ye Mao ⋅ Weixun Luo ⋅ Ranran Huang ⋅ Junpeng Jing ⋅ Krystian Mikolajczyk
Exploring Efficient Reasoning Segmentation with Small Language Models
Changsong Wen ⋅ Zelin Peng ⋅ Yu Huang ⋅ Xiaokang Yang ⋅ Wei Shen
Perceiving Better Moments: Cover Frame Reselection and Enhancement for Live Photos with the Live2K Dataset
Junyu Lou ⋅ Kai Chen ⋅ Weiyi You ⋅ Hui Zeng ⋅ Yabin Zhang ⋅ Shuhang Gu
Maximum Spanning Tree Guided Confidence and Sparse Graph for Robust Noisy Label Learning
Gengfeng Chen ⋅ Xu Liu ⋅ Boyi Peng ⋅ Liangqiu Xiao ⋅ Weicheng Xie ⋅ Siyang Song ⋅ Zitong Yu ⋅ Laizhong Cui ⋅ Linlin Shen
Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces
Jiayuan Du ⋅ Yuebing Song ⋅ Yiming Zhao ⋅ Xianghui Pan ⋅ Jiawei Lian ⋅ Yuchu Lu ⋅ Liuyi Wang ⋅ Chengju Liu ⋅ Qijun Chen
Rethinking Training and Inference for Trajectory Forecasting: Linking Winner-Take-All back to GMMs
Qiyuan Wu ⋅ Katie Luo ⋅ Bharath Hariharan ⋅ Wei-Lun Chao ⋅ Mark Campbell
DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving
Pengxuan Yang ⋅ Yupeng Zheng ⋅ Zebin Xing ⋅ Deheng Qian ⋅ Pengxuan Yang ⋅ Linbo Wang ⋅ Yichen Zhang ⋅ shaoyu guo ⋅ Zhongpu Xia ⋅ Qiang Chen ⋅ Junyu han ⋅ Lingyun Xu ⋅ Yifeng Pan ⋅ Dongbin Zhao
Neural Collapse-Inspired Multi-Label Federated Learning under Label-Distribution Skew
Can Peng ⋅ Yuyuan Liu ⋅ YINGYU YANG ⋅ Pramit Saha ⋅ Qianye Yang ⋅ J. Noble
PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images
Ruiqi Wang ⋅ Yiming Qian ⋅ FENGGEN YU ⋅ Yuxuan Lu ⋅ Dakuo Wang ⋅ Hao Richard Zhang ⋅ Jing Huang
GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
Leslie Gu ⋅ Junhwa Hur ⋅ Charles Herrmann ⋅ Fangneng Zhan ⋅ Todd Zickler ⋅ Deqing Sun ⋅ Hanspeter Pfister
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
Xuelu Feng ⋅ Yunsheng Li ⋅ Ziyu Wan ⋅ Zixuan Gao ⋅ Junsong Yuan ⋅ Dongdong Chen ⋅ Chunming Qiao
Adapting MLLMs for Nuanced Video Retrieval
Piyush Nitin Bagad ⋅ Andrew ZISSERMAN
SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images
Jinyuan Qu ⋅ Hongyang Li ⋅ Lei Zhang
When the City Teaches the Car: Label-Free 3D Perception from Infrastructure
ZHEN XU ⋅ Jinsu Yoo ⋅ Cristian Bautista ⋅ Zanming Huang ⋅ Tai-Yu Pan ⋅ Zhenzhen Liu ⋅ Katie Luo ⋅ Mark Campbell ⋅ Bharath Hariharan ⋅ Wei-Lun Chao
CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification
Xu Haoxuan ⋅ Hanzi Wang ⋅ Guanglin Niu
Better Call CineCrew: Consistent Ultra-Long Narrative-to-Film Generation
Jiaben Chen ⋅ Sixun Dong ⋅ Qinhong Zhou ⋅ Raine Ma ⋅ Zhiyang Dou ⋅ Wojciech Matusik ⋅ Chuang Gan
DualDiff3D: Dual Structure-Appearance Diffusion Priors for Reliability-Enhanced 3D Gaussian Splatting
Qian Wang ⋅ Yu Wang ⋅ Weiqi Li ⋅ Xinhua Cheng ⋅ Xiandong MENG ⋅ Ronggang Wang ⋅ Jian Zhang
PriSM: Parsing and Style-Mixed Consistency for Unsupervised Domain Adaptation in Facial Landmark Detection
Chieh-Yu Yang ⋅ Hou-Ning Hu ⋅ Sykai Chen ⋅ Yu-Lun Liu ⋅ Yen-Yu Lin
Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective
Tian Liu ⋅ Anwesha Basu ⋅ James Caverlee ⋅ Shu Kong
ObjectForesight: Predicting 3D Object Trajectories from Human Videos
Rustin Soraki ⋅ Homanga Bharadhwaj ⋅ Ali Farhadi ⋅ Roozbeh Mottaghi
Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
Haoyu Wu ⋅ Jingyi Xu ⋅ Qiaomu Miao ⋅ Dimitris Samaras ⋅ Hieu Le
ELDiff: When Evidential Learning Meets Text-to-Image Diffusion
Qingtao Pan ⋅ Kai Ye ⋅ Zhihao Dou ⋅ Bing Ji ⋅ Shuo Li
Sequential Visual Place Recognition: Exploiting Trajectory Priors for Robust Localization
Dominik Kloepfer ⋅ Patrick Wenzel
Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise
Kihyun Na ⋅ Jinyoung Choi ⋅ Injung Kim
Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors
Liang Han ⋅ Bangcai Wei ⋅ Junsheng Zhou ⋅ Yushen Liu ⋅ Zhizhong Han
City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion
Liang Han ⋅ Wenyuan Zhang ⋅ Junsheng Zhou ⋅ Yushen Liu ⋅ Zhizhong Han
AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing
Tianyu Liu ⋅ Weitao Xiong ⋅ Kunming Luo ⋅ Manyuan Zhang ⋅ Peng Li ⋅ Yuan Liu ⋅ Ping Tan
Combining Discrepancy-Confusion Uncertainty and Calibration Diversity for Active Fine-Grained Image Classification
Yinghao Jin ⋅ Xi Yang
TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding
Chaohong Guo ⋅ Xun Mo ⋅ Yongwei Nie ⋅ Fei Ma ⋅ Xuemiao Xu ⋅ Chengjiang Long
Benchmarking Vision-Language Models for Microscopic Plant Image Understanding
Tianqi Wei ⋅ Xin Yu ⋅ Zhi Chen ⋅ Scott C Chapman ⋅ Zi Helen Huang
SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows
Qinyu Zhao ⋅ Guangting Zheng ⋅ Tao Yang ⋅ Rui Zhu ⋅ Xingjian Leng ⋅ Stephen Gould ⋅ Liang Zheng
DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection
haifa zhang ⋅ Yijing Wang ⋅ Peixi Peng ⋅ Zhiqiang Zuo
GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking
Youngho Kim ⋅ Hoonhee Cho ⋅ Jae-young Kang ⋅ KUK-JIN YOON
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
LING LI ⋅ Bowen Liu ⋅ Zinuo Zhan ⋅ Peng Jie ⋅ Jianhui Zhong ⋅ Kenglun Chang ⋅ Zhidong Deng
IREU: Identity-Related Encoder-Only Unlearning for Customized Portrait Generation
Chaoyi Shi ⋅ Shanshan Zhang ⋅ Jian Yang
Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing
Dohun Lee ⋅ Chun-Hao Huang ⋅ Xuelin Chen ⋅ Jong Chul Ye ⋅ Duygu Ceylan ⋅ Hyeonho Jeong
PaD-GS: Leveraging Distortion Map for Panoramic Gaussian Splatting
Yihang Xu ⋅ Qiulei Dong
High-speed Imaging through Turbulence with Event-based Light Fields
Yu-Hsiang Huang ⋅ Levi Burner ⋅ Sachin Shah ⋅ Ziyuan Qu ⋅ Adithya Pediredla ⋅ Christopher Metzler
Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention
Yiwen Chen ⋅ Zhihao Li ⋅ Yihao Luo ⋅ Yikai Wang ⋅ Zhang Hu ⋅ Le Li ⋅ Qin Li ⋅ Chi Zhang ⋅ Guosheng Lin
UniTranslator: A Unified Multi-modal framework for End-to-end In-Image Machine Translation
Jiahao Lyu ⋅ Pei Fu ⋅ Zhenhang Li ⋅ Shaojie Zhang ⋅ Jiahui Yang ⋅ Yu ZHOU ⋅ Can Ma ⋅ Zhenbo Luo ⋅ Jian Luan
Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space
Thanh V. T. Tran ⋅ Ngoc-Son Nguyen ⋅ Luong Tran ⋅ Long-Khanh Pham ⋅ Paarth Neekhara ⋅ Shehzeen Hussain ⋅ Van Nguyen
VLA Knows Its Limits
Haoxuan Wang ⋅ Gengyu Zhang ⋅ Yan Yan ⋅ Ramana Kompella ⋅ Gaowen Liu
DuoFlow: JVP-Free Finite-Difference Mean Flows for One-Step Image Generation
Zeming Li ⋅ Xiangyu Zhang ⋅ Ping Tan ⋅ Heung-Yeung Shum
SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting
Haozheng Yu ⋅ Xinyu Yang ⋅ Rundong Luo ⋅ Jennifer Sun ⋅ Bharath Hariharan
Safe Responses Matter: Output-Aware Safety Guardrail Mitigate Over-Refusal in MLLMs
Jiayi Li ⋅ Kun Zhan
VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking
Jiyuan Fu ⋅ Kaixun Jiang ⋅ Jingkai Jia ⋅ Zhaoyu Chen ⋅ Xueyao Chen ⋅ Lingyi Hong ⋅ Shuyong Gao ⋅ Chenzhi Tan ⋅ Dingkang Yang ⋅ Wenqiang Zhang
TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation
Hyeonseop Song ⋅ Seokhun Choi ⋅ Hoseok Do
Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating
Xiangkui Cao ⋅ Jie Zhang ⋅ Meina Kan ⋅ Shiguang Shan ⋅ Xilin CHEN
PosterCopilot: Toward Layout Reasoning and Controllable Editing for Professional Graphic Design
Jiazhe Wei ⋅ Ken Li ⋅ Tianyu Lao ⋅ Haofan Wang ⋅ Yueming Lyu ⋅ Liang Wang ⋅ Caifeng Shan ⋅ Chenyang Si
PPTArena: A Benchmark for PowerPoint Editing
Michael Ofengenden ⋅ Yunze Man ⋅ Ziqi Pang ⋅ Liang-Yan Gui ⋅ Yu-Xiong Wang
SMART: When is it Actually Worth Expanding a Speculative Tree?
Lifu Wang ⋅ Pan ZHOU
RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs
Yeeun Seong ⋅ Doyi Kim ⋅ Minseok Seo ⋅ Changick Kim
DoCoG: Mask-based Multi-Type Grounded Chain-of-Thought for Document QA
Sai Madhusudan Gunda ⋅ Jyothi Jinka ⋅ Hrithik Sagar ⋅ Aryan Jain ⋅ Venkata Venna ⋅ Anirudh Srinivasan ⋅ SANTOSH RAVI KIRAN SARVADEVABHATLA
ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration
Qicheng Zhao ⋅ Yu Li ⋅ Qi Sun ⋅ Zheyu Yan
StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction
GaHye Lee ⋅ Gyoonseo Kim ⋅ Wonjong Jang ⋅ Jooeun Son ⋅ Seungyong Lee
TopoGAT: Plug-and-Play Topological Graph Attention for Fine-Grained 3D Segmentation
Xinyu Jiang ⋅ Lech Szymanski ⋅ Steven Mills
RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement
Zi-Xiang Ni ⋅ Bo-Lun Huang ⋅ Teng-Fang Hsiao ⋅ Bo-Kai Ruan ⋅ Hong-Han Shuai
Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
jie li ⋅ Hongyi Cai ⋅ Mingkang Dong ⋅ Muxin Pu ⋅ Shan You ⋅ Fei Wang ⋅ Tao Huang
VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning
Mingkang Dong ⋅ Hongyi Cai ⋅ jie li ⋅ Sifan Zhou ⋅ Bin Ren ⋅ Kunyu Peng ⋅ Yuqian Fu
GradingBench: Evaluating End-to-End Compositional Reasoning of MLLMs for Automated Exam Grading
Yuting Wang ⋅ Zixian Guo ⋅ Weihao You ⋅ Zhilong Ji ⋅ Jinfeng Bai ⋅ Wangmeng Zuo
SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection
Zhang Tiancheng ⋅ Mengmeng Wang ⋅ Yan Gao ⋅ Xiangjie Kong ⋅ Guojiang Shen ⋅ Jiaxin Du
AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
Kyuan Oh ⋅ Bumsoo Kim
Geometry-Aware Style Transfer in 3D Gaussian Splatting
Min Hyeok Bang ⋅ Jun Hyeong Kim ⋅ Seung-Wook Kim ⋅ Se-Ho Lee
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
Feng Han ⋅ Yibin Wang ⋅ Chenglin Li ⋅ Zheming Liang ⋅ Dianyi Wang ⋅ Yang Jiao ⋅ Zhipeng Wei ⋅ Chao Gong ⋅ Cheng Jin ⋅ Jiaqi Wang
NaVLM-PVC: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
Shichu Sun ⋅ Yichen Zhang ⋅ Haolin Song ⋅ Zonghao Guo ⋅ Chi Chen ⋅ Yidan Zhang ⋅ Yuan Yao ⋅ Zhiyuan Liu ⋅ Maosong Sun
EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
ANKIT YADAV ⋅ Huy Ta ⋅ Lingqiao Liu
3D Gaussian Splatting Compression with Object Scalability
Ruixiang Xue ⋅ Tong Chen ⋅ Zhan Ma
PriorPose: Reference-Guided Joint Deformation and Alignment for Category-Level Object Pose Estimation
Yihan Chen ⋅ Huan Ren ⋅ Wenfei Yang ⋅ Hang Du ⋅ Tianzhu Zhang ⋅ Feng Wu
PriorMaskMap: Robust Online Vectorized Map Construction with Biased Priors
Haoming Xu ⋅ Wei Li ⋅ Yu Hu
Learn to See the Unseen in Low-light Spike Streams
Liwen Hu ⋅ Yang Li ⋅ Mianzhi Liu ⋅ Guo Yijia ⋅ Shenghao Xie ⋅ Wenqiang Zu ⋅ gang ding ⋅ Tiejun Huang ⋅ Lei Ma
BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations
Thomas Monninger ⋅ Shaoyuan Xie ⋅ Qi Chen ⋅ Sihao Ding
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
Weiyang Jin ⋅ Yuwei Niu ⋅ Jiaqi Liao ⋅ Chengqi Duan ⋅ Aoxue Li ⋅ Shenghua Gao ⋅ Xihui Liu
PIAvatar: Physically Interactive Avatars via Deformation Gradient Decoupling
Sang-Hun Han ⋅ Min-Gyu Park ⋅ Jisu Shin ⋅ Seunghyun Shin ⋅ JINHWI PARK ⋅ Hae-Gon Jeon
PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation
Dingwen Xiao ⋅ WEIMING ZHANG ⋅ Shiqi Wen ⋅ Addison Wang
Video-Holmes: Can MLLM Think like Holmes for Complex Video Reasoning?
JUNHAO CHENG ⋅ Yuying Ge ⋅ Teng Wang ⋅ Yixiao Ge ⋅ Jing Liao ⋅ Ying Shan
Policy-Based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards
Orhun Baran ⋅ Melih Kandemir ⋅ Ramazan Gokberk Cinbis
Seek to Segment: Active Perception for Panoramic Referring Segmentation
Song Tang ⋅ Shuming Hu ⋅ Xincheng Shuai ⋅ Henghui Ding ⋅ Yu-Gang Jiang
Unified Panoramic–Gaussian Representation for Monocular 4D Scene Synthesis
Yuankun Yang ⋅ Yi Wei ⋅ Wenyang Zhou ⋅ Li Zhang
On Test-Time Scaling for Vision-Language Models
Fawaz Sammani ⋅ Tzoulio Chamiti ⋅ Nikos Deligiannis
CUST : Clustered Unit-level Similarity Transformer for Lightweight Image Super-Resolution
Jeongsoo Kim
ActionParty: Multi-Subject Action Binding in Generative Video Games
Alexander Pondaven ⋅ Ziyi Wu ⋅ Igor Gilitschenski ⋅ Philip Torr ⋅ Sergey Tulyakov ⋅ Fabio Pizzati ⋅ Aliaksandr Siarohin
VERTIGO: Visual Preference Optimization for Cinematic Camera Generation
Mengtian Li ⋅ Yuwei Lu ⋅ Feifei Li ⋅ Chenqi Gan ⋅ Zhifeng Xie ⋅ Xi WANG
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
Naru Suzuki ⋅ Takehiko Ohkawa ⋅ Tatsuro Banno ⋅ Jihyun Lee ⋅ Ryosuke Furuta ⋅ Yoichi Sato
Cube-Splat: High-Fidelity 360° Gaussian Splatting SLAM via Cubemap Factorization and Adjoint-Consistent Optimization
Xiangfei Guo ⋅ Hao Shi ⋅ Yufan Zhang ⋅ Zhonghua Yi ⋅ maoyongqi maoyongqi ⋅ Xiaoting Yin ⋅ Kaiwei Wang
NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics
Jingye Qiu ⋅ Shizhe Zhou
PASTEL: Panoramic Alignment for Monocular 4D Scene Reconstruction
Yuankun Yang ⋅ Yi Wei ⋅ Bo Bai ⋅ Wenyang Zhou ⋅ Li Zhang
Local-to-global Cross-modal Coordination for Self-supervised RGB-T Tracking
Yueying Zhang ⋅ Timing Li ⋅ Bing Cao ⋅ Pengfei Zhu
Beyond Alignment: A Generative Matching Paradigm via Flow Matching for Zero-Shot Skeleton-Based Action Recognition
Xuan Liu ⋅ Cong Wu ⋅ Wei Fang ⋅ Zhenhua Feng
Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM
Amol Harsh ⋅ Zongyan Han ⋅ Jean Lahoud ⋅ Ye Liu ⋅ Rao M Anwer ⋅ Hisham Cholakkal ⋅ Salman Khan ⋅ Fahad Shahbaz Khan
Spanning the Visual Analogy Space with a Weight Basis of LoRAs
Hila Manor ⋅ Rinon Gal ⋅ Haggai Maron ⋅ Tomer Michaeli ⋅ Gal Chechik
AdaptiveSplat: Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction
Badrinath Singhal ⋅ Srihari G ⋅ Sreehari Iyer ⋅ Ankit Dhiman ⋅ Venkatesh Babu Radhakrishnan
Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos
Xavier Thomas ⋅ Youngsun Lim ⋅ Ananya Srinivasan ⋅ Audrey Zheng ⋅ Deepti Ghadiyaram
D-Rex : Diffusion Rendering for Relightable Expressive Avatars
Timo Teufel ⋅ xilong zhou ⋅ Umar Iqbal ⋅ Jan Kautz ⋅ Marc Habermann ⋅ Vladislav Golyanik ⋅ Christian Theobalt
CortexVideo: A Semantic-Spatial Dual-Anchor Framework for High-Fidelity fMRI-to-Video Reconstruction
Xiaoquan Shen ⋅ Jiaxuan Chen ⋅ Jiajun Li ⋅ Gang Pan
Saber: Anchoring Semantics to Scale-Aware Kinetic Salience for Zero-Shot Skeleton Action Recognition
Zhu Yongquan ⋅ Biru Ning ⋅ Jingyu Zhang
WebEyeTrack: Scalable Eye-Tracking for the Browser via On-Device Few-Shot Personalization
Eduardo Davalos ⋅ Yike Zhang ⋅ Namrata Srivastava ⋅ Yashvitha Thatigotla ⋅ Ashwin T S ⋅ Jorge Salas ⋅ Sun-Joo Cho ⋅ Amanda Goodwin ⋅ Gautam Biswas
Spanning Tree Autoregressive Visual Generation
Sangkyu Lee ⋅ Changho Lee ⋅ Janghoon Han ⋅ Hosung Song ⋅ Tackgeun You ⋅ Hwasup Lim ⋅ Stanley Jungkyu Choi ⋅ Honglak Lee ⋅ Youngjae Yu
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation
Lei Zhu ⋅ xing cai ⋅ Yingjie Chen ⋅ Li YiHeng ⋅ Binxin Yang ⋅ Hao Liu ⋅ Jie Chen ⋅ Chen Li ⋅ Jing LYU
HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models
Yu Xue ⋅ Haoxuan Qu ⋅ ZHUOLING Li ⋅ Hongbin Xu ⋅ Jianxiong Yin ⋅ Simon See ⋅ Hossein Rahmani ⋅ Jun Liu
Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation
Min-Jung Kim ⋅ Jeongho Kim ⋅ Hoiyeong Jin ⋅ Junha Hyung ⋅ Choo Jaegul
TOPA: Mitigating Concept Dominance in Diffusion Personalization via Target-Oriented Perturbation Augmentation
Jiayou Lu ⋅ Mingzhi Lyu ⋅ Junfeng Huang ⋅ Wai-Kin Adams Kong
Automatic Method Illustration Generation for AI Scientific Papers via Drawing Middleware Creation, Evolution, and Orchestration
ZHUOLING Li ⋅ Jiarui Zhang ⋅ Ping Hu ⋅ Jason Kuen ⋅ Jiuxiang Gu ⋅ Hossein Rahmani ⋅ Jun Liu
Knowledge-Centric Agents for Workflow Generation in ComfyUI
Zhendong Li ⋅ Lei Sun ⋅ Ruibo Ming ⋅ He Zhang ⋅ Danda Paudel ⋅ Luc Van Gool ⋅ Jinjin Gu
Reward Lightning: Fast Video Generation via Homologous Preference Distillation
Jiaxiang Cheng ⋅ bing ma ⋅ Xuhua Ren ⋅ Kai Yu ⋅ Peng Zhang ⋅ Tianxiang Zheng ⋅ Qinglin Lu
Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality
Lingjing Kong ⋅ Shaoan Xie ⋅ Guangyi Chen ⋅ Yuewen Sun ⋅ Xiangchen Song ⋅ Kun Zhang
Vulnerability of Privacy-Preserving Visual Localization against Diffusion-based Attacks
Maxime Pietrantoni ⋅ Torsten Sattler ⋅ Gabriela Csurka
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
Ming Li ⋅ Jike Zhong ⋅ Shitian Zhao ⋅ Haoquan Zhang ⋅ Shaoheng Lin ⋅ Yuxiang Lai ⋅ Chen Wei ⋅ Konstantinos Psounis ⋅ Kaipeng Zhang
Multi-Head Normalization for Wide Vision Transformers
Guoyizhe Wei ⋅ Feng Wang ⋅ Alan Yuille ⋅ Rama Chellappa
Path-JEPA: Path Signature Based Predictive Learning for Skeleton Action Recognition
Ashutosh Singh ⋅ Ashish Singh
Test Time Training for Long Videos via Frame Forgetting Network
Rajat modi ⋅ Xin Liang ⋅ Sebastian Noel ⋅ Yogesh Rawat
Articulated Object Reconstruction from Rest-State Observation
Daeun Lee ⋅ Jaeah Lee ⋅ Woosung Kim ⋅ Haebeom Jung ⋅ Jaesik Park
One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control
Zhenxing Mi ⋅ YUXIN WANG ⋅ Dan Xu
AnchorGUI: Asymmetric Memory for Dual-Scale Learning in GUI Navigation
Shengjie Jin ⋅ Zelong Sun ⋅ Hengbo Xu ⋅ Yanbiao Ma ⋅ Zhiwu Lu
Prevention over Correction: Learning Aligned Representations in One-shot Federated Learning
YongHoon Kang ⋅ Jee-Hyong LEE
Learning Sample-wise Rank-Aware Interpolation Weights for Composed Visual Data Retrieval
Boseung Jeong ⋅ Taegyu Park ⋅ Donghyeon Kwon ⋅ Hyunsouk Cho ⋅ Suha Kwak
DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues
Geng Li ⋅ Yuxin Peng
DINOv3D: 2D-3D Joint Optimization for Unified Spatial Understanding
Bo Zhou ⋅ Jianzhe Gao ⋅ Zhihui Wang ⋅ Lingxiang Wu ⋅ Jinqiao Wang ⋅ Yazhou Yao ⋅ Wenguan Wang
Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping
Jinho Kim ⋅ Jinwoo Kim ⋅ Seon Joo Kim
UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving
Guosheng Zhao ⋅ Yaozeng Wang ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Tingdong Yu ⋅ Guan Huang ⋅ Yongchen Zai ⋅ Ji Jiao ⋅ Changliang Xue ⋅ Xiaole Wang ⋅ Zhen Yang ⋅ Futang Zhu ⋅ Xingang Wang
Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
Dohyun Kim ⋅ Seungwoo Lyu ⋅ Seung Kim ⋅ Paul Hongsuck Seo
DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
Mingue Park ⋅ Prin Phunyaphibarn ⋅ Phillip (Yuseung) Lee ⋅ Minhyuk Sung
Teaching an Agent to Sketch One Part at a Time
Xiaodan Du ⋅ Ruize Xu ⋅ David Yunis ⋅ Yael Vinker ⋅ Greg Shakhnarovich
Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting
Zhihao Wen ⋅ Yixin Yang ⋅ Bojian Wu ⋅ Yang Zhou ⋅ Dani Lischinski ⋅ Danny Cohen-Or ⋅ Hui Huang
OP3DSG: Open-vocabulary Part-aware 3D Scene Graph Generation for Real-world Environments
Yirum Kim ⋅ Ue-Hwan Kim
DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing
Kailai Feng ⋅ Yuxiang WEI ⋅ Bo Chen ⋅ yang pan ⋅ Hu Ye ⋅ Songwei Liu ⋅ Chenqian Yan ⋅ Yuan Gao ⋅ Wangmeng Zuo
TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction
Nikos Athanasiou ⋅ Ilya A. Petrov ⋅ Angela Yao ⋅ Shugao Ma ⋅ Eric Sauser ⋅ Edoardo Remelli ⋅ Shreyas Hampali ⋅ Johannes Schönberger ⋅ Fadime Sener ⋅ Bugra Tekin
SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning
Taeryung Lee ⋅ Hyeongjin Nam ⋅ Gyeongsik Moon ⋅ Kyoung Mu Lee
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
Jialv Zou ⋅ Bencheng Liao ⋅ Qian Zhang ⋅ Wenyu Liu ⋅ Xinggang Wang
DeCo: Zero-Shot Anomaly Generation through Decoupling and Recoupling
Shilei Zeng ⋅ Xurui Li ⋅ Yaohan Tang ⋅ Yu Zhou
Coarse-to-fine Contrast: A Hybrid Self-supervised Method for Non-rigid 3D Shape Matching
Feifan Luo ⋅ Ting Li ⋅ Zhao Li ⋅ Hongyang Chen
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
Akio Hayakawa ⋅ Masato Ishii ⋅ Takashi Shibuya ⋅ Yuki Mitsufuji
AlphaRad: Grounded Zero-Shot Classification in Chest Radiology via α-Corrected Binary Cross Entropy and Factorized Latent Supervision
Jianzhong You ⋅ Yuan Gao ⋅ Chris Mcintosh
UniScale: Arbitrary-Scale Anomaly Generation
Shilei Zeng ⋅ Linxin Guan ⋅ Xurui Li ⋅ Yaohan Tang ⋅ Yu Zhou
Layering Virtual Try-On
Chun Feng ⋅ Bowei Chen ⋅ Shan Mengyi ⋅ Ira Kemelmacher-Shlizerman
HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation
Yihong Ji ⋅ Jinsong Zhang ⋅ He Hu ⋅ Hongboxu Hongboxu
Roam2Room: A Unified Floorplan-to-Furnished Framework for Controllable Indoor Scene Generation
Wenbo Li ⋅ Zipeng Qin ⋅ Xiaoliang Ju ⋅ Rongyao Fang ⋅ Hongsheng LI
FlexAM: Flexible Appearance-Motion Decomposition for Versatile Video Generation Control
Mingzhi Sheng ⋅ Zekai Gu ⋅ Peng Li ⋅ Cheng Lin ⋅ Hao-Xiang Guo ⋅ Yingcong Chen ⋅ Yuan Liu
XPos3R: Cross-Modal Transformer for Intraoperative 2D/3D Registration
Shiyan Su ⋅ Ruyi Zha ⋅ HONGDONG LI ⋅ Xuelian Cheng ⋅ Zongyuan Ge
MED-LCDS: Multi-Expert-Domain CLIP Classification via Logit Calibration
Zheng Zeng ⋅ Deepak Sridhar ⋅ Nuno Vasconcelos
Personalized Reward Modeling for Text-to-Image Generation
Jeongeun Lee ⋅ Ryang Heo ⋅ Dongha Lee
Training-Free Task Classification for Multi-Task Model Merging
JUNGYONG SON ⋅ Jinwook Jung ⋅ Sungyong Baik
Following Motion for Sequential Modeling in Video Frame Interpolation
JaeHyun Park ⋅ Nam Ik Cho
ProtoMappingNet: Interpretable Hierarchical Prototypes through Relational Prototype Mappings
Jaehun Park ⋅ Jongmin Lim ⋅ Soobin Cha ⋅ Kwangsu Kim
SharpGS: Sharpness-Preserving 3D Gaussian Splatting with Differentiable Blur-Driven Density Control
Moonsoo Jeong ⋅ Dongbeen Kim ⋅ Minseong Kim ⋅ Sungkil LEE
Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA
CHEN LI ⋅ Meilong Xu ⋅ Xiaoling Hu ⋅ Weimin Lyu ⋅ Chao Chen
Distribution Matching Distillation Meets Reinforcement Learning
Dengyang Jiang ⋅ Dongyang Liu ⋅ Zanyi Wang ⋅ Qilong Wu ⋅ Liuzhuozheng Li ⋅ Heng-Zhuang Li ⋅ Xin Jin ⋅ Zhen Li ⋅ Changsheng Lu ⋅ Mengmeng Wang ⋅ Steven Hoi ⋅ Peng Gao ⋅ Harry Yang
TPCNet: A Low-Light Image Enhancement Network Inspired by Triple Physical Constraints
Jing-Yi Shi ⋅ Ming-Fei Li ⋅ Ling-An Wu
MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes
Ye Tao ⋅ Yuxin Yao ⋅ Kendong Liu ⋅ Dapeng Wu ⋅ Junhui Hou
Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment
Jonghyun Park ⋅ Minhyuk Seo ⋅ Chaewon YEO ⋅ Jonghyun Choi
Rosetum3D: A Large-Scale 3D Vision Dataset from Preharvest Roses
Songyan Liu ⋅ Xipei Liu ⋅ Yujie Liu ⋅ Jiali Wu ⋅ Xiaofei Liu
Are Video Reasoning Models Ready to Go Outside?
Yangfan He ⋅ Changgyu Boo ⋅ Jaehong Yoon
Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging
Kuangpu Guo ⋅ Aijing Yu ⋅ Jian Liang ⋅ Yuhe Ding ⋅ Zilei Wang ⋅ Ran He ⋅ Tieniu Tan
Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses
Ruxiao Duan ⋅ Erin Hong ⋅ Dongxu Zhao ⋅ Eric Turner ⋅ Alex Wong ⋅ Yunwen Zhou
SegPAR: Class-Centric Decision-Based Sparse Attack for Semantic Segmentation
Dongsu Song ⋅ Daeyun Go ⋅ BOSEUNG SEO ⋅ Jay Hoon Jung
Intrinsically Stable Spiking Neural Networks: Overcoming the Performance Barrier in the Absence of Batch Normalization
Ruichen Ma ⋅ Xiaoyang Zhang ⋅ Jian Bai ⋅ Guanchao Qiao ⋅ Liwei Meng ⋅ Ning Ning ⋅ Yang Liu ⋅ Shaogang Hu
SUM: Unified Geometric Surgery on Spatio-Temporal Adaptation Vectors for Federated Class Incremental Learning
Jaeik Kim ⋅ Jaeyoung Do
See & Sniff: Learning Visuo-Olfactory Representations
Seongyu Kim ⋅ Seungwoo Lee ⋅ Hyeonggon Ryu ⋅ Joon Son Chung ⋅ Arda Senocak
Disentangling Rotation and Translation from SE(3)-Equivariant Features for Shape Assembly
Hee-Jun Jung ⋅ Uigeun Ahn ⋅ JINHWI PARK ⋅ Kangil Kim
Towards Sparsely Annotated Open World Object Detection
HEEJU HAN ⋅ AJEONG KIM ⋅ Jinsun Park
Seeing Fast and Slow: Learning the Flow of Time in Videos
Yen-Siang Wu ⋅ Rundong Luo ⋅ Jingsen Zhu ⋅ Tao Tu ⋅ Ali Farhadi ⋅ Matthew Wallingford ⋅ Yu-Chiang Frank Wang ⋅ Steve Marschner ⋅ Wei-Chiu Ma
Fixed Reality, Diffused Possibility: Disentangling Stochastic and Deterministic Latent for Cluttered Grasping
Hritam Basak ⋅ Zhaozheng Yin
GlassGS: Geometry and Concept-Aware 3D Gaussian Splatting for Reflective Enclosures
Mingxuan Cui ⋅ Yunrui Zhu ⋅ Wuqi Wang ⋅ Di Lin ⋅ Jianhua Zhang ⋅ Jie Zhang ⋅ Ming-Ming Cheng ⋅ Shengyong Chen ⋅ Qing Guo
Video Generative Models as Geometry Learner
Haosen Yang ⋅ Song Jifei ⋅ Zhensong Zhang ⋅ Xiatian Zhu ⋅ Jiankang Deng
SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
Ruiqi Shen ⋅ Chang Liu ⋅ Henghui Ding
Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker
Zongjian Wu ⋅ Lei Zhang
Pol-CACTI: A System and dataset forHigh-Speed Polarized Video Compressive Imaging
Yunfeng Song ⋅ Yidong Luo ⋅ Ping Wang ⋅ xingjian jiang ⋅ Xin Yuan
Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension
Lian Xu ⋅ Mohammed Bennamoun ⋅ Farid Boussaid ⋅ Hamid Laga ⋅ Yulan Guo ⋅ Dan Xu
Pathwise Test-Time Correction for Autoregressive Long Video Generation
Xunzhi Xiang ⋅ Zixuan Duan ⋅ Guiyu Zhang ⋅ Haiyu Zhang ⋅ Zhe Gao ⋅ Junta Wu ⋅ Shaofeng Zhang ⋅ Tengfei Wang ⋅ Qi Fan ⋅ Chunchao Guo
MedCAGD: Context-Aware Gated Decoder for Robust Medical Image Segmentation
Saad Wazir ⋅ Patrick Vibild ⋅ Dinh Tran ⋅ Seongah Kim ⋅ Daeyoung Kim
DOGE: Differentiable Bézier Graph Optimization for Road Network Extraction
Jiahui Sun ⋅ Junran Lu ⋅ Jinhui Yin ⋅ Yishuo Xu ⋅ Yuanqi Li ⋅ Yanwen Guo
DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution
Chaoran Xu ⋅ Chengkan Lv ⋅ Qiyu Chen ⋅ Yunkang Cao ⋅ Feng Zhang ⋅ Zhengtao Zhang
CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving
Zhaohong Liu ⋅ Hao Ye ⋅ Xianlin Zhang ⋅ Mengshi Qi
Mitigating Radar-Inertial Calibration Ambiguities via SO(3) Manifold Steering
Chunshen Li ⋅ Shengpeng Wang ⋅ Zitao Ye ⋅ Wei Wang
Φeat: Physically-Grounded Material Feature Representation
Giuseppe Vecchio ⋅ Adrien Kaiser ⋅ Claudia Cuttano ⋅ ROUFFET Romain ⋅ Rosalie MARTIN ⋅ Elena Garces ⋅ Tamy Boubekeur
DG-Force: Disentangling and Gathering Forensic Cues is Needed for Image Manipulation Localization
Yong Yao ⋅ Zhenyu Cui ⋅ Lei Chen ⋅ Jiwen Lu ⋅ Jiahuan Zhou
Conditional Flow Matching for Visually-Guided Acoustic Highlighting
Hugo Malard ⋅ Gael Le Lan ⋅ Daniel Wong ⋅ David Alon ⋅ YI-CHIAO WU ⋅ Sanjeel Parekh
Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction
Clémentine Grethen
Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification
Stanisław Janik ⋅ Michal Byra
Social-Mamba: Socially-Aware Trajectory Forecasting with State-Space Models
Po-Chien Luan ⋅ Wuyang Li ⋅ Yang Gao ⋅ Alexandre ALahi
ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views
Giuseppe Stracquadanio ⋅ Kevin Raj ⋅ Julia Grabinski ⋅ Stefan Roth
Defending from GeoLocalization through Adversarial Road Trips
Niccolò Niccoli ⋅ Federico Becattini ⋅ Lorenzo Seidenari
IConE: Batch Independent Collapse Prevention for Self-Supervised Representation Learning
Konstantinos Almpanakis ⋅ Anna Kreshuk
SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation
Víctor Barreiro ⋅ Johannes Jakubik ⋅ Francisco Argüello ⋅ Dora Heras
Invisible Shortcuts: Why Vision Encoders Know Your Camera
Vladan Stojnic ⋅ Ryan Ramos ⋅ Giorgos Kordopatis-Zilos ⋅ Noa Garcia ⋅ Giorgos Tolias
Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes
Vasiliki Ismiroglou ⋅ Tasos Benos ⋅ Malte Pedersen ⋅ Stefan Bengtson ⋅ Thomas B. Moeslund
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
Thomas De Min ⋅ Subhankar Roy ⋅ Stéphane Lathuilière ⋅ Elisa Ricci ⋅ Massimiliano Mancini
BEV-GS: Feed-forward Gaussian Splatting in Bird’s-Eye-View for Road Reconstruction
Wenhua Wu ⋅ Tong Zhao ⋅ Chensheng Peng ⋅ Lei Yang ⋅ Zhe Liu ⋅ Hesheng Wang
Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion
Yuqi Yang ⋅ Dongliang Chang ⋅ Yijia Ling ⋅ Ruoyi Du ⋅ Zhanyu Ma
OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos
Oussema Dhaouadi ⋅ Zuria Bauer ⋅ Johannes Meier ⋅ Olaf Wysocki ⋅ Marc Pollefeys ⋅ Daniel Cremers
TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches
Langzhe Gu ⋅ Hung-Jui Huang ⋅ Mohamad Qadri ⋅ Michael Kaess ⋅ Wenzhen Yuan
Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
Taewook Kang ⋅ Taeheon Kim ⋅ Donghyun Shin ⋅ Jonghyun Choi
Guide, Think, Act: Interactive Embodied Reasoning for Vision-Language-Action Model
Yiran Ling ⋅ Qing Lian ⋅ Jinghang Li ⋅ Qing Jiang ⋅ TianMing Zhang ⋅ Xiaoke Jiang ⋅ Chuanxiu Liu ⋅ Jie Liu ⋅ Lei Zhang
Noise is a Good Teacher: A Noise-Driven Framework for Robust Collaborative Perception
Chengyan Huang ⋅ Zhongxiang Zhao ⋅ Ziyao Zhang ⋅ Zihao Yang ⋅ Lin Wang
PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving
Kyuhwan Yeon ⋅ Benjamin Ramtoula ⋅ Daniele De Martini
GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation
Xinyu Wang ⋅ Muhammad Ibrahim ⋅ Atif Mansoor ⋅ Ajmal Mian
GR-GRPO: Graph-Diffused Credit for Autoregressive Image RL Alignment
Zheyu Zhang ⋅ Peng-Tao Jiang ⋅ Tianyi Zheng ⋅ Jian Zhang ⋅ Jinwei Chen ⋅ Bo Li
Category-Level 3D Correspondence in Camera Space via Morphable Object Priors
Leonhard Sommer ⋅ Artur Jesslen ⋅ Basavaraj Sunagad ⋅ Adam Kortylewski
InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem
Yeobin Hong ⋅ Suhyeon Lee ⋅ Hyungjin Chung ⋅ Jong Chul Ye
POET: Preference Optimization for Enhanced Text-to-Image Generation
Ruibo Chen ⋅ Jiacheng Pan ⋅ Heng Huang ⋅ Zhenheng Yang
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
Yuwei Guo ⋅ Ceyuan Yang ⋅ Hao He ⋅ Yang Zhao ⋅ Meng Wei ⋅ Zhenheng Yang ⋅ Weilin Huang ⋅ Dahua Lin
Fill2SR: Repurposing Inpainting Diffusion Transformers for Real-World Super-Resolution
Xingfu Yi ⋅ Xiaoxue Yu
General Self-Calibration with Varying Intrinsics
Norio Kosaka ⋅ Timothy Duff ⋅ Tomas Pajdla ⋅ Akihiro Sugimoto
Mixture of Specialized Vision Experts: Unlocking Complementary Visual Insights for Faithful MLLM Reasoning
Yifei Gao ⋅ Liangliang You ⋅ Jiye Xie ⋅ changwei wang ⋅ Kexue Fu ⋅ Jingyi Liu ⋅ Rongtao Xu ⋅ Zhiqiang Kou ⋅ Haoran Xu ⋅ Longxiang Gao ⋅ Yu Zhang
E-M3RF: An Equivariant Multimodal 3D Re-assembly Framework
Adeela Islam ⋅ Stefano Fiorini ⋅ MANUEL LECHA SANCHEZ ⋅ Theodore Tsesmelis ⋅ Stuart James ⋅ Pietro Morerio ⋅ Alessio Del Bue
Beyond Common Sense: Grounding Logical Anomaly Detection in Inspection Criteria
Yuanze Li ⋅ YuanShihao YuanShihao ⋅ Zimeng Zhu ⋅ Ming LIU ⋅ Wangmeng Zuo ⋅ Guangming Shi
MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes
Kartik Bali ⋅ Roland Aydin
Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
Shravan Venkatraman ⋅ Ritesh Thawkar ⋅ Omkar Thawakar ⋅ Rao M Anwer ⋅ Hisham Cholakkal ⋅ Salman Khan ⋅ Fahad Shahbaz Khan
Experts-Guided Unbalanced Optimal Transport for ISP Learning from Unpaired and/or Paired Data
Georgy Perevozchikov ⋅ Nancy Mehta ⋅ Egor Ershov ⋅ Radu Timofte
In-Context Sync-LoRA for Portrait Video Editing
Sagi Polaczek ⋅ Or Patashnik ⋅ Ali Mahdavi-Amiri ⋅ Danny Cohen-Or
SDSA: Shallow-Deep Squeezing Adapter for Vision-Language Models
Hao Wang ⋅ Rui Zhu ⋅ Xiaoxu Li ⋅ Zhanyu Ma ⋅ Jing-Hao Xue
OneHSI: A Unified Hyperspectral Foundation Model with Physical Consistency
Yufei WEN ⋅ Jingdan KANG ⋅ SHUXIN ZHONG ⋅ Yuting Zhang ⋅ Yutong Feng ⋅ Jintai Chen ⋅ Kaishun Wu
Mask-guided Semantic Alignment: Robust Learning with Noisy Labels via Temporal Attention Stability
Yubo Nian ⋅ Can Gao
P3-SAM: Native 3D Part Segmentation
CHANGFENG MA ⋅ YANG LI ⋅ Xinhao Yan ⋅ Jiachen Xu ⋅ Yunhan Yang ⋅ Chunshi Wang ⋅ Zibo Zhao ⋅ Yanwen Guo ⋅ Zhuo Chen ⋅ Chunchao Guo
Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
Kangsheng Duan ⋅ Ziyang Xu ⋅ Wenyu Liu ⋅ Xiaohu Ruan ⋅ Xiaoxin Chen ⋅ Xinggang Wang
Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation
Niclas Popp ⋅ Kevin Laube ⋅ Matthias Hein ⋅ Lukas Schott
SDUM: A Scalable Deep Unrolled Model for Universal Cardiac MRI Reconstruction
Puyang Wang ⋅ Pengfei Guo ⋅ Keyi Chai ⋅ Jinyuan Zhou ⋅ Daguang Xu ⋅ Shanshan Jiang
SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning
Jian He Low ⋅ Alexandre Symeonidis-Herzig ⋅ Maksym Ivashechkin ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization
Théophane Vallaeys ⋅ Jakob Verbeek ⋅ MATTHIEU CORD
Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models
Zehao Liu ⋅ Weijieying Ren ⋅ Jipeng ZHANG ⋅ Tianxiang Zhao ⋅ Jingxi Zhu ⋅ Xiaoting Li ⋅ Vasant Honavar
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
Ruichuan An ⋅ Kai Zeng ⋅ Ming Lu ⋅ Sihan Yang ⋅ Renrui Zhang ⋅ Huitong Ji ⋅ Hao Liang ⋅ Wentao Zhang
AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking
Zining Wang ⋅ Tongkun Guan ⋅ Boming Chen ⋅ Zhentao Guo ⋅ Jianqiang Liu ⋅ chao jin ⋅ Chen Duan ⋅ Kai zhou ⋅ Pengfei Yan ⋅ Wei Shen ⋅ Xiaokang Yang
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
Byungwoo Jeon ⋅ Dongyoung Kim ⋅ Huiwon Jang ⋅ Insoo Kim ⋅ Jinwoo Shin
Gradient sparsity regularization for training unlearning-compatible models
Sobhan Hemati ⋅ Soufiane Lamghari ⋅ Masoud Asgharian ⋅ Xu Li ⋅ Hongliang Li
Rethinking Cross-Spectral Image Generation via Shared-Specific Representation
Haining Wang ⋅ Na Li ⋅ Huijie Zhao ⋅ Yifan Da ⋅ Yan Wen ⋅ Yi Su ⋅ Yuqiang Fang
TerraDiT-Ω: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive
Brian Wei ⋅ Srikumar Sastry ⋅ Daniel Cher ⋅ Eric Xing ⋅ Nathan Jacobs
The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models
Robert Welch ⋅ Emir Konuk ⋅ Kevin Smith
DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation
Siobhan Reid ⋅ Zhixiang Chi ⋅ Li Gu ⋅ Omid Heidari ⋅ Ziqiang Wang ⋅ Yang Wang
Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders
Amandeep Kumar ⋅ Vishal Patel
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
Xiaohu Huang ⋅ Haoyang He ⋅ Hao Zhou ⋅ Qiangpeng Yang ⋅ Min Zheng ⋅ Kai Han
Equivariant Symmetry-Aware Head Pose Estimation for Fetal MRI
Ramya Muthukrishnan ⋅ Borjan Gagoski ⋅ Aryn Lee ⋅ Ellen Grant ⋅ Elfar Adalsteinsson ⋅ Benjamin Billot ⋅ Polina Golland
Seen2Scene: Completing Realistic 3D Scenes with Visibility-Guided Flow
Quan Meng ⋅ Yujin Chen ⋅ Lei Li ⋅ Matthias Niessner ⋅ Angela Dai
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
Yogesh Kulkarni ⋅ Pooyan Fazli
EAGS: Error-Aware Gaussian Splatting with Dual-Confidence-Guided Modeling for Uncalibrated Driving Scenes
Cen Zhigabng ⋅ Ningyan Guo ⋅ Yulan Guo ⋅ Yifan Ge ⋅ Zhiyong Feng
Dual-Margin Embedding for Fine-Grained Long-Tailed Plant Taxonomy
Cheng-Yaw Low ⋅ Heejoon Koo ⋅ Jaewoo Park ⋅ Meeyoung Cha
Physics-Grounded Disentangled Flow Modeling for Brain Disease Progression Trajectory
Jun Wang ⋅ Peirong Liu
Generative Relightable Avatars
Kunwar Singh ⋅ Christian Theobalt ⋅ Rishabh Dabral
On the Plasticity Collapse in Continual Machine Unlearning
Yingdan Shi ⋅ Xiang Xu ⋅ Kaize Ding ⋅ Alfred Hero ⋅ Ren Wang
Implicit Neural Representation for Spherical Harmonics Reconstruction of Motion-Corrupted Fetal Diffusion MRI
Wenxuan Wu ⋅ Irina Grigorescu ⋅ Ruowen Qu ⋅ Jo Hajnal ⋅ J-Donald Tournier ⋅ Maria Deprez
Egocentric Procedure Parsing
Anubhav Anubhav ⋅ Archit Kambhamettu ⋅ Vatsal Agarwal ⋅ Pulkit Kumar ⋅ Abhinav Shrivastava
StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description
Seung Hahm ⋅ Minh Dinh ⋅ SouYoung Jin
Weight Feedback Computes the Exact Jacobian Transpose in Modern Deep Networks
Junlong Shen ⋅ Xingyu Li
Estimating Velocity and Spin of Spherical Objects from Rolling-Shutter Image(s)
Wenjie Xue ⋅ Jun Yang ⋅ Jingmin Wang ⋅ Limin Shang
Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models
Mariam Hassan ⋅ Bastien van Delft ⋅ Wuyang Li ⋅ Alexandre ALahi
STAT: Soft Tail-dropping for Adaptive Visual Tokenization
Zeyuan Chen ⋅ Kai Zhang ⋅ Zhuowen Tu ⋅ Yuanjun Xiong
Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring
Taeho Kang ⋅ Nairan Zhang ⋅ Yelin Kim ⋅ Yujiao Shi ⋅ Youngki Lee
Solving Diffusion Inverse Problems with Restart Posterior Sampling
Bilal Ahmed ⋅ Joseph Makin
RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception
Shaozu Ding ⋅ Linan Song ⋅ Marco Vincenzi ⋅ Dajiang Suo
When the Teacher Has More Bits: Self-Teacher Latent Distillation for Learned Image Compression
Abdellah Mennaoui ⋅ Joseph Meehan ⋅ Jean-Luc Dugelay ⋅ Ghalia Hemrit
Fast Spatial Memory with Scalable Elastic Test-Time Training
Ziqiao Ma ⋅ Xueyang Yu ⋅ Haoyu Zhen ⋅ Yuncong Yang ⋅ Joyce Chai ⋅ Chuang Gan
ReGen3D: Generalizable Unified Representation Learning for 3D Understanding
Haotian Zhang ⋅ Jincen Jiang ⋅ Yuhang Li ⋅ Jian Jun Zhang ⋅ Meili Wang ⋅ Jian Chang
Anchored, Not Graded: How Vision-Language Models Fail at Slant-from-Texture Perception
Qian Zhang ⋅ Michal Golovanevsky ⋅ Fulvio Domini ⋅ James Tompkin
WorldFlow3D: Flowing Through 3D Distributions for Unbounded World Generation
Amogh Joshi ⋅ Julian Ost ⋅ Felix Heide
Importance-Aware Low-Rank Distillation of Diffusion Transformers
Denis Zavadski ⋅ Sebastian Heid ⋅ Damjan Kalšan ⋅ Stefan Roth ⋅ Carsten Rother
From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation
Rit Gangopadhyay ⋅ Alex Wong
Geometry-Anchored Transport Framework for Exemplar-Free Class-Incremental Learning
Hongye Xu ⋅ Bartosz Krawczyk
RayRoPE: Projective Ray Positional Encoding for Multi-view Attention
Yu Wu ⋅ Minsik Jeon ⋅ Rick Chang ⋅ Oncel Tuzel ⋅ Shubham Tulsiani
VideoSfM: Exploiting Temporal Structure for Video-Based Structure-from-Motion
Zador Pataki ⋅ Paul-Edouard Sarlin ⋅ Marc Pollefeys
MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training
Lucia Gordon ⋅ Serge Belongie ⋅ Christian Igel ⋅ Nico Lang
Unsafe by Reciprocity: How Generation–Understanding Coupling Undermines Safety in Unified Multimodal Models
Kaishen Wang ⋅ Heng Huang
Dense Dynamic Scene Reconstruction and Camera Pose Estimation from Multi-View Videos
Shuo Sun ⋅ Unal Artan ⋅ Malcolm Mielle ⋅ Achim Lilienthal ⋅ Martin Magnusson
GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures
Patrick Noras ⋅ Jun Myeong Choi ⋅ Didier Stricker ⋅ Pieter Peers ⋅ Roni Sengupta
Unsupervised Pixel-Level Semantic Left-Right Understanding of In-the-Wild Images
Weikang Wang ⋅ Tobias Weißberg ⋅ Florian Bernard
StAR: Segment Anything Reasoner
Seokju Yun ⋅ Dongheon Lee ⋅ Noori Bae ⋅ Jaesung Jun ⋅ Chanseul Cho ⋅ Youngmin Ro
QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception
Seth Zhao ⋅ Huizhi Zhang ⋅ Zhaowei Li ⋅ Juntong Peng ⋅ Anthony Chui ⋅ Zewei Zhou ⋅ Zonglin Zonglin ⋅ Hao Xiang ⋅ Zhiyu Huang ⋅ Fujia Wang ⋅ Ran Tian ⋅ Chenfeng Xu ⋅ Bolei Zhou ⋅ Jiaqi Ma
Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Large Language Models and Reinforcement Learning
Yiqing Shen ⋅ Mathias Unberath
Learn2Fold: Structured Origami Generation with World Model Planning
Yanjia Huang ⋅ Yunuo Chen ⋅ Ying Jiang ⋅ Zhengzhong Tu ⋅ Yin Yang ⋅ Chenfanfu Jiang
UniFusion: Sparse-View 4D Reconstruction via Unified Spatio-temporal Depth Alignment
Yongzhe Lyu ⋅ Shaofei Wang ⋅ Yixin Chen ⋅ Siyuan Huang
ZMIS-SAM: Segment Anything Model Enhanced With Wavelet Transform For Zooplankton Microscopy Image Instance Segmentation
Dekun Yuan ⋅ Zhongwei Li ⋅ Zheng Qiao ⋅ Jie Zhang
RayMap3R: Inference-Time RayMap for Dynamic 3D Reconstruction
Feiran Wang ⋅ Zezhou Shang ⋅ Gaowen Liu ⋅ Yan Yan
Relaxed Rigidity with Ray-based Grouping for Dynamic Gaussian Splatting
Junoh Lee ⋅ Junmyeong Lee ⋅ Yeon-Ji Song ⋅ Inhwan Bae ⋅ Jisu Shin ⋅ Hae-Gon Jeon ⋅ Jin-Hwa Kim
WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images
Xiyu Zhang ⋅ Jingyu Zhuang ⋅ Hongjia Zhai ⋅ Zizheng Yan ⋅ Jinwei Chen ⋅ Guofeng Zhang ⋅ Qingnan Fan
Counterfactual World Models via Digital Twin-conditioned Video Diffusion
Yiqing Shen ⋅ Aiza Maksutova ⋅ Chenjia Li ⋅ Mathias Unberath
Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models
Enrico Cassano ⋅ Riccardo Renzulli ⋅ Rayyan Ahmed ⋅ Stephan Alaniz ⋅ Marco Grangetto
The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos
Zhuoyuan Wu ⋅ Xurui Yang ⋅ Jiahui Huang ⋅ Yue Wang ⋅ Jun Gao
Towards In-Context Tone Style Transfer with A Large-Scale Triplet Dataset
Yuhai Deng ⋅ Huimin She ⋅ Wei Shen ⋅ Meng Li ⋅ Ruoxi Wu ⋅ Lunxi Yuan ⋅ Xiang Li
TiCRL: Textual Image Classification with Reinforcement Learning-Based Curriculum Learning
Gayoung KIM ⋅ Yuncheol Kang
Generalized Biomedicine Discovery
Luyao Tang ⋅ Yingkai Yang ⋅ Hanqi Chen ⋅ Jiewei Zheng ⋅ Chaoqi Chen ⋅ Cheng Chen
FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small-Object Detection
Aiwen Liu ⋅ Chengguang Zhu ⋅ Gang Wang ⋅ Dandan Zhu ⋅ Haodong Lin ⋅ Yan Wang ⋅ Huiyu Zhou ⋅ Zhengyi Pan
MixTTA: Low-Rank Cross-Channel Mixing for Reliable Test-Time Adaptation
Mansoo Jung ⋅ Youngwook Kim ⋅ Jungwoo Lee
Target-aware Image Editing via Cycle-consistent Constraints
Yanghao Wang ⋅ Zhen Wang ⋅ Long Chen
MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics
Haofeng Liu ⋅ Yang Zhou ⋅ Ziheng Wang ⋅ Zhengbo Xu ⋅ Zhan Peng ⋅ Jie Ma ⋅ Jun Liang ⋅ Shengfeng He ⋅ Jing Li
OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras
Chaesong Park ⋅ Jihyeon Hwang ⋅ Muyeol Sung ⋅ Jongwoo Lim
FineEdit: Fine-Grained Image Edit with Bounding Box Guidance
Haohang Xu ⋅ Lin Liu ⋅ Zhibo Zhang ⋅ Rong Cong ⋅ Xiaopeng Zhang ⋅ Qi Tian
Purify then Guide: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing
Yingjie Ma ⋅ Xun Lin ⋅ Zitong Yu ⋅ Haonan Wang ⋅ Ruixin Zhang ⋅ Shouhong Ding ⋅ Xin Liu ⋅ Xiaochen Yuan ⋅ Weicheng Xie ⋅ Linlin Shen
Beyond Filter Pruning: Top-K Spatial Selection for Efficient Neural Networks
Sarthak Ketanbhai Modi ⋅ Hans Soegeng ⋅ Thomas Peyrin
Slim-DETR: Real-Time Tiny Object Detection with Efficient Interaction and Gaussian Query
Tong Wu ⋅ Jiahao Zhang ⋅ Juntao Guan ⋅ Lai Rui
ColorFM: An Optimization-to-Learning Framework for Color Transfer via Flow Matching
Yuhang He ⋅ Kai Zhang ⋅ Xiaoming Li ⋅ Du Chen ⋅ Jian Yang
MindBlock: Probing Spatial Assembly and Structure in Unified Multimodal Models
Baiqiao Yin ⋅ Junhao Liu ⋅ Han Yin ⋅ Heyang Yu ⋅ Tingxuan Zhang ⋅ Zhiheng Li ⋅ Chengzu Li ⋅ Jihan YANG ⋅ Manling Li ⋅ Chen Feng ⋅ Yiming Li
HumanOmni-Speaker: Identifying Who said What and When
Detao Bai ⋅ Xihan Wei ⋅ Zhiheng Ma
Towards More Efficient Decoding for Autoregressive Vision-language-action Models
Wenxuan Song ⋅ Jiayi Chen ⋅ Pengxiang Ding ⋅ Yuxin Huang ⋅ Han Zhao ⋅ Yinchuan Li ⋅ Yingcong Chen ⋅ Donglin Wang ⋅ Haoang Li
BATQuant: Outlier-Resilient MXFP4 Quantization via Learnable Block-wise Optimization
Jifu Li ⋅ Manyi Zhang ⋅ Xiaobo Xia ⋅ Han Bao ⋅ Haoli Bai ⋅ Zhenhua Dong ⋅ Xianzhi Yu
Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models
Shinnosuke Saito ⋅ Takashi Matsubara
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
Wenxuan Song ⋅ Jiayi Chen ⋅ Shuai Chen ⋅ Jingbo Wang ⋅ Pengxiang Ding ⋅ Han Zhao ⋅ qin yikai ⋅ Xinhu Zheng ⋅ Yan Wang ⋅ Donglin Wang ⋅ Haoang Li
SpecV: Specification Verification for Robust Unified Multimodal Evaluation
Weihao Yu ⋅ Rongyao Fang ⋅ Yuxuan Cai ⋅ Linjiang Huang ⋅ Yuhuan Yang ⋅ Xianwei Zhuang ⋅ Junyang Lin ⋅ Yixuan Yuan ⋅ Shuai Bai
RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory
Hongbo Mao ⋅ Junjun Jiang ⋅ Youyu Chen ⋅ Jiaxin Zhang ⋅ Zhemeng Dong ⋅ Xianming Liu
DiverseAD: A Large-Scale Driving Dataset with Diverse Atmospheric Conditions
Haoyu Wang ⋅ Baorui Ma ⋅ Donglin Di ⋅ Suhang Xuan ⋅ Hao Li ⋅ Shiliang Zhang
MoAKE: Toward Unified All-in-One Action Quality Assessment via Mixture of Action Knowledge Experts
Huangbiao Xu ⋅ Huanqi Wu ⋅ Xiao Ke ⋅ Jiaxin Cai ⋅ Junyi Wu ⋅ Jinglin Xu
ART-VSR: Adaptive Rectified Trajectories for One-Step Video Super-Resolution
JianHui Zhang ⋅ Chen Fang ⋅ Wanghao Wanghao ⋅ chaoyu feng ⋅ LEI LEI ⋅ Jue Wang ⋅ Shuaicheng Liu
Scale3D: Autoregressive Modeling for Large Outdoor Scene Generation
DI QI ⋅ Zheng Sun ⋅ Xuanyang Zhang ⋅ Gang Yu
Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration
Kyoleen Kwak ⋅ Daeho Kim ⋅ Jeong Woon Lee ⋅ Hyoseok Hwang
One-Shot Feed-Forward 360° Animatable Avatar via Inpainted UV-Space Gaussian Modeling
Shuling Zhao ⋅ Dan Xu
Why Can Accurate Models Be Learned from Inaccurate Annotations?
Chongjie Si ⋅ Yidan Cui ⋅ Fuchao Yang ⋅ Wei Shen
Score-Based Matching with Target Guidance for Cryo-EM Denoising
Xiaoqi Wu ⋅ Xueying Zhan ⋅ Wen Li ⋅ Junhao Wu ⋅ Xin Huang ⋅ Ke Ni ⋅ Min Xu
DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming
ZHIHUI KE ⋅ Yvyang Liu ⋅ Xiaobo Zhou ⋅ Tie Qiu
CGCE: Classifier-Guided Concept Erasure in Generative Models
Viet Nguyen ⋅ Vishal Patel
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction
Chin-Yang Lin ⋅ Yang-Che Sun ⋅ Cheng Sun ⋅ Fu-En Yang ⋅ Min-Hung Chen ⋅ Yen-Yu Lin ⋅ Wei-Chen Chiu ⋅ Yu-Lun Liu
VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus
Rohit Sinha ⋅ Kunal Tilaganji ⋅ Tanuja Ganu ⋅ Nagarajan Natarajan ⋅ Amit Sharma ⋅ Vineeth N Balasubramanian
Geometry Aware Reliable Instance Selection for Noisy Partial Label Learning
Rohit Sinha ⋅ Saroj Kumar
EventSpecPS: Photometric Stereo with Multispectral Reflectance Using an Event Camera
Jingqian Wu ⋅ Bohan Yu ⋅ Jun Hoong Chan ⋅ Edmund Lam ⋅ Boxin Shi
PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates
SATOSHI HASHIMOTO ⋅ Yanan Wang ⋅ Hitoshi Nishimura ⋅ Mori Kurokawa
EGVLR: Evidence-Grounded Vision–Language Reinforcement for Anomaly Reasoning
SHIH-CHIH(Leo) LIN ⋅ Ying-Heng Lu ⋅ DONG YE ⋅ Shang-Hong Lai
Temporally Aware Densification for Dynamic 3D Gaussian Splatting
VIKRAM SANDU ⋅ Mayurdeep Pathak ⋅ Rajiv Soundararajan
MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
Haoyu Chen ⋅ Kaichen Zhou ⋅ Hang Hua ⋅ Kaile Zhang ⋅ Jingwen Qian ⋅ Wufei Ma ⋅ Haonan Chen ⋅ Chunjiang Liu ⋅ Yizhou Zhao ⋅ Xiaoyuan Wang ⋅ Weiyue Li ⋅ Alan Yuille ⋅ Paul Pu Liang ⋅ Yilun Du
AutoCompass: Accurate Visual Localization on Public Maps by Learning from Weak Labels
Javier Tirado-Garín ⋅ Alan Paul ⋅ Shuai Chen ⋅ Axel Barroso-Laguna ⋅ Tommaso Cavallari ⋅ Daniyar Turmukhambetov ⋅ Victor Adrian Prisacariu ⋅ Eric Brachmann
SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking
Mohamad Alansari ⋅ Yonathan Michael ⋅ Hasan AlMarzouqi ⋅ Muhammad Muzammal Naseer ⋅ Naoufel Werghi ⋅ Sajid Javed
Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation
Hyunsoo Lee ⋅ Inwoo Hwang ⋅ Young Min Kim
Flash-DD: An Ultra Parameter-Efficient Approach to Dataset Distillation
Ruonan Yu ⋅ Songhua Liu ⋅ Xinchao Wang
Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment
Qifei Jia ⋅ Xintong Yao ⋅ Minghao Li ⋅ Yajie Chai ⋅ Qiming Lu ⋅ Baoyue Shen ⋅ Yasen Zhang ⋅ Runyu Shi ⋅ Ying Huang ⋅ Yue Zhang
Accurate Zero-shot Quantization via Hierarchical Teacher-Assistant Distillation
Wonjin Cho ⋅ Jeongin Yun ⋅ U Kang
How to Teach Large Multimodal Models New Skills
Zhen Zhu ⋅ Yiming Gong ⋅ Yao Xiao ⋅ Yaoyao Liu ⋅ Derek Hoiem
Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence
Han Hu ⋅ Dongheng Lin ⋅ Yuqi Hou ⋅ Haotian LI ⋅ Hyung Jin Chang ⋅ Jianbo Jiao
AutoPhyX: Automatic Text-Condition Physics Property Generation
Bei Huang ⋅ Yixin Chen ⋅ Hongbin Zha ⋅ Yuru Pei ⋅ Siyuan Huang
Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction
Janet Wang ⋅ Yunbei Zhang ⋅ Lin Zhao ⋅ Xi Xiao ⋅ Jihun Hamm ⋅ Xiao Wang
PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos
Dongheng Lin ⋅ Jianbo Jiao
HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers
Jing Yang ⋅ Mayoore Jaiswal ⋅ Zian Wang ⋅ Xiao Zeng ⋅ Yajie Zhao ⋅ Jianyuan Min ⋅ Rochelle Pereira
FDM-MFVT: Few-step Sampling Diffusion Model for Mask-Free Virtual Try-On
Jiaxin Liu ⋅ XIAOYE LIANG ⋅ Lai Jiang ⋅ Jun Liu ⋅ Mai Xu
Lightweight Online Reinforcement Learning for Block Decomposition of CAD Models
Xitong Luo ⋅ Zhenghan Wu ⋅ Yucong Wang ⋅ Yi Cai
MoCA3D: Monocular 3D Bounding Box Prediction in the Image Plane
Changwoo Jeon ⋅ Rishi Upadhyay ⋅ Achuta Kadambi
Q-TriM: Question-Guided Tri-Modal Attention for Audio–Visual Question Answering
SungHun Kim ⋅ Seung Baek
Unbalanced Optimal Transport for Efficient Visual Document Retrieval
Hoyeon Shin ⋅ Jeongyeon Kim ⋅ Yeong Jun Koh ⋅ Yeoneung Kim ⋅ Hanul Kim
Representation Alignment for Just Image Transformers is not Easier than You Think
Jaeyo Shin ⋅ Jiwook Kim ⋅ Hyunjung Shim
DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images
Wu Ke ⋅ Yanan Zhang ⋅ Yingjie Gao ⋅ Wenhao Li ⋅ Chenyu Zhou ⋅ Xinzhu Ma ⋅ Di Huang ⋅ Di Huang
G3AFT: Glance Guided Gradient Aligned Fine-Tuning for Visual Autoregressive Models
Jiayi Zhang ⋅ Xiefan Guo ⋅ Xinzhu Ma ⋅ Di Huang
LINA: Learning INterventions Adaptively for Physical Alignment and Counterfactual Generation in Diffusion Models
Shu Yu ⋅ Chaochao Lu
SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions
Siyuan Yao ⋅ Ziqi Wang ⋅ Junqi Huang ⋅ Ruiqi Yu ⋅ Wenqi Ren ⋅ Xiaochun Cao
TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid
Seonghun Oh ⋅ Youngjung Uh ⋅ Jin-Hwa Kim
Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation
Gongshu Wang ⋅ Zhirui Wang ⋅ Kan Yang
DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection
hun im ⋅ Jungi Lee ⋅ Subeen Cha ⋅ Pilsung Kang
Demystifing Video Reasoning
Ruisi Wang ⋅ Zhongang Cai ⋅ Fanyi Pu ⋅ Junxiang Xu ⋅ Wanqi Yin ⋅ Maijunxian Wang ⋅ Ran Ji ⋅ Chenyang Gu ⋅ Bo Li ⋅ Ziqi Huang ⋅ Hokin Deng ⋅ Dahua Lin ⋅ Ziwei Liu ⋅ Lei Yang
FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction
Seonghyun Jin ⋅ Jong Chul Ye
RADmesh: Remesh-Aware Mesh Deformation
Nam Anh Dinh ⋅ Itai Lang ⋅ Oded Stein ⋅ Rana Hanocka
Table-MCR2TR: Merged-Cell-Aware Table Recognition via Reinforced Multimodal Language Models
Bangbang Zhou ⋅ Zhaoqing Zhu ⋅ Feiyu Gao ⋅ Hangdi Xing ⋅ Yadong Qu ⋅ Qi Zheng ⋅ Ming Yan ⋅ Hongtao Xie
TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction
Ao Li ⋅ Yonggen Ling ⋅ Yiyang Lin ⋅ Yuji Wang ⋅ Yong Deng ⋅ Yansong Tang
Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation
Xiaochen Yang ⋅ Hao Fang ⋅ Jiawei Kong ⋅ Yaoxin Mao ⋅ Bin Chen ⋅ Shu-Tao Xia
LaxMotion: Rethinking Supervision Granularity for 3D Human Motion Generation
Sheng Liu ⋅ Yuanzhi Liang ⋅ Sidan DU
Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling
Yang Zhao ⋅ Peisong Niu ⋅ Tian Zhou ⋅ Ziqing Ma ⋅ Guanlong Ma ⋅ Rong Jin ⋅ Huiling Yuan ⋅ Liang Sun
GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training
Yejun zhang ⋅ Xinjue Wang ⋅ Zihan Wang ⋅ Esa Rahtu ⋅ Juho Kannala
Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video
Siyuan Li ⋅ Weiying Chen ⋅ Yilin Wang ⋅ Xinxin Zuo ⋅ Xingyu Li ⋅ Li Cheng
UniCSG: Unified High-Fidelity content-constrained style-driven generation via Staged Semantic and Frequency Disentanglement
Jingwei Yang ⋅ Ruoxi Wu ⋅ Wei Shen ⋅ Meng Li ⋅ Yulong Liu ⋅ Huimin She ⋅ Lunxi Yuan
LVSPM: Long Sequence View Synthesis and Pose Estimation Model
Xi Chen ⋅ Yachi Zhang ⋅ Linghao Chen ⋅ Minghua Liu ⋅ Hao Su ⋅ Zexiang Xu ⋅ Xiaoshuai Zhang
CLUE-VAD: Structured Semantic Clues for Understanding Explainable Events in Video Anomaly Detection
MYOUNG-CHUL KIM ⋅ Junhee Lee ⋅ ChaeBeen Bang ⋅ MyeongAh Cho
Synesthesia via Direct Latent Augmentation: Bypassing the Decode-Encode Loop for Cross-Modal Distillation
Cristian Sbrolli ⋅ Nicolas Michel ⋅ Matteo Matteucci ⋅ Toshihiko Yamasaki
SIMON: SImultaneous Multi-Object Navigation
Yifeng Zhu ⋅ Siyuan Huang ⋅ Jun Bao ⋅ Jun Yu ⋅ Buyu Liu
Scene Generation at Absolute Scale: Utilizing Semantic and Geometric Guidance From Text for Accurate and Interpretable 3D Indoor Scene Generation
Stefan Ainetter ⋅ Thomas Deixelberger ⋅ Edoardo Dominici ⋅ Philipp Drescher ⋅ Konstantinos Vardis ⋅ Markus Steinberger
FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction
Guangcheng Chen ⋅ Lihuang Fang ⋅ Huaqi Tao ⋅ Yicheng He ⋅ Li He ⋅ Zhang Hong
RUTaL: Residual Upcycling with Task Ladder for Efficient Multi-Task Learning
Haiming Yao ⋅ Wei Luo ⋅ Qiyu Chen ⋅ Jianxing Liao ⋅ Wei You
Hybrid-LUT: Channel-Aware Hybrid Lookup Table and Filtering for Efficient Image Restoration
Zhilin Ai ⋅ Boyu Li ⋅ Sidi Yang ⋅ Wenqing Shi ⋅ Wenyong Zhou ⋅ Binxiao Huang ⋅ Chenchen Ding ⋅ Ngai Wong
Who Does What and Where to Go: Orthogonal Alignment and Hierarchical Planning for Multi-Entity Trajectories
Zhang Wan ⋅ Yu Li ⋅ Tianze Huang ⋅ Juan Cao ⋅ Sheng Tang
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
Daeun Lee ⋅ Shoubin Yu ⋅ Yue Zhang ⋅ Mohit Bansal
Generalizable Neural Reconstruction of High-Fidelity Surfaces via Sparse Volumetric Representations
Aoxiang Fan ⋅ Corentin Dumery ⋅ Nicolas Talabot ⋅ Ming Xu ⋅ Hieu Le ⋅ Pascal Fua
Context-Aware Joint Alignment for Cross-Scene Hyperspectral Image Classification
Boshan Shi ⋅ JiaXin Chen ⋅ Yanbo Liu ⋅ Youqiang Zhang ⋅ Guo Cao
Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention
Taiye Chen ⋅ Zihan Ding ⋅ Anjian Li ⋅ Christina Zhang ⋅ Zeqi Xiao ⋅ Yisen Wang ⋅ Chi Jin
VIVAS: Vitalizing Visual Perception in VLM Pre-training via Vision-language Unified Autoregressive Supervision
Zhehan Kan ⋅ Yubo Zhu ⋅ Xinghua Jiang ⋅ Zhixiang Wei ⋅ Shifeng Liu ⋅ Wei Tong ⋅ Sheng Zhong ⋅ Qingmin Liao ⋅ Wenming Yang ⋅ Xin Li ⋅ Yinsong Liu ⋅ Deqiang Jiang ⋅ Xing Sun
Direct Preference Optimization for Perceptual Alignment via Vision-Language Consistency
Seungyeon Lee ⋅ Donggyu Lee
LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows
Zhengqin Li ⋅ Cheng Zhang ⋅ Jakob Engel ⋅ Dong Zhao
QST-SAM: Leveraging Cross-modal Instructions for Few-shot Referring Video Object Segmentation
Xin Liu ⋅ Weijia Li ⋅ Tao Chen ⋅ Hongsong Wang ⋅ Guosen Xie ⋅ Caifeng Shan ⋅ Fang Zhao
CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts
Lianyu Hu ⋅ shengqian qin ⋅ Zeqin Liao ⋅ Qing Guo ⋅ Liang Wan ⋅ Wei Feng ⋅ Yang Liu
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
Kaitong Cai ⋅ jusheng zhang ⋅ Sizhuo Ma ⋅ Bingqian Lu ⋅ Jian Wang ⋅ Keze Wang
DASAM3D: A Unified Foundation Model for Enhanced 3D Scene Reconstruction and Segmentation
RONNY XAVIER VELASTEGUI SANDOVAL ⋅ Max Pfingsthorn ⋅ Sezer Karaoglu ⋅ Theo Gevers
EmoteGPT: 3D Human Facial Expression from Natural Language Descriptions
Haoran Wang ⋅ Mohit Mendiratta ⋅ Christian Theobalt ⋅ Adam Kortylewski
MotionChain: Fine-Grained Video Motion Understanding via Structured Decomposition
Hao Yang ⋅ Bo Xu ⋅ Jun Dan ⋅ Sijia Chen ⋅ Baigui Sun ⋅ Yang Liu
MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources
Jiahui Yang ⋅ Donglin Di ⋅ Xuancheng Zhang ⋅ Lei Fan ⋅ Jianxun Cui ⋅ Hao Li ⋅ Baorui Ma
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
Taiting Lu ⋅ Kaiyuan Lin ⋅ Yuxin Tian ⋅ Yubo Wang ⋅ Muchuan Wang ⋅ Sharique Khatri ⋅ Akshit Kartik ⋅ Yixi Wang ⋅ Amey Rane ⋅ Yida Wang ⋅ Yifan Yang ⋅ Yi-Chao Chen ⋅ yincheng jin ⋅ Mahanth Gowda
LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
Xinyu Wang ⋅ Chongbo Zhao ⋅ Fangneng Zhan ⋅ Yue Ma
Hi-DiT: Hybrid Latent-Pixel Diffusion Transformer for Image Generation
Yedong Shen ⋅ Yehao Li ⋅ Yingwei Pan ⋅ Yanyong Zhang ⋅ Ting Yao
ReliefSAM: A Geometry-Augmented Multi-Prior Adapter for Bas-Relief Segmentation
YIHANG CHEN ⋅ Xiang Lyu ⋅ Rui Xu ⋅ Jiao PAN ⋅ Fadjar Thufail ⋅ Brahmantara Brahmantara ⋅ JIAQING LIU ⋅ Satoshi Tanaka ⋅ Liang Li
MotionEditGS: Editing Motion and Appearance of 4D Scenes from Monocular Video via Semantically Anchored Gaussians
Daehyun We ⋅ Youngho Yoon ⋅ Jiyong Boo ⋅ KUK-JIN YOON
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation
Yizhe Xiong ⋅ Zihan Zhou ⋅ Yiwen Liang ⋅ Hui Chen ⋅ Zijia Lin ⋅ Xinhao Xu ⋅ Tianxiang Hao ⋅ Fan Zhang ⋅ Jungong Han ⋅ Guiguang Ding
Reweighting Framewise Attention in Video Transformers for Facial Emotion Recognition
Seongro Yoon ⋅ Donghyeon Cho ⋅ Jinsun Park ⋅ Francois Bremond
WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion
Manuel-Andreas Schneider ⋅ Angela Dai
FairSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation
Tatiana Gaintseva ⋅ Akshit Achara ⋅ Greg Slabaugh ⋅ Jiankang Deng ⋅ Ismail Elezi
Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification
Jiawen Wen ⋅ Penglei SUN ⋅ Wenjie Zhang ⋅ Suixuan QIU ⋅ Weisheng Xu ⋅ Xiaofei Yang ⋅ Xiaowen Chu
SA-V2V: Training-Free Subject-Aware Video-to-Video Personalization
Soobin Park ⋅ Seohyeon Yoo ⋅ Jiwon Kim ⋅ SeonHwa Kim ⋅ Kyong Hwan Jin ⋅ Eunju Cha
GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising
Yi He ⋅ Jiangming Wang ⋅ Xinyu Wang ⋅ Mark Fong ⋅ Songchun Zhang ⋅ Yuxuan Xue ⋅ Hai-Tao Zheng ⋅ Yue Ma
C3ASD: Multi-Level Consistency-Driven Representation Learning for Robust Active Speaker Detection
Jin Hong ⋅ Jisoo Park ⋅ Junseok Kwon
MuSViT: A Foundation Vision Model for Sheet Music Representation
Carlos Penarrubia ⋅ Antonio Rios-Vila ⋅ Eliseo Fuentes-Martinez ⋅ Juan Martinez-Sevilla ⋅ Francisco Castellanos ⋅ María Alfaro-Contreras ⋅ Jorge Calvo-Zaragoza
Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
Shizhan Liu ⋅ Xinran Deng ⋅ Zhuoyi Yang ⋅ Jiayan Teng ⋅ Xiaotao Gu ⋅ Jie Tang
WARP: Wide Attention with Rich Projections for Image Super-Resolution
Jiwon Kim ⋅ Kyoung Mu Lee
SPDA: Efficient Online Test-Time Adaptation for Promptable Medical Segmentation
Huixuan Xu ⋅ Hu Han ⋅ Shiguang Shan ⋅ Xilin CHEN
LEO-Fuse: A Modality- and Task-Agnostic Universal Framework for Multimodal Human Sensing
Emrecan Aslan
Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models
Lexiang Xiong ⋅ QI LI ⋅ Jingwen Ye ⋅ Xinchao Wang
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
Ioannis Maniadis Metaxas ⋅ Adrian Bulat ⋅ Alberto Baldrati ⋅ Anestis Zaganidis ⋅ Yassine Ouali ⋅ Hyeonuk Kim ⋅ Georgios Tzimiropoulos
SAND: Stage-Aware Noise Decomposition for Training-Free Diffusion Guidance
DaeHyun Kim ⋅ Hyo-Jun Lee ⋅ Hanul Kim ⋅ Yeong Jun Koh
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
Chengyao Wang ⋅ Zhisheng Zhong ⋅ Bohao PENG ⋅ Senqiao Yang ⋅ Yuqi Liu ⋅ Haokun GUI ⋅ Bin Xia ⋅ Jingyao Li ⋅ Bei Yu ⋅ Jiaya Jia
LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement
Tongkun Guan ⋅ Haocheng Wang ⋅ Wei Shen ⋅ Xiaokang Yang
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
Jiajun Zhai ⋅ Hao Shi ⋅ Shangwei Guo ⋅ Kailun Yang ⋅ Kaiwei Wang
Jumping the Landing Phase: Noise Variance Matching Enables Accurate Few-Step Inversion
Yang Luo ⋅ Zhineng Chen ⋅ Ya Gao ⋅ Xieping Gao ⋅ Yu-Gang Jiang
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
Bingzhou Li ⋅ Tao Huang
λSplit: Self-Supervised Content-Aware Spectral Unmixing for Fluorescence Microscopy
Federico Carrara ⋅ Mehdi Seifi ⋅ Florian Jug
Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training
Taewon Seo ⋅ Seonae Jeon ⋅ Giwon Lee ⋅ KUK-JIN YOON ⋅ Daehee Park
ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories
Yaokun li ⋅ Shuaixian Wang ⋅ Mantang GUO ⋅ Jiehui Huang ⋅ Taojun Ding ⋅ Mu Hu ⋅ Kaixuan Wang ⋅ Shaojie Shen ⋅ Guang Tan
VoxAnchor: Explicit Voxel-Semantic Grounding for Spatial Understanding in Videos
Xinglin Li ⋅ TingTing Long ⋅ Jingzhi Zhou ⋅ Chuxuan Zeng ⋅ Jiajing Chen ⋅ Jian Yang ⋅ Jin Xie
A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP
Hodaya Krakover ⋅ Meir Levi ⋅ Eyal Gofer ⋅ Guy Gilboa
Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation
Fengnian Zhang ⋅ Tao Huang ⋅ Siyu Xu ⋅ Zhong Jin ⋅ Chang Xu
OCTA-SOT: Online Cross-Modal Trajectory Adjustment for RGBT Anti-UAV Single Object Tracking under Spatio-Temporal Misalignment
Xiaokang Liu ⋅ Qi Jia ⋅ Jinrui Wang ⋅ Chengzhou Li ⋅ Yu Liu ⋅ Weimin Wang
Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities
Jindi Bao ⋅ Jianjun Qian ⋅ Mengkai Yan ⋅ Jian Yang
Event Stream-based Sign Language Translation: A High-Definition Benchmark Dataset and A Novel Baseline
Shiao Wang ⋅ Xiao Wang ⋅ Duoqing Yang ⋅ Yao N/A ⋅ Fuling Wang ⋅ Jianing Li ⋅ Lin Zhu ⋅ Bo Jiang
Stable and Scalable Bundle Adjustment of Holistic 3D Structures
Shaohui Liu ⋅ Rémi Pautrat ⋅ Daniel Barath ⋅ Richard Hartley ⋅ Viktor Larsson ⋅ Marc Pollefeys
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
Angen Ye ⋅ Zeyu Zhang ⋅ Boyuan Wang ⋅ Xiaofeng Wang ⋅ Dapeng Zhang ⋅ Zheng Zhu
Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis
YuanShihao YuanShihao ⋅ Yuanze Li ⋅ Ruyi Zhang ⋅ Ming LIU ⋅ Wangmeng Zuo
DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing
Jinxin Ai ⋅ Matthias Niessner ⋅ Ziya Erkoç
4DGS360: 360° Gaussian Reconstruction of Dynamic Objects from a Single Video
Jae Won Jang ⋅ Yeonjin Chang ⋅ Wonsik Shin ⋅ Juhwan Cho ⋅ Nojun Kwak
AquaStereo: Enabling Underwater Stereo Matching via Depth-Conditioned Diffusion and Geometry Self-Distillation
Qizhe Wei ⋅ Yingping Liang ⋅ Shao You ⋅ Ying Fu
Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior
Jiahui Fu ⋅ Zehao Huang ⋅ Han Li ⋅ Naiyan Wang ⋅ Si Liu
MATCH: Flow Matching for Multi-View Anomaly Detection
Mathis Kruse ⋅ Melissa Schween ⋅ Bodo Rosenhahn
Broadband Wide Field of View Imaging with Computational Mirrors
Vishwanath Saragadam ⋅ Niki Nezakati ⋅ Amit Roy-Chowdhury ⋅ Vivek Boominathan
Evidence Triangulation for Multimodal Fact-Checking in the Wild
Stefanos-Iordanis Papadopoulos ⋅ Zacharias Chrysidis ⋅ Christos Koutlis ⋅ Symeon Papadopoulos ⋅ Panagiotis Petrantonakis
Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting
zhen zou ⋅ Xiaoxiao Ma ⋅ Mingde Yao ⋅ Jie Huang ⋅ Linjiang Huang ⋅ Feng Zhao
DPGS: A Diffusion-Prior Guided Framework for Large-Scale 3D Gaussian Splatting Reconstruction
Shidong Zhang ⋅ shuaixin li ⋅ Juntong Qi ⋅ Haoxin Zhang ⋅ Xiao zhang ⋅ Xiaozhou Zhu ⋅ Wen Yao
FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal
Telang Xu ⋅ Chaoyang Zhang ⋅ Guangtao Zhai ⋅ Xiaohong Liu
MorphJEPA: Morphology-Aware Latent Prediction for Hyperspectral Images
Amartya Ray ⋅ Tanmay Mandaliya ⋅ Muhammad Haris Khan ⋅ Biplab Banerjee
Moving Beyond More Views: Redundancy-Aware Ego–Exo Fusion for Proficiency Estimation
Xu Dong ⋅ Wanqing Li ⋅ Anthony Adeyemi-Ejeye ⋅ Andrew Gilbert
DriftScope: Measuring The Hidden Effects of Diffusion Model Fine-Tuning
Héctor Laria ⋅ Yiping Han ⋅ Julian Santamaria ⋅ Kai WANG ⋅ Bogdan Raducanu ⋅ Joost Van de Weijer ⋅ Alex Gomez-Villa
HVGCD:Rethinking Generalized Category Discovery through Hypothesis–Verification
zhang baoqiang ⋅ Kunze Huang ⋅ Luyao Tang ⋅ Xiaotong Tu
Control-DINO: Feature Space Conditioning for Controllable Video Diffusion
Edoardo Dominici ⋅ Thomas Deixelberger ⋅ Konstantinos Vardis ⋅ Markus Steinberger
FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation
fengchen he ⋅ Hao Xu ⋅ Dayang Zhao ⋅ Tingwei Quan ⋅ Shaoqun zeng
Predicting Consequences and Reinforcing Navigation Policies with Latent World Models
Zengmao Wang ⋅ Wei Gao ⋅ Shuhan Shen
FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution
Minh Hoang ⋅ Dinh Tran ⋅ Quyen Nguyen Duc ⋅ Phuong Dam ⋅ Daeyoung Kim
KineticGS: Momentum-driven Coherent 4D Gaussian Splatting for Monocular Dynamic Scene Reconstruction
Yunqing Wang ⋅ Baoyao Yang ⋅ SI-QI LIU ⋅ CHONG YIN ⋅ Yihua Shao ⋅ Hao Tang
R3RECON: Radiance-Field-Free Active Reconstruction via Renderability
Xiaofeng Jin ⋅ Matteo Frosi ⋅ Yiran Guo ⋅ Matteo Matteucci
Constrained Rotation Optimization: Revisiting Crop-Based Gaze Estimation
Riccardo Santambrogio ⋅ Jiawei Qin ⋅ Matteo Matteucci ⋅ Yusuke Sugano
Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation
Wayner Barrios ⋅ SouYoung Jin
PWM-ArtGen: Part World Model for Articulated Object Generation
Wentao Zheng ⋅ Ancong Wu
Interference-Aware Continual Vision–Language Learning via Instance-Level Expert Routing
Zhang Changyuan ⋅ Tianxiang Xu ⋅ Canran Xiao ⋅ Fei Shen
Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models
yue han ⋅ Chong Li ⋅ Zhening Liu ⋅ Cong Huang ⋅ Fang Deng ⋅ Yong Liu ⋅ Fangyun Wei ⋅ Yan Lu
Pano3D: Unified 3D Reconstruction and Panoptic Segmentation
Victor Barberteguy ⋅ Ahmet Iscen ⋅ Mathilde Caron ⋅ Alireza Fathi ⋅ Gül Varol ⋅ Cordelia Schmid
DualCount: Structurally Consistent Density and Point Modeling for Zero-Shot Object Counting
Xuan Cuong Ngo
SWSL: Semantic-aware Weakly Supervised Learning for 3D Motion Generation using 2D Motion Data
Zhicheng Shi ⋅ Tuo Feng ⋅ Wenguan Wang ⋅ Yi Yang
UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization
inha Lee ⋅ Dongjae Jeong ⋅ Junhee Lee ⋅ Kyungdon Joo
Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold
Yunsung Lee ⋅ Hyeongmin Lee
Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off
Fulvio Sanguigni ⋅ Davide Lobba ⋅ Bin Ren ⋅ Marcella Cornia ⋅ Nicu Sebe ⋅ Rita Cucchiara
AracNet: Revealing Debiasing Signals across Layers with Shallow Monitors
Vito Paolo Pastore ⋅ Massimiliano Ciranni ⋅ Enzo Tartaglione ⋅ Vittorio Murino
Conversational Human Audio-visual Talking Dialogue Generation
Junhao Song ⋅ Lluis Guasch ⋅ Xilin He ⋅ zhongyu yang ⋅ Yingfang Yuan ⋅ Weicheng Xie ⋅ Linlin Shen ⋅ Lin Haijun ⋅ Shizhe Liu ⋅ Wei Pang ⋅ Siyang Song
Two-Way Street: Efficient VSLAM using Collaborative In-Sensor and Off-Sensor processing
Hongyi Zhang ⋅ Laurie Bose ⋅ Piotr Dudek ⋅ Walterio Mayol-Cuevas
Exposing Implicit Vulnerabilities in Text-to-Image Models via Adversarial Agentic Probing
Chang Ma ⋅ Junlin Han ⋅ Shuo Chen ⋅ Runjia Li ⋅ Philip Torr ⋅ Jindong Gu
World Knowledge in the Weights: Reading Concept Circuits of Vision Transformers
Yanlin Chen ⋅ Tang Li ⋅ Xi Peng
TriO: Tri-Modal Unsupervised Occupancy World Model for Anything Perception
Quinlan Sykora ⋅ Sourav Biswas ⋅ Christopher Diehl ⋅ Andrew Cunningham ⋅ Thomas Gilles ⋅ Raquel Urtasun
Proximity-CLIP: Text-Guided Semantic Proximity Learning for Zero-Shot Anomaly Detection
Manwen Yang ⋅ Leqian Ding ⋅ Yu Guo ⋅ Fei Wang
XSurfer: Reconstructing surface meshes of cerebral and cerebellar cortex from diverse MRI data using untrained neural networks
Haoxiang Li ⋅ Mingxuan Liu ⋅ Divya Varadarajan ⋅ Zhangxuan Hu ⋅ Qiyuan Tian ⋅ Jonathan Polimeni
VisCritic: Visual State Comparison as Process Reward for GUI Agents
Jiachen Qian
KISS-GS: 3D Gaussian Splatting Compression Kept Simple
Wieland Morgenstern ⋅ Friedrich Elias Branschke ⋅ Florian Fleischmann ⋅ Adrian Szatmari ⋅ Paul Schlack ⋅ Florian Barthel ⋅ Anna Hilsmann ⋅ Peter Eisert
Uncertainty-Weighted Fusion of Image and Synthetic Event for Video Anomaly Detection
SUNGHEON JEONG ⋅ Jihong Park ⋅ Mohsen Imani
SiPhy: Single-Image Physical Property Reasoning
Hoang Le ⋅ Joonwoo Kwon ⋅ Elkhan Ismayilzada ⋅ Yufei Zhang ⋅ Zijun Cui
Lifting Ego World Models for Planning and Control
Alex Wang ⋅ Trevor Darrell ⋅ Pavel Izmailov ⋅ Yutong Bai ⋅ Amir Bar
SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset
Ariel Gjaci ⋅ Antonio Sgorbissa ⋅ Vittorio Murino
Towards Real-World Wearable Motion Reconstruction
Andrea Boscolo Camiletto ⋅ Rishabh Dabral ⋅ Eduardo Alvarado ⋅ Thabo Beeler ⋅ Marc Habermann ⋅ Christian Theobalt
SAM2Matting: Generalized Image and Video Matting
Ruiqi Shen ⋅ Guangquan Jie ⋅ Chang Liu ⋅ Henghui Ding
Learning Geometry-Aware Embedding Fields for Intrinsic Riemannian Mappings
Bo Pang ⋅ Simone Foti ⋅ Tolga Birdal
Spotlight: Identifying and Localizing Video Generation Errors Using VLMs
Aditya Aravind Chinchure ⋅ Sahithya Ravi ⋅ Pushkar Shukla ⋅ Vered Shwartz ⋅ Leonid Sigal
UniQueR: Unified Query-based Feedforward 3D Reconstruction
Chensheng Peng ⋅ Quentin HERAU ⋅ Jiezhi Yang ⋅ Yichen Xie ⋅ Yihan Hu ⋅ Wenzhao Zheng ⋅ Matthew Strong ⋅ Masayoshi TOMIZUKA ⋅ Wei Zhan
Reflecting Process Expertise in Procedural Material Generation
Kunal Gupta ⋅ Gaurav Joshi ⋅ Yen-Ru Chen ⋅ Seemandhar Jain ⋅ Ishit Mehta ⋅ Manmohan Chandraker
MMDiff: Extending Diffusion Transformers for Multi-Modal Generation
Yagmur Akarken ⋅ Orest Kupyn ⋅ Christian Rupprecht
Continuous Adversarial Flow Models
Shanchuan Lin ⋅ Ceyuan Yang ⋅ Zhijie Lin ⋅ Hao Chen ⋅ Haoqi Fan
VKSR: Scalable Kernel Surface Reconstruction Using Vecchia's Approximation
Maximilian Weiherer ⋅ Chukwudi Williams Umah ⋅ Bernhard Egger
Harnessing SSL for Segmentation in 3D Microscopy with Noisy Labels and Hard Patches
Lingtong Xu ⋅ Ahmadreza Attarpour ⋅ Shruti Patel ⋅ Fengqing Yu ⋅ Matthew Rozak ⋅ Bojana Stefanovic ⋅ Anne Martel ⋅ Maged Goubran
AVQ-Attention: Adaptive Vector-Quantized Attention
Winfried van den Dool ⋅ Patrick Forré ⋅ Amirhossein Habibian ⋅ Yuki Asano ⋅ Max Welling
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-visual Language Models
Ami Baid ⋅ Zihui Xue ⋅ Kristen Grauman
SplatPainter: Interactive Authoring of 3D Gaussians from 2D Edits via Test-Time Training
Yang Zheng ⋅ Hao Tan ⋅ Kai Zhang ⋅ Peng Wang ⋅ Leonidas Guibas ⋅ Gordon Wetzstein ⋅ Wang Yifan
SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation
Yiming Wang ⋅ Ye Chen ⋅ Hanqi Chen ⋅ Bingbing Ni
SIGNET: Motion-Level Knowledge Transfer for Cross-Language Sign Language Translation
Sobhan Asasi ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
Zun Wang ⋅ Han Lin ⋅ Jaehong Yoon ⋅ Jaemin Cho ⋅ Yue Zhang ⋅ Mohit Bansal
Reward Modeling for Computer-Using Agent from Video Execution
Linxin Song ⋅ Jieyu Zhang ⋅ Huanxin Sheng ⋅ Taiwei Shi ⋅ Rahul Gupta ⋅ Yang Liu ⋅ Ranjay Krishna ⋅ Jian Kang ⋅ Jieyu Zhao
PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning
Shaoxuan Li ⋅ Zhixuan Zhao ⋅ Hanze Deng ⋅ Zirun Ma ⋅ Shulin Tian ⋅ ZUYAN LIU ⋅ Yushi Hu ⋅ Haoning Wu ⋅ Yuhao Dong ⋅ Benlin Liu ⋅ Ziwei Liu ⋅ Ranjay Krishna
UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation
Jiahang Tu ⋅ Fengyu Yang ⋅ Chenyang Ma ⋅ Xihang Yu ⋅ Ziyao Zeng ⋅ Shaokai Wu ⋅ Hanbin Zhao ⋅ Zhi Tao ⋅ Chao Zhang ⋅ Hui Qian ⋅ Alex Wong
SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training
Jingxing Li ⋅ Yongjae Lee ⋅ Deliang Fan
Towards Reliable Medical Large Vision-Language Models via Counterfactual Preference Optimization
Xiaoguang Zhu ⋅ NaipengWang NaipengWang ⋅ Kartik Patwari ⋅ Lianlong Sun ⋅ Chen-Nee Chuah ⋅ ChengxinPang ChengxinPang
LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
Zeyu Wang ⋅ Zilong Chen ⋅ Chenhui Gou ⋅ Feng Li ⋅ Chaorui Deng ⋅ Deyao Zhu ⋅ Kunchang Li ⋅ Weihao Yu ⋅ Haoqin Tu ⋅ Haoqi Fan ⋅ Cihang Xie
Predictive Photometric Uncertainty in Gaussian Splatting for Novel View Synthesis
Chamuditha Jayanga Ahangama Galappaththige ⋅ Thomas Gottwald ⋅ Peter Stehr ⋅ Edgar Heinert ⋅ Niko Suenderhauf ⋅ Dimity Miller ⋅ Matthias Rottmann
RoME: Robust Mixture of Low-Rank Experts against Multiple Adversarial Perturbations
Woo Jae Kim ⋅ Kyle Min ⋅ Suhyeon Ha ⋅ Joonsung Jeon ⋅ Sung-eui Yoon
Diffusion to Obfuscation: Time-Adaptive Synthesized Generation Against Gradient Leakage Attacks in Federated Learning
Farchan Raswa ⋅ Chun-Shien Lu ⋅ Jia-Ching Wang
Structure Gaussian Splatting SLAM
Yan Li ⋅ Yingzhao Li ⋅ Gim Hee Lee
DiffVP:Differential Visual Semantic Prompting for LLM-Based CT Report Generation
Yuhe Tian ⋅ Kun Zhang ⋅ Haoran Ma ⋅ Rui Yan ⋅ Yingtai Li ⋅ Rongsheng Wang ⋅ S Kevin Zhou
FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness
Shunsuke Yokokawa ⋅ Hironori Kasahara
ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
Zhiyuan Yao ⋅ Zheren Fu ⋅ Zhixiao Zheng ⋅ Jiajun Li ⋅ Yi Tu ⋅ Zhendong Mao
TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings
Yebo Wu ⋅ Feng Liu ⋅ Ziwei Xie ⋅ Changwang Zhang ⋅ Jun Wang ⋅ Li Li
EatVid-Bench: A Multimodal Fine-Grained Eating Behavior Video Dataset
Xiangpeng Zheng ⋅ Zhenbo Xu ⋅ Gong Huang ⋅ Zhu Li ⋅ Qinghong Yang
RAE-NWM: Navigation World Model in Dense Visual Representation Space
Mingkun Zhang ⋅ wangtian shen ⋅ Fan Zhang ⋅ Haijian Qin ⋅ Zihao Pei ⋅ Ziyang Meng
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
Minghao Fu ⋅ Guo-Hua Wang ⋅ Tianyu Cui ⋅ Qing-Guo Chen ⋅ Zhao Xu ⋅ Weihua Luo ⋅ Kaifu Zhang
UniReflect: Self-Reflection Tuning for Unified Multimodal Understanding and Generation
Cong Wei ⋅ Zepeng Huang ⋅ Haoxian Tan ⋅ liang shuang ⋅ Lishuai Gao ⋅ Pengfei Yan ⋅ Xiaoming Wei
LARY: A Latent Action Representation Yielding Benchmark
Dujun Nie ⋅ Fengjiao Chen ⋅ Jun Kuang ⋅ Qi Lv ⋅ Xiaoyu Li ⋅ Xuezhi Cao
Language-Guided Transformer Tokenizer for Human Motion Generation
Sheng Yan ⋅ yong wang ⋅ Xin Du ⋅ Junsong Yuan ⋅ Mengyuan Liu
PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing
Shengbin Guo ⋅ Shaokang He ⋅ Chaoyue Meng ⋅ Shengpeng Xiao ⋅ Xunzhi Xiang ⋅ Shaofeng Zhang ⋅ Qi Fan
RealDyadic: Synthesizing Realistic Dyadic 3D Dialogue with Neural Appearance Priors
Lei Zhu ⋅ Lijian Lin ⋅ Ye Zhu ⋅ Xuehan Hou ⋅ Jiahao Wu ⋅ Yu Li ⋅ Yunfei Liu ⋅ Jie Chen
MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer
Ziyi Wang ⋅ Siming Zheng ⋅ yang yang ⋅ Shusong Xu ⋅ Hao Zhang ⋅ Bo Li ⋅ Changqing Zou ⋅ Peng-Tao Jiang
Implicit Neural Representation Facilitates Unified Universal Vision Encoding
Matthew Gwilliam ⋅ Xiao Wang ⋅ Xuefeng Hu ⋅ Zhenheng Yang
Taming Dynamic Clutter: Variance-Driven Adaptive Gain Control for Bio-inspired Small Target Detection
Jiaxiang Li ⋅ Shaobing Gao ⋅ Qinbing Fu ⋅ Meiyi Li ⋅ Tiansheng Lu ⋅ Minjie Tan
LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents
Yun He ⋅ Francesco Pittaluga ⋅ Ziyu Jiang ⋅ Matthias Zwicker ⋅ Manmohan Chandraker ⋅ Zaid Tasneem
There and Back Again: A Flexible-Frame Transformer for Multi-Exposure Fusion
Lishen Qu ⋅ Yao Liu ⋅ shihao zhou ⋅ Jie Liang ⋅ Hui Zeng ⋅ Yabin Zhang ⋅ Jufeng Yang
FlatLands: Generative Floormap Completion From a Single Egocentric View
Subhransu S. Bhattacharjee ⋅ Dylan Campbell ⋅ Rahul Shome
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
Qinghong Yin ⋅ Yu Tian ⋅ Heming Yang ⋅ Xiang Chen ⋅ Xianlin Zhang ⋅ Yue Ming ⋅ Xueming Li ⋅ Yue Zhang
PACO: Stabilizing Vision Embeddings along Local Paths for Robust Vision-Language Models
Qihang Tang ⋅ Jiacheng Pi ⋅ Zhiguo Yang ⋅ Xu Liu ⋅ Perley Xu ⋅ Wenjie Ruan
Learning Implicit Constitutive Laws for Dynamic 3D Gaussian Splatting from Monocular Videos
Xiaoyang Liu ⋅ Kai Han
TRiGS: Temporal Rigid-Body Motion for Scalable 4D Gaussian Splatting
Suwoong Yeom ⋅ Joonsik Nam ⋅ Seunggyu Choi ⋅ Lucas Lee ⋅ Sangmin Kim ⋅ Jaesik Park ⋅ Joonsoo Kim ⋅ Kugjin Yun ⋅ Kyeongbo Kong ⋅ Suk-Ju Kang
A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models
Nuo Chen ⋅ Lulin Liu ⋅ Zihao Li ⋅ Ziyao Zeng ⋅ Zihao Zhu ⋅ Wenyan Cong ⋅ Junyuan Hong ⋅ Yunhao Yang ⋅ Zhengzhong Tu ⋅ Yan Wang ⋅ Boris Ivanovic ⋅ Marco Pavone ⋅ Zhangyang Wang ⋅ Yang Zhou ⋅ Zhiwen Fan
Egocentric World Model for Photorealistic Hand Object Interaction Synthesis
Dayou Li ⋅ Lulin Liu ⋅ Bangya Liu ⋅ Shijie Zhou ⋅ Jiu Feng ⋅ Ziqi Lu ⋅ Minghui Zheng ⋅ Chenyu You ⋅ Zhiwen Fan
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
Jiacheng Chen ⋅ Ramin Mehran ⋅ Xuhui Jia ⋅ Saining Xie ⋅ Sanghyun Woo
DIGS: Differentiable, Incremental, Global, Scalable Pruning for Language Models
Bingcong Li ⋅ Junlin Xian ⋅ TAO JIANG ⋅ jwlin jwlin ⋅ Cheng ZOU ⋅ Geng-Li Zhang
Same Pool, Different Answer: Stable Best-of-N Selection for Vision-Language Models
Pengfei Zheng
Background Blurring Matters: Improving Visual Grounding by Merging Text-Irrelevant Tokens
Ruilin Yao ⋅ Shengwu Xiong ⋅ Shanshan Yang ⋅ Tianyu Zou ⋅ Shili Xiong ⋅ Yi Rong
Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Generation
Seong Jong Yoo ⋅ Siyuan Peng ⋅ Felix Gu ⋅ Stratis Aloimonos ⋅ Cornelia Fermuller
GameWorlds: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
Mingyu Ouyang ⋅ Siyuan Hu ⋅ Qinghong Lin ⋅ Hwee Tou Ng ⋅ Mike Zheng Shou
FuDU: A Fuzzy Dual-dimension Uncertainty Framework for Streaming Active Learning in Industrial Defect Detection
Zhaoyang Wang ⋅ Haiyong Chen ⋅ Binyi Su ⋅ Xinwei Lyu
Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models
Junyuan Xiao ⋅ Dingkang Liang ⋅ Xin Zhou ⋅ Yixuan Ye ⋅ Tongtong Su ⋅ Guangmo Yi ⋅ Bin Xia ⋅ Qiang Lyu ⋅ Shurui Shi ⋅ Jun Huang ⋅ Jianlou Si ⋅ Wenming Yang
WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation
Wongyun Yu ⋅ Youngwoon Kim ⋅ Minsu Cho
SAFE-Pruner: Semantic Attention–Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation
Shilin Ma ⋅ Chubin Zhang ⋅ Changyuan Wang ⋅ Yuji Wang ⋅ Yue Wu ⋅ Zixuan Wang ⋅ Jingqi Tian ⋅ Zheng Zhu ⋅ Yansong Tang
Beyond Categorical Matching: Intra-Class Graded Relevance Estimation for Cross-Modal 3D Retrieval
shunning liu ⋅ YingPeng Zhang ⋅ Jianing Lin ⋅ Yifan Wang ⋅ Yang Zhang ⋅ Chun Yuan
SOVTrack: Open-Vocabulary Multi-Object Tracking with Self-Supervised Pseudo Labeling and Feature Distillation
Zekun QIAN ⋅ Ruize Han ⋅ Junhui Hou ⋅ Wei Feng
SARA: Structure-Aware Riemannian-Guided Alignment for Drone Image-Text Retrieval
Keyu Lu ⋅ Qing Ma ⋅ Zhenyu Lu ⋅ Cong Bai
High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control
Junha Kim ⋅ Hyunjoon Park ⋅ Donghyeon Cho
Aggregating Cross-Domain Knowledge via Learnable Tokens for Multi-Teacher Distillation
Wu Ran ⋅ Weijia Zhang ⋅ ShuYang Pang ⋅ JingSheng Liu ⋅ Xiaohui Zhang ⋅ Yichao Yan ⋅ Chao Ma
InstanceControl: Controllable Complex Image Generation without Instance Labeling
XIAOYU LIU ⋅ Huan Wang ⋅ FAN LI ⋅ Zhixing Wang ⋅ Jiaqi Xu ⋅ Ming LIU ⋅ Wangmeng Zuo
Seeing as Humans Do: Learning from Motion to Segment Anything Without Supervision
Weijian Jian ⋅ Xiaoyue Zhang ⋅ Bin Xiao ⋅ Chunyu Xie ⋅ Yixiao He ⋅ Yutao Liu ⋅ Dawei Leng ⋅ Yuhui Yin
SEERBench: A Spatial Ego-Exo Reasoning Benchmark for MLLMs with a Simple Yet Effective Baseline
Fengyuan Lu ⋅ Jiahe Feng ⋅ Zhengyang Zhou ⋅ Shaofeng Zhang ⋅ Wenbin Li ⋅ Qi Fan ⋅ Yang Gao
LivingWorld: Interactive 4D World Generation with Environmental Dynamics
Hyeongju Mun ⋅ In-Hwan Jin ⋅ Sohyeong Kim ⋅ Kyeongbo Kong
ANFI: Rethinking Neighbor Feature Interaction in Person Re-ID
Xulin Li ⋅ Yan Lu ⋅ Bin Liu ⋅ Jiaze Li ⋅ Qinhong Yang ⋅ Tao Gong ⋅ Qi Chu ⋅ Nenghai Yu
The Devil Is in the Dark Pixels: Toward Brightness Bias-Robust Denoising
Sungjun Cho ⋅ Zhuangzhuang Chen ⋅ Xiaomeng Li
On-Policy Diffusion Reinforcement Learning Meets Off-Policy Quality Anchoring
Zunxu Liu ⋅ Zhaofan Qiu ⋅ Yazhen Xie ⋅ Yingwei Pan ⋅ Ting Yao ⋅ Tao Mei
DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars
Xiong Haozhong ⋅ Yao Yu ⋅ Yu Zhou ⋅ Sidan DU
Self-Evolving Just-In-Time Memory for Proactive Embodied Safety
Bingrui Sima ⋅ Lizhong Wang ⋅ Xiaoya Lu ⋅ Kun He ⋅ Xiao Yang
Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving
Guoqing Wang ⋅ Pin Tang ⋅ Xiangxuan Ren ⋅ Liping Hou ⋅ Chao Ma
PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation
Kexu Cheng ⋅ Zicheng Liu ⋅ Mingju Gao ⋅ Chunhe Song ⋅ Hao Tang
Image Warping for Image-to-Image Translation
Shen Zheng ⋅ Anurag Ghosh ⋅ Gaurav Parmar ⋅ Srinivasa G. Narasimhan
StereoEdit: A Diffusion-Based Framework for Stereo-Consistent Image Editing
Baolin Liu ⋅ Zongyuan Yang ⋅ Yingde Song ⋅ yongping xiong
RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction
Zifan Wang ⋅ Ziang Ren ⋅ Pengyang Shi ⋅ Zirui Wang ⋅ Chenghuai Lin ⋅ Tianze Wang ⋅ Zekun Qi ⋅ Liangliang Zhao ⋅ HE WANG ⋅ Li Yi
FindingDory: A Benchmark to Evaluate Memory in Embodied Agents
Karmesh Yadav ⋅ Yusuf Ali ⋅ Gunshi Gupta ⋅ Yarin Gal ⋅ Zsolt Kira
MedRepBench: Benchmarking Structured Understanding of Medical Report Images
Fangxin Shang ⋅ Yuan Xia ⋅ Dalu Yang ⋅ Yahui Wang ⋅ BingLinYang BingLinYang
Online 3D Instance Segmentation at task-oriented granularity with Unposed Monocular Video
Dong Wu ⋅ Baicheng Li ⋅ Yingdian Cao ⋅ Shunkai Zhou ⋅ Yiwen Lu ⋅ Hongbin Zha
TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
KEJIA ZHANG ⋅ Keda TAO ⋅ Zhiming Luo ⋅ Chang Liu ⋅ Jiasheng Tang ⋅ Huan Wang
TimeWalker: Personalized Neural Space for Lifelong Head Avatars
Dongwei Pan ⋅ Yang Li ⋅ Hongsheng LI ⋅ Kwan-Yee Lin
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
Yuchao Gu ⋅ Guian Fang ⋅ Yuxin Jiang ⋅ Weijia Mao ⋅ Song Han ⋅ Han Cai ⋅ Mike Zheng Shou
Sector-Level Cross-View Geo-Localization with Implicit Orientation via Azimuthal Scanning
Yiru Li ⋅ Le Wu ⋅ Yingchen Tan ⋅ Yingying Zhu
ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection
Ningning Han ⋅ Lei Fan ⋅ Jia Guo ⋅ Yunkang Cao ⋅ Xiu Su ⋅ Feng Cao ⋅ Donglin Di ⋅ Tonghua Su
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
Yaofeng Su ⋅ Yuming Li ⋅ Zeyue Xue ⋅ Jie Huang ⋅ Siming Fu ⋅ Haoran Li ⋅ Haoyang Huang ⋅ Nan Duan
CaRe: Critical Parameter Rectification for Efficient Visual Modeling
Mingjia Li ⋅ Hongkun Xiong ⋅ Yuheng Shi ⋅ Hengxing Liu ⋅ Xiaojie Guo
ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement
JINLONG LI ⋅ Jiaming Ding ⋅ Dingfu Lu ⋅ Malcolm Hsiu ⋅ Chuang Ke ⋅ Kangning Yang ⋅ Bochen Guan ⋅ Lan Fu ⋅ Jie Cai ⋅ Huiming Sun ⋅ Zibo Meng
Activation Quantization of Vision Encoders Needs Prefixing Registers
Seunghyeon Kim ⋅ Taesun Yeom ⋅ Jinho Kim ⋅ Wonpyo Park ⋅ Kyuyeun Kim ⋅ Jaeho Lee
VICAL: Vicinal Consistency Alignment for Long-Tailed Visual Recognition
Jianggang Zhu ⋅ Zheng Wang ⋅ Bin Zhu ⋅ Yi-Ping Phoebe Chen ⋅ Jingjing Chen
Mode-Conditioned Residual Calibration for Multi-Object Tracking
Muyu Li ⋅ Henan Hu ⋅ Deepak Jain ⋅ Xudong Zhao
EmbedCopilot: Evaluating Vision-Language Models for Hardware-Aware Embedded System Development
Dongsheng Yuan ⋅ Yimo Deng ⋅ Huangxun Chen
FST-SAM3: Taming SAM~3 with Frequency-Spatio-Temporal Refinement for Video Polyp Segmentation
Guanhao Wu ⋅ Guilian Chen ⋅ Huisi Wu ⋅ Jing Qin
Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization
Yannan Chen ⋅ Wei Wang ⋅ Ruoyu Chen ⋅ Wenqiang Wang ⋅ Jiancheng Wang ⋅ Mingbo Yang ⋅ Yaowei Wang ⋅ Xiaochun Cao
PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding
Haoze Zhang ⋅ Tianyu Huang ⋅ Zichen Wan ⋅ Xiaowei Jin ⋅ Hongzhi Zhang ⋅ Hui Li ⋅ Wangmeng Zuo
Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM
Dayu Li ⋅ shihao zhou ⋅ SHU LEIZHI ⋅ Jin Wu ⋅ Chi Man VONG ⋅ Jufeng Yang
R2M: Real-Aware Residual Model Merging for Robust and Generalizable Deepfake Detection
Jinhee Park ⋅ Guisik Kim ⋅ Choongsang Cho ⋅ Junseok Kwon
GraphVid: Interactive Graph-Controllable Video Generation
Vedant Shah ⋅ Onkar Susladkar ⋅ Tushar Prakash ⋅ Kiet Nguyen ⋅ Tianjiao (Joey) Yu ⋅ Adheesh Juvekar ⋅ Muntasir Wahed ⋅ Ismini Lourentzou
OSVE: One Step Video Editing with One Step Diffusion Models
Habin Lim ⋅ Gyeong-Moon Park
Drive2Danger: Deceive End-to-End Autonomous Driving with Risky Instance Recognition
Shuaikang Shang ⋅ Taiqi Zhang ⋅ Feng Lin ⋅ Hao Yan ⋅ Zhengxiong Li
Beyond Pixel Mimicry: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation
Qian Wang ⋅ Zhenyu Li ⋅ Abdelrahman Eldesokey ⋅ Peter Wonka
D2PO: Optimizing Diffusion Samplers via Dynamic Preference
Jinkyu Kim ⋅ Jinyoung Choi ⋅ Bohyung Han
SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models
Ruoyu Wang ⋅ Jialun Liu ⋅ Huayang Huang ⋅ Haibin Huang ⋅ Jiepeng Wang ⋅ Chi Zhang ⋅ Xuelong Li ⋅ Yu Wu
Video-Oasis: Rethinking Evaluation of Video Understanding
Geuntaek Lim ⋅ Minho Shim ⋅ Sungjune Park ⋅ Jaeyun Lee ⋅ Inwoong Lee ⋅ Taeoh Kim ⋅ Dongyoon Wee ⋅ Yukyung Choi
Personalizing MLLMs via Reinforced Multimodal Reference Game
Deepayan Das ⋅ Davide Talon ⋅ Yiming Wang ⋅ Massimiliano Mancini ⋅ Elisa Ricci
SOMA: From Surface Observations to Muscle Anatomy
Eduardo Alvarado ⋅ Emily Kim ⋅ Friedemann Runte ⋅ Gerrit Nolte ⋅ Mario Botsch ⋅ Marc Habermann ⋅ Christian Theobalt
ActiveStructure: Plane Scene Graph-Guided Active 3D Gaussian Splatting
Yingzhao Li ⋅ Yan Li ⋅ Yanjie Liu ⋅ Hanyu Zhou ⋅ lijun zhao ⋅ Gim Hee Lee
Benchmarking MLLMs on Mistake Recognition and Explanation in Single-Step Components of Cooking
Shun Takashige ⋅ Atsushi Hashimoto ⋅ Shin’ichi Satoh
HLRAD: High-dimensional Latent Representation for Unified Anomaly Detection
Tianrui Zhang ⋅ Ziheng Zang ⋅ Ningmu Zou
Unleashing the Power of Large-Scale ViT in Zero-Shot SBIR: A Strong Baseline with Multi-Layer Feature Aggregation
Yang Liu ⋅ Yongjing Guo ⋅ Suisui Jia ⋅ Huaizhou Qi ⋅ Xun Du ⋅ Haonan Chen
InSeg: Interactive Refinement via Intent Propagation for Point Cloud Semantic Segmentation
Yudong Liu ⋅ Yunfei Li ⋅ Ge Gao ⋅ Han Huang ⋅ Ming Gu
Mimicking Radiologists: A Coarse-to-Fine Framework with Structural Sparse Tokens for Dual-LLM Computed Tomography Report Generation
Hong Liu ⋅ Dong Wei ⋅ Yefeng Zheng ⋅ Xian Wu ⋅ Liansheng Wang
Beyond Script Family Boundaries: Towards Unified Open-Set Scene Text Recognition
Chang Liu ⋅ Elisa Smith
Revisiting Deepfake Detection: BCNet for Robust Generalization Beyond Semantic Dependence
Jian Yang ⋅ Shibo Yao ⋅ Renshuai Tao ⋅ Chuangchuang Tan ⋅ Yao Zhao
Geometry Grounding: Elevating Blind Distortion Correction with 3D Structural Priors
Xiang Li ⋅ Weimin Shi ⋅ Qichuan Geng ⋅ Zhong Zhou
UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models
Lei Tan ⋅ Shuwei Li ⋅ Mohan Kankanhalli ⋅ Robby T. Tan
REAL-OW: Rehearsal-free Open World Object Detection with Low-Rank Adaptation and Dual-Stage Objectness Modeling
Huazhong Zhang ⋅ Xiaowen Fu ⋅ Yang Zhang ⋅ Linlin Shen ⋅ Jinbao Wang
The Sterkfontein Caves Dataset: A Novel View Rendering Challenge from the Cradle of Humankind
Ireton Liu ⋅ Brian Xu ⋅ Dominic Stratford ⋅ Steven James ⋅ Richard Klein ⋅ James Tompkin
Virtual Category-Guided Continual Generalized Category Discovery
Jiahui Xiong ⋅ Qiuxia Lai ⋅ Hongsong Wang
Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning
MINSEOK KANG ⋅ Minhyeok Lee ⋅ Minjung Kim ⋅ Jungho Lee ⋅ Donghyeong Kim ⋅ Sungmin Woo ⋅ Inseok Jeon ⋅ Sangyoun Lee
Progressive and Localized Super-Resolution of 3D Objects via Localized Latent Voxel Diffusion
Yuxin Liu ⋅ Minshan Xie ⋅ Jiawen Liang ⋅ Runsong Zhu ⋅ Chi-Wing Fu ⋅ Tien-Tsin Wong
Label-Free Text Prototype Adaptation for Open Vocabulary Segmentation
Keli Wang ⋅ Meixuan Li ⋅ Tianyu Li ⋅ Guoqing Wang
TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis
Chaeyeon Lee ⋅ Khang Quoc ⋅ Jinsol Song ⋅ Yosep Chong ⋅ Kwangil Yim ⋅ JIN TAE KWAK
Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch
Gabriele Mario Caddeo ⋅ Pasquale Marra ⋅ Lorenzo Natale
Learning Semantic-Robust Change Detection via Semantic-Invariant Self-Distillation
Jiuhe Qu ⋅ Yingping Liang ⋅ Ying Fu
H2SVC: Head-aware Heterogeneous Streaming Video Cache for Online Video Understanding
han li ⋅ Xinyi Zhang ⋅ Wenrui Dai ⋅ Yaoming Wang ⋅ Xinyu Peng ⋅ Fan He ⋅ Hang Xu ⋅ Ziyang Zheng ⋅ Chenglin Li ⋅ Junni Zou ⋅ Hongkai Xiong
Category-Level Articulated Object Pose Estimation via Pose–Shape Hypothesis Generation and Verification
Kaifeng Tang ⋅ Chi Xu ⋅ Xin Ao ⋅ Yuting Ge ⋅ Tingrui Guo ⋅ Jun Zhou
Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification
Nicolas Sournac ⋅ Ahmed Jmaa ⋅ Bertrand Braeckeveldt
SPICE: Simple Polysemantic feature Interpretation via Clustering-based Explanations
Sehyun Lee ⋅ Dahee Kwon ⋅ Damin Lee ⋅ Jaesik Choi
Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration
Ninghao Zhang ⋅ Bin Zhu ⋅ Shijie Zhou ⋅ Jingjing Chen
A Dual-Transformer Architecture with Cross-Attention for Multi-Camera View Recommendation
Josep Cabacas Maso ⋅ Carles Ventura ⋅ Ismael Benito-Altamirano
Where to Look Matters: Learning Influential Views for VLM-based 3D Visual Grounding
Tsung-Chih Chiang ⋅ Hsuan-Kung Yang ⋅ Jou-Min Liu ⋅ Ting-Ru Liu ⋅ Chun-Wei Huang ⋅ Quan Kong ⋅ Chun-Yi Lee
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
Mohammad Mahdi ⋅ Nedko Savov ⋅ Danda Paudel ⋅ Luc Van Gool
InstaEdit: Instant Image Editing via Optimized Noise Prediction
Ning Ma ⋅ Yangrui Shao
SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation
Yun He ⋅ Kelin Yu ⋅ Matthias Zwicker
A Scalable Vector Graphics Latent Space
Leonardo Zini ⋅ Elia Frigieri ⋅ Lorenzo Baraldi
Explainability-aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors
Chengzeng You ⋅ Binbin Xu ⋅ Soteris Demetriou
Differentiable Polarized Path Tracing
Pramod Rao ⋅ Jérémy Riviere ⋅ xilong zhou ⋅ Abhijeet Ghosh ⋅ Abhimitra Meka ⋅ Thabo Beeler ⋅ Marc Habermann ⋅ Christian Theobalt ⋅ Delio Vicini
PhysConvex: Physics-Informed Dynamic Convex Fields for Reconstruction and Simulation
Dan Wang ⋅ Xinrui Cui ⋅ Serge Belongie ⋅ Ravi Ramamoorthi
EgoCogNav: Cognition-aware Human Egocentric Navigation
Zhiwen Qiu ⋅ Ziang Liu ⋅ Wenqian Niu ⋅ Tapomayukh Bhattacharjee ⋅ Saleh Kalantari
TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers
Binglei Li ⋅ Mengping Yang ⋅ Zhiyu Tan ⋅ Junping Zhang ⋅ Hao Li
Toward Robust In-Context Segmentation via Concept Guidance
Zhigang Chen ⋅ Xiawu Zheng ⋅ Rongrong Ji
From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs
Arjun Majumdar ⋅ Raphael Braun ⋅ Andreas Engelhardt ⋅ Hendrik Lensch
GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens
Roni Itkin ⋅ Noam Issachar ⋅ Yehonatan Keypur ⋅ Xingyu Chen ⋅ Anpei Chen ⋅ Sagie Benaim
ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
Xumin Yu ⋅ ZUYAN LIU ⋅ Zhenyu Yang ⋅ Yuhao Dong ⋅ Shengsheng Qian ⋅ Jiwen Lu ⋅ Han Hu ⋅ Yongming Rao
SiGMA: Sign-Guided Merging and Adaptation framework for Multimodal Continual Instruction Tuning
Keonhee Park ⋅ Gunhee Kim
ICLAgent: Integrated Circuit Footprint Geometry Labeling via LMM-empowered Multi-Agent Framework
Yida Wang ⋅ Yixin Liu ⋅ Taiting Lu ⋅ Lanqing Yang ⋅ Dian Ding ⋅ Juntao Zhou ⋅ Yifan Yang ⋅ Yi-Chao Chen ⋅ Mahanth Gowda
DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent
Jia-Wei Liao ⋅ Li-Xuan Peng ⋅ Mei-Heng Yueh ⋅ Min Sun ⋅ Cheng-Fu Chou ⋅ Jun-Cheng Chen
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
Zhilin Liu ⋅ Ye Huang ⋅ TingXie TingXie ⋅ Ruizhi Zhang ⋅ Wen Li ⋅ Lixin Duan
CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion
Moritz Böhle ⋅ Amelie Royer ⋅ Juliette Marrie ⋅ Edouard Grave ⋅ Patrick Perez
EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
Sanghyun Jo ⋅ DONGHWAN LEE ⋅ Eunji Jung ⋅ Seong Oh ⋅ Kyungsu Kim
SHReg: Strictly Rotation-Equivariant Point Cloud Registration via Spherical Harmonics
Chongjian Wang ⋅ Junjie Gao
SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts
Haida Feng ⋅ Hao Wei ⋅ Haolin Wang ⋅ Shiwei Li ⋅ Chade Li ⋅ Yihong Wu
PhysEdit: Physically Consistent Image Editing via Causal Enforcement
Siqi Wan ⋅ Jingwen Chen ⋅ Yehao Li ⋅ Yingwei Pan ⋅ Ting Yao ⋅ Tao Mei
Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment
Shuyao Li ⋅ Chuanxing Geng ⋅ heyang sun ⋅ Qiang Zhou ⋅ Jingjing Gu
Overlap-Consistent View Decomposition for Adapting Vision--Language Models to 360° Panoramas
Seungwoo Woo ⋅ Daewon Jung ⋅ Sekyoung Youm
Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction
Efstathios Karypidis ⋅ Spyros Gidaris ⋅ Nikos Komodakis
MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
Gal Fiebelman ⋅ Hadar Averbuch-Elor ⋅ Sagie Benaim
Spectral-Aware Analytic Class-Incremental Learning for Long-Tailed Distributions
Quyen Tran ⋅ Ngoc-Hai Nguyen ⋅ Minh Quan Dao ⋅ Zhuowei Li ⋅ Nam Hai ⋅ Trung Le ⋅ Dimitris N. Metaxas
WAPR: A Foundation Model for Wide-Angle Refinement in Unseen Object Pose Estimation
Yulin Wang ⋅ Jianghao Zhou ⋅ Hongli Li ⋅ MENGTING HU ⋅ Chen LUO
Aligning Anything: Hierarchical Motion Estimation for Video Frame Interpolation
Mengshun Hu ⋅ Zhihang Zhong ⋅ Yansheng Qiu ⋅ Zheng Wang ⋅ Xiao Sun
HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding
Wenhui Liao ⋅ Hongliang Li ⋅ Pengyu Xie ⋅ Xinyu Cai ⋅ Yufan Shen ⋅ Yi Xin ⋅ Qi Qin ⋅ Shenglong Ye ⋅ Tianbin Li ⋅ Ming Hu ⋅ Junjun He ⋅ Yihao Liu ⋅ Wenhai Wang ⋅ Min Dou ⋅ Bin Fu ⋅ Botian Shi ⋅ Yu Qiao ⋅ Lianwen Jin
MVI2V: Human Centric Image to Video Generation with Multiview Consistent Appearance
Pengfei Liu ⋅ Mingyi Xu ⋅ Wentao Jiang ⋅ Tiezheng Ge ⋅ Ming Zeng
Ego-Human Motion Prediction with 3D-Aware LLM
Yujin Bae ⋅ Jaewoo Jeong ⋅ HYEONSEONG KIM ⋅ KUK-JIN YOON
PhenoLeaf-TS: A Time-Series Benchmark for Leaf Instance Segmentation, Tracking, and Growth Stage Classification
Rijad Saric ⋅ Basim Azam ⋅ Sarmad Khan ⋅ Edhem Custovic
SyntheticDoc: A Large Synthetic Dataset for Document Unwarping and Illumination Correction
Daniel Woortmann ⋅ Tanguy Magne ⋅ Olga Sorkine-hornung
Map2World: Segment Map Conditioned Text to 3D World Generation
Jaeyoung Chung ⋅ Suyoung Lee ⋅ Jianfeng Xiang ⋅ Jiaolong Yang ⋅ Kyoung Mu Lee
GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors
Jiazheng Liu ⋅ Hang Li ⋅ jiawei zhang ⋅ Jiahe Li ⋅ Xiaohan Yu ⋅ Shengyin Fan ⋅ Jin Zheng ⋅ Xiao Bai
CURE: Cumulative Knowledge Reuse for Efficient Device-Server Hybrid Inference in Vision-Language Models
Youngjun Lee ⋅ Doyoung Kim ⋅ Junhyeok Kang ⋅ Hwanjun Song ⋅ Jae-Gil Lee
Controllable Generative Reference for Stereo Image Compression via Reliability-Aware Gating
Zhineng Zhao ⋅ Mingyao Hong ⋅ Fengfan Shi ⋅ Zhihai He
WilLaGS: Latent-Conditional 3D Appearance Fields for Robust Gaussian Splatting In-the-Wild
yuhao Bai ⋅ Qianqiu Tan ⋅ Lilong Chen ⋅ Huanhuan Lv ⋅ Lijun Chen
ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking
Kanglong Fan ⋅ Tianhe Wu ⋅ Wen Wen ⋅ Jianzhao Liu ⋅ le yang ⋅ Yabin ZHANG ⋅ Yiting Liao ⋅ Junlin Li ⋅ Li Zhang
TriFlow: Generating Artist-Like 3D Mesh Topology via Nearest-Vertex Vector Fields
Haoxuan Li ⋅ Ziya Erkoç ⋅ Daniele Sirigatti ⋅ Vladislav Rosov ⋅ Lei Li ⋅ Angela Dai ⋅ Matthias Niessner
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
JUNFU PU ⋅ Yuxin Chen ⋅ Teng Wang ⋅ Ying Shan
SARIF: Segment Anything for Robust Image Forensics
Dong-Hyun Moon ⋅ Ju-Hyeon Nam ⋅ Sang-Chul Lee
BitRIC: Efficient Neural Compression of LiDAR Range Images via Hierarchical Bitplanes
Kang You ⋅ Tong Chen ⋅ Dandan Ding ⋅ M. Salman Asif ⋅ Zhan Ma
Predictive Structure Improves Video Diffusion Dynamics
Mi Luo ⋅ Yujia Chen ⋅ Alex Dimakis ⋅ Kristen Grauman ⋅ Wen-Sheng Chu ⋅ Du Tran
SynFlow: Scaling Up LiDAR Scene Flow Estimation with Synthetic Data
Qingwen Zhang ⋅ Xiaomeng Zhu ⋅ ChenHan Jiang ⋅ Patric Jensfelt
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
Xiangyue Liu ⋅ Zijian Zhang ⋅ Miles Yang ⋅ Zhao Zhong ⋅ Liefeng Bo ⋅ Ping Tan
Layer-Aware Video Composition via Split-then-Merge
Ozgur Kara ⋅ Yujia Chen ⋅ Ming-Hsuan Yang ⋅ James Rehg ⋅ Wen-Sheng Chu ⋅ Du Tran
Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection
Xinhao Zhong ⋅ Shuoyang Sun ⋅ Zhaoyang Xu ⋅ Xulin Gu ⋅ Bin Chen ⋅ Min Zhang ⋅ Yaowei Wang
HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments
Ruijie Tang ⋅ Chenye Zou ⋅ Guoquan Wu ⋅ Jun Wei ⋅ Wei Chen ⋅ Jiaxin Zhu
Cross-Resolution Distribution Matching for Diffusion Distillation
Chen Feiyang ⋅ Hongpeng Pan ⋅ Haonan Xu ⋅ Xinyu Duan ⋅ Zhefeng Wang ⋅ Yang Yang
Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading
Hong Li ⋅ Minqi Meng ⋅ Yanjun Liang ⋅ Chongjie Ye ⋅ Houyuan Chen ⋅ Weiqing Xiao ⋅ Xianda Guo ⋅ Guojun Lei ⋅ Xuhui Liu ⋅ Chaojie Yang ⋅ Yanlun Peng ⋅ HAO ZHAO ⋅ Baochang Zhang
RhymeFlow: Training Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling
Chensheng Dai ⋅ Shengjun Zhang ⋅ Yifan Li ⋅ Zhang Zhang ⋅ Zheng Zhu ⋅ Yueqi Duan
LUNA: Learning Universal 3D Human Animation Beyond Skinning
Peng Li ⋅ Rawal Khirodkar ⋅ Junxuan Li ⋅ Yuan Dong ⋅ Chen Cao ⋅ Yuan Liu ⋅ Wenhan Luo ⋅ Yike Guo ⋅ Shunsuke Saito
Uncertainty-Driven Gaussian Sphere Propagation for 3D Semantic Segmentation
Zhicheng Yan ⋅ Qingyong Li ⋅ Yixiao Song ⋅ Wen Wang
CMDR: Contextual Multimodal Document Retrieval
Ryota Tanaka ⋅ Taku Hasegawa ⋅ Kyosuke Nishida
DiffuPrompt: Adapting Video Foundation Models to 3D Medical Volumes via Latent Trajectory Priors
Guowei Dai ⋅ Duwei Dai ⋅ yulong ji ⋅ Chen Hu ⋅ Yi Zhang
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
Walid Bousselham ⋅ Angie Boggust ⋅ Hendrik Strobelt ⋅ Hilde Kuehne
Why Do Vision Language Models Struggle To Recognize Human Emotions?
Madhav Agarwal ⋅ Sotirios Tsaftaris ⋅ Laura Sevilla ⋅ Steven McDonagh
Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow
Shenhan Qian ⋅ Ganlin Zhang ⋅ Elliott (Shangzhe) Wu ⋅ Daniel Cremers
Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency
Zihan Su ⋅ Teng Hu ⋅ Jiangning Zhang ⋅ Ruiyan Wang ⋅ Ran Yi ⋅ Lizhuang Ma ⋅ Dacheng Tao
AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images
Meng Yang ⋅ Zizhuo Li ⋅ Linfeng Tang ⋅ Fan Fan ⋅ Jiayi Ma
The Path to Reconciling Quality and Safety Alignment in Text-to-Image Generation
Shouwei Ruan ⋅ Zhenyu Wu ⋅ Yao Huang ⋅ Ruochen Zhang ⋅ Yitong Sun ⋅ Caixin Kang ⋅ Shiji Zhao ⋅ Weijun Qin ⋅ Jingzhi Li ⋅ Xingxing Wei
AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
Trung Kien Pham ⋅ I Chen ⋅ Qifeng Chen ⋅ Long Chen
Proposal Score Realignment Guided by Semantic Completeness for Weakly Supervised Temporal Action Localization
Maodong Li ⋅ Zhihao Wang ⋅ Jingxiong Wang ⋅ Jian Wang ⋅ Bing Li
When 3D Gaussian Splatting Recovers Real Surfaces
Songhe Wang ⋅ David Miller
UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
Yongkun Du ⋅ Zhineng Chen ⋅ Yazhen Xie ⋅ Weikang Bai ⋅ Hao Feng ⋅ Wei Shi ⋅ Yuchen Su ⋅ Can Huang ⋅ Yu-Gang Jiang
RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild
Cheng Cui ⋅ Tingquan Gao ⋅ Xueqing Wang ⋅ Changda Zhou ⋅ Hongen Liu ⋅ Ting Sun ⋅ Yubo Zhang ⋅ Zelun Zhang ⋅ Jiaxuan Liu ⋅ Manhui Lin ⋅ Yue Zhang ⋅ Suyin Liang ⋅ Yiqing Xiang ⋅ Yi Liu
Mapping the Concept Landscape: Structural Perception of Global Distributions for Transparent Data Pruning
Dongyue Wu ⋅ Tao Ma
Pseudo-Stereo Inputs: A Solution to the Occlusion Challenge in Self-Supervised Stereo Matching
Ruizhi Yang ⋅ Xingqiang Li ⋅ Jiajun Bai ⋅ Jinsong Du
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
Yuyao Ge ⋅ Shenghua Liu ⋅ Yiwei Wang ⋅ Lingrui Mei ⋅ Baolong Bi ⋅ Xuanshan Zhou ⋅ Jiayu Yao ⋅ Jiafeng Guo ⋅ Xueqi Cheng
SVI360: Spherical Video Interpolation
Le Kim NGUYEN ⋅ Renato Martins ⋅ Pascal Vasseur ⋅ Cedric Demonceaux
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
Yuanhao Cai ⋅ Kunpeng Li ⋅ Menglin Jia ⋅ Jialiang Wang ⋅ Junzhe Sun ⋅ Feng Liang ⋅ Weifeng Chen ⋅ Felix Juefei-Xu ⋅ Chu Wang ⋅ Ali Thabet ⋅ Xiaoliang Dai ⋅ Xuan JU ⋅ Alan Yuille ⋅ Ji Hou
Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning
Lei Zhang ⋅ Junjiao Tian ⋅ Zhipeng Fan ⋅ Kunpeng Li ⋅ Jialiang Wang ⋅ Weifeng Chen ⋅ Markos Georgopoulos ⋅ Felix Juefei-Xu ⋅ Julian McAuley ⋅ Manling Li ⋅ Zecheng He
BeTTER: Diagnose the Illusion of Embodied Reasoning in Vision-Language-Action Models
Haiweng Xu ⋅ Sipeng Zheng ⋅ Hao Luo ⋅ Wanpeng Zhang ⋅ Zongqing Lu
FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring
Geunhyuk Youk ⋅ Jihyong Oh ⋅ Munchurl Kim
RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models
Xun Liang ⋅ Honghui Yang ⋅ Weihang Pan ⋅ Boyuan Pan ⋅ Yao Hu ⋅ Binbin Lin ⋅ Deng Cai ⋅ Ruisi Zhao ⋅ Wenxiao Wang
AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution
Geunhyuk Youk ⋅ Jeonghyeok Do ⋅ Dayeon Kim ⋅ Jihyong Oh ⋅ Munchurl Kim
Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration
Jaewon Lee ⋅ Mangyu Kong ⋅ Euntai Kim
RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking
Yanqiu Yu ⋅ Zhifan Jin ⋅ Sijia Chen ⋅ Tongfei Chu ⋅ En Yu ⋅ Liman Liu ⋅ Wenbing Tao
FUSE: Filter-Free Unified Spatiotemporal Estimation of SpO2 via Wave-Transport Modeling
Shahzad Ahmad ⋅ NUVVURU REDDY ⋅ Ram Padhy ⋅ Sukalpa Chanda ⋅ Umapada Pal
On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models
Jelena Bratulić ⋅ Sudhanshu Mittal ⋅ Thomas Brox ⋅ Christian Rupprecht
ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection
Camile Lendering ⋅ Erkut Akdag ⋅ Joaquin Figueira Chacon ⋅ Egor Bondarev
UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables
Yibing Zhang ⋅ Xunpeng Yi ⋅ Qinglong Yan ⋅ Yeda Wang ⋅ Han Xu ⋅ Jiayi Ma
Going Deep: Deep Visual Prompting with LoTeP
Zijie Zhao ⋅ Yanru Wu ⋅ Yuji Wang ⋅ Haohua Wang ⋅ Enming Zhang ⋅ Wai Kin Chan ⋅ Yang Li
Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose
Mohammadreza Jamalifard ⋅ Yaxiong Lei ⋅ Parastoo Azizinezhad ⋅ Javier Andreu-Perez
Mapping Dark-Matter Clusters via Physics-Guided Diffusion Models
Diego Royo ⋅ Brandon Zhao ⋅ Adolfo Muñoz ⋅ Diego Gutierrez ⋅ Katherine Bouman
3D-LENS: A 3D Lifting-based Elevated Novel-view Synthesis method for Single-View Aerial-Ground Re-Identification
William Grolleau ⋅ Astrid Sabourin ⋅ Guillaume Lapouge ⋅ Catherine Achard
OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal
Qinming Zhou ⋅ Chenxi Sun ⋅ Deyang Kong ⋅ Junhao He ⋅ Xiangheng Tang ⋅ Peike Yu ⋅ Haotian Wu ⋅ Leilei Cao ⋅ Linfeng Zhang
DETR is Secretly a Multispectral Detector: Zero-Parameter Adaptation via Semantic Alignment
Xiangyang Li ⋅ Zhiwei Jiang ⋅ Wushuai Jin ⋅ Pengyang Niu ⋅ Chunna Tian ⋅ Lingqiao Liu
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
Changwoo Baek ⋅ Kyeongbo Kong
Deformable and Multi-view Gradient-Aligned Physical Adversarial Camouflage
Jiawei Liang ⋅ Puning Zhao ⋅ tianrui lou ⋅ Haoqing Zhang ⋅ Xianghao Jiao ⋅ Bozheng Lin ⋅ Ming Zhang ⋅ Xiaochun Cao
Through Van Gogh’s Eyes: Global Style Transfer with Diffusion Model
Jeongha Lee ⋅ Yujin Kim ⋅ Ghazanfar Ali ⋅ Suhyun Kim ⋅ Jae-In Hwang
LooseControlVideo: Directorial Video Control using Spatial Blocking
Shariq Farooq Bhat ⋅ Kalyan Sunkavalli ⋅ Niloy Mitra
HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models
Shizhuo Mao ⋅ Hongtao Zou ⋅ Qihu Xie ⋅ Song Chen ⋅ Yi Kang
PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation
Yi Yang ⋅ Myrna Castillo Silva ⋅ Bodo Rosenhahn ⋅ Michael Yang
LEGO: Leveled Language Gaussian Splatting
Yuning Peng ⋅ Haiping Wang ⋅ Yuan Liu ⋅ Yipeng Lu ⋅ Zhen Dong ⋅ Bisheng Yang
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
Tanmay Gupta ⋅ Piper Wolters ⋅ Zixian Ma ⋅ Peter Sushko ⋅ Rock Yuren Pang ⋅ Yue Yang ⋅ Jason Ren ⋅ Harsh Trivedi ⋅ Taira Anderson ⋅ Winson Han ⋅ Ranjay Krishna
MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment
Peiyuan Zhu ⋅ Shaoan Xie ⋅ Zijian Li ⋅ Yifan Shen ⋅ Namrata Deka ⋅ Harsh Shrivastava ⋅ Guangyi Chen ⋅ Kun Zhang
HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding
Yinsheng Yao ⋅ Yan Liu ⋅ Chen Ye
NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation
shuheng zhang ⋅ Feng Wu
WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation
Wei Dong ⋅ Tianyu Fu ⋅ Zhe Yu ⋅ Hanning Wang ⋅ Anyang Su ⋅ Zhizhou Fang ⋅ Yuyang Chen ⋅ Shuo Wang ⋅ Minghui Wu ⋅ Ping Jiang ⋅ Zhen Lei ⋅ Chenxu Zhao
Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners
Yunhan Wang ⋅ Eshika Khandelwal ⋅ Edson Araujo ⋅ Walid Bousselham ⋅ Nina Shvetsova ⋅ Hilde Kuehne
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
Hengye Lyu ⋅ Zisu Li ⋅ Yue Hong ⋅ Yueting Weng ⋅ Jiaxin Shi ⋅ Hanwang Zhang ⋅ Chen Liang
Show Me Examples: Inferring Visual Concepts from Image Sets
Nick Stracke ⋅ Kolja Bauer ⋅ Stefan Andreas Baumann ⋅ Miguel Angel Bautista ⋅ Joshua Susskind ⋅ Bjorn Ommer
Large-Scale Light Field Synthesis from Videos Enables Geometrically Consistent Bokeh Editing
Haoming Cai ⋅ Zhoutong Zhang ⋅ Christopher Metzler ⋅ Shumian Xin
Geometry-Aware Visual Representation for Remaining Useful Life Prediction
Hieu Vu ⋅ Thanh Nguyen ⋅ Eyad Elyan
PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation
Cao Duy ⋅ Phong Nguyen
Dense Video Understanding with Inter-tokenization Acceleration
Haichao Zhang ⋅ Wenhao Chai ⋅ Shwai He ⋅ Ang Li ⋅ Yun Fu
Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models
Yiyang Huang ⋅ Zhaowen Wang ⋅ Simon Jenni ⋅ Jing Shi ⋅ Yitian Zhang ⋅ Yizhou Wang ⋅ Yun Fu
AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision
Xiaoya Cheng ⋅ Rouwan Wu ⋅ Xinyi Liu ⋅ Zeyu Cui ⋅ Yan Liu ⋅ Na Zhao ⋅ Yu Liu ⋅ Maojun Zhang ⋅ Shen Yan
Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching
Arushi Rai ⋅ Adriana Kovashka
PARL-VLA: Pruning-Aware On-Policy Reinforcement Learning for Vision-Language-Action Model
ruiyan xu ⋅ Jiashu Lv ⋅ Sixu Lin ⋅ Ruixing Jin ⋅ Shuliang He ⋅ Guiliang Liu
Long-term Traffic Simulation via Structured Autoregressive Modeling
Lingyu Xiao ⋅ Zexin Feng ⋅ Xintao Yan
From Illusion to Intention: Visual Rationale Learning for Reliable Evidence Acquisition
Changpeng Wang ⋅ Liu Junhan ⋅ Xi Chen ⋅ Haozhe Wang ⋅ Donglian Qi ⋅ Yunfeng Yan
CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition
Muhammad Osama Zeeshan ⋅ Masoumeh Sharafi ⋅ Benoît Savary ⋅ Alessandro Lameiras Koerich ⋅ Marco Pedersoli ⋅ Eric Granger
Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data
Hyunwoo Park ⋅ Sanghyun Lee
NoPA: Non-Parametric Online 3D Scene Graph Generation
Qi Xun Yeo ⋅ Seungjun Lee ⋅ Yan Li ⋅ Gim Hee Lee
Semantic Line Diffusion: Character-Consistent Line Art from text-annotated Storyboards
Seo-Yeon Choi ⋅ Kyungsu Lee
Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels
Venkanna Babu Guthula ⋅ Oswin Krause ⋅ Dimitri Gominski ⋅ Hui Zhang ⋅ Johan Mottelson ⋅ Ankit Kariryaa ⋅ Nico Lang ⋅ Christian Igel
Puppet-CNN: Continuous Parameter Dynamics for Input-Adaptive Convolutional Networks
Yucheng Xing ⋅ Xin Wang
Reference-Free Quality Assessment for Virtual Try-On via Human Feedback
Yuki Hirakawa ⋅ Takashi Wada ⋅ Ryotaro Shimizu ⋅ Takuya Furusawa ⋅ Yuki Saito ⋅ Ryosuke Araki ⋅ Tianwei Chen ⋅ Fan Mo ⋅ Yoshimitsu Aoki
From Reconstruction to Decision: A Post-Encoder Plug-in Adapter for Curvilinear Segmentation
Qin Lei ⋅ Jiang Zhong ⋅ Xin Xiao ⋅ ymyang ymyang ⋅ Hao Wu
VNC: A Scale-Space Foundation for Learnable 3D Surface Evolution
Baoxing Li ⋅ Yong Deng ⋅ Xu Zhao
EoS-FM: Can an Ensemble of Specialist Models act as a Generalist Feature Extractor?
Pierre Adorni ⋅ Minh-Tan Pham ⋅ Stephane May ⋅ Sébastien Lefèvre
Triangle Splatting SLAM
Nicholas Fry ⋅ Eric Dexheimer ⋅ Kirill Mazur ⋅ Paul Kelly ⋅ Andrew Davison
GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine
Yanan Wang ⋅ Wen li ⋅ Yibin Ying ⋅ Zhenghao Fei
Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models
Massimiliano Pappa ⋅ Luca Romani ⋅ Valentino Sacco ⋅ Alessio Palma ⋅ Stéphane Lathuilière ⋅ Fabio Galasso ⋅ Xavier Alameda-Pineda ⋅ Indro Spinelli
Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs
Efthymios Tsaprazlis ⋅ Tiantian Feng ⋅ Anil Ramakrishna ⋅ Sai Karimireddy ⋅ Rahul Gupta ⋅ Shrikanth Narayanan
SAGE: A Synchronized Action and Gaze Estimation Framework for Comprehensive Human Behavior Analysis
Chenyi Kuang ⋅ Nakul Agarwal
COLA: Continual Orthogonal Low-Rank Adaptation for Class-Incremental Learning
Monu Nagar ⋅ Debasis Das
Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding
Yeeun Choi ⋅ Youngbeom Yoo ⋅ Joon-Young Lee ⋅ Hyolim Kang ⋅ Seon Joo Kim
CLIMP: Contrastive Language-Image Mamba Pretraining
Nimrod Shabtay ⋅ Itamar Zimerman ⋅ Eli Schwartz ⋅ RAJA GIRYES
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
Mingi Kwon ⋅ Joonghyuk Shin ⋅ Jaeseok Jeong ⋅ Jaesik Park ⋅ Youngjung Uh
Novel View Synthesis as Video Completion
Qi Wu ⋅ Khiem Vuong ⋅ Minsik Jeon ⋅ Srinivasa G. Narasimhan ⋅ Deva Ramanan
Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning
Dongki Jung ⋅ Jaehoon Choi ⋅ Adil Qureshi ⋅ Somi Jeong ⋅ Dinesh Manocha ⋅ Suyong Yeon
BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models
Aryan Pandit
CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning
Dongxia Wu ⋅ Shiye Su ⋅ Yuhui Zhang ⋅ Elaine Sui ⋅ Emma Lundberg ⋅ Emily Fox ⋅ Serena Yeung-Levy
MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models
Alejandro Lozano ⋅ Ryan D'Cunha ⋅ Daniel Jarquin ⋅ Min Sun ⋅ Josiah Aklilu ⋅ James Burgess ⋅ Yuhui Zhang ⋅ Paola Robayo ⋅ Jin Ye ⋅ Ming Hu ⋅ Zhongying Deng ⋅ Junjun He ⋅ Xin Chen ⋅ Yue Yao ⋅ Robert Tibshirani ⋅ Jeffrey Nirschl ⋅ Xiaoxiao Sun ⋅ Serena Yeung-Levy
Sparsity-Inducing Divergence Losses for Biometric Verification
Dimitrios Koutsianos ⋅ Ladislav Mosner ⋅ Yannis Panagakis ⋅ Themos Stafylakis
Leaving the City: A Large-Scale Aerial Dataset for Cross-Season Localization in Unstructured Environments
Michael Schleiss ⋅ Henry Hölzemann ⋅ Fahmi Rouatbi ⋅ Torsten Fiolka ⋅ Thomas Pany ⋅ Roger Förstner ⋅ Daniel Cremers
FMS2: Unified Flow Matching for Segmentation and Synthesis of Thin Structures
Babak Asadi ⋅ Peiyang Wu ⋅ Mani Golparvar-Fard ⋅ Viraj Jayminkumar Shah ⋅ Ramez Hajj
VERITAS: A Multi-agent Co-scientist for Verifiable Image-Derived Hypothesis Testing
Lucas Stoffl ⋅ Benedikt Wiestler ⋅ Johannes Paetzold
Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings
Theodor Westny ⋅ David Axelsson ⋅ Björn Olofsson ⋅ Erik Frisk
RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement
Jiyao Wang ⋅ Qingyong Hu ⋅ Duoxun Tang ⋅ Xiao Yang ⋅ Kaishun Wu ⋅ Jiangbo Yu
EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow
Dogyun Park ⋅ Yanyu Li ⋅ Sergey Tulyakov ⋅ Anil Kag
BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection
Declan McIntosh ⋅ Alexandra Branzan Albu
Co-evolving Representations in Joint Image-Feature Diffusion
Theodoros Kouzelis ⋅ Spyros Gidaris ⋅ Nikos Komodakis
Zero-Shot Novel Depth Synthesis Using Foundation Models Scene Representations
Denis Akola ⋅ David Fouhey
NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding
Hyeonjeong Ha ⋅ Jinjin Ge ⋅ Bo Feng ⋅ Kaixin Ma ⋅ Gargi Chakraborty
MLP Splatting: Object-Centric Neural Fields
Shinjeong Kim ⋅ Yuzhou Cheng ⋅ Xin Kong ⋅ Paul Kelly ⋅ Andrew Davison
Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation
Weihao Yan ⋅ Yeqiang Qian ⋅ Yi Dong ⋅ Ming Yang
Fourier Splatting: Generalized Fourier encoded primitives for scalable radiance fields
Mihnea Jurca ⋅ Bert hauwermeiren ⋅ Adrian Munteanu
Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
Atin Pothiraj ⋅ Jaemin Cho ⋅ Yue Zhang ⋅ Elias Stengel-Eskin ⋅ Mohit Bansal
SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos
Björn Braun ⋅ Christian Holz
StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
Yuan Qing ⋅ Chengzhi Mao ⋅ Boqing Gong
Versatile Editing of Video Content, Actions, and Dynamics without Training
Vladimir Kulikov ⋅ Roni Paiss ⋅ Andrey Voynov ⋅ Inbar Mosseri ⋅ Tali Dekel ⋅ Tomer Michaeli
Human-like Object Grouping in Self-supervised Vision Transformers
Hossein Adeli ⋅ Seoyoung Ahn ⋅ Andrew Luo ⋅ Mengmi Zhang ⋅ Nikolaus Kriegeskorte ⋅ Gregory Zelinsky
Training-free Discriminative Patch Mining for Robust Few-Shot Recognition with CLIP
Zhenzhang Ye ⋅ Duolikun Danier ⋅ Bo Zhao ⋅ Hakan Bilen
SyncFix: Multi-View Consistent Diffusion Refinement of 3D Reconstructions
Deming Li ⋅ Cheng Peng ⋅ Abhay Kumar Yadav ⋅ Rama Chellappa ⋅ Anand Bhattad
SurvMILKD: A Weakly Supervised Survival Analysis Framework for Multi-Teacher Knowledge Distillation using Pathology Foundation Models
Mayur Mallya ⋅ Ali Khajegili Mirabadi ⋅ Hossein Farahani ⋅ Ali Bashashati
CAM3R: Camera-Agnostic Model for 3D Reconstruction
Namitha Guruprasad ⋅ Abhay Kumar Yadav ⋅ Cheng Peng ⋅ Rama Chellappa
3D-ReGen: A Unified 3D Geometry Regeneration Framework
Geon Yeong Park ⋅ Roman Shapovalov ⋅ Rakesh Ranjan ⋅ Jong Chul Ye ⋅ Andrea Vedaldi ⋅ Thu Nguyen-Phuoc
Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition
Raza Yunus ⋅ Benjamin Ummenhofer ⋅ Jan Eric Lenssen ⋅ Eddy Ilg
Reinforcing Vision-Language Models for Image Quality Assessment with Grounding Process Rewards
Jingwei Liu ⋅ Hongyan Li ⋅ Bo Liu ⋅ Tianlin Zhang ⋅ Yifei Qian ⋅ Congyang Zhao ⋅ Junhong Liu ⋅ Yang Cai ⋅ Ling Yang
Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers
Nina Żukowska ⋅ Wolfgang Stammer ⋅ Bernt Schiele ⋅ Jonas Fischer
From Gaze to Meaning: An AI Agent for Unified Zero-Shot Grounding and Explanation
Shayan Nasiriboukani ⋅ Sara Atito ⋅ Mohammad Nezamipour ⋅ Muhammad Awais
Vector Scaffolding: Inter-Scale Orchestration for Differentiable Image Vectorization
Jaerin Lee ⋅ KANGGEON LEE ⋅ Kyoung Mu Lee
Generalization and Memorization in Rectified Flow
Mingxing Rao ⋅ Daniel Moyer
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
Vishal Narnaware ⋅ Animesh Gupta ⋅ Kevin Zhai ⋅ Zhenyi Wang ⋅ Shah Mubarak
Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting
Qian Ma ⋅ S M Rayeed ⋅ Qiong Wu ⋅ Charles Stewart ⋅ Yao Ma
Momentum Guidance: Plug-and-Play Guidance for Flow Models
Runlong Liao ⋅ Jian Yu ⋅ Baiyu Su ⋅ Chi Zhang ⋅ Lizhang Chen ⋅ Qiang Liu
Natural Image Pretraining Improves Abstract Reasoning
Xiaoman Ding ⋅ Keya Hu ⋅ Katelyn Gan ⋅ Victor Yin ⋅ Kaiming He
ModTrack: Sensor-Agnostic Multi-View Tracking via Identity-Informed PHD Filtering with Covariance Propagation
Aditya Iyer ⋅ Jack Roberts ⋅ Nora Ayanian
Information-Regularized Attention for Visual-Centric Reasoning
Guohao Sun ⋅ Xiaofang Wang ⋅ Yash Patel ⋅ Mengchen Liu ⋅ Zhiqiang Tao ⋅ Praveen Krishnan
FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors
Khiem Vuong ⋅ Deva Ramanan ⋅ Srinivasa G. Narasimhan
Poppy: Polarization-Based Plug-and-Play Guidance for Enhancing Surface Normal Estimation
Irene Kim ⋅ Sai Tanmay Reddy Chakkera ⋅ Alexandros Graikos ⋅ Dimitris Samaras ⋅ Akshat Dave
Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration
Mohammadjavad Matinkia ⋅ Nilanjan Ray
Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning
Vishwas Sathish ⋅ Viresh Ranjan ⋅ Xinliang Zhu ⋅ Arnab Dhua ⋅ Douglas Gray
SAMPLe: A Sharpness Aware Minimization based Optimizer for Prompt Learning in Vision-Language Models
Hossein Rajoli nowdeh ⋅ Fatemeh Lotfi ⋅ Niloufar Alipour Talemi ⋅ Hossein Kashiani ⋅ Xiaolong Ma ⋅ Fatemeh Afghah
Keep Your Friends Close, and the Right Neighbours Closer: Disaster-Conditioned Kernel-Regularized Graph Attention for Building Damage Classification
Fuad Hasan ⋅ Chul Min Yeum
DIVER: Disentangling Camera–Object and Active–Passive Motion for Video Generation
Shaowei Liu ⋅ Xuanchi Ren ⋅ Tianchang Shen ⋅ Huan Ling ⋅ Saurabh Gupta ⋅ Shenlong Wang ⋅ Sanja Fidler ⋅ Jun Gao
Provable and Robust Wavefront Sensing via Self-Reference Interferometry
Nebiyou Yismaw ⋅ Vishwanath Saragadam ⋅ Aswin C. Sankaranarayanan ⋅ M. Salman Asif
MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving
Nan Yang ⋅ Zhanwen Liu ⋅ Linfeng Zhang ⋅ Shangyu Xie ⋅ Yang Wang ⋅ Wenzhuo Zhou ⋅ Xiangmo Zhao
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
Jiwan Kim ⋅ Kibum Kim ⋅ Wonjoong Kim ⋅ Byung-Kwan Lee ⋅ Chanyoung Park
Trajectory-aware Cross-view Geo-Localization with Sequential Observations
Tianyi Gao ⋅ Jiayu Lin ⋅ Danielle Beaulieu ⋅ Nathan Jacobs
OmniPoint: Universal Monocular Metric Pointcloud from Any Camera
Botao Ye ⋅ Marc Pollefeys ⋅ Ming-Hsuan Yang ⋅ Abhijit Kundu
Gender Bias in Vision-Language In-Context Learning
Tong Xiang ⋅ Yuta Nakashima ⋅ Noa Garcia
SMP-UWGS: Coupled Physics-Geometry Optimization for Scalable Multi-Partition Underwater 3D Reconstruction
宇轩 刘 ⋅ Jinhui Zhang
P-CORE: Self-Supervised Surface Consistency for Point-Based Neural Editing
Yanshu Zhang ⋅ Shichong Peng ⋅ Mehran Aghabozorgi ⋅ Alireza Moazeni ⋅ Ke Li
Causal Yet Future-Aware: Dual-Path Temporal Modeling for Online Action Segmentation
Zhichao Zheng ⋅ Peirong Ma ⋅ Ying Zhou ⋅ Li Kong ⋅ Junsheng Zhou
GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models
Chaoxiang Cai ⋅ Minghe Weng ⋅ Jie Li ⋅ Yibo Jiang ⋅ Longrong Yang ⋅ Zequn Qin ⋅ Xi Li
Diversity-Aware View Partitioning for Scalable VGGT
Jinsoo Park ⋅ Donggyu Choi ⋅ Ahyun Seo ⋅ Minsu Cho ⋅ Jeany Son
HERO: Heterogeneous Evidential Robust Object-Level Collaborative Perception
Hao SI ⋅ Ehsan Javanmardi ⋅ Hanlin Wu ⋅ Manabu Tsukada
MotionSplicer: Part-Based Motion Editing for 4D Volumetric Videos
Chaerin Min ⋅ Praccho Muna-McQuay ⋅ Tao Lu ⋅ James Tompkin ⋅ Srinath Sridhar
URoPE: Universal Relative Position Embedding across Geometric Spaces
Yichen Xie ⋅ Depu Meng ⋅ Yihan Hu ⋅ Chensheng Peng ⋅ Quentin HERAU ⋅ Masayoshi TOMIZUKA ⋅ Wei Zhan
Less is More: A Simple yet Effective Object-Centric Prompting Strategy for Vision-Language Reasoning in Autonomous Driving
Saiqian Peng ⋅ Duanfeng Chu ⋅ Liping Lu ⋅ Bing Shi
Parallax Portrait Matting
Xin Cai ⋅ Jiawen Chen ⋅ Lars Jebe ⋅ Tianfan Xue ⋅ Zhoutong Zhang
Towards Effective Long Video Understanding: Dynamic MAS Construction via Meta-Agent
Jing Huang ⋅ Lidong Zhang ⋅ Yadong Li ⋅ Xingzhong Xu ⋅ Siye Chen ⋅ Jie Liu ⋅ Ming Kong ⋅ Qiang Zhu
Mitigating Sycophancy in Multimodal Chart Understanding via Vision-Grounded Verification
Xiaolong Wang ⋅ Zhiwei Lin ⋅ Tai Liu ⋅ Qiang Li ⋅ Jian Sun
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
Arjun Somayazulu ⋅ Kristen Grauman
Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
Ting Lei ⋅ Jialin Liu ⋅ Zhu Xu ⋅ Yuxin Peng ⋅ Yang Liu
Mitigating Pose–Scale Discrepancy Bias and Reforming Multi-Support Reasoning for Few-Shot Semantic Segmentation
Shreya Biswas ⋅ Zhaozheng Yin
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
Siwei Wen ⋅ Zhangcheng Wang ⋅ Xingjian Zhang ⋅ Lei Huang ⋅ wenjun wu
BLOB-Q: Boosting Low Bit ViT Quantization via Global Optimization on Model Distortion
Wang Mark ⋅ Kaixin Xu ⋅ Xue Geng ⋅ Fen Fang ⋅ Mohamed Aly ⋅ Xulei Yang ⋅ Min Wu ⋅ Weisi Lin
Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models
Stanislav Panev ⋅ Minhyek Jeon ⋅ Vaishnavi Khindkar ⋅ Ahish Deshpande ⋅ Celso de Melo ⋅ Shuowen Hu ⋅ Shayok Chakraborty ⋅ Fernando de la Torre
ARGENT: Adaptive Hierarchical Image-Text Representations
Chuong Huynh ⋅ Hossein Souri ⋅ Abhinav Kumar ⋅ Vitali Petsiuk ⋅ Deen Dayal Mohan ⋅ Suren Kumar
Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR
Jinda Lu ⋅ Junkang Wu ⋅ Jinghan Li ⋅ Kexin Huang ⋅ Shuo Yang ⋅ Mingzhu Chen ⋅ Jiancan Wu ⋅ Kuien Liu ⋅ Xiang Wang
Low-Level Dataset Distillation for Medical Image Enhancement
Fengzhi Xu ⋅ Ziyuan Yang ⋅ Mengyu Sun ⋅ Joey Tianyi Zhou ⋅ Yi Zhang
FeVOS: Foresight Expression Video Object Segmentation
Kehan Lan ⋅ Kaining Ying ⋅ Henghui Ding
SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
Jiongze Yu ⋅ Xiangbo Gao ⋅ Pooja Verlani ⋅ Akshay Gadde ⋅ Yilin Wang ⋅ Balu Adsumilli ⋅ Zhengzhong Tu
Off the Planckian Locus: Using 2D Chromaticity to Improve In-Camera Color
SaiKiran Tedla ⋅ Joshua Little ⋅ Hakki Karaimer ⋅ Michael S Brown
EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning
Chengjun Yu ⋅ Xuhan Zhu ⋅ Chaoqun Du ⋅ Pengfei Yu ⋅ Wei Zhai ⋅ Yang Cao ⋅ Zheng-Jun Zha
Short-to-Long Functional Connectivity Transfer via Structure-Aware Latent Diffusion
Ishmael Benjamin Torres Aguilar ⋅ Yufeng Liu ⋅ Zhengwu Zhang
Training-free Cross-domain Few-shot Segmentation via Robust Semantic Representation and Matching
Sujun Sun ⋅ Mingwu Ren ⋅ Haofeng Zhang
TurboMPLE: Joint Infrared Turbulence Mitigation and Physical Fields Estimation via Mutual Progressive Layered Extraction
Yitong An ⋅ Yubo Jiang ⋅ Xiangzhi Bai
Hierarchical Spatial and Channel Aggregation for Cross-domain Few-shot Segmentation
Sujun Sun ⋅ Mingwu Ren ⋅ Haofeng Zhang
DICE: Disentangled Instance-Class knowlEdge prompt tuning via SAE for Vision-Language Models
Daeun Lee ⋅ Seungwoo Jang ⋅ Kwangsu Kim
MoBa-GS: Learning a Spatially-Varying Motion Basis over a Dynamic Canonical Space for 4D Reconstruction
Guan Yuan Tan ⋅ Arghya Pal ⋅ Sailaja Rajanala ⋅ Raphaël Phan ⋅ Chee-Ming Ting
Weather-Conditioned Depth Anything
Zhaoming Xu ⋅ Chan-Wei Hu ⋅ Kuan-Ru Huang ⋅ Zihao Zhu ⋅ Renjie Li ⋅ Yang Zhou ⋅ Zhengzhong Tu
HVA-Fusion:Hierarchical Velocity-Aware 4D Radar-LiDAR Fusion for Robust 3D Object Detection
Jingxian Wu ⋅ Lu Wang ⋅ Lisheng Xu ⋅ Jun Cheng
Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models
Wanpeng Zhang ⋅ Ye Wang ⋅ Hao Luo ⋅ Haoqi Yuan ⋅ Yicheng Feng ⋅ Chaoyi Xu ⋅ Sipeng Zheng ⋅ Qin Jin ⋅ Zongqing Lu
CRISP: Calibration-Aware Visual State Space Duality for Remote Sensing Image Segmentation
kangning wang ⋅ Haopeng Zhang ⋅ Zhiguo Jiang
World Models for Learning Dexterous Hand-Object Interactions from Human Videos
Raktim Goswami ⋅ Amir Bar ⋅ David Fan ⋅ Tsung-Yen Yang ⋅ Gaoyue Zhou ⋅ Prashanth Krishnamurthy ⋅ Michael Rabbat ⋅ Farshad Khorrami ⋅ Yann LeCun
RefDiT: Local Attribute Guidance in Reference-Based Image Generation
Rameshwar Mishra ⋅ Srikrishna Karanam ⋅ Subramanyam Venkata
Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation
Kwonyoung Ryu ⋅ In-Jae Lee ⋅ Jonghyun Jin ⋅ Hyunjee Lee ⋅ Jongmin Lee ⋅ Jaesik Park
Beyond Isolated Scans: Cross-Phase Alignment of Structure and Topology for 3D Medical Pretraining
Wenzhuo xu ⋅ YANJIE ZHOU ⋅ Yujian Hu ⋅ Hongkun Zhang ⋅ Minfeng Xu
When Higher Order Hurts: Pre-Asymptotic Order Collapse in Generative ODE Sampling — A Theory of Discretization–Learning Interaction
Farzad Salajegheh ⋅ Sudhir Mudur
Don’t Mask Out the Background! Natural-Light Photometric Stereo via Illumination Reconstruction
Taiga Hashida ⋅ Hiroaki Santo ⋅ Fumio Okura
Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation
zhaowen zhu ⋅ Li Zhang ⋅ Chen Yujie ⋅ Zhang Tian ⋅ Yingjie Wang ⋅ Mingxia Zhan
mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis
Adnan Armouti ⋅ Yixuan Gao ⋅ Rajalakshmi Nandakumar
CrossView: Can Vision-Language Models Reason Across Cameras?
Sahil Shah ⋅ S P Sharan ⋅ Harsh Goel ⋅ Manvik Pasula ⋅ Adithya Hebbalae ⋅ Minkyu Choi ⋅ Sandeep Chinchali
StratoSplat: Taming Layered Regularities for Sparse Aerial 3D Gaussian Splatting
Zihan Gao ⋅ Lingling Li ⋅ Licheng Jiao ⋅ Fang Liu ⋅ Wenping Ma ⋅ Yuwei Guo ⋅ Shuyuan Yang
Reinforcement Learning for Multimodal Diffusion Language Models via Bidimensional Trajectory and Thought Optimization
Bowen Li ⋅ Yinjie Wang ⋅ Yunzhi Zhang ⋅ Junhong Liu ⋅ Yingqing Guo ⋅ Jiajun Wu ⋅ Mengdi Wang ⋅ Ling Yang
Unified Video Dense Prediction from Disjoint Data
Yihong Sun ⋅ Seoung Wug Oh ⋅ Jiahui Huang ⋅ Bharath Hariharan ⋅ Joon-Young Lee
UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception
Qin Guo ⋅ Hao Luo ⋅ Dongxu Yue ⋅ Weixuan Jin ⋅ Xiao Fu ⋅ Fan Wang ⋅ Dan Xu
Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs
Kibum Kim ⋅ Jiwan Kim ⋅ Kyle Min ⋅ Yueqi Wang ⋅ Jinyoung Moon ⋅ Julian McAuley ⋅ Chanyoung Park
Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution
Soyeon Kim ⋅ Kyowoon Lee ⋅ Jaesik Choi
Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation
Bing Wu ⋅ Zuyao Chen ⋅ Chang Wen Chen
Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation
Shihao Zhang ⋅ Yunzhi Li ⋅ Yuguang Yan ⋅ Junzhe Zhang ⋅ WEI ZHAO ⋅ Bohan Wang ⋅ Hanwang Zhang
ReInGS: Re-Initializing 3D Gaussians against Sparsity Discrepancy in Few-Shot Novel View Synthesis
Junao Shen ⋅ Tian Feng ⋅ Haojie Dong ⋅ Jinkang Ji ⋅ Tianjia Shao
Improving Image-to-Image Translation via a Rectified Flow Reformulation
Satoshi Iizuka ⋅ Shun Okamoto ⋅ Kazuhiro Fukui
ESNE: Efficient Surface Normal Estimation for LiDAR Point Clouds with Sequential Modeling and Variability Guidance
Kohei Matsuzaki ⋅ Keisuke Nonaka
SFD-Net: Sharp Feature Detection Network Based on Local Geometric Features
Inyoung Oh ⋅ Kwanghee Ko
LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching
Yiran Wang ⋅ Oliver Turner ⋅ Viorela Ila
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
Xuan Dong ⋅ Huanyang Zheng ⋅ Tianhao Niu ⋅ Zhe Han ⋅ Pengzhan Li ⋅ Bofei Liu ⋅ Zhengyang Liu ⋅ Guancheng Li ⋅ Qingfu Zhu ⋅ Wanxiang Che
Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models
Amira Guesmi ⋅ Muhammad Shafique
Twin-DAgger: Synergizing Digital Twins and Human Corrections for Efficient Robot Manipulation
Jiahang Li ⋅ Zhirui Zhang ⋅ Kairan Ding ⋅ Fan Fei ⋅ Yunkai Tang ⋅ Jiaming Liu ⋅ Xiao He ⋅ Ziyu Chen ⋅ Gaohao Zhou ⋅ Jieji Ren ⋅ Yandong Guo ⋅ Shanghang Zhang ⋅ Boxin Shi
DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution
Yingwei TANG ⋅ Chen Yan ⋅ Wendi Liu ⋅ Qiang Hu ⋅ Xiaoyun Zhang
Rdm: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation
Linqian Fan ⋅ Peiqin Sun ⋅ Tiancheng Wen ⋅ Shun Lu ⋅ Chengru Song
Multi-History-Step SDE Inversion for Image Editing with Superior Regional Awareness
Haiyan Wei ⋅ Yunlong Wang ⋅ Huaibo Huang ⋅ Zhenan Sun ⋅ Kunbo Zhang
Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
Yoonhyung Park ⋅ Minji Kim ⋅ Sungwon Moon ⋅ Jiyoung Lee
Steering 3D Generations: Preference Alignment via Direct Reward and Preference Optimization
Yuanhang Wang ⋅ Lizhe Qi ⋅ Wenqiang Zhang
ELT: Elastic Looped Transformers for Visual Generation
Sahil Goyal ⋅ Swayam Agrawal ⋅ Gautham Anil ⋅ Sujoy Paul ⋅ Aditya Kusupati ⋅ Prateek Jain
LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving
Pei Liu ⋅ Songtao Wang ⋅ Lang Zhang ⋅ Xinyue Peng ⋅ Yuandong Lyu ⋅ Jiaxin Deng ⋅ Songxin lu ⋅ Weiliang Ma ⋅ Xueyang Zhang ⋅ Yifei Zhan ⋅ Kun Zhan ⋅ Jun Ma
SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch‑Level Incoherence and Temporal Roughness
Jongyeop Hyun ⋅ Hyounghun Kim
DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation
Eungjune Shim ⋅ Hansol Lee ⋅ Eunjung Ju
ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering
Weikai Lin ⋅ Haoxiang Li ⋅ Yuhao Zhu
FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis
Sungwoong Yune ⋅ Suheon Jeong ⋅ Joo-Young Kim
PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection
SeokYeong Lee ⋅ Sithu Aung ⋅ JunYong Choi ⋅ Seungryong Kim ⋅ Ig-Jae Kim ⋅ Junghyun Cho
Edit3r: Instant 3D Scene Editing from Sparse Unposed Images
Jiageng Liu ⋅ Weijie Lyu ⋅ Xueting Li ⋅ Yejie Guo ⋅ Ming-Hsuan Yang
CRD-Net: Frequency-Adaptive Feature Injection and Change Decoupling for Building Damage Assessment
Yao Zheng ⋅ Yuanxin Ye ⋅ Tan Shu ⋅ Liwei Cai
Seeing Isn't Orienting: A Cognitively Grounded Hierarchical Benchmark for Object Orientation in MLLMs
Nazia Tasnim ⋅ Keanu Nichols ⋅ Yuting Yan ⋅ Nicholas Ikechukwu ⋅ Elva Zou ⋅ Deepti Ghadiyaram ⋅ Bryan Plummer
Don’t Starve the Boundaries: Boundary-Constrained Label Propagation for Weakly Supervised 3D Segmentation
Shuwei Wu ⋅ shuo jin ⋅ Zhijin He ⋅ Siyue Yu ⋅ ENG LIM ⋅ Qiufeng Wang ⋅ Jimin Xiao
MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins
WenBo Xu ⋅ Liu Liu ⋅ li zhang ⋅ Dan Guo ⋅ Ruonan Liu
The Telephone Game: Evaluating Semantic Drift in Unified Models
Sabbir Mollah ⋅ Rohit Gupta ⋅ Swetha Sirnam ⋅ Qingyang Liu ⋅ Ahnaf Munir ⋅ Shah Mubarak
MessyKitchens: Contact-rich object-level 3D scene reconstruction
Junaid Ahmed Ansari ⋅ Ran Ding ⋅ Fabio Pizzati ⋅ Ivan Laptev
Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection
Peisheng Qian ⋅ Jie Xu ⋅ Xulei Yang ⋅ Na Zhao
MirrorPPR: Exemplar-Based Portrait Photo Retouching
Zhihong Liu ⋅ Zheng Li ⋅ Jiachun Jin ⋅ Siqi Kou ⋅ Yitao Jian ⋅ Fengpei Yu ⋅ Zhijie Deng
Wavelet-based Intra-video Counterfactual Reasoning for Video Question Grounding
Jiasheng Yuan ⋅ Wei Wei
Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness
Hangyeol Lee ⋅ Hyojeong Lee ⋅ Joo-Young Kim
SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation
Shenbo Xie ⋅ Mingrui Cai ⋅ Xu Yang ⋅ Yifei Liu ⋅ Changxing Ding
Calibrate Before Adapt: Training-Free Pseudo-Label Calibration for Semi-Supervised Cross-Domain Few-Shot Detection
Xin Yang ⋅ Fei Zhou ⋅ Wei Wei ⋅ Lei Zhang
SE-DETR: Explicit Semantic Exploration for Generalizability and Distinguishability in Video Temporal Grounding
Chengyang Hu ⋅ Guanshuo Wang ⋅ Fufu Yu ⋅ Qiong Jia ⋅ Shouhong Ding ⋅ Lizhuang Ma
CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics
Ziyi Ding ⋅ xianxin lai ⋅ Weiyu Chen ⋅ Xiao-Ping Zhang ⋅ Jiayu Chen
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
Qihan Huang ⋅ Haofei Zhang ⋅ Rong Wei ⋅ Yi Wang ⋅ Rui Tang ⋅ Mingli Song ⋅ Jie Song
AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware
David Smerkous ⋅ Zian Wang ⋅ Behzad Najafian
What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
Chen-yi Lu ⋅ Yueh-Shao Chen ⋅ Somali Chaterji
EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders
Xinghao Wang ⋅ Dong Li ⋅ Wei Yu ⋅ Yingwei Pan ⋅ Tao Gong ⋅ Qi Chu ⋅ Nenghai Yu ⋅ Ting Yao
HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations
Yaqiao Dai ⋅ Renjiao Yi ⋅ Zhirui Gao ⋅ Wei Chen ⋅ Kai Xu ⋅ Chenyang Zhu
PrintAnything: Learning Geometric Plan Map for 3D Printing G-code Generation from Unoriented Point Clouds
Sangmin Hong ⋅ Daniel Sungho Jung ⋅ Heewon Kim ⋅ Kyoung Mu Lee
From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation
Haowen Gu ⋅ Gensheng Pei ⋅ Junzhu Mao ⋅ Qiong Wang ⋅ Mingwu Ren ⋅ Yazhou Yao
CGCC: Towards Generalizable Clothes-Changing Person Re-Identification
Yizhi Wu ⋅ Fangyi Liu ⋅ wei yu ⋅ Mang Ye
Learning to Mask: Cross-Modal Noise Modulation for Hallucination Mitigation in Multi-modal Large Language Models
Zijian Song ⋅ Chunlei Wang ⋅ Kun He
Attention-Logit Steering to Compositional Generalization for Continual VQA
Suyoung Yang
Tempo-SAM3D: Monocular Video to 4D via Temporal Memory-Guided Generation
Baicheng Li ⋅ Dong Wu ⋅ Yingdian Cao ⋅ Haoxiang Yang ⋅ Yiwen Lu ⋅ Zike Yan ⋅ Hongbin Zha
Abstract the Layout, Focus the Detail: A Dual-Granularity Representation Framework for Zero-Shot 3D Visual Grounding
Zeyuan Lin ⋅ Hanxuan Li ⋅ Chen He ⋅ Ruiping Wang ⋅ Zhaoxiang Liu ⋅ Xilin CHEN
SafeSAE-VLA: Interpreting OpenVLA Progress Dynamics with Sparse Feature Analysis
Socrates Osorio ⋅ Joy Yang
Closing the Capacity–Convergence Gap: Globally Optimal Configuration of Implicit Neural Representations
Sipeng Chen ⋅ Yan Zhang ⋅ Shibo Li
UF0-6D: Unified Flow-based Zero-Shot 6D Object Pose Estimation without Refinement
Yingnan Guo ⋅ Chun Lim ⋅ Yu Feng ⋅ Yu Zhang
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
Junru Song ⋅ Yimeng Hu ⋅ Yijing Chen ⋅ Huining Li ⋅ Qian Li ⋅ Lizhen Cui ⋅ Yuntao Du
Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation
Dimitrios Karageorgiou ⋅ Symeon Papadopoulos ⋅ Ioannis Kompatsiaris ⋅ Efstratios Gavves
Preventing Expert Collapse in MoE-dVLMs via Modality-Wise Norm Alignment
Zongkai Liu ⋅ Zhen Cao ⋅ Hui Zhang ⋅ Chao Yu ⋅ liqiang niu ⋅ Fandong Meng
Towards High-Resolution Visual Perception via Hierarchical Entity Exploration
Ziyu Ma ⋅ Shidong Yang ⋅ Yuxiang Ji ⋅ Yiming Hu ⋅ Tongwen Huang ⋅ Yong Wang ⋅ Jianfei Cai ⋅ Xiangxiang Chu
BWAFDA: Block-wise Weighted Attention Fusion with Detail-aware for No-Reference Image Quality Assessment
Shilv Cai ⋅ Jian Jin ⋅ Tianang Chen ⋅ Zhuangzi Li ⋅ Weisi Lin
Fourier Self-Supervision for Fine-Grained Generalized Category Discovery
Sarah Rastegar ⋅ Mina Ghadimi Atigh ⋅ Pascal Mettes ⋅ Yuki Asano ⋅ Cees Snoek
STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation
Hesham Syed ⋅ Yun Liu ⋅ Guolei Sun ⋅ Jing Yang ⋅ Henghui Ding ⋅ Xue Geng ⋅ Xudong Jiang
Improving Adversarial Robustness by Mitigating Instability through Relearning
Yi Zeng ⋅ Ling Zhou ⋅ Ruilong Yu ⋅ Qihe Liu ⋅ Shijie Zhou
Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
Wenzheng Zeng ⋅ Siyi Jiao ⋅ Chen Gao ⋅ Hwee Tou Ng ⋅ Mike Zheng Shou
When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression
Tien-Phat Nguyen ⋅ Ngai-Man Cheung
H-SFP: Hierarchical Federated Learning with Decoupled Split-Model Prototyping
Trung-Dung Tran ⋅ Nguyen Ha ⋅ Minh-Duong Nguyen ⋅ Van-Dinh Nguyen ⋅ Kok-Seng Wong
Learning Generatable Mutual Distance for Scene-Aware Human Motion Generation
Zonglin Yang ⋅ Chaoyue Xing ⋅ Yixuan Yin ⋅ Miaomiao Liu ⋅ Liyuan Pan
Cross-Species Animal Re-Identification with Semantic Consistency Learning
Shuoyi Chen ⋅ Yuejia Li ⋅ Mang Ye
Boosting 6D Object Pose Estimation via Monocular Depth Cues
Fengda Hao ⋅ Rui Song ⋅ Qingyuan Wang ⋅ Jiaojiao Li ⋅ Zhiyong Hu ⋅ David Ferstl ⋅ Yinlin Hu
ECC: Encoder-Centric Corruption for Fine-Grained Vision in VLMs
Hyesong Choi ⋅ Daeun Kim ⋅ Sungmin Cha ⋅ Kwang Moo Yi ⋅ Dongbo Min
SAFER-Activities: A Dataset for Smart Assessment of Fall Events and Routine Activities
Diwas Lamsal ⋅ Pramod Wickramatilake ⋅ Jednipat Moonrinta ⋅ Mongkol Ekpanyapong ⋅ Matthew Dailey
ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision–Language Models
Rahul Chowdhury ⋅ Timothy Rupprecht ⋅ Xuan Shen ⋅ Pu Zhao ⋅ Yanzhi Wang
PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
Xiaofeng Mao ⋅ Shaohao Rui ⋅ Bo Zheng ⋅ Kaining Ying ⋅ Chuanhao Li ⋅ Mingmin Chi ⋅ Kaipeng Zhang
Isotropic Embedding Perturbations for Robust Vision Language Encoders
Hyesong Choi ⋅ Daeun Kim ⋅ Song Park ⋅ Taekyung Kim ⋅ Byeongho Heo ⋅ Sangdoo Yun ⋅ Dongbo Min ⋅ Dongyoon Han
DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing
Siying Li ⋅ Ying Ni ⋅ Haotian Shi ⋅ Jie Sun ⋅ Jian Sun
Stabilizing Ultra-Low-Bit Quantization of Multimodal LLMs via Global Bit Allocation
Guilin Li ⋅ Yuexiao Ma ⋅ Yue Zhang ⋅ Xinxiong Wu ⋅ Jiaqi Zhou ⋅ Qingheng Zhang ⋅ Yan Zhang ⋅ Fei Chao ⋅ Xiawu Zheng ⋅ Rongrong Ji
Towards Reliable Multi-Label Classification via Conditional Dependency Modeling
Arkapal Panda ⋅ Aditya Shankar Pal ⋅ Utpal Garain
TopoGS: Planar Reconstruction via Topology-Aware 3D Gaussian Splatting
Shanshan Pan ⋅ Jiale Chen ⋅ Yilin Liu ⋅ Hui Huang
SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers
Sakif Hossain ⋅ Julian Teusch ⋅ Jörg Müller
Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
Cheng Cui ⋅ Changda Zhou ⋅ Tingquan Gao ⋅ Xueqing Wang ⋅ ZIYUE GAO ⋅ Jing Tang ⋅ Yi Liu
Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing
Ayush Prasad ⋅ Swarnalee Mazumder
Ice Cloud Geometry Retrieval with Calibrated Uncertainty from Passive Satellite Imagery
Ayush Prasad
Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection
Ali Balapour ⋅ Faraz Hach
Early Estimation of Language to Latent Alignment in Diffusion Models
VASCO RAMOS ⋅ Regev Cohen ⋅ Idan Szpektor ⋅ Joao Magalhaes
Synthetic Sub-Aperture Phase Augmentation for Demosaicing 2×2 Shared Microlens Sensors
Jeisung Lee ⋅ Wonil Song
Thinking from the Robot’s View: The CoT-HRC Benchmark for Human Intent Reasoning in Embodied Collaboration
Chenxi Deng ⋅ Chao Xu ⋅ JianmingLiu JianmingLiu ⋅ Shaofei Chen
RIGS: Radar-Informed Gaussian Splatting for Uncertainty-Aware 3D Occupancy and Motion Prediction
Zeyu Han ⋅ Junzhe Wu ⋅ Fang Zhang ⋅ Maani Ghaffari Jadidi ⋅ Jianqiang Wang
Practice Makes Perfect: From Explicit Decomposition to Reinforced Latent Planning in Text-to-Human Motion
Ronghao Yu ⋅ Yang Liu ⋅ Juncheng Wang ⋅ Chao Xu ⋅ Yimo Shao ⋅ Baigui Sun ⋅ Yong Liu ⋅ Shan Luo
Structured SIR: Efficient and Expressive Importance-Weighted Inference for High-Dimensional Image Registration
Ivor Simpson ⋅ Neill Campbell
Following the Flow: Advection-Consistent Modeling for Event-based Small Object Detection
Wen Guo ⋅ Fulong Cai ⋅ Wuzhou Quan
Capturing Spectral and Spatial Patterns for Federated Remote Sensing Segmentation
Yixin Xue ⋅ Wenke Huang ⋅ Haonan Guo ⋅ Bo Du
Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
Chenyang Zhang ⋅ Anqi Dong ⋅ Guangming Zhu ⋅ Nuoye Xiong ⋅ Siyuan Wang ⋅ Lin Mei ⋅ Liang Zhang
TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning
Bin Han ⋅ Robert Wolfe ⋅ Bill Howe
VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
Seohyun Lee ⋅ Seoung Choi ⋅ Dohwan Ko ⋅ Jongha Kim ⋅ Hyunwoo Kim
Perceptual Projection Pruning: Diversity-Aware Video Token Pruning for Multimodal Large Language Models
Zhuangqiu Huang ⋅ Minxin Lai ⋅ Shuo Liu ⋅ Yu Zhang ⋅ Jiaqi Wang
Towards Metric-Agnostic Trajectory Forecasting
Markus Knoche ⋅ Daan de Geus ⋅ Bastain Leibe
SceneDiff: A Benchmark and Method for Multiview Object Change Detection
Yuqun Wu ⋅ Chih-Hao Lin ⋅ Henry Che ⋅ Aditi Tiwari ⋅ Chuhang Zou ⋅ Shenlong Wang ⋅ Derek Hoiem
WorldAgents: Can Foundation Image Models be Agents for 3D World Models?
Ziya Erkoç ⋅ Angela Dai ⋅ Matthias Niessner
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
Chancharik Mitra ⋅ Yusen Luo ⋅ Raj Saravanan ⋅ Dantong Niu ⋅ Anirudh Pai ⋅ Jesse Thomason ⋅ Trevor Darrell ⋅ Abrar Anwar ⋅ Deva Ramanan ⋅ Roei Herzig
ORFC: Orthogonal Reparameterization for Low-Bitrate ViT Feature Coding
Letian Zhang ⋅ Wenhan Yang ⋅ Lingyu Duan
Analytic Bayesian Uncertainty for LiDAR Segmentation: A Single-pass Generative Approach
Hanieh Shojaei Miandashti ⋅ Qianqian Zou ⋅ Claus Brenner
Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding
Kadir Yilmaz ⋅ Adrian Kruse ⋅ Tristan Höfer ⋅ Daan de Geus ⋅ Bastain Leibe
Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning
Rujie Wu ⋅ Haozhe Zhao ⋅ Hai Ci ⋅ Yizhou Wang
K-Mask: Kinematic-Aware Masked Modeling for Controllable Text-to-Motion Synthesis
Faisal Ahmed ⋅ Chenqiu Zhao ⋅ Anup Basu
Bounding-Box Trajectories Matter for Video Anomaly Detection
Inpyo Song ⋅ Jangwon Lee
RotateAttention : RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation
Yaofu LIU ⋅ Wangli Lan ⋅ Jinxi Li ⋅ Binhang Yuan ⋅ Harry Yang
Error-Driven Scene Editing for 3D Grounding in Large Language Models
Yue Zhang ⋅ Zun Wang ⋅ Han Lin ⋅ Jialu Li ⋅ Jianing Yang ⋅ Yonatan Bitton ⋅ Idan Szpektor ⋅ Mohit Bansal
PanoRec: Spatially-Structured Sequence Modeling for Multi-Granularity Panoramic Retrieval
Zidong Cao ⋅ Ding Zhou ⋅ Wenyao Gao ⋅ Lutao Jiang ⋅ Hui Xiong
CTEPM: Continuous-Time Event Process Memory for Long-Video Language Models
Yangyang Liu
TextFace: Compositional Text-Guided Identity Preserving Face Synthesis for Face Recognition
Junzhe Yang ⋅ Mingjie He ⋅ Shiguang Shan
One Demonstration Is Enough for Real-World Robotic Reinforcement Learning
Yuwan Liu ⋅ Hongze Yu ⋅ song liu ⋅ Yuhan Wang ⋅ Junge Zhang ⋅ Yaodong Yang ⋅ Yuanpei Chen ⋅ Ceyao Zhang
RoomPlanner: Reachability-Aware View Sampling for Text-to-Room 3D Gaussian Splatting
Wenzhuo Sun ⋅ MingJian Liang ⋅ Wenxuan Song ⋅ Xuelian Cheng ⋅ Zongyuan Ge
Learning Consistency in Reward Modeling for Multi-Modal Reasoning
Chen Li ⋅ Bolin Ni ⋅ Boxin Zhang ⋅ Ke Ye ⋅ Jinnian Zhang ⋅ Houwen Peng ⋅ Han Hu ⋅ Nanning Zheng
Pix2NPHM: Learning to Regress NPHM Reconstructions From a Single Image
Simon Giebenhain ⋅ Tobias Kirschstein ⋅ Liam Schoneveld ⋅ Davide Davoli ⋅ Zhe Chen ⋅ Matthias Niessner
MOOZY: A Patient-First Foundation Model for Computational Pathology
Yousef Hassan ⋅ Vincent Quoc-Huy Trinh ⋅ Christopher Pal ⋅ Mahdi S. Hosseini
EVKit: An Open-source Flexible Toolkit for Efficient Event Camera Data Storage and Loading
Yilun Wu ⋅ Guido De Croon
Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation
Lucas Görnhardt ⋅ Timo Bartels ⋅ Niklas Schwarz ⋅ Tim Fingscheidt
Natural Language Camera Movement Understanding
Yuwen Tan ⋅ Joey Huang ⋅ Jin Huang ⋅ Haoxiang Li ⋅ Boqing Gong
SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning
Jinxiu Liu ⋅ Jianru Li ⋅ Tanqing Kuang ⋅ Xuanming Liu ⋅ Kangfu Mei ⋅ Yandong Wen ⋅ Weiyang Liu
WiFi-JEPA: Self-supervised Learning for WiFi-CSI 3D Human Pose Estimation
Doeon Kim ⋅ Jungyoon Lee ⋅ SEONGSIN KIM ⋅ Seong-heum Kim
Breaking High Confidence: Practical Face Impersonation under High-Security Thresholds
Changjin Kim ⋅ Seunghun Paik ⋅ Dongsoo Kim ⋅ Jae Hong Seo
ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision–Language Models
Zhihao Dou ⋅ Qinjian Zhao ⋅ Zhiqiang Gao ⋅ Sumon Biswas
OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations
Jun Wei ⋅ Xinchang Liu ⋅ Yu Liu ⋅ Chuhua Yang ⋅ Shuhui Wang ⋅ Hui Huang
DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
Haibo Yang ⋅ Yang Chen ⋅ Yingwei Pan ⋅ Zhineng Chen ⋅ Ting Yao ⋅ Tao Mei
FlowLess: Controlling Abstract Image Generation
Amir Hertz ⋅ Noah Snavely
Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories
Merve Kocabas ⋅ Gege Gao ⋅ Bernhard Schölkopf ⋅ Andreas Geiger
E-MOTION: A Dataset for Event-Based Scene Flow Estimation with Independent Moving Objects
Ivan Gutierrez Rodriguez ⋅ Julien Moreau ⋅ Chiara Bartolozzi ⋅ Arren Glover
Open Your Eyes: Benchmarking the Detection of Fabricated Realities and Weaponized Ethics in VLMs
Amit Pandey ⋅ Aditya Mohan ⋅ Phani Sankar
PolyLayout: Multi-room Manhattan Layout Estimation
Gustav Hanning ⋅ Shaohui Liu ⋅ Rémi Pautrat ⋅ Marc Pollefeys ⋅ Kalle Åström ⋅ Viktor Larsson
SR-Edit: Region-Aware Image Editing via Self-Refinement
Andong Wang ⋅ Zehua Chen ⋅ Yuxuan Jiang ⋅ Jun Zhu
ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding
Chia-Hui Chen ⋅ Shih-Ying Yeh ⋅ Fu-En Yang ⋅ Min-Hung Chen ⋅ Shang-Hong Lai
KATANA: Knowledge-Aligned Topology-Aware Neural Agents for RL-Driven Vision-Language Model Compression
Nafew Azim ⋅ Mir Ali ⋅ Fuad Rahman ⋅ Nabeel Mohammed
Breaking Rigidity in Adversarial Patch Attacks
Vishesh Kumar ⋅ Guha Balakrishnan ⋅ Akshay Agarwal
Semantically Aligned Gradient-Driven Context-Preserving Image Editing
Chiranjeev Chiranjeev ⋅ Muskan Dosi ⋅ MAYANK VATSA ⋅ RICHA SINGH
PHOSA: Photorealistic 3D Sign Avatar Modeling and Benchmark
Haodong Wang ⋅ Hezhen Hu ⋅ Wengang Zhou ⋅ Houqiang Li
GeoCFM: Positive-Only Conditional Flow Matching for Mineral Occurrence Sampling
Moshe Eliasof ⋅ Eldad Haber
What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility
Filippo Ziliotto ⋅ Luciano Serafini ⋅ Lamberto Ballan ⋅ Tommaso Campari
LANCE: Low Rank Activation Compression for Efficient On-Device Continual Learning
Marco Apolinario ⋅ Kaushik Roy
Revisiting the Volumetric Data of 4DME: Compression, Extension and Benchmarking for Micro-Expression Analysis
Samuel Boccara ⋅ Amar Tious ⋅ Guoying Zhao ⋅ Yante Li ⋅ Toinon Vigier ⋅ Vincent Ricordel
Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach
Yingjie Dai ⋅ Tianyang Xu ⋅ Yanglin Deng ⋅ Xiao-Jun Wu ⋅ Josef Kittler
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
Chao Wang ⋅ Xudong Tan ⋅ Jianjian Cao ⋅ Kangcong Li ⋅ Tao Chen
Incentivizing Vision Language Models to Search for Long Video Question Answering
Harsh Goel ⋅ S P Sharan ⋅ Sahil Shah ⋅ Minkyu Choi ⋅ Joungbin An ⋅ Kristen Grauman ⋅ Sandeep Chinchali
Visible Yet Unrecognizable: Frequency-Selective Facial Privacy via Attention
Atul Kumar ⋅ Akshay Agarwal
Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Classification
Jeeyung Kim ⋅ Erfan Esmaeili ⋅ Qiang Qiu
EgoEverything: A Benchmark for Human Behavior–Inspired Long-Context Egocentric Video Understanding in AR Environment
Qiance Tang ⋅ Ziqi Wang ⋅ Jieyu Lin ⋅ Ziyun Li ⋅ Barbara Salvo ⋅ Sai Qian Zhang
On Locality and Length-Generalization in Visual Reasoning
Pulkit Madan ⋅ Sanjay Haresh ⋅ Reza Ebrahimi ⋅ Apratim Bhattacharyya ⋅ Sunny Panchal ⋅ Roland Memisevic
Learning Manifolds in High-D Point Embedding for Anisotropic Surface Approximation from Unstructured Point Clouds
Hongbo Li ⋅ Haikuan Zhu ⋅ Xiaohu Guo ⋅ Wenping Wang ⋅ Jing Hua ⋅ Zichun Zhong
Low-Rank Ternary Adaptation for Fine-Tuning Transformers
Alexandru-Dragos Manolache ⋅ Yunqiang Li ⋅ Jan van Gemert
VIGA: View-Conditioned and Identity-Guided Adaptation for Aerial-Ground Person Re-Identification
XU ZHANG ⋅ Feng Yining ⋅ ZUYU ZHANG
Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving
Geonho Bang ⋅ Geunju Baek ⋅ DongYoung Lee ⋅ Wonjun Jeong ⋅ Jun Won Choi
Simple Filtering Improves Masked Autoencoders
Takumi Kobayashi
Evaluating and Understanding Model Editing for Medical Vision Language Models
Guli Zhu ⋅ Chenwei Wu ⋅ Liyue Shen
DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders
Syed Irfan Ali Meerza ⋅ Oktay Ozturk ⋅ Amir Sadovnik ⋅ Jian Liu
SCDL: Synergistic Confidence-Dispersion Learning for Semi-Supervised Video Polyp Segmentation
yuanqin he ⋅ Yuhua Zhang ⋅ Huisi Wu ⋅ Jing Qin
ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device
Fabio Tosi ⋅ Luca Bartolomei ⋅ Matteo Poggi ⋅ Stefano Mattoccia
Flash-Refine: Frustum-Guided Local Incremental Learning for Efficient 3D Gaussian Splatting Completion
Nuocheng Ji ⋅ Hanyang Zhuang ⋅ Chunxiang Wang ⋅ Ming Yang
CrossFeat: Bridging Imaging Modalities in Feature Descriptor Space
Paul Schneider ⋅ Nazim Haouchine
CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains
Wenhan Wang ⋅ Zhixiang Zhou ⋅ Zhongtian Ma ⋅ Yanzhu Chen ⋅ Ziyu Lin ⋅ Hao Sheng ⋅ Pengfei Liu ⋅ Wenqi Shao ⋅ Qiaosheng Zhang ⋅ Yu Qiao
From Blobs to Spokes: High-Fidelity Surface Reconstruction via Oriented Gaussians
Diego Gomez ⋅ Antoine Guedon ⋅ Nissim Maruani ⋅ Bingchen Gong ⋅ Maks Ovsjanikov
DAPS++: Rethinking Diffusion Inverse Problems with Decoupled Posterior Annealing
Hao Chen ⋅ Renzheng Zhang ⋅ Scott Howard
ViTAL‑X: Video-Text Alignment with Cross‑Modal Temporal Edits
Sethuraman T V ⋅ Savya Khosla ⋅ Onkar Susladkar ⋅ Aditi Tiwari ⋅ Seoung Wug Oh ⋅ Kushal Kafle ⋅ Joon-Young Lee ⋅ Derek Hoiem ⋅ Simon Jenni
Bootstrapping Articulated 3D Reconstruction from 2D Image Collections
Jakub Zadrozny ⋅ Oisin Mac Aodha ⋅ Hakan Bilen
SONIC: Spectral Optimization of Noise for Inpainting with Consistency
Seungyeon Baek ⋅ Erqun Dong ⋅ Shadan Namazifard ⋅ Mark J Matthews ⋅ Kwang Moo Yi
Mind2Cloud: EEG-to-Point Cloud Generation with Two-Granularity Diffusion Decoding
Yongyi Lu ⋅ Xiongfeng Huang ⋅ Zhijing Yang
3D Field of Junctions: A Noise-Robust, Training-Free Structural Prior for Volumetric Inverse Problems
Namhoon Kim ⋅ NARGES MOEINI ⋅ Justin Romberg ⋅ Sara Fridovich-Keil
ProtoFair: Fair Self-Supervised Contrastive Learning via Pseudo-Counterfactual Pairs
Marah Halawa ⋅ Olaf Hellwich
Remembering Across Blocks: Topology-Conditioned Block-Progressive Memory for Skeleton-Based Action Recognition
Seonho Lee ⋅ Sang Han ⋅ Hyeok Nam ⋅ Sung In Cho
Why Linear Probing Works: Non-Vacuous Generalization Bounds via Effective Dimension
Dongxin Guo ⋅ Jikun Wu ⋅ SM Yiu
CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization
Chuyan Chen ⋅ Peng Sun ⋅ Kun Yuan
NeuralGarSim: Geometry-agnostic Garment Simulation with Neural Fields
Arihant Gaur ⋅ Navami Kairanda ⋅ Christian Theobalt ⋅ Vladislav Golyanik
Data-Free Client Contribution Estimation via Logit Maximization for Federated Learning
Asim Ukaye ⋅ Nurbek Tastan ⋅ Mubarak Abdu-Aguye ⋅ Karthik Nandakumar
HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization
Rui Chu ⋅ Yingjie Lao
Defect-aware Hybrid Prompt Optimization for Zero-Shot Multi-type Anomaly Detection and Segmentation
Nadeem Nazer ⋅ Hongkuan Zhou ⋅ Lavdim Halilaj ⋅ Ylli Sadikaj ⋅ Steffen Staab
To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion
Shaswati Saha ⋅ Rajasekhar Anguluri ⋅ Manas Gaur
BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
Vishal Narnaware ⋅ Ashmal Vayani ⋅ Rohit Gupta ⋅ Swetha Sirnam ⋅ Shah Mubarak
Tricam-rPPG: A Multimodal Multispectral Dataset for remote Photoplethysmography
Abhijit Sarkar ⋅ Surendrabikram Thapa ⋅ Ishtiaque Khan ⋅ Yogesh Deshpande ⋅ Amos Abbott
One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies
Shaolong Li ⋅ Lichao Sun ⋅ Yongchao Chen
VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context
Xiaoqian Shen ⋅ Mohamed Elhoseiny
Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers
Mikalai Yudzin ⋅ Sergei Kudriashov ⋅ Alexander Gaponov ⋅ Maxim Rakhuba
BeyondSight: Object Permanence for End-to-End Autonomous Driving
Sandro Papais ⋅ Letian Wang ⋅ Mudit jain ⋅ Behnaz Rezaei ⋅ Steven Waslander
BiCE-HG: A Bi-Conditional Egocentric Hand Gesture Dataset for Intelligent Reality Systems
Awfa Dakheel ⋅ Charith Abhayaratne
The Map Is Not the Territory: Embedding-Coverage Blacklists for Safe Diffusion Steering
Juyang Bai ⋅ Tong Zhou ⋅ Shaolei Ren ⋅ Xiaolin Xu
Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers
Robin Kim ⋅ Colin Samplawski ⋅ Benjamin Marlin
Segmentation-Guided Homography Estimation for Long-Term Planar Tracking
Jonáš Šerých ⋅ Jiri Matas
NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices
Filip Pawlicki ⋅ Marcel Kańduła ⋅ Marcin Pucek ⋅ Kamil Dobies
Bayesian Uncertainty Attribution-Guided Fine-Tuning for Open-Set Action Recognition
Shehan Senavirathna ⋅ Hongji Guo ⋅ Qiang Ji
VISOR++ : VISUAL INPUT BASED STEERING FOR LARGE VISION LANGUAGE MODELS
Ravikumar Balakrishnan ⋅ Mansi Phute
Generative Manifold Distillation: Aligning Restoration Trajectories with the Natural Image Prior
Yuyang Hu ⋅ Mojtaba Sahraee-Ardakan ⋅ Kangfu Mei ⋅ Arpit Bansal ⋅ Chenyang Qi ⋅ Peyman Milanfar ⋅ Mauricio Delbracio
DETRPose: Real-Time End-to-End Multi-Person Pose Estimation via Modified Transformer Decoder and Novel Denoising Keypoints
Sebastian Janampa ⋅ Marios Pattichis
The 3D Mirage: Probing and Taming 3D Hallucinations
Hoang Nguyen ⋅ Xiaohao Xu ⋅ Xiaonan Huang
WildCity: A Real-World Dataset for City-Scale Rendering and Beyond
Xiangyu Han ⋅ Mengyu Yang ⋅ Jiaqi Li ⋅ Bowen Chang ⋅ Ziyu Chen ⋅ Hexu Zhao ⋅ Rahul Agrawal ⋅ Anthony Rodriguez ⋅ Rajani Acharya ⋅ Fiona Hua ⋅ Marco Pavone ⋅ Chen Feng ⋅ Yiming Li
TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger
Vu Truong ⋅ Long Bao Le
MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
Bonan Zhang ⋅ Shiyu Dong ⋅ Quan Tran ⋅ Katharina Gschwind ⋅ Shuqi Yang ⋅ Sijia Chen ⋅ Adel Ahmadyan ⋅ Seungwhan Moon ⋅ Lu Zhang ⋅ Ahmed Kirmani ⋅ Babak Damavandi ⋅ Anuj Kumar
Histopathology Multi-modal Embedding for Pathology Composed Retrieval
Qifeng Zhou ⋅ Wenliang Zhong ⋅ Thao Dang ⋅ Hehuan Ma ⋅ Saiyang Na ⋅ Yuzhi Guo ⋅ Junzhou Huang
Cast and Attached Shadow Detection via Iterative Light and Geometry Reasoning
Shilin Hu ⋅ Jingyi Xu ⋅ Sagnik Das ⋅ Dimitris Samaras ⋅ Hieu Le
DisentangledTMR: Privacy-Preserving Skeleton Motion Retargeting via Factorized Transformers
Thomas Carr ⋅ Depeng Xu ⋅ Shuhan Yuan ⋅ Aidong Lu
ReAL: Reference-to-Image (R2I) Aware Latent Diffusion for Image Super-Resolution
Byeonghun Lee ⋅ Hyunmin Cho ⋅ Sunghoon Im ⋅ Kyong Hwan Jin
LineGraph2Road: Structural Graph Reasoning on Line Graphs for Road Network Extraction
Zhengyang Wei ⋅ Renzhi Jing ⋅ Yiyi He ⋅ Jenny Suckale
What if? Emulative Simulation with World Models for Situated Reasoning
Ruiping Liu ⋅ Yufan Chen ⋅ Yuheng Zhang ⋅ Junwei Zheng ⋅ Kunyu Peng ⋅ Chengzhi Wu ⋅ Chenguang Huang ⋅ Di Wen ⋅ Jiaming Zhang ⋅ Kailun Yang ⋅ Rainer Stiefelhagen
Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection
Runzhi Deng ⋅ Yundi Hu ⋅ Yiming Zhong ⋅ Zhao Wang ⋅ Xixi Liu ⋅ Hongsong Wang ⋅ Caifeng Shan ⋅ Fang Zhao
GLARE: Towards Generalizable Detection of Latent Diffusion Images with Global-Local Reconstruction Error
Jiangtao Yan ⋅ Jiazhen Ji ⋅ Zhongyu Zhang ⋅ Yuge Huang ⋅ Wenbin Wang ⋅ Shouhong Ding
NeuralDMD: Interpretable Untrained Neural Network for Imaging from Sparse and Noisy Observations
Ali SaraerToosi ⋅ Renbo Tu ⋅ Esther Lin ⋅ Kamyar Azizzadenesheli ⋅ Aviad Levis
MLVC: A Multi-platform Learned Video Codec for Real-World Deployment
Tanel Pärnamaa ⋅ Martin Lumiste ⋅ Ardi Loot ⋅ Evgenii Indenbom ⋅ Andrei Znobishchev ⋅ Ando Saabas
Pixel-wise Geo-registration of Drone and Satellite Images
Qingyang Liu ⋅ David G Shatwell ⋅ Parth Parag Kulkarni ⋅ Shah Mubarak
LUA: Latent Upscaling Adapter for Diffusion-Based Image Synthesis
Aleksandr Razin ⋅ Kazantsev Danil ⋅ Ilya Makarov
iMED: A Multi-Endoscope Dataset for Surgical 3D Perception
Sierra Bonilla ⋅ Fengyi Jiang ⋅ Chinedu Nwoye ⋅ Jingpei Lu ⋅ Kailey Reardon ⋅ Humphrey Chow ⋅ Francisco Vasconcelos ⋅ Sophia Bano ⋅ Adam Schmidt ⋅ Omid Mohareri
PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur
Gopi Raju Matta ⋅ Reddypalli Trisha ⋅ Divya Madhuri Vemunuri ⋅ Kaushik Mitra
From Local Geometry to Global Pseudo-Labeling for Robust Positive–Unlabeled Learning under Covariate Shift
Firas Gabetni ⋅ Alexandre Rocchi--Henry ⋅ Ziyi LIU ⋅ Nacim Belkhir ⋅ Gianni Franchi
Objects as Audio-Visual Modal Sound Fields
Zisen Shao ⋅ Zihao Wei ⋅ Derong Jin ⋅ Ruohan Gao
Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution
Bryan Kim ⋅ Jonghyun Park ⋅ Jong Chul Ye
The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models
Adeel Yousaf ⋅ Soumik Ghosh ⋅ James Beetham ⋅ Amrit Singh Bedi ⋅ Shah Mubarak
TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing
Tim-Felix Faasch ⋅ Jochen Kall ⋅ Jens Behley ⋅ Lucas Nunes ⋅ Cyrill Stachniss
Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching
Yue Pan ⋅ Tao Sun ⋅ Liyuan Zhu ⋅ Lucas Nunes ⋅ Iro Armeni ⋅ Jens Behley ⋅ Cyrill Stachniss
SEMIR: Topology-Preserving Graph Minors for Thin-Structure Segmentation
Luke Miller ⋅ Yugyung Lee
Causal Intervention in Concept Bottleneck Models
Zhiyu Zhu ⋅ Jiayu Zhang ⋅ Zhibo Jin ⋅ Xinyi Wang ⋅ Fang Chen ⋅ Przemyslaw Biecek ⋅ Jianlong Zhou
CulinaryCut: A Physics-aware Vision-Language-Action Benchmark for Food Cutting via Material Point Method
Hyunsuh Koh ⋅ CHANG-YONG SONG ⋅ Youngjae Choi ⋅ Misa Viveiros ⋅ David Hyde ⋅ Heewon Kim
The Language of Visual Attention: Modeling Scanpaths via Autoregressive Token Prediction
Susmit Agrawal ⋅ Matthias Bethge ⋅ Matthias Kuemmerer
Cambrian-P: Pose-Grounded Video Understanding
Jihan YANG ⋅ Zifan Zhao ⋅ Xichen Pan ⋅ Shusheng Yang ⋅ Junyi Zhang ⋅ Hu Xu ⋅ Shang-Wen Li ⋅ Saining Xie
Group3D: MLLM-Guided Semantic Grouping for Open-Vocabulary 3D Object Detection
Youbin Kim ⋅ Jinho Park ⋅ Hogun Park ⋅ Eunbyung Park
CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation
Tingzhang Luo ⋅ Ruizhong Liu ⋅ Yichao Liu ⋅ Cheng Fan ⋅ Yu Liu ⋅ Jianyuan Guo
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
Lanxiang Hu ⋅ Abhilash Shankarampeta ⋅ Yixin Huang ⋅ Zilin Dai ⋅ Haoyang Yu ⋅ Yujie Zhao ⋅ Haoqiang Kang ⋅ Daniel Zhao ⋅ Tajana Rosing ⋅ Hao Zhang
TIDES: Time-Derivative Event Simulation via Deformable Reconstruction
Christopher Thirgood ⋅ Dipon Kumar Ghosh ⋅ Simon Hadfield
Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering
Hsiang-Wei Huang ⋅ Fu-Chen Chen ⋅ Li-Wu Tsao ⋅ Cheng-Han Lee ⋅ Che-Chun Su ⋅ Lu Xia ⋅ Ronghui Peng ⋅ Jenq-Neng Hwang ⋅ Min Sun ⋅ Cheng-Hao Kuo
Tackling Misattribution in 3D Intrinsic Decomposition via Proximity Attention Point Rendering
Alireza Moazeni ⋅ Shichong Peng ⋅ Yanshu Zhang ⋅ Chirag Vashist ⋅ Ke Li
RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather
Heejun Park ⋅ Jaeseok Jeong ⋅ KUK-JIN YOON
Attention-based Vision-Language Memory for Spatial Reasoning
Zuntao Liu ⋅ Zuntao Liu ⋅ Taimeng Fu ⋅ Shaoshu Su ⋅ Cherie Ho ⋅ Chen Wang
CoCo-IR: Conversational Composed Image Retrieval
Shengcao Cao ⋅ Tanmaya Dabral ⋅ Zhongli Ding ⋅ Madhuri Shanbhogue ⋅ Kaifeng Chen ⋅ Zhe Li ⋅ Mojtaba Seyedhosseini ⋅ Liang-Yan Gui ⋅ Yu-Xiong Wang
When Rubrics Fail: Error Enumeration as Reward for Reference-Free RL Post-Training
Wisdom Ikezogwo ⋅ Mehmet Saygin Seyfioglu ⋅ Ranjay Krishna ⋅ Karim Bouyarmane
DeMuS: Learning Decoupled Matching and Scoring for Batch Zero-Shot Industrial Anomaly Detection
Zhengyang Zhao ⋅ Hailong Sun ⋅ Binhang Qi ⋅ Hongrui Yu ⋅ Zhongchi Wang ⋅ Hang Xu
UMO: Unified In-Context Learning Unlocks Motion Foundation Model Priors
Xiaoyan Cong ⋅ Zekun Li ⋅ Zhiyang Dou ⋅ Hongyu Li ⋅ Omid Taheri ⋅ chuan guo ⋅ Abhay Mittal ⋅ Sizhe An ⋅ Taku Komura ⋅ Wojciech Matusik ⋅ Michael Black ⋅ Srinath Sridhar
Posterior Augmented Flow Matching
George Stoica ⋅ Sayak Paul ⋅ Matthew Wallingford ⋅ Abhay Nori ⋅ Vivek Ramanujan ⋅ Winson Han ⋅ Ali Farhadi ⋅ Ranjay Krishna ⋅ Judy Hoffman
LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos
Ce Zhang ⋅ Jinxi He ⋅ Yaqi Xie ⋅ Katia Sycara
Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration
Sangwoo (Jason) Jo ⋅ Donggeun Ko ⋅ Jayeon Kang ⋅ Youngsang Kwak ⋅ Jaehwa Kwak ⋅ Sungjoon Choi
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
Mahtab Bigverdi ⋅ Linjie Li ⋅ Weikai Huang ⋅ Jieyu Zhang ⋅ Tuhin Kundu ⋅ Zelun Luo ⋅ Chris Kim ⋅ Jaemin Cho ⋅ Ranjay Krishna ⋅ Linda Shapiro ⋅ Liu Yiming
DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents
Fuyao Zhang ⋅ Jiaming Zhang ⋅ CHE WANG ⋅ Xiongtao Sun ⋅ Yurong Hao ⋅ Guowei Guan ⋅ Wenjie Li ⋅ Longtao Huang ⋅ Wei Lim
EgoTraj: Real-World Egocentric Human Trajectory
Ahmad Yehia ⋅ Abduallah Mohamed ⋅ Tianyi Wang ⋅ Kun Qian ⋅ Jiseop Byeon ⋅ Junfeng Jiao ⋅ Christian Claudel
Wan-R1: Verifiable-Reinforcement Learning for Generalizable Video Reasoning
Ming Liu ⋅ Yunbei Zhang ⋅ Shilong Liu ⋅ Liwen Wang ⋅ Wensheng Zhang
XDen-1K: A Density Field Dataset of Real-World Objects
Jingxuan Zhang ⋅ Tianqi Yu ⋅ Yatu Zhang ⋅ Jinze Wu ⋅ Kaixin Yao ⋅ Jingyang Liu ⋅ Yuyao Zhang ⋅ Jiayuan Gu ⋅ Jingyi Yu
PASR: Pattern-Aware Scene-Conditioned Reasoning for Camouflaged Object Detection
Xinyu Wang ⋅ Jintang Xue ⋅ C.-C. Jay Kuo
AMCI: Unlock the Potential of Large Multimodal Models for Fine-grained Open-world Classification via Adaptive Memory Context Injection
Xiao Liu ⋅ Haiyang Zheng ⋅ Nan Pu ⋅ Wenjing Li ⋅ Nicu Sebe ⋅ Zhun Zhong
Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
Cheolhong Min ⋅ Jaeyun Jung ⋅ Daeun Lee ⋅ Hyeonseong Jeon ⋅ Yu Su ⋅ Jonathan Tremblay ⋅ Chan Hee Song ⋅ Jaesik Park
Tactile Modality Fusion for Vision-Language-Action Models
Charlotte Morissette ⋅ Amin Abyaneh ⋅ Wei-Di Chang ⋅ Anas Houssaini ⋅ David Meger ⋅ Hsiu-Chin Lin ⋅ Jonathan Tremblay ⋅ Gregory Dudek
Moiré Video Authentication: A Physical Signature Against AI Video Generation
Yuan Qing ⋅ Kunyu Zheng ⋅ Lingxiao Li ⋅ Boqing Gong ⋅ Chang Xiao
GeoDetect: Geometric Adversarial Detection for VLPs
Afsaneh Hasanebrahimi ⋅ Hanxun Huang ⋅ Christopher Leckie ⋅ James Bailey ⋅ Sarah Erfani
Indelible Backdoors: On the Limits of Post-Training Defenses
Jingyi Guo ⋅ Thuy Dung Nguyen ⋅ Taylor T Johnson ⋅ Kevin Leach
Parsimonious Flow Matching for Efficient Image Generation
Tianjiao Ding ⋅ Ziqing Xu ⋅ Benjamin Haeffele ⋅ Hongkang Li ⋅ Rene Vidal
PointGT: Simultaneous Geometric and Textural Editing for Point-Based Representations
Yanshu Zhang ⋅ George Shramko ⋅ Pratul Srinivasan ⋅ Ke Li
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
Zhexiao Xiong ⋅ Xin Ye ⋅ Burhaneddin Yaman ⋅ Sheng Cheng ⋅ Yiren Lu ⋅ Jingru Luo ⋅ Nathan Jacobs ⋅ Liu Ren
Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion
Dongseok Shim ⋅ Julian Tanke ⋅ Kengo Uchida ⋅ christian simon ⋅ Koichi Saito ⋅ Takashi Shibuya ⋅ Shusuke Takahashi ⋅ Yuki Mitsufuji
T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability
Savya Khosla ⋅ Sethuraman T V ⋅ Aryan Chadha ⋅ Alex Schwing ⋅ Derek Hoiem
Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
Jie-Ying Lee ⋅ Yi-Ruei Liu ⋅ Shr-Ruei Tsai ⋅ Wei-Cheng Chang ⋅ Chung-Ho Wu ⋅ Jiewen Chan ⋅ Zhenjun Zhao ⋅ Chieh Hubert Lin ⋅ Yu-Lun Liu
World Reconstruction From Inconsistent Views
Lukas Höllein ⋅ Matthias Niessner
Tesselating The Earth
Daniel Cher ⋅ Hamza Iqbal ⋅ Eric Xing ⋅ Brian Wei ⋅ Nathan Jacobs
Compositional Non-Face Re-Identification Pressure under Cumulative Vision Releases
Tirth Joshi ⋅ Honggang Wang
WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation
Muhammad Aamir ⋅ Naoya Muramatsu ⋅ Sangyun Shin ⋅ Matthew Wijers ⋅ Jia-Xing Zhong ⋅ Xinyu Hou ⋅ Amir Patel ⋅ Andrew Loveridge ⋅ Andrew Markham
FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity
Ganghyeon Lee ⋅ inha Lee ⋅ Junhee Lee ⋅ Jeongeon Lee ⋅ Sung Whan Yoon ⋅ Kyungdon Joo
Boba: Batched Simulation for Physics-Based Gaussian Digital Twins
Yihan Pang ⋅ Hanxiao Jiang ⋅ Sushant Kondguli ⋅ Sarita Adve ⋅ Shenlong Wang
VisTa3D: A Dataset and Benchmark for Vision, Tactile, and 3D Point Clouds-based Thin Object Reconstruction
Shania Guo ⋅ Yeongsik Seo ⋅ Andrew Fu ⋅ Mei Hao ⋅ Iris Xia ⋅ Jiwon Lee ⋅ Xinyi Xie ⋅ Hyoungseob Park ⋅ Aaron Dollar ⋅ Alex Wong
AnyView: Synthesizing Any Novel View in Dynamic Scenes
Basile Van Hoorick ⋅ Dian Chen ⋅ Shun Iwase ⋅ Pavel Tokmakov ⋅ Muhammad Zubair Irshad ⋅ Igor Vasiljevic ⋅ Swati Gupta ⋅ Fangzhou Cheng ⋅ Sergey Zakharov ⋅ Vitor Guizilini
Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps
Sandeep Mishra ⋅ Yasamin Jafarian ⋅ Andreas Lugmayr ⋅ Yingwei Li ⋅ Varsha Ramakrishnan ⋅ Srivatsan Varadharajan ⋅ Alan Bovik ⋅ Ira Kemelmacher-Shlizerman
Cross-token Guidance Transformer for Weakly Supervised Object Localization
Zhiwei Chen ⋅ Yiran Nie ⋅ Ruize Han ⋅ Qinqin Zhou
DocLayout-VL: A Foundational Model for Hierarchical, Open-set, and Promptable Document Layout Segmentation
Venkata Venna ⋅ Srihari Bandarupalli ⋅ Anirudh Srinivasan ⋅ R Raghuveer ⋅ Sai Madhusudan Gunda ⋅ SANTOSH RAVI KIRAN SARVADEVABHATLA
Spectral Prior for Reducing Exposure Bias in Diffusion Models
Yuya Kobayashi ⋅ Masato Ishii ⋅ Yuhta Takida ⋅ Takashi Shibuya ⋅ Yuki Mitsufuji
STVFocus: Query-guided Spatio-Temporal Visual Focusing for Video LLMs
Taehun Kong ⋅ Minyoung Park ⋅ Sangjun Ahn
Mind-to-Face: Neural-Driven Photorealistic Avatar Synthesis via EEG Decoding
Haolin Xiong ⋅ Tianwen Fu ⋅ Yunxuan Cai ⋅ Pratusha Prasad ⋅ Haiwei Chen ⋅ Wenbin Teng ⋅ Hanyuan Xiao ⋅ Yajie Zhao
Estimating Individual Tree Height and Species from UAV Imagery
Jannik Endres ⋅ Etienne Laliberté ⋅ David Rolnick ⋅ Arthur Ouaknine
Together, Then Apart: Balancing Alignment and Distinctiveness for Multimodal Survival Analysis
Wenjing Liu ⋅ Qin Ren ⋅ Wen Zhang ⋅ Yuewei Lin ⋅ Chenyu You
V-HOLD: Stabilizing Flow Trajectories to Rethink the Edit–Preservation Trade-off
Gahyeon Kim ⋅ Dong-oh Kang
CSS-BA: Gate Guided Column Space Search for Bundle Adjustment
Ayano Kaneda ⋅ Takafumi Taketomi ⋅ Shugo Yamaguchi ⋅ Shigeo Morishima
ARMS: Anchor–Relational Motion Streaming for Seamless Solo-Social Motion Transitions
Huakun Liu ⋅ Qing Yu ⋅ Kent Fujiwara ⋅ Hideaki Uchiyama ⋅ Kiyoshi Kiyokawa
PRISM: Latent Composition Consistency for Single-Image Reflection Removal
Junseong Shin ⋅ Tae Hyun Kim
Molmo-Point: Better Pointing for VLMs with Grounding Tokens
Christopher Clark ⋅ Yue Yang ⋅ Jae Sung Park ⋅ Zixian Ma ⋅ Jieyu Zhang ⋅ Rohun Tripathi ⋅ Mohammadreza Salehi ⋅ Sangho Lee ⋅ Ranjay Krishna
Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation
Minghao Jin ⋅ Mozheng Liao ⋅ Mingfei Han ⋅ Zhihui Li ⋅ Xiaojun Chang
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
HAIHONG HAO ⋅ Lei Chen ⋅ Mingfei Han ⋅ Changlin Li ⋅ Dong An ⋅ Yuqiang Yang ⋅ Zhihui Li ⋅ Xiaojun Chang
SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations
Jason Wu ⋅ Shir-Kang Jin ⋅ Yuyang Yuan ⋅ Maggie Wigness ⋅ Lance Kaplan ⋅ Hang Qiu ⋅ Mani Srivastava
Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
Sen Liang ⋅ Cong Wang ⋅ Zhentao Yu ⋅ Fengbin Guan ⋅ zhengguang zhou ⋅ Teng Hu ⋅ youliang zhang ⋅ Yuan Zhou ⋅ Xin Li ⋅ Qinglin Lu ⋅ Zhibo Chen
Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
youliang zhang ⋅ zhengguang zhou ⋅ Zhentao Yu ⋅ Ziyao Huang ⋅ Teng Hu ⋅ Sen Liang ⋅ Guozhen Zhang ⋅ Ziqiao Peng ⋅ Shunkai Li ⋅ Yi Chen ⋅ Zixiang Zhou ⋅ Yuan Zhou ⋅ Qinglin Lu ⋅ Xiu Li
HIVE: Understanding Post Hallucination Reasoning in Vision Language Models
Feng He ⋅ Zhenting Wang ⋅ Qifan Wang ⋅ Qiang Guan ⋅ Dongfang Liu ⋅ Ruixiang Tang ⋅ Qiankun Li
Personalize Your Large Vision-language Models With In-context Prompt Tuning
Yanshu Li ⋅ Jiaqian Li ⋅ Kuai Yu ⋅ Xi Xiao ⋅ Dongfang Liu ⋅ Tianyang Wang ⋅ Ruixiang Tang
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
Youngwan Lee ⋅ Soojin Jang ⋅ Yoorhim Cho ⋅ Seunghwan Lee ⋅ Yong-Ju Lee ⋅ Sung Hwang
HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video
YIMING JIANG ⋅ Hanzhang Tu ⋅ Wenfeng Song ⋅ Siyou Lin ⋅ Liang An ⋅ Shuai Li ⋅ Aimin Hao ⋅ Yebin Liu
Fast Sam 3D Body: Accelerating SAM 3D Body for Real-Time Full-Body Human Mesh Recovery
Timing Yang ⋅ Sicheng He ⋅ Hongyi Jing ⋅ Jiawei Yang ⋅ Zhijian Liu ⋅ Chuhang Zou ⋅ Yue Wang
Monocular Models are Strong Learners for Multi-View Human Mesh Recovery
Haoyu Xie ⋅ Shengkai Xu ⋅ Cheng Guo ⋅ Muhammad Saleem ⋅ Wenhan Wu ⋅ Chen Chen ⋅ Ahmed Helmy ⋅ Pu Wang ⋅ Hongfei Xue
SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers
Jianing Deng ⋅ Yuanzhe LI ⋅ Jialu Wang ⋅ Song Wang ⋅ Tianlong Chen ⋅ Huanrui Yang ⋅ Jingtong Hu
Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns
Andrea Sanchietti ⋅ Riccardo Marin ⋅ Bharat Bhatnagar ⋅ Yuanlu Xu ⋅ Gerard Pons-Moll
Variational Patch Gating for Training-Free Few-Shot Classification
Ahmed Radwan ⋅ Ahmad Abdel-Qader ⋅ Islam Osman ⋅ Mohamed Shehata
AdaBoosting Text Prompts for Vision-Language Models
Seokhee Jin ⋅ Changhwan Sung ⋅ Sunung Mun ⋅ Hoyoung Kim ⋅ Jungseul Ok