Spotlights
GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction
Enpeng Li ⋅ Yunzhou Zhang ⋅ Zhiyao Zhang ⋅ Dexuan Lyu ⋅ Chenyu Wang ⋅ Chiyuan Cui ⋅ Cheng Cheng
View full details
CFM: Language-aligned Concept Foundation Model for Vision
Kai Wittenmayer ⋅ Sukrut Rao ⋅ Amin Parchami-Araghi ⋅ Bernt Schiele ⋅ Jonas Fischer
View full details
Wat3R: Underwater 3D Geometry Learning without Underwater Annotations
Jiangwei Ren ⋅ Xingyu Jiang ⋅ Zijie Song ⋅ Wei Xu ⋅ Hongkai Lin ⋅ Dingkang Liang ⋅ Xiang Bai
View full details
AdaBoosting Text Prompts for Vision-Language Models
Seokhee Jin ⋅ Changhwan Sung ⋅ Sunung Mun ⋅ Hoyoung Kim ⋅ Jungseul Ok
View full details
GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis
Minjun Kang ⋅ Inkyu Shin ⋅ Taeyeop Lee ⋅ Myungchul Kim ⋅ In Kweon ⋅ KUK-JIN YOON
View full details
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
Chancharik Mitra ⋅ Yusen Luo ⋅ Raj Saravanan ⋅ Dantong Niu ⋅ Anirudh Pai ⋅ Jesse Thomason ⋅ Trevor Darrell ⋅ Abrar Anwar ⋅ Deva Ramanan ⋅ Roei Herzig
View full details
DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
Haibo Yang ⋅ Yang Chen ⋅ Yingwei Pan ⋅ Zhineng Chen ⋅ Ting Yao ⋅ Tao Mei
View full details
Molmo-Point: Better Pointing for VLMs with Grounding Tokens
Christopher Clark ⋅ Yue Yang ⋅ Jae Sung Park ⋅ Zixian Ma ⋅ Jieyu Zhang ⋅ Rohun Tripathi ⋅ Mohammadreza Salehi ⋅ Sangho Lee ⋅ Ranjay Krishna
View full details
Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
Cheolhong Min ⋅ Jaeyun Jung ⋅ Daeun Lee ⋅ Hyeonseong Jeon ⋅ Yu Su ⋅ Jonathan Tremblay ⋅ Chan Hee Song ⋅ Jaesik Park
View full details
Edit3r: Instant 3D Scene Editing from Sparse Unposed Images
Jiageng Liu ⋅ Weijie Lyu ⋅ Xueting Li ⋅ Yejie Guo ⋅ Ming-Hsuan Yang
View full details
Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models
Amira Guesmi ⋅ Muhammad Shafique
View full details
PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS
Yunseo Yang ⋅ Youngho Yoon ⋅ KUK-JIN YOON
View full details
Learning to Deny: Action Denial in Multimodal Large Language Models
Raiyaan Abdullah ⋅ Shehreen Azad ⋅ Yogesh Rawat
View full details
ReSplat: Learning Recurrent Gaussian Splatting
Haofei Xu ⋅ Daniel Barath ⋅ Andreas Geiger ⋅ Marc Pollefeys
View full details
SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection
Kim Jun-Seong ⋅ Tae-Hyun Oh ⋅ Eduardo Pérez Pellitero ⋅ Youngkyoon Jang
View full details
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
Gur Elkin ⋅ Ofir I Shahar ⋅ Ohad Ben-Shahar
View full details
GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
Yijia Weng ⋅ Zhicheng Wang ⋅ Songyou Peng ⋅ Saining Xie ⋅ Howard Zhou ⋅ Leonidas Guibas
View full details
GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing
Mingxin Liu ⋅ Ziqian Fan ⋅ Zhaokai Wang ⋅ Leyao Gu ⋅ Zirun Zhu ⋅ YiguoHe YiguoHe ⋅ Yuchen Yang ⋅ Changyao Tian ⋅ Xiangyu Zhao ⋅ Ning Liao ⋅ Shaofeng Zhang ⋅ Qibing Ren ⋅ Zhihang Zhong ⋅ Xuanhe Zhou ⋅ Junchi Yan ⋅ Xue Yang
View full details
On Test-Time Scaling for Vision-Language Models
Fawaz Sammani ⋅ Tzoulio Chamiti ⋅ Nikos Deligiannis
View full details
SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization
Jiun Lee ⋅ Jaekwang Kim ⋅ Sangmin Lee
View full details
URoPE: Universal Relative Position Embedding across Geometric Spaces
Yichen Xie ⋅ Depu Meng ⋅ Yihan Hu ⋅ Chensheng Peng ⋅ Quentin HERAU ⋅ Masayoshi TOMIZUKA ⋅ Wei Zhan
View full details
Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering
Oriol Jiménez-Ayguadé ⋅ Antonio Agudo
View full details
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
Huanyu Wang ⋅ Jushi Kai ⋅ Haoli Bai ⋅ Lu Hou ⋅ Bo Jiang ⋅ Ziwei He ⋅ Zhouhan Lin
View full details
Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction
Jorge Condor ⋅ Nicolas Moënne-Loccoz ⋅ Merlin Nimier-David ⋅ Piotr Didyk ⋅ Zan Gojcic ⋅ Qi Wu
View full details
CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation
Chenglong Liu ⋅ Xin Zhang ⋅ Yimeng Zhu ⋅ Liyang He ⋅ Yixiao Ma ⋅ Yu Su ⋅ Zhenya Huang ⋅ Qi Liu
View full details
EmbedCopilot: Evaluating Vision-Language Models for Hardware-Aware Embedded System Development
Dongsheng Yuan ⋅ Yimo Deng ⋅ Huangxun Chen
View full details
SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
Olaf Dünkel ⋅ Basavaraj Sunagad ⋅ Haoran Wang ⋅ David Hoffmann ⋅ Christian Theobalt ⋅ Adam Kortylewski
View full details
RayRoPE: Projective Ray Positional Encoding for Multi-view Attention
Yu Wu ⋅ Minsik Jeon ⋅ Rick Chang ⋅ Oncel Tuzel ⋅ Shubham Tulsiani
View full details
TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid
Seonghun Oh ⋅ Youngjung Uh ⋅ Jin-Hwa Kim
View full details
On the Reliability of Cue Conflict and Beyond
Pum Jun Kim ⋅ Seung-Ah Lee ⋅ Seongho Park ⋅ Dongyoon Han ⋅ Jaejun Yoo
View full details
Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation
Ziyu Zhang ⋅ Yi Yu ⋅ Simeng Zhu ⋅ Ahmed Aly ⋅ Yunhe Gao ⋅ Ning Gu ⋅ Yuan Xue
View full details
One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
Xiaohao Xu ⋅ Feng Xue ⋅ Xiang Li ⋅ Haowei Li ⋅ Shusheng Yang ⋅ Tianyi Zhang ⋅ Matthew Johnson-Roberson ⋅ Xiaonan Huang
View full details
Mimicking Radiologists: A Coarse-to-Fine Framework with Structural Sparse Tokens for Dual-LLM Computed Tomography Report Generation
Hong Liu ⋅ Dong Wei ⋅ Yefeng Zheng ⋅ Xian Wu ⋅ Liansheng Wang
View full details
VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation
Chinmay Prabhakar ⋅ Bastian Wittmann ⋅ Tamaz Amiranashvili ⋅ Paul Büschl ⋅ Ezequiel De la Rosa ⋅ Julian McGinnis ⋅ Benedikt Wiestler ⋅ Bjoern Menze ⋅ Suprosanna Shit
View full details
TR-MoE: Temporal Reliability-Aware Mixture-of-Experts for Robust Tracking
Tianle Wang ⋅ Xiangyang Yang ⋅ Jihua Zhu ⋅ Binrui Liu ⋅ Yanzhao Li ⋅ Shuiwang Li
View full details
Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
Qi Song ⋅ Ziyuan Luo ⋅ Haoliang Han ⋅ Renjie Wan
View full details
RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement
Jiyao Wang ⋅ Qingyong Hu ⋅ Duoxun Tang ⋅ Xiao Yang ⋅ Kaishun Wu ⋅ Jiangbo Yu
View full details
LoRC: Detecting AI-Generated Images via Low-Rank Collapse in the Semantic-Residual Space
Haozhen Yan ⋅ Ruoxin Chen ⋅ Jiahui Zhan ⋅ Taiping Yao ⋅ Bo Wang ⋅ Youchang xiao ⋅ Shouhong Ding ⋅ Liqing Zhang ⋅ Jianfu Zhang
View full details
Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling
Yang Zhao ⋅ Peisong Niu ⋅ Tian Zhou ⋅ Ziqing Ma ⋅ Guanlong Ma ⋅ Rong Jin ⋅ Huiling Yuan ⋅ Liang Sun
View full details
Ice Cloud Geometry Retrieval with Calibrated Uncertainty from Passive Satellite Imagery
Ayush Prasad
View full details
Proteus: Model Leakage-Induced Adversarial Attack in Federated Learning
Junjie Shan ⋅ Yue Zhang ⋅ Ziqi Zhao ⋅ Ka Ho Chow
View full details
Beyond Filter Pruning: Top-K Spatial Selection for Efficient Neural Networks
Sarthak Ketanbhai Modi ⋅ Hans Soegeng ⋅ Thomas Peyrin
View full details
Event-based Sparse-view Background-Oriented Schlieren Tomography
Xinyu Zhou ⋅ Shihao Hu ⋅ Peiqi Duan ⋅ Chao Xu ⋅ Boxin Shi
View full details
Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations
Alex Costanzino ⋅ Pierluigi Zama Ramirez ⋅ Giuseppe Lisanti ⋅ Luigi Di Stefano
View full details
Zero-shot Depth from Defocus
Yiming Zuo ⋅ Hongyu Wen ⋅ Venkat Subramanian ⋅ Patrick Chen ⋅ Karhan Kayan ⋅ Mario Bijelic ⋅ Felix Heide ⋅ Jia Deng
View full details
When Higher Order Hurts: Pre-Asymptotic Order Collapse in Generative ODE Sampling — A Theory of Discretization–Learning Interaction
Farzad Salajegheh ⋅ Sudhir Mudur
View full details
Bayesian Self-Attention with Local Pixel Correlations for Lightweight Denoising Transformers
Runyang He ⋅ Zuowei Shen ⋅ Hui JI
View full details
Structured-Noise Masked Modeling for Video, Audio and Beyond
Aritra Bhowmik ⋅ Carlos Hinojosa ⋅ Fida Mohammad Thoker ⋅ Bernard Ghanem ⋅ Cees Snoek
View full details
PolarAPP: Beyond Polarization Demosaicking for Polarimetric Applications
Yidong Luo ⋅ Chenggong Li ⋅ Yunfeng Song ⋅ Ping Wang ⋅ Boxin Shi ⋅ Junchao Zhang ⋅ Xin Yuan
View full details
Stokes-Informed Diffusion for Robust Linear Polarization Estimation
Yidong Luo ⋅ Chenggong Li ⋅ Yuchao Feng ⋅ Boxin Shi ⋅ Junchao Zhang ⋅ Xin Yuan
View full details
Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
Jonas Klotz ⋅ Cassio F. Dantas ⋅ Pallavi Jain ⋅ Diego Marcos ⋅ Begüm Demir
View full details
Multi-Anchor Distillation with Text-Guided Analytic Classifier for Continual Learning
Qier Meng ⋅ De Cheng ⋅ Jiahao Li ⋅ Cheng Deng
View full details
Off the Planckian Locus: Using 2D Chromaticity to Improve In-Camera Color
SaiKiran Tedla ⋅ Joshua Little ⋅ Hakki Karaimer ⋅ Michael S Brown
View full details
RoMa v2: Harder Better Faster Denser Feature Matching
Johan Edstedt ⋅ David Nordström ⋅ Yushan Zhang ⋅ Georg Bökman ⋅ Jonathan Astermark ⋅ Viktor Larsson ⋅ Anders Heyden ⋅ Fredrik Kahl ⋅ Mårten Wadenbäck ⋅ Michael Felsberg
View full details
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Yubo Huang ⋅ Hailong Guo ⋅ Fangtai Wu ⋅ Weiqiang Wang ⋅ Shijie Huang ⋅ Qijun Gan ⋅ Shifeng Zhang ⋅ Lin Liu ⋅ Sirui Zhao ⋅ Enhong Chen ⋅ Jiaming Liu ⋅ Steven Hoi
View full details
LoMa: Local Feature Matching Revisited
David Nordström ⋅ Johan Edstedt ⋅ Georg Bökman ⋅ Jonathan Astermark ⋅ Anders Heyden ⋅ Viktor Larsson ⋅ Mårten Wadenbäck ⋅ Michael Felsberg ⋅ Fredrik Kahl
View full details
Mind-to-Face: Neural-Driven Photorealistic Avatar Synthesis via EEG Decoding
Haolin Xiong ⋅ Tianwen Fu ⋅ Yunxuan Cai ⋅ Pratusha Prasad ⋅ Haiwei Chen ⋅ Wenbin Teng ⋅ Hanyuan Xiao ⋅ Yajie Zhao
View full details
GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos
Yiqian Wu ⋅ Rawal Khirodkar ⋅ Egor Zakharov ⋅ Timur Bagautdinov ⋅ Lei Xiao ⋅ Zhaoen Su ⋅ Shunsuke Saito ⋅ Xiaogang Jin ⋅ Junxuan Li
View full details
Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features
Marcus Valtonen Örnhag ⋅ Alberto Jaenal Gálvez ⋅ Stefan Adalbjörnsson
View full details
Rolling Shutter Camera Self-Calibration
Yongcong Zhang ⋅ Navid Rabbani ⋅ Bangyan Liao ⋅ Chengbo Wang ⋅ Yizhen Lao ⋅ Adrien Bartoli
View full details
OmniFace: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
Xu Guo ⋅ Fulong Ye ⋅ Xinghui Li ⋅ Pengqi Tu ⋅ Pengze Zhang ⋅ Qichao Sun ⋅ Songtao Zhao ⋅ Xiangwang Hou ⋅ Qian HE
View full details
Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition
Zoey Shu ⋅ Jiacheng Yang ⋅ Yang Lu ⋅ Waishan Qiu ⋅ Chuan Li ⋅ Da Chen
View full details
OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data
Kaixing Yang ⋅ Jiashu Zhu ⋅ Xulong Tang ⋅ Ziqiao Peng ⋅ Xiangyue Zhang ⋅ Chubin Chen ⋅ Puwei Wang ⋅ Jiahong Wu ⋅ Xiangxiang Chu ⋅ Hongyan Liu ⋅ Jun He
View full details
OpenCVL: An Open, Diverse, and Large-Scale Dataset for Fine-Grained Cross-View Localization
Zimin Xia ⋅ Mubariz Zaffar ⋅ Junsheng Fu ⋅ Alexandre ALahi ⋅ Julian Kooij
View full details
MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control
Kaiqi Liu ⋅ Yunyao Mao ⋅ Ziqi Cai ⋅ Zheng Geng ⋅ Jing Wang ⋅ Qiulin Wang ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Kun Gai ⋅ Shuchen Weng ⋅ Boxin Shi
View full details
Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video
Siyuan Li ⋅ Weiying Chen ⋅ Yilin Wang ⋅ Xinxin Zuo ⋅ Xingyu Li ⋅ Li Cheng
View full details
E-MOTION: A Dataset for Event-Based Scene Flow Estimation with Independent Moving Objects
Ivan Gutierrez Rodriguez ⋅ Julien Moreau ⋅ Chiara Bartolozzi ⋅ Arren Glover
View full details
SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers
Sakif Hossain ⋅ Julian Teusch ⋅ Jörg Müller
View full details
Monocular Models are Strong Learners for Multi-View Human Mesh Recovery
Haoyu Xie ⋅ Shengkai Xu ⋅ Cheng Guo ⋅ Muhammad Saleem ⋅ Wenhan Wu ⋅ Chen Chen ⋅ Ahmed Helmy ⋅ Pu Wang ⋅ Hongfei Xue
View full details
EgoExoMoCap: Distributed Human Motion Capture via Ego- and Exocentric Body Tracking from Head-Mounted Devices
Jiaxi Jiang ⋅ Bharat Bhatnagar ⋅ Nan Yang ⋅ Lingni Ma ⋅ Sebastian Starke ⋅ Robin Kips ⋅ Nadine Bertsch (Rueegg) ⋅ Christian Holz ⋅ Federica Bogo
View full details
Training-free Controllable Motion Generation under Heterogeneous Constraints
Xiaofei Hui ⋅ Bo Yan ⋅ Haoxuan Qu ⋅ Hossein Rahmani ⋅ Jun Liu
View full details
Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction
Hao Tian ⋅ Chenyangguang Zhang ⋅ Rui Liu ⋅ Wen Shen ⋅ Xiaolin Qin
View full details
OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer
Si-yu Lu ⋅ Po-Ting Chen ⋅ Hui-Che Hsu ⋅ Sin-Ye Jhong ⋅ Wen-Huang Cheng ⋅ Yung-Yao Chen
View full details
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
Yukun Wang ⋅ Ruihuang Li ⋅ Jiale Tao ⋅ Shiyuan Yang ⋅ Liyi Chen ⋅ Zhantao Yang ⋅ Handz Handz ⋅ Yulan Guo ⋅ Shuai Shao ⋅ Qinglin Lu
View full details
VKSR: Scalable Kernel Surface Reconstruction Using Vecchia's Approximation
Maximilian Weiherer ⋅ Chukwudi Williams Umah ⋅ Bernhard Egger
View full details
CameraAnything: Refilming Videos with Arbitrary Camera Control
Yixuan Li ⋅ Yanhong Zeng ⋅ Ka Leong Cheng ⋅ Jiayi Zhu ⋅ Hanlin Wang ⋅ Wen Wang ⋅ Yihao Meng ⋅ Hao Ouyang ⋅ Qiuyu Wang ⋅ Yue Yu ⋅ Zidong Wang ⋅ Yiyuan Zhang ⋅ Yujun Shen ⋅ Dahua Lin
View full details
RADmesh: Remesh-Aware Mesh Deformation
Nam Anh Dinh ⋅ Itai Lang ⋅ Oded Stein ⋅ Rana Hanocka
View full details
RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video
Ulrich Prestel ⋅ Stefan Andreas Baumann ⋅ Nick Stracke ⋅ Bjorn Ommer
View full details
Face Anything: 4D Face Reconstruction from Any Image Sequence
Umut Kocasarı ⋅ Simon Giebenhain ⋅ Richard Shaw ⋅ Matthias Niessner
View full details
A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models
Nuo Chen ⋅ Lulin Liu ⋅ Zihao Li ⋅ Ziyao Zeng ⋅ Zihao Zhu ⋅ Wenyan Cong ⋅ Junyuan Hong ⋅ Yunhao Yang ⋅ Zhengzhong Tu ⋅ Yan Wang ⋅ Boris Ivanovic ⋅ Marco Pavone ⋅ Zhangyang Wang ⋅ Yang Zhou ⋅ Zhiwen Fan
View full details
HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations
Yaqiao Dai ⋅ Renjiao Yi ⋅ Zhirui Gao ⋅ Wei Chen ⋅ Kai Xu ⋅ Chenyang Zhu
View full details
Grounding World Simulation Models in a Real-World Metropolis
Junyoung Seo ⋅ Hyunwook Choi ⋅ Minkyung Kwon ⋅ Jinhyeok Choi ⋅ Siyoon Jin ⋅ Gayoung Lee ⋅ Junho Kim ⋅ JoungBin Lee ⋅ Geonmo Gu ⋅ Dongyoon Han ⋅ Sangdoo Yun ⋅ Seungryong Kim ⋅ Jin-Hwa Kim
View full details
InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image
Gwanhyeong Koo ⋅ Hyunsu Kim ⋅ Youngji Kim ⋅ Taejae Lee ⋅ Siwoo Lim ⋅ Sunjae Yoon ⋅ Suyong Yeon ⋅ Chang Yoo
View full details
Silhouette-based Gait Foundation Model
Dingqiang Ye ⋅ Chao Fan ⋅ Kartik Narayan ⋅ Bingzhe Wu ⋅ Chengwen Luo ⋅ Jianqiang Li ⋅ Vishal Patel
View full details
UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer
Shuai Wang ⋅ Liang Li ⋅ Yang Chen ⋅ Ruopeng Gao ⋅ Yao Teng ⋅ Limin Wang
View full details
CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification
Xu Haoxuan ⋅ Hanzi Wang ⋅ Guanglin Niu
View full details
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
ye junyan ⋅ Leqi Zhu ⋅ Yuncheng Guo ⋅ Dongzhi Jiang ⋅ Zilong Huang ⋅ Yifan Zhang ⋅ Zhiyuan Yan ⋅ Haohuan Fu ⋅ Conghui He ⋅ Weijia Li
View full details
QVAM: Query-guided View-aware Adaptive Modulation for Aerial-Ground Person Re-Identification
Mengfei Zhou ⋅ Lin Wan
View full details
Scaling Multi-Reference Image Generation with Dynamic Reward Optimization
Wenwang Huang ⋅ Yusen Fu ⋅ Mengfei Huang ⋅ Junjie Wang ⋅ Yulin Li ⋅ Gan Liu ⋅ Jing Cai ⋅ Yancheng He ⋅ Zhuotao Tian
View full details
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
Yuchao Gu ⋅ Guian Fang ⋅ Yuxin Jiang ⋅ Weijia Mao ⋅ Song Han ⋅ Han Cai ⋅ Mike Zheng Shou
View full details
Divide and Align: Disentangled Vision-Language Learning for Text-Based Person Anomaly Search
Alex Ergasti ⋅ Tomaso Fontanini ⋅ Claudio Ferrari ⋅ Massimo Bertozzi ⋅ Andrea Prati
View full details
Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
Hau-Shiang Shiu ⋅ Chin-Yang Lin ⋅ Zhixiang Wang ⋅ Chi-Wei Hsiao ⋅ Po-Fan Yu ⋅ Yu-Chih Chen ⋅ Yu-Lun Liu
View full details
PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images
Ruiqi Wang ⋅ Yiming Qian ⋅ FENGGEN YU ⋅ Yuxuan Lu ⋅ Dakuo Wang ⋅ Hao Richard Zhang ⋅ Jing Huang
View full details
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
Zitong Xu ⋅ Huiyu Duan ⋅ Zhongpeng Ji ⋅ Xinyun Zhang ⋅ Yutao Liu ⋅ Xiongkuo Min ⋅ Ke Gu ⋅ Jian Zhang ⋅ Shusong Xu ⋅ Jinwei Chen ⋅ Bo Li ⋅ Guangtao Zhai
View full details
RiO-DETR: DETR for Real-time Oriented Object Detection
Zhangchi Hu ⋅ Yifan Zhao ⋅ Yansong Peng ⋅ Wenzhang SUN ⋅ Xiangchen Yin ⋅ Jie Chen ⋅ Peixi Wu ⋅ Hebei Li ⋅ xinghao wang ⋅ Dongsheng Jiang ⋅ Xiaoyan Sun
View full details
Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels
Venkanna Babu Guthula ⋅ Oswin Krause ⋅ Dimitri Gominski ⋅ Hui Zhang ⋅ Johan Mottelson ⋅ Ankit Kariryaa ⋅ Nico Lang ⋅ Christian Igel
View full details
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
Hui Zhang ⋅ Juntao Liu ⋅ Zongkai Liu ⋅ liqiang niu ⋅ Fandong Meng ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
View full details
Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off
Fulvio Sanguigni ⋅ Davide Lobba ⋅ Bin Ren ⋅ Marcella Cornia ⋅ Nicu Sebe ⋅ Rita Cucchiara
View full details
Exclusivity-Guided Mask Learning for Semi-Supervised Crowd Instance Segmentation and Counting
Jiyang Huang ⋅ Hongru Chen ⋅ Wei Lin ⋅ Jia Wan ⋅ Antoni Chan
View full details
GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing
Zifeng Zhu ⋅ Jiaming Han ⋅ Jiaxiang Zhao ⋅ Minnan Luo ⋅ Xiangyu Yue
View full details
Instance Segmentation as Tracking: A New Paradigm for Multi-Small-Object Tracking with Event Cameras
Nuo Chen ⋅ Shiman He ⋅ Boyang Li ⋅ Yingqian Wang ⋅ Chao Xiao ⋅ QianYin QianYin ⋅ Ruojing Li ⋅ Yihang Luo ⋅ Wei An ⋅ Miao Li
View full details
SelfMOTR: Revisiting MOTR with Self-Generating Detection Priors
Fabian Gülhan ⋅ Emil Mededovic ⋅ Yuli Wu ⋅ Johannes Stegmaier
View full details
Push–Pull Attentional Anchoring for Diffusion Concept Erasure
Nattanat Chatthee ⋅ Tagon Sompong ⋅ Ekapol Chuangsuwanich ⋅ Supasorn Suwajanakorn
View full details
When Rubrics Fail: Error Enumeration as Reward for Reference-Free RL Post-Training
Wisdom Ikezogwo ⋅ Mehmet Saygin Seyfioglu ⋅ Ranjay Krishna ⋅ Karim Bouyarmane
View full details
PhenoLeaf-TS: A Time-Series Benchmark for Leaf Instance Segmentation, Tracking, and Growth Stage Classification
Rijad Saric ⋅ Basim Azam ⋅ Sarmad Khan ⋅ Edhem Custovic
View full details
Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting
zhen zou ⋅ Xiaoxiao Ma ⋅ Mingde Yao ⋅ Jie Huang ⋅ Linjiang Huang ⋅ Feng Zhao
View full details
Event-based Gaze Control Systems for Real-time Spin Estimation in Professional Ball Games
Yunpu Hu ⋅ Fabian Schilling ⋅ Valentina Cavinato ⋅ Asude Aydin ⋅ Agis Politis ⋅ Ricardo Morales ⋅ Kirk Scheper ⋅ Peter Dürr ⋅ Naoya Takahashi
View full details
SPEAR: A Simulator for Photorealistic Embodied AI Research
Mike Roberts ⋅ Renhan Wang ⋅ Rushikesh Zawar ⋅ Rachith Dey-Prakash ⋅ Quentin Leboutet ⋅ Stephan Richter ⋅ Matthias Müller ⋅ German Ros ⋅ Rui Tang ⋅ Stefan Leutenegger ⋅ Yannick Hold-Geoffroy ⋅ Kalyan Sunkavalli ⋅ Vladlen Koltun
View full details
DoCoG: Mask-based Multi-Type Grounded Chain-of-Thought for Document QA
Sai Madhusudan Gunda ⋅ Jyothi Jinka ⋅ Hrithik Sagar ⋅ Aryan Jain ⋅ Venkata Venna ⋅ Anirudh Srinivasan ⋅ SANTOSH RAVI KIRAN SARVADEVABHATLA
View full details
Predicting Consequences and Reinforcing Navigation Policies with Latent World Models
Zengmao Wang ⋅ Wei Gao ⋅ Shuhan Shen
View full details
Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
Heethanjan Kanagalingam ⋅ Thenukan Pathmanathan ⋅ Mokeeshan Vathanakumar ⋅ Basim Azam ⋅ Sarah Erfani ⋅ NAVEED AKHTAR
View full details
Unordered Landmark Visual Navigation
Hao Ren ⋅ Junzhe Zhu ⋅ Yihan Li ⋅ Zetong Bi ⋅ Le Zheng ⋅ Zhi Li ⋅ Yiqing Yuan ⋅ Zhaoliang Wan ⋅ Dizhe Zhang ⋅ Lu Qi ⋅ HUI CHENG
View full details
SyntheticDoc: A Large Synthetic Dataset for Document Unwarping and Illumination Correction
Daniel Woortmann ⋅ Tanguy Magne ⋅ Olga Sorkine-Hornung
View full details
PanoRec: Spatially-Structured Sequence Modeling for Multi-Granularity Panoramic Retrieval
Zidong Cao ⋅ Ding Zhou ⋅ Wenyao Gao ⋅ Lutao Jiang ⋅ Hui Xiong
View full details
R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation
Yuhao Zhang ⋅ Wanxi Dong ⋅ Yue Shi ⋅ Yi Liang ⋅ Jingnan Gao ⋅ Qiaochu Yang ⋅ Yaxing Lyu ⋅ Zhixuan Liang ⋅ Yibin Liu ⋅ Congsheng Xu ⋅ Xianda Guo ⋅ Wei Sui ⋅ Yaohui Jin ⋅ Xiaokang Yang ⋅ Yanyan Xu ⋅ Yao Mu
View full details
Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum
Zhizhao Liang ⋅ Yi-Lin Wei ⋅ Xuhang Chen ⋅ Mu Lin ⋅ Yi-Xiang He ⋅ Zhexi Luo ⋅ Jun-Hui Liu ⋅ Kun-Yu Lin ⋅ WEISHI ZHENG
View full details
NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding
Hyeonjeong Ha ⋅ Jinjin Ge ⋅ Bo Feng ⋅ Kaixin Ma ⋅ Gargi Chakraborty
View full details
Incentivizing Vision Language Models to Search for Long Video Question Answering
Harsh Goel ⋅ S P Sharan ⋅ Sahil Shah ⋅ Minkyu Choi ⋅ Joungbin An ⋅ Kristen Grauman ⋅ Sandeep Chinchali
View full details
Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch
Gabriele Mario Caddeo ⋅ Pasquale Marra ⋅ Lorenzo Natale
View full details
Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen
Chengming Feng ⋅ Hesam Araghi ⋅ Liming Zheng ⋅ Julien Dupeyroux ⋅ Xucong Zhang ⋅ Jan van Gemert ⋅ Nergis Tomen
View full details
Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
Sen Liang ⋅ Cong Wang ⋅ Zhentao Yu ⋅ Fengbin Guan ⋅ zhengguang zhou ⋅ Teng Hu ⋅ youliang zhang ⋅ Yuan Zhou ⋅ Xin Li ⋅ Qinglin Lu ⋅ Zhibo Chen
View full details
HumanOmni-Speaker: Identifying Who said What and When
Detao Bai ⋅ Xihan Wei ⋅ Zhiheng Ma
View full details
TriO: Tri-Modal Unsupervised Occupancy World Model for Anything Perception
Quinlan Sykora ⋅ Sourav Biswas ⋅ Christopher Diehl ⋅ Andrew Cunningham ⋅ Thomas Gilles ⋅ Raquel Urtasun
View full details
VOCA: Visual Odometry with Codec Awareness
Nouri Alexander Hilscher ⋅ Mateo de Mayo ⋅ Dominik Muhle ⋅ Christoph Hermes ⋅ Daniel Cremers
View full details
UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation
Jiahang Tu ⋅ Fengyu Yang ⋅ Chenyang Ma ⋅ Xihang Yu ⋅ Ziyao Zeng ⋅ Shaokai Wu ⋅ Hanbin Zhao ⋅ Zhi Tao ⋅ Chao Zhang ⋅ Hui Qian ⋅ Alex Wong
View full details
PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving
Kyuhwan Yeon ⋅ Benjamin Ramtoula ⋅ Daniele De Martini
View full details
See & Sniff: Learning Visuo-Olfactory Representations
Seongyu Kim ⋅ Seungwoo Lee ⋅ Hyeonggon Ryu ⋅ Joon Son Chung ⋅ Arda Senocak
View full details
Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
Chenyang Zhang ⋅ Anqi Dong ⋅ Guangming Zhu ⋅ Nuoye Xiong ⋅ Siyuan Wang ⋅ Lin Mei ⋅ Liang Zhang
View full details
Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior
Jiahui Fu ⋅ Zehao Huang ⋅ Han Li ⋅ Naiyan Wang ⋅ Si Liu
View full details
CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport
Peng Ling ⋅ Yingda Yin ⋅ Lingting Zhu ⋅ Weikai Chen ⋅ Shengju Qian ⋅ Zeyu HU ⋅ Xin Wang ⋅ Wenming Yang
View full details
MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model
Taiga Yamane ⋅ Satoshi Suzuki ⋅ Ryo Masumura ⋅ Shota Orihashi ⋅ Tomohiro Tanaka ⋅ Mana Ihori ⋅ Naoki Makishima
View full details
CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization
Bo Wu ⋅ Ruoshen Mo ⋅ Justin Yue ⋅ Yanyu Zhang ⋅ Janice Nguyen ⋅ Guoyuan Wu ⋅ Amit Roy-Chowdhury ⋅ Matthew Barth ⋅ Hang Qiu
View full details
When Sinks Help or Hurt: Unified Framework for Attention Sink in MLLMs
Jiho Choi ⋅ Jaemin Kim ⋅ JINHWI PARK ⋅ Seunghoon Hong ⋅ Sanghwan Kim
View full details
VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-Simulation
Hoonhee Cho ⋅ Jae-young Kang ⋅ Giwon Lee ⋅ Hyemin Yang ⋅ Heejun Park ⋅ KUK-JIN YOON
View full details
How to Teach Large Multimodal Models New Skills
Zhen Zhu ⋅ Yiming Gong ⋅ Yao Xiao ⋅ Yaoyao Liu ⋅ Derek Hoiem
View full details
Successful Page Load