GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing
Abstract
While Diffusion Large Language Models (DLLMs) have demon-strated remarkable capabilities in multi-modal generation, performingprecise, training-free image editing remains an open challenge. Unlikecontinuous diffusion models, the discrete tokenization inherent in DLLMshinders the application of standard noise inversion techniques, often lead-ing to structural degradation during editing. In this paper, we introduceGIDE (Grounded Inversion for DLLM Image Editing), a unified frame-work designed to bridge this gap. GIDE incorporates a novel DiscreteNoise Inversion mechanism that accurately captures latent noise pat-terns within the discrete token space, ensuring high-fidelity reconstruc-tion. We then decompose the editing pipeline into grounding, inver-sion, and refinement stages. This design enables GIDE supportingvarious editing instructions (text, point and box) and operations whilestrictly preserving the unedited background. Furthermore, to overcomethe limitations of existing single-step evaluation protocols, we introduceGIDE-Bench, a rigorous benchmark comprising 805 compositional edit-ing scenarios guided by diverse multi-modal inputs. Extensive exper-iments on GIDE-Bench demonstrate that GIDE significantly outper-forms prior training-free methods, improving Semantic Correctness by51.83% and Perceptual Quality by 50.39%. Additional evaluations onImgEdit-Bench confirm its broad applicability, demonstrating consistentgains over trained baselines and yielding photorealistic consistency onpar with leading models.3 .