컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법

arXiv:2608.180632026-08-17

EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법

고해상도 이미지 편집은 계산량이 너무 커서 대부분 1K 이하에서만 작동하고, 저해상도로 편집한 뒤 초해상도(업스케일링)로 키우는 방식은 원본과 다른 디테일을 지어내거나 텍스처가 뭉개지는 문제가 있었다. EditBridge는 저해상도 편집 결과를 고해상도 원본에 맞춰 다시 그리는 과정을 노이즈에서 시작하지 않고 두 이미지 사이를 직접 잇는 방식(디퓨전 브리지)으로 처리하고, 편집 안 한 부분은 원본과 정확히 대응하는 위치만 보고 편집한 부분은 주변만 보는 식으로 연산량을 크게 줄이는 주의 메커니즘을 함께 썼다. 그 결과 2K에서는 기존 초해상도 방식보다 3.6~8.4배 빠르고, 4K 이미지 편집을 61초 만에 끝낼 수 있었다.

METAL MEDIA 해설 도표

저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법

  1. 01고해상도 이미지 편집은 어텐션 연산이 이미지 크기의 제곱에 비례해 늘어나 메모리와 속도 문제로 대부분 1K 이하에서만 동작한다
  2. 02저해상도 편집 후 초해상도로 키우는 기존 방식은 원본에 없는 디테일을 지어내거나(정보 발산) 텍스처가 뭉개지거나 과하게 날카로워지는(텍스처 열화) 문제가 있다
  3. 03EditBridge는 노이즈에서 이미지를 새로 만드는 대신, 저해상도 편집 결과를 고해상도 정답 이미지로 옮겨가는 경로를 직접 학습하는 디퓨전 브리지를 사용해 원본 구조 정보를 끝까지 유지한다
  4. 04편집 안 된 영역은 원본 이미지에서 대응되는 정확한 위치만, 편집된 영역은 그 주변 작은 범위만 보도록 제한하는 프라이어 기반 희소 주의(PG-BSA)로 연산량을 크게 줄였다
  5. 052K에서 기존 초해상도 기반 방법 대비 3.6~8.4배 빠르고(4.08초), 4K 편집을 61초에 완료했으며, 사용자 평가에서도 디테일 보존·사실감·미적 완성도 모두 기존 방법보다 우수했다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 고해상도 이미지 편집은 어텐션 연산이 이미지 크기의 제곱에 비례해 늘어나 메모리와 속도 문제로 대부분 1K 이하에서만 동작한다
  2. 저해상도 편집 후 초해상도로 키우는 기존 방식은 원본에 없는 디테일을 지어내거나(정보 발산) 텍스처가 뭉개지거나 과하게 날카로워지는(텍스처 열화) 문제가 있다
  3. EditBridge는 노이즈에서 이미지를 새로 만드는 대신, 저해상도 편집 결과를 고해상도 정답 이미지로 옮겨가는 경로를 직접 학습하는 디퓨전 브리지를 사용해 원본 구조 정보를 끝까지 유지한다
  4. 편집 안 된 영역은 원본 이미지에서 대응되는 정확한 위치만, 편집된 영역은 그 주변 작은 범위만 보도록 제한하는 프라이어 기반 희소 주의(PG-BSA)로 연산량을 크게 줄였다
  5. 2K에서 기존 초해상도 기반 방법 대비 3.6~8.4배 빠르고(4.08초), 4K 편집을 61초에 완료했으며, 사용자 평가에서도 디테일 보존·사실감·미적 완성도 모두 기존 방법보다 우수했다
Table 1: Quantitative comparison results. ↑/↓ indicate whether higher/lower values are better. Bold numbers represent the best results.
MethodHaar ↑mPSNR ↑mSSIM ↑mMSE ↓mLPIPS ↓Time (s) ↓
1K Resolution
Direct Inference0.397316.80780.75390.05490.411620.00
DiT4SR [14]0.412714.50310.70920.05540.481828.47
DiT-SR [9]0.452316.71520.79550.04300.44032.44
PiSA-SR [32]0.424715.21150.74810.04860.44920.30
TSD-SR [12]0.412715.38640.75310.05160.46280.42
HiFlow [7]0.301211.69640.64890.13230.60125.12
ScaleEdit [22]0.482416.84610.82060.04080.3784181.20
Ours0.499218.65360.86860.03690.38290.84
2K Resolution
Direct Inference0.225413.52620.74910.08800.670082.14
DiT4SR [14]0.380615.12980.74680.05160.5348113.32
DiT-SR [9]0.421017.24300.82650.04230.473814.82
PiSA-SR [32]0.404616.24330.80610.04460.470220.22
TSD-SR [12]0.404616.20210.79520.04670.491034.20
HiFlow [7]0.314413.93140.73770.07590.511333.11
ScaleEdit [22]0.458316.55100.68180.04850.5197662.50
Ours0.467318.63660.87120.03770.39034.08
4K Resolution
Direct Inference0.213410.70860.54110.12810.7774695.23
DiT4SR [14]0.400220.27710.75350.01330.3510533.83
DiT-SR [9]0.426716.86150.68180.04150.5436119.68
PiSA-SR [32]0.426721.62000.79740.01080.2687111.42
TSD-SR [12]0.412422.27660.80350.00740.2399108.72
HiFlow [7]0.330714.44000.67190.06640.6038129.30
ScaleEdit [22]0.411618.57140.76380.03900.60153601.20
Ours0.427924.13800.83470.00490.211261.10
Table 2: Performance comparison between our PG-BSA and full attention across 1K and 2K settings. ↑/↓ indicate whether higher/lower values are better. Bold numbers represent the best results within each resolution block.
SettingMethodHaarPSI↑mPSNR↑mSSIM↑mMSE↓mLPIPS↓Time (s)↓
1KOurs0.49918.6530.8680.0360.3820.84
FullAttention0.53919.0800.8570.0300.5990.73
2KOurs0.46718.6360.8710.0370.3904.08
FullAttention0.50517.9180.7050.0410.4254.71
Table 3: Quantitative evaluation of varying inference steps. ↑/↓ indicate whether higher/lower values are better. Bold numbers represent the best results.
MethodHaarPSI↑mPSNR↑mSSIM↑mMSE↓mLPIPS↓Time(s)↓
5 steps0.413115.72690.77630.04740.47394.03
10 steps0.402015.41900.76360.04940.46628.10
Ours (1 step)0.499118.65350.86850.03680.38290.84

왜 중요한가

고해상도 이미지 편집은 사진 보정, 디자인 등 실무에서 필요하지만 지금까지는 속도와 원본 충실도 사이에서 타협해야 했다. 이 연구는 그 타협 없이 빠르면서도 원본에 충실한 4K 편집이 가능함을 보여줘, 실제 제품에 고해상도 편집 기능을 넣는 문턱을 낮춘다.

이 논문의 용어

  • 디퓨전 브리지(Diffusion Bridge) · 무작위 노이즈가 아니라 시작 이미지와 목표 이미지 사이를 직접 잇는 방식으로 학습하는 생성 모델
  • 초해상도(Super-Resolution) · 저해상도 이미지를 고해상도로 키우는 기술로, 없는 디테일을 새로 만들어내야 한다
  • PG-BSA(Prior-Guided Block-wise Sparse Attention) · 원본과 대응되는 위치만 선택적으로 참고해 연산량을 줄이는 주의 메커니즘
  • DiT(Diffusion Transformer) · 트랜스포머 구조를 사용하는 이미지 생성 모델의 한 종류
  • LoRA(Low-Rank Adaptation) · 모델 전체를 다시 학습하지 않고 적은 파라미터만 추가로 학습해 미세조정하는 기법

본문에 싣지 못한 그림

  • Figure 1: Motivation of the proposed method. (a) and (b) compare the standard high-resolution image editing paradigm with our approach. (c) analyzes the inherent limitations of existing methods.
  • Figure 2: Overview of our proposed EditBridge. The upper section illustrates the inference process of the diffusion bridge, which transports the low-resolution edit to its high-resolution counterpart. The lower section details the construction of the correspondence prior and the proposed Prior-Guided Sparse Attention (PG-BSA) mechanism.
  • Figure 3: Qualitative comparison at 1K resolution. Our method better preserves fidelity while enhancing visual clarity.
  • Figure 4: Qualitative comparison at 2K resolution. Our method better preserves fidelity while enhancing visual clarity.
  • Figure 5: Ablation of Attention Sparsity. Full attention leads to noticeable source-induced artifacts, whereas our sparse attention maintains superior visual fidelity and alignment.
  • Figure 6: Impact of sampling steps. Perceptual quality and high-frequency details are maximized at T=1. Increasing the number of inference steps does not yield significant visual gains, further validating the efficiency of our refinement framework.
  • Figure 7: Results of the user study across three dimensions: Detail Preservation, Realism, and Aesthetics. Our method consistently outperforms all baselines in human preference.
  • Figure 8: Visual results at 1K resolution.
  • Figure 9: Visual results at 2K resolution.
원문에서 그림 보기 →

저자 · Jiayi Song

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사