저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법
저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법
고해상도 이미지 편집은 계산량이 너무 커서 대부분 1K 이하에서만 작동하고, 저해상도로 편집한 뒤 초해상도(업스케일링)로 키우는 방식은 원본과 다른 디테일을 지어내거나 텍스처가 뭉개지는 문제가 있었다. EditBridge는 저해상도 편집 결과를 고해상도 원본에 맞춰 다시 그리는 과정을 노이즈에서 시작하지 않고 두 이미지 사이를 직접 잇는 방식(디퓨전 브리지)으로 처리하고, 편집 안 한 부분은 원본과 정확히 대응하는 위치만 보고 편집한 부분은 주변만 보는 식으로 연산량을 크게 줄이는 주의 메커니즘을 함께 썼다. 그 결과 2K에서는 기존 초해상도 방식보다 3.6~8.4배 빠르고, 4K 이미지 편집을 61초 만에 끝낼 수 있었다.
METAL MEDIA 해설 도표
저해상도로 편집하고 고해상도 원본을 참고해 살을 붙이는 방식으로, 4K 이미지 편집을 61초 만에 해내는 방법
- 01고해상도 이미지 편집은 어텐션 연산이 이미지 크기의 제곱에 비례해 늘어나 메모리와 속도 문제로 대부분 1K 이하에서만 동작한다
- 02저해상도 편집 후 초해상도로 키우는 기존 방식은 원본에 없는 디테일을 지어내거나(정보 발산) 텍스처가 뭉개지거나 과하게 날카로워지는(텍스처 열화) 문제가 있다
- 03EditBridge는 노이즈에서 이미지를 새로 만드는 대신, 저해상도 편집 결과를 고해상도 정답 이미지로 옮겨가는 경로를 직접 학습하는 디퓨전 브리지를 사용해 원본 구조 정보를 끝까지 유지한다
- 04편집 안 된 영역은 원본 이미지에서 대응되는 정확한 위치만, 편집된 영역은 그 주변 작은 범위만 보도록 제한하는 프라이어 기반 희소 주의(PG-BSA)로 연산량을 크게 줄였다
- 052K에서 기존 초해상도 기반 방법 대비 3.6~8.4배 빠르고(4.08초), 4K 편집을 61초에 완료했으며, 사용자 평가에서도 디테일 보존·사실감·미적 완성도 모두 기존 방법보다 우수했다
무엇을 했나
- 고해상도 이미지 편집은 어텐션 연산이 이미지 크기의 제곱에 비례해 늘어나 메모리와 속도 문제로 대부분 1K 이하에서만 동작한다
- 저해상도 편집 후 초해상도로 키우는 기존 방식은 원본에 없는 디테일을 지어내거나(정보 발산) 텍스처가 뭉개지거나 과하게 날카로워지는(텍스처 열화) 문제가 있다
- EditBridge는 노이즈에서 이미지를 새로 만드는 대신, 저해상도 편집 결과를 고해상도 정답 이미지로 옮겨가는 경로를 직접 학습하는 디퓨전 브리지를 사용해 원본 구조 정보를 끝까지 유지한다
- 편집 안 된 영역은 원본 이미지에서 대응되는 정확한 위치만, 편집된 영역은 그 주변 작은 범위만 보도록 제한하는 프라이어 기반 희소 주의(PG-BSA)로 연산량을 크게 줄였다
- 2K에서 기존 초해상도 기반 방법 대비 3.6~8.4배 빠르고(4.08초), 4K 편집을 61초에 완료했으며, 사용자 평가에서도 디테일 보존·사실감·미적 완성도 모두 기존 방법보다 우수했다
| Method | Haar ↑ | mPSNR ↑ | mSSIM ↑ | mMSE ↓ | mLPIPS ↓ | Time (s) ↓ |
|---|---|---|---|---|---|---|
| 1K Resolution | ||||||
| Direct Inference | 0.3973 | 16.8078 | 0.7539 | 0.0549 | 0.4116 | 20.00 |
| DiT4SR [14] | 0.4127 | 14.5031 | 0.7092 | 0.0554 | 0.4818 | 28.47 |
| DiT-SR [9] | 0.4523 | 16.7152 | 0.7955 | 0.0430 | 0.4403 | 2.44 |
| PiSA-SR [32] | 0.4247 | 15.2115 | 0.7481 | 0.0486 | 0.4492 | 0.30 |
| TSD-SR [12] | 0.4127 | 15.3864 | 0.7531 | 0.0516 | 0.4628 | 0.42 |
| HiFlow [7] | 0.3012 | 11.6964 | 0.6489 | 0.1323 | 0.6012 | 5.12 |
| ScaleEdit [22] | 0.4824 | 16.8461 | 0.8206 | 0.0408 | 0.3784 | 181.20 |
| Ours | 0.4992 | 18.6536 | 0.8686 | 0.0369 | 0.3829 | 0.84 |
| 2K Resolution | ||||||
| Direct Inference | 0.2254 | 13.5262 | 0.7491 | 0.0880 | 0.6700 | 82.14 |
| DiT4SR [14] | 0.3806 | 15.1298 | 0.7468 | 0.0516 | 0.5348 | 113.32 |
| DiT-SR [9] | 0.4210 | 17.2430 | 0.8265 | 0.0423 | 0.4738 | 14.82 |
| PiSA-SR [32] | 0.4046 | 16.2433 | 0.8061 | 0.0446 | 0.4702 | 20.22 |
| TSD-SR [12] | 0.4046 | 16.2021 | 0.7952 | 0.0467 | 0.4910 | 34.20 |
| HiFlow [7] | 0.3144 | 13.9314 | 0.7377 | 0.0759 | 0.5113 | 33.11 |
| ScaleEdit [22] | 0.4583 | 16.5510 | 0.6818 | 0.0485 | 0.5197 | 662.50 |
| Ours | 0.4673 | 18.6366 | 0.8712 | 0.0377 | 0.3903 | 4.08 |
| 4K Resolution | ||||||
| Direct Inference | 0.2134 | 10.7086 | 0.5411 | 0.1281 | 0.7774 | 695.23 |
| DiT4SR [14] | 0.4002 | 20.2771 | 0.7535 | 0.0133 | 0.3510 | 533.83 |
| DiT-SR [9] | 0.4267 | 16.8615 | 0.6818 | 0.0415 | 0.5436 | 119.68 |
| PiSA-SR [32] | 0.4267 | 21.6200 | 0.7974 | 0.0108 | 0.2687 | 111.42 |
| TSD-SR [12] | 0.4124 | 22.2766 | 0.8035 | 0.0074 | 0.2399 | 108.72 |
| HiFlow [7] | 0.3307 | 14.4400 | 0.6719 | 0.0664 | 0.6038 | 129.30 |
| ScaleEdit [22] | 0.4116 | 18.5714 | 0.7638 | 0.0390 | 0.6015 | 3601.20 |
| Ours | 0.4279 | 24.1380 | 0.8347 | 0.0049 | 0.2112 | 61.10 |
| Setting | Method | HaarPSI↑ | mPSNR↑ | mSSIM↑ | mMSE↓ | mLPIPS↓ | Time (s)↓ |
|---|---|---|---|---|---|---|---|
| 1K | Ours | 0.499 | 18.653 | 0.868 | 0.036 | 0.382 | 0.84 |
| FullAttention | 0.539 | 19.080 | 0.857 | 0.030 | 0.599 | 0.73 | |
| 2K | Ours | 0.467 | 18.636 | 0.871 | 0.037 | 0.390 | 4.08 |
| FullAttention | 0.505 | 17.918 | 0.705 | 0.041 | 0.425 | 4.71 |
| Method | HaarPSI↑ | mPSNR↑ | mSSIM↑ | mMSE↓ | mLPIPS↓ | Time(s)↓ |
|---|---|---|---|---|---|---|
| 5 steps | 0.4131 | 15.7269 | 0.7763 | 0.0474 | 0.4739 | 4.03 |
| 10 steps | 0.4020 | 15.4190 | 0.7636 | 0.0494 | 0.4662 | 8.10 |
| Ours (1 step) | 0.4991 | 18.6535 | 0.8685 | 0.0368 | 0.3829 | 0.84 |
왜 중요한가
고해상도 이미지 편집은 사진 보정, 디자인 등 실무에서 필요하지만 지금까지는 속도와 원본 충실도 사이에서 타협해야 했다. 이 연구는 그 타협 없이 빠르면서도 원본에 충실한 4K 편집이 가능함을 보여줘, 실제 제품에 고해상도 편집 기능을 넣는 문턱을 낮춘다.
이 논문의 용어
- 디퓨전 브리지(Diffusion Bridge) · 무작위 노이즈가 아니라 시작 이미지와 목표 이미지 사이를 직접 잇는 방식으로 학습하는 생성 모델
- 초해상도(Super-Resolution) · 저해상도 이미지를 고해상도로 키우는 기술로, 없는 디테일을 새로 만들어내야 한다
- PG-BSA(Prior-Guided Block-wise Sparse Attention) · 원본과 대응되는 위치만 선택적으로 참고해 연산량을 줄이는 주의 메커니즘
- DiT(Diffusion Transformer) · 트랜스포머 구조를 사용하는 이미지 생성 모델의 한 종류
- LoRA(Low-Rank Adaptation) · 모델 전체를 다시 학습하지 않고 적은 파라미터만 추가로 학습해 미세조정하는 기법
본문에 싣지 못한 그림
- Figure 1: Motivation of the proposed method. (a) and (b) compare the standard high-resolution image editing paradigm with our approach. (c) analyzes the inherent limitations of existing methods.
- Figure 2: Overview of our proposed EditBridge. The upper section illustrates the inference process of the diffusion bridge, which transports the low-resolution edit to its high-resolution counterpart. The lower section details the construction of the correspondence prior and the proposed Prior-Guided Sparse Attention (PG-BSA) mechanism.
- Figure 3: Qualitative comparison at 1K resolution. Our method better preserves fidelity while enhancing visual clarity.
- Figure 4: Qualitative comparison at 2K resolution. Our method better preserves fidelity while enhancing visual clarity.
- Figure 5: Ablation of Attention Sparsity. Full attention leads to noticeable source-induced artifacts, whereas our sparse attention maintains superior visual fidelity and alignment.
- Figure 6: Impact of sampling steps. Perceptual quality and high-frequency details are maximized at T=1. Increasing the number of inference steps does not yield significant visual gains, further validating the efficiency of our refinement framework.
- Figure 7: Results of the user study across three dimensions: Detail Preservation, Realism, and Aesthetics. Our method consistently outperforms all baselines in human preference.
- Figure 8: Visual results at 1K resolution.
- Figure 9: Visual results at 2K resolution.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다