이미지를 뭉뚱그린 저해상도부터 또렷하게 살려내는 순서로 생성하도록 유도하면, 픽셀 단위 이미지 생성 AI가 더 적은 학습으로 더 좋은 결과를 낸다
이미지를 뭉뚱그린 저해상도부터 또렷하게 살려내는 순서로 생성하도록 유도하면, 픽셀 단위 이미지 생성 AI가 더 적은 학습으로 더 좋은 결과를 낸다
픽셀 공간에서 이미지를 직접 생성하는 AI는 노이즈에서 완성된 이미지로 한 번에 가는 경로를 배우는데, 이 논문은 그 경로의 도착점을 '흐릿한 저주파 이미지'에서 '완성 이미지'로 서서히 움직이게 바꿔 전체 구조를 먼저 그리고 세부를 나중에 그리도록 유도한다. 각 이미지마다 고주파(세부) 정보가 얼마나 부족한지 측정해서 그 이미지에 맞는 속도로 세부를 풀어주는 방식(에너지 기반 스케줄링)을 썼다. 그 결과 ImageNet 256×256 조건부 생성에서 더 적은 학습 반복(에폭)으로도 기존보다 낮은 FID(생성 품질 오차 지표, 낮을수록 좋음)를 얻었다.
METAL MEDIA 해설 도표
EG-FM: 도착점이 움직이는 생성 경로
증거 상태측정 결과가 보고됨
- 1. 고정 도착점(기존 방식)표준 플로우 매칭은 노이즈에서 항상 완성 이미지 x로 직선 이동하며, 저주파(구조)와 고주파(세부)를 동시에 학습해야 한다.
- 2. 저주파 초기 도착점 만들기heat-kernel 필터로 이미지를 흐리게 만든 저주파 버전을 t=0 시점의 도착점 y0로 설정한다.
- 3. 이미지별 에너지 격차 측정이미지마다 저주파 버전과 원본 사이의 부족한 고주파 에너지(스펙트럼 격차)를 측정해 회복 속도(heat-time)를 개인화한다.
- 4. 공통 시계로 동기화모든 이미지가 같은 시간 t에서 같은 비율만큼 세부를 회복하도록 스무더스텝 함수 기반의 공통 릴리스 클록을 적용한다.
- 5. 움직이는 도착점 + 재정의된 속도로 학습도착점이 계속 선명해지므로 학습 목표 속도도 '노이즈→현재 도착점' 속도와 '도착점 자체의 이동' 속도를 더해 재계산한다.
무엇을 했나
- 기존 플로우 매칭(노이즈와 완성 이미지를 잇는 직선 경로로 이미지를 생성하는 방식)은 도착점이 항상 완성된 이미지로 고정돼 있어, 전체 구조와 세부 디테일을 동시에 배워야 하는 부담이 있었다.
- 이 연구는 열전도 방정식에서 쓰이는 필터(heat-kernel)로 이미지를 흐리게 만든 버전을 초기 도착점으로 잡고, 시간이 지남에 따라 그 도착점이 점점 선명해져 결국 완성 이미지가 되도록 경로를 바꿨다.
- 이미지마다 원래 가진 고주파(세부 무늬·질감) 정보량이 다르므로, 각 이미지의 '부족한 고주파 에너지 총량'을 측정하고 모든 이미지가 같은 시간 t에서 같은 비율만큼 세부를 회복하도록 개인 맞춤형 스케줄(heat-time)을 계산했다.
- 도착점이 계속 움직이기 때문에 학습 목표 속도도 '노이즈에서 현재 도착점까지 가는 속도'와 '도착점 자체가 움직이는 속도' 두 가지를 더해 다시 정의했다.
- PixelDiT, DeCo, HyperDiT 세 가지 백본(기반 모델 구조)에 이 방법을 적용해 ImageNet 256×256과 512×512, 그리고 텍스트-이미지 생성 실험에서 성능을 측정했다.
| Method | Epochs | #Params | NFE | FID ↓ | sFID ↓ | IS ↑ | Precision ↑ | Recall ↑ |
|---|---|---|---|---|---|---|---|---|
| REPA (35) | 800 | 675M | 250×2 | 1.42 | 4.70 | 305.7 | 0.80 | 0.65 |
| DDT-XL (34) | 400 | 675M | – | 1.26 | – | 310.6 | 0.79 | 0.65 |
| RAE-XL (38) | 800 | 839M | – | 1.13 | – | 262.6 | 0.78 | 0.67 |
| PixelFlow-XL (4) | 320 | 677M | 120×2 | 1.98 | 5.83 | 282.1 | 0.81 | 0.60 |
| PixNerd-XL (33) | 320 | 700M | 100×2 | 1.93 | – | 298.0 | 0.80 | 0.60 |
| JiT-G (20) | 600 | 2.0B | 100×2 | 1.82 | – | 292.6 | 0.79 | 0.62 |
| PixelU-H/16 (10) | 600 | 1.17B | 100×2 | 1.63 | 5.04 | 305.9 | 0.79 | 0.64 |
| DiP-XL/16 (5) | 600 | 631M | 100×2 | 1.79 | 4.59 | 281.9 | 0.80 | 0.63 |
| FREPix-XL (21) | 320 | 674M | 100×2 | 1.91 | 4.59 | 295.6 | 0.79 | 0.62 |
| DeCo-XL/16 (26) | 600 | 682M | 100×2 | 1.69 | 4.59 | 304.0 | 0.79 | 0.63 |
| + Energy-Guided FM | 440 | 682M | 100×2 | 1.63 | 4.78 | 300.1 | 0.79 | 0.62 |
| HyperDiT-H (12) | 600 | 952M | 100×2 | 1.56 | 4.73 | 306.5 | 0.80 | 0.64 |
| + Energy-Guided FM | 220 | 952M | 100×2 | 1.51 | 4.31 | 293.4 | 0.78 | 0.64 |
| PixelDiT-XL (36) | 80 | 797M | 100×2 | 2.36 | 5.11 | 282.3 | 0.80 | 0.57 |
| PixelDiT-XL (36) | 320 | 797M | 100×2 | 1.61 | 4.68 | 292.7 | 0.78 | 0.64 |
| PixelDiT-XL (36) | 800 | 797M | 100×2 | 1.54 | 4.49 | 297.0 | 0.78 | 0.65 |
| + Energy-Guided FM | 80 | 797M | 100×2 | 1.99 | 5.09 | 280.8 | 0.81 | 0.61 |
| + Energy-Guided FM | 200 | 797M | 100×2 | 1.55 | 4.60 | 296.2 | 0.79 | 0.65 |
| + Energy-Guided FM | 600 | 797M | 100×2 | 1.45 | 4.41 | 299.6 | 0.78 | 0.65 |

| Method | Epochs | Params | FID ↓ | IS ↑ |
|---|---|---|---|---|
| DiT-XL/2 | 600 | 675M | 3.04 | 240.8 |
| SiT-XL/2 | 600 | 675M | 2.62 | 252.2 |
| REPA | 200 | 675M | 2.08 | 274.6 |
| PixNerd-XL† | 320 | 700M | 2.84 | 245.6 |
| JiT-H | 600 | 956M | 1.94 | 309.1 |
| PixelU-H/32 | 600 | 1.2B | 1.92 | 322.1 |
| DiP-XL/32 | - | 631M | 2.31 | 291.7 |
| DeCo-XL/16† | 340 | 682M | 2.22 | 290.0 |
| PixelDiT-XL† | 850 | 797M | 1.81 | 278.6 |
| + EG-FM† | 240 | 797M | 1.68 | 295.5 |
| HyperDiT-H + EG-FM† | 260 | 952M | 1.58 | 285.0 |

| Method | Epochs | #Params | NFE | FID ↓ | sFID ↓ | IS ↑ | Precision ↑ | Recall ↑ |
|---|---|---|---|---|---|---|---|---|
| DiT-XL/2 | 600 | 675M | 250×2 | 3.04 | 5.02 | 240.8 | 0.84 | 0.54 |
| SiT-XL/2 | 600 | 675M | 250×2 | 2.62 | 4.18 | 252.2 | 0.84 | 0.57 |
| REPA | 200 | 675M | 250×2 | 2.08 | 4.19 | 274.6 | 0.83 | 0.58 |
| PixNerd-XL† | 320 | 700M | 100×2 | 2.84 | 5.95 | 245.6 | 0.80 | 0.59 |
| JiT-H | 600 | 956M | 100×2 | 1.94 | – | 309.1 | – | – |
| PixelU-H/32 | 600 | 1.2B | 100×2 | 1.92 | 5.98 | 322.1 | 0.80 | 0.58 |
| DiP-XL/32 | – | 631M | 100×2 | 2.31 | 4.48 | 291.7 | 0.84 | 0.58 |
| DeCo-XL/16† | 340 | 682M | 100×2 | 2.22 | 4.67 | 290.0 | 0.80 | 0.60 |
| PixelDiT-XL† | 850 | 797M | 100×2 | 1.81 | 5.61 | 278.6 | 0.78 | 0.67 |
| + EG-FM† | 240 | 797M | 100×2 | 1.68 | 4.77 | 295.5 | 0.79 | 0.63 |
| HyperDiT-H + EG-FM† | 260 | 952M | 100×2 | 1.58 | 4.90 | 285.0 | 0.79 | 0.64 |

| Method | #Params | Single obj. | Two obj. | Counting | Colors | Position | Color attr. | Overall ↑ |
|---|---|---|---|---|---|---|---|---|
| PixArt-α | 0.6B | 0.98 | 0.50 | 0.44 | 0.80 | 0.08 | 0.07 | 0.48 |
| SD3 | 8B | 0.98 | 0.84 | 0.66 | 0.74 | 0.40 | 0.43 | 0.68 |
| FLUX.1-dev | 12B | 0.99 | 0.81 | 0.79 | 0.74 | 0.20 | 0.47 | 0.67 |
| DALL-E 3 | – | 0.96 | 0.87 | 0.47 | 0.83 | 0.43 | 0.45 | 0.67 |
| BLIP3o | 4B | – | – | – | – | – | – | 0.81 |
| OmniGen2 | 4B | 1.00 | 0.95 | 0.64 | 0.88 | 0.55 | 0.76 | 0.80 |
| PixelFlow | 0.9B | – | – | – | – | – | – | 0.60 |
| PixNerd | 1.2B | 0.97 | 0.86 | 0.44 | 0.83 | 0.71 | 0.53 | 0.73 |
| DeCo-XXL/16 | 1.1B | 1.00 | 0.92 | 0.72 | 0.91 | 0.80 | 0.79 | 0.86 |
| PixelDiT-T2I | 1.3B | 1.00 | 0.94 | 0.70 | 0.90 | 0.53 | 0.65 | 0.78 |
| EG-FM-T2I | 1.3B | 1.00 | 0.95 | 0.74 | 0.92 | 0.72 | 0.77 | 0.85 |
| Method | #Params | Global | Entity | Attribute | Relation | Other | Overall ↑ |
|---|---|---|---|---|---|---|---|
| PixArt-α | 0.6B | 81.7 | 80.1 | 80.4 | 81.7 | 76.5 | 71.6 |
| PixArt-Σ | 0.6B | 87.5 | 87.1 | 86.5 | 84.0 | 86.1 | 79.5 |
| PixelFlow | 0.9B | – | – | – | – | – | 77.9 |
| PixNerd | 1.2B | 80.5 | 87.9 | 87.2 | 91.3 | 72.8 | 80.9 |
| DeCo-XXL/16 | 1.1B | – | – | – | – | – | 81.4 |
| PixelDiT-T2I | 1.3B | 88.0 | 90.9 | 87.6 | 89.8 | 88.5 | 83.7 |
| EG-FM-T2I | 1.3B | 89.3 | 89.2 | 90.2 | 90.9 | 89.7 | 83.9 |

| Backbone | Path | Res. | Batch | GFLOPs | ΔGFLOPs | FLOPs inc. | Time/step | Time inc. | Epoch time |
|---|---|---|---|---|---|---|---|---|---|
| DeCo-XL/16 | Standard FM | 2562 | 256 | 734.81 | 0.00 | 0.00 | 0.10 | 0.00 | 0.14 |
| DeCo-XL/16 | EG-FM | 2562 | 256 | 734.86 | 0.06 | +0.01 | 0.10 | +0.41 | 0.14 |
| PixelDiT-B/16 | Standard FM | 2562 | 256 | 226.29 | 0.00 | 0.00 | 0.04 | 0.00 | 0.06 |
| PixelDiT-B/16 | EG-FM | 2562 | 256 | 226.34 | 0.06 | +0.03 | 0.04 | +4.81 | 0.06 |
| PixelDiT-L/16 | Standard FM | 2562 | 256 | 683.30 | 0.00 | 0.00 | 0.09 | 0.00 | 0.12 |
| PixelDiT-L/16 | EG-FM | 2562 | 256 | 683.36 | 0.06 | +0.01 | 0.09 | +0.51 | 0.12 |
| PixelDiT-XL/16 | Standard FM | 2562 | 256 | 933.58 | 0.00 | 0.00 | 0.11 | 0.00 | 0.15 |
| PixelDiT-XL/16 | EG-FM | 2562 | 256 | 933.64 | 0.06 | +0.01 | 0.11 | +0.99 | 0.15 |
| PixelDiT-XL/16 | Standard FM | 5122 | 64 | 4056.72 | 0.00 | 0.00 | 0.12 | 0.00 | 0.66 |
| PixelDiT-XL/16 | EG-FM | 5122 | 64 | 4056.98 | 0.26 | +0.01 | 0.12 | +0.92 | 0.66 |

실제로 확인된 결과
- ImageNet 256×256 조건부 생성에서 PixelDiT-XL 기준 80에폭 만에 FID를 2.36에서 1.99로 낮췄고, 200에폭에 1.55로 320에폭 기준선 결과 1.61을 이미 넘어섰으며, 600에폭에서는 1.45까지 개선됐다.
- 같은 실험에서 DeCo-XL/16은 440에폭에 FID 1.63을 기록해 600에폭 기준선의 1.69보다 낮았고, HyperDiT-H는 220에폭에 1.51을 기록해 600에폭 기준선의 1.56보다 낮았다.
- ImageNet 512×512에서는 256×256 체크포인트에서 이어 40에폭만 추가 학습해 PixelDiT가 FID 1.68·Inception Score 295.5를 기록했고(기존 방식은 530에폭 더 학습해 FID 1.81·IS 278.6), HyperDiT는 FID 1.58로 비교 대상 중 가장 좋았다.
- 텍스트-이미지 생성에서는 PixelDiT-T2I 대비 GenEval 점수가 0.78에서 0.85로 오르고 DPG-Bench 점수도 0.2점 올라 83.9를 기록했으며, DPG-Bench에서는 비교 대상 중 최고 점수, GenEval에서는 DeCo-XXL/16에 0.01점 차 2위를 기록했다.
- 학습 비용 측면에서는 샘플당 추가 연산량 증가가 최대 0.0256%에 불과했고, 학습 단계별 시간 증가도 대부분 1% 이내(PixelDiT-B/16만 4.81%)였으며 추론 단계에서는 별도 연산이 필요 없어 속도·연산량 변화가 없었다.
어디에 쓸 수 있나
- 잠재공간 압축 없이 픽셀 단위로 직접 고해상도 이미지를 생성하는 모델의 학습 효율과 최종 품질을 개선하려는 연구 및 서비스
- 이미 학습된 저해상도(256×256) 모델을 적은 추가 학습만으로 고해상도(512×512)로 확장하려는 상황
- 텍스트를 조건으로 하는 이미지 생성 모델에서 객체 구성과 세부 프롬프트 반응성을 함께 개선하려는 경우
한계와 남은 검증
- 텍스트-이미지 동시 모델링, 영상 생성, 로봇 등 행동 결정처럼 시간축이 있는 이질적 신호에는 아직 적용·검증되지 않았다.
- Flux나 Qwen-Image급의 초대형 최신 파운데이션 모델 백본에 대해서는 아직 테스트되지 않았다.
- 속도(velocity) 예측 방식에서는 효과가 크지만, 완성 이미지를 직접 예측하는 x-prediction 방식(JiT)에서는 FID가 2.37에서 2.33으로 개선 폭이 작아, 초기 예측이 불안정할 때 이미지별 맞춤 스케줄이 제대로 작동하지 않는 한계가 있다.
- 평가에 사용한 FID 수치는 ADM 평가 도구 기준이며, torch-fidelity 등 다른 평가 도구를 쓰면 절대값이 0.02~0.06 정도 달라질 수 있다.
- 실험은 ImageNet 클래스 조건부 생성과 특정 텍스트-이미지 데이터셋(BLIP3o)에 한정되어 있어, 다른 도메인 데이터에 대한 일반화는 추가 검증이 필요하다.
왜 중요한가
이 방법은 모델 구조나 학습 데이터를 바꾸지 않고 생성 경로만 재설계해 학습 비용을 거의 늘리지 않으면서 학습 속도와 품질을 함께 개선한다. 픽셀 단위로 직접 이미지를 만드는 시스템(잠재공간 압축 없이 세부를 보존하려는 최신 생성 모델들)을 개발하는 실무자에게 학습 효율을 높이는 실질적인 대안이 될 수 있다.
이 논문의 용어
- 플로우 매칭(Flow Matching) · 노이즈에서 목표 이미지로 이어지는 경로를 학습해 이미지를 생성하는 방식
- FID · 생성된 이미지 분포와 실제 이미지 분포가 얼마나 다른지 재는 지표, 낮을수록 좋음
- heat-kernel(열핵) · 열이 퍼지는 방정식에서 유래한 필터로, 이미지를 부드럽게(저주파만 남게) 만드는 데 쓰임
- 저주파/고주파 성분 · 이미지에서 전체적인 형태(저주파)와 세밀한 무늬·질감(고주파)을 주파수로 구분한 것
- CFG(Classifier-Free Guidance) 스케일 · 조건(클래스나 텍스트)을 얼마나 강하게 반영할지 조절하는 생성 시 설정값
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Haoyang Tong et al., arXiv:2608.05811, arxiv-nonexclusive