이미지 노이즈 제거 GAN에서 채널끼리 정보를 나누게 했더니 성능이 올랐다
이미지 노이즈 제거 GAN에서 채널끼리 정보를 나누게 했더니 성능이 올랐다
이 연구는 이미지 잡음 제거용 GAN(생성 모델과 판별 모델이 경쟁하며 학습하는 방식)에서 쓰이던 SVD(특이값 분해, 행렬을 압축·정리하는 선형대수 기법) 기반 필터를 텐서 트레인(양자 다체계 시뮬레이션에서 쓰이던 기법)으로 바꾼 TT-Net을 제안한다. 기존 SVD-Net은 채널마다 따로따로 정보를 걸러내 채널 간 관계를 전혀 보지 못했지만, TT-Net은 두 단계 분해를 통해 채널을 서로 비교하며 정보를 거른다. CIFAR-10 이미지에 가우시안 잡음, 모션 블러, 소금-후추 잡음을 입혀 실험한 결과 TT-Net이 세 가지 잡음 모두에서 SVD-Net보다 화질 지표(PSNR, SSIM)가 높았다.
METAL MEDIA 해설 도표
이미지 노이즈 제거 GAN에서 채널끼리 정보를 나누게 했더니 성능이 올랐다
- 01기존 SVD-Net은 특징 맵의 채널마다 따로 SVD를 적용해 채널끼리 비교가 불가능했던 반면, TT-Net은 두 번의 분해(2-cut 텐서 트레인)로 채널 간 정보를 함께 활용한다
- 02동일한 생성기/판별기 구조, 동일한 학습 조건에서 잡음 제거 블록만 SVD에서 텐서 트레인으로 바꿔 비교했다
- 03가우시안 잡음 기준 PSNR 2.68dB, SSIM 0.0513 향상, 모션 블러는 PSNR 8.32dB, SSIM 0.3798 향상, 소금-후추 잡음은 PSNR 0.99dB, SSIM 0.0165 향상을 SVD-Net 대비 기록했다
- 04가우시안 잡음에서는 TT-Net이 비교 대상이었던 EigenGAN과 최신 기법 Pix2pix보다도 더 높은 PSNR·SSIM을 기록했다
- 05TT-Net은 학습이 진행되면서 판별기를 속이려는 손실(적대적 손실)이 일찍 정체되는데도 복원 품질은 계속 좋아지는 현상이 관찰되어, 적대적 학습이 실제로 얼마나 기여하는지에 대한 열린 질문을 남겼다
무엇을 했나
- 기존 SVD-Net은 특징 맵의 채널마다 따로 SVD를 적용해 채널끼리 비교가 불가능했던 반면, TT-Net은 두 번의 분해(2-cut 텐서 트레인)로 채널 간 정보를 함께 활용한다
- 동일한 생성기/판별기 구조, 동일한 학습 조건에서 잡음 제거 블록만 SVD에서 텐서 트레인으로 바꿔 비교했다
- 가우시안 잡음 기준 PSNR 2.68dB, SSIM 0.0513 향상, 모션 블러는 PSNR 8.32dB, SSIM 0.3798 향상, 소금-후추 잡음은 PSNR 0.99dB, SSIM 0.0165 향상을 SVD-Net 대비 기록했다
- 가우시안 잡음에서는 TT-Net이 비교 대상이었던 EigenGAN과 최신 기법 Pix2pix보다도 더 높은 PSNR·SSIM을 기록했다
- TT-Net은 학습이 진행되면서 판별기를 속이려는 손실(적대적 손실)이 일찍 정체되는데도 복원 품질은 계속 좋아지는 현상이 관찰되어, 적대적 학습이 실제로 얼마나 기여하는지에 대한 열린 질문을 남겼다


| Insertion point | Channels | Height | Width |
|---|---|---|---|
| After 1st encoder stage | 64 | 32 | 32 |
| After 2nd encoder stage | 128 | 16 | 16 |
| After 3rd encoder stage | 256 | 8 | 8 |


| Model | lr (G, D) | β1 | β2 | Optimizer |
|---|---|---|---|---|
| Pix2pix | 2×10−4 | 0.5 | 0.999 | Adam |
| EigenGAN | 2×10−3 | 0.5 | 0.999 | Adam |
| SVD-Net | 1×10−4 | 0.9 | 0.999 | Adam |
| TT-Net | 1×10−4 | 0.9 | 0.999 | Adam |


| Gaussian | Motion Blur | Salt & Pepper | ||||
|---|---|---|---|---|---|---|
| Model | PSNR | SSIM | PSNR | SSIM | PSNR | SSIM |
| Pix2pix | 25.52 | 0.7466 | 36.18 | 0.9643 | 41.79 | 0.9881 |
| EigenGAN | 25.18 | 0.7545 | 26.71 | 0.8398 | 34.24 | 0.9513 |
| SVD-Net | 23.60 | 0.7455 | 18.02† | 0.4260† | 28.98 | 0.8761 |
| TT-Net | 26.28 | 0.7968 | 26.34 | 0.8058 | 29.97 | 0.8926 |

왜 중요한가
잡음 제거처럼 이미지 품질을 다루는 실무에서, 채널 간 정보를 활용하는 간단한 구조 변경만으로 성능이 개선될 수 있음을 보여준다. 또한 양자 컴퓨팅 시뮬레이션에서 쓰이던 텐서 네트워크 기법이 실제 딥러닝 응용에 실용적으로 쓰일 수 있다는 사례를 제시한다.
이 논문의 용어
- 텐서 트레인(Tensor Train) · 다차원 배열(텐서)을 여러 개의 작은 행렬 곱으로 쪼개어 표현하는 방법. 양자물리학에서는 행렬곱상태(MPS)라 불림
- SVD(특이값 분해) · 행렬을 세 개의 간단한 행렬 곱으로 나눠 중요한 정보만 남기고 압축하는 선형대수 기법
- GAN(생성적 적대 신경망) · 가짜 이미지를 만드는 생성기와 진짜/가짜를 구분하는 판별기가 서로 경쟁하며 학습하는 모델 구조
- PSNR/SSIM · 이미지 복원 품질을 재는 지표로, 값이 클수록 원본과 더 비슷함을 의미
- 판별기 붕괴(discriminator collapse) · 학습 도중 판별기가 생성기를 압도해버려 생성 결과 품질이 갑자기 무너지는 현상
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Michal A. Sterzel et al., arXiv:2608.19789, CC BY 4.0