AI · Deep Learning · Computer Vision · 생성형 AI

DDPM에서 Latent Diffusion과 DiT까지

2026-08-01 · 수정 2026-08-01 · Hyeongrok Ryu

Forward noise, reverse denoising, latent space와 Transformer backbone을 한 흐름으로 정리한 기록.

Series
2025 생성모델 집중과정 · 5
유형 / 난이도
study-note · advanced
Tools
Python, PyTorch
01Forward process

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

02Reverse process

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

03Noise prediction 학습

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

04Latent Diffusion과 DiT

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

이 글의 목차에서 자동으로 만든 개념 흐름도입니다.

Forward process

깨끗한 (x_0)에 작은 Gaussian noise를 반복해 (x_T)를 단순한 분포에 가깝게 만든다.

Gaussian noise를 더하는 forward 과정과 학습한 reverse denoising 과정
pixel space와 latent space에서 같은 denoising 아이디어가 어떻게 쓰이는지 비교했다.

Reverse process

생성은 noise에서 시작해 (T)에서 0까지 이동한다. 각 단계에서 모델이 분포의 mean이나 noise를 예측해 조금 더 깨끗한 sample을 만든다.

Noise prediction 학습

학습 때는 무작위 timestep을 고르고, 누적 계수로 (x_t)를 바로 만든 뒤 실제로 더한 ε과 모델 예측을 비교한다. sampling은 모든 timestep을 순서대로 거치므로 학습 한 step보다 오래 걸린다.

Latent Diffusion과 DiT

Latent Diffusion은 Autoencoder로 이미지를 압축한 공간에서 denoise하고 decoder로 복원한다. DiT는 같은 latent diffusion 문제에서 U-Net 대신 latent patch를 처리하는 Transformer를 쓴다.

다시 실행할 순서

강의 Notebook에는 코드만 있고 출력 Cell은 비어 있었다. 먼저 FashionMNIST DDPM의 Tensor shape와 sampling loop를 확인하고, 그다음 encoder·decoder가 추가되는 latent diffusion으로 확장할 예정이다.

사용한 자료

논문 첫 페이지 미리보기