AI · Deep Learning · Computer Vision · 생성형 AI
Autoregressive Factorization과 MLE
2026-08-01 · 수정 2026-08-01 · Hyeongrok Ryu
결합확률을 순서대로 풀고 teacher forcing, log-likelihood, cross entropy를 연결한 기록.
- Series
- 2025 생성모델 집중과정 · 2
- 유형 / 난이도
- study-note · intermediate
- Tools
- Python, PyTorch
01결합확률 나누기
이 글에서 순서대로 다시 확인하는 학습 포인트입니다.
02학습과 생성의 입력
이 글에서 순서대로 다시 확인하는 학습 포인트입니다.
03MLE를 loss로 바꾸기
이 글에서 순서대로 다시 확인하는 학습 포인트입니다.
04코드에서 확인
이 글에서 순서대로 다시 확인하는 학습 포인트입니다.
결합확률 나누기
| (p(x_1,ldots,x_T)=\prod_t p(x_t | x_{<t}))로 쓰면 다음 값 예측을 반복해 전체 표본을 만들 수 있다. |
학습과 생성의 입력
학습에서는 정답 prefix를 넣는 teacher forcing이 가능하다. 생성에서는 모델이 방금 뽑은 값을 다시 넣으므로 초기 오류가 누적될 수 있다. causal mask는 미래 token을 미리 보는 것을 막는다.
MLE를 loss로 바꾸기
Likelihood의 곱에 log를 취하면 합이 된다. 최대화 식에 음수를 붙여 최소화하면 NLL이 된다. class index를 정답으로 쓰는 cross entropy는 정답 class의 log probability를 고르는 같은 계산이다.
코드에서 확인
입력과 target을 한 칸 밀고, output logits의 마지막 축이 vocabulary인지 확인했다. padding token까지 loss에 들어가지 않도록 mask도 함께 봤다.
남은 비용
순차 sampling은 긴 sequence에서 느리다. 이 한계가 병렬 latent-variable 모델과 diffusion sampling을 비교하게 만든다.
사용한 자료
- Pixel Recurrent Neural Networks — paper; autoregressive image factorization