AI · Deep Learning · Computer Vision · 생성형 AI

Autoregressive Factorization과 MLE

2026-08-01 · 수정 2026-08-01 · Hyeongrok Ryu

결합확률을 순서대로 풀고 teacher forcing, log-likelihood, cross entropy를 연결한 기록.

Series
2025 생성모델 집중과정 · 2
유형 / 난이도
study-note · intermediate
Tools
Python, PyTorch
01결합확률 나누기

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

02학습과 생성의 입력

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

03MLE를 loss로 바꾸기

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

04코드에서 확인

이 글에서 순서대로 다시 확인하는 학습 포인트입니다.

이 글의 목차에서 자동으로 만든 개념 흐름도입니다.

결합확률 나누기

(p(x_1,ldots,x_T)=\prod_t p(x_t x_{<t}))로 쓰면 다음 값 예측을 반복해 전체 표본을 만들 수 있다.
조건부확률을 순서대로 예측하고 Negative Log-Likelihood를 합하는 흐름
확률의 chain rule과 실제 loss 계산을 한 줄로 연결했다.

학습과 생성의 입력

학습에서는 정답 prefix를 넣는 teacher forcing이 가능하다. 생성에서는 모델이 방금 뽑은 값을 다시 넣으므로 초기 오류가 누적될 수 있다. causal mask는 미래 token을 미리 보는 것을 막는다.

MLE를 loss로 바꾸기

Likelihood의 곱에 log를 취하면 합이 된다. 최대화 식에 음수를 붙여 최소화하면 NLL이 된다. class index를 정답으로 쓰는 cross entropy는 정답 class의 log probability를 고르는 같은 계산이다.

코드에서 확인

입력과 target을 한 칸 밀고, output logits의 마지막 축이 vocabulary인지 확인했다. padding token까지 loss에 들어가지 않도록 mask도 함께 봤다.

남은 비용

순차 sampling은 긴 sequence에서 느리다. 이 한계가 병렬 latent-variable 모델과 diffusion sampling을 비교하게 만든다.

사용한 자료

논문 첫 페이지 미리보기