-
โ๏ธ Computer VIsion - Szeliski 5์ฅ โ๏ธ๐ฎ ์ด๊ฒ์ ๊ฒ ๊ณต๋ถ/โ๏ธ Computer Vision - Szeliski 2026. 2. 13. 20:17
5.4 Convolutional newral networks
5.4.7 Self-supervised learning
ํ๋์ ์์ ์ ์ํด ๋ฐฑ๋ณธ ๋คํธ์ํฌ๋ฅผ pre-trainํด๋๊ณ , ๋ง์ง๋ง ๋ช ์ธต์ ๋ค๋ฅธ ์์ ์ ๋ง๋ ์๋ก์ด ํค๋๋ก ๊ต์ฒดํ ๋ค์ ๊ทธ ๋ถ๋ถ์ ํ์ต์ํค๋ ๋ฐฉ์์ ๋งค์ฐ ํํ๋ค.
๊ฒฝ์ฐ์ ๋ฐ๋ผ์๋ ์๋ ๋ฐฑ๋ณธ ๋คํธ์ํฌ์ ๋ง์ง๋ง ๋ช ๊ฐ ์ธต์ fine-tuningํ ์ ์๋ค.
transfer learning(์ ์ดํ์ต) : ํ ์์ ์์ ํ์ตํ ๋ด์ฉ์ ๋ค๋ฅธ ์์ ์ ํ์ฉํ๋ ์์ด๋์ด์ด๋ค.
domain adaptation(๋๋ฉ์ธ ์ ์) : ์ต์ข ์ ์ผ๋ก ์ ์ฉํ๋ ค๋ ์ฉ๋์ ๋ฐ์ดํฐ์ ํต๊ณ์ ํน์ฑ์ ๋ง๊ฒ ๋คํธ์ํฌ์ ๋ง์ง๋ง ๋ถ๋ถ์ ์์ , ์กฐ์ ํ๋ ๊ณผ์ ์ด๋ค.
์ด๋ฌํ ์ ๊ทผ์ ์๋ labeled dataset์ผ๋ก ๋ฐฑ๋ณธ์ ํ์ต์ํค๋ fully supervised ๋ฐฉ์์ผ๋ก ํ์ต๋ ๋ฐฑ๋ณธ์ ์ ์ฉ๋์๋ค.
ํ์ง๋ง unlabeled ํ์ค ์ธ๊ณ ์ด๋ฏธ์ง๊ฐ ํจ์ฌ ๋ง์ด ์กด์ฌํ๋ฏ๋ก, ์ด๋ฐ unlabeled ๋๊ท๋ชจ ์ด๋ฏธ์ง๋ก pre-trainingํ ์ ์๋ค๋ฉด ๋งค์ฐ ์ข์ ๊ฒ์ด๋ค.
self-supervised learning์ unlabeled ์ด๋ฏธ์ง๋ก๋ถํฐ ๋ผ๋ฒจ์ ์๋์ผ๋ก ๋ง๋ค์ด๋ผ ์ ์๋ superbised learning ํํ์ pretext task๋ฅผ ๋ง๋ ๋ค.
pre-training์ ๋๋ธ ๋ค์๋, ๋คํธ์ํฌ๋ฅผ ์ต์ข ์ ์ผ๋ก ํ๊ณ ์ถ์ downstream ๊ณผ์ ์ ๋ง๊ฒ ์์ ํ๊ณ fine-tuningํ ์ ์๋ค.
[image classification ๋คํธ์ํฌ๋ฅผ pre-trainingํ๊ธฐ ์ํด ์ ์๋ pretext task]
Context prediction : ์๋ก ๊ฐ๊น์ด ์ด๋ฏธ์ง ํจ์น๋ค์ ๊ฐ์ ธ์์, ๊ทธ๋ค ์ฌ์ด์ ์๋์ ์ธ ์์น๋ฅผ ์์ธกํ๋ค.
Context encoders : ์ด๋ฏธ์ง์์ ํ๋ ์ด์์ ๋๋ฝ๋ ์์ญ์ inpainting์ผ๋ก ์ฑ์ด๋ค
9-ํ์ผ ์ง์ ํผ์ฆ : ํ์ผ๋ค์ ์ฌ๋ฐ๋ฅธ ์์น๋ก ๋ค์ ๋ฐฐ์ดํ๋ค.
ํ๋ฐฑ ์ด๋ฏธ์ง ์ปฌ๋ฌํ
90๋ ๋จ์ ํ์ ๋ณต์ : ์ด๋ฏธ์ง๋ฅผ 90๋์ ๋ฐฐ์๋ก ํ์ ์ํจ ๋ค, ์ฌ๋ฐ๋ฅด๊ฒ ๋๋ฐ๋ก ์ธ์ฐ๋(ํ์ ๊ฐ๋๋ฅผ ๋งํ๋) ์์ ์ ํ๋ค.
๋จ์ผ ์ด๋ฏธ์ง ๊ธฐ๋ฐ pretext ๊ณผ์ ๋ฅผ ์ฐ๋ ๊ฒ ์ธ์๋, ์ฐ์ ํ๋ ์์ด ์๋ฏธ์ ์ผ๋ก ๊ด๋ จ๋ ๋ด์ฉ์ ๋ด๊ณ ์๋ ๋น๋์ค ํด๋ฆฝ์ ํ์ฉํด ์๋ค.
๋น๋์ค ํ๋ ์๋ค์ ์๊ฐ ์์๋๋ก ์ฌ๋ฐ๋ฅด๊ฒ ์ ๋ ฌํ๋ ๊ฒ์ผ๋ก, ์ฆ context prediction๊ณผ ์ง์ ํผ์ฆ์ temporal(์๊ฐ์ ) ๋ฒ์ ์ ์ฌ์ฉํ๋ ๋ฐฉ๋ฒ์ด ์๋ค.
๋ ๋ค๋ฅธ ๋ฐฉ๋ฒ์ผ๋ก ์ปฌ๋ฌํ๋ฅผ ๋น๋์ค๋ก ํ์ฅํ๋ ๊ฒ์ผ๋ก, ์ฒซ ๋ฒ์จฐ ํ๋ ์์ ์์์ ์ฃผ๊ณ ๊ทธ ์ ๋ณด๋ฅผ ์ด์ฉํด ๋๋จธ์ง๋ฅผ ์ฒ๋ฆฌํ๋ ๋ฐฉ์์ด๋ค.
์ด๋ ๋คํธ์ํฌ๊ฐ semantic categoreis์ correspondences๋ฅผ ํ์ตํ๋๋ก ์ ๋ํ๋ค.
๋น๋์ค๋ ๋ณดํต ์๋ฆฌ(์ค๋์ค)๋ฅผ ํจ๊ป ํฌํจํ๋ฏ๋ก, ์ด๋ฅผ self-supervised learning์์ ์ถ๊ฐ์ ์ผ๋ก ํ์ฉํ ์ ์๋ค.
์) ๋คํธ์ํฌ๊ฐ ์๊ฐ ์ ํธ์ ์ฒญ๊ฐ ์ ํธ๋ฅผ ์๋ก ์ ๋ ฌํ๋๋ก ์๊ตฌํ๋ ๋ฐฉ์์ผ๋ก ์ฌ์ฉํ ์ ์๋ค.
์) unsupervised (contrastive(๋์กฐํ์ต)) ํ๋ ์์ํฌ์์ ์ด๋ฅผ ํ์ฉํ๋ ๋ฐฉ๋ฒ๋ ์๋ค.
semi-supervised learning ์์คํ ์ pretext task๋ฅผ ์ํด ์ ๋ต(ground truth) ๋ผ๋ฒจ์ ์๋์ผ๋ก ์์ฑํ์ฌ, ์ด๋ฅผ supervised learning ๋ฐฉ์์ผ๋ก ์ฌ์ฉํ ์ ์๊ฒ ํ๋ค.
contrastive / metric learning : ๋ค๋ฅธ ๋์์ผ๋ก๋, contrastive loss๋ ๋ค๋ฅธ ranking loss๋ฅผ ์ฌ์ฉํด unsupervised learning์ ์ํํ๋ ๋ฐฉ๋ฒ์ด ์๋ค.
์๋ฏธ์ ์ผ๋ก ๋น์ทํ ์ ๋ ฅ๋ค์ด ๋น์ทํ ์ธ์ฝ๋ฉ(ํํ)์ ๋ง๋ค๋๋ก ์ ๋ํ๊ณ , ๋ฐ๋๋ก ์๋ก ๋ค๋ฅธ ์ ๋ ฅ๋ค์ ํํ ๊ณต๊ฐ์์ ๋ ๋ฉ์ด์ง๋๋ก ๋ฒ๋ ค ๋๋ ๊ฒ์ด๋ค.
๋คํธ์ํฌ๊ฐ ๊ฐ instance(๊ฐ ํ์ต ์์ )์ ๋ํด ๋ณ๋์ embedding์ ์์ฑํ๋๋ก ํ์ต์ํค๋ฉฐ, ์ ์ํ์ด ํ์ต ์ค์ธ ์ ๊ฒฝ๋ง์ ํต๊ณผํ ๋๋ง๋ค ๊ทธ embedding์ moving average memory bank์ ์ ์ฅํ๋ค.
๊ทธ๋ค์ embedding ๊ณต๊ฐ์์์ nearest neighbors๋ฅผ ์ด์ฉํด ์๋ก์ด ์ด๋ฏธ์ง๋ฅผ ๋ถ๋ฅํ๋ค.
Momemtum Contrast(MoCo)๋ ์ด memory bank๋ฅผ, ์๊ฐ์ ๋ฐ๋ผ ์กฐ์ ๋๋ momentum encoder๋ฅผ ํตํด ์ธ์ฝ๋ฉ๋ ์ํ๋ค์ ๋ด๋ ๊ณ ์ ๊ธธ์ด queue๋ก ๋์ฒดํ๋ค.
์ด momentum encoder๋ ์ค์ ๋ก ํ์ต๋๋ ๋คํธ์ํฌ์๋ ๋ถ๋ฆฌ๋ ๋ณ๋์ ์ธ์ฝ๋์ด๋ค.
Pretext-Invariant Representation Learning(PIRL)์ pretext task์ multi-crop data augmentation๊ณผ ํจ๊ผ ๋ฐฐ์น ๋ด ๊ฐ ์ํ๊ณผ ๋ฐฐ์น์ ๋ค๋ฅธ ๋ชจ๋ ์ํ ์ฌ์ด์ contrasive loss(normalized temperature cross-entorpy)์ ์ ์ฉํ๋ค.
MoCo v2๋ MoCo์ SimCLR์ ์์ด๋์ด๋ฅผ ๊ฒฐํฉํด ๋ ์ข์ ๊ฒฐ๊ณผ๋ฅผ ์ป๋๋ค.
๋ํ ์์ฑ๋ embedding์ ์ง์ ๋น๊ตํ๊ธฐ๋ณด๋ค๋ ๋จผ์ fully connected network(MLP)๋ฅผ ํ ๋ฒ ์ ์ฉํ ๋ค์ ๋น๊ตํ๋ค.
contrastive loss๋ metric learning์์ ์ ์ฉํ ๋๊ตฌ๋ก ์๋ฏธ์ ์ผ๋ก ๊ด๋ จ๋ ์ ๋ ฅ๋ค์ ๋ํด์๋ embedding space์์ ๊ฑฐ๋ฆฌ๊ฐ ์์์ง๋๋ก ์ ๋ํ๋ค.
์ด์ ๋ํ ๋์์ผ๋ก deep clustering์ ์ด์ฉํ์ฌ, ๊ด๋ จ๋ ์ ๋ ฅ๋ค์ด ์ ์ฌํ ์ถ๋ ฅ์ ๋ด๋๋ก ์ ๋ํ๋ ๋ฐฉ๋ฒ์ด ์๋ค.
์๋ฏธ์ ์ผ๋ก ๋น์ทํ ์ ๋ ฅ๋ค๋ผ๋ฆฌ์ ์ ์ฌ์ฑ๋ง ๊ฐ์ ํ๋ representation learning๋ ์ ์๋ํ๋ค.
contrastive learning์ฒ๋ผ negative ์์ด ์์ผ๋ฉด, ํํ์ด ๋ชจ๋ ์ ๋ ฅ์ ๋ํด ํญ์ ๊ฐ์ ์์๊ฐ์ ์์ธกํด ์ ์ฌ์ฑ์ ์ต๋ํํ๋ ์์ ๋ฌด์๋ฏธํ ํด๋ก ๋ถ๊ดดํ๊ธฐ ์ฝ๊ธฐ ๋๋ฌธ์ ์ง๊ด์ ๋ฐํ๋ค.
์ด๋ฐ ๋ถ๊ดด๋ฅผ ํผํ๊ธฐ ์ํด ๋ณดํต ๋คํธ์ํฌ ์ค๊ณ์ ์ฃผ์๋ฅผ ๊ธฐ์ธ์ธ๋ค.
contrastive learning๊ณผ ๊ด๋ จ ์ฐ๊ตฌ๋ค์ ์ฌ๋ฌ data augmentation์ ์กฐํฉํด์ ์ฌ์ฉํ๋ฉฐ, ์ด๋ฌํ ๋ณํ์๋ ๋ถ๋ณ์ธ representation์ ํ์ตํ๋๋ก ํ๋ค.
generative modeling์ ์ฌ์ฉํ๋ ๋ฐฉ๋ฒ์ด ์๋ค.
ํฝ์ ์ ์์ธกํ๋ ๋ฐฉ์์ผ๋ก representation์ pre-trainingํ๋๋ฐ, ์์ธก ๋ฐฉ์์ ๋ ๊ฐ์ง๊ฐ ์๋ค.
auto-regressive ๋ฐฉ์์ GPT๋ ๋ค๋ฅธ ์ธ์ด ๋ชจ๋ธ์ฒ๋ผ ์ด์ ์ ๋ณด๋ฅผ ๋ฐํ์ผ๋ก ๋ค์ ํฝ์ ์ ์์ฐจ์ ์ผ๋ก ์์ธกํ๋ ๋ฐฉ๋ฒ์ด๋ค.
de-noising ๋ฐฉ์์, BERT๋ masked auto-encoder์ฒ๋ผ ์ผ๋ถ ํฝ์ ์ ๊ฐ๋ฆฐ ๋ค(๋๋ ๋ ธ์ด์ฆ๋ฅผ ๋ฃ์ ๋ค) ์ด๋ฅผ ๋ณต์ํ๋๋ก ํ์ตํ๋ ๋ฐฉ์์ด๋ค.
generative modeling์ ๋น์ ๋ถํฐ NLP๊น์ง ์ฌ๋ฌ ๋๋ฉ์ธ์ ๊ฑธ์น self-supervised learning์ ํ๋๋ก ์ฐ๊ฒฐํ ๊ฐ๋ฅ์ฑ์ด ์๋ค.
student-teacher ๋ชจ๋ธ ๋ํ self-supervised learning์ ๋ณํ์ด๋ค.
teacher ๋คํธ์ํฌ๊ฐ student ๋คํธ์ํฌ๋ฅผ ํ์ต์ํค๊ธฐ ์ํ ํ๋ จ example๋ฅผ ์ ๊ณตํ๋ค.
์ด๋ฐ ์ข ๋ฅ์ ์ํคํ ์ฒ๋ ์๋ model compression, knowledge distillation์ผ๋ก ๋ถ๋ ธ์ผ๋ฉฐ, ๋ ์์ ๋ชจ๋ธ์ ๋ง๋ค๊ธฐ ์ํด ์ฌ์ฉ๋์๋ค.
์ถ๊ฐ ๋ฐ์ดํฐ์ ๋ ํฐ ์ฉ๋์ ๋คํธ์ํฌ๋ฅผ ๊ฒฐํฉํ๋ฉด, ๋ชจ๋ธ ํฌ๊ธฐ๋ฅผ ์ค์ด๋ ๋ชฉ์ ๋ฟ ์๋๋ผ ์ฑ๋ฅ ํฅ์์๋ ๋์์ด ๋๋ค.
5.5 More complex models
5.5.1 Three-dimensional CNNs
์์น์ ์ผ๋ก๋ 2D ๋คํธ์ํฌ์ ์ถ๊ฐ ์ถ ๋ฐฉํฅ์ผ๋ก ์ฌ๋ผ์ด๋ฉ ์๋์ฐ๋ฅผ ๋ผ์ ๋ฃ๊ธฐ๋ง ํ๋ฉด, ๋๋ groupted convolution์ ์ฌ์ฉํ๋ฉด 3D convolution์ ์ํํ ์ ์๋ค.
ํ์ง๋ง ์ค์ ๋ก๋ ์ ์ฒด 3D ๋ณผ๋ฅจ ๋ฐ์ดํฐ๋ฅผ ํ ๋ฒ์ ๋ค๋ฃจ๊ณ , ๋ชจ๋ kernel์ด 3๋ฒ์งธ ์ฐจ์(์. ์๊ฐ/๊น์ด) ๋ฐฉํฅ์ผ๋ก๋ ๊ฐ์ค์น๋ฅผ ๊ณต์ ํ๋๋ก ๋ง๋๋ ํธ์ด ๋ ํธ๋ฆฌํ๋ค.
๋๋ ๊ฐ ์ธต์์ 3๋ฒ์งธ ์ฐจ์ด์ ๋ํด ์ฌ๋ฌ ์ ๋ ฅ/์ถ๋ ฅ feature channel์ ํจ๊ป ๋ค๋ฃจ๋ ๊ตฌ์กฐ๋ก ์ค๊ณํ๊ธฐ๋ ์ฝ๋ค.
temporal(์๊ฐ์ ) ์ ๋ณด๋ฅผ ๊ฒฐํฉํ๋ ์ฌ๋ฌ ๋์์ ์ํคํ ์ฒ๊ฐ ์๋ค.
๋จ์ผ ํ๋ ์ ์ ๊ทผ์ ๊ฐ ํ๋ ์์ ์๋ก ๋ ๋ฆฝ์ ์ผ๋ก ๋ถ๋ฅํ๋ฉฐ, ์ค์ง ๊ทธ ํ๋ ์ ์์ฒด์ ๋ด์ฉ์๋ง ์์กดํ๋ค.
late fusion์ ๊ฐ ํ๋ ์์์ ์์ฑ๋ feature๋ค์ ๊ฐ์ ธ์์ clip ๋จ์๋ก ํ๋์ ๋ถ๋ฅ ๊ฒฐ๊ณผ๋ฅผ ๋ง๋ ๋ค.
early fusion์ ์ธ์ ํ ํ๋ ์๋ค์ ์์ ๋ฌถ์์ 2D CNN์ ์ฌ๋ฌ ์ฑ๋์ฒ๋ผ ๋ฌถ์ด์ ์ ๋ ฅ์ผ๋ก ๋ฃ๋ ๋ฐฉ์์ด๋ค.
์ด๋ฐ ๋ฐฉ์์์ ์๊ฐ ์ถ์ ๊ฑธ์น ์ํธ์์ฉ์ ํฉ์ฑ๊ณฑ์ด ๊ฐ๋ weight sharing์ด๋ temporal shift invariance ๊ฐ์ ์ฑ์ง์ ์ ๋๋ก ๊ฐ์ง ๋ชปํ๋ค.
3D CNN์ spatio-temporal ์๋์ฐ ์์์ ๋์ํ๋ ๊ณต๊ฐ๊ณผ ์๊ฐ์ ๋ํด ๋ถ๋ณ์ธ 3์ฐจ์ Kernel์ ํ์ตํ๊ณ , ๊ทธ ๊ฒฐ๊ณผ๋ฅผ ๊ฒฐํฉํ์ฌ ์ต์ข ์ ์๋ฅผ ๋ง๋ ๋ค.

์์ฃผ ๋จ์ํ 3x3x3 convolution์ ๊น์ ๋คํธ์ํฌ์์ pooling๊ณผ ํจ๊ป ์ฌ์ฉํด๋, ๋ ์ข์ ์ฑ๋ฅ์ ์ป์ ์ ์๋ค. (3D CNN์ VGG)
๋น๋์ค ์ฒ๋ฆฌ๋ฟ๋ง ์๋๋ผ 3D CNN์ volumetric(๋ถํผ) image processing์๋ ์ ์ฉ๋์ด ์๋ค.
์ผ๋ฐ์ ์ธ 2D CNN๊ณผ ๋ง์ฐฌ๊ฐ์ง๋ก, 3D CNN ์ํคํ ์ฒ๋ ๊ณต๊ฐ์ , ์๊ฐ์ ํด์๋, ์คํธ๋ผ์ด๋ฉ, ์ฑ๋ ๊น์ด ๋ฑ์ ๋ค์ํ๊ฒ ํ์ฉํ ์ ์๋ค.
ํ์ง๋ง 3D CNN์ ๊ณ์ฐ๋๊ณผ ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋์ด ๋งค์ฐ ํฐ ๊ฒฝ์ฐ๊ฐ ๋ง๋ค.
→ SlowFast๋ผ๋ two-stream ์ํคํ ์ฒ๋ฅผ ์ฌ์ฉํ๋ค.
slow pathway๊ฐ ๋ ๋ฎ์ ํ๋ ์๋ ์ดํธ์์ ๋์ํ๊ณ , fast pathway๋ ์๊ฐ์ ์ผ๋ก ๋ ์ด์ดํ๊ฒ ์ํ๋ง์ ํ์ง๋ง ์ฑ๋ ์๋ ๋ ์ ๊ฒ ๊ฐ์ ธ๊ฐ๋ฉฐ, ๋ ๊ฒฝ๋ก์ feature๋ฅผ ๊ฒฐํฉํ๋ค.
๋ํ ๋น๋์ค ์ฒ๋ฆฌ ๋คํธ์ํฌ๋ channel-seperated convolutions์ด๋ neural architecture search์ ํตํด์๋ ๋ ํจ์จ์ ์ผ๋ก ๋ง๋ค ์ ์๋ค.
multigrid ๊ธฐ๋ฒ์ ์ฌ์ฉํ๋ฉด ๋น๋์ค ์ธ์ ๋ชจ๋ธ์ ํ์ต์ ๋ ๋น ๋ฅด๊ฒ ๊ฐ์ํ ์ ์๋ค.
3D point clouds and meshes
volumetric density, implicit distance functions, ๋น๋์ค ์ํ์ค์ฒ๋ผ 3์ฐจ์ ๊ฒฉ์ ํํ์ ๋ฐ์ดํฐ๋ฅผ ์ฒ๋ฆฌํ๋ ๊ฒ๋ฟ ์๋๋ผ, neural network๋ ๋จ์ผ ์ด๋ฏธ์ง ํ ์ฅ์ผ๋ก๋ 3D ๋ชจ๋ธ์ ์ถ๋ก ํ๋ ๋ฐ์๋ ์ฌ์ฉํ ์ ์๋ค.
์ด๋ ํฝ์ ๋จ์ ๊น์ด๋ฅผ ์์ธกํ๊ฑฐ๋, ๋ถํผ ๋ฐ๋ ํํ์ผ๋ก ๋ํ๋ธ ์์ ํ 3D ๋ชจ๋ธ์ ์ฌ๊ตฌ์ฑํ์ฌ ์ ๊ทผํ ์ ์๋ค.
์ต๊ทผ์๋ ์ด๋ฌํ 3D inference ๋คํธ์ํฌ ์ค ์ผ๋ถ๊ฐ ์ ํํ 3D ๊ตฌ์กฐ๋ฅผ ์ง์ง๋ก ์ถ๋ก ํ๋ค๊ธฐ๋ณด๋ค ๋จ์ง ๋๋ต์ ์ธ ๋ฌผ์ฒด ๋ฒ์ฃผ๋ฅผ ์ธ์ํ ๋ค ์ฝ๊ฐ์ ๋ง์ถค์ ์ํํ๋ ์์ค์ผ ์๋ ์๋ค๋ ์ ์ ์์ฌํ๋ค.
3D point cloud๋ฅผ ์์ฑํ๊ณ ์ฒ๋ฆฌํ๊ธฐ๋ ํ๋ค.
RGB-D, RGB ์ด๋ฏธ์ง๋ก๋ถํฐ ์ผ๊ฐํ mesh๋ฅผ ์ถ๋ก ํ๋ ๋ฐฉ๋ฒ๋ ์๋ค.
5.5.3 Transformers
deep neural network์ attension ๋ฉ์ปค๋์ฆ์ ์ถ๊ฐํ ์๋ก์ด ์ํคํ ์ฒ์ด๋ค.
์ ๋ ฅ ํ ํฐ์ ํ ๋ฒ์ ํ๋์ฉ ์ฒ๋ฆฌํ๋ RNN ๋ฐ ๊ทธ ๋ณํ๋ค๊ณผ ๋ฌ๋ฆฌ, transformer๋ ์ ์ฒด ์ ๋ ฅ ์ํ์ค๋ฅผ ํ๋ฒ์ ์ฒ๋ฆฌํ ์ ์๋ค.
์ปดํจํฐ ๋น์ ์ transformer๋ฅผ ์ ์ฉํ๋ ค๋ ๋๊ธฐ๋ NLP์ ์ ์ฉํ๋ ค๋ ๋๊ธฐ์ ๋ค๋ฅด๋ค.
RNN์ ์ ๋ ฅ์ ์์ฐจ์ ์ผ๋ก ์ฒ๋ฆฌํด์ผ ํ๋ค๋ ํ๊ณ๋ฅผ ๊ฐ์ง๋ง, convolution์ ์ฐ์ฐ ์์ฒด๊ฐ ๋ณธ์ง์ ์ผ๋ก ๋ณ๋ ฌ์ ์ด๊ธฐ ๋๋ฌธ์ ์ด๋ฐ ๋ฌธ์ ๊ฐ ์๋ค.
๋์ convolution์ ๋ฌธ์ ๋ inductive bias(๊ท๋ฉ์ ํธํฅ)๊ณผ ๊ด๋ จ์ด ์์ผ๋ฉฐ, convolution ๋ชจ๋ธ ์์ ๊ธฐ๋ณธ์ ์ผ๋ก ๋ด์ฅ๋์ด ์๋ default assumptions์ ์๋ฏธํ๋ค.
convolution ์ฐ์ฐ์ ๊ฐ๊น์ด ์๋ ํฝ์ ๋ค์ด ๋ฉ๋ฆฌ ์๋ ํฝ์ ๋ค๋ณด๋ค ๋ ์ค์ํ๋ค๋ ๊ฐ์ ์ ๋ดํฌํ๊ณ ์๋ค.
์ฌ๋ฌ ๊ฐ์ convolution ์ธต์ ์ฐจ๊ณก์ฐจ๊ณก ์์ ์ฌ๋ ค์ผ๋ง receptive fields์ด ์ถฉ๋ถํ ์ปค์ ธ์ ์ด๋ฏธ์ง ์ ์ฒด๋ฅผ ๋ณผ ์ ์๊ฒ ๋๋ค.
๋คํธ์ํฌ์ non-local ์ฐ์ฐ์ ๋ถ์ฌํ๋ฉด ์ด๋ฐ ํ๊ณ๋ฅผ ์ํํ ์ ์๋๋ฐ, ์ด๋ ์ผ๋ถ image denoising ์๊ณ ๋ฆฌ์ฆ์์ ์ฌ์ฉ๋๋ ์ฐ์ฐ๊ณผ ์ ์ฌํ๋ค.
transformer์ ํต์ฌ ๊ตฌ์ฑ์์๋ self-attention์ผ๋ก, ๋คํธ์ํฌ์ ํ layer์ ์๋ N๊ฐ์ unit activations ๊ฐ๊ฐ์ attention์ ์ ์ฉํ๋ ๋ฐฉ์์ผ๋ก ๊ตฌ์ฑ๋๋ค.
key-value ์ {(k_i, v_i)}์ ์งํฉ๊ณผ query q๊ฐ ์ฃผ์ด์ง๋ฉด, ๋์ ๋๋ฆฌ๋ query์ ์ ํํ ์ผ์นํ๋ ํค k_i์ ๋์ํ๋ ๊ฐ v_i๋ฅผ ๋ฐํํ๋ค.
neural network์์๋ key์ query๊ฐ rea-valued vectors(์ค์ ๋ฒกํฐ)๋ก ์ฃผ์ด์ง๊ธฐ ๋๋ฌธ์, ํด๋น ์ฐ์ฐ์ ์ ํํ ์ผ์นํ๋ ํ๋๋ฅผ ๊ณ ๋ฅด๋ ๋์ , query vector์ key vector๋ค ์ฌ์ด์ (์๋ณ) ๊ฑฐ๋ฆฌ/์ ์ฌ๋์ ๋ฐ๋ผ ๊ฐ์ค์น๊ฐ ์ ํด์ง๊ณ , ๊ทธ ๊ฐ์ค์น๋ก value vector๋ค์ weighted sumํ ๊ฒฐ๊ณผ๋ฅผ ๋ฐํํ๋ค.
์ด๋ scattered data interpolation(์ฐ์ฌ ๋ฐ์ดํฐ ๋ณด๊ฐ)๊ณผ ๊ธฐ๋ณธ์ ์ผ๋ก ๊ฐ์ ์์ด๋์ด์ด์ง๋ง, radial distance(๋ฐฉ์ฌ ๊ฑฐ๋ฆฌ)๋ฅผ ์ฐ๋ ๋์ scaled dot-product attention(์ค์ผ์ผ๋ ์ ๊ณฑ ์ดํ ์ )์ ์ฌ์ฉํ๋ค.
scaled dot-product attention์ query ๋ฒกํฐ์ key ๋ฒกํฐ์ ๋ด์ ์ ๊ณ์ฐํ ๋ค, ์๋ฒ ๋ฉ ์ฐจ์ D์ ์ ๊ณฑ๊ทผ์ผ๋ก ๋๋ ์ค์ผ์ผ์ ์ค์ด๊ณ softmax ํจ์๋ฅผ ์ ์ฉํ๋ค.

K์ V๋ ๊ฐ๊ฐ ํค ๋ฒกํฐ๋ค๊ณผ ๊ฐ ๋ฒกํฐ๋ค์ ํ ๋ฐฉํฅ์ผ๋ก ์์ ๋ง๋ ํ๋ ฌ์ด๊ณ y๋ ์ดํ ์ ์ฐ์ฐ์์ ์ถ๋ ฅ์ด๋ค.
์ ๋ ฅ ๋ฒกํฐ๋ค์ ์งํฉ {x_0, x_1, ..., x_N-1}์ด ์ฃผ์ด์ก์ ๋, self-attention ์ฐ์ฐ์ ์ถ๋ ฅ ๋ฒกํฐ๋ค์ ์งํฉ {x'_0, x'_1, ...., x'_N-1}์ ๋ง๋ ๋ค.

self-attention์ ๊ณ์ฐ ๊ทธ๋ํ๋ฅผ ์ฌ์ฉํด ํ๋์ ์ถ๋ ฅ ๋ฒกํฐ x_2๋ฅผ ์ป๋ ๊ณผ์ self-attention์ ํ์ต๋๋ ์ธ ๊ฐ์ ๊ฐ์ค์น ํ๋ ฌ W_q, W_k, W_v๋ฅผ ์ฌ์ฉํ๋ฉฐ, ์ด๋ค์ ๊ฐ ์ ๋(ํ ํฐ/์์น)์ ๋ํด ์ดํ ์ ๋ธ๋ก์ ๋ค์ด๊ฐ๋ query, key, value ๋ฒกํฐ๋ฅผ ๊ฒฐ์ ํ๋ค.

๊ทธ ๋ค์ value vector๋ค์ weighted sum์ ๊ณ์ฐํ๊ณ , ํ์์ ๋ฐ๋ผ ์ด๋ฅผ MLP(๋ค์ธต ํผ์ ํธ๋ก )์ ํต๊ณผ์์ผ ์ต์ข ์ ์ผ๋ก x'_2๋ฅผ ๋ง๋ ๋ค.
fully connected layer์ด๋ convolutional layer๊ณผ ๋น๊ตํ๋ฉด self-attention์ ๊ฐ ์ถ๋ ฅ์ ๊ณ์ฐํ ๋ ์ ๋ ฅ ๋ฒกํฐ ์ ์ฒด๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ํ๋ค.
fully connected layer๋ ๊ฐ ์ ๋ ฅ์ ๋ํ ๊ฐ์ค์น๊ฐ ๊ณ ์ ๋์ด ์๋ ๋ฐ๋ฉด, self-attention์์๋ ๊ฐ์ค์น๊ฐ ์ ๋ ฅ์ ๋ฐ๋ผ ์ฆ์์์ ์กฐ์ ๋๋ค๋ ์ฐจ์ด๊ฐ ์๋ค.
๋ํ ์ฒ์๋ถํฐ ์ ๋ ฅ์ ๋ชจ๋ ๋ถ๋ถ์ ์ฃผ์๋ฅผ ๊ธฐ์ธ์ผ ์ ์๋ค.
์ ๋ ฅ์ local region๋ง ๋ณด๋๋ก ์ ํ๋๋ ๋์ ์ ์ฒด ๋ฒ์๋ฅผ ๋ฐ๋ก ๋ณผ ์ ์๊ธฐ ๋๋ฌธ์, ๋ฌผ์ฒด๋ค์ ๊ตฌ๋ถํ๋๋ฐ ํ์ํ ๋ฌธ๋งฅ ์ ๋ณด๋ฅผ ๋ ์ ๋์ ํ ์ ์๋ค.
transformer block์ ๋ง๋ค๊ธฐ ์ํด์๋ self-attention๊ณผ ํจ๊ป ๊ฒฐํฉ๋๋ ์ฌ๋ฌ ๊ตฌ์ฑ ์์๋ค์ด ์๋ค.
์์ ํ transformer๋ encoder ๋ธ๋ก๊ณผ decoder ๋ธ๋ก์ผ๋ก ๊ตฌ์ฑ๋๋ฉฐ, ๋ ๋ธ๋ก์ ๋ง์ ๊ตฌ์ฑ์์๋ค์ ์๋ก ๊ณต์ ํ๋ค.
set-to-set ์ฐ์ฐ์ ๋ชจ๋ธ๋งํ๋ ๋์ , ๊ฐ ์ ๋ ฅ ๋ฒกํฐ์ ์์น ์ธ์ฝ๋ฉ์ ๋ํด sequence-to-sequence ์ฐ์ฐ์ ๋ชจ๋ธ๋งํ ์ ์๋ค.
์์น ์ธ์ฝ๋ฉ์ ๋ณดํต ์๊ฐ์ ์ผ๋ก(์์น์ ๋ฐ๋ผ) ์์์ด ์กฐ๊ธ์ฉ ์ด๋๋ ์ฌ์ธํ๋ค์ ์งํฉ์ผ๋ก ์ด๋ฃจ์ด์ง๋ฉฐ, ์ด๋ก๋ถํฐ ์์น ์ ๋ณด๋ฅผ ๋ณต์(๋์ฝ๋ฉ)ํ ์ ์๋ค.
์ ๋ ฅ์ self-attention์ ํ ๋ฒ๋ง ์ ์ฉํ๋ ๋์ , ์๋ก ๋ค๋ฅธ ํ์ต ๊ฐ์ค์น ํ๋ ฌ๋ก ์๋ก ๋ค๋ฅธ key, value, query๋ฅผ ๋ง๋ค๊ณ , ์ด๋ฐ self-attention์ ์ฌ๋ฌ ๊ฐ ๋ณ๋ ฌ๋ก ์ ์ฉํด multi-headed self-attention์ ๊ตฌ์ฑํ๋ ๊ฒฝ์ฐ๊ฐ ๋ง๋ค.
๊ฐ ํค๋์ ๊ฒฐ๊ณผ๋ ์๋ก ์ด์ด ๋ถ์ธ ๋ค, ์ ์ฒด๋ฅผ MLP์ ํต๊ณผ์ํจ๋ค.
๊ทธ ๋ค์ MLP์ ์ถ๋ ฅ์ layer normalization๋ฅผ ์ ์ฉํ๋ค. (ํ์ต์ด ํ๋ค๋ฆฌ์ง ์๊ฒ ์์ ์ ์ผ๋ก ๋ง๋ ๋ค.)
์ดํ ๊ฐ ๋ฒกํฐ๋ ๊ฐ์ค์น๋ฅผ ๊ณต์ ํ๋ ๋ ๋ค๋ฅธ MLP๋ฅผ ๋ ๋ฆฝ์ ์ผ๋ก ํต๊ณผํ ์ ์์ผ๋ฉฐ, ๊ทธ ๋ค ๋ค์ layer normalization์ ์ ์ฉํ๋ค.
residual connection์ multi-head attention ๋ค์ ๋ง์ง๋ง MLP ๋ค์ ๊ฐ๊ฐ ์ฌ์ฉ๋๋ค.
training ๊ณผ์ ์์ ๋์ฝ๋์ ๊ฐ์ฅ ํฐ ์ฐจ์ด์ ์, self-attention์ ๋ค์ด๊ฐ๋ ์ ๋ ฅ ๋ฒกํฐ๋ค ์ค ์ผ๋ถ๋ฅผ ๋ง์คํน ์ฒ๋ฆฌํ ์ ์๋ค๋ ์ ์ด๋ค.
์ด๋ autoregressive ์์ธก ๊ณผ์ ์์ parallel training์ ๊ฐ๋ฅํ๊ฒ ํด ์ค๋ค.
transformer๋ฅผ ์ด๋ฏธ์ง ๋๋ฉ์ธ์ ์ ์ฉํ ๋ ํต์ฌ์ ์ธ ์ด๋ ค์ ์ค ํ๋๋ ์ด๋ฏธ์ง ์ ๋ ฅ์ ํฌ๊ธฐ์ ๊ด๋ จ์ด ์๋ค.

Vision Trasformer(ViT)๋ฅผ ํตํด transformer๊ฐ ํจ์ฌ ํฐ ์ด๋ฏธ์ง๋ ์ฒ๋ฆฌํ ์ ์๊ฒ ํด์คฌ๋ค.
image recognition ๊ณผ์ ์์ ๊ฐ ํฝ์ ์ transformer์ ๊ฐ๋ณ ์ ๋ ฅ ๋ฒกํฐ๋ก ์ทจ๊ธํ๋ ๋์ , ํฌ๊ธฐ 224x224์ธ ์ด๋ฏธ์ง๋ฅผ 16x16 ํฌ๊ธฐ์ ๊ฒฉ์ ํํ ํจ์น๋ก ๋๋์ด ์ด 196๊ฐ์ ์๋ก ๋ค๋ฅธ ํจ์น๋ก ๋๋๋ค.
๊ทธ๋ค์ ๊ฐ ํจ์น๋ฅผ ์ผ๋ ฌ๋ก ํผ์น ๋ค, ๋ชจ๋ ํจ์น์ ๊ณตํต์ผ๋ก ์ ์ฉ๋๋ ์๋ฒ ๋ฉ ํ๋ ฌ์ ํต๊ณผ์ํจ๋ค. (== ์คํธ๋ผ์ด๋๊ฐ 16์ธ 16x16 ํฉ์ฑ๊ณฑ์ ์ ์ฉํ๋ ๊ฒ)
์ด๋ ๊ฒ ์ป์ ๊ฒฐ๊ณผ ์์น ์ธ์ฝ๋ฉ ๋ฒกํฐ๋ฅผ ๋ํ ๋ค transformer์ ์ ๋ ฅํ๋ค.
ํฉ์ฑ๊ณฑ์ด ๊ฐ์ง inductive bias(๊ท๋ฉ์ ํธํฅ)๊ณผ transformer๋ฅผ ๊ฒฐํฉํ๋ ค๋ ์๋๋ ์์๋ค.
์ด๋ฐ ๋คํธ์ํฌ์ ์ํฅ๋ ฅ ์๋ ์๋ก DETR์ด ์์ผ๋ฉฐ, ์ด๋ object detection ๊ณผ์ ์ ์ ์ฉ๋๋ค.
DETR์ ๋จผ์ ResNet ๋ฐฑ๋ณธ์ผ๋ก ์ด๋ฏธ์ง๋ฅผ ์ฒ๋ฆฌํ ๋ค, ๊ทธ ์ถ๋ ฅ์ transformer encoder-decoder ๊ตฌ์กฐ์ ์ ๋ ฅํ๋ค.
transformer๋ฅผ ์ถ๊ฐํ๋ฉด ํฐ object๋ฅผ ํ์งํ๋ ๋ฅ๋ ฅ์ด ํฅ์๋์๋๋ฐ, ์ด๋ transformer๊ฐ ์ ๋ ฅ encoder vector๋ค ์ฌ์ด์ ๋์ ๊ด๊ณ๋ฅผ ์ ์ญ์ ์ผ๋ก ์ถ๋ก ํ ์ ์๊ธฐ ๋๋ฌธ์ด๋ค.
5.5.4 Generative models
deep neural network๊ฐ semantic์ ํฌ์ฐฉํ๋ ๋ฐ ๋ณด์ฌ์ค ๋ฅ๋ ฅ์ ํ์ฉํด, ์ํ ์ด๋ฏธ์ง๋ฅผ ์๊ฐํํ๊ณ ์๋ก์ด ์ด๋ฏธ์ง๋ฅผ ์์ฑํ๋ ค๋ฉด visualization ๊ธฐ๋ฒ์ ์ฌ์ฉํ ์ ์๋ค.
ํ์ง๋ง ์ด๋ฐ ๊ธฐ๋ฒ์ ๊ฐ๋ณ ์ ๋์ ๋ํ insights๋ ์ ๊ณตํ ์ ์์ด๋ ์์ ํ ํ์ค์ ์ธ ์ด๋ฏธ์ง๋ฅผ ๋ง๋ค์ด๋ด๋ ๋ฐ์๋ ์คํจํ๋ค.
์๋์ ์ธ์ฝ๋ ๋คํธ์ํฌ๊ฐ ์ํํ classification์ ๋๋๋ฆฌ๋ ๋์ฝ๋ ๋คํธ์ํฌ๋ฅผ ๊ตฌ์ฑํ ์๋ ์๋ค.
์ด๋ฐ ์ข ๋ฅ์ bottleneck(๋ณ๋ชฉ) ์ํคํ ์ฒ๋ ์ด๋ฏธ์ง๋ก๋ถํฐ ํฝ์ ๋จ์ semantic label์ ์ป๊ธฐ ์ํด ์ฌ์ฉ๋๋ค.
Variational autoencoders
autoencoder : ์ด๋ฏธ์ง๋ฅผ ์๊ณ ์์ถ๋ ์ฝ๋๋ก ์ธ์ฝ๋ฉํ ๋ค์, ๊ทธ๊ฒ์ ๋ค์ ์๋ ์ด๋ฏธ์ง๋ก ๋ณต์(๋์ฝ๋ฉ)ํ๋ ค๋ ๋คํธ์ํฌ์ด๋ค.
์ด๋ฐ ์์ถ ์ฝ๋๋ ๋ณดํต ๋ฒกํฐ๋ก ํํ๋๋ฉฐ, ์จ๊ฒจ์ ธ ์๊ณ ์ง์ ๊ด์ธกํ ์ ์๋ ๊ฐ์ด๋ผ๋ ์๋ฏธ๋ฅผ ๊ฐ์กฐํ๊ธฐ ์ํด ํํ latent(์ ์ฌ) vector๋ผ ๋ถ๋ฅธ๋ค.
์ด๋ฏธ์ง ๋ฐ์ดํฐ์ ์ผ๋ก autoencoder๋ฅผ ํ์ต์ํฌ ๋๋ unsupervised ๋ชฉ์ ํจ์๋ฅผ ์ฌ์ฉํ์ฌ, ๋์ฝ๋์ ์ถ๋ ฅ ์ด๋ฏธ์ง๊ฐ ์ธ์ฝ๋์ ์ ๋ ฅ๋ ํ์ต ์ด๋ฏธ์ง์ ์ผ์นํ๋๋ก ๋ง๋ ๋ค.
๊ทธ ๋ค์ ์๋ก์ด ์ด๋ฏธ์ง๋ฅผ ์์ฑํ๋ ค๋ฉด, latent vector๋ฅผ ๋ฌด์์๋ก ์ํ๋งํ๊ณ , ๊ทธ ๋ฒกํฐ๋ก๋ถํฐ ๋์ฝ๋๊ฐ ํ์ต ๋ฐ์ดํฐ์ ๋ถํฌ์์ ๋์จ ๊ฒ์ฒ๋ผ ๋ณด์ด๋ ์๋ก์ด ์ด๋ฏธ์ง๋ฅผ ์์ฑํด ์ฃผ๊ธฐ๋ฅผ ๊ธฐ๋ํ ์ ์๋ค.
autoencoder์์๋ ๊ฐ ์ ๋ ฅ์ด ๊ทธ์ ํด๋นํ๋ latent vector๋ก deterministic(๊ฒฐ์ ๋ก ์ )์ด๋ฉฐ one-to-one์ผ๋ก ๋งคํ๋๋ค.
๋ฐ๋ผ์ ์์ฑ๋๋ latent vector์ ๊ฐ์๋ ์ ๋ ฅ ๋ฐ์ดํฐ ํฌ์ธํธ์ ๊ฐ์์ ์ ํํ ๊ฐ๋ค.
์ธ์ฝ๋์ ๋ชฉํ๊ฐ ๋์ฝ๋ฉํ๊ธฐ ์ฌ์ด latent vector๋ฅผ ๋ง๋๋ ๊ฒ์ด๋ผ๋ฉด, ๋ฐฉ๋ฒ ์ค ํ๋๋ ๊ฐ latent vector๊ฐ ๋ค๋ฅธ ๋ชจ๋ latent vector์ ๋งค์ฐ ๋ฉ๋ฆฌ ๋จ์ด์ง๋๋ก ๋ง๋๋ ๊ฒ์ด๋ค.
→ ๊ฐ latent vector๊ฐ ์๋ก ๊ฑฐ์ ๊ฒน์น์ง ์๋ ์์ ํ ๊ณ ์ ํ ๊ฐ์ด ๋์ด, ๋์ฝ๋๊ฐ ์์ ์ด ๋ณธ latent vector๋ฅผ ๊ฐ๊ฐ ์ธ์์ ๋ณต์ํ ์ ์๋ค.
ํ์ง๋ง ๋ฌด์์๋ก latent vector๋ฅผ ์ํ๋งํ์ฌ ๋์ฝ๋์ ๋ฃ์์ ๋ ํ์ค์ ์ธ ์ด๋ฏธ์ง๊ฐ ์์ฑ๋๋๋ก ํด์ผํ๊ธฐ ๋๋ฌธ์, latent vector๋ ์ถฉ๋ถํ ์ ํ์๋์ด ์์ด์ผ ํ๊ณ , ๋์์ ๊ฐ๊น์ด ๋ฒกํฐ๋ผ๋ฆฌ๋ ์๋ฏธ์ ์ผ๋ก ๋น์ทํ๋ค ๊ฐ์ semantic structure๋ฅผ ๋ด๊ณ ์์ด์ผ ํ๋ค.
์ด์ ๋ํ ํ๊ฐ์ง ๋ฐฉ๋ฒ์ latent vector์ noise๋ฅผ ์ฃผ์ ํ๋ ๊ฒ์ด๋ฉฐ ์ด๋ ๊ฝค ์ ๋์ํ๋ค.
autoencoder์ ํ์ฅ์ผ๋ก๋ variational autoencoder(VAE)๊ฐ ์๋ค.
์ ๋ ฅ๋ง๋ค latent vector๋ฅผ ํ๋๋ง ์์ฑํ๋ ๋์ , latent vector๊ฐ ๋ฐ๋ฅด๋ ๋ฏธ๋ฆฌ ์ ํ ๋ถํฌ๋ฅผ ์ ์ํ๋ mean๊ณผ covariance์ ์์ฑํ๋ค.
๊ทธ๋ฐ ๋ค์ ๊ทธ ๋ถํฌ์์ ์ํ๋งํ์ฌ ํ๋์ latent vector๋ฅผ ์ป๊ณ ์ด๋ฅผ ๋์ฝ๋์ ์ ๋ ฅํ๋ค.
์ํ๋ง ๊ณผ์ ์ด ๊ฒฐ์ ๋ก ์ ์ผ๋ก ๋ณํด๋ฒ๋ฆฌ๋(covariance ํ๋ ฌ์ด 0 ํ๋ ฌ์ด ๋์ด๋ฒ๋ฆฌ๋) ๊ฒ์ ๋ง๊ธฐ ์ํด, objective function์๋ ๋ณดํต regularization ํญ์ด ํฌํจ๋๋ค.
์ด ํญ์ latent vector๊ฐ ์ด๋ค ์ ํ๋ ๋ถํฌ์์ ๋๋ฌด ๋ฉ์ด์ง๋ฉด ๋ฒ์ ์ ์ฃผ๋๋ก ์ค๊ณ๋๋ค.
์ด์ฒ๋ผ ํ๋ฅ ์ ์ฑ๊ฒฉ์ ๊ฐ์ง๊ธฐ ๋๋ฌธ์, VAE๋ ์ผ๋ฐ autoencoder๋ณด๋ค latent vector space๋ฅผ ๋ ์ ํ์ํ ์ ์๊ณ , ๊ทธ ๊ฒฐ๊ณผ ๋์ฝ๋๊ฐ ํ์ต ๋ฐ์ดํฐ๋ฅผ ์ธ์์ ๊ณผ์ ํฉํ๊ธฐ๊ฐ ๋ ์ด๋ ค์์ง๋ค.
์์ฐ์ด๊ฐ discrete(์ด์ฐ์ )์ด๋ผ๋ ์ ๊ณผ, ์ด๋ฏธ์ง๊ฐ ๋ณดํต ์ธ์ด๋ก ์ค๋ช ๋ ์ ์๋ค๋ ์ ์ ์ฐฉ์ํ์ฌ, vector quantized VAE(VQ-VAE)๋ latent space์ categorical(๋ฒ์ฃผํ) ๋ณ์๋ก ๋ชจ๋ธ๋งํ๋ค.
์ธ์ฝ๋์ ๋์ฝ๋๋ ์ผ๋ฐ์ ์ธ VAE์ฒ๋ผ ๋์ํ๋ค.
์ฆ ์ธ์ฝ๋๋ ์ ๋ ฅ์ผ๋ก๋ถํฐ ์ด๋ค latent representation์ ์์ธกํ๊ณ , ๋์ฝ๋๋ ๊ทธ latent representation์ผ๋ก๋ถํฐ ์ด๋ฏธ์ง๋ฅผ ์์ฑํ๋ค.
ํ์ง๋ง ์ผ๋ฐ VAE์ ๋ฌ๋ฆฌ, VQ-VAE๋ ์ธ์ฝ๋๊ฐ ์์ธกํ latent representation์ ๊ฐ spatial dimenison(๊ณต๊ฐ ์์น)์ ๋ํด, ๋ฏธ๋ฆฌ ์ ํด์ง discrete vector ์งํฉ(์ด์ฐ ๋ฒกํฐ ์งํฉ, ์ฝ๋๋ถ)์์ ๊ฐ์ฅ ๊ฐ๊น์ด ๋ฒกํฐ๋ก ํด๋น ๊ฐ์ ์นํํ๋ค.
์ด๋ ๊ฒ discretize๋ ์ ์ฌ ํํ์ด ๋์ฝ๋๋ก ์ ๋ฌ๋๋ค.
๋ํ ์ฝ๋๋ถ์ ์๋ ๋ฒกํฐ๋ค์ VAE์ ์ธ์ฝ๋, ๋์ฝ๋์ ๋์์ ํ์ต๋๋ค.
์ด๋ ์ฝ๋๋ถ ๋ฒกํฐ๋ค์ ์ธ์ฝ๋๊ฐ ์ถ๋ ฅํ ๊ฐ ๊ณต๊ฐ ์์น์ ๋ฒกํฐ๋ค์ ๋ ๊ฐ๊น์์ง๋๋ก ์ต์ ํ๋๋ค.
VG-VAE๊ฐ ์ด์ฐ์ ์ธ ๋ฒกํฐ ์งํฉ์ ์ฐ๊ธด ํ์ง๋ง, ํํํ ์ ์๋ ์ด๋ฏธ์ง์ ๊ฒฝ์ฐ์ ์๋ ์ฌ์ ํ ์์ฒญ๋๊ฒ ๋ง๋ค.
VAE๋ ๋ณดํต gaussian latent distribution์ ๊ฐ์ ํ์ง๋ง, VQ-VAE์ latent distribution์ ๋ช ํํ๊ฒ ์ ์๋์ด ์์ง ์๋ค.
→ latent variable z๋ฅผ ์ํ๋งํ๊ธฐ ์ํด ๋ณ๋์ ์์ฑ ๋ชจ๋ธ์ ๋ฐ๋ก ํ์ตํ๋ค.
์ด ๋ชจ๋ธ์ ํ์ต๋ VQ-VAE ์ธ์ฝ๋๊ฐ ํ์ต ๋ฐ์ดํฐ ์ ์ฒด์ ๋ํด ์ถ๋ ฅํ ์ต์ข latent variables๋ค์ ๊ฐ์ง๊ณ ํ์ต๋๋ค.
์ด๋ฏธ์ง์ ๊ฒฝ์ฐ z์ ๊ฐ ํญ๋ชฉ๋ค์ ๊ณต๊ฐ์ ์ผ๋ก ์๋ก ์์กดํ๋ ๊ฒฝ์ฐ๊ฐ ๋ง๋ค.
์) ํ๋์ ๋ฌผ์ฒด๊ฐ ์๋ก ์ด์ํ ์ฌ๋ฌ ํญ๋ชฉ์ ๊ฑธ์ณ ์ธ์ฝ๋ฉ๋ ์ ์๋ค.
z์ ํญ๋ชฉ๋ค์ด ์ด์ฐ์ ์ธ ์ฝ๋๋ถ ๋ฒกํฐ๋ค ์ค์์ ์ ํ๋๋ ๊ฐ๋ค์ด๋ฏ๋ก, PixelCNN์ ์ฌ์ฉํด ์ด๋ฏธ ์ํ๋ง๋ ์ด์ ํญ๋ชฉ๋ค์ ๋ฐํ์ผ๋ก latent variable์ ์ ํญ๋ชฉ๋ค์ ์๊ธฐํ๊ท์ ์ผ๋ก ์ํ๋งํ ์ ์๋ค.
→ ํน์ ์ด๋ฏธ์ง ํด๋์ค๋ ํน์ง์ ํด๋นํ๋ latent variables๋ฅผ ์ํ๋งํ ์ ์๊ฒ ํด์ค๋ค.
VQ-VAE-2๋ ์ด๋ฏธ์ง๋ฅผ ๋์ฝ๋ฉํ ๋ two-level ์ ๊ทผ์ ์ฌ์ฉํ๋ค.
์์ latent vector์ ํฐ latent vector๋ฅผ ํจ๊ป ์ฌ์ฉํจ์ผ๋ก์จ, reconstruction(์ฌ๊ตฌ์ฑ)๋ ์ด๋ฏธ์ง์ generation๋ ์ด๋ฏธ์ง์ fidelity(ํ์ง)์ ํจ์ฌ ๋ ๋์ผ ์ ์๋ค.
DALL·E๋ VQ-VAE-2๋ฅผ text-to-image ์์ฑ์ ์ ์ฉํ๋ค.
Generative adversarial networks
image synthesis์ ์ํด pre-training๋ ๋คํธ์ํฌ๊ฐ ๊ณ์ฐํ multi-resolution(๋ค์ค ํด์๋) ํน์ง์ ์ด์ฉํด, ์ฃผ์ด์ง ํ ์ค์ฒ ๋๋ ์คํ์ผ ์ด๋ฏธ์ง์ ํต๊ณ๋ฅผ ๋ง์ถ๋ ๋ฐฉ๋ฒ์ด ์๋ค.
ํน์ ํ๊ฐ์ ์คํ์ผ์ด๋ ์ฌ์ง์ ๊ณ ์์ค ๋ด์ฉ(๋ฐฐ์น/๊ตฌ๋, layout)์ ๋ง์ถ๋ ๋ฐ์๋ ์ ์ฉํ์ง๋ง, ์์ ํ ์ฌ์ง์ฒ๋ผ ์ฌ์ค์ ์ธ ์ด๋ฏธ์ง๋ฅผ ์์ฑํ๊ธฐ์๋ ์ถฉ๋ถํ์ง ์๋ค.
์ง์ง๋ก ์ฌ์ง์ฒ๋ผ ํ์ค์ ์ธ ํฉ์ฑ ์ด๋ฏธ์ง๋ฅผ ๋ง๋๋ ค๋ฉด, ์ด๋ค ์ด๋ฏธ์ง๊ฐ ์ง์ง์ธ์ง ๊ฐ์ง์ธ์ง ํ๋ณํ ์ ์์ด์ผ ํ๋ค.
๊ทธ๋ฐ loss function์ด ์กด์ฌํ๋ค๋ฉด, ์ด๋ฅผ ์ด์ฉํด ํฉ์ฑ ์ด๋ฏธ์ง๋ฅผ ์์ฑํ๋ ๋คํธ์ํฌ๋ฅผ ํ์ต์ํฌ ์ ์๋ค.
๊ทธ๋ฌ๋ ์ด loss function์ ์ฌ๋์ด ์ง์ ์ค๊ณํ๊ธฐ๋ ์ด๋ ต๋ค.
generative adversarial networks(GAN)์ด ๋นํ๊ฐ ์ญํ ์ ํ๋ ๋ณ๋์ ์ ๊ฒฝ๋ง์ ํ์ต์ํจ๋ค.
generator(์์ฑ๊ธฐ) ๋คํธ์ํฌ G์ ์ถ๋ ฅ์ด ๋ณ๋์ discriminator(ํ๋ณ๊ธฐ) ๋คํธ์ํฌ D๋ก ๋ค์ด๊ฐ๋ฉฐ, D์ ๊ณผ์ ๋ ๊ฐ์ง๋ก ์์ฑ๋ ํฉ์ฑ ์ด๋ฏธ์ง์ ์ง์ง ์ด๋ฏธ์ง๋ฅผ ๊ตฌ๋ถํ๋ ๊ฒ์ด๋ค.
generator์ ๋ชฉํ๋ discriminator๊ฐ ๊ทธ๊ฒ์ ์ง์ง๋ก ๋ฐ์๋ค์ด๋๋ก ์ด๋ฏธ์ง๋ฅผ ๋ง๋ค์ด๋ด๋ ๊ฒ์ด๊ณ , discriminator์ ๋ชฉํ๋ ๊ทธ ์์กฐ์๋ฅผ ์ก์๋ด๋ ๊ฒ์ด๋ค.
๋ ๋คํธ์ํฌ๋ ๋์์ ํจ๊ป ํ์ต๋๋ฉฐ, ๊ฐ ๋คํธ์ํฌ๊ฐ ์์ ์ ์ญํ ์ ์ ์ํํ๋๋ก ์ ๋ํ๋ ์ฌ๋ฌ loss function์ ํผํฉ์ ์ฌ์ฉํ๋ค.
์ด joint loss๋ ์๋์ ๊ฐ์ด ์ธ ์ ์๋ค.

{x_n}์ ํ์ค ์ธ๊ณ์ ํ์ต ์ด๋ฏธ์ง์ด๊ณ , {z_n}์ ์์์ ๋๋ค ๋ฒกํฐ๋ก ์์ฑ๊ธฐ G์ ์ ๋ ฅ๋์ด ํฉ์ฑ ์ด๋ฏธ์ง x_n์ ๋ง๋ค์ด๋ธ๋ค.
๋ํ {w_G, w_D}๋ ๊ฐ๊ฐ generator์ discriminator์ ํ๋ผ๋ฏธํฐ์ด๋ค.
์ด ์์ค์ ๊ทธ๋๋ก ์ต์ํํ๋ ๋์ , generator์ ๊ฐ์ค์น๋ ์์ค์ ๋ ๋ฒ์งธ ํญ๋ง ์ต์ํํ๋๋ก ์กฐ์ ํ๊ณ (generator๋ ์ฒซ ๋ฒ์งธ ํญ์๋ ์ํฅ์ ์ฃผ์ง ์๋๋ค.), discriminator์ ๊ฐ์ค์น๋ ๋ ํญ ๋ชจ๋๋ฅผ ์ต๋ํํ๋๋ก ์กฐ์ ํ๋ค.
discriminator์ ์ค๋ฅ๋ฅผ ์ต์ํํ๋ ๋ฐฉํฅ์ผ๋ก ํ์ตํ๋ฉฐ ์ด๋ฌํ ๊ณผ์ ์ minimax ๊ฒ์์ด๋ผ๊ณ ๋ถ๋ฅธ๋ค.

GAN, cGAN, infoGAN Deep Convolutional GAN(DCGAN)์ deconvoluiton ๋คํธ์ํฌ์ ๋ค์ชฝ ์ ๋ฐ์ ์ฌ์ฉํ์ฌ, ๋๋ค latent vector z์์ ์์ ํฌ๊ธฐ์ ์ด๋ฏธ์ง๋ก ๋งคํํ ์ ์๊ฒ ํ๊ณ , ๋ ๋ค์ํ ์ถ๋ ฅ์ ์์ฑํ ์ ์๋ค.
LAPGAN์ adversarial network๋ฅผ ๋ผํด๋ผ์์ ํผ๋ผ๋ฏธ๋ ํํ๋ก ์๋ ๋ฐฉ๋ฒ์ ์ฌ์ฉํ๋ค.
์๋ก ๋ค๋ฅธ latent vecotr๋ค ์ฌ์ด๋ฅผ ๋ธ๋ ๋ฉํ๊ฑฐ๋(๋๋ ํน์ ๋ฐฉํฅ์ผ๋ก๋ง ์กฐ๊ธ์ฉ ๊ต๋/์ด๋์ํค๋ฉด), ๊ทธ ์ค๊ฐ ๋จ๊ณ์ ํด๋นํ๋ ์ค๊ฐ(intermediate) ํฉ์ฑ ์ด๋ฏธ์ง๋ฅผ ๋ง๋ค์ด๋ผ ์ ์๋ค.
GAN๊ณผ DCGAN์ ํน์ ํด๋์ค์์ ์ ์ํ์ ์์ฑํ๋๋ก ํ์ต์ํฌ ์ ์์ง๋ง, ํ๋์ ํ์ต๋ ๋คํธ์ํฌ๋ก ์ฌ๋ฌ ํด๋์ค์ ์ํ์ ์์ฑํ ์ ์๋ค๋ฉด ๋ ์ ์ฉํ๋ค.
conditional GAN(cGAN)์ generator๊ณผ discriminator ๋ชจ๋์ ํด๋์ค ๋ฒกํฐ๋ฅผ ์ ๋ ฅ์ผ๋ก ๋ฃ๋ ๋ฐฉ์์ผ๋ก ์ด๋ฅผ ๋ฌ์ฑํ๋ค.
generator G๋ ์ด ๋ ๋ฒ์งธ ์ ๋ ฅ(ํด๋์ค ๋ฒกํฐ)์ ์กฐ๊ฑด์ ๊ฑธ์ด ์ถ๋ ฅ์ ๋ง๋ค๊ณ , discriminator D๋ ํด๋์ค ๋ฒกํฐ๋ฅผ ํจ๊ป ๋ฐ์, ์์ฑ๋ ์ด๋ฏธ์ง๊ฐ ๊ทธ ํด๋์ค์ ํด๋นํ๋ ์ง์ง์ธ์ง ๊ฐ์ง์ธ์ง ํ๋จํ๋ค.
infoGAN์ ์ถ๊ฐ์ ์ธ mutual information ํญ์ ์ฌ์ฉํด discriminator๊ฐ ํด๋์ค ๋ฒกํฐ์ ์๊ด๋ ํด๋์ค๋ฅผ ์์ธกํ๋๋ก ๋ง๋ค ์ ์๋ค.
MNIST์์์ ์ซ์ ๋ชจ์๊ณผ ํ๊ธฐ ์คํ์ผ, ํน์ ํฌ์ฆ์ ์กฐ๋ช ๊ฐ์ ์์์ฒ๋ผ ์๋ก ๋ถ๋ฆฌ๋ ํํ์ ํ์ตํ ์ ์๋ค.
๋ฌด์์ ์ด๋ฏธ์ง๋ฅผ ์์ฑํ๋ ๊ฒ์ ํ ์ค์ฒ ์์ฑ, ๊ตฌ๋ฉ ๋ฉ์ฐ๊ธฐ, ์ฌ์ง ์คํ์ผํ ๋ฑ ๋ค์ํ ๊ทธ๋ํฝ์ค ์์ฉ์ ์ ์ฉํ์ง๋ง, ์ฌ๋์ด ์์ ์ ์ผ๋ก ์ง์ ์ ์ดํ๋ฉด์ ์์ฑํ ์ ์๋ค๋ฉด ๋ ์ ์ฉํด์ง๋ค.
iGAN ์ธํฐ๋ํฐ๋ธ ์ด๋ฏธ์ง ํธ์ง ์์คํ ์ GAN์ ์ด์ฉํด ์ฌ์ง์ฒ๋ผ ํ์ค์ ์ธ ์ด๋ฏธ์ง๋ค์ ๋งค๋ํด๋๋ฅผ ํ์ตํ ๋ค, ์ฌ์ฉ์์ ํธ์ง ๊ฒฐ๊ณผ๊ฐ ์ด ๋งค๋ํด๋ ์์ ๋์ด๋๋ก ์ ์ฝํจ์ผ๋ก์จ ์ด๋ฅผ ๊ตฌํํ๋ค.
์ด ์ ๊ทผ์ ๋ค์ํ image-to-image ๋ณํ ๊ณผ์ ๋ก ์ผ๋ฐํ๋์๋ค.
pix2pix ์์คํ ์์๋ ์ค์ผ์น๋ ์๋งจํฑ ๋ผ๋ฒจ ๊ฐ์ ์ด๋ฏธ์ง๋ฅผ ์์ ๋ U-Net์ ์ ๋ ฅ์ผ๋ก ๋ฃ๊ณ , ์ด๋ฅผ ๋ค๋ฅธ ์๋ฏธ๋ ์คํ์ผ์ ๊ฐ์ง ์ด๋ฏธ์ง๋ก ๋ณํํ๋ค.
semantic image systhesis(์๋งจํฑ ์ด๋ฏธ์ง ํฉ์ฑ) : ์ ๋ ฅ์ด ์๋งจํฑ ๋ผ๋ฒจ ๋งต์ด๊ณ ์ถ๋ ฅ์ด ์ฌ์ง์ฒ๋ผ ์ฌ์ค์ ์ธ ์ด๋ฏธ์ง์ผ ๋
์ด ๋ณํ ๋คํธ์ํฌ๋ conditional GAN์ผ๋ก ํ์ต๋๋๋ฐ, ํ์ต ์์ ์ ๋ ๋๋ฉ์ธ์ ์ํ ์ง์ง์ด์ง ์ด๋ฏธ์ง๋ฅผ ์ฌ์ฉํ๊ณ , discriminator๋ ์ ๋ ฅ ์ด๋ฏธ์ง+ํฉ์ฑ๋ ์ด๋ฏธ์ง๊ฐ ์ง์ง ์์ธ์ง ๊ฐ์ง ์์ธ์ง๋ฅผ ํ๋จํ๋ค.
conditional GAN์์ ํด๋์ค c๋ ํ๋์ ํด๋์ค ID๊ฐ ์๋ ์ ์ฒด ์ด๋ฏธ์ง ์ ๋ ฅ์ด๋ฉฐ, generator G์ discriminator D ๋ชจ๋์ ์ ๋ ฅ๋๋ค.
discriminator๋ ์ด๋ฏธ์ง ์ ์ฒด์ ๋ํด ํ ๋ฒ์ ํ๋จํ๋ ๋์ , ์๋ก ๊ฒน์น๋ patch๋ค์ ๋ณด๊ณ patch ๋จ์๋ก real/fake rufwjddmf soflsek.
→ ํ์ํ ํ๋ผ๋ฏธํฐ ์๊ฐ ์ค๊ณ , ํ์ต ๋ฐ์ดํฐ๊ฐ ๋ ๋ง์์ง๋ฉฐ, ๋ ๊ตฌ์ฒด์ ์ธ ํ๋ณ ํผ๋๋ฐฑ์ ์ ๊ณตํ ์ ์๋ค.
๊ตฌํ์์๋ ๋๋ค ๋ฒกํฐ z๋ฅผ ๋ฐ๋ก ์ฐ์ง ์๊ณ , ํ์ต ์์ ํ ์คํธ(๋ณํ) ์ ๋ชจ๋ dropout์ ์ฌ์ฉํ๋ฉฐ ์ด๋ ๋คํธ์ํฌ์ ์ฌ๋ฌ ์์ค์์ ๋ ธ์ด์ฆ๋ฅผ ์ฃผ์ ํ๋ ๊ฒ๊ณผ ๊ฐ๋ค.
๋ง์ ๊ฒฝ์ฐ์๋ ์ง์ง์ด์ง ์ด๋ฏธ์ง๊ฐ ์ด์ฉ๊ฐ๋ฅํ์ง ์๋ค.
์) ์๋ก ๋ค๋ฅธ ์ฅ์์์ ์์ง๋ ๊ทธ๋ฆผ๊ณผ ์ฌ์ง์ ์ปฌ๋ ์ ์ด ์๊ฑฐ๋, ๋ ๊ฐ์ ์๋ก ๋ค๋ฅธ ๋๋ฌผ ํด๋์ค์ ์ํ ์ฌ์ง๋ค๋ง ์๋ ๊ฒฝ์ฐ
→ cycle-consistent adversarial network(Cycle-GAN)์ ์ฌ์ฉํ์ฌ ๋ ๋๋ฉ์ธ ์ฌ์ด์ ๋งคํ์ด ์๋ ์ ๋ ฅ์ ์ ์งํ๋๋ก ๋ง๋ค๋ฉด์๋, ์์ฑ๋ ์ด๋ฏธ์ง๊ฐ ํ์ต ์ด๋ฏธ์ง๋ค๊ณผ ์ง๊ฐ์ ์ผ๋ก ์ ์ฌํ๋๋ก ์๊ตฌํ ์ ์๋ค.
DualGAN๊ณผ DiscoGAN๋ ๋น์ทํ ์์ด๋์ด๋ฅผ ์ฌ์ฉํ๋ค.
BicycleGAN์ ๋ณํ ์ฌ์ดํด์ด๋ผ๋ ์ ์ฌํ ์์ด๋์ด๋ฅผ ์ด์ฉํด, ์ธ์ฝ๋ฉ๋ latent vector๋ค์ด ์ถ๋ ฅ ์ด๋ฏธ์ง์ ์๋ก ๋ค๋ฅธ ๋ชจ๋์ ๋์ํ๋๋ก ์ ๋ํจ์ผ๋ก์จ, ํด์ ๊ฐ๋ฅ์ฑ๊ณผ ์ ์ด์ฑ์ ๋์ธ๋ค.
'๐ฎ ์ด๊ฒ์ ๊ฒ ๊ณต๋ถ > โ๏ธ Computer Vision - Szeliski' ์นดํ ๊ณ ๋ฆฌ์ ๋ค๋ฅธ ๊ธ
โ๏ธ Computer vision - Szeliski 6์ฅ (2) โ๏ธ (1) 2026.02.12 โ๏ธ Computer vision - Szeliski 6์ฅ (1) โ๏ธ (0) 2026.02.11