-
โ๏ธ Computer vision - Szeliski 6์ฅ (1) โ๏ธ๐ฎ ์ด๊ฒ์ ๊ฒ ๊ณต๋ถ/โ๏ธ Computer Vision - Szeliski 2026. 2. 11. 13:24
6.1 Instance recognition
์ผ๋ฐ์ ์ธ object recognition์ instance recognition๊ณผ class recognition์ผ๋ก ๋๋๋ค.
instance recognition์ ์๋ ค์ง 2์ฐจ์, 3์ฐจ์์ rigid object๋ฅผ re-recognizeํ๋ ๊ฒ์ ํฌํจํ๋ค.
์ด๋ ๋ถ๋ถ์ ์ธ ๊ฐ๋ ค์ง๊ณผ ๋ณต์กํ ๋ฐฐ๊ฒฝ๊ณผ ํจ๊ป ์๋ก์ด ์์ ์์ ๋ฐ๋ผ๋ณผ ๊ฐ๋ฅ์ฑ์ด ์๋ค.
class recognition๋ ์นดํ ๊ณ ๋ฆฌ ์์ค ๋๋ ์ผ๋ฐ ๊ฐ์ฒด ์ธ์์ด๋ผ๊ณ ๋ ์๋ ค์ ธ ์์ผ๋ฉฐ, ํน์ ์ผ๋ฐ ํด๋์ค์ ๋ชจ๋ ์ธ์คํด์ค๋ฅผ ์ธ์ํ๋ ํจ์ฌ ๋ ์ด๋ ค์ด ๋ฌธ์ ์ด๋ค.
์๋ก์ด ์ด๋ฏธ์ง์ ๋ฐ์ดํฐ๋ฒ ์ด์ค์ ์ด๋ฏธ์ง ๋ชจ๋์์ informative sparse 2D features์ ์ถ์ถํ ํ, ์ด๋ฏธ์ง ํน์ง์ ๊ฐ์ฒด ๋ฐ์ดํฐ๋ฒ ์ด์ค์ ๋งค์นญ๋๋ฉฐ, ํฌ์ ํน์ง ๋งค์นญ ์ ๋ต ์ค ํ๋๋ฅผ ์ฌ์ฉํ๋ค.
์ถฉ๋ถํ ์์ match๊ฐ ๋ฐ๊ฒฌ๋ ๋๋ง๋ค, ๋ ๊ฐ์ geometric transformation์ ์ ๋ ฌํ๋ ๊ธฐํํ์ ๋ณํ์ ์ฐพ์ ๊ฒ์ฆ๋๋ค.
Geometric alignment
recognition system์ ๋จผ์ ๊ฐ ๋ฐ์ดํฐ๋ฒ ์ด์ค ์ด๋ฏธ์ง์์ ๊ด์ฌ ์ง์ ์งํฉ์ ์ถ์ถํ๊ณ , ์ฐ๊ด๋ ๋์คํฌ๋ฆฝํฐ(๋ฐ ์๋ ์์น)๋ฅผ search tree์ ๊ฐ์ indexing structure์ ์ ์ฅํ๋ค.
recognition time์ ์๋ก์ด ์ด๋ฏธ์ง์์ ํน์ง์ด ์ถ์ถ๋์ด ์ ์ฅ๋ ๊ฐ์ฒด ํน์ง๊ณผ ๋น๊ต๋๋ค.
์ฃผ์ด์ง ๊ฐ์ฒด์ ๋ํด ์ถฉ๋ถํ ๋ง์ matching featuers์ด ๋ฐ๊ฒฌ๋ ๋๋ง๋ค ์์คํ ์ match verification ๋จ๊ณ๋ฅผ ํธ์ถํ๋ค.
match verification ๋จ๊ณ์์๋ matching feature์ ๊ณต๊ฐ์ ๋ฐฐ์ด์ด DB ์ด๋ฏธ์ง์ ๋ฐฐ์ด๊ณผ ์ผ์นํ๋์ง ์ฌ๋ถ๋ฅผ ํ๋จํ๋ค.
์ด๋ฏธ์ง๊ฐ ๋งค์ฐ ๋ณต์กํ ์ ์๊ณ ์ ์ฌํ ํน์ง์ด ์ฌ๋ฌ object์ ์ํ ์ ์์ผ๋ฏ๋ก, origianl set of feature matches๋ ๋ง์ outliers๋ฅผ ๊ฐ์ง ์ ์๋ค.
→ Hough ๋ณํ์ ์ฌ์ฉํ์ฌ ๊ฐ๋ฅ์ฑ์ด ๋์ geometric transformation์ ๋ํ vote๋ฅผ ๋ชจ์ผ๋ ๋ฐฉ๋ฒ์ด ์ ์๋์๋ค.
DB object ์ฌ์ด์ scene feature ๋ชจ์ ์ฌ์ด์ affine transformation์ ์ฌ์ฉํ๋ฉฐ, ์ด๋ ๋๋ถ๋ถ ํ๋ฉด์ธ object๊ฑฐ๋ ์ ์ด๋ ์ฌ๋ฌ ํด๋น feature์ด quasi-planer geometry๋ฅผ ๊ณต์ ํ๋ ๊ฒฝ์ฐ์ ์ ์๋ํ๋ค.
๋ค๋ฅธ ์์คํ ์์ affine region detector๊ฐ rectify(๊ตญ๋ถ) local image patch๋ฅผ ๋ณด์ ํ๋ ๋ฐ ์ฌ์ฉ๋๋ฉฐ, ์ด๋ฅผ ํตํด SIFT descriptord์ 10x10 UV ์์ ํ์คํ ๋ฆฌ๊ทธ๋จ์ด ๋ชจ๋ ๊ณ์ฐ๋์ด ๋งคํ๊ณผ ์ธ์์ ํ์ฉ๋๋ค.
๋์ผ object์ ๋ค๋ฅธ view์ ์๋ ํด๋น patch์ ๊ทธ๋ค์ local affine deformation(๋ณํ)์ factorization(์ธ์๋ถํด) algorithm์ ํ์ฅ์ผ๋ก(์ดํ์ Euclidean reconstruction) ์ฌ์ฉ๋๋ ๊ฐ์ฒด์ ๋ํ 3D affine model์ ๊ณ์ฐํ๋ ๋ฐ ์ฌ์ฉ๋๋ค.
recognition time์ local Euclidean neighborhood constraint๋ ์ ์ฌ์ match๋ฅผ ํํฐ๋งํ๊ธฐ ์ํด ์ฌ์ฉ๋๋ค.
feature-based approaches๋ ์ผ๋ฐ์ ์ผ๋ก ์ฅ๋ฉด์์ ์๋ ค์ง ๊ฐ์ฒด๋ฅผ ๊ฐ์งํ๊ณ ์์น๋ฅผ ํ์ ํ๋ ๋ฐ ์ฌ์ฉ๋์ง๋ง, ์ด๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ์ฅ๋ฉด์ ํฝ์ -๋ ๋ฒจ segmentation์ ์ป์ ์ ์๋ค.
2000๋ ๋ ์ด์ค๋ฐ์ instnace recognition์ ์ด๋ฏธ์ง ๋ด์์ ์๋ ค์ง 3D ๊ฐ์ฒด์ ์์น๋ฅผ ์ฐพ๋ ๋ฌธ์ ์ ์ด์ ์ ๋ง์ถ์๋ค.
์ดํ์ instance retrieval(์ธ์คํด์ค ๊ฒ์, content-based image retrieval)์ ์ด์ ์ ๋ง์ถ์๋ค.
6.2 Image classification
6.2.1 Feature-based methods

ํน์ง๋ค์ ์ฒ์์ผ๋ก keypoint์์ ์ถ์ถ๋๊ณ ํ์ต๋ ์๊ฐ์ ๋จ์ด(feature cluster centers)์ ๋ํ ๋ถํฌ(ํ์คํ ๊ทธ๋จ)์ ์ป๊ธฐ ์ํด quantize๋๋ค.
์ด feature distribution historgram์ ๋ถ๋ฅ ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉ๋๋ ๊ฒฐ์ ๊ฒฝ๊ณ๋ฅผ ํ์ตํ๋ ๋ฐ ์ฌ์ฉ๋๋ค.
Bag of words
์ด ์๊ณ ๋ฆฌ์ฆ์ query ์ด๋ฏธ์ง์์ ๋ฐ๊ฒฌ๋ ์๊ฐ์ ๋จ์ด๋ค์ ๋ถํฌ(histogram)์ ๋จ์ํ ๊ณ์ฐํ๊ณ , ์ด ๋ถํฌ๋ฅผ training ์ด๋ฏธ์ง์์ ๋ฐ๊ฒฌํ ๊ฒ๊ณผ ๋น๊ตํ๋ค.
instance recognition๊ณผ์ ๊ฐ์ฅ ํฐ ์ฐจ์ด์ ์ geometric verification ๋จ๊ณ๊ฐ ์๋ค๋ ๊ฒ์ด๋ฉฐ, ์ด๋ ์ผ๋ฐ์ ์ธ ์๊ฐ ๋ฒ์ฃผ์ ๊ฐ๋ณ instance๊ฐ ํน์ง๊ณผ์ spatial coherence๊ฐ ์๋์ ์ผ๋ก ์ ๊ธฐ ๋๋ฌธ์ด๋ค.
category recognition์ ์ํ frequency-based ๊ธฐ์ ์ ์ ์ฉ์ฑ์ ์ ์ฆํ ์ฒซ ๋ฒ์งธ ์ ๊ทผ์ด๋ค.
feature vector๋ฅผ ์๊ฐ์ ๋จ์ด๋ก quantizeํ๋ ๋์ , ํฌ๊ธฐ๊ฐ ๊ฐ๋ณ์ ์ธ ๋ feature vector ์งํฉ ์ฌ์ด์ ๋๋ต์ ์ธ ๊ฑฐ๋ฆฌ๋ฅผ ์ง์ ๊ณ์ฐํ๋ ๊ธฐ์ ์ด ๊ฐ๋ฐ๋์๋ค.
feature vector๋ฅผ feature space์ ์ ์๋ multi-resolution pyramid(๋ค์ค ํด์๋ ํผ๋ผ๋ฏธ๋)์ ๋ฃ๊ณ , ํด๋น ๊ตฌ๊ฐ B_il ๊ณผ B'_il์ ์๋ ํน์ง ์๋ฅผ ์ธ๋ ๋ฐฉ๋ฒ์ด๋ค.
๋ ๊ฐ์ feature vector ์ฌ์ด์ ๊ฑฐ๋ฆฌ(๊ณ ์ฐจ์ ๊ณต๊ฐ์์์ ์ )๋ ํด๋น ๊ตฌ๊ฐ ์ฌ์ด์ histogram intersection์ ์ฌ์ฉํด ๊ณ์ฐ๋๋ค.
๊ฑฐ์น ๋ ๋ฒจ๊ณผ ์ธ๋ฐํ ๋ ๋ฒจ์์ ๋ชจ๋ ๋งค์นญ๋๋ฉด ์ค๋ณต์ด๋ ๊ฑฐ์น ๋ ๋ฒจ ๋งค์นญ์ ๋นผ๋ฉฐ, ๋์ ๋ ์ธ๋ฐํ ๋ ๋ฒจ์์์ ๋งค์นญ์ ๋ ํฐ ๊ฐ์ค์น๋ฅผ ์ค๋ค.
๋ค๋ฅธ ์ฐ๊ตฌ์์๋, affine region descriptor๋ฅผ ์ถ์ถํ๊ณ ์ด๋ฅผ ์๊ฐ์ ๋จ์ด๋ก quantizeํ๋ค.
(featurn descriptor๋ ์ด๋ฏธ์ง ์์ ์ ๊ท์น ๊ฒฉ์์์ ์กฐ๋ฐํ๊ฒ ๊ตฌ์ฑ๋๋ฉฐ, ํ ์ค์ฒ๊ฐ ์๋ ์์ญ์ ์ค๋ช ํ๋ ๋ฐ ๋์์ด ๋๋ค.)
๋จ์ด ์(ํ์คํ ๊ทธ๋จ)๋ฅผ ํฌํจํ๋ ๊ตฌ๊ฐ์ผ๋ก ๊ตฌ์ฑ๋ spatial pyramid๋ฅผ ํ์ฑํ๊ณ , ์ ์ฌํ pyramid match kernel์ ์ฌ์ฉํ์ฌ histogram intersection ํ์๋ฅผ ๊ณ์ธต์ ์ผ๋ก ๊ฒฐํฉํ๋ค.
quantized feature descriptior๊ณผ continuous descriptor ์ค ๋ญ๋ฅผ ์ฌ์ฉํ ์ง, ํฌ์์ ์ธ feature์ ์กฐ๋ฐํ feature ์ค ๋ญ๋ฅผ ์ฌ์ฉํ ์ง์ ๋ํ ๋ ผ์์ด ๊ณ์ ์ด์ด์ก๋ค.
์ฟผ๋ฆฌ ์ด๋ฏธ์ง๊ฐ ๊ฐ ํด๋์ค ์ด๋ฏธ์ง๋ง ๊ฐ๋ณ์ ์ผ๋ก ๋น๊ตํ๋ ๊ฒ์ด ์๋๋ผ ์ฃผ์ด์ง ํด๋์ค๋ฅผ ๋ํ๋ด๋ ๋ชจ๋ ํน์ง๊ณผ ๋น๊ต๋ ๊ฒฝ์ฐ, nearest-neighbor matching ๋ค์ naive Bayes classifier์ ์ ์ฉํ๋ ๊ฒ์ด quantized ์๊ฐ์ ๋จ์ด๋ณด๋ค ์ฑ๋ฅ์ด ์ข๋ค.
์ผ๋ฐ์ ์ธ feature detector์ descriptor๋ฅผ ์ฌ์ฉํ๋ ๋์ , randomized forest๋ feature generation๊ณผ image classification ๋จ๊ณ์ ๊ฒฐํฉ์ ์ฌ์ฉํ๊ธฐ๋ ํ๋ค.
์ต์ข ๋ถ๋ฅ์ biological (visual cortical(์๊ฐ ํผ์ง)) ์ฒ๋ฆฌ์ SVM์ ๊ฒฐํฉํ ๊ณ ๋ฐ๋ feature transform์ ๊ณ์ธต ๊ตฌ์กฐ๋ฅผ ์ฌ์ฉํ๊ธฐ๋ ํ๋ค.
Part-based models
object๋ฅผ ๊ทธ ๊ตฌ์ฑ์์์ geometric relationship์ ์ธก์ ํจ์ผ๋ก์จ ์ธ์ํ๋ ๋ฐฉ๋ฒ๋ ์๋ค.
์ผ๊ตด ์ธ์๊ณผ ๋ณดํ์ ์ธ์, ์์ธ ์ธก์ ์ ์ฃผ๋ก ์ฌ์ฉ๋๋ค.
geometric relationship์ ํํํ๊ธฐ ์ํ ๊ฐ์ฅ ์ด๊ธฐ ์ ๊ทผ๋ฒ์ pictorial structures๋ก, ์๋ก ๋ค๋ฅธ feature location ์ฌ์ด์ ์คํ๋ง๊ฐ์ ์ฐ๊ฒฐ๋ก ๊ตฌ์ฑ๋์๋ค.
pictorial structure๋ฅผ ์ด๋ฏธ์ง์ ์ ์ฉํ๋ ค๋ฉด energy function์ ๋ชจ๋ ์ ์ฌ์ ๋ถํ ์์น ๋๋ ํฌ์ฆ {l_i}์ ๋ํด ์ต์ํ๋๋ฉฐ, E์ ๊ฐ์ (๊ธฐํํ์ ๊ด๊ณ)์ด ์กด์ฌํ๋ (i,j) ๋ถํ ์์ ๋ํ ํญ๋ค๊ณผ ํจ๊ป ๊ณ ๋ ค๋๋ค.

part-based ๋ชจ๋ธ์ part ๊ฐ์ geometric ์ฐ๊ฒฐ์ ๋ํด ์๋ก ๋ค๋ฅธ topology๋ฅผ ๊ฐ์ง ์ ์๋ค.
์) ์ฐ๊ฒฐ์ ํธ๋ฆฌ๋ก ์ ํํ์ฌ ํ์ต ๋ฐ ์ถ๋ก ์ ๋ค๋ฃจ๊ธฐ ์ฝ๊ฒ ๋ง๋ ๋ค.
tree topology๋ ์ฌ๊ท์ ์ธ Viterbi(๋์ ํ๋ก๊ทธ๋๋ฐ) ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉ์ ๊ฐ๋ฅํ๊ฒ ํ๋ค.
์ด ์๊ณ ๋ฆฌ์ฆ์์๋ leaf node๋ฅผ ๋จผ์ ๋ถ๋ชจ์ ํจ์๋ก optimizeํ๊ณ , ๊ทธ ๊ฒฐ๊ณผ๊ฐ์ ์๋์ง ํจ์์์ ์ฝ์ ํ๊ณ ์ ๊ฑฐํ๋ค.
ํธ๋ฆฌ ํ ํด๋ก์ง๋ ์ฌ๊ท์ ์ธ Viterbi(๋์ ํ๋ก๊ทธ๋๋ฐ) ์๊ณ ๋ฆฌ์ฆ(Pearl 1988; Bishop 2006)์ ์ฌ์ฉ์ ๊ฐ๋ฅํ๊ฒ ํ๋ค.
์ด ์๊ณ ๋ฆฌ์ฆ์์๋ ์ ๋ ธ๋๋ฅผ ๋จผ์ ๋ถ๋ชจ์ ํจ์๋ก ์ต์ ํํ๊ณ , ๊ทธ ๊ฒฐ๊ณผ๊ฐ๋ค์ ์๋์ง ํจ์์์ ์ฝ์ ํ์ฌ ์ ๊ฑฐํฉ๋๋ค.(๋น์ฉ์ ๋ถ๋ชจ ๋น์ฉ์ ๋ํด ์๋ธํธ๋ฆฌ๋ฅผ ์ ์ด ์์ค๋ค.)
inference ์๊ณ ๋ฆฌ์ฆ์ ํจ์จ์ฑ์ ๋์ด๊ธฐ ์ํด, pairwise(์) ์๋์ง ํจ์ V_ij(l_i, l_j)๋ฅผ ์์น ๋ณ์๋ค์ ์ด๋ค ํจ์์ ๋ํ Mahalanobis ๊ฑฐ๋ฆฌ๋ก ์ ํํ ๋ค์, fast distance transform ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํ์ฌ ๊ฐ ์ ์ํธ์์ฉ์ N์ ๋ํด ์ ํ์ ๋ ๊ฐ๊น์ด ์๊ฐ ๋ณต์ก๋๋ก ์ต์ํํ๋ค.

๋ฐฐ๊ฒฝ ๋ถํ ์ ํตํด ์ป์ ์ด์ง ์ด๋ฏธ์ง์ ๊ด์ ์ด ์๋ ์ ์ฒด ๋ชจ๋ธ์ ๋ง์ถ๊ธฐ ์ํด pictorial structures ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํ ๊ฒฐ๊ณผ์ด๋ค.
๋ถํ์ด ๊ทผ์ฌ ์ง์ฌ๊ฐํ์ ์์น, ํฌ๊ธฐ ๋ฐ ๋ฐฉํฅ์ ๋ฐ๋ผ ๋งค๊ฐ๋ณ์ํ๋๋ค.
Unary matching potentials(๋จํญ ๋งค์นญ ์ ์) Vi(li)๋ ๊ฐ ๋ถ๋ถ์ ๋ํ๋ด๋ ๊ธฐ์ธ์ด์ง ์ฌ๊ฐํ ์ํ์ ์ ๊ฒฝ ๋ฐ ๋ฐฐ๊ฒฝ ํฝ์ ๋น์จ์ ๊ณ์ฐํ์ฌ ๊ฒฐ์ ๋๋ค.
part-based recognition์ ์ํด ๋ค์ํ graphical model์ด ๋ง์ด ์ ์๋์๋ค.
๊ทธ ์ค ํ๋๋ sparse flexible model์ด๋ค.
๋ถํ๋ค์ ์์ํํ๊ณ ๊ฐ ๋ถํ์ ์์น๊ฐ ์์ ์ ์กฐ์(ancestor) ๋ถํ๋ค ์์น ์ค ๋ง์์ผ k๊ฐ์๋ง ์์กดํ๋๋ก ํ๋ ๋ฐฉ์์ ํฌํจํ๋ค.
๊ฐ์ฅ ๋จ์ํ ๋ชจ๋ธ์ bags of words๋ก, ์๋ก ๋ค๋ฅธ part๋ ํน์ง๋ค ์ฌ์ด์ ๊ธฐํํ์ ๊ด๊ณ๊ฐ ์ ํ ์๋ค.
์ด๋ฐ ๋ชจ๋ธ์ ๋งค์ฐ ํจ์จ์ ์ผ ์ ์์ง๋ง, part๋ค์ ๊ณต๊ฐ์ ๋ฐฐ์น๋ฅผ ํํํ ์ ์๋ ๋ฅ๋ ฅ์ ๋งค์ฐ ์ ํ์ ์ด๋ค.
tree์ start๋ inference ์ธก๋ฉด์์ ๊ฐ์ฅ ํจ์จ์ ์ด๋ฏ๋ก ํ์ต ์ธก๋ฉด์์๋ ๊ฐ์ฅ ํจ์จ์ ์ด๋ค.
๋ค์์ผ๋ก ๋ณต์กํ ๋ชจ๋ธ์ directed acyclic graphs๋ก part ๋ชจ๋ธ์ ์ธ๊ณผ์ ๊ตฌ์กฐ๋ฅผ ๊ฐ์ ๋ก ๋ถ์ฌํด์ผ ํ๋ค๋ ๋น์ฉ์ด ๋ค๊ธด ํ์ง๋ง ์ฌ์ ํ ํจ์จ์ ์ธ inference๊ฐ ๊ฐ๋ฅํ๋ค.
fully conneted ๋ชจ๋ธ์ ๊ฐ์ฅ ์ผ๋ฐ์ ์ธ ํํ์ด์ง๋ง, ๋ถํ์ ์ P๊ฐ ์ค๊ฐ ์ ๋๋ง ๋์ด๋ feature์ ๊ฐ ๋ถํ์ ํ ๋นํ๋ ๋ฌธ์ ๊ฐ ๊ณ์ฐ์ ์ผ๋ก ๊ฐ๋นํ๊ธฐ ์ด๋ ค์์ง๋ค.
Contect and scene understanding
context๋ object recognition ์๊ณ ๋ฆฌ์ฆ์ ์ฑ๋ฅ์ ํฌ๊ฒ ํฅ์์ํฌ ์ ์์ผ๋ฉฐ, ์ผ๋ฐ์ ์ธ ์ฅ๋ฉด ์ดํด๋ฅผ ์ํ ์ ์ฉํ ์๋ฏธ๋ก ์ (semantic) ๋จ์๋ฅผ ์ ๊ณตํ ์ ์๋ค.
spatial ์ ๋ณด๋ฅผ recognition ์๊ณ ๋ฆฌ์ฆ์ ํตํฉํ๋ ๋ฐฉ๋ฒ์ spatial pyramid system๊ณผ ๊ฐ์ด ๋ค์ํ region์ ๊ฑธ์น feature statistics๋ฅผ ๊ณ์ฐํ๋ ๊ฒ์ด๋ค.
part-based ๋ชจ๋ธ์ object๋ฅผ ๊ตฌ์ฑํ๊ธฐ ์ํด ๋ค์ํ part๋ฅผ ์ ์ ํ ๊ธฐํํ์ ๊ด๊ณ๋ก ๋ฐฐ์ดํด์ผ ํ๋ ์ผ์ข ์ local context๋ฅผ ์ด์ฉํ๋ค.
context ๋ชจ๋ธ์ object๋ฅผ scene์ผ๋ก ๊ฒฐํฉํ๊ณ ๊ฐ ํด๋์ค์ ๊ตฌ์ฑ object์ ๊ฐ์๊ฐ ์ฌ์ ์ ์๋ ค์ ธ ์์ง ์๋ค๋ ์ ์์ part-based ๋ชจ๋ธ๊ณผ ๋ค๋ฅด๋ค.
์ค์ ๋ก, ๋์ ๋์ผํ recognition architecture๋ก ๊ฒฐํฉํ๋ ๊ฒ์ด ๊ฐ๋ฅํ๋ค.
๋ผ๋ฒจ์ด ๋ถ์ ์์ญ์ ๊ฐ์ง ํ์ต ์ด๋ฏธ์ง๊ฐ ์ถฉ๋ถํ ์๋ค๋ฉด, ์ด๋ค ์์์ ์๋์ ์์น๋ฅผ ์ค๋ช ํ๊ธฐ ์ํ ๊ธฐํํ์ ๋ชจ๋ธ์ ๊ฐ๋ฐํ ์ ์๋ค.
๊ด๋ จํ์ฌ ์ ์๋ ๋ชจ๋ธ์ two-level constellation ๋ชจ๋ธ์ด๋ค.
์์ ๋จ๊ณ์์๋ object๋ค์ด ์๋ก์ ๋ํด ๊ฐ๋ ์๋์ ๋ถํฌ๋ฅผ ๊ฐ์ฐ์์์ผ๋ก ๋ชจ๋ธ๋งํ๋ค.
ํ์ ๋จ๊ณ์์๋ object ์ค์ฌ์ ๋ํ part(affine covariant features)์ ๋ถํฌ๋ฅผ ๊ฐ์ฐ์์ ํผํฉ ๋ชจ๋ธ๋ก ํํํ๋ค.
scene ์ object์ ๊ฐ์์ ๊ฐ object ์์ ๋ถํ ๊ฐ์๋ ๋ฏธ๋ฆฌ ์ ์ ์์ผ๋ฏ๋ก, ์์ฑ์ (generative) ํ๋ ์์ํฌ์์ objcet์ part์ ์์ฑ ๊ณผ์ ์ ๋ชจ๋ธ๋งํ๊ธฐ ์ํด LDP(latent Dirichlet process)์ ์ฌ์ฉํ๋ค.
๋ชจ๋ object์ part์ ๋ํ ๋ถํฌ๋ ๋๊ท๋ชจ ๋ผ๋ฒจ๋ง ๋ฐ์ดํฐ๋ฒ ์ด์ค๋ก๋ถํฐ ํ์ต๋๋ฉฐ, ์ดํ ์ถ๋ก (์ธ์) ๋จ๊ณ์์ scene์ ์ด๋ฃจ๋ ์์๋ค์ ๋ผ๋ฒจ์ ๋ถ์ด๋ ๋ฐ ์ฌ์ฉ๋๋ค.
context์ ๋ ๋ค๋ฅธ ์๋ก๋ simultaneous segmentation๊ณผ recognition์์์ ๊ฒฝ์ฐ๊ฐ ์๋๋ฐ, scene ์ ์ฌ๋ฌ object๋ค์ ๋ฐฐ์น๊ฐ ๋ผ๋ฒจ๋ง ๊ณผ์ ์ ์ผ๋ถ๋ก ์ฌ์ฉ๋๋ค.
๊ฑด๋ฌผ๊ณผ ๋๋ก์ ์ถ์ ์์น๊ฐ ์๋์ฐจ ๊ฒ์ถ์ ์ํฅ์ ๋ฏธ์น๋ CRF(conditional random field)๊ฐ ์์ผ๋ฉฐ, boosting์ ์ฌ์ฉํด CRF์ ๊ตฌ์กฐ๋ฅผ ํ์ตํ๋ค๊ณ ํ๋ค.
CRF ๊ธฐ๋ฐ segmentation ๊ฒฐ๊ณผ๋ฅผ ๊ฐ์ ํ๊ธฐ ์ํด context๋ฅผ ํ์ฉํ๊ธฐ๋ ํ๋๋ฐ, ์ด๋ ์ด๋ค adjacencies(relationsships)๊ฐ ๋ค๋ฅธ ๊ฒ๋ณด๋ค ๋ ์์ฃผ/๊ทธ๋ด๋ฏํ๊ฒ ๋ฐ์ํ๋ค๋ ์ ์ ๋ฐ์ํ๋ ๊ฒ์ด๋ค.
object categorization์ context๋ฅผ ์ถ๊ฐํ๊ธฐ ์ํด ์ ์๋ ๋ค์ํ ์ ๊ทผ๋ฒ๋ค์ด ๊ฒํ ๋์์ผ๋ฉฐ, ์ธ๊ฐ-๊ฐ์ฒด ์ํธ์์ฉ(human-object interactions)์ด ์ฐ๊ตฌ๋์๋ค.
context๋ ๋จ์ผ ์ด๋ฏธ์ง๋ก๋ถํฐ์ 3D inference์๋ ์ฌ์ฉ๋๋ค.
์ปดํจํฐ ๋น์ ๊ธฐ๋ฒ์ ์ฌ์ฉํ์ฌ ํฝ์ ์ ์ง๋ฉด, ์์ง ํ๋ฉด ๋๋ ํ๋์ ์ํ๋ ๊ฒ์ผ๋ก ๋ผ๋ฒจ๋งํ๋ค.
์ด ์์ ์์ญ์ object identity, ์์น, surface orientations, occlusions ๋ฐ ์นด๋ฉ๋ผ ๊ด์ฐฐ ๋งค๊ฐ๋ณ์์ ๋ํด ๋์์ ์ถ๋ก ํ๋ ๋ณด๋ค ์ ์ฒด๋ก ์ (holistic) ์ ๊ทผ ๋ฐฉ์์ผ๋ก ํ์ฅ๋์๋ค.
์ฌ๋ฌ ์ ๊ทผ๋ฐฅ์์ scene์ gist๋ฅผ ์ฌ์ฉํด ํน์ object์ instances๊ฐ ์ด๋์ ๋ํ๋ ๊ฐ๋ฅ์ฑ์ด ๋์์ง ๊ฒฐ์ ํ๋ค.
์) ์ด๋ฏธ์ง์ gist๋ฅผ ๋ฐํ์ผ๋ก ๋ณดํ์, ์๋์ฐจ, ๊ฑด๋ฌผ ๊ฐ์ ๊ฐ์ฒด๋ค์ด ๋ํ๋ ์์ง ๋ฐฉํฅ ์์น๋ฅผ ์์ธกํ๋ regressor๋ฅผ ํ์ตํ๋ค.
์ด๋ ๊ฒ ์ป์ location distribution์ ๊ณ ์ ์ ์ธ object detector์ ํจ๊ป ์ฌ์ฉ๋์ด detector์ ์ฑ๋ฅ์ ํฅ์์ํค๋ ๋ฐ ์ฐ์ธ๋ค.
๋ํ gist๋ ์์ ํ ์ด๋ฏธ์ง๋ค์ ์ง์ ๋งค์นญํ๋ ๋ฐ์๋ ์ฌ์ฉ๋ ์ ์๋ค.
scene understanding ๋ถ์ผ์ ์ผ๋ถ ์ฐ๊ตฌ๋ ๋ผ๋ฒจ์ด ๋ถ์(ํน์ ๋ผ๋ฒจ์ด ์๋) ์ด๋ฏธ์ง๊ฐ ๋งค์ฐ ๋ง์ด ์กด์ฌํ๋ค๋ ์ ์ ํ์ฉํด ๊ฐ๋ณ object ๋จ์๊ฐ ์๋ ์ ์ฒด ์ด๋ฏธ์ง ๋จ์๋ก ์ง์ matching์ ์ํํ๋ค.
์ด๋ฏธ์ง๊ฐ ์์ฒด๊ฐ object๋ค ์ฌ์ด์ ๊ธฐ๋๋๋ ๊ด๊ณ๋ฅผ ์๋ฌต์ ์ผ๋ก(๋ด์ฌ์ ์ผ๋ก) ๋ด๊ณ ์๋ค๊ณ ๋ณธ๋ค.
6.2.2 Deep networks
fine-grained category recognition ๋ฌธ์ ๋ ์ฐ๊ตฌ๋์ด ์๋ค.
fine-grained category recognition์ ํ์ ๋ฒ์ฃผ๋ค ๊ฐ ์ฐจ์ด๊ฐ ์์ฃผ ๋ฏธ๋ฌํ ์ ์๊ณ , ํ์ต์ ์ธ ์ ์๋ exemplers ์๊ฐ ์ ์ ๊ฒฝ์ฐ๊ฐ ๋ง๋ค.
fine-grained categorization์ ์ด๋ฏธ์ง์ ํด๋์ค์ attribute๋ฅผ ์ด์ฉํด ์ ๊ทผํ๋ ๊ฒฝ์ฐ๊ฐ ๋ง๋ค.
attribute๋ฅผ ์ถ์ถํ๋ฉด zero-shot learning์ด ๊ฐ๋ฅํด์ง๋๋ฐ ์ด๋ ์ด์ ์ ๋ณธ ์ ์๋ ๋ณ์๋ ์ด๋ฌํ attribute๋ค์ ์กฐํฉ์ผ๋ก ์ค๋ช ํ ์ ์๊ฒ ๋๋ค.
์๋ก ๋ค๋ฅธ attribute๋ค ์ฌ์ด์ ๊ทธ๋ด๋ฏํด ๋ณด์ด์ง๋ง ์ค์ ๋ก๋ ์๋ฏธ ์๋(์ฐ์ฐํ) correlation์ ํ์ตํ์ง ์๋๋ก ์ฃผ์ํด์ผ ํ๋ค.
object์ ๊ทธ object๊ฐ ์์ฃผ ๋ฑ์ฅํ๋ ์ ํ์ context ์ฌ์ด์ ์ฐ์ฐํ correlation์ ํ์ตํ๋ ๊ฒฝ์ฐ์๋ ์ฃผ์๊ฐ ํ์ํ๋ค.
๋ํ fine-grained recognition์ metric learning, nearest-heighbor visual similarity search ๋ฑ์ผ๋ก๋ ์ ๊ทผํ ์ ์๋ค.
6.2.3 Application: Visual similarity search
์ปดํจํฐ ๋น์ ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํด ์ด๋ฏธ์ง๋ฅผ ์๋์ผ๋ก category๋ก ๋ถ๋ฅํ๊ณ attribute ํ๊ทธ๋ฅผ ๋ถ์ด๋ฉด, ์นดํ๋ก๊ทธ๋ ์น์์ ํด๋น ์ด๋ฏธ์ง๋ฅผ ๋ ์ฝ๊ฒ ์ฐพ์ ์ ์๋ค.
์ด๋ ์ด๋ฏธ์ง ๊ฒ์/์ด๋ฏธ์ง ๊ฒ์ ์์ง์์ ํํ ์ฌ์ฉ๋๋ ๋ฐฉ์์ผ๋ก, ์ผ๋ฐ ์น ๊ฒ์ ์์ง์ด ๊ด๋ จ ๋ฌธ์์ ํ์ด์ง๋ฅผ ํค์๋๋ก ์ฐพ๋ ๊ฒ์ฒ๋ผ, ํค์๋๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ๊ฐ๋ฅ์ฑ์ด ๋์ ์ด๋ฏธ์ง๋ฅผ ์ฐพ์์ค๋ค.
ํ์ํ ์ ๋ณด๋ฅผ ํค์๋๊ฐ ์๋๋ผ ์ด๋ฏธ์ง ์์ฒด๋ก ์ฐพ๋ ๊ฒ์ด ๋ ์ฌ์ธ ๋๋ ์๋ค. (visual search)
์) fine-grained categorization, instance retrieval (๋๊ฐ์ ๋ฌผ์ฒด๋ ๊ฐ์ ์ฅ์๋ฅผ ์ฐพ์๋ด๋ ์์ )
๊ฒ์ ์๋๋ฅผ ๋ง๋ก ๊ฐ๋จํ ํํํ๊ธฐ ์ด๋ ค์ธ ๋๋ visual similarity search(reverse image search)๋ฅผ ์ฌ์ฉํ๋ค.
์ด ๋ถ์ผ์ ์ด๊ธฐ ์ฐ๊ตฌ๋ค์ ์ฃผ๋ก ์์๊ณผ ํ ์ค์ฒ ๊ฐ์ ๊ฐ๋จํ whole-image similarity metrics์ ๊ธฐ๋ฐํ๋ค.
์ดํ์ ์ํคํ ์ฒ๋ค์ feature-based learning๊ณผ recognition ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํด ์ ํต์ ์ธ keyword-based image search engine์ ์ถ๋ ฅ ๊ฒฐ๊ณผ๋ฅผ re-rank(์ฌ์ ๋ ฌ)ํ๋ค.
PLSA(probabilistic latest semantic analysis)์ ํ์ฅํ ๋ฐฉ๋ฒ์ ์ด์ฉํด ์ด๋ฏธ์ง ๊ฒ์ ๊ฒฐ๊ณผ๋ฅผ clusteringํ ๋ค, ์์ ์์ ๊ฒฐ๊ณผ๋ค๊ณผ ์ฐ๊ด๋ ํด๋ฌ์คํฐ๋ฅผ ์ ํํ์ฌ ํด๋น ๋ฒ์ฃผ๋ฅผ ๋ํํ๋ ์ด๋ฏธ์ง๋ค๋ก ์ผ๋๋ค.
์ ๊ตํ๊ฒ ์ฃผ์ ์ฒ๋ฆฌ๋ ์ด๋ฏธ์ง DB์ ์์กดํ๋ ์ ๊ทผ๋ค๋ ์๋ค.
์) query ์ด๋ฏธ์ง๋ฅผ ์ฃผ๋ฉด ์ ์ฌํ LabelMe ์ด๋ฏธ์ง๋ฅผ ์ฐพ์์ฃผ๋ ์์คํ ์ ์ค๋ช ํ๋ค.
feature-based corresponce ์๊ณ ๋ฆฌ์ฆ๊ณผ labeled DB๋ฅผ ๊ฒฐํฉํ์ฌ recognition๊ณผ segmentation์ ๋์์ ์ํํ๋ ์ ๊ทผ๋ ์๋ค.
visual similarity search์ ๋ ์ต์ ์ ๊ทผ์ whole-image descriptor(Fisher kernel, VLAD(Vector of Locally Aggregated Descriptors)), pooled CNN activations(ํ๋ง๋ CNN ํ์ฑ๊ฐ)์ metric learning๊ณผ ๊ฒฐํฉํ์ฌ ๊ฐ ์ด๋ฏธ์ง๋ฅผ ์์ถ๋ descriptor๋ก ํํํ๋ค.
์ด๋ ๊ฒ ์ป์ descriptor์ ๋๊ท๋ชจ DB์์ ์ด๋ฏธ์ง ๊ฐ ์ ์ฌ๋ ์ธก์ ์ ์ฌ์ฉ๋๋ค.
๋ฅ ๋คํธ์ํฌ์ VLAD, generalized mean(GeM) pooling, danamic mean(DAME) pooling๊ณผ ๊ฐ์ ์ฌ๋ฌ ๊ธฐ๋ฒ์ ๊ฒฐํฉํด ์ ์ฒด ์์คํ ์ end-to-end๋ก ํ๋ ๊ฐ๋ฅํ ์์ ํ ์์คํ ์ผ๋ก ๋ง๋ค ์๋ ์๋ค.
image retrieval์ ์ํ ์ต์ ๊ธฐ๋ฒ๋ค ์ค ์ผ๋ถ๋ local descriptor์ global descriptor๋ฅผ ์กฐํฉํ์ฌ, landmark recognition ๊ณผ์ ์์ ์ต์ฒจ๋จ(state-of-the-art) ์ฑ๋ฅ์ ๋ฌ์ฑํ๋ค.
category recognition์ ๋ํด visual similarity search๋ฅผ ์ฌ์ฉํ๋ ์์ฉ ์์คํ ์ ์๋ก GrokNet ์ ํ ์ธ์ ์๋น์ค๊ฐ ์๋ค.
์ฌ์ฉ์๊ฐ ์ฌ๋ฆฐ ์ด๋ฏธ์ง์ ์ผํ ์ง์๋ฅผ ์ ๋ ฅ์ผ๋ก ๋ฐ์, ์ง์ ์ด๋ฏธ์ง์ ์๋ ๋ฌผ๊ฑด๊ณผ ์ ์ฌํ ์ํ(์ธ๋ฑ์ฑ๋ ์์ดํ )์ ์ฐพ์ ๋ฐํํ๋ค.
๋กฑํ ์ผ(long-tail) ์ํ์ด ๋๋ฌด ๋ง์์, ๋ชจ๋ ๋ฌผ๊ฑด์ ์์ ํ๊ฒ ๋ฒ์ฃผํ(์นดํ ๊ณ ๋ฆฌ๋ก ๋ถ๋ฅ)ํ๋ ๋ฐฉ์๋ง์ผ๋ก๋ ํ์ค์ ์ผ๋ก ์ฒ๋ฆฌํ๊ธฐ ์ด๋ ต๋ค.
training time์ GrokNet์ category ๋ฐ/๋๋ attribute ๋ผ๋ฒจ์ด ๋ถ์ด ์๋ weakly labeled ์ด๋ฏธ์ง๋ค๊ณผ, unlabeled ์ด๋ฏธ์ง๋ฅผ ๋ชจ๋ ์ฌ์ฉํ๋ค.
unlabeled ์ด๋ฏธ์ง์์๋ object ๋ด๋ถ์ feature๋ฅผ ๊ฒ์ถํ ๋ค, ์ด๋ฅผ ์ด์ฉํด matric learning์ ์ํํ๋ค.
์ด๋ ArcFace loss๋ฅผ ๋ณํํ ์์ค๊ณผ ์๋ก์ด ๋ง์ง ์์ค์ ์ด์ฉํ๋ค.
์ ์ฒด ์์คํ ์ ๋๊ท๋ชจ์ unlabeled ์ด๋ฏธ์ง์ attribute softmax ์์ค, embedding์ ๋ํด ์๋ก ๋ค๋ฅธ ์ธ ๊ฐ์ง metric ์์ค์ ํจ๊ป ์ฌ์ฉํด ํ์ตํ๋ค.
6.2.4 Face recognition
face recognizer์ ๋ค์ํ ์์ธ(pose), ์กฐ๋ช (illumination), ํ์ (expression) ์กฐ๊ฑด(PIE)์์ ์ดฌ์๋ ์ผ๊ตด ์ด๋ฏธ์ง๊ฐ ์ฃผ์ด์ง ๋ ๊ฐ์ฅ ์ ๋์ํ๋ค.
face recognition์ ๊ฐ์ฅ ์ด๊ธฐ ์ ๊ทผ๋ค ์ค ์ผ๋ถ๋ ๋๋๋ฌ์ง image feature(๋, ์ฝ, ์ )์ ์ฐพ๊ณ , ๊ทธ feature location ์ฌ์ด์ ๊ฑฐ๋ฆฌ๋ฅผ ์ธก์ ํ๋ ๋ฐฉ์์ด์๋ค.
๋ ๋ค๋ฅธ ์ ๊ทผ๋ค์ gray-level image๋ฅผ eigenfaces(๊ณ ์ ์ผ๊ตด)์ด๋ผ ๋ถ๋ฆฌ๋ ์ ์ฐจ์ subspaces์ ํฌ์ํ ๋ค ์ด๋ฅผ ๋น๊ตํ๊ฑฐ๋, active appearance model์ ์ด์ฉํด shpae์ appearance์ ๋ณํ๋ฅผ ํจ๊ป ๋ชจ๋ธ๋งํ๋ ๋ฐฉ์์ ์์กดํ๋ค.
Active appearance and 3D shape models
face recognition์์ modular ๋๋ view-vased eigenspaces(๊ณ ์ ๊ณต๊ฐ)์ ์ฌ์ฉํด์ผ ํ ํ์์ฑ์ด ์๋ค.
์ผ๊ตด์ ์ธ๊ด๊ณผ ์๋ณ ๊ฐ๋ฅ์ฑ์ ์์ด๋ ํ ์ค์ฒ๋งํผ ํํ์๋ ์์กดํ๋ค๋ ๊ฒ์ด๋ค.
3D ๋จธ๋ฆฌ ํ์ ์ ๋ค๋ฃฐ ๋์๋, recogniiton์ ์ํํ ๋ ์ฌ๋ ๋จธ๋ฆฌ์ ์์ธ ์ํฅ์ ๊ฐ๋ฅํ ์ ๊ฑฐ(๋ณด์ )ํด์ผ ํ๋ค.
๊ฐ์ฅ ์ด๊ธฐ face recognition system์ ์ผ๊ตด ์ด๋ฏธ์ง์์ ๋์ ๋๋ ํน์ง์ ์ ์ฐพ์๋ธ ๋ค์, ๊ทธ ํน์ง์ ๋ค์ ์๋์ ์์น๋ ๊ฑฐ๋ฆฌ ์ ๋ณด๋ฅผ ๋ฐํ์ผ๋ก recognition์ ์ํํ๋ค.
์ดํ ๊ธฐ๋ฒ๋ค๋ก๋ local feature analysis, elastic bunch graph๊ฐ ์๋๋ฐ, ์ด๋ค์ ๋๋๋ฌ์ง ํน์ง ์์น์์์ ๋ก์ปฌ ํํฐ ์๋ต์ ํํ ๋ชจ๋ธ๊ณผ ํจ๊ผ ๊ฒฐํฉํ์ฌ face recognition์ ์ํํ๋ค.
ํํ์ ํ ์ค์ฒ(์/์ธ๊ด)์ feature์ perception์ ์ค์ํ ์ํฅ์ ๋ฏธ์น๋ค.
facial feature์ ์ค๊ณฝ์ ์ ์๋์ผ๋ก ์ถ์ ํ ๋ค, ์ค๊ณฝ์ ์ ์ด์ฉํด ๊ฐ ์ด๋ฏธ์ง์ ๊ธฐ์ค์ด ๋๋(canonical) ํํ๋ก normalize(warp)ํ๋ค.
ํ๊ท ์ผ๋ก๋ถํฐ์ ํธ์ฐจ๋ฅผ ๊ธฐ์ค์ผ๋ก ํํ ์ด๋ฏธ์ง์ ์์ ์ด๋ฏธ์ง๋ฅผ ๋ชจ๋ ๋ถ์ํด, ํน์ ํ ํํ, ์์์ ๋ณํ(deformation)์ด personal feature(์. ์ฑ๋ณ)๊ณผ ์ฐ๊ด๋ ์ ์์์ด ๋ณด์ฌ์ก๋ค.
identity๋ expression(ํ์ ) ๋๋ฌธ์ ๋ฐ์ํ๋ ์ผ๊ตด ์ธ๊ด์ ๋ณํ๋ฅผ ๋ชจ๋ธ๋งํ๊ธฐ ์ํด, shape deformation(ํํ ๋ณํ)์ texture interpolation(ํ ์ค์ฒ ๋ณด๊ฐ)์ ๋์์ ์ฌ์ฉํ๋ ๋ฐฉ๋ฒ์ ์ผ๋ค.
→ Active Shape Models, 3D Morphable Models, Elastic Bunch Graph Matching ๊ฐ์ ๊ธฐ๋ฒ์ด ๋ฐ์ ํ๋ค.
Active Appearance Models์ ์ด๋ฏธ์ง์ ํํ s์ ๋ณํ(์ด๋ฏธ์ง์์ key feature point์ ์์น๋ก ์ธ์ฝ๋ฉ๋๋ค.)์, ๋ถ์ํ๊ธฐ ์ ์ ๊ธฐ์ค์ด ๋๋(canonical) ํํ๋ก normalize๋ ํ ์ค์ฒ t์ ๋ณํ ๋ชจ๋๋ฅผ ๋ชจ๋ธ๋งํ๋ค.
ํํ์ ํ ์ค์ฒ๋ ๊ฐ๊ฐ ํ๊ท ํํ bar_s์ ํ๊ท ํ ์ค์ฒ bar_t๋ก๋ถํฐ์ ํธ์ฐจ๋ก ํํ๋๋ค.

U_s์ U_t์ eigenvector๋ค์ pre-scaled(whitened)๋์ด ์์ด์, a์์์ unit vector๊ฐ ํ์ต ๋ฐ์ดํฐ์์ ๊ด์ธก๋ ๋ณ๋์ ํ์คํธ์ฐจ์ 1์ ํด๋นํ๋๋ก ๋์ด ์๋ค.
์ด๋ฌํ pricipal deformation๋ค์ ๋ํด, ํํ parameter๋ค์ ์ฃผ์ด์ง ์ผ๊ตด์ ์์น, ํฌ๊ธฐ, ๋ฐฉํฅ์ ๋ง์ถ๊ธฐ ์ํด global similarity transform์ ํตํด ๋ณํ๋๋ค.
๋ง์ฐฌ๊ฐ์ง๋ก ํ ์ค์ฒ ์ด๋ฏธ์ง์๋ ์๋ก์ด ์กฐ๋ช ์กฐ๊ฑด์ ๊ฐ์ฅ ์ ๋ง์ถ๊ธฐ ์ํ scale๊ณผ offset์ด ํฌํจ๋๋ค.
๋์ผํ appearance parameter a๊ฐ ํ๊ท ์ผ๋ก๋ถํฐ์ shape deformation๊ณผ texture deformation์ ๋์์ ์ ์ดํ๋๋ฐ, ๋ deformation์ด ์๋ก ์๊ด๋์ด ์๋ค๊ณ ๋ณผ ์๋ ์๋ค.
Active Appearance Models(AAM)์ ์ฃผ๋ก ์ผ๊ตด์ ํน์ง์ ์ธ appearance ๋ณํ์ ๋ณํ์ ๋ค์์ฑ์ ์ ํํ ํฌ์ฐฉํ๋๋ก ์ค๊ณ๋์์ง๋ง, ์กฐ๋ช , ์์ธ, ํ์ ๊ฐ์ ๋ค๋ฅธ ๋ณ๋ ์์ธ๋ค๋ก๋ถํฐ identity์ ์ํ variation์ ๋ถ๋ฆฌํ๋ identity subspace๋ฅผ ๊ณ์ฐํจ์ผ๋ก์จ face recognition์๋ ์์ฉํ ์ ์๋ค.
๊ธฐ๋ณธ ์์ด๋์ด๋ eigenfaces์์์ ์ ์ฌํ ์ฐ๊ตฌ๋ฅผ ๋ณธ๋ฌ ๊ฒ์ผ๋ก, intrapersonal variation(๋์ผ ์ธ๋ฌผ ๋ด ๋ณ๋)๊ณผ extrapersonal variation(์ธ๋ฌผ ๊ฐ ๋ณ๋)์ ๋ํด ๊ฐ๊ฐ ๋ณ๋์ ํต๊ณ๋ฅผ ๊ณ์ฐํ ๋ค, ์ด ๋ subspace์์ ์ฌ๋์ ๊ตฌ๋ถํ๋(๋ณ๋ณ๋ ฅ ์๋) ๋ฐฉํฅ๋ค์ ์ฐพ๋ ๊ฒ์ด๋ค.
AAM์ด recognition์ ์ง์ ์ฌ์ฉ๋๊ธฐ๋ ํ์ง๋ง, recognition ๋งฅ๋ฝ์์์ ์ฃผ๋ ์ฉ๋๋ ์ผ๊ตด์ canonical pose๋ก ์ ๋ ฌํ๋ ๋ฐ ์๋ค.
์ ๋ ฌ๋ ์ผ๊ตด์ ๋ํด, ์ ํต์ ์ธ face recognition ๋ฐฉ๋ฒ๋ค์ ์ฌ์ฉํ ์ ์๋ค.
Active Appearance Models(AAM)์ ์กฐ๋ช ๋ฐ ์์ (viewpoint) ๋ณํ๋ฟ๋ง ์๋๋ผ occlusion(๊ฐ๋ฆผ)๊น์ง ๋ค๋ฃฐ ์ ์๋๋ก ํ์ฅ๋์๋ค.
๊ทธ์ค ํ๋๋ 3D shape model์ ๊ตฌ์ถํ๋ ๊ฒ์ผ๋ก, ์์ธ๊ฐ ํฌ๊ฒ ๋ณํ๋ ์ํฉ์์ ์ผ๊ตด ์ธ๊ด์ ์ ์ฒด์ ์ธ ๋ณ๋์ฑ์ ํจ์ฌ ๋ ์ ํฌ์ฐฉํ๊ณ ์ค๋ช ํ ์ ์๋ค.
์ด๋ฌํ ๋ชจ๋ธ์ monocular view sequences๋ก๋ถํฐ ๊ตฌ์ฑํ ์ ์๊ณ ์ฌ๊ตฌ์ฑ๊ณผ ์ถ์ ์์ ๋ ๋์ ์ ๋ขฐ๋์ ์ ํ๋๋ฅผ ์ ๊ณตํ๋ multi-view video sequences๋ก๋ถํฐ ๊ตฌ์ฑํ ์๋ ์๋ค.
Facial recognition using deep learning
๋ฅ ์ ๊ฒฝ๋ง ๋ฐฑ๋ณธ์ ์ฌ์ฉํ DeepFace ์์คํ ์์๋ ๋ ๋จ๊ณ์ ๊ณผ์ ์ด ์๋ค.
๋๋๋งํฌ ๊ธฐ๋ฐ pre-processing frontalization step์ ํตํด ์๋์ ์ปฌ๋ฌ ์ด๋ฏธ์ง๋ฅผ ์ ํฌ๋กญ๋ ์ ๋ฉด ์ผ๊ตด ์ด๋ฏธ์ง๋ก ๋ณํํ๋ค.
๊ทธ ๋ค์์๋ (convolution kernel์ด ๊ณต๊ฐ ์์น์ ๋ฐ๋ผ ๋ฌ๋ผ์ง ์ ์๋) deep locally conttected network๋ฅผ ํต๊ณผ์ํจ ํ classification ์ ์ ๋ง์ง๋ง ๋ ๊ฐ์ fully connected layers์ ์ ๋ ฅํ๋ค.
์ต๊ทผ deep facial recognizer ์ผ๋ถ๋ frontalization ๋จ๊ณ๋ฅผ ์๋ตํ๊ณ , data augmentation(๋ฐ์ดํฐ ์ฆ๊ฐ)์ ์ฌ์ฉํด ๋ ๋ค์ํ ํฌ์ฆ๋ฅผ ๊ฐ์ง syntetic input์ ๋ง๋ค์ด๋ธ๋ค.
triplet loss๋ฅผ ์ฌ์ฉํด subject ์์ ๋ฌด๊ดํ low-dimensional embedding space๋ฅผ ๊ตฌ์ฑํ๋ค.
softmax์์ ์๊ฐ์ ๋ฐ์ contrastive loss๋ฅผ ์ฌ์ฉํ๋ ๊ฒฝ์ฐ๋ ์๋ค.
์ด๋ visual similarity search, face recognition์ผ๋ก ๋ ํ์ฅ๋์๋ค.
Personal photo collections
์ผ๊ตด์ ์นด๋ฉ๋ผ์์ ๋ฑ์ ๋๋ฆฌ๊ณ ์๊ฑฐ๋, ๋ค๋ฅธ ๋ฌผ์ฒด์ ๊ฐ๋ ค์ ธ ์์ ๋ ๋ฑ์ ์ฐพ๊ฑฐ๋ ์ธ์ํ๊ธฐ ์ด๋ ค์ธ ์ ์๋ค.
์ด๋ฐ ์ํฉ์์๋ facial recognition์ person detection, clothes recognition๊ณผ ๊ฒฐํฉํ๋ ๊ฒ์ด ํจ์จ์ ์ด๋ค.
๋๋ location recognition์ด๋ activity ๋๋ event recognition๊ณผ ๊ฒฐํฉํ๋ ๋ฐฉ๋ฒ๋ ์๋ค.
6.3 Object detection
๋จ์ฒด ์ฌ์ง ๊ฐ์ ์ด๋ฏธ์ง๋ฅผ ๋ถ์ํ๊ธฐ ์ํด์๋ ์ด๋ฏธ์ง์์ ๊ฐ๋ฅํ ๋ชจ๋ sub-window์ ๋ํด recognition ์๊ณ ๋ฆฌ์ฆ์ ์ ์ฉํด ๋ณผ ์๋ ์์ง๋ง, ๊ทธ๋ฐ ์๊ณ ๋ฆฌ์ฆ์ ๋์ฒด๋ก ๋๋ฆฌ๊ณ ์ค๋ฅ๊ฐ ๋ง๋ค.
→ ํน์ ๋ฌผ์ฒด๊ฐ ๋ํ๋ ๋ฒํ ์์ญ์ ๋น ๋ฅด๊ฒ ์ฐพ์๋ด๋ ์ผ์ ์ ๋ดํ๋ ํน์ ๋ชฉ์ detector๋ฅผ ๋ง๋๋ ๊ฒ ๋ ํจ๊ณผ์ ์ด๋ค.
6.3.1 Face detection
์ด๋ฏธ์ง์ facial recognition์ ์ ์ฉํ๋ ค๋ฉด, ์ด๋ฏธ์ง ์์ ์๋ ์ผ๊ตด๋ค์ ์์น์ ํฌ๊ธฐ๋ฅผ ์ฐพ์์ผ ํ๋ค.
์์น์ ์ผ๋ก๋ ๋ชจ๋ ํฝ์ ์์น์ ๋ชจ๋ ์ค์ผ์ผ์ ๋ํด ์๊ณ ๋ฆฌ์ฆ์ ์ ์ฉํด์ผ ํ์ง๋ง ๋๋ฌด ๋๋ฆฌ๋ค.
fast face dection ๊ธฐ์ ์ feature-based, template-based, appearance-based๋ก ๋๋๋ค.
feature-based(ํน์ง ๊ธฐ๋ฐ) ์ ๊ทผ๋ฒ์ ๋๋๋ฌ์ง image feature(๋, ์ฝ, ์ )์ ์์น๋ฅผ ์ฐพ๊ณ , ์ด feature๋ค์ด ๊ทธ๋ด๋ฏํ geometrical ๋ฐฐ์น๋ฅผ ์ด๋ฃจ๋์ง๋ฅผ ๊ฒ์ฆํ๋ค.
์ด ๊ธฐ๋ฒ์๋ ์ด๊ธฐ face recognition ์ ๊ทผ๋ฟ๋ง ์๋๋ผ, modular eigenspaces, local felter jets, SVM, boosting์ ๊ธฐ๋ฐํ ์ ๊ทผ๋ค๋ ํฌํจ๋๋ค.
template-based(ํ ํ๋ฆฟ ๊ธฐ๋ฐ) ์ ๊ทผ๋ฒ์ (์. AAM) ์์ธ์ ํ์ ์ ๋ค์ํ ๋ณํ๋ฅผ ํญ๋๊ฒ ๋ค๋ฃฐ ์ ์๋ค.
ํ์ง๋ง ๋ณดํต ์ค์ ์ผ๊ตด ๊ทผ์ฒ์์์ ์ข์ initialization์ด ํ์ํ๋ฏ๋ก, ๋น ๋ฅธ face detector๋ก๋ ์ ์ ํ์ง ์๋ค.
appearance-based(์ธ๊ด ๊ธฐ๋ฐ) ์ ๊ทผ๋ฒ์ ์ด๋ฏธ์ง ์์ ์์ ์ง์ฌ๊ฐํ patch๋ค์ ์๋ก ๊ฒน์น๊ฒ ํ์ฌ ์ ๋ฒ์๋ก ์ค์บํ๋ฉด์, ์ผ๊ตด์ผ ๊ฐ๋ฅ์ฑ์ด ๋์ ํ๋ณด ์์ญ์ ์ฐพ๋๋ค.
์ดํ์๋ ๊ณ์ฐ ๋น์ฉ์ ๋ ๋ค์ง๋ง ๋ ์ ํ์ ์ธ ๊ฒ์ถ ์๊ณ ๋ฆฌ์ฆ์ ๋จ๊ณ์ ์ผ๋ก ์ ์ฉํ๋ cascade๋ฅผ ์ด์ฉํด ํ๋ณด๋ฅผ ์ ๊ตํํ ์ ์๋ค.
์ค์ผ์ผ(ํฌ๊ธฐ) ๋ณํ์ ๋์ํ๊ธฐ ์ํด, ์ด๋ฏธ์ง๋ค์ ๋ณดํต sub-octave pyramid๋ก ๋ณํ๋๊ณ ๊ฐ ๋ ๋ฒจ๋ง๋ค ๋ณ๋์ ์ค์บ์ ์ํํ๋ค.
๋๋ถ๋ถ์ appearance-based ์ ๊ทผ๋ฒ์ labeled face patch์ non-face patch ์งํฉ์ ์ฌ์ฉํด ๋ถ๋ฅ๊ธฐ๋ฅผ ํ์ต์ํค๋ ๋ฐ์ ์์กดํ๋ค.
labeled ์ผ๊ตด patch ์งํฉ๊ณผ, ์ผ๊ตด์ด ํฌํจ๋์ง ์์ ๊ฒ์ผ๋ก ์๋ ค์ง ์ด๋ฏธ์ง์์ ์ถ์ถํ patch ์งํฉ์ ์์งํ๋ค.
์์ง๋ ์ผ๊ตด ์ด๋ฏธ์ง์ ๋ํด ์ข์ฐ ๋ฐ์ , ํ์ , ์ค์ผ์ผ ๋ณํ, ์์ ์ด๋ ๋ฑ์ ์ธ์์ ์ผ๋ก ์ ์ฉํด data augmentation์ ์ํํ์ฌ face detector๊ฐ ์ด๋ฌํ ๋ณํ์ ๋ ๋ฏผ๊ฐํ๋๋ก ๋ง๋ ๋ค.

Clustering and PCA
์ผ๊ตด ํจํด๊ณผ ๋น์ผ๊ตด ํจํด์ pre-processingํ ๋ค, k-means๋ฅผ ์ฌ์ฉํด ๊ฐ ๋ฐ์ดํฐ์ ์ 6๊ฐ์ cluster๋ก ๊ตฐ์งํํ๊ณ , ์ด 12๊ฐ cluster ๊ฐ๊ฐ์ ๋ํด PCA subspaces๋ฅผ ์ ํฉ์ํจ๋ค.
detection time์์ DIFS, DFFS ์ธก์ ๊ฐ์ ์ฌ์ฉํด (cluster ๋น 2๊ฐ์ฉ) ์ด 24๊ฐ์ Mahalanobis ๊ฑฐ๋ฆฌ ์ธก์ ๊ฐ์ ๊ณ์ฐํ๋ค.
์ด๋ ๊ฒ ์ป์ 24๊ฐ์ ์ธก์ ๊ฐ์ multi-layer perpectron(MLP), ์ฆ fully connected neural network์ ์ ๋ ฅ์ผ๋ก ๋ฃ๋๋ค.
Neural networks
๋ฐ์ดํฐ๋ฅผ ๋จผ์ clusteringํ๊ณ cluster ์ค์ฌ๊น์ง์ Mahalanobis ๊ฑฐ๋ฆฌ๋ฅผ ๊ณ์ฐํ๋ ๋์ , ํ์์กฐ ๊ฐ๋๊ฐ์ผ๋ก ์ด๋ฃจ์ด์ง 20x20 ํฝ์ patch์ ์ ๊ฒฝ๋ง(MLP)๋ฅผ ์ง์ ์ ์ฉํ๋ค.
์ด๋ ๋ค์ํ ํฌ๊ธฐ์ ์์์ receptive field๋ฅผ ์ฌ์ฉํ์ฌ ํฐ ์ค์ผ์ผ ๊ตฌ์กฐ์ ๋ ์์ ์ค์ผ์ผ ๊ตฌ์กฐ๋ฅผ ๋ชจ๋ ํฌ์ฐฉํ๋ค.
์ด๋ ๊ฒ ๊ตฌ์ฑ๋ ์ ๊ฒฝ๋ง์ multi-resolution pyramid์์ ๋ชจ๋ ๊ฒน์น๋ patch์ ์ค์ฌ ์์น์ ์ผ๊ตด์ด ์์ likehood(๊ฐ๋ฅ๋)๋ฅผ ์ง์ ์ถ๋ ฅํ๋ค.
์ผ๊ตด ๊ทผ์ฒ์์๋ (๊ณต๊ฐ์ ์ผ๋ก๋, ํด์๋ ์ธก๋ฉด์ผ๋ก๋) ์ฌ๋ฌ ๊ฒน์น๋ patch๊ฐ ๋์์ ๋ฐ์ํ ์ ์์ผ๋ฏ๋ก, ๊ฒน์ณ์ ๋์จ ๊ฒ์ถ ๊ฒฐ๊ณผ๋ฅผ ํ๋๋ก ํฉ์น๊ธฐ ์ํด ์ถ๊ฐ์ ์ธ mergine ๋คํธ์ํฌ๋ฅผ ์ฌ์ฉํ๋ค.
์ฌ๋ฌ ๊ฐ์ ๋คํธ์ํฌ๋ฅผ ํ์ต์ํจ ๋ค ๊ทธ ์ถ๋ ฅ๋ค์ ๊ฒฐํฉํ๋ ๋ฐฉ๋ฒ๋ ์๋ค.
Support vector machines
patch๋ฅผ ๋ถ๋ฅํ๋ ๋ฐ neural network๋ฅผ ์ฌ์ฉํ๋ ๋์ , support vector machine(SVM)์ ์ฌ์ฉํ์ฌ pre-processing๋ patch๋ค์ ๋ถ๋ฅํ๋ค.
SVM์ feature space์์ ์๋ก ๋ค๋ฅธ ํด๋์ค๋ฅผ ๊ตฌ๋ถํ๋ maximum margin seperating plane๋ค์ ์ฐพ๋๋ค.
linear classification boundary๋ก ์ถฉ๋ถํ์ง ์์ ๊ฒฝ์ฐ์๋ kernel์ ์ด์ฉํด feature space๋ฅผ ๋ ๋์ ์ฐจ์์ feature๋ก ์ฌ๋ ค non-linear classification์ ์ํํ ์ ์๋ค.
SVM์ face detection, face recognition๋ฟ๋ง ์๋๋ผ general object recognition์๋ ์ฌ์ฉ๋์ด ์๋ค.
Boosting
์ ์ ๋ ๋ณ๋ณ๋ ฅ์ด ๋์ simple classifier๋ค์ ์ฐ์์ ์ผ๋ก ํ์ต์ํจ ๋ค ๊ทธ ์ถ๋ ฅ๋ค์ ๊ฒฐํฉ(blending)ํ๋ ๋ฐฉ์์ด๋ค.
classifier h(x)๋ฅผ ์ฌ๋ฌ ๊ฐ์ ๋งค์ฐ ๋จ์ํ week learner์ ํฉ์ผ๋ก ๊ตฌ์ฑํ๋ ๋ฐฉ๋ฒ์ด๋ค.
๊ฐ weak learner h_j(x)๋ ์ ๋ ฅ์ ๋ํด ๊ทนํ ๋จ์ํ ํจ์์ด๋ฏ๋ก, ๊ทธ๊ฒ ํ๋๋ง์ผ๋ก๋ ๋ถ๋ฅ ์ฑ๋ฅ์ ํฌ๊ฒ ๊ธฐ์ฌํ์ง ์๋๋ค.

boosting์ ๋๋ถ๋ถ ๋ณํ์์๋ weak learner๊ฐ threshold(์๊ณ๊ฐ) ํจ์์ด๋ฉฐ, decision stump๋ผ๊ณ ๋ ๋ถ๋ฆฐ๋ค. (decision tree์ ๊ฐ๋ฅํ ํ ๊ฐ์ฅ ๋จ์ํ ํํ)

๋๋ถ๋ถ์ ๊ฒฝ์ฐ ์ ํต์ ์ผ๋ก a_j์ b_j๋ฅผ ±1๋ก ์ค์ ํ๋ค.
์ฆ a_j = -s_j, b_j = +s_j๋ก ๋์ด, ์ ํํด์ผ ํ ๊ฒ์ ํน์ง f_j, ์๊ณ๊ฐ θ_j, ์๊ณ๊ฐ์ ๊ทน์ฑ(polarity) s_j ∈ {±1}๋ง ๋จ๋๋ก ํ๋ค.
booting์ ๋ง์ ์์ฉ์์ feature์ ๋จ์ํ ์ขํ์ถ x_k (์ ๋ ฅ ๋ฒกํฐ์ ๊ฐ ์ฑ๋ถ ์์ฒด)์ธ ๊ฒฝ์ฐ๊ฐ ๋ง๋ค.
boosting ์๊ณ ๋ฆฌ์ฆ์ ์ ๋ ฅ ๋ฒกํฐ์ ์ฑ๋ถ๋ค ์ค ํ๋๋ฅผ ๊ณจ๋ผ ๊ทธ ๊ฐ์ threshold๋ฅผ ์ ์ฉํ๋ ๋ฐฉ์์ผ๋ก weak learner์ ์ ํํ๋ค.
feature์ ์ ๋ ฅ patch ๋ด์ ์ง์ฌ๊ฐํ ์์ญ๋ค ์ฌ์ด์ ์ฐจ์ด๋ก ์ ์ํ๋ฉด ๋จ์ผ ํฝ์ ๋ณด๋ค ๋ ๋ณ๋ณ๋ ฅ์ด ์์ผ๋ฉด์ summed area table(๋์ ํฉ ํ ์ด๋ธ)์ ๋ฏธ๋ฆฌ ๊ณ์ฐํด ๋์์ ๋ ๋งค์ฐ ๋น ๋ฅด๊ฒ ๊ณ์ฐํ ์ ์๋ค.
์ด๋ฏธ์ง ํฝ์ ์๋ฅผ N์ด๋ผ ํ ๋ O(N)์ pre-processing ๋น์ฉ๋ง ๋ค์ด๋ฉด ์ดํ ์ง์ฌ๊ฐํ ์์ญ๋ค์ ํฉ/์ฐจ๋ ๋ง์ ํน์ ๋บ์ 4r๋ฒ์ผ๋ก ๊ณ์ฐํ ์ ์๋ค. (r ∈ {2, 3, 4}์ ํด๋น feature์ ๊ตฌ์ฑํ๋ ์ง์ฌ๊ฐํ์ ๊ฐ์)
boosting ์ฑ๊ณต์ ํต์ฌ์ weak learner๋ฅผ ์ ์ง์ ์ผ๋ก ์ ํํ๋ ๋ฐฉ๋ฒ๊ณผ, ๊ฐ ๋จ๊ณ๊ฐ ๋๋ ๋๋ง๋ค training example๋ค์ re-weightingํ๋ ๋ฐฉ๋ฒ์ ์๋ค.
AdaBoost ์๊ณ ๋ฆฌ์ฆ์ ๊ฐ ๋จ๊ณ์์ ์ํ์ด ์ฌ๋ฐ๋ฅด๊ฒ ๋ถ๋ฅ๋์๋์ง ์ฌ๋ถ์ ๋ฐ๋ผ ์ํ์ re-weightingํ๊ณ , ๋จ๊ณ๋ณ ํ๊ท ๋ถ๋ฅ ์ค๋ฅ๋ฅผ ์ด์ฉํด weak learner ์ฌ์ด์ ์ต์ข weight α_j๋ฅผ ๊ฒฐ์ ํ๋ค.
detector์ ์๋๋ฅผ ๋ ๋์ด๊ธฐ ์ํด classifier cascade๋ฅผ ๋ง๋ค ์ ์๋ค.
๊ฐ classifier๋ ์์์ ํ ์คํธ๋ง ์ฌ์ฉํด ๋๋ถ๋ถ์ non-face๋ฅผ ๋น ๋ฅด๊ฒ ๊ธฐ๊ฐํ๊ณ , ๊ฐ๋ฅํ ์ผ๊ตด ํ๋ณด๋ ์ต๋ํ ํต๊ณผ์ํค๋๋ก ์ค๊ฒํ๋ค.
Deep networks
feature cascade, deformable(๋ณํ ๊ฐ๋ฅํ) parts model, aggregated(์ง๊ณ๋) channel features, ์ ๊ฒฝ๋ง ๊ธฐ๋ฐ ๋ฐฉ๋ฒ๋ค์ด ์ ์๋์ด ์๋ค.
6.3.2 Pedestrian detection
detection์ ์ผ๋ฐ์ ์ธ class recognition์ ๋ ์ด๋ ค์ด ๋ณํ์ผ๋ก ๋ณด๊ณ , object์ ์์น์ ๋ฒ์๋ฅผ ๊ฐ๋ฅํ ํ ์ ํํ๊ฒ ๊ฒฐ์ ํ๋ ๊ฒ์ ๋ชฉํ๋ก ํ๋ค.
๋๋ฆฌ ์๋ ค์ง pedestrian detection์ ์๋ก ๊ฒน์น๋๋ก ๋ฐฐ์น๋ Histogram of Oreinted Gradients(HOG) descriptor๋ค์ ์ ๋ ฅ์ผ๋ก ํ์ฌ SVM์ ๋ฃ๋ ๋ฐฉ์์ด๋ค.
๊ฐ HOG๋ ํน์ ๋ฐฉํฅ์์์ gradient์ ๋ํด magnitude๋ก ๊ฐ์ค๋ vote๋ฅผ ๋์ ํ๋ cell๋ค๋ก ๊ตฌ์ฑ๋๋๋ฐ ์ด๋ SIFT(Scale-invariant Feature Transform)์์์ ์ ์ฌํ๋ค.
SIFT๊ฐ interest point ์์น์์๋ง ๊ณ์ฐ๋๋ ๊ฒ๊ณผ ๋ฌ๋ฆฌ, HOG๋ ๊ท์น์ ์ธ ๊ฒฉ์ ์์์ ์๋ก ๊ฒน์น๊ฒ ํ๊ฐ๋๋ฉฐ, descriptor์ ํฌ๊ธฐ๋ ๋ ๊ฑฐ์น coarser grid๋ฅผ ์ด์ฉํด ์ ๊ทํ๋๋ค.
๋ํ HOG๋ ๋จ์ผ ์ค์ผ์ผ๊ณผ ๊ณ ์ ๋ ๋ฐฉํฅ์์๋ง ๊ณ์ฐ๋๋ค.
์ฌ๋ ์ค๊ณฝ์ ์ฃผ๋ณ์ ๋ฏธ๋ฌํ ๋ฐฉํฅ ๋ณํ๋ฅผ ํฌ์ฐฉํ๊ธฐ ์ํด ๋ฐฉํฅ bin์ ๋ง์ด ์ฌ์ฉํ๊ณ central-difference(์ค์์ฐจ๋ถ) ๋ฐฉ์์ gradient ๊ณ์ฐ์๋ smoothing์ ์ํํ์ง ์๋๋ค.
HOG descriptor๋ฅผ ๊ณ์ฐํ ๋ค์๋ ์ด๋ ๊ฒ ์ป์ด์ง ๊ณ ์ฐจ์ ์ฐ์ descriptor ๋ฒกํฐ๋ค๋ก SVM์ ํ์ต์ํจ๋ค.

b-c๋ ๊ฐ ๋ธ๋ก์์ ์์ ๊ฐ์ค์น์ ์์ ๊ฐ์ค์น๊ฐ ์ด๋ป๊ฒ ๋ถํฌํ๋์ง๋ฅผ ๋ณด์ฌ์ค๋ค.
f-g๋ ๊ฐ์ด๋ฐ ์ ๋ ฅ ์ด๋ฏธ์ง์ ๋ํด ํด๋น ๊ฐ์ค์น๊ฐ ์ ์ฉ๋ HOG ์๋ต์ ๋ณด์ฌ์ค๋ค.
์ฌ๋์ ๋จธ๋ฆฌ, ๋ชธํต, ๋ฐ ์ฃผ๋ณ์๋ ์์ ์๋ต์ด ๋ง์ด ๋ํ๋๊ณ ์์ ์๋ต์ ์๋์ ์ผ๋ก ์ ์ผ๋ฉฐ ์ค์จํฐ์ ๊ฐ์ด๋ฐ ๋ถ๋ถ๊ณผ ๋ชฉ ์ฃผ๋ณ์ ๋ํ๋๋ค.
HOG ๊ธฐ๋ฐ person detector์ flexible part model์ ํฌํจํ์๋ค.
๊ฐ part๋ ์ ์ฒด object ๋ชจ๋ธ๋ณด๋ค ํผ๋ผ๋ฏธ๋์์ ๋ ๋จ๊ณ ๋ ์๋ ๋ ๋ฒจ(๋ ๋์ ํด์๋)์์ ๊ณ์ฐ๋ HOG ์์์ ํ์ต๋๊ณ ๊ฒ์ถ๋๋ฉฐ, ๋ถ๋ชจ ๋ ธ๋(์ ์ฒด ๋ฐ์ด๋ฉ ๋ฐ์ค)์ ๋ํ ๋ถํ๋ค์ ์๋์ ์์น๋ ํ์ต๋์ด recognition ๊ณผ์ ์์ ์ฌ์ฉ๋๋ค.
training example์ ๋ฐ์ด๋ฉ ๋ฐ์ค๊ฐ ๋ถ์ ํํ๊ฑฐ๋ ์ผ๊ด๋์ง ์์ ๋ฌธ์ ๋ฅผ ๋ณด์ํ๊ธฐ ์ํด ๋ถ๋ชจ ๋ฐ์ด๋ฉ ๋ฐ์ค์ ์ง์ง ์์น๋ฅผ latent(์ ์ฌ) variable๋ก ๊ฐ์ฃผํ๊ณ , training๊ณผ recognition ๋จ๊ณ ๋ชจ๋์์ ์ด๋ฅผ ์ถ๋ก ํ๋ค.
part๋ค์ ์์น ๋ํ latent variable์ด๋ฏ๋ก training data์ part ๋ผ๋ฒจ์ด ์์ด๋ semi-supervised ๋ฐฉ์์ผ๋ก ์์คํ ์ ํ์ตํ ์ ์๋ค.

์ฌ๋์ ์์ธ์ ์์น๋ฅผ ๋ ์ ํํ๊ฒ ์ถ์ ํ๊ธฐ ์ํด HOG ์์ ๊ตฌ์ถํ random forests๋ฅผ ์ฌ์ฉํ์ฌ, ๋ณดํ ์ฃผ๊ธฐ์์์ ๋จ๊ณ์ ๊ฐ๋ณ ๊ด์ ์์น๋ฅผ ๋ชจ๋ ๊ณ์ฐํ๋ค.
๋น๋์ค sequence๋ฅผ ์ฌ์ฉํ ์ ์๋ ๊ฒฝ์ฐ์๋ optical flow(๊ด๋ฅ)์ motion discontinuities(์ด๋ ๋ถ์ฐ์)์ ๋ด๊ธด ์ถ๊ฐ ์ ๋ณด๊ฐ ๊ฒ์ถ ์์ ์ ๋์์ด ๋ ์ ์๋ค.
6.3.3 General object detection
Precision vs recall
object detection์ ํต์ฌ ๊ณผ์ ๋ ๋ชจ๋ object๋ฅผ ์ ํํ ๋ฐ์ด๋ฉ ๋ฐ์ค๋ก ๋๋ฌ์ธ๊ณ , ๊ทธ object๋ค์ ๋ผ๋ฒจ์ ์ฌ๋ฐ๋ฅด๊ฒ ๋ถ์ด๋ ๊ฒ์ด๋ค.
๊ฐ ๋ฐ์ด๋ฉ ๋ฐ์ค๊ฐ ์ผ๋ง๋ ์ ํํ์ง๋ฅผ ์ธก์ ํ๊ธฐ ์ํด IoU(intersetion over union)์ด ํํ ์ฐ์ด๋ฉฐ, Jaccard index, Faccard similarity coefficient๋ผ๊ณ ๋ถ๋ฆฐ๋ค.
IoU๋ ์ด๋ค object์ ๋ํด ์์ธก ๋ฐ์ด๋ฉ ๋ฐ์ค B_pr๊ณผ ์ ๋ต ๋ฐ์ด๋ฉ ๋ฐ์ค B_gt๋ฅผ ๋๊ณ , ๋ ๋ฐ์ค์ ๊ต์งํฉ ์์ญ ๋ฉด์ ์ ํฉ์งํฉ ์์ญ ๋ฉด์ ์ผ๋ก ๋๋ ๋น์จ์ ๊ณ์ฐํด ๊ตฌํ๋ค.

object detection์ ๋จผ์ ๊ทธ๋ด๋ฏํ ์ง์ฌ๊ฐํ ํ๋ณด ์์ญ๋ค(๊ฒ์ถ ๊ฒฐ๊ณผ)๋ฅผ ์ฌ๋ฌ ๊ฐ ์ ์ํ ๋ค์, ๊ฐ ํ๋ณด๋ฅผ ๋ถ๋ฅํ๊ณ ๋์์ confidence score๋ ์ถ๋ ฅํ๋ ๋ฐฉ์์ผ๋ก ๋์ํ๋ค.
๋ค์์ผ๋ก ์ด ํ๋ณด๋ค์ non-maximal suppression(NMS) ๋จ๊ณ๋ก ๋ค์ด๊ฐ๋๋ฐ, ์ฌ๊ธฐ์ ๊ฐ์ฅ ๋์ ์ ๋ขฐ๋๋ถํฐ ์ ํํ๋ greedy ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํด, ๊ฐํ ๊ฒ์ถ๊ณผ ๋๋ฌด ๋ง์ด ๊ฒน์น๋ ์ฝํ ๊ฒ์ถ๋ค์ ์ ๊ฑฐํ๋ค.
object detector์ ์ฑ๋ฅ ํ๊ฐ๋ฅผ ์ํด ๊ฒ์ถ ๊ฒฐ๊ณผ๋ค์ confidence(์ ๋ขฐ๋)๊ฐ ๋์ ๊ฒ๋ถํฐ ๋ฎ์ ๊ฒ ์์๋ก ๋ชจ๋ ํ์ด๋ณด๋ฉฐ, ๊ฐ ๊ฒ์ถ์ TP, FP๋ก ๋ถ๋ฅํ๋ค.
TP๋ ๋ผ๋ฒจ์ด ๋ง๊ณ IoU๊ฐ ์ถฉ๋ถํ ํฐ ๊ฒฝ์ฐ์ด๊ณ , FP๋ ๋ผ๋ฒจ์ด ํ๋ฆฌ๊ฑฐ๋ ํด๋น ์ ๋ต object๊ฐ ์ด๋ฏธ ๋ค๋ฅธ ๊ฒ์ถ์ ์ํด ๋งค์นญ๋ ๊ฒฝ์ฐ์ด๋ค.
confidence threshold๋ฅผ ์ ์ ๋ฎ์ถฐ๊ฐ๋ฉฐ, ๊ทธ๋๊ทธ๋์ precision(์ ๋ฐ๋)์ recall(์ฌํ์จ)์ ๊ณ์ฐํ ์ ์๋ค.
P๋ positive example์ ๊ฐ์์ด๋ค.

๋ชจ๋ confidence threshold์์ precision๊ณผ recall์ ๊ณ์ฐํ๋ฉด precision-recall curve๋ฅผ ๋ง๋ค ์ ์๋ค.
๊ณก์ ์๋ ๋ฉด์ ์ average precision(AP)๋ผ๊ณ ๋ถ๋ฅธ๋ค.
๊ฒ์ถํ๋ ๊ฐ ํด๋์ค๋ง๋ค AP๋ฅผ ๋ฐ๋ก ๊ณ์ฐํ ์ ์๊ณ , ์ด๋ฅผ ํ๊ท ๋ด๋ฉด mean AP๋ฅผ ์ป๋๋ค.
AP ์ ์๋ ์ฌ์ ํ ๋๋ฆฌ ์ฐ์ด์ง๋ง, ํ๋ฅ ๊ธฐ๋ฐ์ ๋์ ํ๊ฐ ์งํ๋ก probability-based detection quality(PDQ)๊ฐ ์ ์๋์๋ค.
AP๋ฅผ ๋ ๋งค๋๋ฝ๊ฒ ๋ง๋ ๋ฒ์ ์ธ Smooth-AP๋ ์ ์๋์๋ค.
Modern object detectors
์ด๋ฏธ์ง์์ object๋ฅผ ๊ฒ์ถํ๋ ์ฒซ ๋จ๊ณ๋ classifier๋ฅผ ์ ์ฉํด ๋ณผ ๋งํ ๊ทธ๋ด๋ฏํ ์ง์ฌ๊ฐํ ํ๋ณด ์์ญ๋ค์ ์ ์ํ๋ ๊ฒ์ด๋ค.

์๋ R-CNN์ด๋ค.
๋จผ์ selective search ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํด 2,000๊ฐ์ ํ๋ณด ์์ญ์ ์ถ์ถํ๋ค.
๊ทธ ๋ค์ ๊ฐ ํ๋ณด ์์ญ์ 224x224 ํฌ๊ธฐ์ ์ ์ฌ๊ฐํ ์ด๋ฏธ์ง๋ก rescale(warp)ํ ๋ค, AlexNet ๋๋ VGG ์ ๊ฒฝ๋ง์ ํต๊ณผ์ํค๊ณ ๋ง์ง๋ง์ SVM ๋ถ๋ฅ๊ธฐ๋ก ๋ถ๋ฅํ๋ค.

์๋ Fast R-CNN์ด๋ค.
convolutional neural metwork์ region extraction ๋จ๊ณ๋ฅผ ์๋ก ๋ฐ๊พธ๊ณ (๋จผ์ ์ ์ฒด ์ด๋ฏธ์ง์ ๋ํด CNN ํน์ง์ ๊ณ์ฐํ ๋ค์ ๊ทธ ํน์ง์์ ํ๋ณด ์์ญ์ ๋ฝ์๋ธ๋ค.) SVM ๋์ fully connected layer๋ค์ ์ฌ์ฉํ๋ค.
์ด fully connected layer๋ค์ object zmffotm ์์ธก๊ณผ ๋ฐ์ด๋ฉ ๋ฐ์ค ๋ณด์ (refinement)๋ฅผ ํจ๊ป ๊ณ์ฐํ๋ค.
์ด๋ ๊ฒ ํ๋ฉด CNN ๊ณ์ฐ์ ์ฌ๋ฌ ํ๋ณด ์์ญ์ ์ฌ์ฌ์ฉํ ์ ์์ด ํ์ต ๋ฐ ํ ์คํธ ์๊ฐ์ด ํจ์ฌ ๋นจ๋ผ์ง๋, ์ด์ ๋คํธ์ํฌ๋ค์ ๋นํด ์ ํ๋๊ฐ ํฌ๊ฒ ๊ฐ์ ๋๋ค.
Fast R-CNN์ ํ๋์ shared backbone๊ณผ ๋ ๊ฐ์ ๋ถ๋ฆฌ๋ head๋ฅผ ๊ฐ์ง ๋ฅ ๋คํธ์ํฌ์ ์์ด๋ฉฐ, ๋ ๊ฐ์ง ์๋ก ๋ค๋ฅธ loss function์ ๊ฐ๋๋ค.
Faster R-CNN์ ๋น๊ต์ ๋๋ฆฐ selective search ๋จ๊ณ๋ฅผ Region Proposal Network(RPN)์ผ๋ก ๋์ฒดํ์ฌ, ์ถ๋ก ์๋๋ฅผ ํฌ๊ฒ ๋์ธ๋ค.
convolutional featrues์ ๊ณ์ฐํ ๋ค, RPN์ ๊ฐ ๊ฑฐ์น ์์น๋ง๋ค ์ฌ๋ฌ ๊ฐ์ ์ ์ฌ์ anchor box๋ฅผ ์ ์ํ๋๋ฐ, ์ด anchor๋ค์ ๋ค์ํ object๋ฅผ ์์ฉํ ์ ์๋๋ก ๋ชจ์๊ณผ ํฌ๊ธฐ๊ฐ ์๋ก ๋ค๋ฅด๊ฒ ์ค์ ๋๋ค.
์ดํ ๊ฐ ์ ์์ Fast R-CNN์ head๋ฅผ ํตํด ๋ถ๋ฅ๋๊ณ ๋ฐ์ด๋ฉ ๋ฐ์ค๊ฐ refine๋๋ฉฐ, ์ต์ข ๊ฒ์ถ ๊ฒฐ๊ณผ๋ ์ ์์ ๋ฐ๋ผ ์์๊ฐ ๋งค๊ฒจ์ง๊ณ non-maximal suppression(๋น์ต๋ ์ต์ )๋ฅผ ํตํด ๋ณํฉ๋๋ค.
R-CNN, Fast R-CNN, Faster R-CNN์ ๋ชจ๋ single resolution convolutional feature map์์ ๋์ํ๋ค.
๋ ๋์ scale invariance(์ค์ผ์ผ ๋ถ๋ณ์ฑ)์ ์ป๊ธฐ ์ํด์๋ ์ด๋ฏธ์ง ํผ๋ผ๋ฏธ๋์ ๊ฐ ๋ ๋ฒจ์์ feature map์ ๊ณ์ฐํ๋ ๋ฑ ์ฌ๋ฌ ํด์๋ ๋ฒ์์์ ๋์ํ๋ ํธ์ด ๋ฐ๋์งํ์ง๋ง, ์ด๋ ๊ณ์ฐ ๋น์ฉ์ด ํฌ๋ค.
๋ค์ convolutional network ๋ด๋ถ์ ์ฌ๋ฌ ์ธต์ ํ์ฉํ ์๋ ์์ง๋ง, ์ด ์ธต๋ค์ semantic abstraction(์๋ฏธ์ ์ถ์ํ) ์์ค์ด ์๋ก ๋ค๋ฅด๋ค. ๋ ๋์(๋ ๋ฎ์) ๋ ๋ฒจ์ผ์๋ก ๋ ์ถ์์ ์ธ ๊ฐ๋ ์ ๋ง์ถฐ์ ธ ์๋ค.
→ Feature Pyramod Network(FPN)์ ๊ตฌ์ฑํ์ฌ ํด๊ฒฐํ๋ค.
top-down ์ฐ๊ฒฐ์ ์ฌ์ฉํ์ฌ ๋์ ๋ ๋ฒจ์์ ์ถ๋ก ๋ ์๋ฏธ ์ ๋ณด๋ฅผ ๋ ๋์ ํด์๋(๋ ์๋) ํผ๋ผ๋ฏธ๋ ๋ ๋ฒจ์ ์ ๋ฌํ๋ค.
์ด๋ฌํ ์ถ๊ฐ ์ ๋ณด๋ object detector์ ์ฑ๋ฅ์ ํฌ๊ฒ ํฅ์์ํค๋ฉฐ, object ํฌ๊ธฐ์ ๋ํ ๋ฏผ๊ฐ๋๋ฅผ ํจ์ฌ ์ค์ฌ ์ค๋ค.
DETR์ non-maximum suppression๊ณผ anchor generation ๊ณผ์ ์ ์์ ๋ ๋ ๋จ์ํ ์ํคํ ์ฒ๋ฅผ ์ฌ์ฉํ๋ค.
์ด ๋ชจ๋ธ์ ResNet backbone์ด transformer encoder-decoder๋ก ์ฐ๊ฒฐ๋๋ ๊ตฌ์กฐ๋ก ์ด๋ฃจ์ด์ง๋ค.
N๊ฐ์ ๋ฐ์ด๋ฉ ๋ฐ์ค ์์ธก์ ๋ง๋ค์ด ๋ด๋ฉฐ, ๊ทธ์ค ์ผ๋ถ๋ no object ํด๋์ค์ผ ์ ์๋ค.
์ ๋ต(ground truth) ๋ฐ์ด๋ฉ ๋ฐ์ค๋ ์ด N๊ฐ๊ฐ ๋๋๋ก no object ๋ฐ์ค๋ฅผ ๋ง๋ถ์ฌ ๋ง์ถ๋ค.
training time์๋ bipartite matching(์ด๋ถ ๋งค์นญ)์ ์ฌ์ฉํด ๊ฐ ์์ธก ๋ฐ์ค๋ฅผ ์ ๋ต ๋ฐ์ค ํ๋์ 1:1๋ก ๋์์ํค๋, ๊ทธ ๋์์ด ์ ์ฒด cost๋ฅผ ์ต์๋ก ๋ง๋ค๋๋ก ์ ํํ๋ค.
์ ์ฒด ํ์ต ์์ค์ ์ด๋ ๊ฒ ๋งค์นญ๋ ๋ฐ์ค๋ค ์ฌ์ด์ ์์ค์ ํฉํ ๊ฐ์ด ๋๋ค.
Single-stage networks
์์ ์ํคํ ์ฒ๋ค์์๋ rerion proposal(์์ญ ์ ์) ์๊ณ ๋ฆฌ์ฆ์ด๋ ๋คํธ์ํฌ๊ฐ ๊ฒ์ถ ํ๋ณด์ ์์น์ ํํ๋ฅผ ์ ํํ๊ณ , ๊ทธ ๋ค์ ๋ ๋ฒ์จฐ ๋คํธ์ํฌ๊ฐ ๊ฐ ์์ญ ๋ด๋ถ์ ํฝ์ ๋๋ feature์ ์ด์ฉํด classification์ regression์ ์ํํ๋ค.
์ด์ ๋ํ ๋์์ผ๋ก ํ๋์ neural network๊ฐ ๋ค์ํ ์์น์์์ ๊ฒ์ถ ๊ฒฐ๊ณผ๋ฅผ ์ง์ ์ถ๋ ฅํ๋ single-stage ๋คํธ์ํฌ๋ฅผ ์ฌ์ฉํ ์ ์๋ค.
LYOLOv4์ ์ฒ๋ฆฌ ํ์ดํ๋ผ์ธ์ neck ๋จ๊ณ๊ฐ ์๋ค.
nect์ feature pyramid network์์์ ๊ฐ์ top-down feature enbancement๋ฅผ ์ํํ๋ค.
๋ํ ๊ตฌ์ฑ ์์๋ค์ training time์ ์ฌ์ฉํ ์ ์๋ bag of freebies(์ถ๊ฐ ๋น์ฉ ์์ด/๊ฑฐ์ ์์ด ์ฑ๋ฅ์ ์ฌ๋ฆฌ๋ ํ์ต ๊ธฐ๋ฒ)์ bag of specials(๊ฒ์ถ ์์ ์ ์ต์ํ์ ์ถ๊ฐ ๋น์ฉ์ผ๋ก ์ฌ์ฉํ ์ ์๋ค.)์ผ๋ก ๋ถ๋ฅํ๋ค.
'๐ฎ ์ด๊ฒ์ ๊ฒ ๊ณต๋ถ > โ๏ธ Computer Vision - Szeliski' ์นดํ ๊ณ ๋ฆฌ์ ๋ค๋ฅธ ๊ธ
โ๏ธ Computer VIsion - Szeliski 5์ฅ โ๏ธ (0) 2026.02.13 โ๏ธ Computer vision - Szeliski 6์ฅ (2) โ๏ธ (1) 2026.02.12