ABOUT ME

-

Today
-
Yesterday
-
Total
-
  • โ˜˜๏ธŽ Computer vision - Szeliski 6์žฅ (1) โ˜˜๏ธŽ
    ๐Ÿฎ ์ด๊ฒƒ์ €๊ฒƒ ๊ณต๋ถ€/โ˜˜๏ธŽ Computer Vision - Szeliski 2026. 2. 11. 13:24

    6.1 Instance recognition

    ์ผ๋ฐ˜์ ์ธ object recognition์€ instance recognition๊ณผ class recognition์œผ๋กœ ๋‚˜๋‰œ๋‹ค.

    instance recognition์€ ์•Œ๋ ค์ง„ 2์ฐจ์›, 3์ฐจ์›์˜ rigid object๋ฅผ re-recognizeํ•˜๋Š” ๊ฒƒ์„ ํฌํ•จํ•œ๋‹ค.

    ์ด๋Š” ๋ถ€๋ถ„์ ์ธ ๊ฐ€๋ ค์ง๊ณผ ๋ณต์žกํ•œ ๋ฐฐ๊ฒฝ๊ณผ ํ•จ๊ป˜ ์ƒˆ๋กœ์šด ์‹œ์ ์—์„œ ๋ฐ”๋ผ๋ณผ ๊ฐ€๋Šฅ์„ฑ์ด ์žˆ๋‹ค.

    class recognition๋Š” ์นดํ…Œ๊ณ ๋ฆฌ ์ˆ˜์ค€ ๋˜๋Š” ์ผ๋ฐ˜ ๊ฐ์ฒด ์ธ์‹์ด๋ผ๊ณ ๋„ ์•Œ๋ ค์ ธ ์žˆ์œผ๋ฉฐ, ํŠน์ • ์ผ๋ฐ˜ ํด๋ž˜์Šค์˜ ๋ชจ๋“  ์ธ์Šคํ„ด์Šค๋ฅผ ์ธ์‹ํ•˜๋Š” ํ›จ์”ฌ ๋” ์–ด๋ ค์šด ๋ฌธ์ œ์ด๋‹ค.

     

    ์ƒˆ๋กœ์šด ์ด๋ฏธ์ง€์™€ ๋ฐ์ดํ„ฐ๋ฒ ์ด์Šค์˜ ์ด๋ฏธ์ง€ ๋ชจ๋‘์—์„œ informative sparse 2D features์„ ์ถ”์ถœํ•œ ํ›„, ์ด๋ฏธ์ง€ ํŠน์ง•์€ ๊ฐ์ฒด ๋ฐ์ดํ„ฐ๋ฒ ์ด์Šค์™€ ๋งค์นญ๋˜๋ฉฐ,  ํฌ์†Œ ํŠน์ง• ๋งค์นญ ์ „๋žต ์ค‘ ํ•˜๋‚˜๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค.

    ์ถฉ๋ถ„ํ•œ ์ˆ˜์˜ match๊ฐ€ ๋ฐœ๊ฒฌ๋  ๋•Œ๋งˆ๋‹ค, ๋‘ ๊ฐœ์˜ geometric transformation์„ ์ •๋ ฌํ•˜๋Š” ๊ธฐํ•˜ํ•™์  ๋ณ€ํ™˜์„ ์ฐพ์•„ ๊ฒ€์ฆ๋œ๋‹ค.

    Geometric alignment

    recognition system์€ ๋จผ์ € ๊ฐ ๋ฐ์ดํ„ฐ๋ฒ ์ด์Šค ์ด๋ฏธ์ง€์—์„œ ๊ด€์‹ฌ ์ง€์  ์ง‘ํ•ฉ์„ ์ถ”์ถœํ•˜๊ณ , ์—ฐ๊ด€๋œ ๋””์Šคํฌ๋ฆฝํ„ฐ(๋ฐ ์›๋ž˜ ์œ„์น˜)๋ฅผ search tree์™€ ๊ฐ™์€ indexing structure์— ์ €์žฅํ•œ๋‹ค.

    recognition time์— ์ƒˆ๋กœ์šด ์ด๋ฏธ์ง€์—์„œ ํŠน์ง•์ด ์ถ”์ถœ๋˜์–ด ์ €์žฅ๋œ ๊ฐ์ฒด ํŠน์ง•๊ณผ ๋น„๊ต๋œ๋‹ค.

    ์ฃผ์–ด์ง„ ๊ฐ์ฒด์— ๋Œ€ํ•ด ์ถฉ๋ถ„ํžˆ ๋งŽ์€ matching featuers์ด ๋ฐœ๊ฒฌ๋  ๋•Œ๋งˆ๋‹ค ์‹œ์Šคํ…œ์€ match verification ๋‹จ๊ณ„๋ฅผ ํ˜ธ์ถœํ•œ๋‹ค.

    match verification ๋‹จ๊ณ„์—์„œ๋Š” matching feature์˜ ๊ณต๊ฐ„์  ๋ฐฐ์—ด์ด DB ์ด๋ฏธ์ง€์˜ ๋ฐฐ์—ด๊ณผ ์ผ์น˜ํ•˜๋Š”์ง€ ์—ฌ๋ถ€๋ฅผ ํŒ๋‹จํ•œ๋‹ค.

     

    ์ด๋ฏธ์ง€๊ฐ€ ๋งค์šฐ ๋ณต์žกํ•  ์ˆ˜ ์žˆ๊ณ  ์œ ์‚ฌํ•œ ํŠน์ง•์ด ์—ฌ๋Ÿฌ object์— ์†ํ•  ์ˆ˜ ์žˆ์œผ๋ฏ€๋กœ, origianl set of feature matches๋Š” ๋งŽ์€ outliers๋ฅผ ๊ฐ€์งˆ ์ˆ˜ ์žˆ๋‹ค.

    → Hough ๋ณ€ํ™˜์„ ์‚ฌ์šฉํ•˜์—ฌ ๊ฐ€๋Šฅ์„ฑ์ด ๋†’์€ geometric transformation์— ๋Œ€ํ•œ vote๋ฅผ ๋ชจ์œผ๋Š” ๋ฐฉ๋ฒ•์ด ์ œ์•ˆ๋˜์—ˆ๋‹ค.

    DB object ์‚ฌ์ด์™€ scene feature ๋ชจ์Œ ์‚ฌ์ด์— affine transformation์„ ์‚ฌ์šฉํ•˜๋ฉฐ, ์ด๋Š” ๋Œ€๋ถ€๋ถ„ ํ‰๋ฉด์ธ object๊ฑฐ๋‚˜ ์ ์–ด๋„ ์—ฌ๋Ÿฌ ํ•ด๋‹น feature์ด quasi-planer geometry๋ฅผ ๊ณต์œ ํ•˜๋Š” ๊ฒฝ์šฐ์— ์ž˜ ์ž‘๋™ํ•œ๋‹ค. 

     

    ๋‹ค๋ฅธ ์‹œ์Šคํ…œ์—์„  affine region detector๊ฐ€ rectify(๊ตญ๋ถ€) local image patch๋ฅผ ๋ณด์ •ํ•˜๋Š” ๋ฐ ์‚ฌ์šฉ๋˜๋ฉฐ, ์ด๋ฅผ ํ†ตํ•ด SIFT descriptord์™€ 10x10 UV ์ƒ‰์ƒ ํžˆ์Šคํ† ๋ฆฌ๊ทธ๋žจ์ด ๋ชจ๋‘ ๊ณ„์‚ฐ๋˜์–ด ๋งคํ•‘๊ณผ ์ธ์‹์— ํ™œ์šฉ๋œ๋‹ค.

    ๋™์ผ object์˜ ๋‹ค๋ฅธ view์— ์žˆ๋Š” ํ•ด๋‹น patch์™€ ๊ทธ๋“ค์˜ local affine deformation(๋ณ€ํ˜•)์€ factorization(์ธ์ˆ˜๋ถ„ํ•ด) algorithm์˜ ํ™•์žฅ์œผ๋กœ(์ดํ›„์—” Euclidean reconstruction) ์‚ฌ์šฉ๋˜๋Š” ๊ฐ์ฒด์— ๋Œ€ํ•œ 3D affine model์„ ๊ณ„์‚ฐํ•˜๋Š” ๋ฐ ์‚ฌ์šฉ๋œ๋‹ค. 

    recognition time์— local Euclidean neighborhood constraint๋Š” ์ž ์žฌ์  match๋ฅผ ํ•„ํ„ฐ๋งํ•˜๊ธฐ ์œ„ํ•ด ์‚ฌ์šฉ๋œ๋‹ค. 

     

    feature-based approaches๋Š” ์ผ๋ฐ˜์ ์œผ๋กœ ์žฅ๋ฉด์—์„œ ์•Œ๋ ค์ง„ ๊ฐ์ฒด๋ฅผ ๊ฐ์ง€ํ•˜๊ณ  ์œ„์น˜๋ฅผ ํŒŒ์•…ํ•˜๋Š” ๋ฐ ์‚ฌ์šฉ๋˜์ง€๋งŒ, ์ด๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ์žฅ๋ฉด์˜ ํ”ฝ์…€-๋ ˆ๋ฒจ segmentation์„ ์–ป์„ ์ˆ˜ ์žˆ๋‹ค. 

     

    2000๋…„๋Œ€ ์ดˆ์ค‘๋ฐ˜์— instnace recognition์€ ์ด๋ฏธ์ง€ ๋‚ด์—์„œ ์•Œ๋ ค์ง„ 3D ๊ฐ์ฒด์˜ ์œ„์น˜๋ฅผ ์ฐพ๋Š” ๋ฌธ์ œ์— ์ดˆ์ ์„ ๋งž์ถ”์—ˆ๋‹ค.

    ์ดํ›„์—” instance retrieval(์ธ์Šคํ„ด์Šค ๊ฒ€์ƒ‰, content-based image retrieval)์— ์ดˆ์ ์„ ๋งž์ถ”์—ˆ๋‹ค.


    6.2 Image classification

    6.2.1 Feature-based methods

    ํŠน์ง•๋“ค์€ ์ฒ˜์Œ์œผ๋กœ keypoint์—์„œ ์ถ”์ถœ๋˜๊ณ  ํ•™์Šต๋œ ์‹œ๊ฐ์  ๋‹จ์–ด(feature cluster centers)์— ๋Œ€ํ•œ ๋ถ„ํฌ(ํžˆ์Šคํ† ๊ทธ๋žจ)์„ ์–ป๊ธฐ ์œ„ํ•ด quantize๋œ๋‹ค.

    ์ด feature distribution historgram์€ ๋ถ„๋ฅ˜ ์•Œ๊ณ ๋ฆฌ์ฆ˜์— ์‚ฌ์šฉ๋˜๋Š” ๊ฒฐ์ • ๊ฒฝ๊ณ„๋ฅผ ํ•™์Šตํ•˜๋Š” ๋ฐ ์‚ฌ์šฉ๋œ๋‹ค.

     

    Bag of words

    ์ด ์•Œ๊ณ ๋ฆฌ์ฆ˜์€ query ์ด๋ฏธ์ง€์—์„œ ๋ฐœ๊ฒฌ๋œ ์‹œ๊ฐ์  ๋‹จ์–ด๋“ค์˜ ๋ถ„ํฌ(histogram)์„ ๋‹จ์ˆœํžˆ ๊ณ„์‚ฐํ•˜๊ณ , ์ด ๋ถ„ํฌ๋ฅผ training ์ด๋ฏธ์ง€์—์„œ ๋ฐœ๊ฒฌํ•œ ๊ฒƒ๊ณผ ๋น„๊ตํ•œ๋‹ค.

    instance recognition๊ณผ์˜ ๊ฐ€์žฅ ํฐ ์ฐจ์ด์ ์€ geometric verification ๋‹จ๊ณ„๊ฐ€ ์—†๋‹ค๋Š” ๊ฒƒ์ด๋ฉฐ, ์ด๋Š” ์ผ๋ฐ˜์ ์ธ ์‹œ๊ฐ ๋ฒ”์ฃผ์˜ ๊ฐœ๋ณ„ instance๊ฐ€ ํŠน์ง•๊ณผ์˜ spatial coherence๊ฐ€ ์ƒ๋Œ€์ ์œผ๋กœ ์ ๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค. 

    category recognition์„ ์œ„ํ•œ frequency-based ๊ธฐ์ˆ ์˜ ์œ ์šฉ์„ฑ์„ ์ž…์ฆํ•œ ์ฒซ ๋ฒˆ์งธ ์ ‘๊ทผ์ด๋‹ค.

     

    feature vector๋ฅผ ์‹œ๊ฐ์  ๋‹จ์–ด๋กœ quantizeํ•˜๋Š” ๋Œ€์‹ , ํฌ๊ธฐ๊ฐ€ ๊ฐ€๋ณ€์ ์ธ ๋‘ feature vector ์ง‘ํ•ฉ ์‚ฌ์ด์˜ ๋Œ€๋žต์ ์ธ ๊ฑฐ๋ฆฌ๋ฅผ ์ง์ ‘ ๊ณ„์‚ฐํ•˜๋Š” ๊ธฐ์ˆ ์ด ๊ฐœ๋ฐœ๋˜์—ˆ๋‹ค.

    feature vector๋ฅผ feature space์— ์ •์˜๋œ multi-resolution pyramid(๋‹ค์ค‘ ํ•ด์ƒ๋„ ํ”ผ๋ผ๋ฏธ๋“œ)์— ๋„ฃ๊ณ , ํ•ด๋‹น ๊ตฌ๊ฐ„ B_il ๊ณผ B'_il์— ์žˆ๋Š” ํŠน์ง• ์ˆ˜๋ฅผ ์„ธ๋Š” ๋ฐฉ๋ฒ•์ด๋‹ค. 

    ๋‘ ๊ฐœ์˜ feature vector ์‚ฌ์ด์˜ ๊ฑฐ๋ฆฌ(๊ณ ์ฐจ์› ๊ณต๊ฐ„์—์„œ์˜ ์ )๋Š” ํ•ด๋‹น ๊ตฌ๊ฐ„ ์‚ฌ์ด์˜ histogram intersection์„ ์‚ฌ์šฉํ•ด ๊ณ„์‚ฐ๋œ๋‹ค.

    ๊ฑฐ์นœ ๋ ˆ๋ฒจ๊ณผ ์„ธ๋ฐ€ํ•œ ๋ ˆ๋ฒจ์—์„œ ๋ชจ๋‘ ๋งค์นญ๋˜๋ฉด ์ค‘๋ณต์ด๋‹ˆ ๊ฑฐ์นœ ๋ ˆ๋ฒจ ๋งค์นญ์€ ๋นผ๋ฉฐ, ๋Œ€์‹  ๋” ์„ธ๋ฐ€ํ•œ ๋ ˆ๋ฒจ์—์„œ์˜ ๋งค์นญ์— ๋” ํฐ ๊ฐ€์ค‘์น˜๋ฅผ ์ค€๋‹ค.

     

    ๋‹ค๋ฅธ ์—ฐ๊ตฌ์—์„œ๋Š”, affine region descriptor๋ฅผ ์ถ”์ถœํ•˜๊ณ  ์ด๋ฅผ ์‹œ๊ฐ์  ๋‹จ์–ด๋กœ quantizeํ•œ๋‹ค.

    (featurn descriptor๋Š” ์ด๋ฏธ์ง€ ์œ„์˜ ์ •๊ทœ์น™ ๊ฒฉ์ž์—์„œ ์กฐ๋ฐ€ํ•˜๊ฒŒ ๊ตฌ์„ฑ๋˜๋ฉฐ, ํ…์Šค์ฒ˜๊ฐ€ ์—†๋Š” ์˜์—ญ์„ ์„ค๋ช…ํ•˜๋Š” ๋ฐ ๋„์›€์ด ๋œ๋‹ค.)

    ๋‹จ์–ด ์ˆ˜(ํžˆ์Šคํ† ๊ทธ๋žจ)๋ฅผ ํฌํ•จํ•˜๋Š” ๊ตฌ๊ฐ„์œผ๋กœ ๊ตฌ์„ฑ๋œ spatial pyramid๋ฅผ ํ˜•์„ฑํ•˜๊ณ , ์œ ์‚ฌํ•œ pyramid match kernel์„ ์‚ฌ์šฉํ•˜์—ฌ histogram intersection ํšŸ์ˆ˜๋ฅผ ๊ณ„์ธต์ ์œผ๋กœ ๊ฒฐํ•ฉํ•œ๋‹ค.

     

    quantized feature descriptior๊ณผ continuous descriptor ์ค‘ ๋ญ๋ฅผ ์‚ฌ์šฉํ• ์ง€, ํฌ์†Œ์ ์ธ feature์™€ ์กฐ๋ฐ€ํ•œ feature ์ค‘ ๋ญ๋ฅผ ์‚ฌ์šฉํ• ์ง€์— ๋Œ€ํ•œ ๋…ผ์Ÿ์ด ๊ณ„์† ์ด์–ด์กŒ๋‹ค. 

    ์ฟผ๋ฆฌ ์ด๋ฏธ์ง€๊ฐ€ ๊ฐ ํด๋ž˜์Šค ์ด๋ฏธ์ง€๋งŒ ๊ฐœ๋ณ„์ ์œผ๋กœ ๋น„๊ตํ•˜๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ ์ฃผ์–ด์ง„ ํด๋ž˜์Šค๋ฅผ ๋‚˜ํƒ€๋‚ด๋Š” ๋ชจ๋“  ํŠน์ง•๊ณผ ๋น„๊ต๋  ๊ฒฝ์šฐ, nearest-neighbor matching ๋’ค์— naive Bayes classifier์„ ์ ์šฉํ•˜๋Š” ๊ฒƒ์ด quantized ์‹œ๊ฐ์  ๋‹จ์–ด๋ณด๋‹ค ์„ฑ๋Šฅ์ด ์ข‹๋‹ค.

    ์ผ๋ฐ˜์ ์ธ feature detector์™€ descriptor๋ฅผ ์‚ฌ์šฉํ•˜๋Š” ๋Œ€์‹ , randomized forest๋‚˜ feature generation๊ณผ image classification ๋‹จ๊ณ„์˜ ๊ฒฐํ•ฉ์„ ์‚ฌ์šฉํ•˜๊ธฐ๋„ ํ•œ๋‹ค. 

    ์ตœ์ข… ๋ถ„๋ฅ˜์— biological (visual cortical(์‹œ๊ฐ ํ”ผ์งˆ)) ์ฒ˜๋ฆฌ์™€ SVM์„ ๊ฒฐํ•ฉํ•œ ๊ณ ๋ฐ€๋„ feature transform์˜ ๊ณ„์ธต ๊ตฌ์กฐ๋ฅผ ์‚ฌ์šฉํ•˜๊ธฐ๋„ ํ•œ๋‹ค. 

     

    Part-based models

    object๋ฅผ ๊ทธ ๊ตฌ์„ฑ์š”์†Œ์˜ geometric relationship์„ ์ธก์ •ํ•จ์œผ๋กœ์จ ์ธ์‹ํ•˜๋Š” ๋ฐฉ๋ฒ•๋„ ์žˆ๋‹ค. 

    ์–ผ๊ตด ์ธ์‹๊ณผ ๋ณดํ–‰์ž ์ธ์‹, ์ž์„ธ ์ธก์ •์— ์ฃผ๋กœ ์‚ฌ์šฉ๋œ๋‹ค.

     

    geometric relationship์„ ํ‘œํ˜„ํ•˜๊ธฐ ์œ„ํ•œ ๊ฐ€์žฅ ์ดˆ๊ธฐ ์ ‘๊ทผ๋ฒ•์€ pictorial structures๋กœ, ์„œ๋กœ ๋‹ค๋ฅธ feature location ์‚ฌ์ด์˜ ์Šคํ”„๋ง๊ฐ™์€ ์—ฐ๊ฒฐ๋กœ ๊ตฌ์„ฑ๋˜์—ˆ๋‹ค. 

    pictorial structure๋ฅผ ์ด๋ฏธ์ง€์— ์ ์šฉํ•˜๋ ค๋ฉด energy function์€ ๋ชจ๋“  ์ž ์žฌ์  ๋ถ€ํ’ˆ ์œ„์น˜ ๋˜๋Š” ํฌ์ฆˆ {l_i}์— ๋Œ€ํ•ด ์ตœ์†Œํ™”๋˜๋ฉฐ, E์— ๊ฐ„์„ (๊ธฐํ•˜ํ•™์  ๊ด€๊ณ„)์ด ์กด์žฌํ•˜๋Š” (i,j) ๋ถ€ํ’ˆ ์Œ์— ๋Œ€ํ•œ ํ•ญ๋“ค๊ณผ ํ•จ๊ป˜ ๊ณ ๋ ค๋œ๋‹ค. 

     

    part-based ๋ชจ๋ธ์€ part ๊ฐ„์˜ geometric ์—ฐ๊ฒฐ์— ๋Œ€ํ•ด ์„œ๋กœ ๋‹ค๋ฅธ topology๋ฅผ ๊ฐ€์งˆ ์ˆ˜ ์žˆ๋‹ค.

    ์˜ˆ) ์—ฐ๊ฒฐ์„ ํŠธ๋ฆฌ๋กœ ์ œํ•œํ•˜์—ฌ ํ•™์Šต ๋ฐ ์ถ”๋ก ์„ ๋‹ค๋ฃจ๊ธฐ ์‰ฝ๊ฒŒ ๋งŒ๋“ ๋‹ค.

    tree topology๋Š” ์žฌ๊ท€์ ์ธ Viterbi(๋™์  ํ”„๋กœ๊ทธ๋ž˜๋ฐ) ์•Œ๊ณ ๋ฆฌ์ฆ˜์˜ ์‚ฌ์šฉ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•œ๋‹ค. 

    ์ด ์•Œ๊ณ ๋ฆฌ์ฆ˜์—์„œ๋Š” leaf node๋ฅผ ๋จผ์ € ๋ถ€๋ชจ์˜ ํ•จ์ˆ˜๋กœ optimizeํ•˜๊ณ , ๊ทธ ๊ฒฐ๊ณผ๊ฐ’์„ ์—๋„ˆ์ง€ ํ•จ์ˆ˜์—์„œ ์‚ฝ์ž…ํ•˜๊ณ  ์ œ๊ฑฐํ•œ๋‹ค. 

    ํŠธ๋ฆฌ ํ† ํด๋กœ์ง€๋Š” ์žฌ๊ท€์ ์ธ Viterbi(๋™์  ํ”„๋กœ๊ทธ๋ž˜๋ฐ) ์•Œ๊ณ ๋ฆฌ์ฆ˜(Pearl 1988; Bishop 2006)์˜ ์‚ฌ์šฉ์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•œ๋‹ค.

    ์ด ์•Œ๊ณ ๋ฆฌ์ฆ˜์—์„œ๋Š” ์žŽ ๋…ธ๋“œ๋ฅผ ๋จผ์ € ๋ถ€๋ชจ์˜ ํ•จ์ˆ˜๋กœ ์ตœ์ ํ™”ํ•˜๊ณ , ๊ทธ ๊ฒฐ๊ณผ๊ฐ’๋“ค์„ ์—๋„ˆ์ง€ ํ•จ์ˆ˜์—์„œ ์‚ฝ์ž…ํ•˜์—ฌ ์ œ๊ฑฐํ•ฉ๋‹ˆ๋‹ค.(๋น„์šฉ์„ ๋ถ€๋ชจ ๋น„์šฉ์— ๋”ํ•ด ์„œ๋ธŒํŠธ๋ฆฌ๋ฅผ ์ ‘์–ด ์—†์•ค๋‹ค.)

    inference ์•Œ๊ณ ๋ฆฌ์ฆ˜์˜ ํšจ์œจ์„ฑ์„ ๋†’์ด๊ธฐ ์œ„ํ•ด, pairwise(์Œ) ์—๋„ˆ์ง€ ํ•จ์ˆ˜ V_ij(l_i, l_j)๋ฅผ ์œ„์น˜ ๋ณ€์ˆ˜๋“ค์˜ ์–ด๋–ค ํ•จ์ˆ˜์— ๋Œ€ํ•œ Mahalanobis ๊ฑฐ๋ฆฌ๋กœ ์ œํ•œํ•œ ๋‹ค์Œ, fast distance transform ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‚ฌ์šฉํ•˜์—ฌ ๊ฐ ์Œ ์ƒํ˜ธ์ž‘์šฉ์„ N์— ๋Œ€ํ•ด ์„ ํ˜•์— ๋” ๊ฐ€๊นŒ์šด ์‹œ๊ฐ„ ๋ณต์žก๋„๋กœ ์ตœ์†Œํ™”ํ•œ๋‹ค.

     

    ๋ฐฐ๊ฒฝ ๋ถ„ํ• ์„ ํ†ตํ•ด ์–ป์€ ์ด์ง„ ์ด๋ฏธ์ง€์— ๊ด€์ ˆ์ด ์žˆ๋Š” ์‹ ์ฒด ๋ชจ๋ธ์„ ๋งž์ถ”๊ธฐ ์œ„ํ•ด pictorial structures ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‚ฌ์šฉํ•œ ๊ฒฐ๊ณผ์ด๋‹ค.

    ๋ถ€ํ’ˆ์ด ๊ทผ์‚ฌ ์ง์‚ฌ๊ฐํ˜•์˜ ์œ„์น˜, ํฌ๊ธฐ ๋ฐ ๋ฐฉํ–ฅ์— ๋”ฐ๋ผ ๋งค๊ฐœ๋ณ€์ˆ˜ํ™”๋œ๋‹ค.

    Unary matching potentials(๋‹จํ•ญ ๋งค์นญ ์ „์œ„) Vi(li)๋Š” ๊ฐ ๋ถ€๋ถ„์„ ๋‚˜ํƒ€๋‚ด๋Š” ๊ธฐ์šธ์–ด์ง„ ์‚ฌ๊ฐํ˜• ์•ˆํŒŽ์˜ ์ „๊ฒฝ ๋ฐ ๋ฐฐ๊ฒฝ ํ”ฝ์…€ ๋น„์œจ์„ ๊ณ„์‚ฐํ•˜์—ฌ ๊ฒฐ์ •๋œ๋‹ค.

     

    part-based recognition์„ ์œ„ํ•ด ๋‹ค์–‘ํ•œ graphical model์ด ๋งŽ์ด ์ œ์•ˆ๋˜์—ˆ๋‹ค.

    ๊ทธ ์ค‘ ํ•˜๋‚˜๋Š” sparse flexible model์ด๋‹ค.

    ๋ถ€ํ’ˆ๋“ค์„ ์ˆœ์„œํ™”ํ•˜๊ณ  ๊ฐ ๋ถ€ํ’ˆ์˜ ์œ„์น˜๊ฐ€ ์ž์‹ ์˜ ์กฐ์ƒ(ancestor) ๋ถ€ํ’ˆ๋“ค ์œ„์น˜ ์ค‘ ๋งŽ์•„์•ผ k๊ฐœ์—๋งŒ ์˜์กดํ•˜๋„๋ก ํ•˜๋Š” ๋ฐฉ์‹์„ ํฌํ•จํ•œ๋‹ค.

     

    ๊ฐ€์žฅ ๋‹จ์ˆœํ•œ ๋ชจ๋ธ์€ bags of words๋กœ, ์„œ๋กœ ๋‹ค๋ฅธ part๋‚˜ ํŠน์ง•๋“ค ์‚ฌ์ด์— ๊ธฐํ•˜ํ•™์  ๊ด€๊ณ„๊ฐ€ ์ „ํ˜€ ์—†๋‹ค.

    ์ด๋Ÿฐ ๋ชจ๋ธ์€ ๋งค์šฐ ํšจ์œจ์ ์ผ ์ˆ˜ ์žˆ์ง€๋งŒ, part๋“ค์˜ ๊ณต๊ฐ„์  ๋ฐฐ์น˜๋ฅผ ํ‘œํ˜„ํ•  ์ˆ˜ ์žˆ๋Š” ๋Šฅ๋ ฅ์€ ๋งค์šฐ ์ œํ•œ์ ์ด๋‹ค.

    tree์™€ start๋Š” inference ์ธก๋ฉด์—์„œ ๊ฐ€์žฅ ํšจ์œจ์ ์ด๋ฏ€๋กœ ํ•™์Šต ์ธก๋ฉด์—์„œ๋„ ๊ฐ€์žฅ ํšจ์œจ์ ์ด๋‹ค.

    ๋‹ค์Œ์œผ๋กœ ๋ณต์žกํ•œ ๋ชจ๋ธ์€ directed acyclic graphs๋กœ part ๋ชจ๋ธ์— ์ธ๊ณผ์  ๊ตฌ์กฐ๋ฅผ ๊ฐ•์ œ๋กœ ๋ถ€์—ฌํ•ด์•ผ ํ•œ๋‹ค๋Š” ๋น„์šฉ์ด ๋“ค๊ธด ํ•˜์ง€๋งŒ ์—ฌ์ „ํžˆ ํšจ์œจ์ ์ธ inference๊ฐ€ ๊ฐ€๋Šฅํ•˜๋‹ค.

    fully conneted ๋ชจ๋ธ์€ ๊ฐ€์žฅ ์ผ๋ฐ˜์ ์ธ ํ˜•ํƒœ์ด์ง€๋งŒ, ๋ถ€ํ’ˆ์˜ ์ˆ˜ P๊ฐ€ ์ค‘๊ฐ„ ์ •๋„๋งŒ ๋˜์–ด๋„ feature์„ ๊ฐ ๋ถ€ํ’ˆ์— ํ• ๋‹นํ•˜๋Š” ๋ฌธ์ œ๊ฐ€ ๊ณ„์‚ฐ์ ์œผ๋กœ ๊ฐ๋‹นํ•˜๊ธฐ ์–ด๋ ค์›Œ์ง„๋‹ค.

     

    Contect and scene understanding

    context๋Š” object recognition ์•Œ๊ณ ๋ฆฌ์ฆ˜์˜ ์„ฑ๋Šฅ์„ ํฌ๊ฒŒ ํ–ฅ์ƒ์‹œํ‚ฌ ์ˆ˜ ์žˆ์œผ๋ฉฐ, ์ผ๋ฐ˜์ ์ธ ์žฅ๋ฉด ์ดํ•ด๋ฅผ ์œ„ํ•œ ์œ ์šฉํ•œ ์˜๋ฏธ๋ก ์ (semantic) ๋‹จ์„œ๋ฅผ ์ œ๊ณตํ•  ์ˆ˜ ์žˆ๋‹ค.

     

    spatial ์ •๋ณด๋ฅผ recognition ์•Œ๊ณ ๋ฆฌ์ฆ˜์— ํ†ตํ•ฉํ•˜๋Š” ๋ฐฉ๋ฒ•์€ spatial pyramid system๊ณผ ๊ฐ™์ด ๋‹ค์–‘ํ•œ region์— ๊ฑธ์นœ feature statistics๋ฅผ ๊ณ„์‚ฐํ•˜๋Š” ๊ฒƒ์ด๋‹ค.

    part-based ๋ชจ๋ธ์€ object๋ฅผ ๊ตฌ์„ฑํ•˜๊ธฐ ์œ„ํ•ด ๋‹ค์–‘ํ•œ part๋ฅผ ์ ์ ˆํ•œ ๊ธฐํ•˜ํ•™์  ๊ด€๊ณ„๋กœ ๋ฐฐ์—ดํ•ด์•ผ ํ•˜๋Š” ์ผ์ข…์˜ local context๋ฅผ ์ด์šฉํ•œ๋‹ค. 

     

    context ๋ชจ๋ธ์€  object๋ฅผ scene์œผ๋กœ ๊ฒฐํ•ฉํ•˜๊ณ  ๊ฐ ํด๋ž˜์Šค์˜ ๊ตฌ์„ฑ object์˜ ๊ฐœ์ˆ˜๊ฐ€ ์‚ฌ์ „์— ์•Œ๋ ค์ ธ ์žˆ์ง€ ์•Š๋‹ค๋Š” ์ ์—์„œ part-based ๋ชจ๋ธ๊ณผ ๋‹ค๋ฅด๋‹ค. 

    ์‹ค์ œ๋กœ, ๋‘˜์„ ๋™์ผํ•œ recognition architecture๋กœ ๊ฒฐํ•ฉํ•˜๋Š” ๊ฒƒ์ด ๊ฐ€๋Šฅํ•˜๋‹ค.

     

    ๋ผ๋ฒจ์ด ๋ถ™์€ ์˜์—ญ์„ ๊ฐ€์ง„ ํ•™์Šต ์ด๋ฏธ์ง€๊ฐ€ ์ถฉ๋ถ„ํžˆ ์žˆ๋‹ค๋ฉด, ์ด๋“ค ์š”์†Œ์˜ ์ƒ๋Œ€์  ์œ„์น˜๋ฅผ ์„ค๋ช…ํ•˜๊ธฐ ์œ„ํ•œ ๊ธฐํ•˜ํ•™์  ๋ชจ๋ธ์„ ๊ฐœ๋ฐœํ•  ์ˆ˜ ์žˆ๋‹ค.

    ๊ด€๋ จํ•˜์—ฌ ์ œ์•ˆ๋œ ๋ชจ๋ธ์€ two-level constellation ๋ชจ๋ธ์ด๋‹ค.

    ์ƒ์œ„ ๋‹จ๊ณ„์—์„œ๋Š” object๋“ค์ด ์„œ๋กœ์— ๋Œ€ํ•ด ๊ฐ–๋Š” ์ƒ๋Œ€์  ๋ถ„ํฌ๋ฅผ ๊ฐ€์šฐ์‹œ์•ˆ์œผ๋กœ ๋ชจ๋ธ๋งํ•œ๋‹ค.

    ํ•˜์œ„ ๋‹จ๊ณ„์—์„œ๋Š” object ์ค‘์‹ฌ์— ๋Œ€ํ•œ part(affine covariant features)์˜ ๋ถ„ํฌ๋ฅผ ๊ฐ€์šฐ์‹œ์•ˆ ํ˜ผํ•ฉ ๋ชจ๋ธ๋กœ ํ‘œํ˜„ํ•œ๋‹ค.

    scene ์† object์˜ ๊ฐœ์ˆ˜์™€ ๊ฐ object ์•ˆ์˜ ๋ถ€ํ’ˆ ๊ฐœ์ˆ˜๋Š” ๋ฏธ๋ฆฌ ์•Œ ์ˆ˜ ์—†์œผ๋ฏ€๋กœ, ์ƒ์„ฑ์ (generative) ํ”„๋ ˆ์ž„์›Œํฌ์—์„œ objcet์™€ part์˜ ์ƒ์„ฑ ๊ณผ์ •์„ ๋ชจ๋ธ๋งํ•˜๊ธฐ ์œ„ํ•ด LDP(latent Dirichlet process)์„ ์‚ฌ์šฉํ•œ๋‹ค.

    ๋ชจ๋“  object์™€ part์— ๋Œ€ํ•œ ๋ถ„ํฌ๋Š” ๋Œ€๊ทœ๋ชจ ๋ผ๋ฒจ๋ง ๋ฐ์ดํ„ฐ๋ฒ ์ด์Šค๋กœ๋ถ€ํ„ฐ ํ•™์Šต๋˜๋ฉฐ, ์ดํ›„ ์ถ”๋ก (์ธ์‹) ๋‹จ๊ณ„์—์„œ scene์„ ์ด๋ฃจ๋Š” ์š”์†Œ๋“ค์— ๋ผ๋ฒจ์„ ๋ถ™์ด๋Š” ๋ฐ ์‚ฌ์šฉ๋œ๋‹ค.

     

    context์˜ ๋˜ ๋‹ค๋ฅธ ์˜ˆ๋กœ๋Š” simultaneous segmentation๊ณผ recognition์—์„œ์˜ ๊ฒฝ์šฐ๊ฐ€ ์žˆ๋Š”๋ฐ, scene ์† ์—ฌ๋Ÿฌ object๋“ค์˜ ๋ฐฐ์น˜๊ฐ€ ๋ผ๋ฒจ๋ง ๊ณผ์ •์˜ ์ผ๋ถ€๋กœ ์‚ฌ์šฉ๋œ๋‹ค.

    ๊ฑด๋ฌผ๊ณผ ๋„๋กœ์˜ ์ถ”์ • ์œ„์น˜๊ฐ€ ์ž๋™์ฐจ ๊ฒ€์ถœ์— ์˜ํ–ฅ์„ ๋ฏธ์น˜๋Š” CRF(conditional random field)๊ฐ€ ์žˆ์œผ๋ฉฐ, boosting์„ ์‚ฌ์šฉํ•ด CRF์˜ ๊ตฌ์กฐ๋ฅผ ํ•™์Šตํ•œ๋‹ค๊ณ  ํ•œ๋‹ค.

    CRF ๊ธฐ๋ฐ˜ segmentation ๊ฒฐ๊ณผ๋ฅผ ๊ฐœ์„ ํ•˜๊ธฐ ์œ„ํ•ด context๋ฅผ ํ™œ์šฉํ•˜๊ธฐ๋„ ํ•˜๋Š”๋ฐ, ์ด๋Š” ์–ด๋–ค adjacencies(relationsships)๊ฐ€ ๋‹ค๋ฅธ ๊ฒƒ๋ณด๋‹ค ๋” ์ž์ฃผ/๊ทธ๋Ÿด๋“ฏํ•˜๊ฒŒ ๋ฐœ์ƒํ•œ๋‹ค๋Š” ์ ์„ ๋ฐ˜์˜ํ•˜๋Š” ๊ฒƒ์ด๋‹ค.

    object categorization์— context๋ฅผ ์ถ”๊ฐ€ํ•˜๊ธฐ ์œ„ํ•ด ์ œ์•ˆ๋œ ๋‹ค์–‘ํ•œ ์ ‘๊ทผ๋ฒ•๋“ค์ด ๊ฒ€ํ† ๋˜์—ˆ์œผ๋ฉฐ, ์ธ๊ฐ„-๊ฐ์ฒด ์ƒํ˜ธ์ž‘์šฉ(human-object interactions)์ด ์—ฐ๊ตฌ๋˜์—ˆ๋‹ค.

     

    context๋Š” ๋‹จ์ผ ์ด๋ฏธ์ง€๋กœ๋ถ€ํ„ฐ์˜ 3D inference์—๋„ ์‚ฌ์šฉ๋œ๋‹ค. 

    ์ปดํ“จํ„ฐ ๋น„์ „ ๊ธฐ๋ฒ•์„ ์‚ฌ์šฉํ•˜์—ฌ ํ”ฝ์…€์„ ์ง€๋ฉด, ์ˆ˜์ง ํ‘œ๋ฉด ๋˜๋Š” ํ•˜๋Š˜์— ์†ํ•˜๋Š” ๊ฒƒ์œผ๋กœ ๋ผ๋ฒจ๋งํ•œ๋‹ค.

    ์ด ์ž‘์—… ์˜์—ญ์€ object identity, ์œ„์น˜, surface orientations, occlusions ๋ฐ ์นด๋ฉ”๋ผ ๊ด€์ฐฐ ๋งค๊ฐœ๋ณ€์ˆ˜์— ๋Œ€ํ•ด ๋™์‹œ์— ์ถ”๋ก ํ•˜๋Š” ๋ณด๋‹ค ์ „์ฒด๋ก ์ (holistic) ์ ‘๊ทผ ๋ฐฉ์‹์œผ๋กœ ํ™•์žฅ๋˜์—ˆ๋‹ค.

     

    ์—ฌ๋Ÿฌ ์ ‘๊ทผ๋ฐฅ์—์„œ scene์˜ gist๋ฅผ ์‚ฌ์šฉํ•ด ํŠน์ • object์˜ instances๊ฐ€ ์–ด๋””์— ๋‚˜ํƒ€๋‚  ๊ฐ€๋Šฅ์„ฑ์ด ๋†’์€์ง€ ๊ฒฐ์ •ํ•œ๋‹ค.

    ์˜ˆ) ์ด๋ฏธ์ง€์˜ gist๋ฅผ ๋ฐ”ํƒ•์œผ๋กœ ๋ณดํ–‰์ž, ์ž๋™์ฐจ, ๊ฑด๋ฌผ ๊ฐ™์€ ๊ฐ์ฒด๋“ค์ด ๋‚˜ํƒ€๋‚  ์ˆ˜์ง ๋ฐฉํ–ฅ ์œ„์น˜๋ฅผ ์˜ˆ์ธกํ•˜๋Š” regressor๋ฅผ ํ•™์Šตํ•œ๋‹ค.

    ์ด๋ ‡๊ฒŒ ์–ป์€ location distribution์€ ๊ณ ์ „์ ์ธ object detector์™€ ํ•จ๊ป˜ ์‚ฌ์šฉ๋˜์–ด detector์˜ ์„ฑ๋Šฅ์„ ํ–ฅ์ƒ์‹œํ‚ค๋Š” ๋ฐ ์“ฐ์ธ๋‹ค.

    ๋˜ํ•œ gist๋Š” ์™„์ „ํ•œ ์ด๋ฏธ์ง€๋“ค์„ ์ง์ ‘ ๋งค์นญํ•˜๋Š” ๋ฐ์—๋„ ์‚ฌ์šฉ๋  ์ˆ˜ ์žˆ๋‹ค.

     

    scene understanding ๋ถ„์•ผ์˜ ์ผ๋ถ€ ์—ฐ๊ตฌ๋Š” ๋ผ๋ฒจ์ด ๋ถ™์€(ํ˜น์€ ๋ผ๋ฒจ์ด ์—†๋Š”) ์ด๋ฏธ์ง€๊ฐ€ ๋งค์šฐ ๋งŽ์ด ์กด์žฌํ•œ๋‹ค๋Š” ์ ์„ ํ™œ์šฉํ•ด ๊ฐœ๋ณ„ object ๋‹จ์œ„๊ฐ€ ์•„๋‹Œ ์ „์ฒด ์ด๋ฏธ์ง€ ๋‹จ์œ„๋กœ ์ง์ ‘ matching์„ ์ˆ˜ํ–‰ํ•œ๋‹ค.

    ์ด๋ฏธ์ง€๊ฐ€ ์ž์ฒด๊ฐ€ object๋“ค ์‚ฌ์ด์— ๊ธฐ๋Œ€๋˜๋Š” ๊ด€๊ณ„๋ฅผ ์•”๋ฌต์ ์œผ๋กœ(๋‚ด์žฌ์ ์œผ๋กœ) ๋‹ด๊ณ  ์žˆ๋‹ค๊ณ  ๋ณธ๋‹ค. 

    6.2.2 Deep networks

    fine-grained category recognition ๋ฌธ์ œ๋„ ์—ฐ๊ตฌ๋˜์–ด ์™”๋‹ค.

    fine-grained category recognition์€ ํ•˜์œ„ ๋ฒ”์ฃผ๋“ค ๊ฐ„ ์ฐจ์ด๊ฐ€ ์•„์ฃผ ๋ฏธ๋ฌ˜ํ•  ์ˆ˜ ์žˆ๊ณ , ํ•™์Šต์— ์“ธ ์ˆ˜ ์žˆ๋Š” exemplers ์ˆ˜๊ฐ€ ์ ์€ ๊ฒฝ์šฐ๊ฐ€ ๋งŽ๋‹ค.

     

    fine-grained categorization์€ ์ด๋ฏธ์ง€์™€ ํด๋ž˜์Šค์˜ attribute๋ฅผ ์ด์šฉํ•ด ์ ‘๊ทผํ•˜๋Š” ๊ฒฝ์šฐ๊ฐ€ ๋งŽ๋‹ค.

    attribute๋ฅผ ์ถ”์ถœํ•˜๋ฉด zero-shot learning์ด ๊ฐ€๋Šฅํ•ด์ง€๋Š”๋ฐ ์ด๋Š” ์ด์ „์— ๋ณธ ์  ์—†๋Š” ๋ณ€์ˆ˜๋„ ์ด๋Ÿฌํ•œ attribute๋“ค์˜ ์กฐํ•ฉ์œผ๋กœ ์„ค๋ช…ํ•  ์ˆ˜ ์žˆ๊ฒŒ ๋œ๋‹ค.

     

    ์„œ๋กœ ๋‹ค๋ฅธ attribute๋“ค ์‚ฌ์ด์— ๊ทธ๋Ÿด๋“ฏํ•ด ๋ณด์ด์ง€๋งŒ ์‹ค์ œ๋กœ๋Š” ์˜๋ฏธ ์—†๋Š”(์šฐ์—ฐํ•œ) correlation์„ ํ•™์Šตํ•˜์ง€ ์•Š๋„๋ก ์ฃผ์˜ํ•ด์•ผ ํ•œ๋‹ค.

    object์™€ ๊ทธ object๊ฐ€ ์ž์ฃผ ๋“ฑ์žฅํ•˜๋Š” ์ „ํ˜•์  context ์‚ฌ์ด์˜ ์šฐ์—ฐํ•œ correlation์„ ํ•™์Šตํ•˜๋Š” ๊ฒฝ์šฐ์—๋„ ์ฃผ์˜๊ฐ€ ํ•„์š”ํ•˜๋‹ค.

    ๋˜ํ•œ fine-grained recognition์€ metric learning, nearest-heighbor visual similarity search ๋“ฑ์œผ๋กœ๋„ ์ ‘๊ทผํ•  ์ˆ˜ ์žˆ๋‹ค.

    6.2.3 Application: Visual similarity search

    ์ปดํ“จํ„ฐ ๋น„์ „ ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‚ฌ์šฉํ•ด ์ด๋ฏธ์ง€๋ฅผ ์ž๋™์œผ๋กœ category๋กœ ๋ถ„๋ฅ˜ํ•˜๊ณ  attribute ํƒœ๊ทธ๋ฅผ ๋ถ™์ด๋ฉด, ์นดํƒˆ๋กœ๊ทธ๋‚˜ ์›น์—์„œ ํ•ด๋‹น ์ด๋ฏธ์ง€๋ฅผ ๋” ์‰ฝ๊ฒŒ ์ฐพ์„ ์ˆ˜ ์žˆ๋‹ค.

    ์ด๋Š” ์ด๋ฏธ์ง€ ๊ฒ€์ƒ‰/์ด๋ฏธ์ง€ ๊ฒ€์ƒ‰ ์—”์ง„์—์„œ ํ”ํžˆ ์‚ฌ์šฉ๋˜๋Š” ๋ฐฉ์‹์œผ๋กœ, ์ผ๋ฐ˜ ์›น ๊ฒ€์ƒ‰ ์—”์ง„์ด ๊ด€๋ จ ๋ฌธ์„œ์™€ ํŽ˜์ด์ง€๋ฅผ ํ‚ค์›Œ๋“œ๋กœ ์ฐพ๋Š” ๊ฒƒ์ฒ˜๋Ÿผ, ํ‚ค์›Œ๋“œ๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ๊ฐ€๋Šฅ์„ฑ์ด ๋†’์€ ์ด๋ฏธ์ง€๋ฅผ ์ฐพ์•„์ค€๋‹ค.

     

    ํ•„์š”ํ•œ ์ •๋ณด๋ฅผ ํ‚ค์›Œ๋“œ๊ฐ€ ์•„๋‹ˆ๋ผ ์ด๋ฏธ์ง€ ์ž์ฒด๋กœ ์ฐพ๋Š” ๊ฒƒ์ด ๋” ์‰ฌ์šธ ๋–„๋„ ์žˆ๋‹ค. (visual search)

    ์˜ˆ) fine-grained categorization, instance retrieval (๋˜‘๊ฐ™์€ ๋ฌผ์ฒด๋‚˜ ๊ฐ™์€ ์žฅ์†Œ๋ฅผ ์ฐพ์•„๋‚ด๋Š” ์ž‘์—…)

    ๊ฒ€์ƒ‰ ์˜๋„๋ฅผ ๋ง๋กœ ๊ฐ„๋‹จํžˆ ํ‘œํ˜„ํ•˜๊ธฐ ์–ด๋ ค์šธ ๋•Œ๋Š” visual similarity search(reverse image search)๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค.

     

     ์ด ๋ถ„์•ผ์˜ ์ดˆ๊ธฐ ์—ฐ๊ตฌ๋“ค์€ ์ฃผ๋กœ ์ƒ‰์ƒ๊ณผ ํ…์Šค์ฒ˜ ๊ฐ™์€ ๊ฐ„๋‹จํ•œ whole-image similarity metrics์— ๊ธฐ๋ฐ˜ํ–ˆ๋‹ค.

     

    ์ดํ›„์˜ ์•„ํ‚คํ…์ฒ˜๋“ค์€ feature-based learning๊ณผ recognition ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‚ฌ์šฉํ•ด ์ „ํ†ต์ ์ธ keyword-based image search engine์˜ ์ถœ๋ ฅ ๊ฒฐ๊ณผ๋ฅผ re-rank(์žฌ์ •๋ ฌ)ํ•œ๋‹ค.

    PLSA(probabilistic latest semantic analysis)์„ ํ™•์žฅํ•œ ๋ฐฉ๋ฒ•์„ ์ด์šฉํ•ด ์ด๋ฏธ์ง€ ๊ฒ€์ƒ‰ ๊ฒฐ๊ณผ๋ฅผ clusteringํ•œ ๋’ค, ์ƒ์œ„ ์ˆœ์œ„ ๊ฒฐ๊ณผ๋“ค๊ณผ ์—ฐ๊ด€๋œ ํด๋Ÿฌ์Šคํ„ฐ๋ฅผ ์„ ํƒํ•˜์—ฌ ํ•ด๋‹น ๋ฒ”์ฃผ๋ฅผ ๋Œ€ํ‘œํ•˜๋Š” ์ด๋ฏธ์ง€๋“ค๋กœ ์‚ผ๋Š”๋‹ค. 

    ์ •๊ตํ•˜๊ฒŒ ์ฃผ์„ ์ฒ˜๋ฆฌ๋œ ์ด๋ฏธ์ง€ DB์— ์˜์กดํ•˜๋Š” ์ ‘๊ทผ๋“ค๋„ ์žˆ๋‹ค.

    ์˜ˆ) query ์ด๋ฏธ์ง€๋ฅผ ์ฃผ๋ฉด ์œ ์‚ฌํ•œ LabelMe ์ด๋ฏธ์ง€๋ฅผ ์ฐพ์•„์ฃผ๋Š” ์‹œ์Šคํ…œ์„ ์„ค๋ช…ํ•œ๋‹ค.

    feature-based corresponce ์•Œ๊ณ ๋ฆฌ์ฆ˜๊ณผ labeled DB๋ฅผ ๊ฒฐํ•ฉํ•˜์—ฌ recognition๊ณผ segmentation์„ ๋™์‹œ์— ์ˆ˜ํ–‰ํ•˜๋Š” ์ ‘๊ทผ๋„ ์žˆ๋‹ค.

     

    visual similarity search์˜ ๋” ์ตœ์‹  ์ ‘๊ทผ์€ whole-image descriptor(Fisher kernel, VLAD(Vector of Locally Aggregated Descriptors)), pooled CNN activations(ํ’€๋ง๋œ CNN ํ™œ์„ฑ๊ฐ’)์„ metric learning๊ณผ ๊ฒฐํ•ฉํ•˜์—ฌ ๊ฐ ์ด๋ฏธ์ง€๋ฅผ ์••์ถ•๋œ descriptor๋กœ ํ‘œํ˜„ํ•œ๋‹ค. 

    ์ด๋ ‡๊ฒŒ ์–ป์€ descriptor์€ ๋Œ€๊ทœ๋ชจ DB์—์„œ ์ด๋ฏธ์ง€ ๊ฐ„ ์œ ์‚ฌ๋„ ์ธก์ •์— ์‚ฌ์šฉ๋œ๋‹ค.

     

    ๋”ฅ ๋„คํŠธ์›Œํฌ์™€ VLAD, generalized mean(GeM) pooling, danamic mean(DAME) pooling๊ณผ ๊ฐ™์€ ์—ฌ๋Ÿฌ ๊ธฐ๋ฒ•์„ ๊ฒฐํ•ฉํ•ด ์ „์ฒด ์‹œ์Šคํ…œ์„ end-to-end๋กœ ํŠœ๋‹ ๊ฐ€๋Šฅํ•œ ์™„์ „ํ•œ ์‹œ์Šคํ…œ์œผ๋กœ ๋งŒ๋“ค ์ˆ˜๋„ ์žˆ๋‹ค.

    image retrieval์„ ์œ„ํ•œ ์ตœ์‹  ๊ธฐ๋ฒ•๋“ค ์ค‘ ์ผ๋ถ€๋Š” local descriptor์™€ global descriptor๋ฅผ ์กฐํ•ฉํ•˜์—ฌ, landmark recognition ๊ณผ์ œ์—์„œ ์ตœ์ฒจ๋‹จ(state-of-the-art) ์„ฑ๋Šฅ์„ ๋‹ฌ์„ฑํ•œ๋‹ค.

     

    category recognition์— ๋”ํ•ด visual similarity search๋ฅผ ์‚ฌ์šฉํ•˜๋Š” ์ƒ์šฉ ์‹œ์Šคํ…œ์˜ ์˜ˆ๋กœ GrokNet ์ œํ’ˆ ์ธ์‹ ์„œ๋น„์Šค๊ฐ€ ์žˆ๋‹ค.

    ์‚ฌ์šฉ์ž๊ฐ€ ์˜ฌ๋ฆฐ ์ด๋ฏธ์ง€์™€ ์‡ผํ•‘ ์งˆ์˜๋ฅผ ์ž…๋ ฅ์œผ๋กœ ๋ฐ›์•„, ์งˆ์˜ ์ด๋ฏธ์ง€์— ์žˆ๋Š” ๋ฌผ๊ฑด๊ณผ ์œ ์‚ฌํ•œ ์ƒํ’ˆ(์ธ๋ฑ์‹ฑ๋œ ์•„์ดํ…œ)์„ ์ฐพ์•„ ๋ฐ˜ํ™˜ํ•œ๋‹ค. 

    ๋กฑํ…Œ์ผ(long-tail) ์ƒํ’ˆ์ด ๋„ˆ๋ฌด ๋งŽ์•„์„œ, ๋ชจ๋“  ๋ฌผ๊ฑด์„ ์™„์ „ํ•˜๊ฒŒ ๋ฒ”์ฃผํ™”(์นดํ…Œ๊ณ ๋ฆฌ๋กœ ๋ถ„๋ฅ˜)ํ•˜๋Š” ๋ฐฉ์‹๋งŒ์œผ๋กœ๋Š” ํ˜„์‹ค์ ์œผ๋กœ ์ฒ˜๋ฆฌํ•˜๊ธฐ ์–ด๋ ต๋‹ค.

     

    training time์— GrokNet์€ category ๋ฐ/๋˜๋Š” attribute ๋ผ๋ฒจ์ด ๋ถ™์–ด ์žˆ๋Š” weakly labeled ์ด๋ฏธ์ง€๋“ค๊ณผ, unlabeled ์ด๋ฏธ์ง€๋ฅผ ๋ชจ๋‘ ์‚ฌ์šฉํ•œ๋‹ค. 

    unlabeled ์ด๋ฏธ์ง€์—์„œ๋Š” object ๋‚ด๋ถ€์˜ feature๋ฅผ ๊ฒ€์ถœํ•œ ๋’ค, ์ด๋ฅผ ์ด์šฉํ•ด matric learning์„ ์ˆ˜ํ–‰ํ•œ๋‹ค.

    ์ด๋•Œ ArcFace loss๋ฅผ ๋ณ€ํ˜•ํ•œ ์†์‹ค๊ณผ ์ƒˆ๋กœ์šด ๋งˆ์ง„ ์†์‹ค์„ ์ด์šฉํ•œ๋‹ค.

    ์ „์ฒด ์‹œ์Šคํ…œ์€ ๋Œ€๊ทœ๋ชจ์˜ unlabeled ์ด๋ฏธ์ง€์™€ attribute softmax ์†์‹ค, embedding์— ๋Œ€ํ•ด ์„œ๋กœ ๋‹ค๋ฅธ ์„ธ ๊ฐ€์ง€ metric ์†์‹ค์„ ํ•จ๊ป˜ ์‚ฌ์šฉํ•ด ํ•™์Šตํ•œ๋‹ค.

    6.2.4 Face recognition

    face recognizer์€ ๋‹ค์–‘ํ•œ ์ž์„ธ(pose), ์กฐ๋ช…(illumination), ํ‘œ์ •(expression) ์กฐ๊ฑด(PIE)์—์„œ ์ดฌ์˜๋œ ์–ผ๊ตด ์ด๋ฏธ์ง€๊ฐ€ ์ฃผ์–ด์งˆ ๋•Œ ๊ฐ€์žฅ ์ž˜ ๋™์ž‘ํ•œ๋‹ค.

     

    face recognition์˜ ๊ฐ€์žฅ ์ดˆ๊ธฐ ์ ‘๊ทผ๋“ค ์ค‘ ์ผ๋ถ€๋Š” ๋‘๋“œ๋Ÿฌ์ง„ image feature(๋ˆˆ, ์ฝ”, ์ž…)์„ ์ฐพ๊ณ , ๊ทธ feature location ์‚ฌ์ด์˜ ๊ฑฐ๋ฆฌ๋ฅผ ์ธก์ •ํ•˜๋Š” ๋ฐฉ์‹์ด์—ˆ๋‹ค.

    ๋˜ ๋‹ค๋ฅธ ์ ‘๊ทผ๋“ค์€ gray-level image๋ฅผ eigenfaces(๊ณ ์œ ์–ผ๊ตด)์ด๋ผ ๋ถˆ๋ฆฌ๋Š” ์ €์ฐจ์› subspaces์— ํˆฌ์˜ํ•œ ๋’ค ์ด๋ฅผ ๋น„๊ตํ•˜๊ฑฐ๋‚˜, active appearance model์„ ์ด์šฉํ•ด shpae์™€ appearance์˜ ๋ณ€ํ™”๋ฅผ ํ•จ๊ป˜ ๋ชจ๋ธ๋งํ•˜๋Š” ๋ฐฉ์‹์— ์˜์กดํ–ˆ๋‹ค.

     

    Active appearance and 3D shape models

    face recognition์—์„œ modular ๋˜๋Š” view-vased eigenspaces(๊ณ ์œ ๊ณต๊ฐ„)์„ ์‚ฌ์šฉํ•ด์•ผ ํ•  ํ•„์š”์„ฑ์ด ์žˆ๋‹ค.

    ์–ผ๊ตด์˜ ์™ธ๊ด€๊ณผ ์‹๋ณ„ ๊ฐ€๋Šฅ์„ฑ์€ ์ƒ‰์ด๋‚˜ ํ…์Šค์ฒ˜๋งŒํผ ํ˜•ํƒœ์—๋„ ์˜์กดํ•œ๋‹ค๋Š” ๊ฒƒ์ด๋‹ค.

    3D ๋จธ๋ฆฌ ํšŒ์ „์„ ๋‹ค๋ฃฐ ๋–„์—๋Š”, recogniiton์„ ์ˆ˜ํ–‰ํ•  ๋•Œ ์‚ฌ๋žŒ ๋จธ๋ฆฌ์˜ ์ž์„ธ ์˜ํ–ฅ์„ ๊ฐ€๋Šฅํ•œ ์ œ๊ฑฐ(๋ณด์ •)ํ•ด์•ผ ํ•œ๋‹ค.

     

    ๊ฐ€์žฅ ์ดˆ๊ธฐ face recognition system์€ ์–ผ๊ตด ์ด๋ฏธ์ง€์—์„œ ๋ˆˆ์— ๋„๋Š” ํŠน์ง•์ ์„ ์ฐพ์•„๋‚ธ ๋‹ค์Œ, ๊ทธ ํŠน์ง•์ ๋“ค์˜ ์ƒ๋Œ€์  ์œ„์น˜๋‚˜ ๊ฑฐ๋ฆฌ ์ •๋ณด๋ฅผ ๋ฐ”ํƒ•์œผ๋กœ recognition์„ ์ˆ˜ํ–‰ํ–ˆ๋‹ค. 

    ์ดํ›„ ๊ธฐ๋ฒ•๋“ค๋กœ๋Š” local feature analysis, elastic bunch graph๊ฐ€ ์žˆ๋Š”๋ฐ, ์ด๋“ค์€ ๋‘๋“œ๋Ÿฌ์ง„ ํŠน์ง• ์œ„์น˜์—์„œ์˜ ๋กœ์ปฌ ํ•„ํ„ฐ ์‘๋‹ต์„ ํ˜•ํƒœ ๋ชจ๋ธ๊ณผ ํ•จ๊ผ ๊ฒฐํ•ฉํ•˜์—ฌ face recognition์„ ์ˆ˜ํ–‰ํ–ˆ๋‹ค. 

     

    ํ˜•ํƒœ์™€ ํ…์Šค์ฒ˜(์ƒ‰/์™ธ๊ด€)์€ feature์˜ perception์— ์ค‘์š”ํ•œ ์˜ํ–ฅ์„ ๋ฏธ์นœ๋‹ค.

    facial feature์˜ ์œค๊ณฝ์„ ์„ ์ˆ˜๋™์œผ๋กœ ์ถ”์ •ํ•œ ๋’ค, ์œค๊ณฝ์„ ์„ ์ด์šฉํ•ด ๊ฐ ์ด๋ฏธ์ง€์˜ ๊ธฐ์ค€์ด ๋˜๋Š”(canonical) ํ˜•ํƒœ๋กœ normalize(warp)ํ•œ๋‹ค.

    ํ‰๊ท ์œผ๋กœ๋ถ€ํ„ฐ์˜ ํŽธ์ฐจ๋ฅผ ๊ธฐ์ค€์œผ๋กœ ํ˜•ํƒœ ์ด๋ฏธ์ง€์™€ ์ƒ‰์ƒ ์ด๋ฏธ์ง€๋ฅผ ๋ชจ๋‘ ๋ถ„์„ํ•ด, ํŠน์ •ํ•œ ํ˜•ํƒœ, ์ƒ‰์ƒ์˜ ๋ณ€ํ˜•(deformation)์ด personal feature(์˜ˆ. ์„ฑ๋ณ„)๊ณผ ์—ฐ๊ด€๋  ์ˆ˜ ์žˆ์Œ์ด ๋ณด์—ฌ์กŒ๋‹ค.

     

    identity๋‚˜ expression(ํ‘œ์ •) ๋•Œ๋ฌธ์— ๋ฐœ์ƒํ•˜๋Š” ์–ผ๊ตด ์™ธ๊ด€์˜ ๋ณ€ํ™”๋ฅผ ๋ชจ๋ธ๋งํ•˜๊ธฐ ์œ„ํ•ด, shape deformation(ํ˜•ํƒœ ๋ณ€ํ˜•)์™€ texture interpolation(ํ…์Šค์ฒ˜ ๋ณด๊ฐ„)์„ ๋™์‹œ์— ์‚ฌ์šฉํ•˜๋Š” ๋ฐฉ๋ฒ•์„ ์ผ๋‹ค.

    → Active Shape Models, 3D Morphable Models, Elastic Bunch Graph Matching ๊ฐ™์€ ๊ธฐ๋ฒ•์ด ๋ฐœ์ „ํ–ˆ๋‹ค.

     

    Active Appearance Models์€ ์ด๋ฏธ์ง€์˜ ํ˜•ํƒœ s์˜ ๋ณ€ํ™”(์ด๋ฏธ์ง€์—์„œ key feature point์˜ ์œ„์น˜๋กœ ์ธ์ฝ”๋”ฉ๋œ๋‹ค.)์™€, ๋ถ„์„ํ•˜๊ธฐ ์ „์— ๊ธฐ์ค€์ด ๋˜๋Š”(canonical) ํ˜•ํƒœ๋กœ normalize๋œ ํ…์Šค์ฒ˜ t์˜ ๋ณ€ํ™” ๋ชจ๋‘๋ฅผ ๋ชจ๋ธ๋งํ•œ๋‹ค.

    ํ˜•ํƒœ์™€ ํ…์Šค์ฒ˜๋Š” ๊ฐ๊ฐ ํ‰๊ท  ํ˜•ํƒœ bar_s์™€ ํ‰๊ท  ํ…์Šค์ฒ˜ bar_t๋กœ๋ถ€ํ„ฐ์˜ ํŽธ์ฐจ๋กœ ํ‘œํ˜„๋œ๋‹ค.

    U_s์™€ U_t์˜ eigenvector๋“ค์€ pre-scaled(whitened)๋˜์–ด ์žˆ์–ด์„œ, a์—์„œ์˜ unit vector๊ฐ€ ํ•™์Šต ๋ฐ์ดํ„ฐ์—์„œ ๊ด€์ธก๋œ ๋ณ€๋™์˜ ํ‘œ์ค€ํŽธ์ฐจ์— 1์— ํ•ด๋‹นํ•˜๋„๋ก ๋˜์–ด ์žˆ๋‹ค. 

    ์ด๋Ÿฌํ•œ pricipal deformation๋“ค์— ๋”ํ•ด, ํ˜•ํƒœ parameter๋“ค์€ ์ฃผ์–ด์ง„ ์–ผ๊ตด์˜ ์œ„์น˜, ํฌ๊ธฐ, ๋ฐฉํ–ฅ์— ๋งž์ถ”๊ธฐ ์œ„ํ•ด global similarity transform์„ ํ†ตํ•ด ๋ณ€ํ™˜๋œ๋‹ค.

    ๋งˆ์ฐฌ๊ฐ€์ง€๋กœ ํ…์Šค์ฒ˜ ์ด๋ฏธ์ง€์—๋Š” ์ƒˆ๋กœ์šด ์กฐ๋ช… ์กฐ๊ฑด์„ ๊ฐ€์žฅ ์ž˜ ๋งž์ถ”๊ธฐ ์œ„ํ•œ scale๊ณผ offset์ด ํฌํ•จ๋œ๋‹ค.

     

    ๋™์ผํ•œ appearance parameter a๊ฐ€ ํ‰๊ท ์œผ๋กœ๋ถ€ํ„ฐ์˜ shape deformation๊ณผ texture deformation์„ ๋™์‹œ์— ์ œ์–ดํ•˜๋Š”๋ฐ, ๋‘ deformation์ด ์„œ๋กœ ์ƒ๊ด€๋˜์–ด ์žˆ๋‹ค๊ณ  ๋ณผ ์ˆ˜๋„ ์žˆ๋‹ค.

     

    Active Appearance Models(AAM)์€ ์ฃผ๋กœ ์–ผ๊ตด์— ํŠน์ง•์ ์ธ appearance ๋ณ€ํ™”์™€ ๋ณ€ํ˜•์˜ ๋‹ค์–‘์„ฑ์„ ์ •ํ™•ํžˆ ํฌ์ฐฉํ•˜๋„๋ก ์„ค๊ณ„๋˜์—ˆ์ง€๋งŒ, ์กฐ๋ช…, ์ž์„ธ, ํ‘œ์ • ๊ฐ™์€ ๋‹ค๋ฅธ ๋ณ€๋™ ์š”์ธ๋“ค๋กœ๋ถ€ํ„ฐ identity์— ์˜ํ•œ variation์„ ๋ถ„๋ฆฌํ•˜๋Š” identity subspace๋ฅผ ๊ณ„์‚ฐํ•จ์œผ๋กœ์จ face recognition์—๋„ ์‘์šฉํ•  ์ˆ˜ ์žˆ๋‹ค.

    ๊ธฐ๋ณธ ์•„์ด๋””์–ด๋Š” eigenfaces์—์„œ์˜ ์œ ์‚ฌํ•œ ์—ฐ๊ตฌ๋ฅผ ๋ณธ๋œฌ ๊ฒƒ์œผ๋กœ, intrapersonal variation(๋™์ผ ์ธ๋ฌผ ๋‚ด ๋ณ€๋™)๊ณผ extrapersonal variation(์ธ๋ฌผ ๊ฐ„ ๋ณ€๋™)์— ๋Œ€ํ•ด ๊ฐ๊ฐ ๋ณ„๋„์˜ ํ†ต๊ณ„๋ฅผ ๊ณ„์‚ฐํ•œ ๋’ค, ์ด ๋‘ subspace์—์„œ ์‚ฌ๋žŒ์„ ๊ตฌ๋ถ„ํ•˜๋Š”(๋ณ€๋ณ„๋ ฅ ์žˆ๋Š”) ๋ฐฉํ–ฅ๋“ค์„ ์ฐพ๋Š” ๊ฒƒ์ด๋‹ค.

    AAM์ด recognition์— ์ง์ ‘ ์‚ฌ์šฉ๋˜๊ธฐ๋„ ํ•˜์ง€๋งŒ, recognition ๋งฅ๋ฝ์—์„œ์˜ ์ฃผ๋œ ์šฉ๋„๋Š” ์–ผ๊ตด์„ canonical pose๋กœ ์ •๋ ฌํ•˜๋Š” ๋ฐ ์žˆ๋‹ค.

    ์ •๋ ฌ๋œ ์–ผ๊ตด์— ๋Œ€ํ•ด, ์ „ํ†ต์ ์ธ face recognition ๋ฐฉ๋ฒ•๋“ค์„ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋‹ค.

     

    Active Appearance Models(AAM)์€ ์กฐ๋ช… ๋ฐ ์‹œ์ (viewpoint) ๋ณ€ํ™”๋ฟ๋งŒ ์•„๋‹ˆ๋ผ occlusion(๊ฐ€๋ฆผ)๊นŒ์ง€ ๋‹ค๋ฃฐ ์ˆ˜ ์žˆ๋„๋ก ํ™•์žฅ๋˜์—ˆ๋‹ค.

    ๊ทธ์ค‘ ํ•˜๋‚˜๋Š” 3D shape model์„ ๊ตฌ์ถ•ํ•˜๋Š” ๊ฒƒ์œผ๋กœ, ์ž์„ธ๊ฐ€ ํฌ๊ฒŒ ๋ณ€ํ•˜๋Š” ์ƒํ™ฉ์—์„œ ์–ผ๊ตด ์™ธ๊ด€์„ ์ „์ฒด์ ์ธ ๋ณ€๋™์„ฑ์„ ํ›จ์”ฌ ๋” ์ž˜ ํฌ์ฐฉํ•˜๊ณ  ์„ค๋ช…ํ•  ์ˆ˜ ์žˆ๋‹ค.

    ์ด๋Ÿฌํ•œ ๋ชจ๋ธ์€ monocular view sequences๋กœ๋ถ€ํ„ฐ ๊ตฌ์„ฑํ•  ์ˆ˜ ์žˆ๊ณ  ์žฌ๊ตฌ์„ฑ๊ณผ ์ถ”์ ์—์„œ ๋” ๋†’์€ ์‹ ๋ขฐ๋„์™€ ์ •ํ™•๋„๋ฅผ ์ œ๊ณตํ•˜๋Š” multi-view video sequences๋กœ๋ถ€ํ„ฐ ๊ตฌ์„ฑํ•  ์ˆ˜๋„ ์žˆ๋‹ค.

     

    Facial recognition using deep learning

    ๋”ฅ ์‹ ๊ฒฝ๋ง ๋ฐฑ๋ณธ์„ ์‚ฌ์šฉํ•œ DeepFace ์‹œ์Šคํ…œ์—์„œ๋Š” ๋‘ ๋‹จ๊ณ„์˜ ๊ณผ์ •์ด ์žˆ๋‹ค.

    ๋žœ๋“œ๋งˆํฌ ๊ธฐ๋ฐ˜ pre-processing frontalization step์„ ํ†ตํ•ด ์›๋ž˜์˜ ์ปฌ๋Ÿฌ ์ด๋ฏธ์ง€๋ฅผ ์ž˜ ํฌ๋กญ๋œ ์ •๋ฉด ์–ผ๊ตด ์ด๋ฏธ์ง€๋กœ ๋ณ€ํ™˜ํ•œ๋‹ค.

    ๊ทธ ๋‹ค์Œ์—๋Š” (convolution kernel์ด ๊ณต๊ฐ„ ์œ„์น˜์— ๋”ฐ๋ผ ๋‹ฌ๋ผ์งˆ ์ˆ˜ ์žˆ๋Š”) deep locally conttected network๋ฅผ ํ†ต๊ณผ์‹œํ‚จ ํ›„ classification ์ „์— ๋งˆ์ง€๋ง‰ ๋‘ ๊ฐœ์˜ fully connected layers์— ์ž…๋ ฅํ•œ๋‹ค.

     

    ์ตœ๊ทผ deep facial recognizer ์ผ๋ถ€๋Š” frontalization ๋‹จ๊ณ„๋ฅผ ์ƒ๋žตํ•˜๊ณ , data augmentation(๋ฐ์ดํ„ฐ ์ฆ๊ฐ•)์„ ์‚ฌ์šฉํ•ด ๋” ๋‹ค์–‘ํ•œ ํฌ์ฆˆ๋ฅผ ๊ฐ€์ง„ syntetic input์„ ๋งŒ๋“ค์–ด๋‚ธ๋‹ค.

    triplet loss๋ฅผ ์‚ฌ์šฉํ•ด subject ์ˆ˜์™€ ๋ฌด๊ด€ํ•œ low-dimensional embedding space๋ฅผ ๊ตฌ์„ฑํ•œ๋‹ค.

    softmax์—์„œ ์˜๊ฐ์„ ๋ฐ›์€ contrastive loss๋ฅผ ์‚ฌ์šฉํ•˜๋Š” ๊ฒฝ์šฐ๋„ ์žˆ๋‹ค. 

    ์ด๋Š” visual similarity search, face recognition์œผ๋กœ ๋” ํ™•์žฅ๋˜์—ˆ๋‹ค.

     

    Personal photo collections

    ์–ผ๊ตด์€ ์นด๋ฉ”๋ผ์—์„œ ๋“ฑ์„ ๋Œ๋ฆฌ๊ณ  ์žˆ๊ฑฐ๋‚˜, ๋‹ค๋ฅธ ๋ฌผ์ฒด์— ๊ฐ€๋ ค์ ธ ์žˆ์„ ๋•Œ ๋“ฑ์— ์ฐพ๊ฑฐ๋‚˜ ์ธ์‹ํ•˜๊ธฐ ์–ด๋ ค์šธ ์ˆ˜ ์žˆ๋‹ค.

    ์ด๋Ÿฐ ์ƒํ™ฉ์—์„œ๋Š” facial recognition์„ person detection, clothes recognition๊ณผ ๊ฒฐํ•ฉํ•˜๋Š” ๊ฒƒ์ด ํšจ์œจ์ ์ด๋‹ค.

    ๋˜๋Š” location recognition์ด๋‚˜ activity ๋˜๋Š” event recognition๊ณผ ๊ฒฐํ•ฉํ•˜๋Š” ๋ฐฉ๋ฒ•๋„ ์žˆ๋‹ค. 


    6.3 Object detection

    ๋‹จ์ฒด ์‚ฌ์ง„ ๊ฐ™์€ ์ด๋ฏธ์ง€๋ฅผ ๋ถ„์„ํ•˜๊ธฐ ์œ„ํ•ด์„œ๋Š” ์ด๋ฏธ์ง€์—์„œ ๊ฐ€๋Šฅํ•œ ๋ชจ๋“  sub-window์— ๋Œ€ํ•ด recognition ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์ ์šฉํ•ด ๋ณผ ์ˆ˜๋„ ์žˆ์ง€๋งŒ, ๊ทธ๋Ÿฐ ์•Œ๊ณ ๋ฆฌ์ฆ˜์€ ๋Œ€์ฒด๋กœ ๋А๋ฆฌ๊ณ  ์˜ค๋ฅ˜๊ฐ€ ๋งŽ๋‹ค.

    → ํŠน์ • ๋ฌผ์ฒด๊ฐ€ ๋‚˜ํƒ€๋‚ ๋ฒ•ํ•œ ์˜์—ญ์„ ๋น ๋ฅด๊ฒŒ ์ฐพ์•„๋‚ด๋Š” ์ผ์„ ์ „๋‹ดํ•˜๋Š” ํŠน์ˆ˜ ๋ชฉ์  detector๋ฅผ ๋งŒ๋“œ๋Š” ๊ฒŒ ๋” ํšจ๊ณผ์ ์ด๋‹ค.

    6.3.1 Face detection

    ์ด๋ฏธ์ง€์— facial recognition์„ ์ ์šฉํ•˜๋ ค๋ฉด, ์ด๋ฏธ์ง€ ์•ˆ์— ์žˆ๋Š” ์–ผ๊ตด๋“ค์˜ ์œ„์น˜์™€ ํฌ๊ธฐ๋ฅผ ์ฐพ์•„์•ผ ํ•œ๋‹ค.

    ์›์น™์ ์œผ๋กœ๋Š” ๋ชจ๋“  ํ”ฝ์…€ ์œ„์น˜์™€ ๋ชจ๋“  ์Šค์ผ€์ผ์— ๋Œ€ํ•ด ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์ ์šฉํ•ด์•ผ ํ•˜์ง€๋งŒ ๋„ˆ๋ฌด ๋А๋ฆฌ๋‹ค.

     

    fast face dection ๊ธฐ์ˆ ์€ feature-based, template-based, appearance-based๋กœ ๋‚˜๋‰œ๋‹ค.

     

    feature-based(ํŠน์ง• ๊ธฐ๋ฐ˜) ์ ‘๊ทผ๋ฒ•์€ ๋‘๋“œ๋Ÿฌ์ง„ image feature(๋ˆˆ, ์ฝ”, ์ž…)์˜ ์œ„์น˜๋ฅผ ์ฐพ๊ณ , ์ด feature๋“ค์ด ๊ทธ๋Ÿด๋“ฏํ•œ geometrical ๋ฐฐ์น˜๋ฅผ ์ด๋ฃจ๋Š”์ง€๋ฅผ ๊ฒ€์ฆํ•œ๋‹ค.

    ์ด ๊ธฐ๋ฒ•์—๋Š” ์ดˆ๊ธฐ face recognition ์ ‘๊ทผ๋ฟ๋งŒ ์•„๋‹ˆ๋ผ, modular eigenspaces, local felter jets, SVM, boosting์— ๊ธฐ๋ฐ˜ํ•œ ์ ‘๊ทผ๋“ค๋„ ํฌํ•จ๋œ๋‹ค.

    template-based(ํ…œํ”Œ๋ฆฟ ๊ธฐ๋ฐ˜) ์ ‘๊ทผ๋ฒ•์€ (์˜ˆ. AAM) ์ž์„ธ์™€ ํ‘œ์ •์˜ ๋‹ค์–‘ํ•œ ๋ณ€ํ™”๋ฅผ ํญ๋„“๊ฒŒ ๋‹ค๋ฃฐ ์ˆ˜ ์žˆ๋‹ค.

    ํ•˜์ง€๋งŒ ๋ณดํ†ต ์‹ค์ œ ์–ผ๊ตด ๊ทผ์ฒ˜์—์„œ์˜ ์ข‹์€ initialization์ด ํ•„์š”ํ•˜๋ฏ€๋กœ, ๋น ๋ฅธ face detector๋กœ๋Š” ์ ์ ˆํ•˜์ง€ ์•Š๋‹ค.

    appearance-based(์™ธ๊ด€ ๊ธฐ๋ฐ˜) ์ ‘๊ทผ๋ฒ•์€ ์ด๋ฏธ์ง€ ์•ˆ์˜ ์ž‘์€ ์ง์‚ฌ๊ฐํ˜• patch๋“ค์„ ์„œ๋กœ ๊ฒน์น˜๊ฒŒ ํ•˜์—ฌ ์ „ ๋ฒ”์œ„๋กœ ์Šค์บ”ํ•˜๋ฉด์„œ, ์–ผ๊ตด์ผ ๊ฐ€๋Šฅ์„ฑ์ด ๋†’์€ ํ›„๋ณด ์˜์—ญ์„ ์ฐพ๋Š”๋‹ค.

    ์ดํ›„์—๋Š” ๊ณ„์‚ฐ ๋น„์šฉ์€ ๋” ๋“ค์ง€๋งŒ ๋” ์„ ํƒ์ ์ธ ๊ฒ€์ถœ ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ๋‹จ๊ณ„์ ์œผ๋กœ ์ ์šฉํ•˜๋Š” cascade๋ฅผ ์ด์šฉํ•ด ํ›„๋ณด๋ฅผ ์ •๊ตํ™”ํ•  ์ˆ˜ ์žˆ๋‹ค.

    ์Šค์ผ€์ผ(ํฌ๊ธฐ) ๋ณ€ํ™”์— ๋Œ€์‘ํ•˜๊ธฐ ์œ„ํ•ด, ์ด๋ฏธ์ง€๋“ค์€ ๋ณดํ†ต sub-octave pyramid๋กœ ๋ณ€ํ™˜๋˜๊ณ  ๊ฐ ๋ ˆ๋ฒจ๋งˆ๋‹ค ๋ณ„๋„์˜ ์Šค์บ”์„ ์ˆ˜ํ–‰ํ•œ๋‹ค.

    ๋Œ€๋ถ€๋ถ„์˜ appearance-based ์ ‘๊ทผ๋ฒ•์€ labeled face patch์™€ non-face patch ์ง‘ํ•ฉ์„ ์‚ฌ์šฉํ•ด ๋ถ„๋ฅ˜๊ธฐ๋ฅผ ํ•™์Šต์‹œํ‚ค๋Š” ๋ฐ์— ์˜์กดํ•œ๋‹ค.

     

    labeled ์–ผ๊ตด patch ์ง‘ํ•ฉ๊ณผ, ์–ผ๊ตด์ด ํฌํ•จ๋˜์ง€ ์•Š์€ ๊ฒƒ์œผ๋กœ ์•Œ๋ ค์ง„ ์ด๋ฏธ์ง€์—์„œ ์ถ”์ถœํ•œ patch ์ง‘ํ•ฉ์„ ์ˆ˜์ง‘ํ•œ๋‹ค.

    ์ˆ˜์ง‘๋œ ์–ผ๊ตด ์ด๋ฏธ์ง€์— ๋Œ€ํ•ด ์ขŒ์šฐ ๋ฐ˜์ „, ํšŒ์ „, ์Šค์ผ€์ผ ๋ณ€ํ™”, ์ž‘์€ ์ด๋™ ๋“ฑ์„ ์ธ์œ„์ ์œผ๋กœ ์ ์šฉํ•ด data augmentation์„ ์ˆ˜ํ–‰ํ•˜์—ฌ face detector๊ฐ€ ์ด๋Ÿฌํ•œ ๋ณ€ํ™”์— ๋œ ๋ฏผ๊ฐํ•˜๋„๋ก ๋งŒ๋“ ๋‹ค.

    Clustering and PCA

    ์–ผ๊ตด ํŒจํ„ด๊ณผ ๋น„์–ผ๊ตด ํŒจํ„ด์„ pre-processingํ•œ ๋’ค, k-means๋ฅผ ์‚ฌ์šฉํ•ด ๊ฐ ๋ฐ์ดํ„ฐ์…‹์„ 6๊ฐœ์˜ cluster๋กœ ๊ตฐ์ง‘ํ™”ํ•˜๊ณ , ์ด 12๊ฐœ cluster ๊ฐ๊ฐ์— ๋Œ€ํ•ด PCA subspaces๋ฅผ ์ ํ•ฉ์‹œํ‚จ๋‹ค.

    detection time์—์„œ DIFS, DFFS ์ธก์ •๊ฐ’์„ ์‚ฌ์šฉํ•ด (cluster ๋‹น 2๊ฐœ์”ฉ) ์ด 24๊ฐœ์˜ Mahalanobis ๊ฑฐ๋ฆฌ ์ธก์ •๊ฐ’์„ ๊ณ„์‚ฐํ•œ๋‹ค.

    ์ด๋ ‡๊ฒŒ ์–ป์€ 24๊ฐœ์˜ ์ธก์ •๊ฐ’์„ multi-layer perpectron(MLP), ์ฆ‰ fully connected neural network์˜ ์ž…๋ ฅ์œผ๋กœ ๋„ฃ๋Š”๋‹ค.

     

    Neural networks

    ๋ฐ์ดํ„ฐ๋ฅผ ๋จผ์ € clusteringํ•˜๊ณ  cluster ์ค‘์‹ฌ๊นŒ์ง€์˜ Mahalanobis ๊ฑฐ๋ฆฌ๋ฅผ ๊ณ„์‚ฐํ•˜๋Š” ๋Œ€์‹ , ํšŒ์ƒ‰์กฐ ๊ฐ•๋„๊ฐ’์œผ๋กœ ์ด๋ฃจ์–ด์ง„ 20x20 ํ”ฝ์…€ patch์— ์‹ ๊ฒฝ๋ง(MLP)๋ฅผ ์ง์ ‘ ์ ์šฉํ•œ๋‹ค.

    ์ด๋•Œ ๋‹ค์–‘ํ•œ ํฌ๊ธฐ์˜ ์ˆ˜์ž‘์—… receptive field๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ํฐ ์Šค์ผ€์ผ ๊ตฌ์กฐ์™€ ๋” ์ž‘์€ ์Šค์ผ€์ผ ๊ตฌ์กฐ๋ฅผ ๋ชจ๋‘ ํฌ์ฐฉํ•œ๋‹ค. 

    ์ด๋ ‡๊ฒŒ ๊ตฌ์„ฑ๋œ ์‹ ๊ฒฝ๋ง์€ multi-resolution pyramid์—์„œ ๋ชจ๋“  ๊ฒน์น˜๋Š” patch์˜ ์ค‘์‹ฌ ์œ„์น˜์— ์–ผ๊ตด์ด ์žˆ์„ likehood(๊ฐ€๋Šฅ๋„)๋ฅผ ์ง์ ‘ ์ถœ๋ ฅํ•œ๋‹ค.

    ์–ผ๊ตด ๊ทผ์ฒ˜์—์„œ๋Š” (๊ณต๊ฐ„์ ์œผ๋กœ๋„, ํ•ด์ƒ๋„ ์ธก๋ฉด์œผ๋กœ๋„) ์—ฌ๋Ÿฌ ๊ฒน์น˜๋Š” patch๊ฐ€ ๋™์‹œ์— ๋ฐ˜์‘ํ•  ์ˆ˜ ์žˆ์œผ๋ฏ€๋กœ, ๊ฒน์ณ์„œ ๋‚˜์˜จ ๊ฒ€์ถœ ๊ฒฐ๊ณผ๋ฅผ ํ•˜๋‚˜๋กœ ํ•ฉ์น˜๊ธฐ ์œ„ํ•ด ์ถ”๊ฐ€์ ์ธ mergine ๋„คํŠธ์›Œํฌ๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค.

    ์—ฌ๋Ÿฌ ๊ฐœ์˜ ๋„คํŠธ์›Œํฌ๋ฅผ ํ•™์Šต์‹œํ‚จ ๋’ค ๊ทธ ์ถœ๋ ฅ๋“ค์„ ๊ฒฐํ•ฉํ•˜๋Š” ๋ฐฉ๋ฒ•๋„ ์žˆ๋‹ค.

     

    Support vector machines

    patch๋ฅผ ๋ถ„๋ฅ˜ํ•˜๋Š” ๋ฐ neural network๋ฅผ ์‚ฌ์šฉํ•˜๋Š” ๋Œ€์‹ , support vector machine(SVM)์„ ์‚ฌ์šฉํ•˜์—ฌ pre-processing๋œ patch๋“ค์„ ๋ถ„๋ฅ˜ํ•œ๋‹ค.

    SVM์€ feature space์—์„œ ์„œ๋กœ ๋‹ค๋ฅธ ํด๋ž˜์Šค๋ฅผ ๊ตฌ๋ถ„ํ•˜๋Š” maximum margin seperating plane๋“ค์„ ์ฐพ๋Š”๋‹ค.

    linear classification boundary๋กœ ์ถฉ๋ถ„ํ•˜์ง€ ์•Š์€ ๊ฒฝ์šฐ์—๋Š” kernel์„ ์ด์šฉํ•ด feature space๋ฅผ ๋” ๋†’์€ ์ฐจ์›์˜ feature๋กœ ์˜ฌ๋ ค non-linear classification์„ ์ˆ˜ํ–‰ํ•  ์ˆ˜ ์žˆ๋‹ค.

    SVM์€ face detection, face recognition๋ฟ๋งŒ ์•„๋‹ˆ๋ผ general object recognition์—๋„ ์‚ฌ์šฉ๋˜์–ด ์™”๋‹ค.

     

    Boosting

    ์ ์  ๋” ๋ณ€๋ณ„๋ ฅ์ด ๋†’์€ simple classifier๋“ค์„ ์—ฐ์†์ ์œผ๋กœ ํ•™์Šต์‹œํ‚จ ๋’ค ๊ทธ ์ถœ๋ ฅ๋“ค์„ ๊ฒฐํ•ฉ(blending)ํ•˜๋Š” ๋ฐฉ์‹์ด๋‹ค.

    classifier h(x)๋ฅผ ์—ฌ๋Ÿฌ ๊ฐœ์˜ ๋งค์šฐ ๋‹จ์ˆœํ•œ week learner์˜ ํ•ฉ์œผ๋กœ ๊ตฌ์„ฑํ•˜๋Š” ๋ฐฉ๋ฒ•์ด๋‹ค.

    ๊ฐ weak learner h_j(x)๋Š” ์ž…๋ ฅ์— ๋Œ€ํ•ด ๊ทนํžˆ ๋‹จ์ˆœํ•œ ํ•จ์ˆ˜์ด๋ฏ€๋กœ, ๊ทธ๊ฒƒ ํ•˜๋‚˜๋งŒ์œผ๋กœ๋Š” ๋ถ„๋ฅ˜ ์„ฑ๋Šฅ์— ํฌ๊ฒŒ ๊ธฐ์—ฌํ•˜์ง€ ์•Š๋Š”๋‹ค.

    boosting์˜ ๋Œ€๋ถ€๋ถ„ ๋ณ€ํ˜•์—์„œ๋Š” weak learner๊ฐ€ threshold(์ž„๊ณ„๊ฐ’) ํ•จ์ˆ˜์ด๋ฉฐ, decision stump๋ผ๊ณ ๋„ ๋ถˆ๋ฆฐ๋‹ค. (decision tree์˜ ๊ฐ€๋Šฅํ•œ ํ•œ ๊ฐ€์žฅ ๋‹จ์ˆœํ•œ ํ˜•ํƒœ)

    ๋Œ€๋ถ€๋ถ„์˜ ๊ฒฝ์šฐ ์ „ํ†ต์ ์œผ๋กœ a_j์™€ b_j๋ฅผ ±1๋กœ ์„ค์ •ํ•œ๋‹ค.

    ์ฆ‰ a_j = -s_j, b_j = +s_j๋กœ ๋‘์–ด, ์„ ํƒํ•ด์•ผ ํ•  ๊ฒƒ์€ ํŠน์ง• f_j, ์ž„๊ณ—๊ฐ’ θ_j, ์ž„๊ณ„๊ฐ’์˜ ๊ทน์„ฑ(polarity) s_j ∈ {±1}๋งŒ ๋‚จ๋„๋ก ํ•œ๋‹ค.

     

    booting์˜ ๋งŽ์€ ์‘์šฉ์—์„œ feature์€ ๋‹จ์ˆœํžˆ ์ขŒํ‘œ์ถ• x_k (์ž…๋ ฅ ๋ฒกํ„ฐ์˜ ๊ฐ ์„ฑ๋ถ„ ์ž์ฒด)์ธ ๊ฒฝ์šฐ๊ฐ€ ๋งŽ๋‹ค.

    boosting ์•Œ๊ณ ๋ฆฌ์ฆ˜์€ ์ž…๋ ฅ ๋ฒกํ„ฐ์˜ ์„ฑ๋ถ„๋“ค ์ค‘ ํ•˜๋‚˜๋ฅผ ๊ณจ๋ผ ๊ทธ ๊ฐ’์— threshold๋ฅผ ์ ์šฉํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ weak learner์„ ์„ ํƒํ•œ๋‹ค. 

    feature์„ ์ž…๋ ฅ patch ๋‚ด์˜ ์ง์‚ฌ๊ฐํ˜• ์˜์—ญ๋“ค ์‚ฌ์ด์˜ ์ฐจ์ด๋กœ ์ •์˜ํ•˜๋ฉด ๋‹จ์ผ ํ”ฝ์…€๋ณด๋‹ค ๋” ๋ณ€๋ณ„๋ ฅ์ด ์žˆ์œผ๋ฉด์„œ summed area table(๋ˆ„์ ํ•ฉ ํ…Œ์ด๋ธ”)์„ ๋ฏธ๋ฆฌ ๊ณ„์‚ฐํ•ด ๋‘์—ˆ์„ ๋•Œ ๋งค์šฐ ๋น ๋ฅด๊ฒŒ ๊ณ„์‚ฐํ•  ์ˆ˜ ์žˆ๋‹ค.

     

    ์ด๋ฏธ์ง€ ํ”ฝ์…€ ์ˆ˜๋ฅผ N์ด๋ผ ํ•  ๋•Œ O(N)์˜ pre-processing ๋น„์šฉ๋งŒ ๋“ค์ด๋ฉด ์ดํ›„ ์ง์‚ฌ๊ฐํ˜• ์˜์—ญ๋“ค์˜ ํ•ฉ/์ฐจ๋Š” ๋ง์…ˆ ํ˜น์€ ๋บ„์…ˆ 4r๋ฒˆ์œผ๋กœ ๊ณ„์‚ฐํ•  ์ˆ˜ ์žˆ๋‹ค. (r ∈ {2, 3, 4}์€ ํ•ด๋‹น feature์„ ๊ตฌ์„ฑํ•˜๋Š” ์ง์‚ฌ๊ฐํ˜•์˜ ๊ฐœ์ˆ˜)

     

    boosting ์„ฑ๊ณต์˜ ํ•ต์‹ฌ์€ weak learner๋ฅผ ์ ์ง„์ ์œผ๋กœ ์„ ํƒํ•˜๋Š” ๋ฐฉ๋ฒ•๊ณผ, ๊ฐ ๋‹จ๊ณ„๊ฐ€ ๋๋‚  ๋•Œ๋งˆ๋‹ค training example๋“ค์„ re-weightingํ•˜๋Š” ๋ฐฉ๋ฒ•์— ์žˆ๋‹ค.

    AdaBoost ์•Œ๊ณ ๋ฆฌ์ฆ˜์€ ๊ฐ ๋‹จ๊ณ„์—์„œ ์ƒ˜ํ”Œ์ด ์˜ฌ๋ฐ”๋ฅด๊ฒŒ ๋ถ„๋ฅ˜๋˜์—ˆ๋Š”์ง€ ์—ฌ๋ถ€์— ๋”ฐ๋ผ ์ƒ˜ํ”Œ์„ re-weightingํ•˜๊ณ , ๋‹จ๊ณ„๋ณ„ ํ‰๊ท  ๋ถ„๋ฅ˜ ์˜ค๋ฅ˜๋ฅผ ์ด์šฉํ•ด weak learner ์‚ฌ์ด์˜ ์ตœ์ข… weight α_j๋ฅผ ๊ฒฐ์ •ํ•œ๋‹ค.

     

    detector์˜ ์†๋„๋ฅผ ๋” ๋†’์ด๊ธฐ ์œ„ํ•ด classifier cascade๋ฅผ ๋งŒ๋“ค ์ˆ˜ ์žˆ๋‹ค.

    ๊ฐ classifier๋Š” ์†Œ์ˆ˜์˜ ํ…Œ์ŠคํŠธ๋งŒ ์‚ฌ์šฉํ•ด ๋Œ€๋ถ€๋ถ„์˜ non-face๋ฅผ ๋น ๋ฅด๊ฒŒ ๊ธฐ๊ฐํ•˜๊ณ , ๊ฐ€๋Šฅํ•œ ์–ผ๊ตด ํ›„๋ณด๋Š” ์ตœ๋Œ€ํ•œ ํ†ต๊ณผ์‹œํ‚ค๋„๋ก ์„ค๊ฒŒํ•œ๋‹ค.

     

    Deep networks

    feature cascade, deformable(๋ณ€ํ˜• ๊ฐ€๋Šฅํ•œ) parts model, aggregated(์ง‘๊ณ„๋œ) channel features, ์‹ ๊ฒฝ๋ง ๊ธฐ๋ฐ˜ ๋ฐฉ๋ฒ•๋“ค์ด ์ œ์•ˆ๋˜์–ด ์™”๋‹ค.

    6.3.2 Pedestrian detection

    detection์„ ์ผ๋ฐ˜์ ์ธ class recognition์˜ ๋” ์–ด๋ ค์šด ๋ณ€ํ˜•์œผ๋กœ ๋ณด๊ณ , object์˜ ์œ„์น˜์™€ ๋ฒ”์œ„๋ฅผ ๊ฐ€๋Šฅํ•œ ํ•œ ์ •ํ™•ํ•˜๊ฒŒ ๊ฒฐ์ •ํ•˜๋Š” ๊ฒƒ์„ ๋ชฉํ‘œ๋กœ ํ–ˆ๋‹ค.

     

    ๋„๋ฆฌ ์•Œ๋ ค์ง„ pedestrian detection์€ ์„œ๋กœ ๊ฒน์น˜๋„๋ก ๋ฐฐ์น˜๋œ Histogram of Oreinted Gradients(HOG) descriptor๋“ค์„ ์ž…๋ ฅ์œผ๋กœ ํ•˜์—ฌ SVM์— ๋„ฃ๋Š” ๋ฐฉ์‹์ด๋‹ค.

    ๊ฐ HOG๋Š” ํŠน์ • ๋ฐฉํ–ฅ์—์„œ์˜ gradient์— ๋Œ€ํ•ด magnitude๋กœ ๊ฐ€์ค‘๋œ vote๋ฅผ ๋ˆ„์ ํ•˜๋Š” cell๋“ค๋กœ ๊ตฌ์„ฑ๋˜๋Š”๋ฐ ์ด๋Š” SIFT(Scale-invariant Feature Transform)์—์„œ์™€ ์œ ์‚ฌํ•˜๋‹ค.

     

    SIFT๊ฐ€ interest point ์œ„์น˜์—์„œ๋งŒ ๊ณ„์‚ฐ๋˜๋Š” ๊ฒƒ๊ณผ ๋‹ฌ๋ฆฌ, HOG๋Š” ๊ทœ์น™์ ์ธ ๊ฒฉ์ž ์œ„์—์„œ ์„œ๋กœ ๊ฒน์น˜๊ฒŒ ํ‰๊ฐ€๋˜๋ฉฐ, descriptor์˜ ํฌ๊ธฐ๋Š” ๋” ๊ฑฐ์นœ coarser grid๋ฅผ ์ด์šฉํ•ด ์ •๊ทœํ™”๋œ๋‹ค.

    ๋˜ํ•œ HOG๋Š” ๋‹จ์ผ ์Šค์ผ€์ผ๊ณผ ๊ณ ์ •๋œ ๋ฐฉํ–ฅ์—์„œ๋งŒ ๊ณ„์‚ฐ๋œ๋‹ค.

    ์‚ฌ๋žŒ ์œค๊ณฝ์„  ์ฃผ๋ณ€์˜ ๋ฏธ๋ฌ˜ํ•œ ๋ฐฉํ–ฅ ๋ณ€ํ™”๋ฅผ ํฌ์ฐฉํ•˜๊ธฐ ์œ„ํ•ด ๋ฐฉํ–ฅ bin์„ ๋งŽ์ด ์‚ฌ์šฉํ•˜๊ณ  central-difference(์ค‘์•™์ฐจ๋ถ„) ๋ฐฉ์‹์˜ gradient ๊ณ„์‚ฐ์—๋Š” smoothing์„ ์ˆ˜ํ–‰ํ•˜์ง€ ์•Š๋Š”๋‹ค.

     

    HOG descriptor๋ฅผ ๊ณ„์‚ฐํ•œ ๋’ค์—๋Š” ์ด๋ ‡๊ฒŒ ์–ป์–ด์ง„ ๊ณ ์ฐจ์› ์—ฐ์† descriptor ๋ฒกํ„ฐ๋“ค๋กœ SVM์„ ํ•™์Šต์‹œํ‚จ๋‹ค. 

    b-c๋Š” ๊ฐ ๋ธ”๋ก์—์„œ ์–‘์˜ ๊ฐ€์ค‘์น˜์™€ ์Œ์˜ ๊ฐ€์ค‘์น˜๊ฐ€ ์–ด๋–ป๊ฒŒ ๋ถ„ํฌํ•˜๋Š”์ง€๋ฅผ ๋ณด์—ฌ์ค€๋‹ค.

    f-g๋Š” ๊ฐ€์šด๋ฐ ์ž…๋ ฅ ์ด๋ฏธ์ง€์— ๋Œ€ํ•ด ํ•ด๋‹น ๊ฐ€์ค‘์น˜๊ฐ€ ์ ์šฉ๋œ HOG ์‘๋‹ต์„ ๋ณด์—ฌ์ค€๋‹ค. 

    ์‚ฌ๋žŒ์˜ ๋จธ๋ฆฌ, ๋ชธํ†ต, ๋ฐœ ์ฃผ๋ณ€์—๋Š” ์–‘์˜ ์‘๋‹ต์ด ๋งŽ์ด ๋‚˜ํƒ€๋‚˜๊ณ  ์Œ์˜ ์‘๋‹ต์€ ์ƒ๋Œ€์ ์œผ๋กœ ์ ์œผ๋ฉฐ ์Šค์›จํ„ฐ์˜ ๊ฐ€์šด๋ฐ ๋ถ€๋ถ„๊ณผ ๋ชฉ ์ฃผ๋ณ€์— ๋‚˜ํƒ€๋‚œ๋‹ค.

     

    HOG ๊ธฐ๋ฐ˜ person detector์— flexible part model์„ ํฌํ•จํ•˜์˜€๋‹ค. 

    ๊ฐ part๋Š” ์ „์ฒด object ๋ชจ๋ธ๋ณด๋‹ค ํ”ผ๋ผ๋ฏธ๋“œ์—์„œ ๋‘ ๋‹จ๊ณ„ ๋” ์•„๋ž˜ ๋ ˆ๋ฒจ(๋” ๋†’์€ ํ•ด์ƒ๋„)์—์„œ ๊ณ„์‚ฐ๋œ HOG ์œ„์—์„œ ํ•™์Šต๋˜๊ณ  ๊ฒ€์ถœ๋˜๋ฉฐ, ๋ถ€๋ชจ ๋…ธ๋“œ(์ „์ฒด ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค)์— ๋Œ€ํ•œ ๋ถ€ํ’ˆ๋“ค์˜ ์ƒ๋Œ€์  ์œ„์น˜๋„ ํ•™์Šต๋˜์–ด recognition ๊ณผ์ •์—์„œ ์‚ฌ์šฉ๋œ๋‹ค.

    training example์˜ ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค๊ฐ€ ๋ถ€์ •ํ™•ํ•˜๊ฑฐ๋‚˜ ์ผ๊ด€๋˜์ง€ ์•Š์€ ๋ฌธ์ œ๋ฅผ ๋ณด์™„ํ•˜๊ธฐ ์œ„ํ•ด ๋ถ€๋ชจ ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค์˜ ์ง„์งœ ์œ„์น˜๋ฅผ latent(์ž ์žฌ) variable๋กœ ๊ฐ„์ฃผํ•˜๊ณ , training๊ณผ recognition ๋‹จ๊ณ„ ๋ชจ๋‘์—์„œ ์ด๋ฅผ ์ถ”๋ก ํ•œ๋‹ค.

    part๋“ค์˜ ์œ„์น˜ ๋˜ํ•œ latent variable์ด๋ฏ€๋กœ training data์— part ๋ผ๋ฒจ์ด ์—†์–ด๋„ semi-supervised ๋ฐฉ์‹์œผ๋กœ ์‹œ์Šคํ…œ์„ ํ•™์Šตํ•  ์ˆ˜ ์žˆ๋‹ค.

     

    ์‚ฌ๋žŒ์˜ ์ž์„ธ์™€ ์œ„์น˜๋ฅผ ๋” ์ •ํ™•ํ•˜๊ฒŒ ์ถ”์ •ํ•˜๊ธฐ ์œ„ํ•ด HOG ์œ„์— ๊ตฌ์ถ•ํ•œ random forests๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ, ๋ณดํ–‰ ์ฃผ๊ธฐ์—์„œ์˜ ๋‹จ๊ณ„์™€ ๊ฐœ๋ณ„ ๊ด€์ ˆ ์œ„์น˜๋ฅผ ๋ชจ๋‘ ๊ณ„์‚ฐํ•œ๋‹ค.

    ๋น„๋””์˜ค sequence๋ฅผ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋Š” ๊ฒฝ์šฐ์—๋Š” optical flow(๊ด‘๋ฅ˜)์™€ motion discontinuities(์šด๋™ ๋ถˆ์—ฐ์†)์— ๋‹ด๊ธด ์ถ”๊ฐ€ ์ •๋ณด๊ฐ€ ๊ฒ€์ถœ ์ž‘์—…์— ๋„์›€์ด ๋  ์ˆ˜ ์žˆ๋‹ค.

    6.3.3 General object detection

    Precision vs recall

    object detection์˜ ํ•ต์‹ฌ ๊ณผ์ œ๋Š” ๋ชจ๋“  object๋ฅผ ์ •ํ™•ํ•œ ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค๋กœ ๋‘˜๋Ÿฌ์‹ธ๊ณ , ๊ทธ object๋“ค์˜ ๋ผ๋ฒจ์„ ์˜ฌ๋ฐ”๋ฅด๊ฒŒ ๋ถ™์ด๋Š” ๊ฒƒ์ด๋‹ค.

    ๊ฐ ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค๊ฐ€ ์–ผ๋งˆ๋‚˜ ์ •ํ™•ํ•œ์ง€๋ฅผ ์ธก์ •ํ•˜๊ธฐ ์œ„ํ•ด IoU(intersetion over union)์ด ํ”ํžˆ ์“ฐ์ด๋ฉฐ, Jaccard index, Faccard similarity coefficient๋ผ๊ณ  ๋ถˆ๋ฆฐ๋‹ค.

    IoU๋Š” ์–ด๋–ค object์— ๋Œ€ํ•ด ์˜ˆ์ธก ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค B_pr๊ณผ ์ •๋‹ต ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค B_gt๋ฅผ ๋‘๊ณ , ๋‘ ๋ฐ•์Šค์˜ ๊ต์ง‘ํ•ฉ ์˜์—ญ ๋ฉด์ ์„ ํ•ฉ์ง‘ํ•ฉ ์˜์—ญ ๋ฉด์ ์œผ๋กœ ๋‚˜๋ˆˆ ๋น„์œจ์„ ๊ณ„์‚ฐํ•ด ๊ตฌํ•œ๋‹ค.

    object detection์€ ๋จผ์ € ๊ทธ๋Ÿด๋“ฏํ•œ ์ง์‚ฌ๊ฐํ˜• ํ›„๋ณด ์˜์—ญ๋“ค(๊ฒ€์ถœ ๊ฒฐ๊ณผ)๋ฅผ ์—ฌ๋Ÿฌ ๊ฐœ ์ œ์•ˆํ•œ ๋‹ค์Œ, ๊ฐ ํ›„๋ณด๋ฅผ ๋ถ„๋ฅ˜ํ•˜๊ณ  ๋™์‹œ์— confidence score๋„ ์ถœ๋ ฅํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ ๋™์ž‘ํ•œ๋‹ค.

    ๋‹ค์Œ์œผ๋กœ ์ด ํ›„๋ณด๋“ค์€ non-maximal suppression(NMS) ๋‹จ๊ณ„๋กœ ๋“ค์–ด๊ฐ€๋Š”๋ฐ, ์—ฌ๊ธฐ์„œ ๊ฐ€์žฅ ๋†’์€ ์‹ ๋ขฐ๋„๋ถ€ํ„ฐ ์„ ํƒํ•˜๋Š” greedy ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‚ฌ์šฉํ•ด, ๊ฐ•ํ•œ ๊ฒ€์ถœ๊ณผ ๋„ˆ๋ฌด ๋งŽ์ด ๊ฒน์น˜๋Š” ์•ฝํ•œ ๊ฒ€์ถœ๋“ค์„ ์ œ๊ฑฐํ•œ๋‹ค. 

     

    object detector์˜ ์„ฑ๋Šฅ ํ‰๊ฐ€๋ฅผ ์œ„ํ•ด ๊ฒ€์ถœ ๊ฒฐ๊ณผ๋“ค์„ confidence(์‹ ๋ขฐ๋„)๊ฐ€ ๋†’์€ ๊ฒƒ๋ถ€ํ„ฐ ๋‚ฎ์€ ๊ฒƒ ์ˆœ์„œ๋กœ ๋ชจ๋‘ ํ›‘์–ด๋ณด๋ฉฐ, ๊ฐ ๊ฒ€์ถœ์„ TP, FP๋กœ ๋ถ„๋ฅ˜ํ•œ๋‹ค.

    TP๋Š” ๋ผ๋ฒจ์ด ๋งž๊ณ  IoU๊ฐ€ ์ถฉ๋ถ„ํžˆ ํฐ ๊ฒฝ์šฐ์ด๊ณ , FP๋Š” ๋ผ๋ฒจ์ด ํ‹€๋ฆฌ๊ฑฐ๋‚˜ ํ•ด๋‹น ์ •๋‹ต object๊ฐ€ ์ด๋ฏธ ๋‹ค๋ฅธ ๊ฒ€์ถœ์— ์˜ํ•ด ๋งค์นญ๋œ ๊ฒฝ์šฐ์ด๋‹ค.

    confidence threshold๋ฅผ ์ ์  ๋‚ฎ์ถฐ๊ฐ€๋ฉฐ, ๊ทธ๋•Œ๊ทธ๋•Œ์˜ precision(์ •๋ฐ€๋„)์™€ recall(์žฌํ˜„์œจ)์„ ๊ณ„์‚ฐํ•  ์ˆ˜ ์žˆ๋‹ค.

    P๋Š” positive example์˜ ๊ฐœ์ˆ˜์ด๋‹ค. 

     

    ๋ชจ๋“  confidence threshold์—์„œ precision๊ณผ recall์„ ๊ณ„์‚ฐํ•˜๋ฉด precision-recall curve๋ฅผ ๋งŒ๋“ค ์ˆ˜ ์žˆ๋‹ค.

    ๊ณก์„  ์•„๋ž˜ ๋ฉด์ ์„ average precision(AP)๋ผ๊ณ  ๋ถ€๋ฅธ๋‹ค.

    ๊ฒ€์ถœํ•˜๋Š” ๊ฐ ํด๋ž˜์Šค๋งˆ๋‹ค AP๋ฅผ ๋”ฐ๋กœ ๊ณ„์‚ฐํ•  ์ˆ˜ ์žˆ๊ณ , ์ด๋ฅผ ํ‰๊ท ๋‚ด๋ฉด mean AP๋ฅผ ์–ป๋Š”๋‹ค.

     

    AP ์ ์ˆ˜๋Š” ์—ฌ์ „ํžˆ ๋„๋ฆฌ ์“ฐ์ด์ง€๋งŒ, ํ™•๋ฅ  ๊ธฐ๋ฐ˜์˜ ๋Œ€์•ˆ ํ‰๊ฐ€ ์ง€ํ‘œ๋กœ probability-based detection quality(PDQ)๊ฐ€ ์ œ์•ˆ๋˜์—ˆ๋‹ค.

    AP๋ฅผ ๋” ๋งค๋„๋Ÿฝ๊ฒŒ ๋งŒ๋“  ๋ฒ„์ „์ธ Smooth-AP๋„ ์ œ์•ˆ๋˜์—ˆ๋‹ค.

     

    Modern object detectors

    ์ด๋ฏธ์ง€์—์„œ object๋ฅผ ๊ฒ€์ถœํ•˜๋Š” ์ฒซ ๋‹จ๊ณ„๋Š” classifier๋ฅผ ์ ์šฉํ•ด ๋ณผ ๋งŒํ•œ ๊ทธ๋Ÿด๋“ฏํ•œ ์ง์‚ฌ๊ฐํ˜• ํ›„๋ณด ์˜์—ญ๋“ค์„ ์ œ์•ˆํ•˜๋Š” ๊ฒƒ์ด๋‹ค.

    ์œ„๋Š” R-CNN์ด๋‹ค.

    ๋จผ์ € selective search ์•Œ๊ณ ๋ฆฌ์ฆ˜์„ ์‚ฌ์šฉํ•ด 2,000๊ฐœ์˜ ํ›„๋ณด ์˜์—ญ์„ ์ถ”์ถœํ•œ๋‹ค.

    ๊ทธ ๋‹ค์Œ ๊ฐ ํ›„๋ณด ์˜์—ญ์„ 224x224 ํฌ๊ธฐ์˜ ์ •์‚ฌ๊ฐํ˜• ์ด๋ฏธ์ง€๋กœ rescale(warp)ํ•œ ๋’ค, AlexNet ๋˜๋Š” VGG ์‹ ๊ฒฝ๋ง์— ํ†ต๊ณผ์‹œํ‚ค๊ณ  ๋งˆ์ง€๋ง‰์— SVM ๋ถ„๋ฅ˜๊ธฐ๋กœ ๋ถ„๋ฅ˜ํ•œ๋‹ค.

    ์œ„๋Š” Fast R-CNN์ด๋‹ค.

    convolutional neural metwork์™€ region extraction ๋‹จ๊ณ„๋ฅผ ์„œ๋กœ ๋ฐ”๊พธ๊ณ  (๋จผ์ € ์ „์ฒด ์ด๋ฏธ์ง€์— ๋Œ€ํ•ด CNN ํŠน์ง•์„ ๊ณ„์‚ฐํ•œ ๋‹ค์Œ ๊ทธ ํŠน์ง•์—์„œ ํ›„๋ณด ์˜์—ญ์„ ๋ฝ‘์•„๋‚ธ๋‹ค.) SVM ๋Œ€์‹  fully connected layer๋“ค์„ ์‚ฌ์šฉํ•œ๋‹ค.

    ์ด fully connected layer๋“ค์€ object zmffotm ์˜ˆ์ธก๊ณผ ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค ๋ณด์ •(refinement)๋ฅผ ํ•จ๊ป˜ ๊ณ„์‚ฐํ•œ๋‹ค.

    ์ด๋ ‡๊ฒŒ ํ•˜๋ฉด CNN ๊ณ„์‚ฐ์„ ์—ฌ๋Ÿฌ ํ›„๋ณด ์˜์—ญ์— ์žฌ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ์–ด ํ•™์Šต ๋ฐ ํ…Œ์ŠคํŠธ ์‹œ๊ฐ„์ด ํ›จ์”ฌ ๋นจ๋ผ์ง€๋„, ์ด์ „ ๋„คํŠธ์›Œํฌ๋“ค์— ๋น„ํ•ด ์ •ํ™•๋„๊ฐ€ ํฌ๊ฒŒ ๊ฐœ์„ ๋œ๋‹ค.

    Fast R-CNN์€ ํ•˜๋‚˜์˜ shared backbone๊ณผ ๋‘ ๊ฐœ์˜ ๋ถ„๋ฆฌ๋œ head๋ฅผ ๊ฐ€์ง„ ๋”ฅ ๋„คํŠธ์›Œํฌ์˜ ์˜ˆ์ด๋ฉฐ, ๋‘ ๊ฐ€์ง€ ์„œ๋กœ ๋‹ค๋ฅธ loss function์„ ๊ฐ–๋Š”๋‹ค.

     

    Faster R-CNN์€ ๋น„๊ต์  ๋А๋ฆฐ selective search ๋‹จ๊ณ„๋ฅผ Region Proposal Network(RPN)์œผ๋กœ ๋Œ€์ฒดํ•˜์—ฌ, ์ถ”๋ก  ์†๋„๋ฅผ ํฌ๊ฒŒ ๋†’์ธ๋‹ค.

    convolutional featrues์„ ๊ณ„์‚ฐํ•œ ๋’ค, RPN์€ ๊ฐ ๊ฑฐ์นœ ์œ„์น˜๋งˆ๋‹ค ์—ฌ๋Ÿฌ ๊ฐœ์˜ ์ž ์žฌ์  anchor box๋ฅผ ์ œ์•ˆํ•˜๋Š”๋ฐ, ์ด anchor๋“ค์€ ๋‹ค์–‘ํ•œ object๋ฅผ ์ˆ˜์šฉํ•  ์ˆ˜ ์žˆ๋„๋ก ๋ชจ์–‘๊ณผ ํฌ๊ธฐ๊ฐ€ ์„œ๋กœ ๋‹ค๋ฅด๊ฒŒ ์„ค์ •๋œ๋‹ค.

    ์ดํ›„ ๊ฐ ์ œ์•ˆ์€ Fast R-CNN์˜ head๋ฅผ ํ†ตํ•ด ๋ถ„๋ฅ˜๋˜๊ณ  ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค๊ฐ€ refine๋˜๋ฉฐ, ์ตœ์ข… ๊ฒ€์ถœ ๊ฒฐ๊ณผ๋Š” ์ ์ˆ˜์— ๋”ฐ๋ผ ์ˆœ์œ„๊ฐ€ ๋งค๊ฒจ์ง€๊ณ  non-maximal suppression(๋น„์ตœ๋Œ€ ์–ต์ œ)๋ฅผ ํ†ตํ•ด ๋ณ‘ํ•ฉ๋œ๋‹ค.

     

    R-CNN, Fast R-CNN, Faster R-CNN์€ ๋ชจ๋‘ single resolution convolutional feature map์—์„œ ๋™์ž‘ํ•œ๋‹ค.

    ๋” ๋‚˜์€ scale invariance(์Šค์ผ€์ผ ๋ถˆ๋ณ€์„ฑ)์„ ์–ป๊ธฐ ์œ„ํ•ด์„œ๋Š” ์ด๋ฏธ์ง€ ํ”ผ๋ผ๋ฏธ๋“œ์˜ ๊ฐ ๋ ˆ๋ฒจ์—์„œ feature map์„ ๊ณ„์‚ฐํ•˜๋Š” ๋“ฑ ์—ฌ๋Ÿฌ ํ•ด์ƒ๋„ ๋ฒ”์œ„์—์„œ ๋™์ž‘ํ•˜๋Š” ํŽธ์ด ๋ฐ”๋žŒ์งํ•˜์ง€๋งŒ, ์ด๋Š” ๊ณ„์‚ฐ ๋น„์šฉ์ด ํฌ๋‹ค.

    ๋‹ค์‹  convolutional network ๋‚ด๋ถ€์˜ ์—ฌ๋Ÿฌ ์ธต์„ ํ™œ์šฉํ•  ์ˆ˜๋„ ์žˆ์ง€๋งŒ, ์ด ์ธต๋“ค์€ semantic abstraction(์˜๋ฏธ์  ์ถ”์ƒํ™”) ์ˆ˜์ค€์ด ์„œ๋กœ ๋‹ค๋ฅด๋‹ค. ๋” ๋†’์€(๋” ๋‚ฎ์€) ๋ ˆ๋ฒจ์ผ์ˆ˜๋ก ๋” ์ถ”์ƒ์ ์ธ ๊ฐœ๋…์— ๋งž์ถฐ์ ธ ์žˆ๋‹ค.

      Feature Pyramod Network(FPN)์„ ๊ตฌ์„ฑํ•˜์—ฌ ํ•ด๊ฒฐํ•œ๋‹ค.

    top-down ์—ฐ๊ฒฐ์„ ์‚ฌ์šฉํ•˜์—ฌ ๋†’์€ ๋ ˆ๋ฒจ์—์„œ ์ถ”๋ก ๋œ ์˜๋ฏธ ์ •๋ณด๋ฅผ ๋” ๋†’์€ ํ•ด์ƒ๋„(๋” ์•„๋ž˜) ํ”ผ๋ผ๋ฏธ๋“œ ๋ ˆ๋ฒจ์— ์ „๋‹ฌํ•œ๋‹ค.

    ์ด๋Ÿฌํ•œ ์ถ”๊ฐ€ ์ •๋ณด๋Š” object detector์˜ ์„ฑ๋Šฅ์„ ํฌ๊ฒŒ ํ–ฅ์ƒ์‹œํ‚ค๋ฉฐ, object ํฌ๊ธฐ์— ๋Œ€ํ•œ ๋ฏผ๊ฐ๋„๋ฅผ ํ›จ์”ฌ ์ค„์—ฌ ์ค€๋‹ค.

     

    DETR์€ non-maximum suppression๊ณผ anchor generation ๊ณผ์ •์„ ์—†์• ๋Š” ๋” ๋‹จ์ˆœํ•œ ์•„ํ‚คํ…์ฒ˜๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค.

    ์ด ๋ชจ๋ธ์€ ResNet backbone์ด transformer encoder-decoder๋กœ ์—ฐ๊ฒฐ๋˜๋Š” ๊ตฌ์กฐ๋กœ ์ด๋ฃจ์–ด์ง„๋‹ค.

    N๊ฐœ์˜ ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค ์˜ˆ์ธก์„ ๋งŒ๋“ค์–ด ๋‚ด๋ฉฐ, ๊ทธ์ค‘ ์ผ๋ถ€๋Š” no object ํด๋ž˜์Šค์ผ ์ˆ˜ ์žˆ๋‹ค.

    ์ •๋‹ต(ground truth) ๋ฐ”์šด๋”ฉ ๋ฐ•์Šค๋„ ์ด N๊ฐœ๊ฐ€ ๋˜๋„๋ก no object ๋ฐ•์Šค๋ฅผ ๋ง๋ถ™์—ฌ ๋งž์ถ˜๋‹ค.

    training time์—๋Š” bipartite matching(์ด๋ถ„ ๋งค์นญ)์„ ์‚ฌ์šฉํ•ด ๊ฐ ์˜ˆ์ธก ๋ฐ•์Šค๋ฅผ ์ •๋‹ต ๋ฐ•์Šค ํ•˜๋‚˜์™€ 1:1๋กœ ๋Œ€์‘์‹œํ‚ค๋˜, ๊ทธ ๋Œ€์‘์ด ์ „์ฒด cost๋ฅผ ์ตœ์†Œ๋กœ ๋งŒ๋“ค๋„๋ก ์„ ํƒํ•œ๋‹ค.

    ์ „์ฒด ํ•™์Šต ์†์‹ค์€ ์ด๋ ‡๊ฒŒ ๋งค์นญ๋œ ๋ฐ•์Šค๋“ค ์‚ฌ์ด์˜ ์†์‹ค์„ ํ•ฉํ•œ ๊ฐ’์ด ๋œ๋‹ค.

     

    Single-stage networks

    ์•ž์˜ ์•„ํ‚คํ…์ฒ˜๋“ค์—์„œ๋Š” rerion proposal(์˜์—ญ ์ œ์•ˆ) ์•Œ๊ณ ๋ฆฌ์ฆ˜์ด๋‚˜ ๋„คํŠธ์›Œํฌ๊ฐ€ ๊ฒ€์ถœ ํ›„๋ณด์˜ ์œ„์น˜์™€ ํ˜•ํƒœ๋ฅผ ์„ ํƒํ•˜๊ณ , ๊ทธ ๋‹ค์Œ ๋‘ ๋ฒˆ์จฐ ๋„คํŠธ์›Œํฌ๊ฐ€ ๊ฐ ์˜์—ญ ๋‚ด๋ถ€์˜ ํ”ฝ์…€ ๋˜๋Š” feature์„ ์ด์šฉํ•ด classification์™€ regression์„ ์ˆ˜ํ–‰ํ–ˆ๋‹ค.

    ์ด์•  ๋Œ€ํ•œ ๋Œ€์•ˆ์œผ๋กœ ํ•˜๋‚˜์˜ neural network๊ฐ€ ๋‹ค์–‘ํ•œ ์œ„์น˜์—์„œ์˜ ๊ฒ€์ถœ ๊ฒฐ๊ณผ๋ฅผ ์ง์ ‘ ์ถœ๋ ฅํ•˜๋Š” single-stage ๋„คํŠธ์›Œํฌ๋ฅผ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋‹ค.

     

    LYOLOv4์˜ ์ฒ˜๋ฆฌ ํŒŒ์ดํ”„๋ผ์ธ์—” neck ๋‹จ๊ณ„๊ฐ€ ์žˆ๋‹ค.

    nect์€ feature pyramid network์—์„œ์™€ ๊ฐ™์€ top-down feature enbancement๋ฅผ ์ˆ˜ํ–‰ํ•œ๋‹ค.

    ๋˜ํ•œ ๊ตฌ์„ฑ ์š”์†Œ๋“ค์„ training time์— ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋Š” bag of freebies(์ถ”๊ฐ€ ๋น„์šฉ ์—†์ด/๊ฑฐ์˜ ์—†์ด ์„ฑ๋Šฅ์„ ์˜ฌ๋ฆฌ๋Š” ํ•™์Šต ๊ธฐ๋ฒ•)์™€ bag of specials(๊ฒ€์ถœ ์‹œ์ ์— ์ตœ์†Œํ•œ์˜ ์ถ”๊ฐ€ ๋น„์šฉ์œผ๋กœ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋‹ค.)์œผ๋กœ ๋ถ„๋ฅ˜ํ•œ๋‹ค.

Designed by Tistory.