<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>딥러닝 탐구생활</title>
    <link>https://deeplearning-research.tistory.com/</link>
    <description>나를 알고 싶나요 닝겐?</description>
    <language>ko</language>
    <pubDate>Sun, 23 Aug 2026 03:51:46 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>괜찮나요닝겐</managingEditor>
    <image>
      <title>딥러닝 탐구생활</title>
      <url>https://tistory1.daumcdn.net/tistory/7274298/attach/2c32b12f0afd457387a7ed6c43c206ef</url>
      <link>https://deeplearning-research.tistory.com</link>
    </image>
    <item>
      <title>[NEW] Yolov13 논문 리뷰</title>
      <link>https://deeplearning-research.tistory.com/28</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&lt;a href=&quot;https://arxiv.org/abs/2506.17733&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;&lt;span&gt;https://arxiv.org/abs/2506.17733&lt;/span&gt;&lt;/a&gt;&lt;/p&gt;
&lt;figure data-ke-type=&quot;opengraph&quot; data-og-title=&quot;YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perception&quot; data-ke-align=&quot;alignCenter&quot; data-og-description=&quot;The YOLO series models reign supreme in real-time object detection due to their superior accuracy and computational efficiency. However, both the convolutional architectures of YOLO11 and earlier versions and the area-based self-attention mechanism introdu&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2506.17733&quot; data-og-image=&quot;https://blog.kakaocdn.net/dna/4mNE0/hyZKxb0wB4/AAAAAAAAAAAAAAAAAAAAAH1O6Gn0QNAdK4s3pKu6tVGfo2MWwizs1NG248HQcQC-/img.png?credential=yqXZFxpELC7KVnFOS48ylbz2pIh7yKj8&amp;amp;expires=1761922799&amp;amp;allow_ip=&amp;amp;allow_referer=&amp;amp;signature=xmmfQ1NACNZnnz00UokyeCWr57Q%3D&quot; data-og-url=&quot;https://arxiv.org/abs/2506.17733v2&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2506.17733v2&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2506.17733&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://blog.kakaocdn.net/dna/4mNE0/hyZKxb0wB4/AAAAAAAAAAAAAAAAAAAAAH1O6Gn0QNAdK4s3pKu6tVGfo2MWwizs1NG248HQcQC-/img.png?credential=yqXZFxpELC7KVnFOS48ylbz2pIh7yKj8&amp;amp;expires=1761922799&amp;amp;allow_ip=&amp;amp;allow_referer=&amp;amp;signature=xmmfQ1NACNZnnz00UokyeCWr57Q%3D');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perception&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The YOLO series models reign supreme in real-time object detection due to their superior accuracy and computational efficiency. However, both the convolutional architectures of YOLO11 and earlier versions and the area-based self-attention mechanism introdu&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;YOLO 시리즈는 실시간 객체 탐지 분야에서 빠른 속도와 높은 정확도 덕분에 꾸준히 인기를 끌고 있습니다.&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Yolov11 및 이전 모델 : 합성곱 기반 구조라 지역적인 정보만 처리 가능&lt;/li&gt;
&lt;li&gt;Yolov12 : Self-Attention을 도입했지만, 여전히 pairwise 관계까지만 표현 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만, 위와 같은 한계점도 보였는데, 이는 글로벌한 다대다 상관관계를 제대로 모델링하지 못했기 때문에, 복잡한 장면에서 성능이 떨어질 수 밖에 없었습니다.&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;Abstract&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. HyperACE (Hypergraph-based Adaptive Correlation Enhancement):&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존의 단순한 pairwise correlation 대신, 하이퍼그래프 연산을 활용한 high-order 상관관계를 학습&lt;/li&gt;
&lt;li&gt;위치 간/스케일 간 글로벌 feature 융합을 효율적으로 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2. Full-PAD (Full-Pipeline Aggregation-and-Distribution)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;HyperACE를 통해 강화된 특징을 네트워크 전체에 분배&lt;/li&gt;
&lt;li&gt;세밀한 정보 흐름과 표현 시너지를 확보 &amp;rarr; 더 강력한 feature representation을 형성&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3. 경량화 설계&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Depthwise Separable Convolution을 활용해 기존의 큰 커널 합성곱을 대체&lt;/li&gt;
&lt;li&gt;성능은 유지하며 파라미터 수와 연산량(FLOPs)을 크게 감소시킴&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;531&quot; data-origin-height=&quot;486&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bY6Ept/btsQZ18ToJM/9GLLjFakhAkWTsbIX9SDHK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bY6Ept/btsQZ18ToJM/9GLLjFakhAkWTsbIX9SDHK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bY6Ept/btsQZ18ToJM/9GLLjFakhAkWTsbIX9SDHK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbY6Ept%2FbtsQZ18ToJM%2F9GLLjFakhAkWTsbIX9SDHK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;531&quot; height=&quot;486&quot; data-origin-width=&quot;531&quot; data-origin-height=&quot;486&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;1. Introduction&lt;/b&gt;&lt;/h3&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-end=&quot;1288&quot; data-start=&quot;621&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li data-end=&quot;873&quot; data-start=&quot;621&quot;&gt;&lt;b&gt;HyperACE (Hypergraph-based Adaptive Correlation Enhancement)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;873&quot; data-start=&quot;694&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;738&quot; data-start=&quot;694&quot;&gt;기존은 &quot;픽셀 간 거리가 비슷하면 연결&quot; 같은 &lt;b&gt;수동적인 연결 규칙&lt;/b&gt;&lt;/li&gt;
&lt;li data-end=&quot;833&quot; data-start=&quot;742&quot;&gt;YOLOv13은 &lt;b&gt;학습 가능한 하이퍼그래프 모듈&lt;/b&gt;을 통해&lt;br /&gt;&amp;rarr; 여러 위치&amp;middot;스케일 간 &lt;b&gt;고차(high-order) 상관관계&lt;/b&gt;를 자동으로 학습&lt;/li&gt;
&lt;li data-end=&quot;873&quot; data-start=&quot;837&quot;&gt;Global feature 융합 &amp;amp; 강화로 복잡한 장면에서도 강력한 성능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1114&quot; data-start=&quot;875&quot;&gt;&lt;b&gt;FullPAD (Full-Pipeline Aggregation-and-Distribution)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1114&quot; data-start=&quot;940&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1025&quot; data-start=&quot;940&quot;&gt;HyperACE로 강화된 특징을&lt;br /&gt;&amp;rarr; &lt;b&gt;백본(Backbone), 넥(Neck), Detection Head 전체 파이프라인에 배분&lt;/b&gt;&lt;/li&gt;
&lt;li data-end=&quot;1114&quot; data-start=&quot;1029&quot;&gt;결과적으로 **정보 흐름(Gradient flow)**이 원활해지고,&lt;br /&gt;더 정교한 표현(Representation synergy) 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1288&quot; data-start=&quot;1116&quot;&gt;&lt;b&gt;경량화 설계 (Lightweight Blocks)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1288&quot; data-start=&quot;1156&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1229&quot; data-start=&quot;1156&quot;&gt;기존 &lt;b&gt;큰 커널 합성곱(large-kernel conv)&lt;/b&gt; &amp;rarr; &lt;b&gt;Depthwise Separable Conv&lt;/b&gt;로 대체&lt;/li&gt;
&lt;li data-end=&quot;1252&quot; data-start=&quot;1233&quot;&gt;연산량과 파라미터 대폭 감소&lt;/li&gt;
&lt;li data-end=&quot;1288&quot; data-start=&quot;1256&quot;&gt;추론 속도 빨라지고, 모바일/엣지 환경에서도 효율적&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;성능 결과 (MS COCO 기준)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv13-N/S
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv12 대비 +1.5% / +0.9% mAP &amp;uarr;&lt;/li&gt;
&lt;li&gt;YOLOv11 대비 +3.0% / +2.2% mAP &amp;uarr;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;더 높은 정확도 + 더 가벼운 연산량&lt;/b&gt; &amp;rarr; 실시간성 유지&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;2. Relate Work&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;A. YOLO 시리즈의 진화 (Evolution of YOLO Detectors)&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;YOLO는 &amp;ldquo;You Only Look Once&amp;rdquo;라는 이름처럼, 객체 탐지를 한 번에 처리하는 &lt;b&gt;단일 단계(single-stage) 모델&lt;/b&gt;입니다.&lt;br /&gt;초창기에는 R-CNN 계열처럼 여러 단계를 거쳐야 했지만, YOLO는 이를 단순화하여 &lt;b&gt;속도와 정확도&lt;/b&gt;를 동시에 잡으면서 객체 탐지 분야의 대세가 되었습니다.&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;주요 버전별 특징&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1080&quot; data-start=&quot;409&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;485&quot; data-start=&quot;409&quot;&gt;&lt;b&gt;YOLOv1 (2016)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;485&quot; data-start=&quot;433&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;485&quot; data-start=&quot;433&quot;&gt;객체 탐지를 &lt;b&gt;하나의 회귀(regression) 문제&lt;/b&gt;로 정의 &amp;rarr; 초고속 탐지 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;553&quot; data-start=&quot;486&quot;&gt;&lt;b&gt;YOLOv2&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;553&quot; data-start=&quot;503&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;553&quot; data-start=&quot;503&quot;&gt;&lt;b&gt;Anchor box&lt;/b&gt; 도입 + &lt;b&gt;DarkNet-19 백본&lt;/b&gt; &amp;rarr; 정확도 향상&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;628&quot; data-start=&quot;554&quot;&gt;&lt;b&gt;YOLOv3&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;628&quot; data-start=&quot;571&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;628&quot; data-start=&quot;571&quot;&gt;&lt;b&gt;DarkNet-53 백본&lt;/b&gt; + &lt;b&gt;3단계(3-scale) 예측&lt;/b&gt; &amp;rarr; 작은 객체 탐지 강화&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;725&quot; data-start=&quot;629&quot;&gt;&lt;b&gt;YOLOv4 ~ YOLOv8&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;725&quot; data-start=&quot;655&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;704&quot; data-start=&quot;655&quot;&gt;CSP, SPP, PANet, Anchor-free Head 등 다양한 모듈 도입&lt;/li&gt;
&lt;li data-end=&quot;725&quot; data-start=&quot;707&quot;&gt;속도/정확도의 균형 최적화&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;793&quot; data-start=&quot;726&quot;&gt;&lt;b&gt;YOLOv9 &amp;amp; YOLOv10&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;793&quot; data-start=&quot;753&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;793&quot; data-start=&quot;753&quot;&gt;경량화된 백본과 단순화된 구조 &amp;rarr; &lt;b&gt;엣지/실시간 환경 최적화&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;935&quot; data-start=&quot;794&quot;&gt;&lt;b&gt;YOLOv11&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;935&quot; data-start=&quot;812&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;840&quot; data-start=&quot;812&quot;&gt;Backbone-Neck-Head 구조 유지&lt;/li&gt;
&lt;li data-end=&quot;870&quot; data-start=&quot;843&quot;&gt;&lt;b&gt;C2f 블록 &amp;rarr; C3k2 블록 교체&lt;/b&gt;&lt;/li&gt;
&lt;li data-end=&quot;935&quot; data-start=&quot;873&quot;&gt;&lt;b&gt;C2PSA (Partial Spatial Attention)&lt;/b&gt; 추가 &amp;rarr; 작은/가려진 객체 탐지 개선&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1080&quot; data-start=&quot;936&quot;&gt;&lt;b&gt;YOLOv12&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1080&quot; data-start=&quot;954&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;985&quot; data-start=&quot;954&quot;&gt;본격적으로 &lt;b&gt;Attention 메커니즘 통합&lt;/b&gt;&lt;/li&gt;
&lt;li data-end=&quot;1058&quot; data-start=&quot;988&quot;&gt;R-ELAN, A2 (Area Attention), Flash Attention &amp;rarr; &lt;b&gt;전역+지역 의미적 특징 학습&lt;/b&gt;&lt;/li&gt;
&lt;li data-end=&quot;1080&quot; data-start=&quot;1061&quot;&gt;메모리 효율 + 정밀도 향상&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;기존 YOLO의 한계&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;지금까지의 YOLO는 &lt;b&gt;지역(Local) 정보와 쌍(Pairwise) 관계&lt;/b&gt;까지만 모델링 가능했습니다.&lt;br /&gt;즉, &lt;b&gt;복잡한 장면에서 여러 위치&amp;middot;스케일 간 고차원(global high-order) 상관관계&lt;/b&gt;를 학습하지 못한다는 한계가 있었습니다.&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1089&quot; data-origin-height=&quot;699&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bctuC3/btsQ05wD3JW/XPmLFGIWBhkiJxb6IR61fK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bctuC3/btsQ05wD3JW/XPmLFGIWBhkiJxb6IR61fK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bctuC3/btsQ05wD3JW/XPmLFGIWBhkiJxb6IR61fK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbctuC3%2FbtsQ05wD3JW%2FXPmLFGIWBhkiJxb6IR61fK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1089&quot; height=&quot;699&quot; data-origin-width=&quot;1089&quot; data-origin-height=&quot;699&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;B. High-Order Correlation Modeling (고차 상관관계 모델링)&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;현실 세계의 데이터는 단순히 1:1 관계(예: 사람 &amp;harr; 물건)만 있는 게 아닙니다. 신경망 연결, 단백질 상호작용, 사회 연결망 같은 곳에서는 &lt;b&gt;복잡한 다대다 관계(고차 상관관계, High-Order Correlation)&lt;/b&gt; 가 존재합니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;이미지와 영상에서도 비슷한 현상이 일어납니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;어떤 객체들은 &lt;b&gt;공간적(spatial)&lt;/b&gt; 으로 붙어 있거나,&lt;/li&gt;
&lt;li&gt;시간적으로 연속적인 관계를 가지거나,&lt;/li&gt;
&lt;li&gt;의미적으로 함께 등장(semantic)하는 경우가 많죠.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이런 관계들은 단순히 &quot;둘씩 짝지은 관계(pairwise)&quot;가 아니라, 여러 객체가 동시에 얽힌 &lt;b&gt;고차(high-order) 관계&lt;/b&gt;일 수 있습니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;Hypergraph (하이퍼그래프)의 등장&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;그래프(Graph)는 보통 노드(node)와 엣지(edge)로 &lt;b&gt;1:1 관계&lt;/b&gt;를 표현합니다. 하지만 &lt;b&gt;Hypergraph(하이퍼그래프)&lt;/b&gt; 는 여러 개 노드가 동시에 연결될 수 있어, 이런 복잡한 고차 상관관계를 더 잘 표현할 수 있습니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;최근 연구에서는 이를 딥러닝에 적용하기 위해 &lt;b&gt;Hypergraph Neural Networks (HGNNs)&lt;/b&gt; 이 활발히 사용되고 있습니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Feng et al. &amp;rarr; &lt;b&gt;스펙트럼 기반 HGNN&lt;/b&gt; 제안 &amp;rarr; 이미지 검색 성능 향상&lt;/li&gt;
&lt;li&gt;Gao et al. &amp;rarr; &lt;b&gt;HGNN+&lt;/b&gt; 제안 &amp;rarr; 공간적 하이퍼그래프 컨볼루션 연산 도입&lt;/li&gt;
&lt;li&gt;최근에는 &lt;b&gt;객체 탐지 모델에도 HGNN 도입&lt;/b&gt; 시도 &amp;rarr; 고차 상관관계가 탐지 성능에 중요함을 입증&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 기존 방법은 &lt;b&gt;고정된 threshold 값&lt;/b&gt;으로 &quot;특징이 가까운 픽셀만 관련 있음&quot;이라고 단순 판단하기 때문에,&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;정확도 부족&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;강건성(robustness) 부족&lt;/b&gt; 문제를 안고 있었습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv13에서는 이런 한계를 해결하기 위해&lt;b&gt; Hypergraph 기반 적응형 상관관계 강화 메커니즘&lt;/b&gt; (Adaptive Correlation Enhancement)을 도입했습니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;픽셀/객체 간 잠재적 관계(latent correlation)&lt;/b&gt; 를 자동으로 학습&lt;/li&gt;
&lt;li&gt;단순 threshold 대신, 네트워크가 적응적으로 &lt;b&gt;위치 간, 스케일 간, 의미 간 관계&lt;/b&gt;를 모델링&lt;/li&gt;
&lt;li&gt;기존 YOLO 시리즈에서 부족했던 &lt;b&gt;전역적(global) 고차 상관관계 모델링&lt;/b&gt;을 보완&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이로써 모델은 단순한 국소(local) 특징뿐 아니라, &lt;b&gt;장거리 상호작용(long-range dependencies)&lt;/b&gt; 까지도 더 정교하게 학습할 수 있게 되었습니다. YOLOv13은 단순히 backbone이나 head 개선뿐 아니라, &lt;b&gt;하이퍼그래프 신경망 아이디어를 차용해 객체 간 고차 관계를 학습&lt;/b&gt;할 수 있도록 설계된 게 핵심 포인트입니다.&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;3. Method&amp;nbsp;&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv13은 단순히 &lt;b&gt;backbone&lt;/b&gt;을 교체하거나 &lt;b&gt;head&lt;/b&gt; 구조를 바꾼 게 아니라, &lt;b&gt;객체 탐지 과정 전반&lt;/b&gt;을 새롭게 설계했습니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;III-A. Overall Network Architecture (전체 네트워크 아키텍처)&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;YOLO 계열의 전통적인 Backbone&amp;ndash;Neck&amp;ndash;Head 구조를 유지하면서도, 새로운 모듈들이 결합되어 있습니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;기존 YOLO 시리즈는 전통적으로 &lt;b&gt;Backbone &amp;rarr; Neck &amp;rarr; Head &lt;/b&gt;라는 3단계 구조를 따라왔습니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Backbone&lt;/b&gt; : 이미지에서 기본적인 특징(에지, 패턴 등)을 추출&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Neck&lt;/b&gt; : 다양한 스케일의 특징을 통합/강화&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Head&lt;/b&gt; : 최종적으로 객체의 위치와 클래스 예측&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 이 구조에서는 정보 흐름이 단방향적이라 중요한 특징이 충분히 전달되지 못했습니다.&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;이를 해결하기 위해 YOLOv13에서&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;1) Full-Pipeline Aggregation-and-Distribution (FullPAD)&lt;/b&gt; 패러다임을 도입했습니다.&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;특징을 &lt;b&gt;한 번에 모아(Aggregation)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;필요한 곳에 &lt;b&gt;다시 뿌려주는(Distribution)&lt;/b&gt;&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;새로운 데이터 흐름 방식을 적용한 것입니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;2) HyperACE 모듈: 고차 상관관계 학습&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;Hypergraph 기반 Adaptive Correlation Enhancement (HyperACE)&lt;/b&gt; 메커니즘을 통해&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;서로 다른 스케일&lt;/li&gt;
&lt;li&gt;서로 다른 위치&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;의 특징들 사이의 &lt;b&gt;복잡한 상관관계 (High-order Correlation)&lt;/b&gt;를 학습합니다. 이 과정 덕분에 모델은 &lt;b&gt;더 정교한 정보 표현력&lt;/b&gt;을 갖게 되고, 결과적으로 &lt;b&gt;탐지 능력(정확도)도 크게 향상&lt;/b&gt;되었습니다.&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;3) 새로운 Backbone 블록: DS-C3k2&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;Backbone 단계에서는 기존 YOLO에서 쓰던 &lt;b&gt;대형 커널 컨볼루션&lt;/b&gt; 대신, 새롭게 제안한 &lt;b&gt;경량화 DS-C3k2 블록&lt;/b&gt;을 적용함으로써 연산량은 줄이고, 표현력은 강화할 수 있었습니다.&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;4)&amp;nbsp;정보 흐름 최적화 (3개의 경로 분산)&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;YOLOv13의 FullPAD는 &lt;b&gt;3개의 분산 터널(tunnel)&lt;/b&gt; 을 통해 특징을 전달합니다:&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;Backbone &amp;rarr; Neck 연결부&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Neck 내부 레이어&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Neck &amp;rarr; Head 연결부&lt;/b&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 구조 덕분에 &lt;b&gt;정보가 끊기지 않고 유기적으로 흐르며&lt;/b&gt;, 그 결과 &lt;b&gt;작은 물체부터 큰 물체까지 더 균형 있는 탐지 성능&lt;/b&gt;을 발휘합니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;III-B. Hypergraph-based Adaptive Correlation Enhancement (하이퍼그래프 기반 적응형 상관관계 강화)&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv13은 객체 간의 복잡한 고차(high-order) 상관관계를 학습할 수 있도록 설계되었습니다.&lt;br /&gt;이를 위해 Hypergraph Neural Network(HGNN) 개념을 도입하여, 픽셀&amp;middot;영역 간 잠재적인 관계를 자동으로 모델링합니다.&lt;/li&gt;
&lt;li data-end=&quot;1034&quot; data-start=&quot;995&quot;&gt;쉽게 말해&lt;b&gt;,&lt;/b&gt; &lt;b&gt;HyperACE&lt;/b&gt;는 두 개의 브랜치로 나뉘는데,
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1034&quot; data-start=&quot;995&quot;&gt;Global High-Order Branch (C3AH 모듈): Adaptive Hypergraph를 이용해 &lt;b&gt;글로벌 고차 상관관계&lt;/b&gt; 학습하고, 객체들 간의 복잡한 의미적 연결을 잡아준다&lt;/li&gt;
&lt;li data-end=&quot;1034&quot; data-start=&quot;995&quot;&gt;Local Low-Order Branch (DS-C3k 블록): 작은 영역의 로컬 저차 상관관계를 학습해, 세부적인 디테일을 보존한다.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이 둘을 합쳐서&lt;b&gt; 글로벌 + 로컬&lt;/b&gt; 특징을&lt;b&gt; 동시에 강화&lt;/b&gt;합니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;524&quot; data-origin-height=&quot;462&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/NSygw/btsQ1Ai2tXo/yDkgls12LOkH5NrSevzAcK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/NSygw/btsQ1Ai2tXo/yDkgls12LOkH5NrSevzAcK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/NSygw/btsQ1Ai2tXo/yDkgls12LOkH5NrSevzAcK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FNSygw%2FbtsQ1Ai2tXo%2FyDkgls12LOkH5NrSevzAcK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;524&quot; height=&quot;462&quot; data-origin-width=&quot;524&quot; data-origin-height=&quot;462&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;III-C. Full-Pipeline Aggregation-and-Distribution Paradigm (전체 파이프라인 집약-분산 패러다임)&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다중 스케일 특징을 &lt;b&gt;효율적으로 집약(Aggregation)&lt;/b&gt; 한 뒤,&lt;/li&gt;
&lt;li&gt;필요한 위치에 &lt;b&gt;선택적으로 분산(Distribution)&lt;/b&gt; 시키는 새로운 파이프라인을 도입했습니다.&lt;b&gt;&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;이를 통해 작은 객체부터 큰 객체까지 &lt;b&gt;더 균형 있게 탐지 성능을 확보&lt;/b&gt;할 수 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;III-D. Lightweight Feature Extraction Blocks (경량화 특징 추출 블록)&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;새로운 경량화 블록(Lightweight Block) 을 설계하여, 기존 YOLO 대비 낮은 연산량으로도 높은 정확도를 달성할 수 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1) Depthwise-Separable Convolution (DSConv):&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;499&quot; data-start=&quot;386&quot;&gt;일반적인 Convolution을 &lt;b&gt;두 단계로 분리&lt;/b&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-end=&quot;499&quot; data-start=&quot;423&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li data-end=&quot;458&quot; data-start=&quot;423&quot;&gt;&lt;b&gt;Depthwise&lt;/b&gt;: 각 채널별로 공간 특징 추출&lt;/li&gt;
&lt;li data-end=&quot;499&quot; data-start=&quot;461&quot;&gt;&lt;b&gt;Pointwise (1&amp;times;1 Conv)&lt;/b&gt;: 채널 간 결합&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;li data-end=&quot;526&quot; data-start=&quot;500&quot;&gt;장점: &lt;b&gt;파라미터 수와 연산량 감소&lt;/b&gt;&lt;/li&gt;
&lt;li data-end=&quot;578&quot; data-start=&quot;527&quot;&gt;DSConv + BatchNorm + SiLU activation &amp;rarr; 핵심 특징 추출&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2) DS-Bottleneck&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;DSConv 블록을 두 개 연속 연결&lt;/li&gt;
&lt;li&gt;첫 번째: 3&amp;times;3 DSConv&lt;/li&gt;
&lt;li&gt;두 번째: 큰 커널(k&amp;times;k) DSConv&lt;/li&gt;
&lt;li&gt;입력과 출력 채널이 같으면 &lt;b&gt;Residual Skip Connection&lt;/b&gt; 적용 &amp;rarr; 정보 손실 최소화&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3) DS-C3k &amp;amp; DS-C3k2&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;892&quot; data-start=&quot;776&quot;&gt;&lt;b&gt;DS-C3k&lt;/b&gt;: CSP-C3 구조를 기반으로,
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;892&quot; data-start=&quot;811&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;830&quot; data-start=&quot;811&quot;&gt;1&amp;times;1 Conv로 채널 축소&lt;/li&gt;
&lt;li data-end=&quot;857&quot; data-start=&quot;833&quot;&gt;여러 DS-Bottleneck을 통과&lt;/li&gt;
&lt;li data-end=&quot;892&quot; data-start=&quot;860&quot;&gt;입력 브랜치와 결합 후 1&amp;times;1 Conv로 채널 복원&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;980&quot; data-start=&quot;893&quot;&gt;&lt;b&gt;DS-C3k2&lt;/b&gt;: C3k2 구조 기반
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;980&quot; data-start=&quot;923&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;980&quot; data-start=&quot;923&quot;&gt;1&amp;times;1 Conv &amp;rarr; Feature 분할 &amp;rarr; DS-C3k 여러 개 적용 &amp;rarr; Shortcut과 합침&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;1018&quot; data-start=&quot;981&quot;&gt;Backbone과 Neck 모두에 DS-C3k2 블록을 적용&lt;/li&gt;
&lt;li data-end=&quot;1066&quot; data-start=&quot;1019&quot;&gt;HyperACE 모듈의 로컬 저차 특성 추출에는 &lt;b&gt;DS-C3k 블록&lt;/b&gt; 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;4) 효과&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv13 전 모델에서 &lt;b&gt;파라미터 최대 30% 감소&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;GFLOPs 최대 28% 감소&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;경량화 덕분에 &lt;b&gt;속도 향상&lt;/b&gt;과 &lt;b&gt;실시간 추론 가능&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;동시에 HyperACE로 &lt;b&gt;고차 상관관계 학습&lt;/b&gt;과 &lt;b&gt;FullPAD로 정보 흐름 강화&lt;/b&gt;를 통해&lt;b&gt;&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&amp;rarr; &lt;b&gt;복잡한 장면에서도 정확하고 효율적인 탐지&lt;/b&gt; 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;531&quot; data-origin-height=&quot;414&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c4zAeC/btsQZ1Vx2s4/NxbHsQvs5KuAB7JzSdhG4k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c4zAeC/btsQZ1Vx2s4/NxbHsQvs5KuAB7JzSdhG4k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c4zAeC/btsQZ1Vx2s4/NxbHsQvs5KuAB7JzSdhG4k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc4zAeC%2FbtsQZ1Vx2s4%2FNxbHsQvs5KuAB7JzSdhG4k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;531&quot; height=&quot;414&quot; data-origin-width=&quot;531&quot; data-origin-height=&quot;414&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4. Experiments&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv13의 성능과 효율성을 검증하기 위해, 다음과 같은 실험을 진행했습니다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-end=&quot;535&quot; data-start=&quot;185&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li data-end=&quot;263&quot; data-start=&quot;185&quot;&gt;&lt;b&gt;실험 환경 및 설정&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;263&quot; data-start=&quot;208&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;237&quot; data-start=&quot;208&quot;&gt;학습 데이터셋, 하이퍼파라미터, 평가 지표 등&lt;/li&gt;
&lt;li data-end=&quot;263&quot; data-start=&quot;241&quot;&gt;모델 비교를 위한 기준 환경 설정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;400&quot; data-start=&quot;265&quot;&gt;&lt;b&gt;기존 모델과의 비교&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;400&quot; data-start=&quot;288&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;352&quot; data-start=&quot;288&quot;&gt;YOLOv13을 YOLO11, YOLOv12 등 기존 YOLO 시리즈 및 최신 실시간 객체 탐지 모델과 비교&lt;/li&gt;
&lt;li data-end=&quot;400&quot; data-start=&quot;356&quot;&gt;결과: &lt;b&gt;더 높은 정확도(mAP)와 낮은 연산량(GFLOPs) 달성&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;535&quot; data-start=&quot;402&quot;&gt;&lt;b&gt;Ablation Study (모듈별 효과 분석)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;535&quot; data-start=&quot;441&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;498&quot; data-start=&quot;441&quot;&gt;HyperACE, FullPAD, DSConv 블록 등 각 모듈이 성능에 얼마나 기여하는지 분석&lt;/li&gt;
&lt;li data-end=&quot;535&quot; data-start=&quot;502&quot;&gt;결과: 각 모듈이 &lt;b&gt;탐지 성능 향상에 핵심 역할&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1069&quot; data-origin-height=&quot;775&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lao3e/btsQ1kG5hKc/k89kdcw3aFH0gVMXby5mFk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lao3e/btsQ1kG5hKc/k89kdcw3aFH0gVMXby5mFk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lao3e/btsQ1kG5hKc/k89kdcw3aFH0gVMXby5mFk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Flao3e%2FbtsQ1kG5hKc%2Fk89kdcw3aFH0gVMXby5mFk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1069&quot; height=&quot;775&quot; data-origin-width=&quot;1069&quot; data-origin-height=&quot;775&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;529&quot; data-origin-height=&quot;299&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bHkqEo/btsQ1ub2OzC/vENSiEgyIjqpuE6quIJsfk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bHkqEo/btsQ1ub2OzC/vENSiEgyIjqpuE6quIJsfk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bHkqEo/btsQ1ub2OzC/vENSiEgyIjqpuE6quIJsfk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbHkqEo%2FbtsQ1ub2OzC%2FvENSiEgyIjqpuE6quIJsfk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;446&quot; height=&quot;252&quot; data-origin-width=&quot;529&quot; data-origin-height=&quot;299&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;1) FullPAD와 HyperACE의 효과&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;HyperACE를 제거하면 정확도(AP)가 약 &lt;b&gt;1% 정도 하락&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;FullPAD가 각 단계(Backbone&amp;rarr;Neck, Neck 내부, Neck&amp;rarr;Head)로 기능을 분산시키지 않으면, AP가 약 &lt;b&gt;0.2~0.4% 감소&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;514&quot; data-origin-height=&quot;144&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/8qb1d/btsQ036VeO7/0ofgDcEc6cZItEWdQbZAA0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/8qb1d/btsQ036VeO7/0ofgDcEc6cZItEWdQbZAA0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/8qb1d/btsQ036VeO7/0ofgDcEc6cZItEWdQbZAA0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F8qb1d%2FbtsQ036VeO7%2F0ofgDcEc6cZItEWdQbZAA0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;514&quot; height=&quot;144&quot; data-origin-width=&quot;514&quot; data-origin-height=&quot;144&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;2) 하이퍼엣지(HyperEdges) 개수&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;703&quot; data-start=&quot;656&quot;&gt;HyperEdges 개수를 줄이면 연산량과 파라미터는 줄지만, 성능 저하 발생&lt;/li&gt;
&lt;li data-end=&quot;732&quot; data-start=&quot;704&quot;&gt;너무 많으면 성능 향상은 있으나 계산량 증가&lt;/li&gt;
&lt;li data-end=&quot;796&quot; data-start=&quot;733&quot;&gt;적절한 균형으로 모델별 Hyperedge 개수 설정:
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;796&quot; data-start=&quot;769&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;796&quot; data-start=&quot;769&quot;&gt;N: 4, S: 8, L: 8, X: 12&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;512&quot; data-origin-height=&quot;127&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cjlED3/btsQ1xGJPKh/P5PkmTp48V3D1j9O5sxIT0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cjlED3/btsQ1xGJPKh/P5PkmTp48V3D1j9O5sxIT0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cjlED3/btsQ1xGJPKh/P5PkmTp48V3D1j9O5sxIT0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcjlED3%2FbtsQ1xGJPKh%2FP5PkmTp48V3D1j9O5sxIT0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;452&quot; height=&quot;112&quot; data-origin-width=&quot;512&quot; data-origin-height=&quot;127&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3) DS 시리즈 블록의 효율성&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;861&quot; data-start=&quot;827&quot;&gt;기존 일반 Convolution &amp;rarr; DS 블록으로 교체&lt;/li&gt;
&lt;li data-end=&quot;889&quot; data-start=&quot;862&quot;&gt;AP 성능 거의 유지 (0~0.1% 차이)&lt;/li&gt;
&lt;li data-end=&quot;990&quot; data-start=&quot;890&quot;&gt;연산량(GFLOPs)과 파라미터 크게 감소
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;990&quot; data-start=&quot;920&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;953&quot; data-start=&quot;920&quot;&gt;Nano: 파라미터 -0.6M, FLOPs -1.1G&lt;/li&gt;
&lt;li data-end=&quot;990&quot; data-start=&quot;956&quot;&gt;Small: 파라미터 -2.2M, FLOPs -4.2G&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;511&quot; data-origin-height=&quot;140&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dERsxg/btsQ0ADSOZ8/4DTRp1Qbshd3oc5iGqct61/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dERsxg/btsQ0ADSOZ8/4DTRp1Qbshd3oc5iGqct61/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dERsxg/btsQ0ADSOZ8/4DTRp1Qbshd3oc5iGqct61/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdERsxg%2FbtsQ0ADSOZ8%2F4DTRp1Qbshd3oc5iGqct61%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;412&quot; height=&quot;113&quot; data-origin-width=&quot;511&quot; data-origin-height=&quot;140&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4) 학습 에폭(Epochs)&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;최적 학습 에폭: &lt;b&gt;600 epochs&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;Nano: AP50:95 41.6%&lt;/li&gt;
&lt;li&gt;Small: AP50:95 48.0%&lt;/li&gt;
&lt;li&gt;더 오래 학습하면 과적합 발생 &amp;rarr; 성능 저하&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;5) 다양한 하드웨어에서의 추론 속도&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;510&quot; data-origin-height=&quot;120&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cUGQtj/btsQ09Tw0i5/FUviMtDN7RPrEL3PORlz6K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cUGQtj/btsQ09Tw0i5/FUviMtDN7RPrEL3PORlz6K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cUGQtj/btsQ09Tw0i5/FUviMtDN7RPrEL3PORlz6K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcUGQtj%2FbtsQ09Tw0i5%2FFUviMtDN7RPrEL3PORlz6K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;421&quot; height=&quot;99&quot; data-origin-width=&quot;510&quot; data-origin-height=&quot;120&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;5. Conclusion&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv13은 &lt;b&gt;정확도와 속도, 효율성을 동시에 잡은 최첨단 실시간 객체 탐지 모델&lt;/b&gt;입니다.&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;b&gt;Github 주소&lt;/b&gt;&lt;br /&gt;&amp;nbsp;&lt;br /&gt;&lt;a href=&quot;https://github.com/iMoonLab/yolov13&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;&lt;span&gt;https://github.com/iMoonLab/yolov13&lt;/span&gt;&lt;/a&gt;&lt;/p&gt;
&lt;figure data-ke-type=&quot;opengraph&quot; data-og-title=&quot;GitHub - iMoonLab/yolov13: Implementation of &amp;quot;YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perce&quot; data-ke-align=&quot;alignCenter&quot; data-og-description=&quot;Implementation of &amp;quot;YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perception&amp;quot;. - iMoonLab/yolov13&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/iMoonLab/yolov13&quot; data-og-image=&quot;https://blog.kakaocdn.net/dna/JGCnQ/hyZKpkMfBW/AAAAAAAAAAAAAAAAAAAAAKDLoC20CEXULSjXEarI3hLoQWQHjUxck9vc_qHEIvMu/img.png?credential=yqXZFxpELC7KVnFOS48ylbz2pIh7yKj8&amp;amp;expires=1761922799&amp;amp;allow_ip=&amp;amp;allow_referer=&amp;amp;signature=3sD46T5msiB7syef%2BAzu%2FlxGSSM%3D&quot; data-og-url=&quot;https://github.com/iMoonLab/yolov13&quot;&gt;&lt;a href=&quot;https://github.com/iMoonLab/yolov13&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/iMoonLab/yolov13&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://blog.kakaocdn.net/dna/JGCnQ/hyZKpkMfBW/AAAAAAAAAAAAAAAAAAAAAKDLoC20CEXULSjXEarI3hLoQWQHjUxck9vc_qHEIvMu/img.png?credential=yqXZFxpELC7KVnFOS48ylbz2pIh7yKj8&amp;amp;expires=1761922799&amp;amp;allow_ip=&amp;amp;allow_referer=&amp;amp;signature=3sD46T5msiB7syef%2BAzu%2FlxGSSM%3D');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - iMoonLab/yolov13: Implementation of &quot;YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perce&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Implementation of &quot;YOLOv13: Real-Time Object Detection with Hypergraph-Enhanced Adaptive Visual Perception&quot;. - iMoonLab/yolov13&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>object detection sota</category>
      <category>real-time object detection</category>
      <category>yolo13</category>
      <category>yolov13</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/28</guid>
      <comments>https://deeplearning-research.tistory.com/28#entry28comment</comments>
      <pubDate>Thu, 2 Oct 2025 18:00:45 +0900</pubDate>
    </item>
    <item>
      <title>[NEW] Ultralytics Yolov11 리뷰</title>
      <link>https://deeplearning-research.tistory.com/27</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://docs.ultralytics.com/models/yolo11/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://docs.ultralytics.com/models/yolo11/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1728354519517&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;YOLO11   NEW&quot; data-og-description=&quot;Discover YOLO11, the latest advancement in state-of-the-art object detection, offering unmatched accuracy and efficiency for diverse computer vision tasks.&quot; data-og-host=&quot;docs.ultralytics.com&quot; data-og-source-url=&quot;https://docs.ultralytics.com/models/yolo11/&quot; data-og-url=&quot;https://docs.ultralytics.com/models/yolo11&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bsC6pI/hyXee7xYWE/wiLISaDhzkaCuq5kMPbmyk/img.png?width=3840&amp;amp;height=1680&amp;amp;face=0_0_3840_1680&quot;&gt;&lt;a href=&quot;https://docs.ultralytics.com/models/yolo11/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://docs.ultralytics.com/models/yolo11/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bsC6pI/hyXee7xYWE/wiLISaDhzkaCuq5kMPbmyk/img.png?width=3840&amp;amp;height=1680&amp;amp;face=0_0_3840_1680');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLO11   NEW&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Discover YOLO11, the latest advancement in state-of-the-art object detection, offering unmatched accuracy and efficiency for diverse computer vision tasks.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;docs.ultralytics.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Overview&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLO11은 Ultralytics YOLO 시리즈의 최신 버전으로, 실시간 객체 탐지 분야에서 정확도, 속도, 효율성 측면에서 혁신을 이루었다. 이전 YOLO 버전들의 발전을 바탕으로, YOLO11은 아키텍처와 학습 방법에서 중요한 개선을 도입하여, 다양한 컴퓨터 비전 작업에 적합한 다재다능한 선택지를 제공한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1280&quot; data-origin-height=&quot;560&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/R48h0/btsJYTBCPSI/c3IGOKAlLzRXzOUsTwUEF0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/R48h0/btsJYTBCPSI/c3IGOKAlLzRXzOUsTwUEF0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/R48h0/btsJYTBCPSI/c3IGOKAlLzRXzOUsTwUEF0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FR48h0%2FbtsJYTBCPSI%2Fc3IGOKAlLzRXzOUsTwUEF0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1280&quot; height=&quot;560&quot; data-origin-width=&quot;1280&quot; data-origin-height=&quot;560&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Key Features&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;향상된 특징 추출&lt;/b&gt;: YOLO11은 개선된 백본(backbone)과 넥(neck) 아키텍처를 사용하여 특징 추출 능력을 향상시켜 보다 정밀한 객체 탐지와 복잡한 작업 성능을 제공함.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;효율성 및 속도 최적화&lt;/b&gt;: YOLO11은 세밀한 아키텍처 디자인과 최적화된 학습 파이프라인을 도입하여 처리 속도를 높이면서 정확도와 성능 간의 최적의 균형을 유지한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;더 적은 파라미터로 높은 정확도&lt;/b&gt;: 모델 디자인의 발전을 통해 YOLO11m은 YOLOv8m에 비해 22% 적은 파라미터로 COCO 데이터셋에서 더 높은 평균 정밀도(mAP)를 달성하여 계산 효율성을 유지하면서도 정확도를 향상시킨다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;다양한 환경에서의 적응성&lt;/b&gt;: YOLO11은 엣지 디바이스, 클라우드 플랫폼, NVIDIA GPU를 지원하는 시스템 등 다양한 환경에서 원활하게 배포될 수 있어 최대의 유연성을 제공한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;다양한 작업 지원&lt;/b&gt;: 객체 탐지, 인스턴스 분할, 이미지 분류, 자세 추정, OBB(방향 객체 탐지) 등 다양한 컴퓨터 비전 작업을 수행하도록 설계되었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1129&quot; data-origin-height=&quot;434&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bgUblB/btsJWSj4Tk5/I4S6T8NTacbMLmnmGbwhEK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bgUblB/btsJWSj4Tk5/I4S6T8NTacbMLmnmGbwhEK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bgUblB/btsJWSj4Tk5/I4S6T8NTacbMLmnmGbwhEK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbgUblB%2FbtsJWSj4Tk5%2FI4S6T8NTacbMLmnmGbwhEK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1129&quot; height=&quot;434&quot; data-origin-width=&quot;1129&quot; data-origin-height=&quot;434&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이번 yolov11에서는 object detection, instance segmentation, pose estimation, oriented detection, classification task를 지원한다. 하지만 현재 yolov11은 v10과 달리 nms-free 모델은 아닌것 같다. 변경하고 싶다면 model configuration을 변경해야할 것 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이번 yolov11에 사용된 모델 구조를 v10과 비교해서 살펴보자.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;792&quot; data-origin-height=&quot;594&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/EaafK/btsJW1upDTv/pdCwgKEE7o8bZWJw89mnd0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/EaafK/btsJW1upDTv/pdCwgKEE7o8bZWJw89mnd0/img.png&quot; data-alt=&quot;왼쪽: yolov11, 오른쪽: yolov10&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/EaafK/btsJW1upDTv/pdCwgKEE7o8bZWJw89mnd0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FEaafK%2FbtsJW1upDTv%2FpdCwgKEE7o8bZWJw89mnd0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;792&quot; height=&quot;594&quot; data-origin-width=&quot;792&quot; data-origin-height=&quot;594&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;왼쪽: yolov11, 오른쪽: yolov10&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;backbone을 보면 v11에서는 C3k2를 사용하고, v10에서는 C2f를 사용했다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;C3k2 (C3 Block with k=2):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;구조&lt;/b&gt; : C3k2는 여러 개의 경량화된 합성곱(convolution) 레이어로 구성된 블록이다. 이 블록은 주로 C3의 변형으로, 각 레이어가 특정 수의 필터를 사용해 정보를 효과적으로 압축하고, 동시에 깊이(depth)를 늘려 다양한 특징을 학습할 수 있게 설계되어있다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;특징&lt;/b&gt; : 이 레이어는 데이터 흐름을 원할하게 하면서도 정보 손실을 줄여, 작은 객체를 보다 잘 탐지할 수 있도록 돕는다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;C2f (C2 Block):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;구조&lt;/b&gt;: C2f는 두 개의 병렬 경량 합성곱 레이어를 포함하고 있다. 이 구조는 다른 스케일의 정보를 동시에 처리할 수 있도록 하여, 서로 다른 크기의 객체를 잘 탐지 할 수 있게 설계되었다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;특징&lt;/b&gt;: C2f는 경량화와 효율성을 중시하며, 다양한 해상도의 특징을 통합하여 탐지 성능을 높이는데 중점을 두고 있다. 하지만, 이 구조는 깊이와 넓이 측면에서 C3k2만큼의 유연성을 제공하지는 않을 수 있다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 backbone의 마지막 부분을 보면 v11에서는 C2PSA를 사용하고, v10에서는 PSA를 사용했다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;C2PSA:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;C2PSA는 두 개의 독립된 브랜치로 구성되는데, 각각의 브랜치는 서로 다른 공간적 정보와 채널 간 상호작용을 처리한다. 이로 인해 객체의 다양한 특징을 더 잘 포착할 수 있다. 즉, 하나의 브랜치가 객체의 전반적인 형태와 위치 정보를 포착하는 반면, 다른 브랜치는 더 미세한 세부 정보를 추출하는 역할을 한다.&lt;/li&gt;
&lt;li&gt;이 방식은 개체의 여러 해상도에서 중요한 특징을 더 잘 추출할 수 있게 하며, 특히 크기가 작은 객체를 탐지하는 데 유리하다. 기존 PSA는 모든 정보를 한 번에 처리했기 때문에 정보 손실이 있을 수 있었으나, C2PSA는 이를 분리해 보다 세밀하게 정보를 처리할 수 있다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이제 head를 한번 보자. &lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;모듈 구성 (Modules):&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일단 v11은 C3k2 모듈을 사용하고, v10은 C2f 모듈을 주로 사용한다. C3k2는 더 작은 커널 크기를 사용해 성능을 최적화하는 반면에, C2f는 피처를 더 많이 분리하여 다층 피처를 효과적으로 처리하는 구조이다. 또한, v11의 경우엔 P5 스케일에서 C2PSA 모듈이 추가되었는데, 이는 C2와 PSA(Pyramid Split Attention) 기법을 결합하여 피처맵의 전역적 중요성을 고려한 구조이다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;업샘플링 전략 (Upsampling Strategy):&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 모델 모두 nn.Upsample을 사용해 해상도를 증가시키지만, v11에서는 업샘플링된 피처맵을 C3k2블록과 결합해 사용하고 v10은 C2f 모듈과 결합한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Detection head:&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;v11의 head는 v10과 마찬가지로 P3, P4, P5의 세 가지 피처맵을 기반으로 탐지를 수행하지만, v11의 최종 탐지 모듈로 v8에서 사용하던 Detect를 사용하고, v10은 v10Detect를 사용한다. v10Detect를 사용할 경우 one-to-one, one-to-many를 활용해 nms-free를 이용할 수 있지만, v11은 아닌듯 하다. v10에서는 P5 단계에 C2fCIB 모듈이 포함되어있는데, 이는 C2f블록에 추가적인 CIB(Cross Iteration Batchnorm)기법을 더해 성능을 향상시키는 구조이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;레이어 반복 횟수:&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;v11은 C3k2 블록에서 반복 횟수가 상대적으로 적고, v10에서는 C2f 블록에서 더 많은 반복 횟수가 적용되어, 피처의 상세한 처리가 이루어진다.따라서 v11은 보다 경량화된 구조와 새로운 모듈을 도입해 성능을 높였으며, v10은 C2f와 CIB 같은 모듈로 더 깊이 있는 피처 처리를 강조한 모델이다. &lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;혹시 yolov11을 한번 학습해 보고 싶은 사람들은 아래 링크를 참고하길 바란다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://github.com/ultralytics/ultralytics&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/ultralytics/ultralytics&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1728373675591&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - ultralytics/ultralytics: Ultralytics YOLO11  &quot; data-og-description=&quot;Ultralytics YOLO11  . Contribute to ultralytics/ultralytics development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/ultralytics/ultralytics&quot; data-og-url=&quot;https://github.com/ultralytics/ultralytics&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/vqbzC/hyXehDfJQa/8Itmk0XHJ9MX4jxdp8QqRK/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640,https://scrap.kakaocdn.net/dn/6NojK/hyXefFo9dE/XBKob2llSuDXxIFLzTY900/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640&quot;&gt;&lt;a href=&quot;https://github.com/ultralytics/ultralytics&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/ultralytics/ultralytics&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/vqbzC/hyXehDfJQa/8Itmk0XHJ9MX4jxdp8QqRK/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640,https://scrap.kakaocdn.net/dn/6NojK/hyXefFo9dE/XBKob2llSuDXxIFLzTY900/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - ultralytics/ultralytics: Ultralytics YOLO11  &lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Ultralytics YOLO11  . Contribute to ultralytics/ultralytics development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;</description>
      <category>논문</category>
      <category>yolov11</category>
      <category>yolov11 vs yolov10</category>
      <category>yolov11 리뷰</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/27</guid>
      <comments>https://deeplearning-research.tistory.com/27#entry27comment</comments>
      <pubDate>Tue, 8 Oct 2024 16:50:19 +0900</pubDate>
    </item>
    <item>
      <title>[논문 리뷰] Pegasus-v1 Technical Report</title>
      <link>https://deeplearning-research.tistory.com/26</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2404.14687&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2404.14687&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1725599943506&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Pegasus-v1 Technical Report&quot; data-og-description=&quot;This technical report introduces Pegasus-1, a multimodal language model specialized in video content understanding and interaction through natural language. Pegasus-1 is designed to address the unique challenges posed by video data, such as interpreting sp&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2404.14687&quot; data-og-url=&quot;https://arxiv.org/abs/2404.14687v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/W47zD/hyWZgEtx3U/JKWtK8P9Rh4Tt9UAI155U1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/vyz42/hyWZe7JWGO/4w44YA8SreOnunjXZOeWZ0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000,https://scrap.kakaocdn.net/dn/bO3GxT/hyWY8zF1YX/Ku9m3jV2xgvUtOmEYFkkJk/img.png?width=846&amp;amp;height=242&amp;amp;face=0_0_846_242&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2404.14687&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2404.14687&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/W47zD/hyWZgEtx3U/JKWtK8P9Rh4Tt9UAI155U1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/vyz42/hyWZe7JWGO/4w44YA8SreOnunjXZOeWZ0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000,https://scrap.kakaocdn.net/dn/bO3GxT/hyWY8zF1YX/Ku9m3jV2xgvUtOmEYFkkJk/img.png?width=846&amp;amp;height=242&amp;amp;face=0_0_846_242');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Pegasus-v1 Technical Report&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;This technical report introduces Pegasus-1, a multimodal language model specialized in video content understanding and interaction through natural language. Pegasus-1 is designed to address the unique challenges posed by video data, such as interpreting sp&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;Abstract&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;트웰브랩스(Twelve Labs)에서 발표한 동영상 콘텐츠 이해 및 자연어 상호작용에 특화된 멀티모달 언어 모델인 Pegasus-1에 대해 쓴 논문이다. Pegasus-1은 시공간 정보를 해석하여 다양한 길이의 동영상 콘텐츠를 세밀하게 이해할 수 있도록 설계되었다. 이 기술 보고서에서 Pegasus-1의 아키텍처, 학습 전략, 그리고 동영상 대화, 제로샷 동영상 질의응답, 동영상 요약과 같은 벤치마크에서의 성능에 대해 개괄적으로 설명한다. 또한 Pegasus-1의 능력과 한계를 보여주며, 현재 상태와 향후 방향에 대한 균형잡힌 관점을 제공하기 위해 질적 특성을 탐구한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. Introduction&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;점점 진화하는 대형 언어모델 (LLM) 분야에서 LLM의 동영상 이해 능력을 개발하는 것은 혁신과 실용성의 최전선으로 떠오르고 있다. 이 기술 보고서에서는 자연어를 통해 동영상 콘텐츠를 해석하고 생성하며 상호작용할 수 있는 최첨단 멀티모달 모델인 Pegasus-1을 소개하고 분석한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pegasus-1의 주요 목표는 단일 형식 내에 여러 모달리티가 포함된 동영상 데이터의 고유한 문제를 극복하는 것이다. 이러한 이해에 있어 중요한 요소는 시각적 데이터의 시간적 순서를 해석하여 움직임과 변화의 본질을 포착하고, 각 프레임 내에서 공간적으로 세부적인 부분을 제공하는 것이다. 동시에, 시각적 요소의 해석을 향상시키고 동영상 콘텐츠의 미묘한 이해를 보장하기 위해 오디오 정보를 통합해야한다. 또한, 짧은 클립부터 긴 영상에 이르기까지 다양한 동영상 길이를 처리하는 것이 필수적인 요소이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 기술 보고서에서는 이러한 문제를 해결하기 위한 Pegasus-1의 접근 방식을 논의하여 동영상 콘텐츠를 종합적으로 이해할 수 있도록 하는 방법을 설명한다. 여기에는 모델 아키텍처, 학습 데이터, 학습 전략에 대한 간략한 설명이 포함되어 있으며, Pegasus-1의 advanced 동영상 이해 능력에 기여하는 요소들에 대한 폭넓은 관점을 제공한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;835&quot; data-origin-height=&quot;344&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bB23Ca/btsJsnywFKO/vUerPKDpG2E4QhAkZuyBp1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bB23Ca/btsJsnywFKO/vUerPKDpG2E4QhAkZuyBp1/img.png&quot; data-alt=&quot;그림 1: Pegasus-1의 아키텍처 개요 : Pegasus-1은 세 가지 주요 구성 요소로 이루어져 있습니다: 1) 시각적 및 오디오 입력으로부터 멀티모달 임베딩을 생성하는 비디오 인코더 모델 , 2) 비디오와 텍스트 표현을 동기화하는 비디오-언어 정렬 모델 , 3) 문맥에 맞는 텍스트 출력을 생성하는 대형 언어 모델.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bB23Ca/btsJsnywFKO/vUerPKDpG2E4QhAkZuyBp1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbB23Ca%2FbtsJsnywFKO%2FvUerPKDpG2E4QhAkZuyBp1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;835&quot; height=&quot;344&quot; data-origin-width=&quot;835&quot; data-origin-height=&quot;344&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림 1: Pegasus-1의 아키텍처 개요 : Pegasus-1은 세 가지 주요 구성 요소로 이루어져 있습니다: 1) 시각적 및 오디오 입력으로부터 멀티모달 임베딩을 생성하는 비디오 인코더 모델 , 2) 비디오와 텍스트 표현을 동기화하는 비디오-언어 정렬 모델 , 3) 문맥에 맞는 텍스트 출력을 생성하는 대형 언어 모델.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;2. Model Architecture and Training&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;2.1 Model Architecture&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;동영상 데이터를 효율적으로 이해하기 위해서는 청각 및 시각 정보를 매끄럽게 통합하면서 긴 동영상 길이를 효과적으로 관리하는것이 중요하다. 트웰브랩스의 아키텍처 전략에서는 오디오와 시각적 데이터를 함께 처리할 수 있는 아키텍처를 개발했으며, 이는 긴 동영상에 맞춘 효율적인 계산을 특징으로 한다. 그림 1에서 보여지듯, Pegasus-1은 인코딩, 정렬, 디코딩을 위한 종합적인 삼분체 프레임 워크로 구성되어있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;비디오 인코더 모델&lt;/b&gt; : Marengo 2.6을 기반으로 한 비디오 인코더 모델은 비디오 입력을 처리하여 비디오 프레임과 오디오 음성 인식 (ASR)데이터를 포함한 풍부한 임베딩을 생성한다. 이러한 임베딩은 동영상 콘텐츠의 시각적 및 청각적 본질을 포착하는 밀집된 표현이다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;비디오-언어 정렬 모델&lt;/b&gt; : 이 모델은 비디오 임베딩을 해당 언어 임베딩에 매핑하여, 비디오와 텍스트 표현이 일관되게 정렬된 공통 공간을 형성한다. 이러한 정렬은 모델이 비디오의 시각적 콘텐츠와 그 설명적 언어를 효과적으로 구분하고 연관시키는 데 중요하다. 또한, 긴 동영상 길이 처리를 향상시키기 위해, 대형 언어 모델 내에서 입력 토큰 크기를 최소화하는 토큰 감소 기술을 사용하여 계산 효율성을 최적화하고 긴 시간 동안 문맥의 무결성을 유지한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;대형 언어 모델(디코더 모델)&lt;/b&gt;: 대형 언어 모델 디코더는 정렬된 임베딩과 사용자 프롬프트를 받아 일관되고 문맥에 맞는 텍스트 출력을 생성한다. 이 출력은 동영상 콘텐츠에 대한 설명적 요약부터 특정 질문에 대한 답변에 이르기까지 다양할 수 있다. 이 대형 언어 모델 디코더는 동영상 데이터의 긴 문맥을 효율적으로 처리하기 위해 효율적인 어텐션 메커니즘을 활용한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;2.2 Training&lt;b&gt;&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최첨단 멀티모달 기초 모델인 Pegasus-1의 학습은 시각 및 오디오 모드를 포함한 동영상 데이터의 다양한 모달리티를 조화롭게 이해하는데 중점을 둔다. 이를 위해 각 모달리티의 고유한 강점을 활용하였으며, 이미지 데이터에서 공간적 이해를 적용하고 오디오 데이터에서 강력한 오디오 이해를 위한 insight를 도출해냈다. 특히, 동영상은 독립적인 이미지나 오디오보다 풍부한 정보 소스를 가지고 있음에도 불구하고, 고품질 동영상 데이터는 많지 않다. 이러한 문제를 해결하기 위해 학습을 위한 방대한 양의 독점 텍스트 주석을 주집했다고한다. 구체적으로, 약 1천만 개 이상의 다양한 동영상을 매우 상세한 설명으로 주석처리 했고, 이러한 설명은 각 동영상에 나타나는 대부분의 이벤트를 포착하며, 활동 및 객체에 대한 상세한 실세계 지식, 특정 객체의 이름, 다양한 스포츠의 기술 용어등을 포함한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pegasus-1의 학습 과정은 사전 학습 단계(pretraining phase)와 명령 튜닝 단계(instruction tuning phase)의 두 단계로 구성된다. 사전 학습 단계에서는 비디오 인코더와 대형 언어 모델을 사전 학습된 가중치로 초기화한 후, 앞서 언급한 풍부한 상세 동영상 데이터를 포함한 대규모 멀티모달 데이터셋으로 학습을 진행한다. 두 번째 단계에서는 독점적인 멀티모달 명령 데이터셋을 활용하여 모델의 사용자 명령에 대한 반응성을 정제하는 지도 학습 명령 미세 조정(supervised instruction finetuning)을 수행한다. 하지만, 이러한 다단계 학습에서 주요한 도전 과제는 파국적 망각(the risk of catastrophic forgetting)의 위험으로, 이는 사전 학습된 모델이 새로운 정보를 수용하면서 이전에 획득한 지식을 잃어버리는 현상이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 완화하기 위해, 학습 전략은 신중하게 계획된 두 단계를 포함하여, 새로운 데이터의 통합을 조화롭게 진행하면서 기존 지식을 보존하도록 설계했다고 한다. 이 전략의 핵심은 모델 파라미터의 선택적 해동(the selective unfreezing of model)과 학습 진행 중 학습률의 정밀한 조정을 결합하는 것이다. 이러한 접근 방식은 Pegasus-1이 새로운 기능을 효율적으로 습득할 뿐만 아니라, 이전에 학습된 기술을 유지하고 정제하여 advanced 동영상-언어 이해를 위한 강력한 기초를 확립할 수 있게 해주었다고한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;3. Results on Benchmarks&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;3.1 Comparison Models&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Gemini models (proprietary): Gemini는 Google의 독점적인 멀티모달 모델로, 비디오-언어 작업에서 최첨단 성능으로 잘 알려져있다. 비교 분석의 정확성과 관련성을 보장하기 위해, Video Question Answering 벤치마크에서 Geminio 1.0 및 Gemini 1.5의 성능을 Google의 기술 보고서에서 발췌했다고 한다. 비디오 대화 및 요약과 같이 그들의 보고서에 포함되지 않은 다른 벤치마크의 경우, 2024년 2월 17일에 공개된 Gemini API버전을 사용하여 테스트를 했다고 한다.&lt;/li&gt;
&lt;li&gt;OpenSource models : VideoChat, Video-ChatGPT, Video LLAMA, BT-adapter, LLAMA-VID, VideoChat2와 비교했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;762&quot; data-origin-height=&quot;266&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Jioqj/btsJuD62aZF/wkEq6cvarVskQP76Ccu2bk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Jioqj/btsJuD62aZF/wkEq6cvarVskQP76Ccu2bk/img.png&quot; data-alt=&quot;표1: 비디오 대화 벤치마크를 사용한 비교에서, 개방형 생성 출력은 언어 모델(LLM)에 의해 정답과 비교하여 평가된다. 이 평가에서는 특히 다섯 가지 측면에 중점을 둔다. Pegasus-1은 오픈소스 모델과 선도적인 독점 모델을 모두 능가하는 성능을 보였다고함. (2024년 2월 기준)&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Jioqj/btsJuD62aZF/wkEq6cvarVskQP76Ccu2bk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FJioqj%2FbtsJuD62aZF%2FwkEq6cvarVskQP76Ccu2bk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;590&quot; height=&quot;206&quot; data-origin-width=&quot;762&quot; data-origin-height=&quot;266&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;표1: 비디오 대화 벤치마크를 사용한 비교에서, 개방형 생성 출력은 언어 모델(LLM)에 의해 정답과 비교하여 평가된다. 이 평가에서는 특히 다섯 가지 측면에 중점을 둔다. Pegasus-1은 오픈소스 모델과 선도적인 독점 모델을 모두 능가하는 성능을 보였다고함. (2024년 2월 기준)&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1205&quot; data-origin-height=&quot;202&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/baswmG/btsJt2zVLyS/EAEtj8ZaH6smmqusPuwGQ1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/baswmG/btsJt2zVLyS/EAEtj8ZaH6smmqusPuwGQ1/img.png&quot; data-alt=&quot;표2: TempCompass는 비디오 언어 모델의 시간적 이해 능력을 다섯 가지 차원에서 평가함.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/baswmG/btsJt2zVLyS/EAEtj8ZaH6smmqusPuwGQ1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbaswmG%2FbtsJt2zVLyS%2FEAEtj8ZaH6smmqusPuwGQ1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1205&quot; height=&quot;202&quot; data-origin-width=&quot;1205&quot; data-origin-height=&quot;202&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;표2: TempCompass는 비디오 언어 모델의 시간적 이해 능력을 다섯 가지 차원에서 평가함.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;760&quot; data-origin-height=&quot;342&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dlZsKZ/btsJsSrJ6hz/lGcWFRcIXA94zeW8rTFhn1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dlZsKZ/btsJsSrJ6hz/lGcWFRcIXA94zeW8rTFhn1/img.png&quot; data-alt=&quot;표3: 제로샷 비디오 질의응답 벤치마크&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dlZsKZ/btsJsSrJ6hz/lGcWFRcIXA94zeW8rTFhn1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdlZsKZ%2FbtsJsSrJ6hz%2FlGcWFRcIXA94zeW8rTFhn1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;471&quot; height=&quot;212&quot; data-origin-width=&quot;760&quot; data-origin-height=&quot;342&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;표3: 제로샷 비디오 질의응답 벤치마크&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;880&quot; data-origin-height=&quot;249&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/1kyCn/btsJtcceCp1/4wrMaDtvP8LpLnnWdmjznK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/1kyCn/btsJtcceCp1/4wrMaDtvP8LpLnnWdmjznK/img.png&quot; data-alt=&quot;표4: 비디오 대화 벤치마크를 활용해 생성 출력을 다섯가지 차원에서 평가하며, 비디오 요약 작업과 관련된 세가지 특정 측면(정확성, 디테일, 맥락)에 중점을 두었다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/1kyCn/btsJtcceCp1/4wrMaDtvP8LpLnnWdmjznK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F1kyCn%2FbtsJtcceCp1%2F4wrMaDtvP8LpLnnWdmjznK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;481&quot; height=&quot;136&quot; data-origin-width=&quot;880&quot; data-origin-height=&quot;249&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;표4: 비디오 대화 벤치마크를 활용해 생성 출력을 다섯가지 차원에서 평가하며, 비디오 요약 작업과 관련된 세가지 특정 측면(정확성, 디테일, 맥락)에 중점을 두었다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;비디오 대화 벤치마크&lt;/b&gt;: 표1에서 비디오 기반 대화 벤치마크에서 Pegasus-1의 평가결과를 보여준다. Pegasus-1이 비디오 대화의 맥락에서 강력한 성응을 발휘하며, 다양한 평가 차원에서 주목할 만한 성과를 달성했다. 특히, Pegasus-1은 정확성에서 3.79, 맥락에서 4.29의 점수를 기록하여 비디오 대화 콘텐츠와 관련된 맥락을 효과적으로 처리하고 이해함을 나타낸다. 이러한 점수는 정확성, 세부 사항, 맥락 인식, 시간적 이해 및 일관성 같은 핵심 영역에서의 Pegasus-1의 성능을 나타내며, 비디오 기반 대화를 해석하고 응답하는 능력을 강조한다. &lt;/li&gt;
&lt;li&gt;&lt;b&gt;제로샷 비디오 질의응답:&lt;/b&gt; 표 3에서 두가지 인기있는 제로샷 비디오 질의응답 벤치마크인 ActivityNet-QA와 NExT-AQ에서 Pegasus-1의 성능을 상세히 설명해준다. 비디오 질의응답 작업에서, Pegasus-1은 ActivityNet-QA와 NExT-AQ 데이터셋에서 오픈소스 모델 및 Gemini 시리즈와 비교하여 제로샷 능력에서 상당한 향상을 보여줬다. 생성된 응답은 GPT-3.5 Turbo에 제공되어 예측이 실제 정답과 일치하는지 여부를 결정하는데 사용된다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;비디오 요악&lt;/b&gt;: 비디오 요약 성을을 평가하기 위해, 비디오 대화 벤치마크를 따르고 생성된 요약을 정보의 정확성, 세부 지향성, 맥락 이해의 세 가지 영역에서 평가한다. GPT-4는 각 지표에 대한 점수를 기준 요약을 실제 정답으로 설정하여 측정한다. 비디오 대화 벤치마크에서 제안된 ActivityNet 상세 캡션 데이터셋을 사용하여, 표 4에서 이 결과를 보여준다. 위에서 보듯이, Pegasus-1은 모든 지표에서 높은 성과를 거두었다. &lt;/li&gt;
&lt;li&gt;&lt;b&gt;시간적 이해:&lt;/b&gt; 비디오 언어 모델인 Pegasus-1은 비디오의 시간적 정보를 이해할 수 있어야 한다. 이 능력을 테스트하기 위해 TempCompass라는 특별한 데이터셋을 사용했다는데, 이는 비디오의 행동, 방향, 속도, 이벤트 순서, 속성 변화 등 다섯 가지 시간적 요소를 평가한다.이 평가에서는 원본 비디오를 다양한 방식으로 변형한 합성 비디오를 사용하는데, 예를 들어, 비디오를 뒤집거나, 빠르게 재생하거나, 느리게 재생하는 등의 조작을 통해 시각적 콘텐츠는 동일하게 유지하면서 시간적 역학이 변경된 상황을 만든다.표 2에서 보여준 결과에 따르면, Pegasus-1은 다른 오픈소스 모델들보다 뛰어난 성능을 보였으며, 특히 시간적 정보에 중점을 둔 VideoChat2를 크게 능가한다. TempCompass 데이터셋은 구문 분석이 가능한 다중 선택 QA 데이터셋 형식으로 되어 있기 때문에, Pegasus-1의 중간 출력을 사용하여 데이터를 분석한다. 이 중간 출력은 최종 응답과 동일한 정보를 전달하지만, 데이터셋의 분석 요구 사항에 맞게 조정하기 더 쉽다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4. Capabilities of Pegasus-1&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.1 Comparison Protocol for Qualitative Results&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;제시된 프롬프트는 모델의 성능을 정확하게 평가할 수 있도록 명확하고 일관되게 신중하게 작성되었다. 프롬프트를 작성할 때는 과도한 모호성이나 불필요한 복잡성을 피하여 프롬프트가 직관적이고 모델의 능력을 명확하게 평가할 수 있도록 해야한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한, 시각적으로 정확한 응답 능력 비교에 특히 중점을 두었고, 이는 언어 모델의 '런 오프(runoff)'로는 달성할 수 없는 능력이다. 언어 모델의 언오프란, 언어 모델이 강력한 언어적 선험 지식을 활용하여 맥락에 맞는 정보를 생성하는 경향을 말한다. 예를 들어, 대형 언어 모델(LLM)이 &quot;해변&quot;이라는 개념을 인식하면, 픽셀 정보에서 직접적인 증거 없이도 &quot;맑은 날씨&quot;나 &quot;사람들이 수영하는 장면&quot;과 같은 응답을 생성할 수 있다. 이 과정은 일관된 응답을 생성할 수 있지만, 시각적 콘텐츠를 정확하게 반영하지 않을 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;4.2 Characteristics&amp;nbsp;of&amp;nbsp;Pegasus-1&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;자세한 출력(Vebose Ouput): Pegasus-1은 지침을 정확하게 따르도록 설계되어 있으며, 비디오의 오디오 및 시각적 요소에 대한 광범위한 세부 정보를 제공한다. 그 결과, Pegasus-1의 출력은 매우 자세할 수 있으며, 질문에 대한 풍부한 정보를 제공할 수 있다. 이러한 특성은 두 가지 주요 이유로 의도된 것이다. &lt;br /&gt;첫째, Pegasus-1은 채팅 인터페이스 기능을 갖추고 있지 않기 때문에, 단일 상호작용에서 포괄적인 응답을 제공하도록 설계되었다. 이는 비디오 이해 작업과 잘 맞아떨어지며, 비디오는 정부가 매우 풍부하기 때문이다.&lt;br /&gt;둘째, 연구에 따르면 사용자는 짧은 응답보다 자세한 설명을 선호하는 경향이 있다. &lt;br /&gt;하지만, Pegasus-1은 길고 자세한 응답을 생성하도록 강화하면 허위 정보가 생성될 수 있다. 이를 완화하기 위해, 향후 Pegasus-1의 응답에서 세부 사항 수준을 조정할 수 있는 기능을 구현할 계획이라고 한다. &lt;/li&gt;
&lt;li&gt;능력 범주(Categories of capabilities): Pegasus-1에 대한 관찰 결과, 비디오 이해에서 다양한 능력을 보여주었다. 이 능력들은 비디오 분석의 여러 차원에서 모델의 숙련도를 보여주며, 다음과 같은 기능들을 포함한다.
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;현실 세계 지식&lt;/b&gt; : Pagasus-1은 방대한 현실 세계 지식을 통합해 비디오 콘텐츠를 정확하고 깊이 있게 맥락화하고 해석 할 수 있다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;비디오 기반 추록&lt;/b&gt;: 이 모델은 비디오 데이터에서 추론을 이끌어내어 일관된 이해와 insight를 구성하는 복잡한 추론 능력을 보여준다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;3D 공간 이해:&lt;/b&gt; Pegasus-1은 비디오 프레임 내의 3D 공간 관계를 이해할 수 있는 능력을 가지고 있어, 깊이와 공간을 이해해야하는 복잡한 장면과 객체 상호작용을 해석할 수 있다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;시간적 추론:&lt;/b&gt; Pegasus-1은 비디오 내 사건의 시간적 순서를 인식해 서사적 이해에 중요한 기능을 제공한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;시간적 참조 프롬프트:&lt;/b&gt; 전통적인 텍스트 기반 프롬프트 방법을 넘어서, 시각적 참조 프롬프트를 채택해 픽셀 공간 내에서 직접적인 수정을 가능하게 한다. 이 advaned 접근 방식은 사용자가 화살표, 박스 또는 기타 시각적 마커를 사용하여 특정 영역을 강조하고 모델의 초점을 이러한 강조된 영역으로 유도할 수 있도로 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.3 Real World Knowledge&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pegasus-1은 비디오 콘텐츠 내에서 현식 세계의 개체를 인식하고 식별하는 데 능숙한 비디오 언어 모델이다. 다양한 비디오 시나리오에서 특정 현실 세계의 객체를 이름 붙이는 도전 과제를 통해 Pegasus-1을 평가했었다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;507&quot; data-origin-height=&quot;747&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/D0jH1/btsJuyrxYl1/lZDkkxkKk2cWAkeKEqW2V0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/D0jH1/btsJuyrxYl1/lZDkkxkKk2cWAkeKEqW2V0/img.png&quot; data-alt=&quot;그림2: 튈르리 정원에서 촬영된 이 비디오는 음성 내레이션이 없이 시각적 단서만으로 위치를 추론해야 한다. Pegasus-1은 잘 다듬어진 헤지, 장식용 나무, 그리고 웅장한 건물의 독특한 외관 등 주요 시각적 요소를 정확히 식별하여 정확한 장소를 찾아낸다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/D0jH1/btsJuyrxYl1/lZDkkxkKk2cWAkeKEqW2V0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FD0jH1%2FbtsJuyrxYl1%2FlZDkkxkKk2cWAkeKEqW2V0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;507&quot; height=&quot;747&quot; data-origin-width=&quot;507&quot; data-origin-height=&quot;747&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림2: 튈르리 정원에서 촬영된 이 비디오는 음성 내레이션이 없이 시각적 단서만으로 위치를 추론해야 한다. Pegasus-1은 잘 다듬어진 헤지, 장식용 나무, 그리고 웅장한 건물의 독특한 외관 등 주요 시각적 요소를 정확히 식별하여 정확한 장소를 찾아낸다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;501&quot; data-origin-height=&quot;786&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cgQzoJ/btsJt3yThxX/ByfbhcnuJkN9GkgRsMUlk0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cgQzoJ/btsJt3yThxX/ByfbhcnuJkN9GkgRsMUlk0/img.png&quot; data-alt=&quot;그림3: 교토의 다양한 풍경을 보여주는 비디오이다. Pegasus-1은 장면을 비디오에서의 시간적 순서에 맞게 세심히 정렬하여 교토의 랜드마크를 그 순서에 맞춰 상세히 설명한다. 또한, 가을 단품의 존재를 통해 촬영 계절이 가을임을 지능적으로 추론한다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cgQzoJ/btsJt3yThxX/ByfbhcnuJkN9GkgRsMUlk0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcgQzoJ%2FbtsJt3yThxX%2FByfbhcnuJkN9GkgRsMUlk0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;501&quot; height=&quot;786&quot; data-origin-width=&quot;501&quot; data-origin-height=&quot;786&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림3: 교토의 다양한 풍경을 보여주는 비디오이다. Pegasus-1은 장면을 비디오에서의 시간적 순서에 맞게 세심히 정렬하여 교토의 랜드마크를 그 순서에 맞춰 상세히 설명한다. 또한, 가을 단품의 존재를 통해 촬영 계절이 가을임을 지능적으로 추론한다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;499&quot; data-origin-height=&quot;683&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bml6Jy/btsJsZqHZu8/ZurbihCzXTE8wkNFvZ5vhk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bml6Jy/btsJsZqHZu8/ZurbihCzXTE8wkNFvZ5vhk/img.png&quot; data-alt=&quot;그림4: Pegasus-1은 부가티 시론(Bugatti Chiron)을 정확히 식별하고 영상 내에서 보여지는 상황들을 자세히 설명해준다&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bml6Jy/btsJsZqHZu8/ZurbihCzXTE8wkNFvZ5vhk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbml6Jy%2FbtsJsZqHZu8%2FZurbihCzXTE8wkNFvZ5vhk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;499&quot; height=&quot;683&quot; data-origin-width=&quot;499&quot; data-origin-height=&quot;683&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림4: Pegasus-1은 부가티 시론(Bugatti Chiron)을 정확히 식별하고 영상 내에서 보여지는 상황들을 자세히 설명해준다&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;492&quot; data-origin-height=&quot;737&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dyZJLI/btsJufFPemQ/WIkXYeo9GILzged4mpppM0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dyZJLI/btsJufFPemQ/WIkXYeo9GILzged4mpppM0/img.png&quot; data-alt=&quot;그림5: Pegasus-1은 비디오 게임 제목인 &amp;quot;The Legend of Zelda:Bread of the Wild&amp;quot;를 정확히 구분하여, 특정 엔터테인먼트 도메인 내에서도 강력한 분류 능력을 보여준다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dyZJLI/btsJufFPemQ/WIkXYeo9GILzged4mpppM0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdyZJLI%2FbtsJufFPemQ%2FWIkXYeo9GILzged4mpppM0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;492&quot; height=&quot;737&quot; data-origin-width=&quot;492&quot; data-origin-height=&quot;737&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림5: Pegasus-1은 비디오 게임 제목인 &quot;The Legend of Zelda:Bread of the Wild&quot;를 정확히 구분하여, 특정 엔터테인먼트 도메인 내에서도 강력한 분류 능력을 보여준다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.4 Video-based Reasoning&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pegasus-1은 비주얼 추론 능력도 가지고 있는데, 이는 시각적 해석과 논리적 추론의 조화를 요구한다. 비주얼 추론 작업을 효과적으로 수행하기 위해서는 이러한 능력을 통합해 정확한 답변을 제공해야한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;502&quot; data-origin-height=&quot;795&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/tBckx/btsJuwHjTtL/OpjU174aSrKBkugBGO9cjK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/tBckx/btsJuwHjTtL/OpjU174aSrKBkugBGO9cjK/img.png&quot; data-alt=&quot;그림6: 조수 후 상황에서 즉각적인 반응을 예측하고, 영상에서 보여지는 상황을 세밀하게 묘사한다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/tBckx/btsJuwHjTtL/OpjU174aSrKBkugBGO9cjK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FtBckx%2FbtsJuwHjTtL%2FOpjU174aSrKBkugBGO9cjK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;502&quot; height=&quot;795&quot; data-origin-width=&quot;502&quot; data-origin-height=&quot;795&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림6: 조수 후 상황에서 즉각적인 반응을 예측하고, 영상에서 보여지는 상황을 세밀하게 묘사한다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;504&quot; data-origin-height=&quot;757&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cGxgei/btsJs0pBQdQ/LWBuHpGL9Z6fksx5ItmnPK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cGxgei/btsJs0pBQdQ/LWBuHpGL9Z6fksx5ItmnPK/img.png&quot; data-alt=&quot;그림7: 야간 운정 중 발생할 가능성이 있는 사건의 원인과 후속 전개를 추론하는 능력을 보여주며, 이는 상황과 순서에 대한 detail한 이해를 나타낸다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cGxgei/btsJs0pBQdQ/LWBuHpGL9Z6fksx5ItmnPK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcGxgei%2FbtsJs0pBQdQ%2FLWBuHpGL9Z6fksx5ItmnPK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;504&quot; height=&quot;757&quot; data-origin-width=&quot;504&quot; data-origin-height=&quot;757&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림7: 야간 운정 중 발생할 가능성이 있는 사건의 원인과 후속 전개를 추론하는 능력을 보여주며, 이는 상황과 순서에 대한 detail한 이해를 나타낸다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;503&quot; data-origin-height=&quot;797&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QV1XK/btsJuvIpy2g/Tp0Ij7YKsXX8XELy3YCQIk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QV1XK/btsJuvIpy2g/Tp0Ij7YKsXX8XELy3YCQIk/img.png&quot; data-alt=&quot;그림8: 뉴욕의 부동산 가치를 추정하는 advaned 추론을 요구하는 문제이다. 이 경우, Pegasus-1은 시각적 단서를 종합해 논리적인 결론을 도출하며, Gemini 1.0 Pro보다 표면적인 분석을 능가하는 더 복잡한 추론 능력을 보여준다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QV1XK/btsJuvIpy2g/Tp0Ij7YKsXX8XELy3YCQIk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQV1XK%2FbtsJuvIpy2g%2FTp0Ij7YKsXX8XELy3YCQIk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;503&quot; height=&quot;797&quot; data-origin-width=&quot;503&quot; data-origin-height=&quot;797&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림8: 뉴욕의 부동산 가치를 추정하는 advaned 추론을 요구하는 문제이다. 이 경우, Pegasus-1은 시각적 단서를 종합해 논리적인 결론을 도출하며, Gemini 1.0 Pro보다 표면적인 분석을 능가하는 더 복잡한 추론 능력을 보여준다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;505&quot; data-origin-height=&quot;763&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bAsUQa/btsJs8H3tWC/zpKrLmWKGgKjvOQKXUiGw1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bAsUQa/btsJs8H3tWC/zpKrLmWKGgKjvOQKXUiGw1/img.png&quot; data-alt=&quot;그림9: 상식적 추론을 중점적으로 다루며, Pegasus-1은 고양이가 &amp;quot;운전하는&amp;quot; 비정상적인 시나리오의 이상성을 식별한다. 이 사례는 Pegasus-1이 일상적인 것과 비정상적인 것을 구별하는 능력을 강조하며, 시각적 세부사항을 활용하여 현실 세계의 논리와 일치하는 그럴듯한 해석을 도출하는 능력을 보여준다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bAsUQa/btsJs8H3tWC/zpKrLmWKGgKjvOQKXUiGw1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbAsUQa%2FbtsJs8H3tWC%2FzpKrLmWKGgKjvOQKXUiGw1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;505&quot; height=&quot;763&quot; data-origin-width=&quot;505&quot; data-origin-height=&quot;763&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림9: 상식적 추론을 중점적으로 다루며, Pegasus-1은 고양이가 &quot;운전하는&quot; 비정상적인 시나리오의 이상성을 식별한다. 이 사례는 Pegasus-1이 일상적인 것과 비정상적인 것을 구별하는 능력을 강조하며, 시각적 세부사항을 활용하여 현실 세계의 논리와 일치하는 그럴듯한 해석을 도출하는 능력을 보여준다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.5 3D 공간 이해 능력 평가&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pegasus-1의 3D 공간 이해 능력을 평가하기 위해, 비디오 콘텐츠에서 복잡한 공간 관계를 해석하고 탐색하는 능력에 초점을 맞춘다. 이 작업은 비디오 내 시각적 단서에서 공간 정보를 추출하고 통합하여 삼차원 공간 내에서 정확한 내비게이션 방향을 제공하는 것을 포함한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;505&quot; data-origin-height=&quot;793&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/BoSyN/btsJsX7vEox/1YH45XeaUukQkICSu3OcJk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/BoSyN/btsJsX7vEox/1YH45XeaUukQkICSu3OcJk/img.png&quot; data-alt=&quot;그림 10: 주거 공간 내의 다양한 공간을 탐색하는 내용을 담고 있으며, 모델이 공간 layout을 효과적으로 해석하고 설명하도록 한다. 특정 작업인 &amp;quot;앞문 앞에 있다고 가정해 주세요. 냉장고까지 가는 길을 알려주세요&amp;quot;는 Pegasus가 집의 구조를 통해 경로를 추론하도록 요구한다. 이는 단순한 객체인식을 넘어 공간적 방향 감각과 논리적 경로 추론을 포함하는 이해를 보여준다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/BoSyN/btsJsX7vEox/1YH45XeaUukQkICSu3OcJk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FBoSyN%2FbtsJsX7vEox%2F1YH45XeaUukQkICSu3OcJk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;505&quot; height=&quot;793&quot; data-origin-width=&quot;505&quot; data-origin-height=&quot;793&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림 10: 주거 공간 내의 다양한 공간을 탐색하는 내용을 담고 있으며, 모델이 공간 layout을 효과적으로 해석하고 설명하도록 한다. 특정 작업인 &quot;앞문 앞에 있다고 가정해 주세요. 냉장고까지 가는 길을 알려주세요&quot;는 Pegasus가 집의 구조를 통해 경로를 추론하도록 요구한다. 이는 단순한 객체인식을 넘어 공간적 방향 감각과 논리적 경로 추론을 포함하는 이해를 보여준다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.6 시간적 추론&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비디오-언어 모델링의 영역에서 오디오-비주얼 콘텐츠의 순차적 성격을 이해하는 것은 필수적이다. 모델은 비디오 내에서 사건의 시간적 순서를 인식하고 유지해야 정확하게 콘텐츠를 이해하고 해석할 수 있다. Pegasus-1은 이 능력을 잘 보여주며, 사건의 시간적 순서를 효과적으로 추적하고 보존하며, 사건들의 순서에 대한 예리한 인식을 나타낸다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;502&quot; data-origin-height=&quot;822&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b675dD/btsJuUA1Dq7/g6RTlxEhqBKQjPaANih4Fk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b675dD/btsJuUA1Dq7/g6RTlxEhqBKQjPaANih4Fk/img.png&quot; data-alt=&quot;그림11: 요리는 순차적인 단계가 필요한 행위이다. Pegasus-1은 각 단계를 체계적으로 설명하며, 닭고기 준비부터 시작하여 향신료를 추가하고, 양파와 쌀을 층층이 쌓고, 마지막으로 모든 재료를 결합하는 방식으로 설명한다. 이러한 설명은 요리 맥락에서 시간적 추론 능력을 강조한다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b675dD/btsJuUA1Dq7/g6RTlxEhqBKQjPaANih4Fk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb675dD%2FbtsJuUA1Dq7%2Fg6RTlxEhqBKQjPaANih4Fk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;502&quot; height=&quot;822&quot; data-origin-width=&quot;502&quot; data-origin-height=&quot;822&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림11: 요리는 순차적인 단계가 필요한 행위이다. Pegasus-1은 각 단계를 체계적으로 설명하며, 닭고기 준비부터 시작하여 향신료를 추가하고, 양파와 쌀을 층층이 쌓고, 마지막으로 모든 재료를 결합하는 방식으로 설명한다. 이러한 설명은 요리 맥락에서 시간적 추론 능력을 강조한다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;501&quot; data-origin-height=&quot;800&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nBJDn/btsJt7agzgb/6pkMAo1Olkw9UwUqyOU99K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nBJDn/btsJt7agzgb/6pkMAo1Olkw9UwUqyOU99K/img.png&quot; data-alt=&quot;그림12: 런던의 상징적인 랜드마크를 모은 비디오 몽타주이다. 여기서 Pegasus-1은 제시된 랜드마크의 순서를 정확하게 포착하고 연관지으며, 서로 다른 장면 간의 시간적 흐름을 이해하는 능력을 보여준다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nBJDn/btsJt7agzgb/6pkMAo1Olkw9UwUqyOU99K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FnBJDn%2FbtsJt7agzgb%2F6pkMAo1Olkw9UwUqyOU99K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;501&quot; height=&quot;800&quot; data-origin-width=&quot;501&quot; data-origin-height=&quot;800&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림12: 런던의 상징적인 랜드마크를 모은 비디오 몽타주이다. 여기서 Pegasus-1은 제시된 랜드마크의 순서를 정확하게 포착하고 연관지으며, 서로 다른 장면 간의 시간적 흐름을 이해하는 능력을 보여준다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.7 시간적 참조 프롬프트 (Visual Referring Prompts)&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pegasus-1은 비디오 내의 특정 구간에 주의를 기울이는 능력을 뚜렷이 보여주며, 이는 시각적 마커에 의해 강조된 부분을 해석하고 응답하는데 중요한 역할을 한다. 이 능력은 비디오 프레임 내에서 특정 영역이나 행동을 강조하는 sign을 해석하고 반응해야 할 때 필수적이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;496&quot; data-origin-height=&quot;709&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bxl62J/btsJuxzvjqP/aCVuHTRKeMRt54otlEUDd1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bxl62J/btsJuxzvjqP/aCVuHTRKeMRt54otlEUDd1/img.png&quot; data-alt=&quot;그림13: 축구 경기 클립에서 특정 선수를 빨간 원으로 표시하여 그의 역할에 주목하고 있다. Pegasus-1은 이 강조된 선수를 정확히 파악하고, 해당 선수가 공격적으로 공을 상대 팀의 골대로 이동시키고 있다고 언급한다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bxl62J/btsJuxzvjqP/aCVuHTRKeMRt54otlEUDd1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbxl62J%2FbtsJuxzvjqP%2FaCVuHTRKeMRt54otlEUDd1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;496&quot; height=&quot;709&quot; data-origin-width=&quot;496&quot; data-origin-height=&quot;709&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림13: 축구 경기 클립에서 특정 선수를 빨간 원으로 표시하여 그의 역할에 주목하고 있다. Pegasus-1은 이 강조된 선수를 정확히 파악하고, 해당 선수가 공격적으로 공을 상대 팀의 골대로 이동시키고 있다고 언급한다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;497&quot; data-origin-height=&quot;708&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b96hOi/btsJuTIThTl/cuO6ksCECuvCzpVjKuyVCK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b96hOi/btsJuTIThTl/cuO6ksCECuvCzpVjKuyVCK/img.png&quot; data-alt=&quot;그림14: Gerrit Cole의 투구 메커니즘을 기술적으로 분석한 비디오이다. 특정 움직임은 흰색 원과 초록색 화살표로 강조되어 있다. Pegasus-1은 이러한 마커가 있는 구역의 중요성을 적절히 인식하고, 흰색 원으로 구분된 내용에 대한 명확한 이해를 보여준다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b96hOi/btsJuTIThTl/cuO6ksCECuvCzpVjKuyVCK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb96hOi%2FbtsJuTIThTl%2FcuO6ksCECuvCzpVjKuyVCK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;497&quot; height=&quot;708&quot; data-origin-width=&quot;497&quot; data-origin-height=&quot;708&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림14: Gerrit Cole의 투구 메커니즘을 기술적으로 분석한 비디오이다. 특정 움직임은 흰색 원과 초록색 화살표로 강조되어 있다. Pegasus-1은 이러한 마커가 있는 구역의 중요성을 적절히 인식하고, 흰색 원으로 구분된 내용에 대한 명확한 이해를 보여준다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;4.8 다른 다양한 케이스들&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;502&quot; data-origin-height=&quot;712&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/FWxil/btsJuGJKnbs/eVfUvAkykO923DAKQJ0wwK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/FWxil/btsJuGJKnbs/eVfUvAkykO923DAKQJ0wwK/img.png&quot; data-alt=&quot;그림16: 이 대시캠 비디오는 차가 불타는 장면을 담고 있다. 처음에는 차량이 작고 멀리 보이지만, 비디오가 진행됨에 따라 차량이 점점 가까워진다. Pegasus-1은 이 위험한 상황을 정확히 감지하고, 도로 옆에서 상승하는 연기를 강조한다. 또한, 대시캠 장착 차량이 출구로 접근하는 모습을 정확히 반영하여 비디오의 사건을 잘 나타낸다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/FWxil/btsJuGJKnbs/eVfUvAkykO923DAKQJ0wwK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFWxil%2FbtsJuGJKnbs%2FeVfUvAkykO923DAKQJ0wwK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;502&quot; height=&quot;712&quot; data-origin-width=&quot;502&quot; data-origin-height=&quot;712&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림16: 이 대시캠 비디오는 차가 불타는 장면을 담고 있다. 처음에는 차량이 작고 멀리 보이지만, 비디오가 진행됨에 따라 차량이 점점 가까워진다. Pegasus-1은 이 위험한 상황을 정확히 감지하고, 도로 옆에서 상승하는 연기를 강조한다. 또한, 대시캠 장착 차량이 출구로 접근하는 모습을 정확히 반영하여 비디오의 사건을 잘 나타낸다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;500&quot; data-origin-height=&quot;777&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/L3iWm/btsJtcpQpqG/XA28kE2PC4IINFoWWtfMDk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/L3iWm/btsJtcpQpqG/XA28kE2PC4IINFoWWtfMDk/img.png&quot; data-alt=&quot;그림17: 이 대시캠은 마을을 돌아다니는 일반적인 드라이브 장면을 담고있다. 법 집행 기관의 주의가 필요한 잠재적인 위험 순간에 대해 질문했을때, Pegasus-1은 비디오에서 두 가지 사건을 식별한다. 첫 번째는 헬멧 없이 도로를 달리는 자전거를 탄 남자와 관련이 있으며, 두번째는 방향 지시등 없이 좌회전하는 차량과 관련이 있다고 한다.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/L3iWm/btsJtcpQpqG/XA28kE2PC4IINFoWWtfMDk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FL3iWm%2FbtsJtcpQpqG%2FXA28kE2PC4IINFoWWtfMDk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;500&quot; height=&quot;777&quot; data-origin-width=&quot;500&quot; data-origin-height=&quot;777&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;그림17: 이 대시캠은 마을을 돌아다니는 일반적인 드라이브 장면을 담고있다. 법 집행 기관의 주의가 필요한 잠재적인 위험 순간에 대해 질문했을때, Pegasus-1은 비디오에서 두 가지 사건을 식별한다. 첫 번째는 헬멧 없이 도로를 달리는 자전거를 탄 남자와 관련이 있으며, 두번째는 방향 지시등 없이 좌회전하는 차량과 관련이 있다고 한다.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;5. 한계점&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;최대 비디오 길이 :&lt;/b&gt; 최대 15분 길이의 비디오에 최적화되어 있다. 비디오 길이가 길어질수록 시간이 먼 프레임 간의 관계를 포착하는 효율성이 감조하는 주요 한계가 있다. 더 긴 비디오를 처리하고 먼 프레임 간의 연결 정확성을 유지하는 능력을 향상시키는 것이 주 목표이다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;환각:&lt;/b&gt; Pegasus는 다른 시각-언어 모델과 마찬가지로 환각 현상이 발생할 수 있다. 이는 존재하지 않는 객체, 행동, 또는 사건의 순서를 부정확하게 식별하는 경우로 나타난다. 이러한 부정확성은 모델의 해석 정확성을 더욱 개선할 필요가 있다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;안전성 및 편향 :&lt;/b&gt; 안전성과 편향은 중요한 문제이다. Pegasus는 훈련 데이터에 존재하는 편향을 무의식적으로 perpetuate할 수 있으며, 이는 고정관념이나 잘못된 인식을 줄 수 있다. 또한, 모델은 부적절하거나 유해한 콘텐츠를 검증하거나 생성할 수 있으며, 잘못된 정보가 확산될 위험이 있다. 시각적 단서에 의존해 해석하는 것은 이러한 문제를 더욱 복잡하게 만든다. 현재 Pegasus의 능력은 사회적 맥락과 역학의 복잡성을 완전히 이해하지 못해, 맥락에 맞지 않는 결과를 생성할 수 있따. 이러한 문제를 완화하기 위해서는 더 공정하고 윤리적인 모델을 개발하고 콘텐츠 검토 메커니즘을 개선하는 전략이 필요하다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;채팅 기능 :&lt;/b&gt; 현재 Pegasus는 채팅 기능이 없다. 향후 버전에서 채팅 기능을 추가할 계획은 있으며, 이는 모델의 상호작용성과 사용자 참여를 향상시키기 위한 목표이다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Official Website: &lt;a href=&quot;https://www.twelvelabs.io/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://www.twelvelabs.io/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1725609379968&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Multimodal AI that understands videos like humans&quot; data-og-description=&quot;Bring human-like video understanding to any application, whether you have terabytes or petabytes of video&quot; data-og-host=&quot;www.twelvelabs.io&quot; data-og-source-url=&quot;https://www.twelvelabs.io/&quot; data-og-url=&quot;https://www.twelvelabs.io/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/WvbV2/hyWZlZ8yua/HJe2SzKIWnJZBbWCNKmoK0/img.png?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630,https://scrap.kakaocdn.net/dn/bMyib9/hyWZkz9K4d/pZv9KQxCjUoslqlEQxQKK1/img.png?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630,https://scrap.kakaocdn.net/dn/CnWJU/hyWZgEv17M/sXnQzcRJAQNp1XzkUvQISk/img.jpg?width=1200&amp;amp;height=1180&amp;amp;face=0_0_1200_1180&quot;&gt;&lt;a href=&quot;https://www.twelvelabs.io/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://www.twelvelabs.io/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/WvbV2/hyWZlZ8yua/HJe2SzKIWnJZBbWCNKmoK0/img.png?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630,https://scrap.kakaocdn.net/dn/bMyib9/hyWZkz9K4d/pZv9KQxCjUoslqlEQxQKK1/img.png?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630,https://scrap.kakaocdn.net/dn/CnWJU/hyWZgEv17M/sXnQzcRJAQNp1XzkUvQISk/img.jpg?width=1200&amp;amp;height=1180&amp;amp;face=0_0_1200_1180');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Multimodal AI that understands videos like humans&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Bring human-like video understanding to any application, whether you have terabytes or petabytes of video&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;www.twelvelabs.io&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>pegasus-v1 technical report 리뷰</category>
      <category>twelvelabs</category>
      <category>트웰브랩스 pegasus-1 리뷰</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/26</guid>
      <comments>https://deeplearning-research.tistory.com/26#entry26comment</comments>
      <pubDate>Fri, 6 Sep 2024 16:57:31 +0900</pubDate>
    </item>
    <item>
      <title>[논문 리뷰] EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks</title>
      <link>https://deeplearning-research.tistory.com/25</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1905.11946&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/1905.11946&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1725548706905&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks&quot; data-og-description=&quot;Convolutional Neural Networks (ConvNets) are commonly developed at a fixed resource budget, and then scaled up for better accuracy if more resources are available. In this paper, we systematically study model scaling and identify that carefully balancing n&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/1905.11946&quot; data-og-url=&quot;https://arxiv.org/abs/1905.11946v5&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/BfTdl/hyWZhQKRnZ/bswC3gfZIAtjUJm19gRHy1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bH78iA/hyWZkfE4Sm/7WvyUbH3HL5M3maTxpqAm0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000,https://scrap.kakaocdn.net/dn/bgpoeQ/hyWZdt5jfY/hq9dAcAJwfXsqCHYY1acL0/img.png?width=846&amp;amp;height=242&amp;amp;face=0_0_846_242&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1905.11946&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/1905.11946&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/BfTdl/hyWZhQKRnZ/bswC3gfZIAtjUJm19gRHy1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bH78iA/hyWZkfE4Sm/7WvyUbH3HL5M3maTxpqAm0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000,https://scrap.kakaocdn.net/dn/bgpoeQ/hyWZdt5jfY/hq9dAcAJwfXsqCHYY1acL0/img.png?width=846&amp;amp;height=242&amp;amp;face=0_0_846_242');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Convolutional Neural Networks (ConvNets) are commonly developed at a fixed resource budget, and then scaled up for better accuracy if more resources are available. In this paper, we systematically study model scaling and identify that carefully balancing n&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;오늘은 그 유명한 EfficientNet을 한번 리뷰해보려고 한다. EfficientNet은 Google AI에서 발표한 논문으로, &lt;b&gt;모델 스케일링&lt;/b&gt;에 대한 새로운 방식과 효율적인 CNN 아키텍처를 제안한 연구이다. 이 논문은 2019년 ICCV에서 발표되었으며, 모델 성능과 계산 효율성 간의 균형을 최적화하는 것이 주요 목표이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Abstract&lt;/b&gt;&amp;nbsp;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;복합 스케일링 방법&lt;/b&gt;: 깊이, 너비, 해상도를 모두 균일하게 확장하는 방식으로, 간단하지만 매우 효과적인 방법이다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;기존 모델과의 비교&lt;/b&gt;: 이 스케일링 방법을 MobileNet과 ResNet에 적용해 효과를 입증했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;EfficientNet 설계&lt;/b&gt;: 나아가 신경망 아키텍처 검색(Neural Architecture Search)을 사용해 새로운 기준 네트워크를 설계하고 이를 확장하여 &lt;b&gt;EfficientNet&lt;/b&gt;이라는 모델 계열을 개발했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;효율성과 성능&lt;/b&gt;: EfficientNet-B7 모델은 ImageNet 데이터셋에서 84.3%의 Top-1 정확도를 기록하며, 기존의 최첨단 ConvNet 대비 8.4배 더 작고, 추론(inference) 속도는 6.1배 더 빠르다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;전이 학습 성능&lt;/b&gt;: EfficientNet은 CIFAR-100, Flowers 등 다양한 전이 학습 데이터셋에서도 뛰어난 성능을 발휘하며, 다른 모델들보다 훨씬 적은 파라미터로도 높은 정확도를 달성했다.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;632&quot; data-origin-height=&quot;506&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/chRDND/btsJsNCW7IN/oIDni0VIERvyaenznxYCk0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/chRDND/btsJsNCW7IN/oIDni0VIERvyaenznxYCk0/img.png&quot; data-alt=&quot;Model Size vs ImageNet Accuracy&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/chRDND/btsJsNCW7IN/oIDni0VIERvyaenznxYCk0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FchRDND%2FbtsJsNCW7IN%2FoIDni0VIERvyaenznxYCk0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;632&quot; height=&quot;506&quot; data-origin-width=&quot;632&quot; data-origin-height=&quot;506&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Model Size vs ImageNet Accuracy&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;모델 스케일링의 문제점&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;딥러닝에서 &lt;b&gt;모델 스케일링&lt;/b&gt;은 모델의 성능을 높이기 위해 네트워크의 크기를 확장하는 과정을 의미한다. 예를 들어, 더 깊은 네트워크를 구성하거나, 각 레이어의 필터 수를 늘리거나, 입력 이미지의 해상도를 높이는 방법을 사용한다. 하지만, 이러한 확장 방식은 각기 다른 차원(깊이, 너비, 해상도)을 별도로 고려하기 때문에 최적화되지 않을 수 있다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;기존 스케일링 방법의 한계&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;깊이(Depth)&lt;/b&gt;: 네트워크의 층을 늘려 더 복잡한 패턴을 학습할 수 있습니다. 하지만 너무 깊으면 &lt;b&gt;기울기 소실&lt;/b&gt; 문제가 발생해 학습이 어려워진다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;너비(Width)&lt;/b&gt;: 각 레이어의 필터 수를 늘리면 정보 처리량이 증가하지만, 지나치게 너비가 넓으면 계산 비용이 급격히 증가한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;해상도(Resolution)&lt;/b&gt;: 입력 이미지의 해상도를 높이면 더 세밀한 특징을 학습할 수 있지만, 고해상도 이미지는 처리 비용이 많이 든다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이처럼 각 차원을 독립적으로 확장하는 것은 계산 자원에 비해 성능 향상이 비효율적인 문제가 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;복합 스케일링(Compound Scaling)의 제안&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 방법은 네트워크의 &lt;b&gt;깊이, 너비, 해상도&lt;/b&gt;를 &lt;b&gt;균일하게 동시에 확장&lt;/b&gt;하여 더 나은 성능을 얻는 것을 목표로 한다.&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;복합 계수(compound coefficient)&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;복합 스케일링은 세 가지 차원을 조정하는 단일 파라미터인 복합 계수(&amp;phi;)를 도입해 모델을 확장한다. 각 차원을 조정하는 비율은 미리 고정되며, 복합 계수를 통해 전체 모델을 균일하게 확장하며, 이 방식은 기존의 하나의 차원만 확장하는 방법보다 더 효율적이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;복합 계수는 아래의 수식을 따른다:&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;372&quot; data-origin-height=&quot;226&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ndAgB/btsJrPuEkgr/OJTzqPF9tI5lf9tufpnyTK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ndAgB/btsJrPuEkgr/OJTzqPF9tI5lf9tufpnyTK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ndAgB/btsJrPuEkgr/OJTzqPF9tI5lf9tufpnyTK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FndAgB%2FbtsJrPuEkgr%2FOJTzqPF9tI5lf9tufpnyTK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;247&quot; height=&quot;150&quot; data-origin-width=&quot;372&quot; data-origin-height=&quot;226&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 &lt;span&gt;&lt;span&gt;&amp;alpha;,&amp;beta;,&amp;gamma;&lt;/span&gt;&lt;/span&gt;는 각각 깊이, 너비, 해상도를 제어하는 상수이며, &lt;span&gt;&lt;span&gt;&amp;phi;&lt;/span&gt;&lt;/span&gt;는 스케일링 계수이다. 이 수식에 따라 모든 차원이 균일하게 확장되므로, 자원 제한 내에서 성능을 극대화할 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;새로운 기준 네트워크 설계&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;복합 스케일링 방법을 적용하기 위해, EfficientNet에서는 기존 MobileNet과 ResNet 구조를 확장하는 대신, 신경망 아키텍처 검색(Neural Architecture Search)을 통해 새로운 기본 네트워크(Baseline Network)를 설계했다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;신경망 아키텍처 검색(Neural Architecture Search, NAS)&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 방법은 자동화된 알고리즘을 통해 네트워크 아키텍처를 탐색하여 최적의 기본 네트워크를 찾는 과정이다. 기존의 수작업 방식보다 더 나은 성능을 발휘할 수 있으며, 특히 자원 효율성을 극대화하는 모델을 설계하는 데 유용하다. EfficientNet 논문에서는 이러한 NAS를 통해 최적화된 기본 네트워크 &lt;b&gt;EfficientNet-B0&lt;/b&gt;를 설계했고, 이를 복합 스케일링 방법으로 확장하여 &lt;b&gt;EfficientNet-B1&lt;/b&gt;에서 &lt;b&gt;B7&lt;/b&gt;까지 다양한 크기의 모델을 개발했다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;626&quot; data-origin-height=&quot;302&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/s3UJS/btsJr3faggk/TK7iZE88TAULZKC6iKwG80/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/s3UJS/btsJr3faggk/TK7iZE88TAULZKC6iKwG80/img.png&quot; data-alt=&quot;EfficientNetB0 baseline network&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/s3UJS/btsJr3faggk/TK7iZE88TAULZKC6iKwG80/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fs3UJS%2FbtsJr3faggk%2FTK7iZE88TAULZKC6iKwG80%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;562&quot; height=&quot;271&quot; data-origin-width=&quot;626&quot; data-origin-height=&quot;302&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;EfficientNetB0 baseline network&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;EfficientNet의 성능&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;EfficientNet 모델은 ImageNet 데이터셋에서 뛰어난 성능을 보였으며, 기존 최첨단 모델들과 비교했을 때도 매우 높은 효율성을 자랑한다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;ImageNet 성능&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;EfficientNet-B7 모델은 ImageNet에서 &lt;b&gt;84.3%의 Top-1 정확도&lt;/b&gt;를 기록하며, 기존 ConvNet보다 &lt;b&gt;8.4배 더 작고&lt;/b&gt;, 추론(inference) 속도는 &lt;b&gt;6.1배 더 빠르다&lt;/b&gt;.&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;전이 학습(Transfer Learning) 성능&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;EfficientNet은 ImageNet 외에도 다른 데이터셋에 대한 전이 학습 성능에서도 매우 우수한 결과를 보였다. &lt;b&gt;CIFAR-100&lt;/b&gt;, &lt;b&gt;Flowers&lt;/b&gt;와 같은 다양한 전이 학습 데이터셋에서도 기존 모델을 능가하는 성능을 기록했다. EfficientNet은 더 적은 파라미터로도 &lt;b&gt;CIFAR-100에서 91.7%&lt;/b&gt;, Flowers에서 98.8%의 정확도를 달성했으며, 이는 다른 ConvNet에 비해 파라미터 수가 &lt;b&gt;한 자릿수 감소&lt;/b&gt;한 상태에서 얻어진 성과이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1300&quot; data-origin-height=&quot;810&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/YCpmg/btsJtfFDrAI/KRA62O5o7rjMxDTEKk4Ni1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/YCpmg/btsJtfFDrAI/KRA62O5o7rjMxDTEKk4Ni1/img.png&quot; data-alt=&quot;EfficientNet Performance Results on ImageNet&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/YCpmg/btsJtfFDrAI/KRA62O5o7rjMxDTEKk4Ni1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYCpmg%2FbtsJtfFDrAI%2FKRA62O5o7rjMxDTEKk4Ni1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1300&quot; height=&quot;810&quot; data-origin-width=&quot;1300&quot; data-origin-height=&quot;810&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;EfficientNet Performance Results on ImageNet&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;결론&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;EfficientNet은 CNN 모델 스케일링의 문제를 해결하기 위해 &lt;b&gt;복합 스케일링&lt;/b&gt;이라는 혁신적인 방법을 제안했다. 이 방법을 통해 모델의 깊이, 너비, 해상도를 균형 있게 확장하여 자원 효율성을 극대화하면서도 성능을 극대화할 수 있었다고한다.&amp;nbsp;특히, EfficientNet-B7은 ImageNet에서 한 때는 최고 성능을 달성했으며, 더 적은 자원으로 더 나은 결과를 보여줬다. 또한 다양한 전이 학습 데이터셋에서도 우수한 성능을 입증하며, EfficientNet의 범용성을 증명했다. EfficientNet은 자원이 제한된 환경에서도 높은 성능을 필요로 하는 다양한 애플리케이션에 적용될 수 있는 매우 유용한 모델이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Github 주소 :&amp;nbsp;&lt;b&gt;&lt;a href=&quot;https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet&lt;/a&gt;&lt;/b&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1725550541398&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;tpu/models/official/efficientnet at master &amp;middot; tensorflow/tpu&quot; data-og-description=&quot;Reference models and tools for Cloud TPUs. Contribute to tensorflow/tpu development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet&quot; data-og-url=&quot;https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bGKuYt/hyWZkGImeX/m1mCvGarnPLx5p7Nk3qIiK/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/SXndT/hyWZhDezfC/nthqUW2hHjIaLJHKkicxVk/img.png?width=1666&amp;amp;height=1330&amp;amp;face=0_0_1666_1330,https://scrap.kakaocdn.net/dn/dZorf0/hyWZeftGn8/jPNAEFVwoQKX8SrhuQM6Q1/img.png?width=1666&amp;amp;height=1326&amp;amp;face=0_0_1666_1326&quot;&gt;&lt;a href=&quot;https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bGKuYt/hyWZkGImeX/m1mCvGarnPLx5p7Nk3qIiK/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/SXndT/hyWZhDezfC/nthqUW2hHjIaLJHKkicxVk/img.png?width=1666&amp;amp;height=1330&amp;amp;face=0_0_1666_1330,https://scrap.kakaocdn.net/dn/dZorf0/hyWZeftGn8/jPNAEFVwoQKX8SrhuQM6Q1/img.png?width=1666&amp;amp;height=1326&amp;amp;face=0_0_1666_1326');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;tpu/models/official/efficientnet at master &amp;middot; tensorflow/tpu&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Reference models and tools for Cloud TPUs. Contribute to tensorflow/tpu development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>efficientnet 논문 리뷰</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/25</guid>
      <comments>https://deeplearning-research.tistory.com/25#entry25comment</comments>
      <pubDate>Fri, 6 Sep 2024 00:35:58 +0900</pubDate>
    </item>
    <item>
      <title>[논문] YOLOv10: Real-Time End-to-End Object Detection 리뷰</title>
      <link>https://deeplearning-research.tistory.com/24</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;논문 출처: &lt;a href=&quot;https://arxiv.org/abs/2405.14458&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2405.14458&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1724214456485&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;YOLOv10: Real-Time End-to-End Object Detection&quot; data-og-description=&quot;Over the past years, YOLOs have emerged as the predominant paradigm in the field of real-time object detection owing to their effective balance between computational cost and detection performance. Researchers have explored the architectural designs, optim&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2405.14458&quot; data-og-url=&quot;https://arxiv.org/abs/2405.14458v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bBC18d/hyWSd1YWNl/18bz5CimIf008kuq2Opbv1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dbJ7av/hyWScIMglZ/9B17ill2LWEY4N5eZ3jUs1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2405.14458&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2405.14458&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bBC18d/hyWSd1YWNl/18bz5CimIf008kuq2Opbv1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dbJ7av/hyWScIMglZ/9B17ill2LWEY4N5eZ3jUs1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv10: Real-Time End-to-End Object Detection&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Over the past years, YOLOs have emerged as the predominant paradigm in the field of real-time object detection owing to their effective balance between computational cost and detection performance. Researchers have explored the architectural designs, optim&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;761&quot; data-origin-height=&quot;298&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/tmTil/btsJazxDtSD/XYIvr8HvramniZVy3125jk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/tmTil/btsJazxDtSD/XYIvr8HvramniZVy3125jk/img.png&quot; data-alt=&quot;Comparisons with other in terms of latency-accuracy (left) and size-accuracy (right) trade-offs.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/tmTil/btsJazxDtSD/XYIvr8HvramniZVy3125jk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FtmTil%2FbtsJazxDtSD%2FXYIvr8HvramniZVy3125jk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;672&quot; height=&quot;263&quot; data-origin-width=&quot;761&quot; data-origin-height=&quot;298&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Comparisons with other in terms of latency-accuracy (left) and size-accuracy (right) trade-offs.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Abstract&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최근 몇 년 동안 YOLO는 real-time object detector분야에서 주도적인 패러다임으로 자리잡았다. 연구자들은 YOLO의 아키텍처 설계, 최적화 목표, 데이터 증강 전략 등 여러 측면을 탐구하여 눈에 띄는 발전을 이뤄냈다. 하지만, YOLO의 후 처리에 대한 NMS(None-Maximum Suppression)에 대한 의존은 YOLO의 종단 간 배포를 방해하고 추론 지연 시간에 부정적인 영향을 미쳤다. 또한 YOLO의 다양한 구성 요소 설계는 포괄적이고 철저한 검토가 부족해 눈에 띄는 계산적 중복을 초래하고 모델의 모델의 능력을 제한한다.YOLOv10에서는 NMS가 없는 YOLO훈련을 위한 일관된 이중 할당 방법을 제시하며, 이는 경쟁력 있는 성능과 낮은 latency를 일궈냈다. YOLOv10-S는 COCO에서 유사한 AP를 유지하면서 RT-DETR-R18보다 1.8배 빠르며, 동시에 2.8배 적은 매개변수와 FLOPs를 자랑한다. YOLOv9-C와 비교했을 때, YOLOv10-B는 동일한 성능을 유지하며 latency는 46% 줄어들고 Parameter도 25%가 적다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Real-time object detection은 이미지에서 객체의 종류와 위치를 신속하게 예측하는 기술로, 자율 주행, 로봇 내비게이션, 객체 추적 등 다양한 분야에서 사용된다. 최근 연구자들은 CNN기반 객체 탐지기를 개발해 실시간 탐지를 목표로 해왔고, YOLO는 성능과 효율성의 균형을 잘 맞춰 많은 인기를 얻었다. 하지만 YOLO는 NMS(None-Maximum Suppression)에 의존하여 추론 속도가 느려지고, 성능이 하이퍼파라미터에 민감해지는 문제를 겪고 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이에 대한 해결책으로, 최근에 DETR 아키텍처를 쓰고나 concentrated on devising CNN-based object detectors등을 시도하고 있지만, 여전히 추가적인 호버헤드가 발생하거나 최적의 성능을 달성하긴 어려웠다. YOLO의 모델 아키텍처 설계 또한 중요한 도전 과제로, 다양한 설계 전략이 제안되었으나 효율성과 정확도 측면에서 포괄적인 검토는 부족했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 연구에서는 YOLO의 정확도와 속도를 개선하기 위해 후처리와 모델 아키텍처 두 가지 측면을 개선했다. NMS 없이도 높은 성능을 유지할 수 있는 이중 레이블 할당 전략을 세지하고, 다양한 구성 요소를 포괄적으로 검토해 효율적이고 정확한 모델 아키텍처를 설계했다. 결과적으로, YOLOv10은 real-time object detection에서 다양한 모델 스케일에 걸쳐 우수한 성능과 효율성을 보여주며 이전 모델들보다 개선된 성능을 제공한다.&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&amp;nbsp;&lt;/h4&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Related Work&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Real-time Object Detection:&lt;/b&gt;&lt;br /&gt;실시간 객체 탐지는 낮은 latency로 객체를 분류하고 위치를 지정하는 것을 목표로 하며, 이는 실제 응용 분야에서 중요하다. YOLOv1, YOLOv2, YOLOv3은 일반적인 탐지 아키텍처를 구성하며, YOLOv4와 YOLOv5는 CSPNet 설계를 도입하여 DarkNet을 대체하고 데이터 증강 전략, 향상된 PAN, 다양한 모델 스케일을 추가했다. YOLOv6는 BiC와 SimCSPSPPF를 도입하고, YOLOv7은 E-ELAN을 도입해 풍부한 gradient 흐름 경로를 제공하며, 여러 학습 가능한 기법을 연구했다. YOLOv8은 효과적인 특징 추출 및 융합을 위한 C2f 빌딩 블록을 제시하고, Gold-YOLO는 멀티스케일 특징 융합 능력을 향상시키기 위한 GD 메커니즘을 제공했다. YOLOv9은 GELAN을 통해 아키텍처를 개선하고 PGI를 통해 학습 과정을 증강한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;End-to-end object detectors:&lt;/b&gt;&lt;br /&gt;종단 간 객체 탐지는 전통적인 pipeline에서 벗어나 간소화된 아키텍처를 제공한다. DETR은 변환기 아키텍처와 헝가리안 손실을 도입해 1:1 매칭 예측을 수행하며, 수동으로 설계된 구성 요소와 후처리를 제거한다. 이후 다양한 DETR 변형들이 성능과 효율성을 향상시키기 위해 제안되었다. Deformable-DETR은 다중 스케일 변형 가능한 주의 모듈을 활용해 수렴 속도를 가속화하고, DINO는 대비 노이즈 제거, 혼합 쿼리 선택, 두 번의 전방 탐색을 통합했다. RT-DETR은 효율적인 하이브리드 인코더를 설계하고 불확실성 최소 쿼리 선택을 제안해 정확도와 latency를 모두 개선했다. 또 다른 접근 방법으로, 학습 가능한 NMS와 관계 네트워크가 중복 예측을 제거하고, OneNet과 DeFCN이 1:1 매칭 전략을 제안해 Fully convolution network를 사용한 end-to-end object detector를 가능케 했다. FCOSpss는 최적 샘플을 선택하기 위한 positive sample 선택기를 도입했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Methodology&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Consistent&amp;nbsp;Dual&amp;nbsp;Assignments&amp;nbsp;for&amp;nbsp;NMS-free&amp;nbsp;Training&lt;br /&gt;&lt;/b&gt;&lt;b&gt;&lt;/b&gt;YOLO 모델에서는 객체를 예측하고, 이 예측이 ground truth와 얼만 잘 맞는지 평가하는 방법(matching metric)이 필요하다. 이 방법은 훈련 과정에서 모델이 더 잘 학습 할 수 있도록 해준다. 하지만, 기존의 YOLO 모델은 여러개의 예측을 하나의 객체에 연결(1매칭)해서 학습하는데, 이는 정확도를 높여주지만, 최종 결과를 얻기 위해 불필요한 prediction을 제거하는 과정(NMS)이 필요하다. 이러한 과정이 모델의 latency에 좋지 않은 영향을 준다. &lt;br /&gt;&lt;br /&gt;이러한 문제를 해결하기 위해, 불필요한 prediction을 제거한느 과정 없이 모델이 직접 좋은 결과를 내도록 하는 방법 (1:1매칭)을 도입했다. 하지만 이러한 방법은 학습 신호가 약해져서 성능이 떨어질 수 있다. 따라서 두가지 방법의 장점을 결합한 새로운 방식을 채택했다. &lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;이중 레이블 할당 (Dual Label Assignments):&lt;/b&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;훈련 중에는 두 가지 매칭 방식을 동시에 사용한다. (one-to-one head, one-to-many head)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;one-to-many&lt;/b&gt;: 기존처럼 여러 예측을 하나의 객체에 연결해 강한 학습 신호를 제공한다&lt;/li&gt;
&lt;li&gt;&lt;b&gt;one-to-one&lt;/b&gt;: 하나의 예측만 하나의 객체에 연결해 최종 예측이 간단하고 빠르게 이루어지게 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;일관된 매칭 메트릭 (Consistent Matching Metric):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;두 가지 방식에서 같은 기준으로 예측을 평가하도록 matching metric을 통일한다.&lt;/li&gt;
&lt;li&gt;이렇게 하면 두 방식이 서로 잘 맞아 떨어져, 최종 예측이 더 정확해지고 학습이 더 효과적으로 이루어진다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;835&quot; data-origin-height=&quot;294&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bvQ6hx/btsJaennHWj/2tuVRUxPdh4B9kHXLpKhrk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bvQ6hx/btsJaennHWj/2tuVRUxPdh4B9kHXLpKhrk/img.png&quot; data-alt=&quot;(a)Consistent dual assignments for NMS-free training. (b) Frequency of one-to-one assignments in Top-1/5/10 of one to many results for YOLOv8-S&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bvQ6hx/btsJaennHWj/2tuVRUxPdh4B9kHXLpKhrk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbvQ6hx%2FbtsJaennHWj%2F2tuVRUxPdh4B9kHXLpKhrk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;693&quot; height=&quot;244&quot; data-origin-width=&quot;835&quot; data-origin-height=&quot;294&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;(a)Consistent dual assignments for NMS-free training. (b) Frequency of one-to-one assignments in Top-1/5/10 of one to many results for YOLOv8-S&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Holistic&amp;nbsp;Efficiency-Accuracy&amp;nbsp;Driven&amp;nbsp;Model&amp;nbsp;Design&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;효율성 중심의 모델 설계:&lt;br /&gt;&lt;/b&gt;YOLO 모델의 구성 요소 중 일부는 효율성 문제를 일으킨다.
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Lightweight classification head&lt;/b&gt;: YOLO의 분류와 회귀 헤드는 동일한 구조를 공유하지만, 분류 헤드가 더 많은 계산 비용을 차지한다. 분석 결과, 회귀 헤드가 더 중요한 역할을 하기 때문에, 분류 헤드를 경량화해도 성능 저하가 크지 않다. 그래서, 가벼운 구조를 도입해 분류 헤드를 간소화했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Spatial-channel decoupled downsampling&lt;/b&gt;: 기존 YOLO 모델은 공간 크기를 줄이고 채널 수를 늘리는 작업을 동시에 수행해 계산 비용이 높았다. 이 두 작업을 분리해 더 효율적인 다운샘플링 방법을 제안했다. 이를 통해 계산 비용을 줄이고, 성능 저하 없이 효율성을 높였다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Rank-guided block design&lt;/b&gt;: YOLO는 모든 단계에서 동일한 기본 블록을 사용하는데, 이로 인해 일부 단계에서 불필요한 계산이 발생할 수 있다. 각 단계의 중요도를 분석한 후, 복잡도가 높은 단계를 간소화된 블록으로 대체하여 효율성을 높였다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;정확성 중심의 모델 설계&lt;/b&gt;:&lt;br /&gt;정확성을 높이기 위해 큰 커널의 컨볼루션과 부분적인 자기 주의를 도입했다.
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Large-kernel convolution&lt;/b&gt;: 큰 커널의 컨볼루션을 사용하면 모델의 수용 영역이 커져 성능이 향상된다. 그러나 모든 단계에서 큰 커널을 사용하면 오히려 성능이 떨어질 수 있다. 그래서, 깊은 단계에서만 큰 커널을 사용하여 모델 성능을 최적화했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Partial self-attention(PSA)&lt;/b&gt;: Self-Attention은 모델이 전반적인 정보를 잘 학습할 수 있게 해주지만, 계산 비용이 높다. 이를 해결하기 위해, 일부 채널만 사용해 Self-Attention을 적용했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;776&quot; data-origin-height=&quot;324&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/l3mOV/btsJapPVGbU/iC7NwGfC00QL1XQ3SckM0K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/l3mOV/btsJapPVGbU/iC7NwGfC00QL1XQ3SckM0K/img.png&quot; data-alt=&quot;(a) The intrinsic ranks across stages and models in YOLOv8. (b) The compact inverted block (CIB). (c) The partial self-attention module (PSA).&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/l3mOV/btsJapPVGbU/iC7NwGfC00QL1XQ3SckM0K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fl3mOV%2FbtsJapPVGbU%2FiC7NwGfC00QL1XQ3SckM0K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;642&quot; height=&quot;268&quot; data-origin-width=&quot;776&quot; data-origin-height=&quot;324&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;(a) The intrinsic ranks across stages and models in YOLOv8. (b) The compact inverted block (CIB). (c) The partial self-attention module (PSA).&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Experience&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Implementation Details&lt;/b&gt;&lt;br /&gt;YOLOv10은 YOLOv8을 기본 모델로 선택했는데, 이는 뛰어난 속도-정확성 균형과 다양한 모델 크기에서의 가용성 때문이라고 한다. YOLOv10 모델을 개발하는 과정에서, NMS 없이 학습할 수 있는 일관된 듀얼 할당 방식과 효율성-정확성을 동시에 고려한 모델을 설계했다.
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;주요 특징:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv10은 YOLOv8과 동일하게 N,S,M,L,X와 같은 여러 가지 변형된 모델을 가진다.&lt;/li&gt;
&lt;li&gt;새로운 변형 모델인 YOLOv10-B도 도입되었으며, 이는 YOLOv10-M의 Width Scale Factor를 단순히 증가시켜 만들었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;검증:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv10은 COCO 데이터셋에서 검증되었으며, 이 과정에서 기존과 동일한 처음부터 학습하는 설정을 사용했다.&lt;/li&gt;
&lt;li&gt;모든 모델의 latency는 T4 GPU에서 TensorRT FP16 환경으로 테스트되었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;781&quot; data-origin-height=&quot;714&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/czKlkH/btsJahkeAQz/LpPwp9cIf6Xgc4ldPyToU0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/czKlkH/btsJahkeAQz/LpPwp9cIf6Xgc4ldPyToU0/img.png&quot; data-alt=&quot;Comparision with SOTA&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/czKlkH/btsJahkeAQz/LpPwp9cIf6Xgc4ldPyToU0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FczKlkH%2FbtsJahkeAQz%2FLpPwp9cIf6Xgc4ldPyToU0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;573&quot; height=&quot;524&quot; data-origin-width=&quot;781&quot; data-origin-height=&quot;714&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Comparision with SOTA&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Model Analyses&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;NMS-Free Training with Consistent Dual Assignments&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv10-S에서 이 접근법은 end-to-end latency를 4.63ms로 줄이면서, 44.3% AP로 경쟁력 있는 성능을 유지함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Efficiency Driven Model Design&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv10-M의 경우, 이 설계를 통해 11.8M 파라미터와 20.8GFLOPs가 감소했으며, Latency가 0.65ms로 줄었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Accuracy Driven Model Design&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이 설계는 YOLOv10-S와 YOLOv10-M의 AP를 각각 1.8과 0.7만큼 눈에 띄게 향상 시켰으며, latency는 각각 0.18ms, 0.17ms만 증가했다. 이는 성능 향상에 따른 latency 증가가 미미함을 나타내며, 우수한 설계임을 입증한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Conclusion&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문에서 YOLO object detection pipeline의 post processing과 모델 아키텍처 두 가지 측면을 모두 개선하는데 초점을 맞췄다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;Post Processing: NMS(Non-Maximum Suppression, 비최대 억제) 없이 훈련할 수 있는 일관된 듀얼 라벨 할당 방식.&lt;/li&gt;
&lt;li&gt;Model Architecture: 효율성과 정확성을 종합적으로 고려한 모델을 디자인함으로써 성능과 효율성 간의 균형을 개선했다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;source code: &lt;a href=&quot;https://github.com/THU-MIG/yolov10&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/THU-MIG/yolov10&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1724220347923&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - THU-MIG/yolov10: YOLOv10: Real-Time End-to-End Object Detection&quot; data-og-description=&quot;YOLOv10: Real-Time End-to-End Object Detection. Contribute to THU-MIG/yolov10 development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/THU-MIG/yolov10&quot; data-og-url=&quot;https://github.com/THU-MIG/yolov10&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/dYjPc4/hyWSi3jryW/GOfKmlwryrkaFh0QKjfVvK/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/THU-MIG/yolov10&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/THU-MIG/yolov10&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/dYjPc4/hyWSi3jryW/GOfKmlwryrkaFh0QKjfVvK/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - THU-MIG/yolov10: YOLOv10: Real-Time End-to-End Object Detection&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv10: Real-Time End-to-End Object Detection. Contribute to THU-MIG/yolov10 development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>real-time object detection</category>
      <category>yolov10</category>
      <category>yolov10: real-time end-to-end object detection</category>
      <category>yolov10: real-time end-to-end object detection 논문 리뷰</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/24</guid>
      <comments>https://deeplearning-research.tistory.com/24#entry24comment</comments>
      <pubDate>Wed, 21 Aug 2024 15:07:19 +0900</pubDate>
    </item>
    <item>
      <title>[논문] YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors 리뷰</title>
      <link>https://deeplearning-research.tistory.com/23</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;논문 출처 : &lt;a href=&quot;https://arxiv.org/abs/2207.02696&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2207.02696&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1724204676785&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors&quot; data-og-description=&quot;YOLOv7 surpasses all known object detectors in both speed and accuracy in the range from 5 FPS to 160 FPS and has the highest accuracy 56.8% AP among all known real-time object detectors with 30 FPS or higher on GPU V100. YOLOv7-E6 object detector (56 FPS &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2207.02696&quot; data-og-url=&quot;https://arxiv.org/abs/2207.02696v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/SbQBm/hyWSfZKDjz/Swp8mQ0ykzn4k8LnLFOgm1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/eUJyR/hyWSjA35Vm/BiCQrxS9vyFIz4yfGVh4IK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2207.02696&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2207.02696&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/SbQBm/hyWSfZKDjz/Swp8mQ0ykzn4k8LnLFOgm1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/eUJyR/hyWSjA35Vm/BiCQrxS9vyFIz4yfGVh4IK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv7 surpasses all known object detectors in both speed and accuracy in the range from 5 FPS to 160 FPS and has the highest accuracy 56.8% AP among all known real-time object detectors with 30 FPS or higher on GPU V100. YOLOv7-E6 object detector (56 FPS&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Abstract&lt;/b&gt;&lt;/h4&gt;
&lt;p style=&quot;text-align: justify;&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv7은 5FPS에서 160FPS 범위에서 속도와 정확성 모두 뛰어나며, GPU V100에서 30FPS이상의 Real-Time Object Detection이 가능하고 56.8%의 mAP를 달성했다. YOLOv7-E6 모델 (56 FPS V100, 55.9% AP)은 transformer 기반 detection인 SWIN-L Cascade-Mask R-CNN(9.2 FPS A100, 53.9% AP)에 비해 속도에서 509%와 정확도에서 2%에서 우수하며, 컨볼루션 기반 탐지기인 ConvNext-XL Cascade-Mask R-CNN (8.6 FPS A100, 55.2% AP)에 비해 속도에서 551% 빨라지고, 정확도에서 0.7% 나아졌다. 또한, YOLOv7은 YOLOR, YOLOX, Scaled-YOLOv4, DETR, Deformable DETR, DINO-5scale-R50, ViT-Adapter-B 및 기타 많은 객체 탐지 모델들보다 속도와 정확도가 뛰어나다. 또한, YOLOv7은 다른 데이터셋이나 사전 훈련된 가중치 없이 MS COCO 데이터셋만을 사용하여 처음부터 학습되었다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;507&quot; data-origin-height=&quot;367&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bfWS49/btsJa0Id7ZT/WDW0PyT0eF8oeEBz44MBl0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bfWS49/btsJa0Id7ZT/WDW0PyT0eF8oeEBz44MBl0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bfWS49/btsJa0Id7ZT/WDW0PyT0eF8oeEBz44MBl0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbfWS49%2FbtsJa0Id7ZT%2FWDW0PyT0eF8oeEBz44MBl0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;383&quot; height=&quot;277&quot; data-origin-width=&quot;507&quot; data-origin-height=&quot;367&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최근 몇 년간, real-time object detection은 다양한 edge device를 위해 개발되고 있다. 예를들어, MCUNET, NanoDet의 개발은 저전력 단일 칩을 생성하고 edge CPU에서의 추론 속도를 개선하는데 중점을 두었고, YOLOX와 YOLOR과 같은 방법은 다양한 GPU에서 추론 속도를 개선하는데 중점을 두었다. 최근에는 실시간 객체 탐지기의 개발이 효율적인 아키텍처 설계에 집중되고있고, CPU에서 사용할 수 있는 실시간 객체 탐지기는 주로 MobileNet, ShuffleNet, GhostNet을 기반으로 설계되었다. GPU를 위한 주요 실시간 객체 탐지기는 주로 ResNet, DarkNet, DLA를 사용하고 CSPNet strategy로 아키텍처를 최적화한다. 이 논문에서 제안하는 방법의 개발 방향은 현재 주요 real-time object detection과는 좀 다르다. 아키텍처 최적화 외에도, 훈련 과정의 최적화에 중점을 둔다. 여기서 제안하는 모듈과 최적화 방법을 'trainable bag of freebies'라고 부른다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최근에 모델 재파라미터화(re-parameterization)와 동적 레이블 할당(dynamic label assignment)이 네트워크 훈련 및 객체 탐지에서 중요한 주제로 부각되었다. 이러한 새로운 개념이 제안된 이후, 객체 탐지의 훈련에서 많은 문제가 발생했다. 모델 재파라미터화에 대해서는, gradient 전파 경로의 개념을 적용하여 다양한 네트워크의 레이어에 적용 가능한 모델 재파라미터화 전략을 분석하고, 계획된 re-prameterization 모델을 제안한다. 또한, 동적 레이블 할당 기술을 사용할 때, 다양한 브랜치의 출력에 대해 동적 타켓을 어떻게 할당할 것인지에 대해서 이 논문 저자는 'coarse-to-fine lead guided label assignment'라는 새로운 레이블 할당 방법을 제안했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;요약하면,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;훈련 가능한 무료 항목(trainable bag-of-freebies)&lt;/b&gt; 방법을 여러 가지 설계하여, 실시간 객체 탐지가 추론 비용을 증가시키지 않으면서도 탐지 정확도를 크게 향상시킬 수 있도록 했다.&lt;/li&gt;
&lt;li&gt;객체 탐지 방법의 진화에 따라, 원래 모듈을 어떻게 재파라미터화된 모듈로 대체할 것인지, 동적 레이블 할당 전략이 다양한 출력 레이어에 대한 할당을 어떻게 처리할 것인지라는 두 가지 새로운 문제를 발견했고, 이러한 문제에서 발생하는 어려움을 해결하기 위한 방법을 제안했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;확장(extend)&lt;/b&gt; 및 &lt;b&gt;복합 스케일링(compound scaling)&lt;/b&gt; 방법을 제안하여, 실시간 객체 탐지기가 파라미터와 계산을 효과적으로 활용할 수 있도록 했다.&lt;/li&gt;
&lt;li&gt;우리가 제안한 방법은 최신 실시간 객체 탐지기의 약 40%의 파라미터와 50%의 계산을 효과적으로 줄이면서, 더 빠른 추론 속도와 더 높은 탐지 정확도를 보여준다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Real-Time Object Detector&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재 최신 실시간 객체 탐지기들은 주로 YOLO(You Only Look Once)와 FCOS(Fully Convolutional One-Stage Object Detection)를 기반으로 하고 있다. 실시간 객체 탐지에 일반적으로 다음과 같은 특성이 필요한데,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;더 빠르고 강력한 네트워크 아키텍처&lt;/b&gt;: 네트워크가 더 빠르고 효과적으로 작동할 수 있어야 한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;더 효과적인 특징 통합 방법&lt;/b&gt;: 이미지에서 얻은 정보를 효과적으로 결합하여 더 나은 탐지를 할 수 있어야 함.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;더 정확한 탐지 방법&lt;/b&gt;: 객체를 더 정확하게 탐지할 수 있는 방법이 필요하다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;더 강력한 손실 함수&lt;/b&gt;: 모델의 학습을 보다 효과적으로 유도할 수 있는 손실 함수가 필요하다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;더 효율적인 레이블 할당 방법&lt;/b&gt;: 객체의 레이블을 보다 효율적으로 할당할 수 있어야 한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;더 효율적인 훈련 방법&lt;/b&gt;: 모델 훈련을 보다 효율적으로 수행할 수 있어야 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문에서는 자가 감독 학습(self-supervised learning)이나 지식 증류(knowledge distillation)와 같이 추가 데이터나 큰 모델이 필요한 방법을 탐구하지 않는다. 대신, 'trainable bag-of-freebies' 방법을 통해 모델의 성능을 향상시키면서 추론시 추가 비용을 증가시키지 않는 방법을 모색했다. &lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Model&amp;nbsp;re-parameterization&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 기술은 여러 계산 모듈을 추론 단계에서 하나로 통합하는 기술이다. 앙상블 기법의 일종으로, 두 가지 주요 접근 방법이 있다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;모델 수준의 앙상블:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;여러 개의 동일한 모델을 서로 다른 데이터로 훈련한 후, 이들 모델의 가중치를 평균화하여 최종 모델을 얻는다.&lt;/li&gt;
&lt;li&gt;서로 다른 반복에서 학습된 모델의 가중치를 가중 평균해 최종 모델을 생성한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;모듈 수준의 앙상블:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;훈련 중에 모듈은 여러 개의 동일하거나 서로 다른 브랜치로 나누고, 추론 단계에서 이들 브랜치를 하나의 통합된 모듈로 결합한다.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모듈 수준의 재파라미터화는 다양한 네트워크 아키텍처에 적용할 시 완벽하지 않을 수 있다. 따라서 새로운 재파라미터화 모듈을 개발하고 다양한 아키텍처에 맞는 응용 전략을 설계하는 것이 중요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;VGG에서 RepConv가 좋은 성능을 달성했었지만, ResNet이나 DenseNet등 다른 아키텍처에 사용할 때 심각한 정확도 손실을 야기시켰다고 한다. RepConv에서 identity connection을 사용하는 경우, ResNet에서의 잔차(Residual)연결이나 DenseNet에서의 concatenation 구조에 부정적인 영향을 미친다는걸 확인했다고 한다. ReNet의 경우, 잔차 연결이 gradient의 다양성을 제공하여 더 좋은 학습을 가능하게한다. DenseNet의 경우, 여러 층에서 특징을 연결해 더 강력한 표현 능력을 제공한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 해결 하기 위해, identity connection이 없는 RepConvN을 사용해 아키텍처를 설계했다. RepConvN은 잔차 또는 연결이 있는 컨볼루션 레이어를 대체할 때 identity connection을 포함하지 않는다. YOLOv7에서의 Planned re-parameterized convolution은 RepConvN을 사용해 설계되었다. 이는 ResNet이나 DenseNet과 같은 네트워크에 적절히 적용될 수 있도록 설계된 새로운 형태의 컨볼루션이다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;492&quot; data-origin-height=&quot;381&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cg8Oh3/btsJaKr6UOY/Xs5y9otK173FL0Bc6WzX4k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cg8Oh3/btsJaKr6UOY/Xs5y9otK173FL0Bc6WzX4k/img.png&quot; data-alt=&quot;Planned re-parameterized model&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cg8Oh3/btsJaKr6UOY/Xs5y9otK173FL0Bc6WzX4k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcg8Oh3%2FbtsJaKr6UOY%2FXs5y9otK173FL0Bc6WzX4k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;398&quot; height=&quot;308&quot; data-origin-width=&quot;492&quot; data-origin-height=&quot;381&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Planned re-parameterized model&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Model Scaling&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델 스케일링은 이미 설계된 모델을 다양한 컴퓨팅 장치에 맞게 크기를 조정하는 방법이다. 이는 보통 다양한 스케일링 요소를 사용해 네트워크 파라미터의 양, 계산량, 추론 속도 및 정확도 사이의 균형을 맞추려고 노력한다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;해상도&lt;/b&gt;: 입력 이미지의 크기&lt;/li&gt;
&lt;li&gt;&lt;b&gt;깊이&lt;/b&gt;: 레이어의 수&lt;/li&gt;
&lt;li&gt;&lt;b&gt;너비&lt;/b&gt;: 채널의 수&lt;/li&gt;
&lt;li&gt;&lt;b&gt;단계&lt;/b&gt;: 피쳐 피라미드의 수&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;NAS(Network Architecture Search)는 모델 스케일링에서 일반적으로 사용되는 방법 중 하나이다. 이는 복잡한 규칙을 정의하지 않고도 search space에서 적절한 스케일링 요소를 자동으로 검색할 수 있다. 하지만 시행하기 위해선 매우 많은 비용이 소요된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;대부분의 모델 스케일링 방법은 각 스케일링 요소를 개별적으로 분석하고 최적화한다. 복합한 스케일링 방법조차도 요소를 독립적으로 조정하는 경우가 많은데, NAS 아키텍처들이 서로 상관관계가 크지 않은 스케일링 요소를 다루기 때문이다. DenseNet, VovNet과 같은 concatenation 기반의 모델에서는 깊이가 조정될 때 일부 레이어의 입력 너비가 변경된다는걸 발견했다. 이러한 연결 기반의 모델일 경우, 기존의 스케일링 방법으로는 제대로 된 조정이 어려울 수 있다. 따라서, 이러한 모델에 맞춘 새로운 복합 스케일링 방법을 설계할 필요가 있다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1060&quot; data-origin-height=&quot;415&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/AP36t/btsI8W8YtYI/OrK1ld2vqNywH0EWHwF1aK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/AP36t/btsI8W8YtYI/OrK1ld2vqNywH0EWHwF1aK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/AP36t/btsI8W8YtYI/OrK1ld2vqNywH0EWHwF1aK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FAP36t%2FbtsI8W8YtYI%2FOrK1ld2vqNywH0EWHwF1aK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1060&quot; height=&quot;415&quot; data-origin-width=&quot;1060&quot; data-origin-height=&quot;415&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Training Techniques: Coarse&amp;nbsp;for&amp;nbsp;auxiliary&amp;nbsp;and&amp;nbsp;fine&amp;nbsp;for&amp;nbsp;lead&amp;nbsp;loss&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Deep Supervision&lt;/b&gt;: YOLOv7은 딥 슈퍼비전 기법을 사용해, 모델 학습을 지원하는 보조 헤드를 추가한다. 이를 통해 모델의 학습 성능과 안정성을 높인다&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Coarse-to-Fine Label Assignment&lt;/b&gt;: YOLOv7은 레이블 할당 전략으로 Coarse-to-Fine 방식을 사용하여, 정확한 소프트 레이블을 생성하고 학습 효율성을 높였다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1039&quot; data-origin-height=&quot;253&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bI0zmx/btsI94rhWb2/Vyi6hrjyqN3MtspEXHW4l0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bI0zmx/btsI94rhWb2/Vyi6hrjyqN3MtspEXHW4l0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bI0zmx/btsI94rhWb2/Vyi6hrjyqN3MtspEXHW4l0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbI0zmx%2FbtsI94rhWb2%2FVyi6hrjyqN3MtspEXHW4l0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1039&quot; height=&quot;253&quot; data-origin-width=&quot;1039&quot; data-origin-height=&quot;253&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;YOLOv7 Archtecture&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;네트워크&lt;/b&gt; &lt;b&gt;아키텍처&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Backbone&lt;/b&gt;: &lt;br /&gt;CSPDarknet을 백본으로 사용. 이는 기존의 Darknet을 개선하여, 더 효율적인 특징 추출을 가능케하고, 깊이와 넓이 스케일링을 통해 성능을 향상시킨다. CSP(Cross-Stage Partial Network)는 네트워크의 각 단계에서 파라미터의 양을 줄이면서도 정보의 흐름을 유지해준다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Neck&lt;/b&gt;: &lt;br /&gt;PANet(Path Aggregation Network)과 FPN(Feature Pyramid Network) 구조를 결합하여, 다양한 스케일의 특징을 효과적으로 결합한다. PANet은 특징 맵의 세부 정보를 잘 유지하면서, 물체의 다양한 크기를 감지 할 수 있게 해준다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Head&lt;/b&gt;: &lt;br /&gt;YOLO 헤드를 사용하여, 객체 탐지와 분류를 수행한다. YOLOv7은 이전 YOLO 헤드보다 더욱 향상된 구조를 가지고 있으며, 다양한 크기의 객체를 더 정확하게 탐지 할 수 있다.
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Decoupled Head:&lt;br /&gt;분리형 헤드 구조를 채택하여, bbox regression과 객체 분류를 별도의 네트워크로 분리한다. 이 접근 방식은 두 가지 작업을 독립적으로 최적화할 수 있게 해준다.&lt;/li&gt;
&lt;li&gt;Anchor-Free Approach:&lt;br /&gt;객체 탐지에서 앵커 박스를 사용하지 않고, 보다 유연하고 직접적인 방법으로 객체의 위치를 예측한다. 이 방식은 객체의 위치를 더 정확하게 예측할 수 있게 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;993&quot; data-origin-height=&quot;745&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Z2o7i/btsJatc4eFd/ljPBoRmxD2knecwfmIWpGk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Z2o7i/btsJatc4eFd/ljPBoRmxD2knecwfmIWpGk/img.png&quot; data-alt=&quot;Comparison of SOTA real-time object detectors&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Z2o7i/btsJatc4eFd/ljPBoRmxD2knecwfmIWpGk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FZ2o7i%2FbtsJatc4eFd%2FljPBoRmxD2knecwfmIWpGk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;993&quot; height=&quot;745&quot; data-origin-width=&quot;993&quot; data-origin-height=&quot;745&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Comparison of SOTA real-time object detectors&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;source code : &lt;a href=&quot;https://github.com/WongKinYiu/yolov7&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/WongKinYiu/yolov7&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1724209443747&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - WongKinYiu/yolov7: Implementation of paper - YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time &quot; data-og-description=&quot;Implementation of paper - YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors - WongKinYiu/yolov7&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/WongKinYiu/yolov7&quot; data-og-url=&quot;https://github.com/WongKinYiu/yolov7&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/dlBmgT/hyWSc9Pp8Z/ehOUBelCJeMbNHc5JkkzM1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/WongKinYiu/yolov7&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/WongKinYiu/yolov7&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/dlBmgT/hyWSc9Pp8Z/ehOUBelCJeMbNHc5JkkzM1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - WongKinYiu/yolov7: Implementation of paper - YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Implementation of paper - YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors - WongKinYiu/yolov7&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>yolov7</category>
      <category>yolov7 논문 리뷰</category>
      <category>yolov7: trainable bag-of-freebies sets new state-of-the-art for real-time object detectors</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/23</guid>
      <comments>https://deeplearning-research.tistory.com/23#entry23comment</comments>
      <pubDate>Wed, 21 Aug 2024 12:05:53 +0900</pubDate>
    </item>
    <item>
      <title>[논문] YOLOv6: A Single-Stage Object Detection Framework for Industrial Applications 리뷰</title>
      <link>https://deeplearning-research.tistory.com/22</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;논문 출처 : &lt;a href=&quot;https://arxiv.org/abs/2209.02976&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2209.02976&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1724051118570&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;YOLOv6: A Single-Stage Object Detection Framework for Industrial Applications&quot; data-og-description=&quot;For years, the YOLO series has been the de facto industry-level standard for efficient object detection. The YOLO community has prospered overwhelmingly to enrich its use in a multitude of hardware platforms and abundant scenarios. In this technical report&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2209.02976&quot; data-og-url=&quot;https://arxiv.org/abs/2209.02976v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/w1U2a/hyWSeGb6iY/8QmBwkoqM2CDB5WQhMSCok/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/d0qqtj/hyWOhYQLn6/9TqAjwZHCd3YGbWSrBYjkk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2209.02976&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2209.02976&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/w1U2a/hyWSeGb6iY/8QmBwkoqM2CDB5WQhMSCok/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/d0qqtj/hyWOhYQLn6/9TqAjwZHCd3YGbWSrBYjkk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv6: A Single-Stage Object Detection Framework for Industrial Applications&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;For years, the YOLO series has been the de facto industry-level standard for efficient object detection. The YOLO community has prospered overwhelmingly to enrich its use in a multitude of hardware platforms and abundant scenarios. In this technical report&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Abstract&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;빠르게 발전하는 객체 탐지 분야에서 YOLO(You Only Look Once) 시리즈는 오랜 시간 동안 속도와 효율성의 기준을 세워왔다. YOLOv6는 real-time object detection의 한계를 넘어서기 위해 설계된 획기적인 모델이다. EfficientRep 백본, anchor-free 방법, VariFocal Loss 같은 최신 기법들을 도입하여, 더 나은 정확도와 빠른 추론 속도를 달성했고, 이는 학계와 다양한 산업에서 향상된 정확도와 빠른 추론 속도로 사용될 수 있을 것이라 한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;YOLOv1-3: one-stage detector의 개척자&lt;/li&gt;
&lt;li&gt;YOLOv4: Backbone, Neck, Head로 구성된 탐지 프레임워크의 재구성&lt;/li&gt;
&lt;li&gt;YOLOv5, YOLOX, PPYOLOE, YOLOv7등 여러 모델이 경쟁 중&lt;/li&gt;
&lt;li&gt;&lt;b&gt;YOLOv6가 고려한 점&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Reparameterization(재매개화)&lt;/b&gt;: RepVGG에서의 재매개화 기법은 탐지에서 아직 충분히 활용되지 않았고, 작은 네트워크에는 단순한 경로 아키텍처가 적합하지만, 큰 모델에서는 파라미터와 계산 비용이 급격히 증가해 실용적이지 않았다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Quantization(양자화)&lt;/b&gt;: 재매개화 기반 Detector의 양자화는 신중하게 처리하지 않으면 학습과 추론 중 성능 저하를 해결하기 어렵기 때문.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;배포 문제&lt;/b&gt;: 이전 작업들은 배포보다는 성능 비교에 집중했고, 실제 환경에서는 Tesla T4와 같은 저전력 GPU가 비용 효율적이고 좋은 추론 성능을 제공했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;고급 도메인 전략&lt;/b&gt;: 레이블 할당과 손실 함수 설계 같은 전략은 구조적 변동을 고려해 추가 검증이 필요하다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;학습 전략 조정&lt;/b&gt;: 배포를 위해 정확도를 높이면서 추론 비용을 늘리지 않는 학습 전략 조정이 필요하다. (Knowledge Distillation 등)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;YOLOv6의 특징&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;다양한 네트워크 아키텍처:&lt;/b&gt; 다양한 크기의 네트워크를 산업 응용에 맞게 재구성했고, 작은 모델은 단순한 단일 경로 backbone을 사용하고 큰 모델은 효율적인 다중 분기 block을 사용한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;자기 증류 전략(Self-Distillation Strategy):&lt;/b&gt; Classification과 Regression 작업 모두에서 자기 증류를 적용하고, 지식 조정을 통해 모델 학습을 더욱 효율적으로 만든다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;최신 탐지 기법 검증:&lt;/b&gt; 레이블 할당, 손실 함수, 데이터 증강 기법을 광범위하게 검증하고 선택적으로 채택하여 성능을 향상시킴.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;개선된 양자화:&lt;/b&gt; RepOptimizer와 채널별 증류를 활용하여, 43.3% COCO AP와 869 FPS의 추론 성능을 달성함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/h4&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;네트워크 디자인:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Backbone:&lt;/b&gt; YOLOv6는 작은 네트워크에서 RepVGG 백본을 사용하여 더 강력한 특징 표현력을 제공하며, 대형 모델에는 RepBlock과 CSPStackRep 블록을 결합하여 효율성을 높였다. RepBlock은 작은 네트워크에서 좋은 성능을 발휘하며, 대형 모델에서는 CSPStackRep 블록을 사용해 파라미터와 계산 비용을 줄였다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Neck:&lt;/b&gt; PAN(Path Aggregation Network) 토폴로지를 채택하여 YOLOv4와 YOLOv5의 접근 방식을 개선함. RepBlocks 또는 CSPStackRep Blocks를 사용해 Rep-PAN으로 향상시킴.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Head:&lt;/b&gt; Decoupled Head를 간소화하여 더 효율적인 Efficient Decoupled Head로 개선함.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;레이블 할당:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;TAL(Task Alignment Learning)이 더 효과적이며 학습 친화적인 것을 발견&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;손실 함수:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Classification Loss: VariFocal Loss&lt;/li&gt;
&lt;li&gt;Regression Loss: SIoU(Scaled Intersection over Union) 및 GIoU(Generalized Intersection over Union) 손실&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;산업 적용 개선:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;자기 증류(self-distillation)와 추가 학습 epoch를 포함한 공통 실습과 트릭을 도입했다. 자기 증류는 Classification과 박스 Rergression을 각각 teacher 모델로 감독하며, DFL(Deep Feature Learning)을 통해 Box Regression의 증류를 가능하게 한다. Soft와 Hard Label의 정보 비율을 동적으로 감소시켜 Student 모델이 학습 과정에서 지식을 효율적으로 습득하도록 한다. 또한, 평가 시 추가적인 회색 경계 없이 성능을 유지하기 위한 해결책을 제공함.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;양자화 및 배포:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;RepOptimizer를 사용하여 양자화 친화적인 가중치를 얻고, QAT(Quantization Aware Training)와 채널별 증류(channel-wise distillation), 그래프 최적화를 적용하여 극한의 성능을 추구했다. 양자화된 YOLOv6-S는 42.3% AP와 869 FPS(배치 크기 32)의 성능을 달성하여 새로운 최첨단 기록을 세웠다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Backbone&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이전 연구들에 따르면, 다중 분기 네트워크는 종종 단일 경로 네트워크보다 더 나은 분류 성능을 달성할 수 있지만, 병렬성의 감소와 latency의 증가를 초래하는 경우가 많다. 반면, VGG와 같은 단일 경로 네트워크는 높은 병렬성과 적은 메모리 사용량 덕분에 더 높은 추론 효율성을 제공한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RepVGG에서 제안된 구조적 재매개화 방법은 훈련 시의 다중 분기 구조를 추론 시의 단일 경로 아키텍처로 분리하여 속도와 정확성 간의 균형을 개선했다. 이러한 연구에 영감을 받아, YOLOv6는 EfficientRep이라는 효율적인 재매개화 가능한 Backbone을 설계했다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;작은 모델 : 훈련 단계에서 백본의 주요 구성 요소는 RepBlock이다. 각 RepBlock은 추론 단계에서 3x3의 합성곱 층(RepConv)로 변환된다. 3x3 합성곱은 main GPU와 CPU에 최적화되어 있으며, 높은 계산 밀도를 제공하여 하드웨어의 계산능력을 충분히 활용하게 해준다. 이로 인해 Latency가 크게 줄어들고 표현 능력또한 향상되는 효과를 가져온다.&lt;/li&gt;
&lt;li&gt;중간 및 대형 모델 : 모델 용량이 확장되면서, 단일 경로 네트워크의 계산 비용과 파라미터 수가 기하급수적으로 증가한다. 따라서 CSPStackRep Block을 수정해 중간 및 대형 네트워크의 Backbone을 구축했다. CSPStackRep Block은 세 개의 1x1 합성곱 층과 두 개의 RepVGG Block 또는 RepConv으로 구성된 SubBlock의 Stack, 잔차 연결로 구성된다. 또한, 계산 비용을 과도하게 증가시키지 않으면서 성능을 향상시키기 위해 CSP(Cross Stage Partial)가 채택되었다. CSPRepResStage와 비교해 더 간결한 구조를 가지고 있으며, 정확성과 속도 간의 균형을 고려했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;640&quot; data-origin-height=&quot;309&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bWrvAf/btsI820KIp3/OsZ2Qk5iWLTUgrFbmyCXwk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bWrvAf/btsI820KIp3/OsZ2Qk5iWLTUgrFbmyCXwk/img.png&quot; data-alt=&quot;(a) RepBlock is composed of a stack of RepVGG blocks with ReLU activations at training. (b) During inference time, RepVGG block is converted to RepConv. (c) CSPStackRep Blcok comprises three 1x1 conv layers and stack of sub-blocks of double RepConvs following the ReLU activations with a residual connection.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bWrvAf/btsI820KIp3/OsZ2Qk5iWLTUgrFbmyCXwk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbWrvAf%2FbtsI820KIp3%2FOsZ2Qk5iWLTUgrFbmyCXwk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;513&quot; height=&quot;248&quot; data-origin-width=&quot;640&quot; data-origin-height=&quot;309&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;(a) RepBlock is composed of a stack of RepVGG blocks with ReLU activations at training. (b) During inference time, RepVGG block is converted to RepConv. (c) CSPStackRep Blcok comprises three 1x1 conv layers and stack of sub-blocks of double RepConvs following the ReLU activations with a residual connection.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Neck&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Object Detection에서 다양항 스케일에서의 특징 통합이 매우 중요하고, 효과적인 부분으로 입증되었다. YOLOv6는 YOLOv4와 5에서 사용된 수정된 PAN(Path Aggregation Network) 포톨로지를 Detection Neck의 기본으로 채택했다.&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Neck: YOLOv6에서는 YOLOv5에서 사용된 CSP-Block을 RepBlock(작은 모델의 경우) 또는 CSPStackRep Block(큰 모델의 경우)으로 대체하고, 이에 따라 Neck의 Width와 Height을 조정했다. 이러한 조정을 통해 YOLOv6의 넥은 Rep-PAN으로 불린다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Head&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Efficient Decoupled Head&lt;/b&gt;: YOLOv5의 탐지 헤드는 Classification과 Localization branch가 파라미터를 공유하는 couple head구조를 가지고 있다. 반면, FCOS와 YOLOX는 두 branch를 decoupling하고 각 브랜치에 추가적인 3x3 합성곱 층을 도입하여 성능을 향상시킨다. YOLOv6에서는 혼합 채널 strategy를 채택해 더욱 효율적인 decoupled head를 설계했다. 중간 3x3 합성곱 층의 개수를 하나로 줄였고, 헤드의 너비는 backbone과 neck의 너비 배율에 따라 조정된다. 이러한 수정은 계산 비용을 줄여 Latency를 낮추는데 기여했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Anchor-Free:&lt;/b&gt; anchor가 없는 detector는 일반화 능력과 decoding 예측 결과의 단순성 덕분에 주목받고 있는 추세이다. Post Processing에 필요한 시간이 크게 줄었다. Anchor-free detector는 두가지 방식이 존재하는데, 하나는 anchor point based이고 다른 하나는 keypoint based이다. YOLOv6에서는 앵커 포인트 기반 패러다임을 채택했고, 이 방식에서 box regression branch가 실제로 anchor point에서 bbox의 네 면까지의 거리를 예측한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Loss&amp;nbsp;Functions&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Object Detection은 두 가지 하위 작업, 즉 Classification과 Localization을 포함한다. 이 두 작업에는 각각의 손실 함수가 필요한데, Classification Loss 함수와 Box Regression Loss 함수이다. 각 하위 작업에 대해 다양한 손실 함수가 제안되었다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;Classification Loss Function:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Cross-Entropy Loss: 가장 기본적이고 널리 사용되는 classification loss 함수로, 분류의 확률을 최대화하는 방향으로 작동함.&lt;/li&gt;
&lt;li&gt;Focal Loss: 클레스의 불균형 문제를 해결하기 위해 설계된 손실 함수로, 어려운 예제에 더 많은 가중치를 부여함.&lt;/li&gt;
&lt;li&gt;VariFocal Loss: Focal Loss의 변형된 버전으로, 다양한 예제의 중요도를 조절하여 더 세밀한 학습이 가능하도록 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Box Regression Loss Function:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;IoU(Intersection over Union) Loss: IoU를 기반으로 한 손실 함수로, 예측 박스와 실제 박스 간의 겹치는 정도를 측정.&lt;/li&gt;
&lt;li&gt;GIoU(Generalized IoU) Loss: IoU의 일반화된 형태로, 예측 박스와 실제 박스의 겹침 외에도 두 박스 사이의 거리를 고려함.&lt;/li&gt;
&lt;li&gt;SIoU(Scaled IoU) Loss: IoU의 Scale버전으로, 박스 크기와 위치에 따라 손실 값을 조정함.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Object Loss:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Object Loss는 FCOS에서 처음 제안된 개념으로, 낮은 품질의 BBox Score를 감소시켜 Post Processing단계에서 필터링 할 수 있도록 한다. YOLOX에서도 사용되어 네트워크의 수렴 속도를 가속화하고 정확도를 향상시키는데 기여했다. YOLOv6에서 FCOS와 YOLOX와 같은 Anchor-Free 프레임워크로서 객체 손실을 도입해보았지만, 좋은 효과를 주진 못했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Quantization&amp;nbsp;and&amp;nbsp;Deployment&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;산업 배포를 위해, 런타임 속도를 더욱 향상 시키면서 성능 손실을 최소화하기 위해 양자화를 채택하는 것이 일반적인 방법이다. 양자화 모델의 계산 효율성을 높이기 위해 사용한느 기법으로, 두가지가 있는데,&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;사후 양자화 (Post-Training Quantization, PTQ): 모델을 학습 후에 양자화 하는 방법. 소규모의 calibration dataset만으로 직접 모델을 양자화한다. 학습 데이터에 접근할 필요가 없어 비교적 간단하게 구현 가능&lt;/li&gt;
&lt;li&gt;양자화 인식 학습 (Quantization-Aware Training, QAT): 학습 과정 중에 양자화를 인식하여 성능을 더욱 향상시키는 방법. QAT는 일반적으로 Knowledge Distillation과 함께 사용되어, 양자화의 영향을 고려하며 학습이 진행된다.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;560&quot; data-origin-height=&quot;391&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/puff8/btsI9aK9Nn7/pFcHOu2wFDHovnpKL0HEUk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/puff8/btsI9aK9Nn7/pFcHOu2wFDHovnpKL0HEUk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/puff8/btsI9aK9Nn7/pFcHOu2wFDHovnpKL0HEUk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fpuff8%2FbtsI9aK9Nn7%2FpFcHOu2wFDHovnpKL0HEUk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;404&quot; height=&quot;282&quot; data-origin-width=&quot;560&quot; data-origin-height=&quot;391&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 YOLOv6는 많은 양의 재매개화 블록을 사용하고 있어, 기존의 PTQ 기술로는 높은 성능을 달성하기 어렵고, 학습과 추론 시에 가짜 양자화기(Faux Quantizer)를 맞추는것이 어려워 QAT를 적용하는데 한계가 있다. 이를 해결하기 위해 RepOptimizer와 채널별 증류 (Channel-Wise-Distillation)를 활용한 양자화 접근 방식을 적용했다. RepOptimizer는 모델의 파라미터를 양자화에 맞게 조정해 PTQ 친화적인 가중치를 생성하며, 채널별 증류는 학습 과정에서 양자화의 영향을 최소화한다. 또한, 그래프 최적화를 통해 추론 성능을 극대화한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Backbone Network Performance&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1055&quot; data-origin-height=&quot;748&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c9cozb/btsI8o4pAST/stZIq6oG5w2LTrzHAIXSgK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c9cozb/btsI8o4pAST/stZIq6oG5w2LTrzHAIXSgK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c9cozb/btsI8o4pAST/stZIq6oG5w2LTrzHAIXSgK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc9cozb%2FbtsI8o4pAST%2FstZIq6oG5w2LTrzHAIXSgK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;733&quot; height=&quot;520&quot; data-origin-width=&quot;1055&quot; data-origin-height=&quot;748&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;code source: &lt;a href=&quot;https://github.com/meituan/YOLOv6&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/meituan/YOLOv6&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1724204578854&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - meituan/YOLOv6: YOLOv6: a single-stage object detection framework dedicated to industrial applications.&quot; data-og-description=&quot;YOLOv6: a single-stage object detection framework dedicated to industrial applications. - meituan/YOLOv6&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/meituan/YOLOv6&quot; data-og-url=&quot;https://github.com/meituan/YOLOv6&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/eB0sBf/hyWSg5qTmB/zBmuQ5FZzQgFWMOLvFnojK/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/meituan/YOLOv6&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/meituan/YOLOv6&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/eB0sBf/hyWSg5qTmB/zBmuQ5FZzQgFWMOLvFnojK/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - meituan/YOLOv6: YOLOv6: a single-stage object detection framework dedicated to industrial applications.&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv6: a single-stage object detection framework dedicated to industrial applications. - meituan/YOLOv6&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>YOLOv6</category>
      <category>yolov6 논문 리뷰</category>
      <category>yolov6: a single-stage object detection framework for industrial applications</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/22</guid>
      <comments>https://deeplearning-research.tistory.com/22#entry22comment</comments>
      <pubDate>Mon, 19 Aug 2024 18:01:41 +0900</pubDate>
    </item>
    <item>
      <title>[논문] YOLOv4: Optimal Speed and Accuracy of Object Detection</title>
      <link>https://deeplearning-research.tistory.com/21</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;논문 출처 : &lt;a href=&quot;https://arxiv.org/abs/2004.10934&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2004.10934&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1724043820449&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;YOLOv4: Optimal Speed and Accuracy of Object Detection&quot; data-og-description=&quot;There are a huge number of features which are said to improve Convolutional Neural Network (CNN) accuracy. Practical testing of combinations of such features on large datasets, and theoretical justification of the result, is required. Some features operate&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2004.10934&quot; data-og-url=&quot;https://arxiv.org/abs/2004.10934v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bexP4U/hyWOpiheG4/U8AEqp9yXzgxaDw5FX2oGk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bl0IxQ/hyWSmc7VEE/wOk60RZHa1z0s2bCycpGE1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2004.10934&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2004.10934&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bexP4U/hyWOpiheG4/U8AEqp9yXzgxaDw5FX2oGk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bl0IxQ/hyWSmc7VEE/wOk60RZHa1z0s2bCycpGE1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv4: Optimal Speed and Accuracy of Object Detection&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;There are a huge number of features which are said to improve Convolutional Neural Network (CNN) accuracy. Practical testing of combinations of such features on large datasets, and theoretical justification of the result, is required. Some features operate&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Introduction&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CNN 기반 객체 감지기는 주로 추천 시스템에 사용되며, 정확한 모델은 느리지만 부정확한 모델은 빠릅니다. 실시간 객체 감지기의 정확도를 향상시키면 독립적인 프로세스 관리에 활용될 수 있다. 최신 신경망은 실시간 작동이 어렵고 많은 GPU를 필요로하지만, YOLOv4에서는 일반적인 GPU에서 실시간으로 작동하고 훈련 가능한 CNN을 개발하려고 했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;486&quot; data-origin-height=&quot;379&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cvuJj0/btsI8paMjac/qTSiODc74gqj7Ur945MWjK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cvuJj0/btsI8paMjac/qTSiODc74gqj7Ur945MWjK/img.png&quot; data-alt=&quot;Comparision of the proposed YOLOv4 and other SOTA object detectors&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cvuJj0/btsI8paMjac/qTSiODc74gqj7Ur945MWjK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcvuJj0%2FbtsI8paMjac%2FqTSiODc74gqj7Ur945MWjK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;365&quot; height=&quot;285&quot; data-origin-width=&quot;486&quot; data-origin-height=&quot;379&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Comparision of the proposed YOLOv4 and other SOTA object detectors&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 연구의 주요 목표는 이론적인 계산량 지표(BFLOP)보다 생산 시스템에서 객체 감지기의 빠른 작동 속도와 병렬 계산에 대한 최적화에 중점을 두는 것이다. GPU를 사용해 실시간으로 고품질의 객체 감지 결과를 얻을 수 있도록 설계된 모델을 누구나 쉽게 학습 할 수 있게 하는게 목표라고한다. &lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;1080 Ti 또는 2080 Ti GPU를 사용해 초고속 및 고정확도의 객체 감지기를 훈련할 수 있는 효율적이고 강력한 모델을 개발했다.&lt;/li&gt;
&lt;li&gt;객체 감지기 훈련 시 최신 Bag-of-Freebies와 Bag-of-Specials 방법의 영향을 검증했다.&lt;/li&gt;
&lt;li&gt;최신 방법들을 수정하여 단일 GPU 훈련에 더 효율적이고 적합하게 만들었다. (예: CBN, PAN, SAM 등)&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1051&quot; data-origin-height=&quot;517&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b7e5m8/btsI8phy3DU/Kk3ANep61OGL9u3ZPAKFU0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b7e5m8/btsI8phy3DU/Kk3ANep61OGL9u3ZPAKFU0/img.png&quot; data-alt=&quot;Object Detector&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b7e5m8/btsI8phy3DU/Kk3ANep61OGL9u3ZPAKFU0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb7e5m8%2FbtsI8phy3DU%2FKk3ANep61OGL9u3ZPAKFU0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1051&quot; height=&quot;517&quot; data-origin-width=&quot;1051&quot; data-origin-height=&quot;517&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Object Detector&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Object Detection Models&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Modern Object Detector : Backbone + Head의 두 부분으로 구성되어있다. 백본은 이미지넷(ImageNet)에서 사전 학습된 네트워크로, GPU에서는 VGG, Resnet, DenseNet과 같은 모델이, CPU에서는 MobileNet, ShuffleNet등이 사용된다. 헤드는 클레스와 바운딩 박스를 예측하는데,
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;One-Stage Detector : YOLO, SSD, RetinaNet등이 대표적이며, CornerNet, FCOS와 같은 Anchor-free 모델들이 개발되었다.&lt;/li&gt;
&lt;li&gt;Two-Stage Detector : R-CNN 시리즈가 대표적이며, RepPoint와 같은 Anchor-free 모델도 존재한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;이 외에도 Backbone과 Head사이에 Neck을 추가해 다양한 Feature Map을 collect하는 구조도 존재하며, FPN, PAN, BiFPN등이 이에 해당한다. 이를 통해서 Object Detection의 성능을 더욱 향상 시킬 수 있다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Bag of freebies&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Object Detection의 추론 비용을 늘리지 않으며, train strategy를 개선해 성능을 높이는 다양한 방법들이 있다. 주로, 데이터 증강 (Data Augmentation), 라벨 스무딩 (Label Smoothing), 손실 함수 개선 (Loss Function Enhancement)을 통해서 object detection 모델의 정확도와 robust를 크게 향상 시킬 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;데이터 증강 (Data Augmentation)&lt;/b&gt;: 데이터 증강은 훈련 데이터의 다양성을 증가시켜 모델이 다양한 환경에서 높은 성능을 발휘할 수 있게 돕는다. 대표적인 방법으로 밝기, 대비, 채도 조절등과 같은 photometric distortions과 회전, 크기 조정, flip과 같은 geometric distortions이 있다. 추가로, Random erase, CutOut, MixUp, CutMix등과 같은 기법들도 객체 탐지 성능을 높이는데 사용된다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;라벨 스무딩 (Label Smoothing):&lt;/b&gt; Object Detection에서 클레스 간 불균형이 발생할 수 있는데, 라벨스무딩을 통해 이러한 문제를 해결할 수 있다. 라벨 스무딩은 hard level을 soft level로 변환해 모델이 더욱 견고하게 학습 될 수 있게 한다. 이와 함께 Knowledge Distillation 기법을 활용해 더 나은 라벨을 생성하는 방법도 있다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;손실 함수 개선 (Loss Function Enhancement):&lt;/b&gt; 기존의 손실 함수는 Bounding Box regression에서 좌표를 독립적으로 취급해 객체의 완전성을 고려하지 못했다. 이를 해결하기 위해 IOU(Intersection over Union) 손실이 제안되었고, 그 이후에 IOU보다 개선된 GIoU, DIoU,CIoU 손실 함수가 개발되었다. 이들 함수는 객체의 크기, 중심 거리, 종횡비 등을 고려해 더욱 정확한 BBox를 예측할 수 있게 해주었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Methodology&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv4의 기본 목표는 이론적인 계산 지표(BFLOP)보다는 실제 생산 시스템에서의 신경망 운영 속도와 병렬 연산 최적화에 중점을 두었다. &lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;For GPU: CSPResNeXt50 및 CSPDarknet53 모델은 소수의 그룹(1~8)을 사용하는 컨볼루션 레이어를 활용해 최적화했다.&lt;/li&gt;
&lt;li&gt;For VPU: EfficientNet-lite, MixNet, GhostNet, MobileNetV3 모델은 그룹화된 컨볼루션 레이어를 사용하되, SE 블록을 배제하여 최적화되었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Selection of architecture&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;아키텍쳐 선택 과정에서는 input 네트워크 해상도, convolution layer의 수, parameter의 수, output layer(filter)사이의 균형을 찾는 것이 중요하다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Selection of Backbone: CSPResNeXt50은 ImageNet 데이터셋에서 Object Classification 성능이 우수한 반면, CSPDarknet53은 MS COCO 데이터셋에서 Object Detection 성능이 더 뛰어나다.&lt;/li&gt;
&lt;li&gt;Additional Module: 수용 영역을 확장하고 파라미터 집계를 최적화하기 위해 CSPDarknet53 위에 SPP 블록을 추가하여 속도 저하 없이 수용 영역을 크게 확장한다. 또한, YOLOv3에서 사용된 FPN 대신 PANet을 사용하여 백본의 다른 레벨에서 파라미터를 집계한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1005&quot; data-origin-height=&quot;152&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bmXfoi/btsI7W1kzg4/IfsytXumLK406DUczHiTsk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bmXfoi/btsI7W1kzg4/IfsytXumLK406DUczHiTsk/img.png&quot; data-alt=&quot;Parameters of neural networks for image classification&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bmXfoi/btsI7W1kzg4/IfsytXumLK406DUczHiTsk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbmXfoi%2FbtsI7W1kzg4%2FIfsytXumLK406DUczHiTsk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;787&quot; height=&quot;119&quot; data-origin-width=&quot;1005&quot; data-origin-height=&quot;152&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Parameters of neural networks for image classification&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 &lt;b&gt;YOLOv4의 모델 아키텍쳐&lt;/b&gt;는 아래와 같이 구성되었다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Backbone : CSPDarkNet53&lt;/li&gt;
&lt;li&gt;Additional Module : SPP&lt;/li&gt;
&lt;li&gt;Neck : PANet 경로 집계&lt;/li&gt;
&lt;li&gt;Head : YOLOv3 (Anchor-Based)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Selection&amp;nbsp;of&amp;nbsp;BoF&amp;nbsp;and&amp;nbsp;BoS&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Object Detection 학습을 개선하기 위해 CNN에서 사용하는 다양한 기법들에 대해 설명해준다. &lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;활성화 함수 (Activation):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ReLU, leaky-ReLU, parametric-ReLU, ReLU6, SELU, Swish, Mish등 다양한 활성화 함수가 사용된다.&lt;/li&gt;
&lt;li&gt;selection에서 PReLU와 SELU는 훈련이 더 어려워 제외되었고, ReLU6는 양자화 네트워크에 특화되어 있어 제외되었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;BBox Regression Loss:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MSE,IoUm GIoU,CIoU,DIoU등 다양한 손실 함수가 사용된다&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;데이터 증강 (Data Augmentation):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;CutOut, MixUp, CutMix 등 여러 데이터 증강 기법이 적용된다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Regularization Method:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;DropOut, DropPath, Spatial DropOut, DropBlock 등 정규화 기법이 사용된다.&lt;/li&gt;
&lt;li&gt;DropBlock은 다른 정규화 기법들과 비교해 우수한 성능을 보여 선택되었다. &lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Normalization of Network Activations:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Batch Normalization (BN), Cross-GPU Batch Normalization (CGBN or SyncBN), Filter Response Normalization (FRN), Cross-Iteration Batch Normalization (CBN) 등의 정규화 기법이 존재한다. &lt;/li&gt;
&lt;li&gt;단일 GPU를 사용하는 train strategy에 중점을 두어, SyncBN은 고려하지 않았다고 한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Skip-connections:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Residual connections, Weighted residual connections, Multi-input weighted residual connections, Cross stage partial connections (CSP) 등 다양한 스킵 연결 방식이 있다. &lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div data-message-id=&quot;e82e4b70-9640-497f-9acd-b5a8d8aa126d&quot; data-message-author-role=&quot;assistant&quot;&gt;
&lt;div&gt;
&lt;div&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;YOLOv4 상세 설명&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Backbone: &lt;/b&gt;강력한 특징 추출을 위해 &lt;b&gt;CSPDarknet53&lt;/b&gt;을 사용했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Neck:&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;SPP (Spatial Pyramid Pooling)&lt;/b&gt;: 다양한 크기의 수용 영역을 활용하여 특징을 추출.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;PAN (Path Aggregation Network)&lt;/b&gt;: 여러 백본 레벨에서 파라미터를 집계하여 성능을 향상시킴.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;3. Head (헤드):&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;YOLOv3&lt;/b&gt;: 객체 탐지 결과를 예측하는 데 사용됨.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;4. BoS &amp;amp; BoF&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Bag of Freebies (BoF) for Backbone (백본용 자유 기법)&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터 증강: CutMix와 Mosaic 기법을 사용하여 훈련 데이터의 다양성을 증가.&lt;/li&gt;
&lt;li&gt;정규화: DropBlock 정규화 기법을 적용하여 모델의 일반화 성능을 개선.&lt;/li&gt;
&lt;li&gt;클래스 라벨 스무딩 (Class Label Smoothing): 클래스를 부드럽게 표현하여 과적합을 방지.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Bag of Specials (BoS) for Backbone (백본용 특별 기법)&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;활성화 함수: Mish 활성화 함수를 사용하여 비선형 변환을 향상시킴.&lt;/li&gt;
&lt;li&gt;Cross-stage Partial Connections (CSP): 네트워크의 깊이를 증가시키지 않고 특징을 효율적으로 집계함.&lt;/li&gt;
&lt;li&gt;Multi-input Weighted Residual Connections (MiWRC): 다양한 입력으로부터 가중치를 조정하여 더 효과적인 특징 학습을 가능하게 함.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Bag of Freebies (BoF) for Detector (탐지기용 자유 기법):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;손실 함수: CIoU-loss를 사용하여 더 정밀한 Bbox regression을 수행한다.&lt;/li&gt;
&lt;li&gt;정규화: CmBN (Cross-mini-batch Normalization)과 DropBlock을 사용함.&lt;/li&gt;
&lt;li&gt;데이터 증강: Mosaic 기법을 포함하여 데이터의 다양성을 높였다.&lt;/li&gt;
&lt;li&gt;자기-적대적 훈련 (Self-Adversarial Training): 모델의 강건성을 향상시킨다.&lt;/li&gt;
&lt;li&gt;그리드 민감도 제거: 모델의 그리드 기반 민감도를 줄인다.&lt;/li&gt;
&lt;li&gt;여러 앵커: 단일 ground truth에 대해 여러 Anchor를 사용하여 Detection 성능을 개선한다.&lt;/li&gt;
&lt;li&gt;코사인 주기적 스케줄러: Cosine annealing scheduler를 사용하여 학습률을 조절한다.&lt;/li&gt;
&lt;li&gt;최적의 하이퍼파라미터&lt;b&gt;:&lt;/b&gt; 모델 성능을 극대화하기 위해 하이퍼파라미터를 최적화한다.&lt;/li&gt;
&lt;li&gt;무작위 훈련 크기: 다양한 크기의 입력을 사용하여 모델의 일반화 능력을 향상시킨다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Bag of Specials (BoS) for Detector (탐지기용 특별 기법):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;활성화 함수: Mish 활성화 함수를 사용한다.&lt;/li&gt;
&lt;li&gt;SPP 블록: SPP (Spatial Pyramid Pooling) 블록을 추가하여 수용 영역을 확장한다.&lt;/li&gt;
&lt;li&gt;SAM 블록: SAM (Selective Attention Module) 블록을 사용하여 중요한 특징을 강조함.&lt;/li&gt;
&lt;li&gt;PAN 경로 집계 블록: **PANet (Path Aggregation Network)**을 사용하여 백본 레벨에서 파라미터를 집계한다.&lt;/li&gt;
&lt;li&gt;DIoU-NMS: DIoU (Distance-IoU) Non-Maximum Suppression(NMS)을 사용하여 박스 정합을 개선함.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;908&quot; data-origin-height=&quot;556&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cjLr28/btsI9gEm0Rw/tkoE03ZKqcSywkCWeJ7Py1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cjLr28/btsI9gEm0Rw/tkoE03ZKqcSywkCWeJ7Py1/img.png&quot; data-alt=&quot;Comparision of the speed and accuracy of different object detectors&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cjLr28/btsI9gEm0Rw/tkoE03ZKqcSywkCWeJ7Py1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcjLr28%2FbtsI9gEm0Rw%2FtkoE03ZKqcSywkCWeJ7Py1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;463&quot; height=&quot;284&quot; data-origin-width=&quot;908&quot; data-origin-height=&quot;556&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Comparision of the speed and accuracy of different object detectors&lt;/figcaption&gt;
&lt;/figure&gt;

&lt;h4 data-ke-size=&quot;size20&quot;&gt;&amp;nbsp;&lt;/h4&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Conclusion&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv4는 표에서 보여진 모든 alternative object detector들보다 &lt;b&gt;속도&lt;/b&gt;와 &lt;b&gt;정확도&lt;/b&gt;에서 우수한 성능을 자랑한다. 8-16GB VRAM을 가진 일반 GPU에서 훈련과 사용이 가능하여, 널리 활용될 수 있는 실용적인 솔루션을 제공한다. YOLOv4의 성과는 하나의 단계(anchor-based) detection 개념의 유효성을 입증하며, 다양한 기능을 검증하고 최적화하여 높은 정확도와 빠른 처리 속도를 동시에 달성했다. &lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;source code: &lt;a href=&quot;https://docs.ultralytics.com/models/yolov4/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://docs.ultralytics.com/models/yolov4/&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>yolov4</category>
      <category>yolov4 논문 리뷰</category>
      <category>yolov4: high-speed and precise object detection</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/21</guid>
      <comments>https://deeplearning-research.tistory.com/21#entry21comment</comments>
      <pubDate>Mon, 19 Aug 2024 15:55:21 +0900</pubDate>
    </item>
    <item>
      <title>[논문] YOLOv3: An Incremental Improvement 리뷰</title>
      <link>https://deeplearning-research.tistory.com/20</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;논문 출처 : &lt;a href=&quot;https://arxiv.org/abs/1804.02767&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/1804.02767&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1723973819870&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;YOLOv3: An Incremental Improvement&quot; data-og-description=&quot;We present some updates to YOLO! We made a bunch of little design changes to make it better. We also trained this new network that's pretty swell. It's a little bigger than last time but more accurate. It's still fast though, don't worry. At 320x320 YOLOv3&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/1804.02767&quot; data-og-url=&quot;https://arxiv.org/abs/1804.02767v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bdPkAZ/hyWOeHHaAB/rlr8vS9znUmRZL5v70hRI0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b9juUh/hyWOrtwtXA/c6gPxyPyvob1FKKbIUk3hK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1804.02767&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/1804.02767&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bdPkAZ/hyWOeHHaAB/rlr8vS9znUmRZL5v70hRI0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b9juUh/hyWOrtwtXA/c6gPxyPyvob1FKKbIUk3hK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv3: An Incremental Improvement&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We present some updates to YOLO! We made a bunch of little design changes to make it better. We also trained this new network that's pretty swell. It's a little bigger than last time but more accurate. It's still fast though, don't worry. At 320x320 YOLOv3&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv3(You Only Look Once version 3)는 Joseph Redmon과 Ali Farhadi가 2018년에 발표한 물체 인식 모델로, YOLOv2의 단점을 보완하고 성능을 더욱 향상시킨 버전이다. 다양한 크기의 물체를 효과적으로 인식할 수 있도록 여러 가지 기술적 개선이 도입되었으며, 특히 빠른 속도와 높은 정확도의 균형을 유지하면서도, 깊은 네트워크 구조와 멀티스케일 예측을 통해 성능을 크게 향상시켰다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Backbone: &lt;/b&gt;Darknet-53&lt;/h4&gt;
&lt;p style=&quot;text-align: justify;&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv3는 새로운 백본 네트워크로 &lt;b&gt;Darknet-53&lt;/b&gt;을 사용했는데, 이는 53개의 conv layers로 구성된 깊은 네트워크로, &lt;b&gt;ResNet&lt;/b&gt;에서 사용된 잔차 블록(Residual Blocks)을 채택해 더 깊은 네트워크를 안정적으로 학습할 수 있게 한다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;특징&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이전 버전의 Darknet-19보다 깊은 네트워크로, 더욱 복잡한 특징을 추출할 수 있다.&lt;/li&gt;
&lt;li&gt;ResNet의 아이디어를 차용해, 기울기 소실 문제를 해결하고 더 깊은 구조에서도 효과적인 학습이 가능하다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;FLOPs&lt;/b&gt;(Floating Point Operations) 대비 효율적인 연산을 통해, 이미지넷 분류 작업에서 기존 모델들에 비해 경쟁력 있는 성능을 보여줍니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;536&quot; data-origin-height=&quot;750&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b3r2IP/btsI6P2xahy/CWLhJZo6GmzklMKPmZYsWK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b3r2IP/btsI6P2xahy/CWLhJZo6GmzklMKPmZYsWK/img.png&quot; data-alt=&quot;Darknet-53&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b3r2IP/btsI6P2xahy/CWLhJZo6GmzklMKPmZYsWK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb3r2IP%2FbtsI6P2xahy%2FCWLhJZo6GmzklMKPmZYsWK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;257&quot; height=&quot;360&quot; data-origin-width=&quot;536&quot; data-origin-height=&quot;750&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Darknet-53&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Multi-Scale Predictions&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv3는 &lt;b&gt;멀티스케일 예측&lt;/b&gt;을 도입하여, 서로 다른 크기의 물체를 인식할 수 있는 능력을 크게 향상시켰다. 이를 위해 YOLOv3는 &lt;b&gt;Feature Pyramid Network (FPN)&lt;/b&gt; 구조를 활용하여 3개의 다른 스케일에서 예측을 수행한다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;작동 방식&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;네트워크의 다른 레이어에서 나오는 특징 맵을 사용해, 작은, 중간, 큰 크기의 물체를 각각 인식할 수 있다.&amp;nbsp;&lt;/li&gt;
&lt;li&gt;각 스케일에서 3개의 앵커 박스를 사용하여 바운딩 박스를 예측하며, 총 9개의 앵커 박스가 사용된다.&lt;/li&gt;
&lt;li&gt;다양한 스케일에서 예측함으로써, 작은 물체와 큰 물체를 모두 잘 인식할 수 있다.&lt;/li&gt;
&lt;li&gt;Feature Map : 13 x 13, 26 x 26, 52 x 52를 사용&lt;span style=&quot;background-color: #f8f9fa; color: #212529; text-align: start;&quot;&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1052&quot; data-origin-height=&quot;556&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ZwusA/btsI61VX14Y/2DTrmzh2hPiVGkeIPSr4n1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ZwusA/btsI61VX14Y/2DTrmzh2hPiVGkeIPSr4n1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ZwusA/btsI61VX14Y/2DTrmzh2hPiVGkeIPSr4n1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FZwusA%2FbtsI61VX14Y%2F2DTrmzh2hPiVGkeIPSr4n1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;588&quot; height=&quot;311&quot; data-origin-width=&quot;1052&quot; data-origin-height=&quot;556&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Bounding Box Predictions&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;바운딩 박스의 좌표를 예측하는 방식에서 개선이 이루어졌다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;선형 활성화 함수&lt;/b&gt;: YOLOv3는 바운딩 박스의 중심 좌표와 크기를 예측할 때, 선형 활성화 함수를 사용하여 더 정확한 좌표 예측을 가능하게 했다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;기존 모델과의 차이점&lt;/b&gt;: YOLOv3는 이전 버전에서 사용된 비선형 활성화 함수 대신, 선형 활성화 함수를 사용함으로써 예측의 직관성과 정확도를 높였다.&lt;br /&gt;&lt;br /&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Class Prediction&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;로지스틱 회귀&lt;/b&gt;를 사용하여 각 바운딩 박스에서 물체의 클래스를 예측한다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;다중 라벨 예측&lt;/b&gt;: YOLOv3는 소프트맥스 함수 대신 로지스틱 회귀를 사용하여, 각 클래스에 대한 독립적인 확률을 계산하며 이를 통해 한 바운딩 박스에서 여러 개의 클레스가 동시에 예측 될 수 있다. 이렇게 되면 다중 라벨 분류 문제에 적합해지며, 단일 물체가 여러 클레스에 속하는 경우에도 효과적으로 대응 할 수 있게된다.&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Conclusion&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv3는 물체 인식에서 속도와 정확도를 동시에 유지하면서도 더 복잡한 장면과 다양한 크기의 물체를 효과적으로 인식할 수 있는 강력한 모델이다. 다만, 일부 작은 물체 인식의 한계와 모델 크기의 부담이 있지만, 전체적으로 보면 YOLOv3는 물체 인식 분야에서 중요한 진전을 이룬 모델이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;code source : &lt;a href=&quot;https://github.com/ultralytics/yolov3&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/ultralytics/yolov3&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1723977816672&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - ultralytics/yolov3: YOLOv3 in PyTorch &amp;gt; ONNX &amp;gt; CoreML &amp;gt; TFLite&quot; data-og-description=&quot;YOLOv3 in PyTorch &amp;gt; ONNX &amp;gt; CoreML &amp;gt; TFLite. Contribute to ultralytics/yolov3 development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/ultralytics/yolov3&quot; data-og-url=&quot;https://github.com/ultralytics/yolov3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cmLzDJ/hyWSool96m/knuCCHqxVddIpIkDxauhO0/img.png?width=1920&amp;amp;height=540&amp;amp;face=0_0_1920_540&quot;&gt;&lt;a href=&quot;https://github.com/ultralytics/yolov3&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/ultralytics/yolov3&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cmLzDJ/hyWSool96m/knuCCHqxVddIpIkDxauhO0/img.png?width=1920&amp;amp;height=540&amp;amp;face=0_0_1920_540');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - ultralytics/yolov3: YOLOv3 in PyTorch &amp;gt; ONNX &amp;gt; CoreML &amp;gt; TFLite&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv3 in PyTorch &amp;gt; ONNX &amp;gt; CoreML &amp;gt; TFLite. Contribute to ultralytics/yolov3 development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>논문</category>
      <category>YOLOv3</category>
      <category>yolov3 논문리뷰</category>
      <category>yolov3: an incremental improvement</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/20</guid>
      <comments>https://deeplearning-research.tistory.com/20#entry20comment</comments>
      <pubDate>Sun, 18 Aug 2024 19:43:48 +0900</pubDate>
    </item>
    <item>
      <title>[논문] YOLOv2 리뷰</title>
      <link>https://deeplearning-research.tistory.com/19</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;논문 출처 : &lt;a href=&quot;https://arxiv.org/abs/1612.08242&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/1612.08242&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1723971488080&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;YOLO9000: Better, Faster, Stronger&quot; data-og-description=&quot;We introduce YOLO9000, a state-of-the-art, real-time object detection system that can detect over 9000 object categories. First we propose various improvements to the YOLO detection method, both novel and drawn from prior work. The improved model, YOLOv2, &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/1612.08242&quot; data-og-url=&quot;https://arxiv.org/abs/1612.08242v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/xSQse/hyWOlUm90S/9dRIk3hioybALdDtWVyE80/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/S210s/hyWSe0jApa/4let00bSJjL4nO3FQBoN5K/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1612.08242&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/1612.08242&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/xSQse/hyWOlUm90S/9dRIk3hioybALdDtWVyE80/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/S210s/hyWSe0jApa/4let00bSJjL4nO3FQBoN5K/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;YOLO9000: Better, Faster, Stronger&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We introduce YOLO9000, a state-of-the-art, real-time object detection system that can detect over 9000 object categories. First we propose various improvements to the YOLO detection method, both novel and drawn from prior work. The improved model, YOLOv2,&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;YOLOv2(You Only Look Once version 2)는 YOLO 모델의 개선된 버전으로, 2016년에 Joseph Redmon과 Ali Farhadi가 발표한 논문 &quot;YOLO9000: Better, Faster, Stronger&quot;에서 소개되었다. 이 논문은 YOLOv2와 함께 YOLO9000이라는 모델도 제안하며, 물체 인식에서 더 나은 성능과 정확도를 달성하기 위해 여러 가지 새로운 기술들을 도입했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문은 YOLO의 기본 철학을 유지하면서도, 다양한 최적화 기법과 새로운 기술을 적용하여 더 나은 정확도와 효율성을 달성했다. 특히, YOLOv2는 다양한 크기의 물체를 인식할 수 있도록 개선되었으며, 속도와 정확성 사이의 균형을 맞추는 데 중점을 두었다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문 제목에 9,000이라는 숫자가 있는데 이는 9천가지 종류의 객체를 탐지할 수 있는 실시간 object detection 모델이기 때문이다. 이 모델은 VOC 2007 data에서 76.8mAP를 67 fps 달성했으며, 78.6mAP를 40 fps로 달성했다고한다. object detection과 classification을 함께 학습시키는 방법을 통해 detection dataset에 존재하지 않는 라벨들에 대해서도 예측이 가능하며 여전히 빠른 실행 속도를 유지하며 9000개 이상의 object category에 대해 예측한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Better: &lt;/b&gt;더 나은 정확성 (Improved Accuracy)&lt;/h4&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;기존 YOLO 모델에 비해 물체 인식의 정확도를 크게 향상시켰다.&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Batch Normalization&lt;/b&gt;: YOLOv2는 모든 컨볼루션 레이어에 배치 정규화를 적용하여 학습을 안정화하고, 과적합을 방지하여 모델의 일반화 성능을 높였다. 이 방법은 기존 YOLO 모델에 비해 약 2%의 mAP(mean Average Precision) 향상을 가져왔다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;High-Resolution Classifier&lt;/b&gt;: 모델이 학습 중간에 높은 해상도 이미지를 사용하여 더욱 세밀한 특징을 학습하게 한다. 처음에는 낮은 해상도로 학습을 시작한 후, 네트워크를 높은 해상도로 전환하여 더욱 정교한 특징을 추출하는데, 이러한 접근법은 작은 물체나 세밀한 부분을 더 잘 감지할 수 있게 해준다.&amp;nbsp;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Anchor Boxes&lt;/b&gt;: YOLOv2는 바운딩 박스를 예측하기 위해 앵커 박스를 도입했다. 앵커 박스는 다양한 크기와 비율을 가지는 사전 정의된 박스들로, 이를 통해 다양한 크기의 물체를 더 잘 인식할 수 있으며, 이를 통해 작은 물체나 목잡한 장면에서의 성능을 개선하는데 도움이 되었다고 한다.&amp;nbsp;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Dimension Clusters&lt;/b&gt;: 앵커 박스의 크기와 비율을 설정하기 위해, YOLOv2는 K-평균 클러스터링을 사용하여 학습 데이터에서 가장 자주 나타나는 박스 차원들을 선택했다. 이를 통해 모델이 더욱 최적화된 앵커 박스를 사용할 수 있게 되었고, 바운딩 박스 예측의 정확성이 향상되었다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;648&quot; data-origin-height=&quot;498&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c5GaT5/btsI6WN3Yxj/oH4mn8K5U1xeymakJkuZRk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c5GaT5/btsI6WN3Yxj/oH4mn8K5U1xeymakJkuZRk/img.png&quot; data-alt=&quot;Bounding boxes with dimension priors and location prediction.&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c5GaT5/btsI6WN3Yxj/oH4mn8K5U1xeymakJkuZRk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc5GaT5%2FbtsI6WN3Yxj%2FoH4mn8K5U1xeymakJkuZRk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;475&quot; height=&quot;365&quot; data-origin-width=&quot;648&quot; data-origin-height=&quot;498&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Bounding boxes with dimension priors and location prediction.&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Faster:&lt;/b&gt; 더 빠른 처리 속도 (Increased Speed)&lt;/h4&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;실시간 물체 인식을 염두에 두고 설계되었으며, 속도와 정확도 간의 균형을 유지하는 데 중점을 두었다:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Darknet-19&lt;/b&gt;: YOLOv2는 새로운 백본 네트워크로 Darknet-19를 도입했는데, 이 네트워크는 19개의 컨볼루션 레이어와 5개의 맥스풀링 레이어로 구성되어 있으며, 경량화된 구조로 인해 연산 속도가 매우 빠르다. Darknet-19는 이미지넷(ImageNet) 데이터셋에서 분류 정확도를 높게 유지하면서도, YOLOv1에서 사용된 모델보다 훨씬 빠른 속도를 보여준다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;488&quot; data-origin-height=&quot;610&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b0WU6X/btsI7VAAcCj/qN0Lt9PLpr7kO1dKU255kk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b0WU6X/btsI7VAAcCj/qN0Lt9PLpr7kO1dKU255kk/img.png&quot; data-alt=&quot;Darknet19&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b0WU6X/btsI7VAAcCj/qN0Lt9PLpr7kO1dKU255kk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb0WU6X%2FbtsI7VAAcCj%2FqN0Lt9PLpr7kO1dKU255kk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;395&quot; height=&quot;494&quot; data-origin-width=&quot;488&quot; data-origin-height=&quot;610&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Darknet19&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Multi-Scale Training&lt;/b&gt;: YOLOv2는 학습 중에 다양한 해상도의 이미지를 사용하여 모델이 다양한 크기와 스케일에 적응할 수 있도록 훈련되었다. 이는 모델이 더 작은 해상도에서도 빠르게 동작할 수 있게 하며, 동시에 높은 해상도에서의 정확도를 유지할 수 있게 한다. 이 접근법은 다양한 해상도의 입력 이미지에서 균형 잡힌 성능을 제공하는 데 기여했다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;648&quot; data-origin-height=&quot;468&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bkTSl1/btsI7pWmNGU/T9u5T87gpfP5CkGsrTLvc1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bkTSl1/btsI7pWmNGU/T9u5T87gpfP5CkGsrTLvc1/img.png&quot; data-alt=&quot;Accuracy and speed on VOC 2007&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bkTSl1/btsI7pWmNGU/T9u5T87gpfP5CkGsrTLvc1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbkTSl1%2FbtsI7pWmNGU%2FT9u5T87gpfP5CkGsrTLvc1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;469&quot; height=&quot;339&quot; data-origin-width=&quot;648&quot; data-origin-height=&quot;468&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Accuracy and speed on VOC 2007&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;650&quot; data-origin-height=&quot;390&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/r2WSt/btsI6CCk0Bs/eEACeBHSqn8JjT8yHmXq10/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/r2WSt/btsI6CCk0Bs/eEACeBHSqn8JjT8yHmXq10/img.png&quot; data-alt=&quot;Detection frameworks on PASCAL VOC 2007&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/r2WSt/btsI6CCk0Bs/eEACeBHSqn8JjT8yHmXq10/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fr2WSt%2FbtsI6CCk0Bs%2FeEACeBHSqn8JjT8yHmXq10%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;312&quot; height=&quot;187&quot; data-origin-width=&quot;650&quot; data-origin-height=&quot;390&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Detection frameworks on PASCAL VOC 2007&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Stronger:&lt;/b&gt; 더 강력한 확장성과 일반화 능력 (Improved Flexibility and Generalization)&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;더 강력한 확장성과 일반화 능력을 갖추도록 설계되었다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;YOLO9000&lt;/b&gt;:&amp;nbsp; YOLO9000은 ImageNet과 COCO 데이터셋을 결합하여 9,000개 이상의 클래스를 실시간으로 인식할 수 있는 모델이다. 이는 단순히 더 많은 클래스를 인식할 수 있는 것뿐만 아니라, 새로운 클래스를 더 잘 일반화할 수 있는 능력을 제공한다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Hierarchical Classification&lt;/b&gt;: YOLO9000은 계층적 분류 체계를 사용하여, 다양한 수준의 클래스에서 물체를 인식할 수 있다. 이를 통해 학습 데이터에 없는 클래스도 더 높은 수준의 계층에서 유사한 클래스로 인식할 수 있게 된다. 예를 들어, &quot;Dog&quot;라는 클래스를 학습했더라도 &quot;불독&quot;이나 &quot;리트리버&quot;와 같은 세부 클래스를 일반화하여 인식할 수 있다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;652&quot; data-origin-height=&quot;714&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cV2uCa/btsI6kveOzY/HWskaew06OTfQaJlYsmblK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cV2uCa/btsI6kveOzY/HWskaew06OTfQaJlYsmblK/img.png&quot; data-alt=&quot;Combining datasets using WordTree hierarchy&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cV2uCa/btsI6kveOzY/HWskaew06OTfQaJlYsmblK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcV2uCa%2FbtsI6kveOzY%2FHWskaew06OTfQaJlYsmblK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;440&quot; height=&quot;482&quot; data-origin-width=&quot;652&quot; data-origin-height=&quot;714&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Combining datasets using WordTree hierarchy&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;WordTree&lt;/b&gt;: YOLO9000은 WordTree라는 계층 구조를 활용하여 각 클래스 간의 관계를 정의하고, 클래스별 확률을 조정하여 모델이 더 많은 클래스에서 효과적으로 학습할 수 있도록 한다. 이를 통해 새로운 데이터셋과 클래스에도 쉽게 확장될 수 있으며, 다양한 애플리케이션에서 사용될 수 있는 강력한 유연성을 제공한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;668&quot; data-origin-height=&quot;564&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dYHPZv/btsI8pOLieR/tmfajMefNJii3Qsi2ftgU1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dYHPZv/btsI8pOLieR/tmfajMefNJii3Qsi2ftgU1/img.png&quot; data-alt=&quot;Prediction on ImageNet vs WordTree&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dYHPZv/btsI8pOLieR/tmfajMefNJii3Qsi2ftgU1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdYHPZv%2FbtsI8pOLieR%2FtmfajMefNJii3Qsi2ftgU1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;402&quot; height=&quot;339&quot; data-origin-width=&quot;668&quot; data-origin-height=&quot;564&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;Prediction on ImageNet vs WordTree&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Conclusion&lt;/b&gt;&lt;/h4&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv2는 &quot;Better, Faster, Stronger&quot;라는 슬로건에 걸맞게, 물체 인식에서의 정확도, 속도, 확장성을 모두 크게 개선한 모델이다. 이 논문은 YOLO의 기본 철학을 유지하면서도 여러 가지 최적화와 혁신적인 기술을 도입하여, 실시간 물체 인식의 새로운 표준을 제시했 으며, 다양한 크기의 물체를 좀 더 효율적으로 인식할 수 있고, 실시간 애플리케이션에서 탁월한 성능을 발휘할 수 있는 모델로 자리 잡았다.&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;Limitation&lt;/b&gt;&lt;/h4&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;YOLOv2는 여러 측면에서 기존 YOLO 모델을 크게 개선했지만, 작은 물체 인식, 복잡한 장면에서의 성능, 앵커 박스 설정의 제약, 다양한 스케일 처리의 한계, 정밀도와 속도 간의 trade off, 그리고 새로운 환경에서의 일반화 능력에서 여전히 한계가 있다.&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #212529; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;source code: &lt;a href=&quot;https://pjreddie.com/darknet/yolo/#google_vignette&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://pjreddie.com/darknet/yolo/#google_vignette&lt;/a&gt;&lt;/p&gt;</description>
      <category>논문</category>
      <category>yolo9000</category>
      <category>yolo9000: better faster stronger</category>
      <category>yolov2</category>
      <category>yolov2 논문 리뷰</category>
      <author>괜찮나요닝겐</author>
      <guid isPermaLink="true">https://deeplearning-research.tistory.com/19</guid>
      <comments>https://deeplearning-research.tistory.com/19#entry19comment</comments>
      <pubDate>Sun, 18 Aug 2024 18:35:30 +0900</pubDate>
    </item>
  </channel>
</rss>