YOLOv3 알고리즘 기반 교통 표지판 인식 2부
Jan 19, 2024
2. 알고리즘 기초
2.1. YOLOv3 알고리즘
YOLOv3[14]는 YOLOv2를 기반으로 한 Redmon의 향상된 단일 단계 표적 탐지 알고리즘으로 탐지 정확도와 실시간 성능이 향상되었으며 속도와 정확도 측면에서 다른 알고리즘보다 뛰어납니다.
최근 인공지능 기술의 급속한 발전으로 다양한 지능형 탐지 시스템이 다양한 분야에 적용되는 것이 가능해지고 있다. 탐지 정확도는 지능형 시스템의 품질을 평가하는 중요한 지표이며, 메모리는 지능형 시스템의 작동을 지원하는 핵심 기능 중 하나입니다. 그렇다면 둘 사이의 관계는 무엇일까?
우선, 탐지 정확도와 메모리가 단순한 '양의 상관관계'나 '음의 상관관계'가 아니라는 점을 분명히 해야 합니다. 그들 사이에는 높은 수준의 상호 작용과 조정이 있습니다. 많은 경우 지능형 시스템의 감지 정확도는 메모리, 즉 샘플 데이터를 이해하고 학습하는 능력에 따라 달라집니다.
예를 들어, 얼굴 인식 분야에서 좋은 얼굴 인식 시스템은 다양한 얼굴을 정확하게 식별하고 이를 알려진 얼굴 데이터베이스에 있는 사람의 정보와 일치시킬 수 있어야 합니다. 이를 위해서는 강력한 메모리를 보유하고, 알려진 얼굴의 정보를 데이터베이스에 저장하고, 후속 인식 작업에서 이를 유연하게 사용할 수 있는 지능형 시스템이 필요합니다.
마찬가지로 의료 분야에서도 지능형 시스템은 의사의 질병 진단 및 치료 계획 설계를 지원하기 위해 많은 양의 의학 지식을 이해하고 기억해야 합니다. 이를 위해서는 강력한 기억력과 학습 능력을 갖추고, 새로운 의학 지식을 지속적으로 흡수하며, 기존 지식 기반과 교차 검증 및 업그레이드하는 지능형 시스템이 필요합니다.
물론 탐지 정확도와 메모리의 관계는 단방향이 아닙니다. 반대로, 좋은 감지 정확도는 지능형 시스템의 메모리 향상을 촉진할 수도 있습니다. 예를 들어, 일부 분류 및 인식 작업에서 지능형 시스템은 정확도와 정밀도를 지속적으로 개선하기 위해 지속적으로 피드백과 최적화를 제공해야 하며, 이를 통해 샘플 데이터를 이해하고 기억하는 능력을 더욱 강화해야 합니다.
일반적으로 감지 정확도와 메모리는 지능형 시스템 작동에 없어서는 안 될 두 가지 요소입니다. 그들은 완전히 고려하고 조정해야 하는 복잡한 상호 작용과 관계를 가지고 있습니다. 감지 정확도를 지속적으로 개선하고 지능형 시스템의 기억 및 학습 기능을 지속적으로 강화해야만 지능형 시스템의 포괄적인 개발 및 적용이 실제로 실현될 수 있습니다. 기억력 향상이 필요하다고 볼 수 있는데, Cistanche Deserticola는 아세틸콜린 수치와 성장인자 수치를 높이는 등 신경전달물질의 균형도 조절할 수 있기 때문에 기억력을 크게 향상시킬 수 있습니다. 이 물질은 기억과 학습에 매우 중요합니다. 또한 고기는 혈류를 개선하고 산소 전달을 촉진하여 뇌에 충분한 영양분과 에너지를 공급하여 뇌의 활력과 지구력을 향상시킬 수 있습니다.

YOLOv3은 현재 YOLO 계열에서 가장 인기 있는 알고리즘이며 실제 탐지 시나리오에서 널리 사용됩니다[15]. YOLOv3 네트워크 구조는 그림 1에 나와 있습니다.

YOLOv3에서 사용하는 전체 컨볼루셔널 구조는 이미지 입력 크기에 의해 제한되지 않습니다.
전체 네트워크 구조에서 풀링 및 완전 연결 레이어를 제거하고 다운샘플링 작업을 위해 풀링 레이어 대신 스텝 크기 2의 콘볼루션 레이어를 사용하여 풀링 중 타겟 정보의 손실을 방지하고 작은 타겟의 탐지를 용이하게 합니다. 16].
또한 YOLOv3는 YOLOv2의 DarkNet-19 네트워크 구조를 DarkNet-53기능 추출 계층으로 대체합니다.
심층 네트워크의 그래디언트 문제와 다층 콘볼루션 연산 중 원본 정보의 손실을 성공적으로 해결하여 특징을 더 잘 추출하고 탐지 및 분류를 향상시키는 DarkNet{0}} 네트워크[17]는 ResNet의 잔여 네트워크 구조를 차용합니다. 18] 이전 계층의 원래 출력을 네트워크의 후반 계층 입력의 일부로 사용합니다.
그림 2에서 볼 수 있듯이 YOLOv3의 잔여 모듈은 두 개의 컨볼루셔널 레이어와 단축 레이어로 구성됩니다.

또한 YOLOv3는 기능 피라미드 네트워크(FPN)(19) 개념을 사용하고 기능 피라미드 네트워크를 도입하여 13 x 13, 26 x 26 및 52 x 52의 감지 스케일을 사용하여 세 가지 스케일에서 기능 맵을 예측합니다.
컨벌루션 신경망의 특징 추출 방법은 FPN 네트워크에서 상향식이며, 컨벌루션 레이어 특징 맵을 업샘플링하는 과정은 그림 3과 같이 하향식입니다.
2.2. 공간 피라미드 풀링 구조
SPP(Spatial Pyramid Pooling) 구조(20)는 컨볼루셔널 신경망에 의한 이미지 특징의 반복 추출 문제를 해결하고 검출 효율성을 크게 향상시키며, SPPNet 네트워크 구조는 그림 4에 나와 있습니다.

입력 이미지의 해상도가 완전 연결 레이어가 있는 신경망의 완전 연결 레이어의 특징 차원과 일치하는지 확인하려면 입력 이미지에 대한 영역 자르기 및 크기 조정 작업이 필요합니다.
Scaling 및 Cropping 프로세스는 사진 특징 정보의 손실을 초래하여 감지 정확도를 낮추고 감지 결과에 영향을 미칩니다. 그러나 SPPNet은 사진 특징 정보 감지 정확도의 손실 및 감지 결과에 영향을 미치는 반면 SPPNet은 한계를 극복할 수 있습니다. 입력 이미지의 크기를 고정하여 계산 비용을 절약합니다. 21.

3. 향상된 YOLOv3
3.1. 향상된 YOLOv3 네트워크 구조
COCO 데이터세트 설명에 따르면 기본 특징 추출 네트워크는 일반적으로 다운샘플링 속도 2로 5번 다운샘플링되며, 5번 다운샘플링 다중도는 32의 2의 5승입니다.
다운샘플링을 계속하면 획득된 특징 맵은 1이 되며 대상 정보는 손실됩니다. 작은 타겟은 32×32픽셀보다 작고, 중간 타겟은 32×32~96×96픽셀, 거대 타겟은 96×96픽셀보다 크다[22].
그림 5에서 볼 수 있듯이, 본 연구에서 사용된 TT100K 교통표지판 데이터세트는 대부분 중소형 타겟으로 구성되어 있으며, 대형 타겟은 전체 데이터세트의 7.4%, 소형 타겟은 42.5%를 차지한다[23].

TT100K 데이터 세트는 고해상도를 가지며 각 이미지의 해상도는 2048 × 2048 픽셀이며 작은 대상 중 가장 큰 교통 표지판은 전체 이미지의 0.1% 미만을 차지하므로 대상에 심각한 도전 과제를 제기합니다. 탐지 알고리즘.
작은 타겟은 기능이 제한되어 있어 위치 파악 정확도가 높아야 합니다.
다중 규모 기능 융합을 활용하여 작은 대상 식별에 중요한 고유한 기능 레이어의 결과를 융합하여 예측을 생성하기 위해 YOLOv3에 FPN 구조를 도입했음에도 불구하고 결과는 여전히 만족스럽지 못했습니다.
YOLOv3 네트워크에서 얕은 레이어에는 기능 의미 정보가 적지만 정확한 대상 위치가 포함되어 있는 반면, 깊은 레이어에는 대략적인 대상 위치가 더 많이 포함되어 있습니다.
결과적으로 얕은 컨벌루션 레이어는 작은 목표를 예측하는 데 사용되며 깊은 컨벌루션 레이어는 큰 목표를 예측하는 데 사용됩니다. 크기가 152 × 152인 네 번째 특징 예측 척도가 YOLOv3 네트워크 구조의 세 가지 특징 예측 척도에 추가되어 네트워크의 얕은 특징을 완전히 활용하여 작은 목표를 예측합니다.
입력 이미지 크기가 608 × 608인 경우 입력 이미지의 컨볼루션 및 2배 업샘플링 후 출력 이미지 특징 크기는 152 × 152였으며 기능 레이어는 라우팅 레이어를 통해 유도되었습니다. 이 특징 추출은 11번째 레이어 특징과 융합되어 네 번째 특징 예측 규모를 늘렸습니다.
또한 SPPNet의 개념을 차용하여 YOLOv3와 결합하여 로컬 기능과 글로벌 기능의 병합을 구현하기 위해 SPP 모듈을 추가했습니다.
YOLO 탐지 계층 이전에는 다섯 번째와 여섯 번째 컨볼루션 계층 사이에 SPP 모듈이 통합되었으며, SPP 모듈의 특징 맵과 풀링된 특징 맵이 다시 연결되어 다음 탐지 네트워크 계층으로 전달되었습니다.

로컬 및 전역 기능의 기능 맵 수준 융합을 달성하려면 SPP 모듈의 최대 풀링 커널은 풀링할 기능 맵의 크기에 최대한 가까워야 합니다.
SPP 모듈로 인한 계산 노력을 최소화하고 특징 맵 표현 기능을 풍부하게 하며 탐지 영향을 높이기 위해 본 연구의 SPP 모듈은 두 개의 병렬 분기로 구성되었으며, 각 분기는 19×19 최대 풀링 레이어와 점프로 구성되었습니다. 연결. 그림 6은 향상된 YOLOv3 네트워크 구조를 보여줍니다.

3.2. 향상된 손실 함수
YOLOv3의 손실 함수는 중심 좌표 손실(lossy), 너비-높이 좌표 손실(loss), 신뢰 손실(lossconf) 및 분류 손실(losses)로 구성됩니다. 중심 좌표 손실은 다음과 같이 표현됩니다.

여기서 λcoord는 좌표 손실 가중치를 나타냅니다. λnoobj는 객체가 없는 신뢰 손실 가중치를 나타냅니다. Iobjij는 i번째 셀의 j번째 앵커 박스가 객체(1 또는 0)를 담당하는지 여부를 나타냅니다. Inobbyij는 객체를 담당하지 않는 i번째 그리드의 j번째 앵커 박스를 나타냅니다. (xi,yi,wji,hjI, CjI, Pji)는 예측된 대상 상자 좌표, 신뢰도 및 범주를 나타내고 (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji)는 실제 대상 상자 좌표, 신뢰도 및 범주를 나타냅니다.
YOLOv3 손실 함수는 식 (5)로 표현되는데, 여기서 MSE(평균 제곱 오류) 손실 함수는 경계 상자 회귀에 사용되고 교차 엔트로피는 lossconf 및 locals에서 손실 함수로 활용됩니다.
손실=lossxy + losswh − losscon f − losscls (5)
그러나 MSE를 경계 상자 회귀의 손실 함수로 활용하는 것은 작은 대상 탐지에 적합하지 않고 개체 규모에 민감하며 큰 규모의 대상에 집중하고 작은 규모의 개체에는 적합하지 않습니다.
본 논문에서는 경계 상자 크기가 너비 및 높이 손실 함수에 미치는 영향을 약화시켜 크고 작은 대상의 손실 균형을 맞추고 탐지 결과를 최대화하기 위해 본 논문에서는 IoU 유형의 손실 함수를 사용했으며, IoU에 의해 발생하는 메트릭 손실을 다음과 같이 사용했습니다. 성능 방정식 (6).
IoU =|A ∩ B||A ∪ B|(6)
경계 상자와 대상 상자가 겹치지 않는 경우 IoU=0는 두 상자 사이의 거리 차이를 반영하지 않습니다. 예측 상자와 레이블이 지정된 상자가 완전히 겹치면 IoU=1 경계 상자의 중심점을 결정할 수 없으며 대상 상자와의 크기 차이를 더 이상 최적화할 수 없습니다.
DIOU 손실[24]은 크기와 무관합니다. 따라서 큰 크기로 인해 큰 손실이 발생하지 않습니다. 작은 크기에서는 약간의 손실이 발생하므로 문제를 해결할 수 있으므로 이 작업에서는 DIOU 손실을 사용했으며 그 계산 공식은 식 (7)에 나와 있습니다.
D IoU 손실=1 − IoU +ρ2 b, bgt c2(7)
여기서 b와 bgt는 중심점을 나타내고, ρ는 유클리드 거리, c는 두 상자를 덮는 가장 작은 둘러싸는 상자의 대각선 길이입니다.
DIOU 손실은 두 대상 프레임 사이의 거리를 직접 최소화하고 빠르게 수렴하며 대상과 앵커 사이의 거리, 중첩 비율 및 스케일을 고려하여 대상 프레임 회귀를 더 많이 만드는 대상 프레임 회귀 메커니즘과 더 일치합니다. 안정적인 동시에 대상 프레임과 겹치지 않는 경계 상자에 대한 그라데이션 방향을 제공합니다.

For more information:1950477648nn@gmail.com






