세심한 다중 기능 네트워크를 이용한 새로운 시공간적 연속 수화 인식(1)

Jun 01, 2023

추상적인: 비디오 스트림이 주어지면 CSLR(지속적인 수화 인식)과 관련된 세그먼트화되지 않은 기호를 올바르게 감지하는 것을 목표로 합니다. 이 분야에서 제안하는 딥 러닝 방법의 증가에도 불구하고 대부분은 풀 프레임 이미지 또는 손과 얼굴의 세부 사항 중 하나인 RGB 기능만 사용하는 데 주로 초점을 맞추고 있습니다. CSLR 교육 프로세스에 대한 정보 부족은 비디오 입력 프레임을 사용하여 여러 기능을 학습하는 기능을 크게 제한합니다. 또한 비디오의 모든 프레임을 CSLR 작업에 활용하면 각 프레임에 노이즈 추론의 주요 기능을 포함하여 다양한 수준의 정보가 포함되어 있기 때문에 차선의 성능이 발생할 수 있습니다. 따라서 추가 키포인트 기능을 제공하여 CSLR을 향상시키기 위해 주의 깊은 다중 기능 네트워크를 사용한 새로운 시공간적 연속 수화 인식을 제안합니다. 또한 공간 및 시간 모듈의 주의 계층을 활용하여 여러 중요한 기능을 동시에 강조합니다. 두 CSLR 데이터셋의 실험 결과는 제안된 방법이 CSL 및 PHOENIX 데이터셋의 WER 점수에 대해 각각 0.76 및 20.56만큼 현재의 최신 방법과 비교하여 우수한 성능을 달성함을 보여줍니다.

Desert living cistanche

수퍼맨 허브 시스탄슈

키워드: 연속 수화; 공간; 일시적인; 다중 기능; 키 포인트; 자기주의

1. 소개

수화는 의사소통을 위해 소리 대신 손짓, 몸짓, 입술 움직임을 사용하는 수동 의사소통을 우선시합니다[1,2]. 일반적으로 수화는 청각 장애가 있는 사람이 사용하지만 소리를 들을 수 없거나 듣기 어려운 상황에서도 사용할 수 있습니다. 따라서 청각장애인과 그렇지 않은 사람을 연결해주는 수화인식(SLR) 시스템이 필요하다.

최근 몇 년 동안 연구원들은 SLR이 제공하는 풍부한 시각적 정보 때문에 많은 관심을 집중시켰습니다. 최근의 SLR 연구는 일반적으로 고립 수화 인식(ISLR) 또는 연속 수화 인식(CSLR)으로 그룹화됩니다. 몇몇 작업은 ISLR[3,4]만 다루는 반면 다른 작업은 알파벳 인식을 위한 정적 제스처와 같은 더 쉬운 작업만 분석합니다[5]. 한편, 최신 방법은 일반적으로 CSLR 작업을 해결하기 때문에 더 복잡합니다[6–8]. ISLR에 비해 CSLR은 문장의 재구성을 포함하므로 더 어려운 문제입니다.

Cistanche tea2

Cistanche 차

Cistanche deserticola 차 제품을 보려면 여기를 클릭하십시오.

【추가 문의】 이메일:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

CSLR 연구는 구현이 실제 세계의 일상적인 조건과 밀접하게 관련되어 있기 때문에 여전히 큰 수요가 있습니다. 이 접근 방식은 비디오 시리즈에서 명확한 세분화 없이 또는 전혀 세분화되지 않은 일련의 설명을 인식하는 것을 목표로 합니다. 또한 많은 기계 학습 연구와 인간 행동에 대한 철저한 이해를 통합합니다. 예를 들어, 그것은 인간의 움직임 추적[9], 제스처 인식[10], 얼굴 인식[11]을 포함합니다. 그럼에도 불구하고 CSLR 작업을 수행하는 데는 몇 가지 문제가 있습니다.

첫째, 데이터 수집 및 주석은 CSLR에 비용이 많이 듭니다[12]. 이것은 CSLR이 대규모 네트워크에 관련되어 있고 데이터 양이 성능에 큰 영향을 미치기 때문에 개발 과정에서 직면한 문제 중 하나일 것입니다[13]. 더욱이, 수화에 대해 사용 가능한 여러 데이터 세트에는 약하게 주석이 달려 있습니다[12,14,15]. 이 문제를 해결하기 위해 네트워크 아키텍처에 정렬 및 기능 추출기 모듈을 적용하는 것과 함께 약한 지도 방식을 사용한 많은 연구들이 있습니다[12].

둘째, ISLR에 비해 CSLR은 더 복잡합니다. 여러 기능을 사용하여 충분한 정보를 얻습니다. 이는 이전 작업[16–18]에서 보고된 단일 기능을 사용하는 것보다 더 나은 성능을 달성하는 것으로 입증되었습니다. 이러한 다중 특징은 가장 높은 정확도를 달성하는 신체 이미지인 주요 특징과 개별 수행에 대해 정확도가 낮은 포즈, 머리, 왼손, 오른손과 같은 추가 특징으로 구성됩니다[17,18]. 많은 양의 데이터로 대규모 네트워크를 교육하는 것은 시간이 많이 걸립니다[13]. 입력 스트림을 추가하면 교육 시간이 늘어나지만 추가 이미지 기반 기능을 사용하면 비용이 증가합니다[19]. 따라서 효율적으로 학습할 수 있도록 중요한 기능을 선택해야 합니다.

Cistanche deserticola slice (1)

중국 허브 시탕슈

셋째, 비디오 입력은 시퀀스에 많은 수의 이미지가 있습니다. 일부 이미지는 빠른 움직임으로 인해 손 모양이 명확하지 않아 잘못된 정보로 이어질 수 있습니다. 따라서 제안하는 모델은 [20]에 기반한 self-attention을 활용하여 중요한 정보를 선택하는데 도움을 준다. 또한 [21,22]에 의해 입증된 self-attention은 성능 향상에 영향을 미칩니다.

따라서 모든 문제를 처리하기 위해 새로운 STAMF(시공간 주의 다중 기능)라는 새로운 모델을 제안합니다. 약한 주석 문제가 있는 CSLR에서 작동하는 것으로 입증된 이전 작업[17,23]을 따랐습니다. 세 가지 주요 구성 요소를 사용하여 모델을 구성합니다. 첫 번째는 공간 모듈, 두 번째는 시간 모듈, 세 번째는 시퀀스 학습 모듈입니다. CSLR 작업을 수행하기 위해 키포인트 기능과 함께 전체 프레임 기능을 사용하여 효율적이고 효과적인 다중 기능 입력을 제안합니다. 풀프레임 특징은 신체 이미지를 주특징으로, 키포인트 특징을 부가특징으로 표현한다. 손 포즈의 디테일을 비롯한 바디 포즈가 포인트. 이 바디 포즈는 일부 작품에서 풀프레임 기능 다음으로 가장 높은 정확도를 달성하는 것으로 입증되었기 때문에 가장 효과적인 추가 기능입니다[17,18]. 우리는 또한 [20]을 기반으로 self-attention을 사용하는 Attention 모듈을 활용하여 중요한 기능을 캡처하고 성능 향상을 위한 시퀀스 학습을 돕습니다.

이 원고의 기여는 다음과 같이 요약됩니다. • 우리는 최종 출력에 기여하는 중요한 시점을 캡처하기 위해 시퀀스 모듈에 새로운 시간 주의를 도입합니다. • 프레임의 RGB 값부터 풀프레임 기능을 주요 기능으로 구성하고 모델 인식 성능을 향상시키기 위해 추가 기능으로 손 모양 디테일이 있는 바디 포즈를 포함하는 키포인트 기능으로 구성된 멀티 기능을 도입합니다. • WER 메트릭을 사용하여 실험을 통해 제안된 STAMF 모델이 두 CSLR 벤치마크 데이터 세트 모두에서 최첨단 모델보다 성능이 우수함을 보여줍니다.

cistanche—Improve memory4

me-Improve Memory 근처의 Cistanche 보충제

2. 관련 저작물

기술에 몇 가지 발전이 있었고 SLR에 대한 많은 연구가 수행되었습니다. 이전 연구[24–27]는 각 단어에 대한 분할이 있는 ISLR을 사용할 가능성을 탐색했습니다. 최근 몇 년 동안 강력한 시각적 표현을 위해 2D[28,29] 또는 3D[30,31]의 컨볼루션 네트워크를 사용하여 특징을 추출하는 데 딥 러닝 기반 방법이 사용되었습니다. 수화 인식에 대한 초기 연구의 대부분은 더 나은 성능을 제공하는 RGB, 깊이 맵 및 스켈레톤과 같은 다중 모드 특성[30-32]을 가진 ISLR을 중심으로 이루어졌습니다.

요즘에는 CSLR이 각 단어 사이에 명확하게 구분되지는 않았지만 더욱 대중화되었습니다. 초기 작업에서는 시퀀스 대상을 구축하기 위해 CNN 기능 추출기[6,33]와 HMM[34]을 사용했습니다. CSLR 시스템에 대한 최근 연구[17,23]에는 문제 인식 작업을 수행하는 세 가지 주요 단계가 포함되어 있습니다. 먼저 공간적 특징 추출, 시간적 분할, 마지막으로 언어 모델로 문장 합성[35]을 하거나 시퀀스 학습[17,23]을 사용했다. 이 시퀀스 학습은 Bi-LSTM 및 CTC를 사용하여 비디오 시퀀스에서 기호 광택 간의 관계를 조사했습니다. 기호 글로스를 정의하기 위해 세그먼트화되지 않은 비디오 시퀀스가 ​​있는 약한 주석을 사용하지만 이러한 접근 방식은 유망한 결과를 보여주었습니다.

그러나 다중 기능 접근 방식을 구현한 가장 최근의 관련 CLSR 연구[17]는 5개의 기능을 동시에 사용했습니다. 다중 기능 접근 방식은 적은 수의 기능을 사용하는 것보다 무겁습니다[19]. 이 접근 방식은 또한 빠른 움직임으로 인해 흐릿한 손 모양과 같이 불분명한 정보가 있는 비디오 시퀀스의 노이즈 프레임을 처리할 수 없습니다. 또한 RNN 기반 시퀀스 학습에 의존하면 긴 시퀀스에서 문제가 발생할 수 있으며 전역 컨텍스트를 잃을 수 있습니다[20].

cistanche—Improve memory3

me-Improve Memory 근처의 Cistanche 보충제

현재 연구는 글로벌 컨텍스트를 학습하기 위해 더 긴 시퀀스를 처리할 수 있는 self-attention 메커니즘[21,22]을 추가하여 성능을 향상시키는 것을 목표로 합니다. Self-attention은 self-attention이 긴 종속성을 처리할 수 있다는 이점이 있음을 보여준 초기 연구[20]를 기반으로 합니다. 그러나 이 self-attention은 의존성이 긴 긴 경로에 비해 짧은 경로를 학습하는 것이 더 쉽습니다. 이전 CLSR 작업[21,22]에서 self-attention은 네트워크가 기능을 보다 효과적으로 학습하는 데 도움이 될 수 있습니다.

따라서 본 논문에서는 새로운 시공간 주의 다중 기능 모델을 소개한다. 본 제안 모델은 multi-feature에서 self-attention 메커니즘을 사용하여 중요한 정보를 제공함으로써 효과적으로 중요한 특징을 추출하고 시퀀스를 더 잘 학습합니다. 모든 프로세스는 종단 간 접근 방식으로 실행됩니다.

3. 제안 방법

이 섹션에서는 CSLR에 대해 제안된 모델의 핵심 기술에 대해 자세히 설명합니다. 따라서 제안된 모델의 개요를 설명하는 것으로 이 섹션을 시작합니다. 또한 공간 모듈, 시간 모듈 및 시퀀스 학습 모듈을 포함하여 각 주요 구성 요소에 대한 자세한 내용을 제공합니다. 또한 모델이 더 잘 학습할 수 있도록 제안된 어텐션 모듈에 대해서도 설명합니다. 마지막으로 훈련 및 추론을 위한 프레임워크를 제안된 모델에 통합할 수 있습니다.

3.1. 프레임워크 개요

비디오 입력이 주어지면 우리가 제안하는 모델은 해당 부호를 올바른 글로스 문장으로 예측하는 것을 목표로 합니다. 첫 번째 모듈은 비디오의 각 T 프레임에 대한 전체 프레임 및 키포인트 기능과 같은 여러 공간 기능을 생성합니다. 그런 다음 시간 모듈을 사용하면 두 스트림에 대한 프레임 사이의 공간적 특징의 시간적 상관 관계를 추출할 수 있습니다. 마지막 단계로 공간 및 시간 네트워크는 시퀀스 학습 및 추론을 위해 양방향 장단기 메모리(Bi-LSTM) 및 CTC에 연결되었습니다. 다음으로 주요 구성 요소에 대해 보다 자세하고 순차적으로 설명합니다. 제안된 아키텍처의 개요는 그림 1에 나와 있습니다.

Figure 1


그림 1. 제안하는 방법의 전체 구조는 공간 모듈, 시간 모듈 및 시퀀스 학습 모듈의 세 가지 구성 요소로 구성됩니다. 공간 모듈은 먼저 이미지 시퀀스를 가져와 프레임별 특징을 추출한 다음 시간 모듈을 적용하여 시간 특징을 추출합니다. 그런 다음 시간적 특징을 시퀀스 학습 모듈로 보내어 단어 예측을 수행하고 문장으로 구성합니다.

3.2. 공간 모듈

공간 모듈은 그림 2와 같이 전체 프레임 기능과 키포인트 기능을 활용합니다. 이 모듈은 2D-CNN 네트워크 아키텍처를 백본으로 사용하고 다중 기능을 캡처하기 위해 ResNet50을 선택했습니다. ResNet50은 최근의 ResNet 아키텍처에 비해 사용 시간 측면에서 더 효과적이면서 비교 가능한 결과를 가집니다[36,37]. RGB는 ResNet50을 직접 사용하는 반면 키포인트는 비디오 프레임에서 HRNet[38]에 의해 획득되고 키포인트 특징을 얻기 위해 ResNet50을 사용하여 추출됩니다.

Figure 2


그림 2. 공간 모듈 아키텍처는 다중 스트림 입력을 사용합니다. RGB 스트림은 전체 프레임 기능으로, 키포인트는 키포인트 기능으로 스트리밍됩니다.

3.2.1. 풀프레임 기능

전처리 단계를 RGB 데이터에 적용한 다음 데이터를 모델에 입력했습니다. 그런 다음 이를 아키텍처에 풀프레임 입력으로 넣습니다. 그림 3은 왼쪽에 있는 원본 RGB 이미지와 오른쪽에 잘린 이미지의 그림을 보여줍니다. 자른 이미지는 모델의 입력으로 사용됩니다. 이것은 이미지의 덜 중요한 부분을 줄이고 서명자에게 더 많은 초점을 두는 전처리 단계를 보여줍니다. 이 자르기는 [12]의 무작위 자르기 방법을 사용하여 데이터 세트를 보강합니다. 전체 프레임 기능은 ResNet50을 사용하여 시퀀스의 각 프레임에 대해 자른 이미지에서 추출됩니다.

Figure 3


그림 3. RGB 이미지를 사용한 풀프레임 특성, (왼쪽 이미지)는 원본 이미지, (오른쪽 이미지)는 제안된 모델로 조정하기 위해 잘라낸 이미지

3.2.2. 주요 기능

비디오 입력의 각 프레임에 대한 데이터 RGB에서 공간 모듈의 키포인트 특징을 추출했습니다. 키포인트 기능의 품질은 제안된 모델에서 중요한 역할을 하므로 HRNet[38]과 같은 강력한 접근 방식을 사용해야 합니다. 우리는 사전 훈련된 HRNet[38]을 사용하여 133개의 신체 키 포인트를 모두 추정하고 그 결과에서 133개의 키 포인트 중 27개를 활용했습니다. 그림 4에서와 같이 왼쪽은 원래의 상체 요점이고 오른쪽은 선택된 27개의 상체 요점입니다. 이 27개의 핵심 포인트에는 손목, 팔꿈치, 어깨, 목, 손 및 손가락이 포함됩니다.

Figure 4


Figure 4. PHOENIX-RWTH 데이터셋의 Keypoint 특징 [33,39], (왼쪽 이미지) RGB 이미지에서 추출, (오른쪽 이미지)는 제안된 모델에서 사용하는 선택된 키포인트이다.

3.3. 시간 모듈

시간 모듈은 공간 모듈로부터 시공간 정보를 학습하는 것을 목표로 합니다. 임시 모듈은 각 스트림에 대해 누적된 임시 풀링으로 구성됩니다. 그림 5에서 볼 수 있듯이 Temporal pooling 모듈은 temporal convolution layer와 pooling layer로 구성되어 순차적 입력에서 특징을 추출합니다.

Figure 5.


그림 5. 시간 모듈 아키텍처는 쌓인 1D-CNN과 어텐션 모듈이 포함된 풀링 레이어로 구성됩니다. 쌓인 레이어의 끝에서 연결된 두 기능 스트림에 대해 병렬로 작업하고 시퀀스 길이가 4배 더 작은 단일 시간 기능을 생성합니다.

입력은 이전 단계의 공간 다중 기능 목록입니다. 시간적 특징은 입력 길이와 출력 길이가 같은 단일 1D 컨볼루션 레이어인 시간적 컨볼루션 레이어와 크기를 절반으로 줄이는 단일 풀링 레이어를 사용하여 얻습니다. 이전 연구[12]에 따르면 이 두 개의 적층된 시간적 풀링 레이어를 사용하는 것이 가장 좋은 구성입니다. 각 시간적 풀링 후에 우리는 섹션 3.4에서 자세히 설명할 어텐션 모듈을 내장합니다. 결국 두 스트림의 임시 풀링 출력을 연결합니다.

3.4. 주의 모듈

비디오에는 이미지의 일부가 때때로 흐릿한 여러 프레임이 있습니다. RTWH-PHOENIX 데이터셋[33,39]은 CSL 데이터셋[8,40,41]보다 결함이 있는 프레임이 더 많습니다. 움직임이 너무 빨라서 흐릿한 이미지가 생성되어 키포인트 위치가 잘못되었을 때 이런 일이 발생합니다. 이 프레임은 결함이 있는 것으로 간주되며 잠재적으로 RGB 및 키포인트 기능 모두를 잘못 해석할 수 있습니다. 그림 6은 RTWH-PHOENIX 데이터 세트[33]의 결함 프레임 그림을 보여줍니다. 이 문제를 해결하기 위해 주의 레이어를 추가했습니다.

Figure 6


그림 6. RWTH-PHOENIX 데이터세트의 결함 프레임 그림[33,39]. 흐릿한 이미지로 인해 손 영역의 일부 키 포인트가 잘못된 위치에 있습니다.

CTC 알고리즘을 사용하면 공백 레이블을 사용하고 반복 레이블을 제거하여 레이블 지정과 함께 경로 정렬이 수행됩니다. CTC는 광택 경계를 구별할 수 없는 경우 광택 경계보다 공백 레이블을 예측하는 것을 선호하지만 어떤 결과도 설득력이 없습니다. 이로 인해 네트워크는 CTC를 사용하여 분석, 학습 및 예측할 때 결과에 ​​스파이크를 생성합니다[42,43]. 일반적으로 CTC 손실은 키프레임을 찾고 마지막 결과는 공백 레이블 또는 공백이 아닌 레이블일 확률이 높은 특정 키프레임의 예측입니다. 광택이 동일한 레이블 또는 빈 레이블을 연속적으로 예측하면 동일한 출력이 생성됩니다. 그러나 같은 라벨 사이에 삽입 라벨이 있으면 단 한 번의 실수라도 훨씬 더 큰 손실이 발생합니다. 여기서 어텐션 레이어를 추가하면 순차적 학습에 사용되기 전에 중요한 시간적 시퀀스를 선택하는 데 도움이 됩니다.

어텐션 모듈은 멀티 헤드 셀프 어텐션 메커니즘을 사용합니다[20]. 다중 헤드 모듈은 동시에 여러 병렬 어텐션 메커니즘을 실행하는 데 사용됩니다. 다중 헤드 어텐션은 별도의 헤드에서 단기 의존성 또는 장기 의존성에 집중하기 위해 독립적으로 실행됩니다. 그런 다음 각 출력은 선형으로 연결되어 원하는 모양으로 변환됩니다.

동시에 multi-head self-attention 메커니즘은 관찰 기록에 따라 여러 표현 하위 공간의 정보를 처리합니다. 단순화를 위해 입력 시퀀스를 X로 표시합니다. 수학적으로 단일 헤드 어텐션 모델의 경우 입력 X t − T + 1:t=[X t − T + 1, · · ·, X t ] ∈ RT × N × P에서 세 개의 부분 공간, 즉 쿼리 부분 공간 Q ∈ RN ×dq, 키 부분 공간 K ∈ RN × dk 및 값 부분 공간 V ∈ RN × dv를 구합니다. 잠재 부분 공간 학습 프로세스는 다음과 같이 공식화할 수 있습니다.

Q=XWQ, K=XWK , V=XWV ,

그런 다음 스케일링된 내적 어텐션을 사용하여 어텐션 출력을 [20]으로 계산합니다.

주의(Q, K, V)=so f tmaxQKT/ p dkV,

또한 입력의 여러 표현을 동시에 따르는 여러 헤드가 있는 경우 동시에 더 관련성 높은 결과를 얻을 수 있습니다. 마지막 단계는 모든 헤드를 연결하고 다시 투영하여 최종 점수를 계산하는 것입니다[20].

MultiHead(Q,K,V)=Concat(head1,... , heads )WO,

머리=주의(Qi,Ki,Vi),

여기서 Qi=XWQ i , Ki=XWVi 및 WO ∈ R hd × dmodel입니다. 마지막으로 시퀀스의 모든 정보가 중요하지 않기 때문에 피처 시퀀스에서 중요한 부분을 선택할 수 있습니다.

그림 7에 표시된 것처럼 여러 구성에서 어텐션 모듈을 사용합니다. 첫 번째 주의 모듈은 공간 모듈의 끝에 배치되고 두 번째 및 세 번째 주의 모듈은 시간 모듈에 배치됩니다. 초기 시간 모듈이라고 하는 두 번째 주의 모듈은 입력으로 시간 풀링의 첫 번째 블록 뒤에 배치되는 반면, 후기 시간 주의 모듈이라고 하는 세 번째 시간 주의 모듈은 시간 풀링의 두 번째 블록 뒤에 배치됩니다.

Figure 7

그림 7. 주의 모듈은 서로 다른 구성의 공간 및 시간 모듈에 내장되어 있습니다..

당신은 또한 좋아할지도 모릅니다