야생에서 보행 인식을 위한 자가 감독 비전 변환기 탐색 1부

Nov 24, 2023

추상적인:

걷는 방식(보행)은 고유한 지문 채취 방법으로 사용되는 강력한 생체 인식 방식으로, 피험자의 협조 없이 멀리서 눈에 띄지 않는 행동 분석을 수행할 수 있습니다.

운동이 건강에 도움이 된다는 것은 모두가 알고 있는 사실입니다. 이 외에도 운동은 기억력 향상에도 도움이 됩니다. 걷기는 가장 간단하고 쉽게 실천할 수 있는 운동으로, 많은 사람들이 걷기나 조깅을 하면서 휴식을 즐긴다. 이제 더 많은 연구에 따르면 걷기가 뇌에 강력한 영향을 미치는 것으로 나타났습니다.

첫째, 걷기는 뇌의 신경계를 자극해 뇌 기능을 강화하는 데 도움이 된다. 몸이 움직이면 심박수와 혈류가 증가하고, 이는 또한 뇌를 자극하여 더 많은 뉴런과 시냅스를 생성합니다. 이러한 뉴런과 시냅스 사이의 연결은 새로운 신경 네트워크와 더 빠른 사고 과정을 생성할 수 있습니다.

둘째, 걷기는 스트레스와 불안을 해소할 수 있어 기억력 향상에 매우 중요합니다. 마음과 몸이 긴장, 우울, 불안 상태에 있을 때 뇌에서는 코르티솔이라는 호르몬이 분비됩니다. 코티솔은 뇌의 뉴런과 시냅스를 손상시켜 기억 상실로 이어질 수 있습니다. 걷기는 스트레스와 불안을 완화하고 신체의 코티솔 생성을 감소시키며 건강한 뉴런과 시냅스를 유지하는 데 도움이 됩니다.

마지막으로, 걷기는 뇌로의 혈액 순환을 증가시킵니다. 일부 연구에 따르면 혈액 순환이 좋아지면 기억력 향상에 도움이 될 수 있습니다. 나이가 들수록 뇌혈관이 점차 막히게 되어 뇌에 산소 공급이 부족해지게 됩니다. 걷기는 심장의 건강을 향상시켜 심장이 뇌에 산소와 영양분을 보다 효과적으로 전달하게 하여 기억력과 뇌 기능을 향상시킵니다.

그러므로 걷기는 남녀노소 모두에게 훌륭한 운동 형태입니다. 걷기는 신체 건강을 향상시키는 것 외에도 기억력 향상에도 도움이 될 수 있습니다. 우리 자신을 더 건강하고 더 좋게 만들기 위해 매일 먼 거리를 걷자! 기억력 향상이 필요함을 알 수 있는데, 시스탄체 데저티콜라는 기억력 향상이라는 독특한 효능이 많은 중국 전통 약재이기 때문에 기억력을 크게 향상시킬 수 있습니다. 다진 고기의 효능은 산, 다당류, 플라보노이드 등 포함된 다양한 활성 성분에서 비롯됩니다. 이러한 성분은 다양한 방식으로 뇌 건강을 증진할 수 있습니다.

improve memory

기억력을 향상시키는 10가지 방법을 알아보세요

보다 전통적인 생체 인식 인증 방법과 달리 보행 분석은 피험자의 명시적인 협력이 필요하지 않으며 피험자의 얼굴이 가리거나 보이지 않도록 요구하지 않고 저해상도 설정에서 수행할 수 있습니다. 대부분의 최신 접근 방식은 인식 및 분류를 위한 신경 아키텍처 개발을 지원하는 깨끗하고 표준적인 주석 데이터를 사용하여 통제된 환경에서 개발되었습니다.

최근에야 보행 분석이 자체 감독 방식으로 사전 훈련된 네트워크에 보다 다양하고 대규모이며 현실적인 데이터 세트를 사용하는 모험을 시작했습니다. 자가 감독 훈련 방식을 사용하면 값비싼 수동 주석 없이 다양하고 강력한 보행 표현을 학습할 수 있습니다. 컴퓨터 비전을 포함한 딥 러닝의 모든 영역에서 변환기 모델의 유비쿼터스 사용에 힘입어 이 작업에서는 자기 감독 보행 인식에 직접 적용되는 다양한 비전 변환기 아키텍처의 사용을 탐구합니다.

우리는 GREW 및 DenseGait라는 두 가지 대규모 보행 데이터 세트에서 간단한 ViT, CaiT, CrossFormer, Token2Token 및 TwinsSVT를 조정하고 재교육합니다. 우리는 두 개의 벤치마크 보행 인식 데이터 세트인 CASIA-B와 FVG에 대한 제로 샷 및 미세 조정에 대한 광범위한 결과를 제공하고 시각 변환기에서 사용되는 공간적 및 시간적 보행 정보의 양 사이의 관계를 탐색합니다.

우리의 결과는 모션 처리를 위한 변압기 모델을 설계하는 데 이전의 전체 골격 접근 방식보다 더 미세한 움직임 박람회에 대한 계층적 접근 방식(예: CrossFormer 모델)이 비교적 더 우수하다는 것을 보여줍니다.

키워드:

보행인식; 생체인증; 비전 트랜스포머; 포즈 추정; 자기주도 학습; 대조 학습.

1. 소개

우리가 움직이는 방식에는 우리 자신에 대한 중요한 단서가 포함되어 있습니다. 특히 우리의 보행(걷는 방식)은 의학[1], 심리학[2], 스포츠과학[3]에서 긴밀하게 연구되어 왔습니다. 최근 딥 러닝의 기하급수적인 발전과 컴퓨팅 하드웨어의 광범위한 가용성과 동시에 보행 분석이 컴퓨터 과학계로부터 주목을 받고 있습니다[4,5].

AI 기반 보행 분석 시스템은 외관 단서를 사용하지 않고도 대상을 성공적으로 인식하고[6-10], 성별 및 연령과 같은 인구통계를 추정하고, 의복과 같은 외부 속성을 추정[12]할 수 있었습니다. 근골격 구조, 유전적, 환경적 요인, 보행자의 감정 상태와 성격의 차이로 인해 보행에 개인차가 크다는 점을 고려하면 이러한 결과는 놀라운 일이 아닙니다[13].

현재 시스템은 실제로 통제된 실내 환경에서만 훈련되고 테스트됩니다. 대부분의 방법은 CASIA-B 데이터세트[6]를 보행 인식 모델의 표준 벤치마크로 사용하며, 여기에는 여러 대의 카메라로 캡처된 엄격하게 통제된 방식으로 실내를 걷고 있는 124명의 피험자가 포함되어 있습니다. 현실 세계의 복잡성은 이러한 제한적인 시나리오로는 완벽하게 모델링할 수 없습니다. 최근에는 DenseGait [12], GREW [7] 및 Gait3D [14]와 같은 데이터 세트를 사용하여 "야생" 보행 모델링에 초점이 맞춰졌습니다.

short term memory how to improve

깨끗하고 주석이 완전히 달린 대규모 데이터 세트를 수집하는 것은 재정적 자원과 할당된 시간 측면에서 엄청난 노력을 의미합니다. GREW 데이터세트[7]를 수집하고 주석을 추가하는 데 3개월의 지속적인 작업이 소요된 것으로 알려졌습니다. 이러한 접근 방식은 보행 처리를 위한 신경 아키텍처를 개발하는 데 유용했지만[8,9], 보다 편안한 실제 환경에서 적절하게 사용할 수 있을 만큼 충분히 다양하지는 않습니다.

AI 커뮤니티는 비전[15]과 언어[16] 모두에 대한 자기 지도 학습 방법이 상당한 견인력을 얻고 종종 전통적인 지도 방법을 능가하는 등 다른 영역에서 이러한 접근 방식에서 서서히 벗어나고 있습니다. 최근 자기 지도 학습의 발전에 따르면 자기 지도 모델은 훈련 중에 명시적으로 정의되지 않은 더 강력하고 새로운 행동을 보이는 것으로 나타났습니다.

예를 들어, 자기 감독 방식으로 훈련된 비전 변환기인 DINO[17]는 훈련 중에 그러한 레이블을 사용하지 않고 감독되지 않은 객체 분할을 가능하게 하는 클래스별 기능을 학습했습니다. Cosma와 Radoi[10]는 DenseGait[12]의 더 작은 버전에서 ST-GCN[18]을 훈련하여 보행 분석을 위한 자기 지도 학습을 위한 최초의 대조 방법을 제안했습니다. 그들의 방법은 다운스트림 보행 인식 작업에서 합리적인 결과를 얻었으며 사전 훈련된 데이터 세트 크기와 제로샷 전송 성능 사이에 강한 상관관계가 있음을 보여주었습니다.

보행 분석을 위한 많은 접근 방식이 배경 차감에서 추출된 실루엣을 활용해 왔지만[6,8,9], 실제 감시 시나리오에서 실루엣을 추출하려면 인스턴스 분할[19]과 같은 더 발전된 기술을 사용해야 하며 계산 비용이 많이 듭니다. 일련의 실루엣은 상당한 저장 공간을 차지하며 활동 인식과 같은 다른 인접 작업에 사용할 만큼 유연성이 충분하지 않습니다. 더욱이 실루엣은 미묘한 외양 단서를 인코딩하므로 식별에 움직임이 어느 정도 활용되는지 불분명해집니다[20].

반면에 2D 자세 추정 모델은 점점 더 정확해지고 계산 효율성이 높아졌습니다[21,22]. 뼈대는 추출 비용이 저렴하고 현재는 특히 원거리에서 3D 메시 및 3D 포즈보다 더 안정적입니다. 게다가 2D 뼈대는 장기 보관 측면에서 실루엣보다 훨씬 가볍습니다.

뼈대의 순서를 처리하기 위한 현재 아키텍처는 인간 뼈대에 존재하는 자연공간 그래프 구조를 활용하여 모델 설계에 귀납적 편향을 도입합니다. 인기 있는 ST-GCN[18] 및 MS-G3D[23]와 같은 모델은 골격 기반 동작 인식에 대해 인상적인 결과를 보였습니다.

동시에, 자연어 처리에 대한 초기 적용 이후 딥 러닝의 거의 모든 영역에서 변환기 모델의 사용이 폭발적으로 증가했습니다.

변압기는 유도성 바이어스가 거의 없는 보다 일반적인 아키텍처로 간주됩니다. 처음에 Transformer는 이미지 분류를 위해 CNN 모델을 일치시키는 데 어려움을 겪었지만[24], 현재 다른 모델을 능가하고 자기 감독 시나리오에서 유망한 결과를 보여주고 있습니다. 다른 유형의 아키텍처보다 Transformer는 인상적인 학습 능력과 자기 하에서 창발적인 행동을 보여주었습니다. -감독 [17].

Cosma와 Radoi[12]는 개별 골격을 입력 "패치"로 활용하고 공간적 주의 관계를 무시하고 본질적으로 시간적 주의만 수행하는 보행 인식을 위한 비전 변환기 인코더 모델을 직접 적용한 GaitFormer를 처음으로 제안했습니다.

GaitFormer는 자체 감독 방식으로 훈련되었으며 미세 조정 없이도 다른 보행 인식 방법을 능가했습니다. 이러한 이전 작업은 보행 분석을 위한 변환기 아키텍처의 잠재적 적용에 대한 보다 심층적인 연구를 위한 길을 열어줍니다. 비전 변환기 모델을 골격 보행 표현의 자가 지도 학습에 적용할 수 있습니까?

비전 변환기의 주요 아키텍처 문제는 로컬 정보와 글로벌 정보를 정의하는 이미지 패치 간의 적절한 관계를 정의하는 것입니다. 보행에 적용할 때 패치 크기의 선택은 뼈대 시퀀스의 인코딩된 시간적 및 공간적 정보의 양에 해당합니다.

이 연구에서는 보행 인식에 적합한 다섯 가지 비전 변환기에 대한 광범위한 연구를 제시합니다. 우리는 고전적인 ViT 모델 [24], CaiT [25], CrossFormer [26], TwinsSVT [27] 및 토큰 간 ViT [28]를 탐색합니다.

ways to improve memory

각 아키텍처는 2D 보행 골격 시퀀스의 두 가지 대규모 "야생" 데이터세트인 DenseGait(원시 감시 스트림에서 자동으로 수집된 데이터세트)과 깨끗한 인간 주석이 포함된 소규모 데이터세트인 GREW에 대해 대조적인 자체 감독 방식으로 개별적으로 훈련됩니다.

보행 인식을 위해 두 개의 제어된 데이터세트인 CASIA[6] 및 FVG[29]에 대한 전송 기능을 탐색합니다. 각 데이터 세트에 대해 점진적으로 더 큰 데이터 세트 하위 세트를 사용하여 훈련하여 미세 조정 중 직접(제로샷) 전송 및 데이터 효율성을 분석합니다. 또한 SimpleViT 및 CaiT의 패치 크기에 대한 공간 차원과 시간 차원 간의 관계에 대한 절제 연구를 수행합니다. , 현재까지 대부분의 비전 변환기의 표준 백본입니다.

나머지 논문은 다음과 같이 구성된다. 보행 인식 모델 및 비전 변환기에 관한 관련 작업에 대한 높은 수준의 개요를 수행합니다. 우리는 보행 표현 모델이 자기 감독 훈련에서 더 강력하고 일반적인 임베딩을 갖기 위해 큰 이점을 얻었으며 변환기 모델은 자기 감독 훈련 체제에서 뛰어난 모델링 용량을 보여주었다는 것을 관찰했습니다.

또한 우리는 비전 변환기가 뼈대 시퀀스에서 원활하게 작동해야 하는 것과 같이 수행해야 하는 데이터 전처리 및 뼈대 변환을 벤치마킹하고 설명하는 5가지 아키텍처를 수학적으로 설명합니다. 또한 데이터 확대, 훈련 및 벤치마킹 데이터세트, 실험 설정에 대해서도 설명합니다.

우리는 5개 아키텍처 각각과 2개의 '실제 사전 훈련' 데이터 세트에 대한 CASIA-B 및 FVG에 대한 결과를 보여줍니다. 마지막으로 공간적 패치 크기와 시간적 패치 크기 사이의 관계에 대한 절제 연구를 수행하고 결과에 대한 간략한 논의를 제공합니다. 우리는 투명성과 재현성을 위해 소스 코드를 GitHub(https://github.com/cosmaadrian/gait-vit, 2023년 2월 28일 액세스)에서 공개적으로 제공합니다.

2. 관련 업무

이 섹션에서는 통제된 환경과 "야생"에서 보행 인식을 위한 기존 방법에 대해 간략하게 설명합니다. 또한, 변압기 모델의 개발, 특히 비전 영역에서의 적용에 대해 설명합니다.

2.1. 보행 인식

얼굴 기반 식별과 유사하게 보행 인식은 측정법 학습에 의존합니다. 단일 이미지(예: 얼굴 인식)에 의존하고 광범위한 협력(예: 홍채 기반 생체 인증)이 필요한 기존 생체 인증 방법과 달리 보행 특징은 일련의 모션 스냅샷으로 처리됩니다. 이러한 제스처 역학은 가장 유익한 하위 시퀀스를 결정하는 데 더 많은 복잡성을 요구하지만 멀리서 눈에 띄지 않는 인증을 사용할 수 있습니다.

이러한 맥락에서 작업은 걷기 시퀀스를 임베딩 유사성이 보행의 유사성에 해당하는 임베딩 공간에 매핑하도록 인코더 네트워크를 훈련하는 것을 의미합니다. 동일한 사람의 걷기에 대한 임베딩은 임베딩 공간에 가까워야 하고, 다른 신원에서 온 사람들은 더 멀리 떨어져 있어야 합니다. 이 임베딩 공간에서는 보행 시퀀스의 임베딩을 얻고 최근접 이웃을 활용하여 추론을 할 수 있습니다. 알려진 걷기 데이터베이스에 접근합니다.

보행 기반 인식의 현재 접근 방식은 모양 기반[8,9]과 모델 기반[10,12,30]의 두 가지 범주로 나뉩니다. 모양 기반 방법은 먼저 각 비디오 프레임에서 배경 빼기 또는 분할 알고리즘을 사용하여 걷는 피사체의 실루엣을 얻습니다.

그런 다음 일련의 실루엣이 CNN 기반 아키텍처에 입력되어 인식을 위한 최종 임베딩으로 집계되는 공간적, 시간적 특징을 추출합니다. 모델 기반 접근 방식은 자세 추정 모델을 사용하여 RGB 비디오에서 골격을 추출합니다[21,22]. 골격 시퀀스는 일반적으로 보행 임베딩을 얻기 위해 그래프 컨볼루션[10,30]에 의존하는 모델에 의해 처리됩니다.

Chao 등의 연구인 GaitSet. [8]은 보행을 순서 없는 실루엣 세트로 간주합니다. 저자는 이 표현이 프레임의 다양한 배열이나 다중 보행 방향과 변형의 조합에 강력하기 때문에 실루엣 시퀀스보다 더 유연하다고 주장합니다. 그들은 각 실루엣에 대해 컨볼루션 레이어를 활용하여 이미지 수준 기능을 얻고 이를 Set Pooling을 통해 세트 수준 기능으로 결합합니다. 그들은 HorizonPyramid Matching [31] 버전을 사용하여 최종 출력을 얻습니다.

팬 외. [9]은 인간의 실루엣의 특정 부분이 각각 고유한 패턴을 가지고 있기 때문에 시공간적 표현을 가져야 한다는 사실에 주목했습니다. 그들의 아키텍처인 GaitPart는 더 제한된 수용 필드를 가진 특수한 유형의 컨볼루션인 초점 컨볼루션 레이어(FConvs)를 활용합니다. 저자는 FConv가 움직이는 신체의 다양한 부분에 대해 보다 세밀한 특징을 학습하는 데 아키텍처를 지원한다고 주장합니다. 또한 작은 시간 시퀀스의 특징을 추출하는 데 사용되는 마이크로 모션 캡처 모듈을 소개합니다.

Teepeet al. [30]은 골격 시퀀스에서 얻은 시공간 특징을 인코딩하기 위해 ResGCN [32]이라는 적응된 그래프 컨볼루셔널 네트워크를 활용하는 GaitGraph를 제안합니다. Li et al. [33]은 걷기의 가장 중요한 단계에 대한 분석을 기반으로 하나의 보행주기에서 여러 시간적 특징을 집계하는 구조인 PTP를 제안합니다.

또한 PTP와 함께 작동하는 공간 특징 추출을 위해 그래프 컨벌루션 네트워크를 활용합니다. 저자는 보다 현실적인 주기에서 여러 속도를 갖도록 보행을 수정하는 새로운 데이터 증대 방법을 소개합니다.

그러나 이전 연구와 달리 우리는 자기 감독 시나리오에서 보행 인식 아키텍처의 성능을 탐색하는 것을 목표로 하고 있습니다. 컴퓨터 비전 영역의 엄청난 발전에 영감을 받아 이미지 대신 뼈대 시퀀스에서 작동하도록 기존 비전 변환기 아키텍처를 조정하고 자체 감독 시나리오에서 모델링 용량을 테스트할 것을 제안합니다. 대부분의 다른 연구[8,9,30]는 제어된 데이터 세트의 보행 인식에 대한 인상적인 결과를 달성하는 신경 아키텍처를 개발하는 데 노력을 집중합니다.

그러나 우리는 보행 데이터 세트에 대해 비용이 많이 드는 수동 주석의 필요성을 제거하고 자가 지도 학습이 보행 분석에 적합한 방법을 탐색할 계획입니다.

memory enhancement

이 영역의 이전 연구[10,12]에서는 주석이 약한 데이터 세트에서 좋은 보행 표현을 학습할 수 있는 가능성을 보여주었습니다. Cosma와 Radoi [12]는 ViT [24] 모델에서 영감을 받아 골격 시퀀스 처리를 위한 최초의 변환기 기반 아키텍처인 GaitFormer를 제안했습니다. [12]와 유사하게 패치 처리 메커니즘에서 서로 다른 공간적 및 시간적 역학을 사용하여 다른 비전 변환기 모델의 성능을 탐색하려고 시도합니다. 보행 인식을 위한 대규모 데이터 세트는 과거에 제안되었으며[7,12], 이를 통해 표현 학습을 위한 일반적인 아키텍처의 개발이 가능해졌습니다.


For more information:1950477648nn@gmail.com


당신은 또한 좋아할지도 모릅니다