기계 학습 알고리즘을 사용하여 음성 신호에서 향상된 기능 매개변수 추출(1)
May 30, 2023
추상적인: 음성 인식은 음성 신호를 수신하여 음성 신호에서 화자의 특징을 식별하고 이후 화자를 인식하는 소프트웨어 또는 하드웨어의 기능을 의미합니다. 일반적으로 음성 인식 프로세스에는 음향 처리, 특징 추출 및 분류/인식의 세 가지 주요 단계가 포함됩니다. 특징 추출의 목적은 미리 정해진 개수의 신호 성분을 사용하여 음성 신호를 표현하는 것입니다. 음향 신호의 모든 정보는 다루기가 지나치게 번거롭고 일부 정보는 식별 작업과 관련이 없기 때문입니다. 본 연구는 실시간 스마트시티 환경에서 음성인식 응용의 성능을 향상시키기 위해 음성 신호로부터 특징 파라미터 추출을 수행하는 기계 학습 기반 접근 방식을 제안한다. 또한 메인 메모리 블록을 캐시에 매핑하는 원리를 효율적으로 사용하여 컴퓨팅 시간을 단축합니다. 캐시 메모리의 블록 크기는 캐시 성능에 큰 영향을 미치는 매개변수입니다. 특히 이러한 프로세스를 실시간 시스템에 구현하려면 높은 계산 속도가 필요합니다. 처리 속도는 실시간 시스템에서 음성 인식에 중요한 역할을 합니다. 음성 신호에서 특징 매개변수를 추출하는 속도를 높이는 최신 기술과 빠른 알고리즘을 사용해야 합니다. 음성 신호의 디지털 처리 중 오버클러킹 문제는 아직 완전히 해결되지 않았습니다. 실험 결과는 제안하는 방법이 기존의 다른 음성 인식 알고리즘에 비해 성공적으로 신호 특징을 추출하고 원활한 분류 성능을 달성함을 보여줍니다.

Cistanche Deserticola
키워드: 음성 인식; 병렬 컴퓨팅; 분산 컴퓨팅; 멀티코어 프로세서; 특징 추출; 스펙트럼 분석
1. 소개
인간과 컴퓨터 기술 간의 커뮤니케이션 접근 방식을 확립하는 것은 현대 인공 지능에서 중요한 작업입니다. 사용자가 정보를 입력하는 가장 쉬운 방법 중 하나는 음성 신호를 이용하는 것입니다. 따라서 음성 신호 처리 기술과 그 도구는 정보 사회의 필수 요소가 되었습니다. 음성 인식은 음성 신호 처리의 필수 연구 측면이며 중요한 인간-컴퓨터 상호 작용 기술입니다. 음성 신호에는 의미, 개인 및 환경 정보가 포함됩니다[1]. 음성 신호 처리에 대한 일반적인 접근 방식은 신호 매개변수가 변경되지 않는다고 가정하고 신호를 고정 크기의 시간 창으로 나누는 단기 분석을 사용하는 것입니다. 보다 정확한 신호 표현을 얻기 위해 창 사이에 중첩이 배치됩니다. 스펙트럼 분석 및 선형 예측과 같은 특징 추출 알고리즘이 각 창에 적용됩니다. 그러나 이러한 프로세스는 속도와 시간도 고려해야 합니다.

사막 인삼
타이밍은 실시간 신호 처리의 여러 영역에서 중요한 문제입니다. 프로세서 리소스를 효율적으로 사용하고 새롭고 빠른 알고리즘을 개발하여 디지털 처리 시간을 줄임으로써 처리 속도 비율을 높일 수 있습니다. 그러나 고성능 컴퓨팅 문제는 아직 완전히 해결되지 않았습니다 [2]. 또한 디지털 신호 처리 하드웨어 및 소프트웨어의 발전으로 자동 음성 인식에 상당한 진전이 있었습니다. 그러나 이러한 발전에도 불구하고 기계는 특히 화자 독립적인 음성 인식에서 정확성과 속도 인식 측면에서 인간의 성능을 따라잡을 수 없습니다. 따라서 음성인식 기술의 응용 범위와 한계로 인해 음성인식에 대한 많은 연구가 화자와 독립적인 음성인식 문제에 집중되어 왔다[3].
요약하면 연구의 주요 기여는 다음과 같습니다.

Cistanche 차
Cistanche deserticola 차 제품을 보려면 여기를 클릭하십시오.
【추가 문의】 이메일:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
음성 신호로 사람을 식별하는 과정은 여러 단계로 구성됩니다. 그 중 일부 단계는 더 많은 계산 시간이 필요합니다. 이것은 스펙트럼 분석입니다. 기계 학습 알고리즘에서 특히 중요한 매개 변수 중 하나는 훈련 시간입니다. 본 연구에서는 음성 신호 식별을 위해 특징을 추출하는 과정이 중요함을 발견하였다. 또한 기계 학습에는 많은 시간이 걸립니다. 스펙트럼 분석 프로세스가 독립적인 작업으로 구성되고 병렬화가 가능하다는 것이 확립되었습니다.
실험 결과 FFT 및 DCT 스펙트럼 변환이 스펙트럼 분석에서 좋은 결과를 제공하는 것으로 나타났습니다. 스펙트럼 분석 프로세스는 음성 신호의 각 세그먼트에 대해 유효합니다. 이를 통해 이러한 기능을 음성 신호와 명확하게 구분할 수 있습니다. OpenMP 및 TBB 도구의 도움으로 계산 속도를 높일 수 있는 병렬 컴퓨팅 알고리즘이 개발되었습니다.
세그먼트 크기는 음성 신호를 세그먼트로 나눌 때 중요합니다. 실험 중에 음성 신호 세그먼트의 크기는 중앙 프로세서의 캐시 메모리에 따라 달라진다는 사실이 밝혀졌습니다. 특히, 멀티코어 프로세서에서 캐시 크기에 대한 세그먼트 일치는 기계 학습에서 계산 속도에 긍정적인 영향을 미치는 것으로 밝혀졌습니다.
TBB 및 OpenMP를 사용하는 멀티코어 프로세서에서 기계 학습 알고리즘을 사용하여 음성 신호에서 특징 매개변수 추출을 위한 신호의 스펙트럼 변환을 위한 새로운 병렬 구현 방법이 제안됩니다.
또한 주기억장치 블록을 캐시에 매핑하는 원리와 캐시 메모리 블록의 크기를 효과적으로 활용하면 처리 속도를 높일 수 있음을 알 수 있었다.

Me-Improving Memory 근처의 Cistanche 보충제
이 논문의 나머지 부분은 다음과 같이 구성된다. 섹션 2에서는 특정 음성 신호 속성을 추출하기 위한 기존 연구를 검토합니다. 섹션 3에서는 실험을 통한 특징 추출 단계를 설명합니다. 4장에서는 음성 신호로부터 특징 파라미터를 추출하기 위한 제안된 고성능 연산 알고리즘을 구체적으로 제시한다. 우리가 구현한 실험 결과는 5장에서 논의한다. 6장에서는 제안하는 방법의 한계를 강조한다. 마지막으로 7절에서는 연구 결과를 요약하고 향후 연구 방향을 제시하며 연구를 마무리한다.
2. 관련 저작물
새로운 방법, 알고리즘 및 보다 현대적인 응용 프로그램은 현재 음성 신호의 분할 및 선택된 조각의 파라메트릭 표시기 계산을 위해 개발되고 개선되어 스펙트럼 분석을 사용하여 음성 신호의 스펙트로그램을 생성합니다[4-7]. 전 세계의 다양한 음성 클립을 통한 화자 식별은 특히 강력하고 차별적인 특징을 추출하는 데 중요하고 어려운 작업입니다[8]. 기존의 MFCC 구현보다 빠르고 에너지 효율적인 새로운 MFCC(Mel Frequency Cepstral Coefficients) 특징 추출 시스템이 Korkmaz et al.에 의해 제안되었습니다. [9]. 하이패스 프리엠퍼시스 필터를 사용하는 대신 로우패스 필터를 사용했습니다. 그들은 고주파수에서 신호의 에너지를 증폭시키기 위해 사전 강조가 필요하기 때문에 고역 통과 필터로 대역 통과 필터를 구현했습니다. 이전 작업[10]에서 화자 식별을 위한 새로운 MFCC 기반 방법을 제시했습니다. 기존 MFCC를 사용하는 대신 Mel 스펙트로그램의 픽셀을 기능 세트로 사용합니다. 스펙트로그램은 2-D 배열로 변환되어 새 데이터세트를 생성했습니다. 화자를 식별하기 위해 10-폴드 교차 검증 기법을 사용하여 여러 학습 알고리즘을 실행했습니다. tanh 활성화 기능이 있는 다층 퍼셉트론(MLP)의 도움으로 90.2%의 최고의 정확도를 달성했습니다.
특징 추출은 음성 파형을 후속 처리 및 분석을 위해 상대적으로 낮은 데이터 속도에서 파라메트릭 표현의 형태로 변경하여 수행됩니다[11-14]. 특징 추출 접근법은 일반적으로 모든 음성 신호에 대해 다차원 특징 벡터를 생성합니다. 특징 추출은 화자 인식에서 가장 관련성이 높은 부분입니다. 말의 특징은 말하는 사람을 다른 사람과 구별하는 데 중요한 역할을 합니다. 특징 추출은 음성 신호의 강도를 손상시키지 않으면서 음성 신호의 크기를 줄입니다[15-17]. [18]에서 저자는 화자 종속 자동 음성 인식의 성능을 향상시키기 위해 초기 단시간 푸리에 변환을 계산하는 데 사용되는 스펙트럼 분석 창의 크기 및 이동 매개변수의 미세 조정을 활용하는 새로운 접근 방식을 도입했습니다. (ASR) 시스템. 의사가 없는 경우 평신도는 인공 지능 접근 방식을 사용하여 만든 의사 결정 지원 시스템을 사용할 수 있습니다. 조기 및 비침습적 심장 상태 감지는 심음도(PCG) 신호를 사용하여 달성할 수 있습니다[19-21].
CNN(Convolutional Neural Networks)은 기능 공간에서 구조적 지역성을 성공적으로 시뮬레이션하고 편향된 주파수 영역 내에서 풀링을 사용하여 변환 변동을 줄이고 기능 공간의 교란 및 작은 변화를 조정하는 것으로 입증되었습니다[22]. Mukhamadiyevet al. 우즈베크어와 그 방언에 대한 종단 간 심층 신경망 숨겨진 Markov 모델 음성 인식 모델과 하이브리드 연결주의 시간 분류(CTC)-주의 네트워크를 제안했습니다. 제안된 접근 방식은 어텐션 모델 훈련에서 CTC 목적 함수를 효과적으로 사용하여 훈련 시간을 줄이고 음성 인식 정확도를 향상시킨다[23]. 심전도(ECG)와 직접적으로 독립적으로 심음 신호를 정상과 비정상으로 구분하는 1차원 CNN(Convolutional Neural Network) 모델을 사용한 특징 추출 및 분류가 [24]에서 제안되었습니다. 컨볼루션 커널이 52 미만인 경우 본 연구에서 사용된 심음 신호는 2D CNN보다 1D CNN에서 분류 정확도가 더 높다고 주장한다. 컨볼루션 커널이 크면 계산 복잡도가 높아지고 시간이 많이 소요되기 때문이다. . [25]에서는 TIMIT 데이터베이스(TIMIT Acoustic-Phonetic Continuous Speech Corpus)를 사용하여 음성 특징 시퀀스에 관한 음향 모델의 상태 시퀀스의 사후 정확도를 최대화하도록 심층 신경망을 훈련했습니다.
3. 전처리: 재료 개요

Me-Improving Memory 근처의 Cistanche 보충제
이를 위해 음성 신호 및 매개변수 표현에서 특징 매개변수를 추출하기 위한 신속한 알고리즘 개발, 처리를 위한 유용하고 유익한 샘플 추출, 선택된 음향 세그먼트의 스펙트로그램 구현을 위한 프로그램 개발이 필수적입니다.
음성 인식 시스템은 두 가지 주요 하위 시스템으로 구성됩니다.
음성 신호(음반)의 1차 처리;
지능형 알고리즘(스펙트로그램)을 사용하여 음향 기호를 분류합니다.
첫 번째 하위 시스템은 신호 및 신호 특성의 유익한 음향 특성 세트로 음향 기호를 생성합니다. 두 번째 서브시스템은 획득한 음향 특성을 기반으로 음성 신호를 파라메트릭 형식으로 변환합니다. 음성 신호 처리는 다음 단계로 구성됩니다.
음성 신호의 경계 분리;
디지털 필터링;
분할;
스무딩 윈도우 적용;
스펙트럼 변환 및 스펙트럼 주파수의 정규화.
이러한 단계는 음성 신호에서 특징 매개변수를 추출하는 데 광범위하게 사용되며 주요 특징은 다음에서 고려됩니다.
3.1. 경계의 분리
시끄러운 환경에서 들어오는 신호에서 품사만 추출하거나 문장의 시작과 끝 부분을 결정하는 것은 음성 처리에서 필수적인 작업입니다. 이 문제를 해결하기 위해 음성 신호의 다음 속성이 사용됩니다. 음성 신호의 단기 에너지, 0에서 교차하는 점의 수, 신호 내 묵음 필드 값의 분포 밀도 및 스펙트럼 엔트로피. 전통적인 음성 인식 시스템은 들어오는 음성 신호에서 음성 경계를 결정하기 위해 신호(예: 음성 활동 감지)의 과도 및 스펙트럼 에너지를 기반으로 하는 기술을 사용합니다[26-28].
음성 신호의 주요 매개변수는 음성 신호의 단기 에너지와 0을 통과하는 지점의 수입니다. 일반적으로 음성 신호의 매개변수는 시간이 지남에 따라 빠르게 변합니다. 따라서 음성 신호를 중첩되지 않는 10~30ms 길이의 조각으로 처리하는 것이 일반적입니다. 음성 신호는 이 범위 내에서 고정되며 음성 신호의 무음 영역은 과도 에너지를 계산하여 제거됩니다. 이 문제를 해결하기 위한 알고리즘은 다음 음성 신호의 256개의 단기 에너지 값의 N 시퀀스로 나뉩니다.
음성 신호를 분할하여 각 조각의 에너지를 계산하는 것은 병렬 및 분산 컴퓨팅에 적합합니다. 각 조각은 독립적으로 처리됩니다. n코어 멀티프로세서에서 프로세싱을 적용하면 n개 조각의 에너지를 동시에 계산할 수 있다. 따라서 이 단계에서 병렬 처리 효율을 높일 수 있다[29-32].
3.2. 제로 크로싱 수
제로 크로싱은 수학 함수의 부호가 변하는 지점(예: 양수에서 음수로)으로 함수 그래프에서 축의 절편(0 값)으로 표시됩니다[33]. 신호의 제로 크로싱 주파수는 스펙트럼 특성의 가장 직접적인 지표일 수 있습니다. 예를 들어 음성 신호에서 0을 통과하는 지점의 수는 다음 방정식을 사용하여 결정할 수 있습니다.

그림 1. 스펙트럼 엔트로피 분석에 기반한 음성 분리 방법.
3.3. 디지털 필터링
일반적이고 유용한 신호 외에도 다양한 유형의 노이즈가 존재합니다. 노이즈는 음성 인식 시스템의 품질에 부정적인 영향을 미치므로 노이즈 처리가 시급한 문제입니다. 시스템의 노이즈 레벨을 줄이기 위해 라인 필터와 초기 필터의 두 가지 유형의 디지털 필터가 사용됩니다. 선형 필터는 저주파수와 고주파수를 모두 캡처하므로 저주파 필터와 고주파수 필터의 조합으로 간주할 수 있습니다. 초기 필터링은 후속 식별에 사용되는 특성 표시에 대한 국부 교란의 영향을 최소화하기 위해 적용됩니다. 음성 신호는 스펙트럼 정렬을 위해 저역 통과 필터를 통과해야 합니다[35].
3.4. 분할
분할은 음성 신호를 겹치지 않는 이산 조각으로 나누는 과정입니다. 신호는 일반적으로 문장, 단어, 음절, 음소 또는 더 작은 음성 단위와 같은 음성 단위로 나뉩니다. 수많은 화자의 발화를 포함하는 녹음의 분할은 발화의 일부를 특정 화자의 것으로 간주하는 것으로 구성될 수 있습니다. "세그먼트 스테이션"이라는 용어는 때때로 음성 신호를 매개변수화하기 전에 프레임으로 나누는 것을 나타내는 데 사용됩니다[36,37].
3.5. 스펙트럼 변환
음성 인식 과정의 후기 단계에서 사용되는 음성 신호의 주요 특징을 구별할 필요가 있다. 초기 특징은 음성 신호의 스펙트럼 특성을 분석하여 결정됩니다. 고속 푸리에 변환 알고리즘은 일반적으로 음성 신호의 스펙트럼 주파수를 얻기 위해 사용됩니다[38,39].
3.6. 스펙트럼 주파수의 정규화
지능형 알고리즘의 전체 계산 프로세스는 움직이는 십진수를 기반으로 합니다. 따라서 신경망을 사용하여 분류되는 객체의 매개변수는 [{{0}}.0, 1.0] 범위로 제한됩니다. 결과 스펙트럼은 신경망을 사용하여 스펙트럼 처리를 적용하기 위해 0과 1 사이에서 정규화됩니다. 이를 달성하기 위해 각 벡터 구성 요소는 최대 구성 요소로 나뉩니다.
스펙트럼 처리 방법을 사용하면 음성 신호에서 얻은 모든 데이터 샘플을 사용할 수 있습니다. 많은 음성 신호에는 특정 주파수 구조와 스펙트럼 특성이 있습니다. 스펙트럼 방법은 음성 신호의 고정밀 처리를 제공합니다. 스펙트럼 처리의 단점은 신호의 로컬 특성의 낮은 유연성, 스펙트럼 차원의 부족 및 상대적으로 높은 계산 비용을 포함합니다.
푸리에 변환, 웨이블릿 분석 및 기타 여러 알고리즘이 음성 신호의 스펙트럼 처리에 광범위하게 사용됩니다. 푸리에 변환은 음성 처리를 비롯한 많은 과학 분야에서 사용됩니다. 음성 신호 처리에서 푸리에 변환은 신호를 주파수 성분으로 시간 필드에서 스펙트럼 필드로 변환합니다[40].
이전 연구에서는 이산 푸리에 변환(DFT), 이산 코사인 변환(DCT), 단기 푸리에 변환 및 웨이블릿 변환이 스펙트럼 분석에 적용되었습니다. 이러한 방법은 음성 신호의 조각을 주파수 도메인으로 변환하고 스펙트럼을 계산하는 데 사용되었습니다. TBB 및 OpenMP 패키지는 스펙트럼 변환을 위한 병렬 알고리즘을 만드는 데 사용되었습니다. 이러한 방법에서 명령은 신호를 프레임으로 나눕니다. 예를 들어, 각 프레임에 대해 N=16, 32, … 또는 4096[4]입니다. 생성된 각 프레임의 크기는 캐시 메모리의 블록 크기와 동일합니다. 캐시 메모리는 병렬 처리의 효율성에 영향을 미치는 요소이기 때문입니다. 가속 결과는 그림 2에 묘사되어 있습니다.

그림 2. (a) 4코어 및 (b) 8코어 프로세서의 가속화 결과.
병렬 처리 알고리즘의 소프트웨어 구현을 위해 Table 1과 같이 개인용 컴퓨터와 서버를 사용하여 적용된 4코어 및 8코어 프로세서에서 직렬 및 병렬 처리를 수행하였다.
표 1. Intel 프로세서의 특성.

DCT 알고리즘의 주요 특징은 주기성입니다. DCT의 장점은 신호 에너지의 대부분을 적은 수의 요인에 집중시키는 경향이 있다는 것입니다. 다음 방정식은 계수 행렬의 요소를 제공합니다.


여기서 L(k)는 DCT의 값, k는 계수의 인덱스, x(n)은 데이터 항목을 나타내고 N은 프레임 크기입니다.
푸리에 분석 매개변수는 스펙트럼 영역 내 음성 신호의 디지털 처리에서 대부분의 음성 인식 시스템에서 특징 벡터를 생성하는 데 사용되는 방법의 기초입니다. MFCC(Mel-frequency cepstral coefficients)[41] 및 선형 예측 코딩(LPC) 기술[42,43]은 푸리에 분석에서 음성 신호로부터 스펙트로그램 이미지를 생성하는 데 사용됩니다. 푸리에 분석을 사용하여 얻은 스펙트럼은 그림 3과 같이 음성 신호에 대한 간결하고 정확한 정보를 제공합니다.

그림 3. DFT: (a) 시간 영역 내에서 주파수 범위의 변화 및 (b) 스펙트로그램.
실험에서 스펙트럼 분석을 위해 2차원(2D) 신호를 사용했습니다. 병렬 이미지 처리 알고리즘에 사용되는 2D 스펙트럼 분석 특성은 멀티코어 프로세서에서 병렬 처리에 적합하다[38]. 특히 순방향 및 역방향 변환 벡터와 행렬은 이진 차원을 가지며 이 멀티코어 프로세서 아키텍처의 호환성은 계산 속도를 효과적으로 높일 수 있습니다. 따라서 2D 신호 처리에 사용된 알고리즘의 하드웨어 구현을 위해 프로세서 특성이 다른 컴퓨터에서 순차 및 병렬 처리를 적용했습니다(표 2).
표 2. 인텔 프로세서 적용 특성

전체 2D 신호는 각 단계에서 크기가 다른 동일한 조각으로 나뉩니다[44]. 선택된 조각의 값은 16×16과 1024×1024의 픽셀 해상도 사이였습니다. OpenMP 패키지를 사용한 병렬 DCT 알고리즘의 속도와 순차 알고리즘의 속도는 그림 4에 나와 있습니다. 병렬 2D 스펙트럼 분석의 사용 멀티코어 프로세서의 알고리즘은 코어 수에 가까운 오버클러킹 결과를 산출합니다.

그림 4. 2D 병렬 스펙트럼 분석의 가속 결과.






