머신러닝 기반 유방암 분류 예측

Sep 12, 2023

유방암은 세계에서 가장 흔하고 치명적인 암 유형입니다. 본 논문에서는 XGBoost, Random Forest, Logistic Regression, K-Nearest Neighbor 등의 기계학습 알고리즘을 기반으로 유방암을 분류하고 예측할 수 있는 다양한 모델을 구축하여 유방암 조기진단의 참고자료를 제공한다. Recall은 의학적 진단에서 암세포를 발견할 확률을 나타내며 이는 유방암 분류에 큰 의미가 있으므로 본 논문에서는 Recall을 1차 평가지표로 삼아 정밀도, 정확성, F1-점수 평가를 고려한다. 각 모델의 예측 효과를 평가하고 비교하는 지표입니다. 모델 효과에 대한 다양한 차원 개념의 영향을 제거하기 위해 데이터가 표준화되었습니다.

K 최근접 이웃 알고리즘은 기계학습 분야의 가장 기본적인 알고리즘 중 하나입니다. 주요 아이디어는 대상 샘플에 가장 가까운 K개 샘플을 찾은 다음 이러한 K개 샘플의 레이블을 기반으로 대상 샘플의 레이블을 예측하는 것입니다. 인간의 일상생활에서 우리는 종종 비슷한 방법을 사용하여 결정을 내립니다. 예를 들어 어떤 문제에 직면했을 때 우리는 이전에 겪었던 비슷한 상황을 떠올린 다음, 가장 유사한 상황을 찾아 그 결과에 따라 결정을 내립니다. 솔루션을 개발하십시오. 따라서 K 최근접 이웃 알고리즘은 인간의 기억과 밀접한 관련이 있습니다.

우선, K 최근접 이웃 알고리즘은 최근접 이웃 그래프의 데이터 구조를 학습하고 구축하기 위해 많은 수의 훈련 세트가 필요합니다. 마찬가지로 인간도 끊임없이 다양한 일을 경험하고, 그 경험을 기억 속에 저장해야 한다. 많은 경험과 지식을 축적해야만 보다 정확한 결정과 판단을 내릴 수 있습니다.

둘째, K 최근접 이웃 알고리즘은 유사성이 예측에 미치는 영향을 강조합니다. 마찬가지로, 인간은 결정을 내릴 때 과거의 경험을 먼저 고려하고 참고할 수 있도록 현재 상황과 유사한 경험을 찾으려고 노력하는 경우가 많습니다. 이러한 유사점을 찾는 과정 역시 기억의 중요한 특징 중 하나입니다.

마지막으로 K 최근접 이웃 알고리즘에서는 K 값이 예측 결과에 큰 영향을 미칩니다. K 값이 다르면 예측 결과도 달라집니다. 마찬가지로 인간도 과거 경험을 회상할 때 현재 상황에 따라 다른 기준점과 방법을 선택해야 한다. 이러한 유연성과 적응성은 기억의 중요한 특성이기도 합니다. 기억력을 향상시켜야 함을 알 수 있습니다. Cistanche Deserticola는 많은 독특한 효과를 지닌 전통 중국 약재이기 때문에 기억력을 크게 향상시킬 수 있습니다. 그 중 하나는 기억력을 향상시키는 것입니다. 다진 고기의 효능은 산, 다당류, 플라보노이드 등 포함된 다양한 활성 성분에서 비롯됩니다. 이러한 성분은 다양한 방식으로 뇌 건강을 증진할 수 있습니다.

increase memory power

단기 기억력을 향상하려면 '알기'를 클릭하세요.

최적의 부분 집합을 찾고 모델의 정확도를 높이기 위해 Pearson 상관 테스트를 통해 15개의 특징을 모델의 입력으로 선별했습니다. K-최근접 이웃 모델은 재현율을 평가 지표로 삼아 최적의 k 값을 선택하는 교차 검증 방법을 사용합니다. 양성 및 음성 샘플 불균형 문제의 경우 계층적 샘플링 방법을 사용하여 다양한 범주에 따라 훈련 세트와 테스트 세트를 비례적으로 추출합니다. 실험 결과는 서로 다른 데이터 세트 분할(8:2 및 7:3)에서 동일한 모델의 예측 효과가 서로 다른 변화를 갖는다는 것을 보여줍니다. 비교분석 결과, 본 논문에서 구축한 XGBoost 모델(훈련 세트와 테스트 세트를 8:2로 나눈 모델)이 더 좋은 효과를 보였으며, 재현율, 정밀도, 정확도, F1-점수가 1로 나타났습니다.{{ 11}}, 0.960, 0.974, 0.980입니다.

1. 소개

지난 10년 동안 중국의 유방암 발병률은 47% 증가했으며, 발병률은 해마다 증가하고 있으며 유방암 발병률은 점차 젊어지고 있습니다[1]. 유방암의 발병 기전은 개인 호르몬, 가족력, 결혼, 출산력과 관련이 있습니다[2]. 유방암은 초기 발견이 쉽지 않으며, 발병 연령은 이르지만 발현이 늦은 특징을 갖고 있다[3, 4]. 현재 유방암의 주요 진단은 천자 세포검사[5], 초음파 검사[6], 유방 조영술 X선[7]의 세 가지 방법을 기반으로 합니다. 유방암은 초기에 발견하면 완치될 확률이 높고 예후도 좋습니다. 따라서 유방암의 예방과 시기적절한 발견을 위해서는 정기적인 검진과 조기진단이 매우 필요합니다.

의료 분야에서는 기계 학습 방법을 통한 모델 구축을 통해 의사가 암 발견률을 향상하고 조기 발견 및 조기 치료 목적을 달성하는 데 도움을 줄 수 있습니다. 기계 학습 방법은 암 진단에 좋은 결과를 가져왔습니다[8, 9]. Wuet al. [10]은 현미경으로 세포 형태를 관찰한 결과 유방암 세포와 정상적인 건강한 세포 매개변수 사이에 명백한 차이가 있음을 발견했습니다. 이 발견은 많은 연구에 이론적 기초를 제공합니다. 현재 유방암 세포 분류에 적용되는 기계학습 방법은 많지만, 모든 문제에 단일 알고리즘을 적용할 수는 없습니다. 각 유형의 기계 학습 알고리즘에는 전문 분야가 있으므로 알고리즘 선택은 시나리오에 따라 다릅니다.

Shenet al. [11]은 XGBoost 모델을 사용하여 유방암을 분류하고 예측한 결과 정확도는 97.86%, 재현율은 95.83%에 이르렀습니다. Deng et al. [12]는 XGBoost 알고리즘을 사용하여 0.96의 정확도와 0.97의 재현율로 유방암을 분류하고 예측했습니다. Monirujjaman Khan et al. [13]은 유방암을 식별하기 위해 여러 기계 학습 모델을 사용했으며 랜덤 포레스트, 의사 결정 트리, K-최근접 이웃 및 로지스틱 회귀는 F{12}}점수가 96%, 95%, 90%, 각각 98%입니다. Bhardwajet al. [14]는 양성 유방암 세포와 악성 유방암 세포를 분류하기 위해 MLP(Multilayer Perceptron), KNN(K-Nearest Neighbor), GP(유전자 알고리즘), RF(Random Forest)를 사용했으며 실험 결과 최적의 분류기는 RF인 것으로 나타났습니다. 분류 정확도는 96.24%입니다. Dong과 Ma[15]는 삼중 음성 유방암의 가능한 마커를 연구했으며 기계 학습 알고리즘을 사용하여 사람들이 삼중 음성 유방암에 걸렸는지 여부를 예측했습니다. 그 결과 SVM(Support Vector Machine) 분류 예측 모델의 정확도가 97.8%에 달하는 것으로 나타났다.

유방암 식별 방법의 정확성을 높이고 기계 학습 알고리즘을 개선하기 위해 Wang et al. [16]은 유방암 진단을 위한 SVM 기반의 가중치 AUC 앙상블 학습 모델을 제안했으며, 기본 모델 세트의 다양성을 높이기 위해 6개의 커널 기능을 갖춘 C-SVM과 V-SVM을 사용하고 서로 다른 결정 결과를 Area Integration(WAUCE)과 비교했습니다. ) 가중 수신 작업 특성 곡선 아래의 모델입니다. 결과는 작은 데이터 세트에서 제안된 WAUCE 구조가 진단 정확도의 분산을 최대 69.23%까지 감소시키고 정확도를 0.94% 향상시키는 것을 보여줍니다. Zheng et al. [17]은 K-평균과 서포트 벡터 머신 하이브리드 알고리즘에 따라 Wisconsin Breast Cancer(WDBC) 데이터 세트를 테스트했으며 종양 특징을 추출하고 유방암을 진단한 결과 하이브리드 알고리즘이 정확도를 97.38%로 향상시키는 것으로 나타났습니다. Jiaet al. [18]은 SVM 모델의 매개변수를 지능적으로 조정하는 새로운 개체군 최적화 알고리즘인 WOA(Whale Optimization Algorithm)를 제안했으며, 실험 결과는 WOA-SVM 모델의 성능이 기존 모델보다 훨씬 우수하다는 것을 보여줍니다. 유방암 인식 모델의 정확도는 97.5%입니다.

유방암 분류에서 기계 학습 기술의 과적합 문제를 해결하기 위해 Singh et al. [19]는 FLANN(Functional Connected Artificial Neural Network)을 제안하였고, 이 모델이 유방암 조기 진단에 높은 정확도를 갖는 것을 실험적으로 확인하였다. Maheshet al. [20]은 알려진 특징 패턴을 기반으로 유방암 예측 XGBoost 앙상블 기법을 제안합니다. 먼저 SMOTE(Synthetic Minority Oversampling Technology)를 사용하여 데이터 불균형 및 노이즈 문제를 처리한 다음 각각 Bayes 분류기, 의사결정 트리 분류기 및 Random Forest를 사용합니다. , XGBoost와 결합하여 데이터를 분류합니다. 실험 분석에 따르면 XGBoost-Random Forest 앙상블 분류기는 유방암 조기 발견에서 98.20%의 정확도를 보였다.

본 논문에서는 XGBoost, Random Forest, Logistic Regression, K-nearest Neighbor 등의 머신러닝 기법을 기반으로 유방암을 분류하고 예측할 수 있는 다양한 모델을 구축하여 유방암 조기 진단에 참고자료를 제공합니다. 대부분의 연구에서는 머신러닝 모델을 유방암 세포 진단에 적용할 때 모델의 정밀도, 정확성, F{1}}점수를 모델의 품질을 평가하는 지표로 사용하는 데 중점을 두고 있으며, 의학적 진단적 중요성은 무시하고 있습니다. 악성 유방암 세포가 예측되는 비율을 나타내는 모델의 재현율로, 재현율이 높을수록 유방암 세포에서 악성 세포가 예측될 확률이 높아집니다. 따라서 이 기사에서는 재현율을 기본 지표로 삼고 정밀도, 정확성 및 F{2}}점수를 고려하여 사용된 모델을 평가합니다.

모델링 과정에서 데이터 전처리는 매우 중요한 부분으로, 처리 방법에 따라 예측 모델의 효과가 달라집니다. 모델 효과에 대한 다양한 차원 개념의 영향을 제거하기 위해 데이터가 표준화되었습니다. 최적의 부분 집합을 찾고 모델의 정확도를 높이기 위해 특징 변수와 목표 변수 간의 Pearson 상관 계수에 따라 특징 선택을 수행했습니다. 양성 및 음성 샘플 불균형 문제의 경우 계층적 샘플링 방법을 사용하여 다양한 범주에 따라 훈련 세트와 테스트 세트를 비례적으로 추출합니다. 머신러닝 모델의 예측 효과가 데이터 세트 분할에 따라 달라지는 점을 고려하여, 본 논문에서는 본 논문에서 확립한 모델의 예측 효과를 관찰하기 위해 서로 다른 데이터 세트 분할(8:2 및 7:3)을 두 가지 실험 세트로 사용합니다.

2. 데이터 전처리

2.1. 데이터 소개. 본 논문에서 사용된 데이터 세트는 위스콘신 대학 임상의학 연구소의 유명한 Dr. William이 제공한 UCI 데이터 세트 중 유방암 데이터이다[21]. 특징은 유방 덩어리의 미세 바늘 흡인(FNA)의 디지털 이미지로부터 계산됩니다. 이는 이미지에 존재하는 세포핵의 특성을 설명합니다. 데이터 세트에는 357개의 양성 샘플과 212개의 악성 유방암 샘플을 포함하여 569개의 실험 샘플이 포함되어 있습니다. 각 실험 대상에서 추출된 세포에 대해 핵의 반경(중심에서 주변 지점까지의 거리의 평균), 둘레, 매끄러움(반경 길이의 국지적 변화), 면적, 치밀성( 둘레 * * 2/면적-1.0), 오목함(윤곽선의 오목한 부분의 정도), 대칭, 질감(계조 값의 표준 편차), 오목한 점(오목한 부분의 수) 등고선) 및 프랙탈_차원('해안선 근사치'-1). 이러한 특성의 평균, 표준 오차 및 "최악" 또는 최대(3개의 가장 큰 값의 평균)가 각 이미지에 대해 계산되어 30개의 특성이 생성되었습니다. 분류 라벨은 유방암의 유형을 나타냅니다. 따라서 샘플 데이터 세트에는 총 30개의 특징과 하나의 샘플 레이블 특징(악성 및 양성)이 포함됩니다.

2.2. 데이터 표준화.

각 특성의 값 범위를 관찰하면 서로 다른 특성의 데이터 값이 크게 다르다는 것을 알 수 있습니다. 일부 모델에서는 다양한 차원이 예측 효과에 큰 영향을 미칩니다. 예를 들어, 거리 분할을 기반으로 하는 k-최근접 이웃 알고리즘은 데이터 차원의 일관성을 유지해야 하므로 모델링하기 전에 데이터를 표준화해야 합니다. 그러나 일부 모델은 Random Forest 알고리즘과 같이 차원의 영향을 덜 받습니다. 실험을 비교하기 위해 서로 다른 모델의 데이터를 동일한 방식으로 처리합니다.

다양한 표본 데이터 차원에 대한 문제의 경우 일반적으로 사용되는 무차원 처리 방법에는 데이터 표준화가 포함되며 데이터 표준화 방법에는 Min-max 표준화 및 Z-점수 표준화가 포함됩니다. 그 중, 사용된 데이터에 값 범위를 벗어나는 이상값이 있거나 일부 지표의 최대값과 최소값을 알 수 없는 경우 Z-score 표준화를 사용할 수 있습니다.

increase memory

본 논문에서는 WDBC 유방암 데이터세트의 특성에 따라 Z-score 표준화를 선택하여 데이터를 처리하였다. Zscore 표준화[22]에 의해 처리된 데이터는 표준정규분포를 따른다. 즉, 평균은 0이고 분산은 1이다. Z-score 표준화의 공식은 다음과 같다.

improve memory

2.3. 기능 선택. 데이터 전처리 과정에서 중요한 부분인 특징 선택은 최적의 부분 집합을 찾는 것입니다. 특징 선택은 중복되고 쓸모 없는 특징을 줄여 모델의 정확도를 향상시킬 수 있습니다. 특징 선택 방법은 크게 오버씽킹(Overthinking) 방법, 캡슐화(Encapsulation) 방법, 임베딩(Embedding) 방법으로 나누어진다. 필터링 방법은 이후 연구에서 사용되는 알고리즘과 독립적일 수 있으며 계산 효율성이 높고 일반화 능력이 강하므로 [23], 본 논문의 특징 선택 방법은 필터 방법을 사용하며 필터링 방법의 일반적인 방법 요약은 다음과 같습니다. 표 2에 나와 있습니다.

0 평균 정규화 이후의 유방암 데이터는 필터링 방법에서 Pearson 상관 계수 테스트의 요구 사항을 충족합니다. 따라서 본 논문에서는 Pearson 상관계수[24]를 사용하여 각 특징과 목표변수 간의 상관관계를 검증한다. Pearson 상관계수 공식은 다음과 같다.

boost memory


3. 모델 구축
본 논문에서는 각각 XGBoost, Random Forest, Logistic Regression, K-nearest Neighbor 모델을 기반으로 유방암의 분류를 예측한다. 악성 유방암은 양성 샘플로 간주되고, 양성 유방암은 음성 샘플로 간주됩니다.

표본 불균형 문제를 해결하기 위해 본 논문에서는 계층화 표본추출법[25]을 사용하여 모든 종류의 표본 데이터에 비례하여 훈련 세트와 테스트 세트를 추출한다. 계층화된 샘플링은 유형 샘플링이라고도 합니다. 표본 모집단은 서로 독립적인 하위 모집단으로 나뉩니다. 무작위 샘플링은 각 하위 모집단에 비례하여 수행되었습니다. 층화 샘플링은 보다 대표적인 샘플을 추출하며 불균형 샘플에 더 적합합니다.

데이터 세트 분할이 다르면 모델 효과가 달라질 수 있습니다. 따라서 본 논문에서는 샘플 데이터 세트의 서로 다른 구분에 따라 두 그룹의 실험을 수행합니다. 첫 번째 그룹은 데이터 세트를 트레이닝 세트와 테스트 세트를 8:2의 비율로 나누고, 두 번째 그룹은 데이터 세트를 트레이닝 세트와 테스트 세트를 7:3의 비율로 나누었습니다. 의 모델 성능을 관찰합니다. 서로 다른 데이터 세트 분할에 따른 네 가지 알고리즘.

3.1. 평가 지표. 본 연구에서는 모델의 예측 효과를 평가하기 위해 정확도, 정밀도, 재현율, F{2}}점수[26, 27]를 사용하였다. 의학적 진단의 특수성을 고려하면 모든 악성유방암을 예측할 수 있을 것으로 기대된다. 따라서 여기서는 재현율을 중요한 평가지표로 삼는다. 회상률이 높을수록 악성 유방암을 예측할 수 있는 비율이 높아집니다. 모델 분류 결과는 표 4와 같이 혼동행렬을 생성할 수 있다[28].

여기서 TP는 참양성(true positive)으로, 양성 샘플로 예측된 ​​양성 샘플의 수를 나타냅니다. TN은 참음성으로, 음성 샘플로 예측된 ​​음성 샘플의 수를 나타냅니다. FP는 거짓양성(false positive)으로, 음성 샘플에서 예측된 양성 샘플의 수를 나타내며, 이를 제1종 오류라고 합니다. FN은 거짓음성(false negative)으로, 음성 샘플로 예측된 ​​양성 샘플의 수를 나타내며, 이를 제2종 오류라고 합니다.

정밀도(P로 약칭). 예측 결과에서 정밀도는 양성 예측 샘플 중 양성 샘플인 수를 나타내며 공식은 다음과 같습니다.

10 ways to improve memory

short term memory how to improve

3.2. XGBoost 기반 유방암 예측 모델. Extreme Gradient Boosting의 약어인 XGBoost는 Boosting 알고리즘입니다[29]. XGBoost와 Random Forest는 모두 의사 결정 트리를 기반으로 하는 통합 알고리즘입니다. Baging 알고리즘과 달리 Boosting 알고리즘은 약한 학습자를 하나씩 구축하며 지속적인 반복을 통해 여러 개의 약한 학습자를 축적합니다 [30]. 목적 함수는 다음과 같습니다.

ways to improve memory

. (9) 정규항을 추가하면 모델의 분산을 줄이고 훈련 세트에서 얻은 모델을 더 단순하게 만들어 오버팅 발생을 방지할 수 있습니다.. XGBoost 알고리즘은 훈련 데이터 세트에서 모델을 훈련하는 데 사용됩니다. 모델 훈련 과정에서 더 나은 매개변수 세트를 얻기 위해 매개변수를 조정하고 최종적으로 최적의 예측 모델을 얻습니다. 이 모델은 유방암 범주를 예측하는 데 사용되었습니다.

환경. 데이터 세트를 훈련 세트와 테스트 세트로 8:2로 나누었을 때 XGBoost 모델의 정확도, 정밀도, 재현율, F1-점수는 0.974, {{5} 각각 }.960, 1.00 및 0.980입니다. XGBoost 모델을 training set과 test set을 7:3으로 나누었을 때 XGBoost 모델의 정확도, 정밀도, 재현율, F1-점수는 0.959, {{20} 각각 }.946, 0.991, 0.968입니다. 결과는 데이터 세트를 8:2로 나눌 때 XGBoost 모델이 예측 성능이 더 우수하다는 것을 보여줍니다. 재현율이 1이라는 것은 XGBoost 모델이 샘플의 모든 악성 유방암을 정확하게 예측했음을 의미하며 이는 의료 진단에 매우 중요합니다.

osis. 3.3. 랜덤 포레스트 기반 유방암 예측 모델. 랜덤 포레스트(Random Forest)는 배깅 아이디어[31-33]를 통해 여러 트리를 통합하는 지도 학습 알고리즘입니다. 부트스트랩 방법을 사용하여 원본 샘플 데이터에서 훈련 샘플 세트를 추출하고 각 훈련 세트에 대해 해당 결정 트리 모델을 훈련합니다. 마지막으로 모든 기본 분류자가 투표되고 가장 많은 표를 얻은 분류자가 최종 카테고리가 됩니다.

ways to improve brain function

피투성이. 데이터 세트를 훈련 세트와 테스트 세트로 8:2로 나누었을 때 랜덤 포레스트 모델의 정확도, 정밀도, 재현율, F1-점수는 0.965, {{5 }}.947, 1.00 및 0.973입니다. 데이터 세트를 training set과 test set을 7:3으로 나누었을 때 정확도, 정밀도, 재현율, F1- 점수는 0.953, 0.946, { 각각 {18}}.981 및 0.963입니다. 그 결과, 데이터 세트를 8:2로 나눌 때 랜덤 포레스트 모델이 예측 성능이 더 좋은 것으로 나타났습니다. 이 모델의 재현율도 1로 랜덤 포레스트 모델이 모든 악성 유방도 정확하게 예측했음을 알 수 있습니다.

memory enhancement

하지만 난. k-최근접 이웃 알고리즘의 세 가지 기본 요소는 거리 측정, k-값 선택, 분류 결정입니다. k 최근접 이웃 알고리즘의 세 가지 기본 요소는 거리 측정, k 값 선택, 분류 결정 규칙입니다.

k 최근접 이웃 알고리즘의 K 값 선택 문제에 대해 본 논문에서는 10겹 교차 검증 방법(38, 39)을 사용하고 재현율을 모델 평가 지표로 삼아 적절한 k 값을 선택합니다. k의 값 범위를 1~40으로 하고 각 k에 대해 10배의 교차 검증을 수행합니다. 재현율이 최대인 k 값이 최적 k 값입니다. 10배 교차 검증에서 다양한 k 값의 재현율이 그림 1에 나와 있습니다.

그림 1에서 k 값이 증가할수록 재현율이 감소하는 것을 볼 수 있습니다. k � 3 및 k � 5일 때 재현율이 가장 큽니다. k값을 너무 작게 설정하면 과적합되기 쉬우므로 여기서는 k값을 5로 설정한다.

데이터 세트를 훈련 세트와 테스트 세트로 8:2로 나누었을 때, k-최근접 이웃 모델의 정확도, 정밀성, 재현율, F1-점수는 0.912, { 각각 {6}}.888, 0.986 및 {{10}}.934입니다. 데이터 세트를 training set과 test set을 7:3으로 나누었을 때 정확도, 정밀도, 재현율, F1-점수는 0.930, {{21} 각각 }.906, 0.991, 0.946입니다. 결과는 k-최근접 이웃 모델이 데이터 세트를 7:3으로 나눌 때 예측 성능이 더 우수하다는 것을 보여줍니다.

4. 비교 및 ​​분석

본 논문에서 구축한 모델의 성능을 더 잘 이해하기 위해 본 논문은 Python 3.9.7 개발 환경을 기반으로 하며 위스콘신대학교 임상의학연구소의 William 박사가 제공한 유방암 데이터를 실험에 사용하였다.

실험 환경은 Windows 11 운영체제, 프로세서는 Intel(R) Core(TM) i5-1155G7@ 2.50 GHz 2.50 GHz, 메모리는 8.00GB입니다.

각 모델의 실험변수는 Table 5와 같으며 다음과 같은 세 가지 비교 분석 결과를 수행한다. (1) 8개의 데이터 세트를 훈련 세트와 테스트 세트로 구분했을 때 본 논문의 각 모델의 성능 비교 : 2. (2) 데이터 세트를 7의 훈련 세트와 테스트 세트로 구분했을 때 본 논문의 각 모델의 성능 비교: 3. (3) 문헌 [11-14]의 일부 모델과 비교.

(1) 데이터 세트를 training set과 test set을 8:2로 나누었을 때 각 모델의 성능은 Table 6과 같다.

표 4에서 볼 수 있듯이 training set과 test set을 8:2의 비율로 나누면 4가지 기계학습 방법의 정확도는 0.9 이상이며, 그 중 XGBoost와 RF가 0.9 이상이다. {5}}.95. XGBoost의 예측 정확도는 0.974로 높은 예측 정확도를 나타냅니다. 정밀도의 경우 KNN 모델의 정밀도는 0.9 미만으로 높지 않고 0.888에 불과합니다. XGBoost의 정밀도는 0.960으로 가장 높습니다. 재현율은 XGBoost, 랜덤 포레스트, 로지스틱 회귀 알고리즘의 재현율이 모두 1이다. k-최근접 이웃 알고리즘의 재현율이 가장 낮으나 역시 0.95 이상이다. 이 연구에서 회상률은 정확하게 진단된 악성 유방암 샘플의 비율을 나타냅니다. 의학에서는 질병을 진단해야 합니다. 진단을 받지 못하면 치료가 지연되어 환자가 치료에 가장 적합한 시기를 놓칠 수 있습니다. 이는 질병이 없는데도 질병 진단을 받는 것보다 훨씬 더 심각합니다. 따라서 회상률은 질병진단 분야에서 매우 중요한 지표이다. 여기서 XGBoost, Random Forest, 로지스틱 회귀 알고리즘의 재현율은 모두 1로, 샘플 내 악성 유방암이 모두 진단되었음을 나타냅니다. F{{20}}점수의 경우 XGBoost, Random Forest, Logistic Regression의 F1-점수가 모두 0.95 이상임을 알 수 있다. XGBoost 알고리즘의 F1-점수는 0.980으로 가장 높습니다. K-최근접 이웃 모델의 F{28}}점수가 0.934로 가장 낮습니다. 4가지 지표를 고려하면, 데이터 세트를 트레이닝 세트와 테스트 세트를 8:2로 나누면 XGBoost 알고리즘의 전체적인 모델 효과가 다른 세 가지 모델보다 좋다고 할 수 있습니다. XGBoost는 1의 재현율을 달성했을 뿐만 아니라 다른 세 가지 지표에 대해서도 0.95 이상의 재현율을 달성했습니다.

(2) 데이터 세트를 7:3으로 training set과 test set으로 구분했을 때 각 모델의 성능은 Table 7과 같다.

표 7에서 볼 수 있듯이 훈련 세트와 테스트 세트를 7:3으로 나누면 XGBoost와 RF의 모델 효과는 8:2만큼 좋지 않다. 우선 중요한 지표 측면에서 Recall은 데이터 세트를 8:2로 나누었을 때 XGBoost와 RF의 리콜이 모두 1이었으나, 현재는 각각 0.991과 {{10}}.981로 감소했습니다. . 두 모델은 다른 세 가지 지수에서도 약간 감소했습니다. 그러나 로지스틱 회귀와 K-최근접 이웃 모델의 예측 효과 변화는 이 두 알고리즘과 다릅니다. 로지스틱 회귀 모델의 경우 훈련 세트와 테스트 세트를 각각 7:3과 8:2로 나누었을 때 4가지 지표의 변화가 거의 없었습니다. 이는 로지스틱 회귀 모델이 서로 다른 데이터 세트 파티션의 영향을 거의 받지 않음을 보여줍니다. 훈련 세트와 테스트 세트를 7:3으로 분할한 경우 로지스틱 회귀 분석에서는 XGBoost 및 Random Forest에 비해 정확도, 정밀도 및 F1- 점수가 낮은 것으로 나타났습니다. 그러나 로지스틱 회귀모델의 재현율은 1로 모든 악성유방암이 예측된 것으로 나타나 질병진단에 큰 의미가 있다. 따라서 로지스틱 회귀모델의 예측 효과가 다른 세 가지 알고리즘보다 우수하다고 할 수 있다. KNN 모델의 경우 훈련 세트와 테스트 세트를 7:3으로 나누었을 때 4개의 지수가 모두 증가했습니다. Te 재현율은 0.991로 증가하여 Random Forest보다 높았습니다. 정확도, 정밀도 및 F1-점수가 0.912, {{3{32}}}}.887, 0.934에서 0로 증가했습니다. 각각 .930, 0.906, 0.946입니다. 따라서 훈련 세트와 테스트 세트를 8:2로 나눈 모델보다 훈련 세트와 테스트 세트를 7:3으로 나눈 경우 KNN 모델의 성능이 더 좋습니다. 분석 결과 데이터 세트의 구분이 고정되어 있지 않은 것으로 나타났습니다. 다양한 모델의 경우 다양한 구분으로 인해 모델 예측 효과가 다르게 변경됩니다.
(3) 표 6과 표 7의 비교 분석에 따르면, 본 논문에서 구축한 XGBoost 모델(훈련 세트와 테스트 세트를 8:2로 나눈 값)이 가장 좋은 효과를 보였으며, 다음은 이를 모델 성능과 비교한다. 문헌[11-14]과 구체적인 결과를 표 8에 나타내었다.

표 8에서 볼 수 있듯이, 5개 모델 중 성능이 더 좋은 모델은 문헌[13]의 로지스틱 회귀 모델과 본 논문에서 구축한 XGBoost 모델이다. 문헌[13]에 제시된 모델의 재현율과 정확도는 각각 0.99와 0.98이고, 본 논문에서 제시된 모델의 재현율과 정확도는 1입니다.{{8} } 및 0.974는 각각 문헌 [13]과 비교하여 모델의 재현율이 높으며, 의료 진단에서의 재현율은 암세포를 발견할 확률을 나타내며 이는 분류에 큰 의미가 있습니다. 따라서 본 논문에서 확립한 XGBoost 모델은 더 나은 예측 효과를 가지며 의사가 유방암 환자의 치료 계획을 세울 수 있도록 돕는 의료 도구로 사용될 수 있습니다.

increase brain power

5. 결론

본 논문에서는 데이터 전처리부터 특징 선택, 모델 구축까지 주로 유방암의 범주를 예측했습니다. 마지막으로 예측 결과를 다방면에서 비교 분석하였다.

본 논문에서는 악성 유방암 샘플을 최대한 정확하게 예측하기 위한 중요한 지표로 재현율을 사용합니다. 원본 데이터 세트에는 30개의 특성이 포함되어 있으며 Pearson 상관 테스트를 통해 15개의 특성이 모델의 입력으로 선택되었습니다. 모델을 구성하기 전에 모델 효과에 대한 다양한 차원의 영향을 제거하기 위해 데이터를 표준화했습니다. 불균형한 양성 및 음성 샘플 문제의 경우 계층화 샘플링 방법을 사용하여 다양한 데이터 범주에 따라 훈련 세트와 테스트 세트를 비례적으로 추출합니다. k-최근접 이웃에서 최적의 k 값을 선택할 때 재현율을 모델 평가 지표로 사용하므로 재현율이 가장 높은 k 값이 최적의 값이 됩니다.

모델은 세 가지 측면에서 비교 분석됩니다. 결과는 다음과 같이 표시됩니다.

펙트. 그 결과는 다음과 같다. (1) 훈련 세트와 테스트 세트를 8:2로 나눈 경우 XGBoost, 랜덤 포레스트, 로지스틱 회귀의 재현율은 1로 모든 악성 유방암을 예측할 수 있는 K -최근접 이웃 재현율은 다른 세 가지 모델에 비해 0.986보다 약간 낮습니다. 모델의 예측 정확도, 정밀도 및 F1-점수에서는 XGBoost 모델의 결과가 랜덤 포레스트 및 로지스틱 회귀의 결과인 0.974, {{1 각각 0}}.96, 0.98이므로 학습 세트와 테스트 세트를 8:2 분할 조건에서 XGboost 모델을 최종 예측 모델로 선택합니다.

(2) 훈련 세트와 테스트 세트를 7:3으로 나눈 경우, XGBoost와 Random Forest의 경우 4가지 평가 지표 값이 감소한 반면, K-최근접 이웃 모델의 경우 4가지 평가 지표 값이 감소하는 것으로 나타났습니다. 개선되었으나 재현율은 로지스틱 회귀모델의 재현율만 1이었고 나머지 모델들은 0.98 이상으로 로지스틱 회귀모델 예측 효과가 가장 좋았으며 예측 정확도, 정밀도가 가장 높았다. , F1- 로지스틱 회귀 점수는 각각 0.947, {{10}}.922, 0.96이었습니다.

improve your memory

(3) 실험을 통해 서로 다른 구분에서 모델의 예측 효과가 서로 다르게 변화함을 알 수 있다. 서로 다른 두 세트의 실험에서 최적 모델을 비교하면 XGBoost 모델(훈련 세트와 테스트 세트를 8:2로 나눈 값)의 예측 정확도, 정밀도 및 F1-점수를 확인할 수 있습니다. 재현율이 1일 때 로지스틱 회귀 모델(훈련 세트와 테스트 세트를 7:3으로 나눈)보다 높으므로 XGBoost 모델(훈련 세트와 테스트 세트를 8:2로 나눈)이 작동합니다. 이 논문에서 확립된 모델에서 가장 좋습니다. 또한, 문헌[11-14]의 모델과 비교하여, 본 논문에서 확립한 XGBoost 모델은 더 나은 효과를 가지며 악성 유방암 세포를 정확하게 식별할 수 있다. 그러나 본 연구는 수치 데이터셋에 국한되어 있으며, 앞으로는 딥러닝 알고리즘을 활용하여 다양한 특징 추출 기법을 이미지 데이터(예: X-ray 이미지)에 적용하여 더 나은 분류 결과를 얻을 수 있도록 노력하겠습니다.

데이터 가용성

이 연구 결과를 뒷받침하는 데이터는 UCI 기계 학습 저장소(https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+%28Diagnostic%29)에서 공개적으로 제공됩니다.

이해 상충

저자는 이해상충이 없음을 선언합니다.

감사의 말

이 작품은 중국 국립자연과학재단(보조금 번호 61502156), 후베이 교육 위원회의 교육 및 연구 프로젝트(보조금 번호 282) 및 후베이 기술대학교 박사 재단(보조금 번호 BSQD13051)의 지원을 받았습니다.


참고자료

[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi 및 L. Chanderkant, "히마찰 주 심라의 1차 의료 종사자들 사이에서 유방암 위험 요인 및 조기 발견 방법에 대한 지식 프라데시," 교육 및 건강 증진 저널, vol. 8, p. 2019년 265일.

[2] MS Simon, TA Hastert, A. Barac 등, "여성 건강 계획에서 암 후 심혈관 대사 위험 요인 및 생존", Cancer, vol. 127, 아니. 4, pp. 598–608, 2021.

[3] HF Pasha, RH Mohamed, MM Toam 및 AM Yehia, "아디포넥틴 유전자의 유전적 및 후생적 변형: p," The Journal of Gene Medicine, vol. 21, 아니. 10, 페이지. e3120, 2019.

[4] D. Hong, AJ Fritz, SK Zaidi 등, "상피에서 중간엽으로의 전이 및 암 줄기 세포가 유방암 이질성에 기여합니다." Journal of Cellular Physiology, vol. 233, 아니. 12, 페이지 9136–9144, 2018.

[5] J. Zhong, D. Sun, W. Wei 등, "초기 유방암의 감시 림프절 생검을 위한 조영 강화 초음파 유도 미세 바늘 흡인", 의학 및 생물학의 초음파, vol. . 44, 아니. 7, pp. 1371–1378, 2018.

[6] K. Babic, C. Siguan-Bell, M. Hee 및 SC Lin, "안구 g: Ahmed 판막 수술 후 유지된 수술 스폰지의 초음파 B 스캔 평가: 사례 r," Journal of Glaucoma, vol. 26, 아니. 10, 페이지 e239–e241, 2017.

[7] A. Yala, PG Mikhael, F. Strand 등, "유방암 위험에 대한 강력한 유방 조영술 기반 모델을 향해", Science Translational Medicine, vol. 13, 아니. 578, 기사 ID eaba4373, 2021.

[8] G. Zheng, X. Liu 및 G. Han, "의료 영상 컴퓨터 지원 탐지 및 진단 시스템 검토", Journal of Software, vol. 29, 아니. 5, pp. 1471–1514, 2018.

[9] EY Huang, S. Knight, CR Guetter 등, "외과 전문 분야의 원격 진료 및 원격 멘토링: 서사적 검토, The American Journal of Surgery, vol. 218, no. 4, pp. 760–766, 2019.

[10] Q. Wu, BT Wang, HR Rao, Y. Jiang, C. Liu, "유방암 및 양성 질환 세포가 계측 연구를 형성합니다." Journal of Anhui Medical University, vol. 31, 아니. 02, pp. 91–93, 1996.

[11] Q. Shen, F. Shao, R. Sun, "xgboost 기반 유방암 예측 모델," 청도대학교 저널(자연과학판), vol. 32, 아니. 2019년 1월 1일

[12] Z. Deng, B. Su 및 K. Zhan. g, "앙상블 학습을 기반으로 한 유방암 분류", China Medical Devices, vol. 35, 아니. 2020년 12월 12일

[13] M. Monirujjaman Khan, S. Islam, S. Sarkar 등, "유방암 예측을 위한 기계 학습 기반 비교 분석," Journal of Healthcare Engineering, vol. 2022, 기사 ID 4365855, 15페이지, 2022.

[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle 및 W. Ibrahim, "유방암 분류를 위한 트리 기반 및 기계 학습 알고리즘 분석," 전산 지능 및 신경과학, vol. 2022, 기사 ID 6715406, 6페이지, 2022.

[15] H. Dong, L. Ma, "기계 학습 기반 삼중 음성 유방암 예측 모델," Journal of Yunnan University, vol. 39, 아니. 1, pp. 111–115, 2017.


For more information:1950477648nn@gmail.com


당신은 또한 좋아할지도 모릅니다