AttentionMNIST: 필기 숫자 및 알파벳 인식을 위한 마우스 클릭 주의 추적 데이터 세트
Feb 22, 2024
일련의 일별을 통해 물체를 인식하는 여러 주의 기반 모델은 손으로 쓴 숫자 인식에 대한 결과를 보고했습니다. 그러나 손으로 쓴 숫자나 알파벳 인식에 대한 주의 추적 데이터는 없습니다. 이러한 데이터의 가용성을 통해 주의 기반 모델을 인간의 성과와 비교하여 평가할 수 있습니다. 우리는 순차적 샘플링을 통해 이미지에서 손으로 쓴 숫자와 알파벳(대소문자)을 인식하려고 시도한 382명의 참가자로부터 마우스 클릭 주의 추적 데이터를 수집했습니다. 벤치마크 데이터세트의 이미지는 자극으로 표시됩니다. AttentionMNIST라고 불리는 수집된 데이터 세트는 일련의 샘플(마우스 클릭) 위치로 구성됩니다.각 샘플링에서 규정된 클래스 라벨 및 각 샘플링 기간. 평균적으로 참가자들은 인식을 위해 이미지의 12.8%만을 관찰합니다. 우리는 참가자가 다음 샘플링에서 선택할 위치와 클래스를 예측하기 위한 기준 모델을 제안합니다. 참가자들과 동일한 자극과 실험 조건에 노출되면 많이 인용되는 주의 기반 강화 모델은 인간의 효율성에 미치지 못합니다.

중국어 시스탄체목초- 알츠하이머병 예방 제품
일련의 일별을 통해 객체를 인식하는 기계 학습(ML) 모델은 확장성과 효율성으로 인해 최근 몇 년 동안 관심을 받았습니다. 1-7과 같은 이러한 모델 중 다수는 손으로 쓴 숫자 인식을 위한 벤치마크 MNIST 데이터 세트에 대한 실험 결과를 보고했습니다. 불행하게도 MNIST에 대한 주의 추적 데이터는 없습니다. 이는 인간의 성과와 비교하여 주의 기반 모델을 평가하는 것을 방지합니다. 우리는 순차적 샘플링을 통해 이미지에서 손으로 쓴 숫자와 알파벳을 인식하려는 성인 참가자로부터 데이터 세트를 수집하여 이러한 격차에 빠졌습니다. 눈 움직임 주의 추적(emAT)과 달리 참가자는 보고 싶은 이미지의 위치를 클릭합니다(마우스 클릭 주의 추적(mcAT)의 한 형태). 그 직후 그는 지금까지의 관찰을 바탕으로 객체가 속할 것으로 예측하는 클래스를 선택합니다. 따라서 각 샘플링 에피소드에서 우리의 데이터는 선택한 이미지 위치, 예측된 클래스 레이블, 참가자가 마지막 에피소드 이후 소요한 시간으로 구성됩니다. 각 이미지 이후 참가자는 자신의 성과(정확성과 효율성)에 따라 보상을 받습니다.

cistanche tubeulosa - 항알츠하이머병의 이점
손으로 쓴 숫자/알파벳 인식에 있어서 emAT에 비해 mcAT의 장점.
(1) 고기는 특히 정적 자극(이미지)8,9의 경우 고정 위치에 상당한 개인 내 및 개인 간 가변성을 포함합니다. 따라서 통계적으로 유의미한 결론에 도달하려면 많은 양의 눈 고정 데이터가 필요합니다. mcAT는 시선 추적 데이터10에서 흔히 발생하는 일부 기술적 노이즈 소스에 영향을 받지 않습니다. (2) 안구 운동은 자발적인 메커니즘과 비자발적인 메커니즘 모두에서 발생할 수 있습니다11. 작업에 따른 의사 결정을 촉진하기 위해 참가자에게 적절한 시간, 컨텍스트 및 강화 신호를 제시하며, 이는 ML 모델에도 제시될 수 있습니다. (3) emAT 데이터의 정밀도와 정확성은 안구 추적기에 따라 달라지지만 mcAT는 모든 장치에 독립적입니다. (4) 클래스 선택과 눈의 움직임을 동기화하는 것은 어려운 일입니다. 이를 극복하기 위해 우리의 경우 동일한 에피소드에서 샘플링 위치와 클래스를 선택합니다. (5) 마지막으로 우리의 방법은 12,13에서와 같이 Amazon Mechanical Turk(MTurk)를 사용하여 데이터 수집을 허용하며 이는 비용 및 시간 효율적이며 쉽게 재현 가능합니다.
기여.
우리는 382명의 참가자로부터 MTurk를 사용하여 AttentionMNIST라는 mcAT 데이터 세트를 수집했으며, 순차적 샘플링을 통해 이미지에서 손으로 쓴 숫자와 알파벳(대문자 및 소문자)을 정확하고 효율적으로 인식한 것에 대해 보상을 받았습니다. 벤치마크 데이터 세트(MNIST, EMNIST)의 이미지가 자극으로 표시됩니다. 숫자/알파벳 클래스당 평균 169.1개의 응답이 기록됩니다. 이 데이터 세트를 사용하여 다음을 보여줍니다. • 평균적으로 참가자는 숫자, 대문자 및 소문자 알파벳을 인식하는 데 4.2, 4.7 및 4.9 샘플이 필요하며 이는 각각 이미지 영역의 11.3%, 13.4% 및 13.7%에 해당합니다. . 여러 샘플을 사용하면 분류 정확도가 높아집니다. • 기준으로 제시된 모델은 참가자가 다음 샘플링 에피소드에서 선택할 클래스와 위치를 각각 74.4% 및 67.7%의 정확도로 예측할 수 있으며, 둘 다 모든 샘플링 및 데이터 세트에 대한 평균입니다. 샘플이 증가하면 클래스 예측 정확도가 증가하고 위치 예측 정확도가 감소합니다. • 참가자와 동일한 자극 및 조건에 노출될 때 많이 인용되는 강화 기반 반복 주의 모델(RAM)3은 숫자, 대문자 및 소문자 알파벳을 인식하는 데 3.7, 8.5, 7.6개의 샘플이 필요하며 이는 8.9%에 해당합니다. , 21.0%, 각각 이미지 영역의 18.7%. 다른 주의 기반 강화 모델(예: 1,2,4,5,7,14)도 인간 성과와 비교하여 유사하게 평가할 수 있습니다.

나 근처의 Cistanche 보충제-기억력 향상
Cistanche의 기억력 향상 및 알츠하이머병 예방 제품을 보려면 여기를 클릭하십시오.
【추가 요청】 이메일:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
관련된 일
mcAT에서 마우스 클릭의 시간적 순서는 안구 운동 스캔 경로와 유사합니다10. mcAT는 emAT가 상당한 상관관계를 갖고 있기 때문에 효과적으로 대체할 수 있습니다10,12,13,15-17. mcAT 연구에서는 애니메이션 및 무생물 이미지10, 자연 장면 이미지12,13, 정적 웹페이지13, 검색 페이지 레이아웃16, 시각적 비교를 위한 두 개의 영숫자 문자열 목록17과 같은 다양한 종류의 자극이 사용되었습니다. 그러나 mcAT는 필기 숫자/알파벳 분류 작업이나 주의 기반 분류 모델 평가에는 사용되지 않았습니다. mcAT 연구에서는 접촉 시간, 관심 영역(AOI)의 상대적 고정 빈도, AOI에서 적어도 한 번 클릭한 피험자의 상대적 비율10, 시험당 고정 횟수, 시험 내 수정, 체류 시간 및 스캔 경로와 같은 기능을 사용했습니다. , 고정 맵12,13, AOI 및 정보 흐름 패턴16. 타임스탬프가 표시된 클릭 위치의 순서와 예측 클래스 레이블은 분류 작업에서 주의 기반 모델 또는 인간의 효율성과 정확성을 평가하는 데 필요한 원시 데이터를 구성합니다. 이 데이터에서 다양한 기능을 파생할 수 있습니다. 시선 추적 데이터에 비해 여러 가지 이점을 제공하는 mcAT 데이터 세트는 AI, ML 및 기타 영역의 주의 기반 모델 연구에서 중요한 격차를 메웁니다. 우리의 데이터 세트를 통해 주의 기반 모델을 인간의 성과와 비교하여 평가할 수 있습니다. 무엇보다도 이는 실제로 널리 사용되는 효율적인 실시간 광학 문자 인식 시스템의 개발을 촉진할 것입니다(예18-20 참조). 시각적 고정을 안내하는 원리는 우리의 데이터 세트를 사용하여 가설을 세우고 테스트할 수 있습니다. 성공적인 원칙은 자율 주행과 같이 효율성이 주요 관심사인 실제 시각적 인식 작업을 위한 시스템을 개발하는 데 적용될 수 있습니다.
데이터
우리의 데이터는 각 참가자에 대한 일련의 T 에피소드로 구성됩니다. 각 에피소드의 데이터는 (1) 참가자가 클릭한 이미지 내 위치(회당 이미지 1회 클릭), (2) 참가자가 선택한 수업, (3) 참가자가 소요한 시간으로 구성됩니다. 참가자는 현재 샘플을 등록합니다(즉, 이미지의 마지막 클릭과 현재 클릭 사이에 경과된 시간). 이 섹션에서는 자극 선택, 참가자, 시각적 작업, 성과 채점 및 데이터 필터링을 포함한 데이터 수집 프로세스를 설명합니다.
자극 선택. 자극은 두 가지 벤치마크 데이터 세트의 이미지에서 선택됩니다. (1)
MNIST21 데이터 세트는 10개의 손으로 쓴 숫자 {0, 1, ..., 9}로 구성된 70,000 라벨 이미지(28×28 픽셀)로 구성됩니다. (2)
EMNIST22 데이터 세트는 대문자와 소문자로 된 손으로 쓴 영어 알파벳 이미지(28×28픽셀) 145,600개로 구성되어 균형 잡힌 클래스를 구성합니다. 모든 이미지에는 26개 클래스 {a, b, ..., z} 중 하나로 라벨이 지정됩니다. 그러나 대문자 또는 소문자 레이블은 이미지와 연결되지 않습니다. 각 카테고리에서 MNIST에서 올바른 형식의 숫자 15개와 EMNIST 대문자 및 EMNIST 소문자 데이터세트에서 각각 15개의 올바른 형식의 알파벳을 선택합니다. 잘 구성된 숫자나 알파벳은 해당 클래스의 표준과 유사합니다. 따라서 우리는 62개의 클래스 각각에 속하는 15개의 이미지로 구성된 15(10 + 26 + 26)=930 고유 이미지 세트의 자극을 제시합니다. 잘 구성된 930개의 이미지는 다음과 같이 선택됩니다.
1단계: 0와 1 사이에서 강도를 조정하기 위해 최소-최대를 사용하여 각 이미지를 정규화합니다.
2단계: 잘 구성된 EMNIST 이미지에 대문자 또는 소문자로 레이블을 지정합니다. 각 알파벳 클래스에 대해 대문자와 소문자 이미지 모두에서 올바른 형식의 알파벳을 수동으로 선택하고 레이블을 지정합니다. 해당 클래스에 속하는 모든 이미지와 두 개의 레이블이 지정된 이미지의 코사인 유사성이 계산됩니다. 코사인 유사성 임계값(경험적으로 0.8로 선택됨)보다 높은 이미지에는 대문자 또는 소문자 레이블이 할당됩니다.
3단계: 각 클래스에 속한 이미지의 평균을 계산합니다. 계급의 비열한 이미지가 그 계급의 규범을 구성합니다. 해당 클래스의 평균 이미지와 코사인 유사성이 경험적으로 결정된 임계값(MNIST의 경우 0.7, EMNIST의 경우 0.75)보다 큰 경우 이미지는 자극이 될 수 있습니다.
4단계: 적합한 이미지 중에서 각 클래스의 15개 이미지가 형식이 얼마나 좋은지에 따라 수동으로 선택됩니다. 원래 28×28 픽셀이었던 각 이미지는 강도 변화가 없기 때문에 경계 근처의 픽셀을 제거하여 27×25로 축소됩니다. 이 15개 이미지의 평균은 62개 클래스 각각에 대해 계산됩니다. 각 데이터세트의 n개 클래스에 대해 이러한 평균 이미지를 I1, I2, ..., In으로 표시합니다.
참가자들.
총 382명의 성인이 우리 연구에 참여했습니다. 선택 기준이 사용되지 않았습니다. 참가자는 여러 이미지에 응답할 수 있습니다. 62개 학급 각각 평균 169.1건의 응답이 기록됐다.

cistanche tubeulosa의 장점-항알츠하이머병
시각적 작업.
시각적 작업을 위한 MTurk 인터페이스는 그림 1에 나와 있습니다. 270×250 크기의 캔버스는 항상 낮은 강도의 배경 이미지를 표시합니다. 배경 및 자극 이미지는 270×250으로 10배 업샘플링됩니다. 캔버스의 중심이 이미지의 중심과 정렬됩니다. 배경 처음에 배경은 자극이 그려지는 데이터 세트에 있는 모든 이미지의 평균입니다. 첫 번째 에피소드 이후 배경은 마지막 에피소드에서 참가자가 선택한 클래스 집합의 모든 이미지의 평균입니다. 현실 세계에서 숫자나 알파벳의 위치, 크기, 방향에 대한 맥락은 여기에서는 누락된 인근 문자에서 얻습니다. 빈 배경에서 실험을 진행했을 때 참가자들은 물체의 어떤 부분도 포함하지 않은 이미지의 위치를 샘플링하는 경우가 많았습니다. 이 동작은 낮은 강도의 배경에서 선택한 클래스의 평균 이미지를 표시하고 모든 MNIST 및 EMNIST 이미지의 크기를 28×28 픽셀에서 27×25로 줄임으로써 억제되었습니다. 참가자가 캔버스에서 위치를 클릭하여 선택할 때마다 자극 이미지에서 해당 위치를 중심으로 하는 50×50 픽셀 패치가 표시됩니다. 한 번 공개된 패치는 마지막 에피소드까지 계속 표시됩니다. 참가자의 작업은 각 에피소드 t(t=1, ..., T)에서 세 단계로 구성됩니다.
1단계: 270×250 캔버스의 아무 곳이나 클릭하여 샘플링하려는 패치를 표시합니다. 첫 번째 클릭만 허용됩니다.
2단계: 지금까지 관찰한 모든 샘플에서 숫자/알파벳을 인식합니다. 참가자는 여러 수업을 선택할 수 있으며 캔버스 아래에 표시된 수업 목록에서 최소한 하나의 수업을 선택해야 합니다.
3단계: 계속 진행하려면 화면 하단의 "다음"을 클릭하세요. 수업을 정확하고 빠르게 추론하려면 참가자는 현재 에피소드까지 관찰한 내용을 고려하여 신중하게 위치를 선택해야 합니다. 에피소드에는 시간 제한이 없습니다. 그러나 이미지의 T개 에피소드에 대한 총 시간은 6분으로 제한됩니다. 우리는 주의 기반 필기 인식 또는 생성에 대해 많이 인용된 작품이 12번 미만의 일별을 사용했기 때문에 T=12를 선택합니다(예: RAM3은 7번의 일별 내에서 MNIST 숫자를 인식할 수 있고, DRAW23은 11개의 일별 내에서 MNIST 숫자를 생성할 수 있음) 인간은 12회보다 훨씬 적은 횟수로 손으로 쓴 숫자와 알파벳을 인식할 수 있습니다.
성과 채점. 관찰된 샘플 수의 정확성과 효율성을 바탕으로 참가자에게 점수가 할당됩니다. 그가 임의의 에피소드 t에서 선택한 클래스 세트로 둡니다. 10, t에서의 그의 점수는 다음과 같습니다:

그림 1. 참가자가 본 MTurk 인터페이스. EMNIST 대문자 알파벳에 대한 두 번째 샘플링이 표시됩니다.

어디 |.| 세트의 카디널리티를 나타냅니다. T개의 에피소드에서 획득한 총점은 h {{0}} T t=1 Pt입니다. 따라서 항상 올바른 클래스만 선택하면 T 에피소드에서 얻을 수 있는 최대 점수는 T입니다. 그가 항상 올바른 클래스를 포함하지 않는 클래스 세트를 선택하는 경우 T 에피소드에서 점수를 얻을 수 있는 최소 점수는 0입니다. 따라서 0은 h보다 작거나 같습니다. T보다 작거나 같습니다. 참가자가 올바른 클래스를 빨리 선택할수록 점수가 높아집니다. 따라서 이 채점 메커니즘은 인식 정확도와 샘플링 효율성을 고려합니다. 첫 번째 에피소드에서 하나의 클래스만 선택하여 점수를 최대화하려는 시도는 올바른 클래스가 아닌 경우 0점이 부여되고 참가자가 여러 클래스를 선택하는 경우 0보다 큰 점수가 부여되므로 위험합니다. 올바른 클래스를 포함하는 모든 클래스도 마찬가지입니다. 이는 참가자가 모든 에피소드에서 마음속에 있는 예상 클래스를 기반으로 응답하도록 동기를 부여합니다. 각 에피소드에서 부여된 점수는 T 에피소드가 끝난 후에만 공개되므로 참가자에게 어떠한 힌트도 제공되지 않습니다. MTurk에서 참가자가 이미지에 대해 받는 보상은 총점 h에 비례합니다.
데이터 필터링.
자극 이미지에 대한 마지막(즉 T번째) 에피소드에서 참가자의 점수가 0인 경우 해당 이미지에 대해 기록된 데이터는 삭제됩니다. 참가자가 작업을 완료하지 않은 채 떠나는 경우에도 데이터가 삭제됩니다. 이 선택 기준을 사용하여 MNIST에서 1736개 자극, EMNIST 대문자에서 4431개 자극, EMNIST 소문자에서 4315개 자극에 대한 응답을 얻었습니다. 즉, 수업당 평균 169.1개의 응답입니다.
데이터 활용 모델 및 방법
이 섹션에서는 (4.1) 참가자의 행동을 예측하기 위한 기본 모델을 제공하고 (4.2) 기존 주의 기반 강화 모델을 인간의 숫자/알파벳 인식과 비교할 수 있는 방법을 보여줌으로써 수집된 데이터의 유용성을 설명합니다. 성능. 행동 예측을 위한 기준선. 모든 에피소드의 행동은 위치 선택과 클래스 선택으로 구성됩니다. 샘플에는 서로 다른 관찰자 또는 서로 다른 시간의 동일한 관찰자에 대해 서로 다른 양의 정보가 포함되어 있으므로 각 참가자의 행동 예측은 어려운 문제입니다. n을 데이터세트의 클래스 수, etat를 t의 자극 이미지에 대한 실제 클래스를 포함하는 싱글톤 세트, ct는 클래스 세트, lt는 t에서 참가자가 관찰한 위치로 선택한 위치로 설정합니다. t, 1:t는 시퀀스 1, 2, ..., t를 나타냅니다. 임의의 t까지 참가자의 관찰은 o1:t이고 그가 선택한 위치는 l1:t입니다. 우리는 참가자의 행동 예측 문제를 다음과 같이 공식화합니다: 클래스 예측 o1:t 및 l1:t가 주어지면 i∈ct (i=1, 2, ..., n)의 확률을 추정합니다. 즉, P( i ∈ ct|o1:t, l1:t). 위치 예측 그의 o1:t, l1:t 및 ct, 즉 P(lt+1|o1:t, l1:t,ct)를 고려하여 lt+1의 확률을 추정합니다. 수업 예측. 참가자가 에피소드 t에서 선택할 클래스를 예측하기 위해 참가자가 선택한 위치 l1:t와 해당 관측값 o1:t를 고려하여 t에서의 이미지 자극이 클래스 I에 속할 확률을 다음과 같이 계산합니다.

여기서 Ii는 클래스 i에 속하는 자극 이미지(27×25)의 평균이고, I'는 l1:t에 o1:t를 포함하는 27×25 이미지입니다. ·는 스칼라 곱을 나타내고, .는 유클리드 표준을 나타냅니다. 모든 픽셀 강도는 음수가 아닙니다. 임의의 에피소드 t에서, 신념 분포 P(i|o1:t, l1:t)로부터 k개의 가장 높은 가능성 클래스는 우리 모델에 의해 예측된 클래스 세트 ˆct를 구성합니다. 여기서 k=|ct|입니다. 분류 정확도는 Jaccard 지수(JI)를 사용하여 측정됩니다. JI는 J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|와 같이 두 집합 X와 Y 사이의 유사성을 측정합니다. JI는 0과 1 사이로 제한됩니다. X=Y, J(X, Y)=1인 경우. 모든 에피소드 t에서 참가자의 분류 정확도는 J(θt,ct)이고 우리 모델의 분류 정확도는 J(θt, ˆct)입니다. 분모로 인해 JI는 예측 세트(ct 또는 ct)에서 eta에 포함되지 않은 요소 수가 증가할수록 더 많은 페널티를 적용합니다. 이는 우리의 경우 바람직한 속성입니다. 참가자 분류와 모델 분류 간의 유사성은 J(ct, ˆct)로 측정됩니다. 우리 모델은 또한 각 참가자에 대한 수업 선택 및 거부 정확도 측면에서 평가됩니다. st=ct − ct−1을 선택된 새 클래스 세트로 설정하고 rt=ct−1 − ct를 t에서 참가자가 거부한 클래스 세트로 설정합니다. 마찬가지로, ˆst=ˆct − ct−1은 선택된 새 클래스 세트이고 ˆrt=ct−1 − ˆct는 t에서 우리 모델에 의해 거부된 클래스 세트입니다. 그런 다음 모델의 클래스 선택 및 거부는 |st|일 때 참가자의 J(st, ˆst)와 비교할 수 있습니다. > 0 및 J(rt, ˆrt) |rt| > 0입니다. 위치 예측. 가설 이상적으로, 모든 클래스에 대한 믿음 분포는 참가자가 자극(환경)의 클래스(상태)에 대해 확신을 가지고 있음을 나타내는 모양에서 단봉(즉, 하나의 피크만)과 얇은 가우스(즉, 작은 표준 편차)여야 합니다. 그러나 우리의 데이터(그림 2 참조)에서 알 수 있듯이 참가자는 특히 처음 몇 번의 에피소드 동안 여러 클래스 간에 혼동을 일으키는 경우가 많습니다. 이 경우 그의 믿음 분포는 여러 개의 정점을 가지거나 뚱뚱한 가우시안입니다. 우리는 참가자의 목표가 단봉 및 얇은 가우스로 수렴하여 하나를 제외한 모든 클래스의 확률을 줄이는 위치를 선택적으로 샘플링하는 것이라고 가정합니다. 이 가설은 안구 운동을 포함하여 행동을 안내하는 잘 알려진 원리인 클래스(환경 상태)에 대한 불확실성을 최소화합니다.

그림 2. '0', 'a' 및 'A' 카테고리에 속하는 모든 참가자 및 자극에 대한 지속 시간 및 클래스 분포.
Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>θ, 여기서 임계값 θ=0.5 × max(D)는 경험적으로 결정된 스칼라 수량입니다.
우리는 함수 g의 후보로 Kullback-Leibler(KL) 발산과 차이라는 두 가지 비대칭 측정항목을 고려합니다. KL 발산 두 개의 정규화된 평균 이미지 Ii와 Ij가 주어지면 KL 발산 KL(Ii, Ij)는 Ij를 사용하여 Ii를 근사할 때의 정보 손실을 측정합니다. 이는 각 픽셀 k에 대해 다음과 같이 계산됩니다. KL(Ii,k, Ij,k)=Ii,k log δ + Ii,k Ij,k+δ, 여기서 Ij,k는 k번째 픽셀의 강도입니다. Ij이고, δ는 정규화 상수입니다. Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0일 때. 차이 두 정규화된 평균 이미지 Ii와 Ij가 주어지면 각 픽셀 k의 차이는 Diff (Ii,k, Ij,k)=Ii,k − Ij,k입니다. Ii,k=Ij,k, Diff(Ii,k, Ij,k)=0일 때. 참가자는 현재 에피소드에서 선택한 클래스 세트 ct에 대해 확신이 없습니다. 따라서 위치 예측을 위해 ct의 클래스를 포함하는 D의 돌출 맵만 고려합니다. 이러한 돌출성 지도를 기반으로 두드러지고 참가자가 선택한 적이 없는 경우 위치가 예측됩니다. Tus, o1:t, l1:t 및 ct가 주어지면 위치 lt+1는 다음과 같이 예측됩니다.

여기서 Ŵ는 예측 위치 ˆl, (i)에 대해 두드러진 클래스, 그리고 어떤 클래스(j)를 포함하는 3-튜플의 집합입니다. �l − lt+1� < ē, I ∈ ct+1 및 j /∈ ct{{3}와 같은 �l, i, j� ∈ Ŵ이 존재하는 경우 Te 위치가 올바르게 예측됩니다. }, 여기서 는 관찰 패치의 중앙 픽셀과 픽셀 사이의 최대 유클리드 거리입니다. 위치 예측을 위한 의사 코드는 알고리즘 1에 나와 있습니다. 의사 코드에 대한 자세한 설명은 보충 자료의 섹션 S1에 포함되어 있습니다. (확률 분포 P(lt+1|o1:t, l1:t,ct)는 Ŵ에 포함되지 않은 위치의 돌출 점수를 0으로 가정하고 모든 위치의 돌출 점수를 정규화하여 계산할 수 있습니다. 그러나 이 확률은 이 논문의 목적에 충분하기 때문에 식 (3)이 사용되지 않았습니다.)

주의 기반 모델 평가.
Attention 기반 모델의 대표로서 우리는 MNIST 데이터 세트에 대한 실험 결과를 보고하는 많이 인용되는 RAM(Recurrent Attention 모델)3을 고려합니다. 이 강화 모델은 이미지를 순차적으로 샘플링하고 각 샘플링 순간에 다음 샘플링 위치를 결정하므로 수집된 데이터를 사용하여 평가하는 데 적합합니다.
램
일련의 일별을 사용하여 이미지를 분류합니다. 다음 위치는 위치 네트워크에 의해 매개변수화된 분포로부터 확률적으로 선택됩니다. 모델은 다음 목표를 최대화하여 엔드 투 엔드로 학습됩니다.3:

여기서 M은 에피소드 수, T는 관찰 수, xi 1:t는 I 에피소드까지 현재 에이전트를 실행하여 얻은 상호 작용 시퀀스, ui t는 현재 작업, θ는 훈련 가능한 매개변수 세트, Ri t 는 누적 보상, bt는 기준선, π(ui t|xi 1:t; θ )는 정책입니다. RAM의 행동은 RAM에 의해 예측된 위치 시퀀스와 참가자가 선택한 위치 시퀀스에서 얻은 고정 맵을 비교하여 참가자의 동작과 비교할 수 있습니다. fxation 맵은 각 위치에 선택 빈도와 동일한 값을 할당한 다음 해당 값을 정규화하여 모든 위치에 대한 분포를 생성함으로써 계산됩니다.
고정 맵을 비교하기 위한 측정항목입니다. 두 개의 고정 맵 P와 Q를 비교하는 메트릭의 경우 26을 밀접하게 따릅니다. KL 발산(KL), 피어슨 상관 계수(CC) 및 유사성(SIM)의 세 가지 분포 기반 메트릭을 사용하여 샘플링 위치의 분포를 비교합니다. 수집된 데이터에 기록된 참가자의 모델과 함께.
KL(앞서 정의됨)은 0 값에 매우 민감합니다.
CC는 다음과 같이 두 맵 간의 선형 관계를 평가할 수 있습니다. CC(P, Q)=σ (P, Q) σ (P)σ (Q), 여기서 σ는 분산 또는 공분산입니다. CC는 대칭형이므로 고정 맵 간의 차이가 위양성 또는 위음성으로 인한 것인지 추론할 수 없습니다.
SIM은 26으로 측정됩니다: SIM(P, Q)=k min(Pk, Qk), 여기서 k Pk=k Qk=1. CC와 마찬가지로 SIM은 대칭형이며 동일한 단점을 상속받습니다. 또한 SIM은 누락된 값에 매우 민감하며 실제 밀도를 설명하지 못한 예측에 페널티를 적용합니다.
인간과 동물 연구.
멤피스 대학의 기관 검토 위원회(Institutional Review Board)는 이 연구가 인간 대상 연구에 대한 인간 대상 연구 보호국 정의를 충족하지 않으며 45 CFR 파트 46이 적용되지 않는다고 결정했습니다. 따라서 본 연구는 IRB의 승인이나 검토가 필요하지 않습니다.
실험 결과 데이터 분석.
수집된 데이터는 선택한 위치의 분포 순서(그림 3), 선택한 클래스(그림 2), 연속 에피소드 간 기간(그림 2)의 측면에서 시각화할 수 있습니다. 이러한 분포는 세 가지 데이터 세트에서 매우 유사합니다. 숫자나 알파벳의 경우 최종 에피소드 이후 선택한 위치의 분포는 데이터 세트에서 해당 클래스의 픽셀 강도 분포와 유사합니다. 그러나 선택된 위치의 순서는 본질적으로 확률론적입니다. 클래스 분포는 참가자가 여러 클래스를 선택할 때 처음 몇 번의 에피소드에서 유사한 구조를 가진 범주 간의 혼란을 나타냅니다. 샘플링을 많이 하면 이러한 혼란이 줄어듭니다. 혼란 정도(선택한 클래스 수/전체 클래스 수)와 샘플링 기간 사이에는 유의미한 양의 상관관계가 있습니다(그림 4 참조). 선택한 클래스 수가 높으면(낮음) 연속 에피소드 간의 기간이 높습니다(낮음). 한 수업에 대해 참가자가 선택한 일련의 위치에 대한 CC는 중요하지 않습니다(표 1). 이는 정적 이미지 샘플링의 피사체 간 가변성으로 인해 예상됩니다. 참가자가 클래스를 정확하게 예측하기 위해 필요한 평균 샘플링 수는 매우 낮습니다. MNIST, EMNIST 대문자, 소문자 이미지를 각각 정확하게 분류하는 데에는 평균 36초, 44.1초, 48.1초에 해당하는 4.2, 4.7, 4.9개의 샘플이 소요됩니다. 참가자들은 숫자, 대문자, 소문자 알파벳 이미지를 정확하게 분류하기 위해 평균적으로 이미지 영역의 11.3%, 13.4%, 13.7%만을 보았습니다(보충 자료의 그림 S2 참조). 이러한 결과는 비록 시선 추적 데이터보다 해상도는 낮지만 노이즈와 가변성은 적음에도 불구하고 인간의 시각적 추론 시스템의 효율성을 강조합니다. 이러한 경험적 결과는 실제 애플리케이션을 위한 주의 기반 모델을 설계하는 데 유용할 수 있습니다. 행동 예측. 이 섹션에서는 기본 모델의 성능이 각 참가자의 위치와 클래스 선택을 얼마나 정확하게 예측할 수 있는지 평가합니다. 두 가지 돌출성 점수 함수인 KL divergence와 차이를 사용한 실험 결과는 매우 유사하므로 달리 명시하지 않는 한 결과는 차이만 사용하여 보고됩니다. 수업 예측. 클래스 예측 및 정확도 평가 방법은 "클래스 예측" 섹션에 설명되어 있습니다. 그림 5에 표시된 클래스 예측 정확도는 모든 샘플링에 대해 모든 클래스에 대해 계산됩니다. 모든 샘플링 및 데이터 세트에 대한 평균 클래스 예측 정확도는 74.4%(표준 개발 26.5)입니다. 그림 5a 및 b는 참가자와 기본 모델(Eq. 2)에 의해 선택된 클래스 세트가 초기 에피소드에서는 매우 부정확하고 샘플이 증가함에 따라 향상된다는 것을 보여줍니다. 그림 5c는 초기 에피소드 동안 이 두 세트 ct와 ct가 상당히 다르다는 것을 보여줍니다. 유사성은 샘플이 증가함에 따라 증가합니다. 새로운 클래스 선택에도 동일하게 적용됩니다(그림 5f 참조). 그러나 수업 거부는 초기 에피소드에서 유사합니다. 샘플이 많을수록 유사성은 더욱 증가합니다 (그림 5e 참조). 이후 J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| 그리고 J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)|, 그림 5e, f에서 초기 에피소드에서 ct−1과 ct ∪ ˆct 사이의 교차점이 작다는 것을 추론할 수 있으며, 이는 초기에 참가자와 기본 모델이 있음을 나타냅니다. 연속되는 에피소드 사이에 클래스 선택을 많이 변경합니다. 따라서 초기에 클래스 선택 과정은 매우 확률적입니다. 초기 에피소드 동안 참가자와 모델의 클래스 예측 사이에는 약간의 차이점이 있지만 샘플이 많아질수록 동작은 점점 더 유사해집니다. 처음 몇 번의(일반적으로 4~7회) 에피소드 동안 자극의 매우 두드러진 부분이 드러납니다. 이는 이후 샘플링에서 올바른 클래스만 선택하는 데 도움이 되므로 예측 정확도가 높아집니다. 처음 몇 번의 에피소드 동안 관찰된 자극 부분과 평균 템플릿이 일치하는 클래스가 많기 때문에 클래스 선택 프로세스는 확률론적이므로 참가자와 모델의 분류 정확도가 낮아집니다.

그림 3. 각 숫자/알파벳 클래스 및 각 샘플링 에피소드에 대해 모든 참가자에 대한 샘플링 위치 분포. 각 행은 클래스에 해당하고, 각 열은 왼쪽에서 오른쪽으로 증가하는 샘플링 에피소드에 해당합니다.
위치 예측. 모든 샘플링과 데이터 세트에 대해 평균을 낸 기준 모델(식 3)의 위치 예측 정확도는 67.7%(표준 개발 14.1)입니다(그림 5d 참조). 이 예측 정확도의 추세는 클래스 예측 정확도의 추세와 반대입니다. 그러나 설명은 동일하게 유지됩니다. 초기 샘플링에서는 위치 예측 정확도가 높습니다. 왜냐하면 이러한 에피소드 중에 가장 두드러진 위치가 선택되고 이후 에피소드에서는 덜 두드러진 위치가 선택되기 때문입니다. 돌출성이 낮은 위치가 많기 때문에 선택 프로세스가 확률론적이어서 예측하기 어렵고 샘플링이 증가함에 따라 예측 정확도가 감소합니다. 클래스 수와 식별에 유용한 매우 두드러진 위치의 수가 데이터 세트마다 다르기 때문에 감소 추세는 각 데이터 세트마다 고유합니다(그림 5d 참조). 클래스 수가 적고 식별력이 높은 위치가 많을수록 샘플링이 증가함에 따라 위치 예측 정확도가 더 빨리 감소합니다.

그림 4. (왼쪽) 모든 클래스에 대해 평균을 낸 연속 샘플 간의 시간 차이(초)에 대한 오류 막대 플롯. Tat는 샘플링 에피소드 t에 표시된 값은 t - 1과 t에서 참가자의 이미지 클릭 사이에 경과된 시간입니다. (오른쪽) 각 에피소드의 모든 클래스에 대한 평균 혼란에 대한 오류 막대 플롯. 오류 막대는 표준을 나타냅니다. 개발자

그림 5. 기본 모델 평가("행동 예측을 위한 기준" 섹션 참조). (a) 참가자의 분류 정확도(ac.) 및 (b) 실제 레이블을 기준 진실로 사용하는 기본 모델의 정확도. (c) 분류 유사성(J(ct, ˆct)), (d) 위치 예측 정확도, (e) 클래스 거부 정확도 및 (f) 참가자 데이터를 기준 진실로 사용하는 기준 모델의 클래스 선택 정확도. 자세한 내용은 "행동 예측" 섹션을 참조하세요.

표 1. 동일한 클래스에 대한 FXation 시퀀스의 평균 Pearson 상관 계수(corr.) 모든 고정의 경우 거리는 유클리드이고 방향은 자극 중심을 원점으로 기준으로 하는 극각으로 측정됩니다. 표준 개발자 괄호 안에 포함되어 있습니다.
RAM 평가.
각 클래스 및 샘플링에 대해 RAM의 고정 맵(github.com/hehefan/Recurrent-Attention-Model의 RAM 구현을 사용함)과 MTurk에 제시된 동일한 자극에 대해 수집된 데이터가 비교됩니다. 참가자와의 공정한 비교를 위해 RAM에서 시퀀스 길이를 이미지 중심의 첫 번째 샘플링 위치인 T= 12에 고정하고 입력 관찰을 선택한 위치를 중심으로 하는 5×5 패치로 고정했습니다. 보상 함수를 Eq.로 수정했습니다. (1). Te 누적 보상, Rt는 Eq. (4,)는 Eq.에서 얻은 누적 점수 t τ=1 Pτ로 대체됩니다. (1). 참가자는 모든 에피소드에서 여러 클래스를 선택할 수 있으므로 RAM 모델의 경우 가장 높은 확률을 기반으로 단일 클래스를 예측하는 대신 모든 클래스에 대한 평균 확률을 임계값으로 간주하고 더 큰 확률로 클래스 세트 ct를 예측합니다. 한계점. 이 ct는 Eq.를 사용하여 점수를 계산하는 데 사용됩니다. (1). 이러한 조건에서 RAM은 MNIST 숫자, 대문자 및 소문자 EMNIST 알파벳을 인식하기 위해 3.7, 8.5 및 7.6 샘플이 필요하며 이는 각각 이미지 영역의 8.9%, 21.{19}}%, 18.7%에 해당합니다. 따라서 참가자("데이터 분석" 섹션 참조)와 비교할 때 RAM은 효율성이 떨어집니다. 표 2를 참조하십시오. RAM의 고정 맵과 수집된 데이터를 비교한 결과는 표 3에 나와 있습니다. KL은 0 값에 대한 민감도로 인해 더 높습니다. 이는 참가자가 여러 위치를 샘플링하지만 RAM에서는 샘플링하지 않음을 의미합니다. 이러한 실험은 주의 모델에 의해 샘플링된 위치를 평가하기 위한 기준으로 사용될 수 있습니다.

cistanche 혜택 - 기억력 향상
토론
본 논문에서 사용된 mcAT 패러다임은 물체 인식 메커니즘을 연구하기 위해 눈의 움직임과 시선에 주로 의존하는 패러다임과 몇 가지 차이점이 있습니다. 후자에서는 장면의 두드러진 부분이 먼저 주의를 끌고 눈의 시선을 두드러진 위치로 향하는 단속적인 안구 움직임이 뒤따릅니다. 시선은 돌출 정보와 함께 객체 인식을 위한 눈 움직임을 안내하는 우선 순위 맵을 형성하는 상향식 및 하향식 신호에 의해 구동됩니다. 본 연구의 참가자들은 자유로운 시청 조건에서 충분한 시간(T=12 샘플링의 경우 6분)을 두고 정적 이미지를 보았기 때문에 탐색을 위해 일련의 안구 운동이나 시각적 추론28에 참여했을 가능성이 높습니다. AOI를 클릭하기 전의 이미지. 이러한 눈 움직임은 emAT(안구 추적기 사용)에서는 캡처될 수 있지만 mcAT에서는 캡처되지 않습니다. 그러나 이러한 눈의 움직임은 딴생각의 영향을 받습니다. mcAT도 정신 분산의 영향을 받는 반면29 참가자가 시각적 추론 후 반응할 때마다 효과가 줄어들 수 있습니다. 자극에 대한 안구 운동은 현재 작업의 영향을 받기 때문에 참가자의 안구 운동 패턴은 각 샘플링에서 할당된 3단계 작업(참조 "시각적 작업" 섹션)의 영향을 받을 가능성이 높습니다. 아이트래커를 사용했다면 샘플을 탐색하기 위한 참가자의 눈 움직임이 선택한 클래스를 클릭하기 위한 눈 움직임과 혼합되어 샘플의 시각적 탐색 해석이 복잡해졌을 것입니다. 클래스를 클릭하는 것은 참가자의 마음속에 있는 예측 클래스를 비록 성찰적으로 드러내기 때문에 필요한 단계입니다. AOI 선택 직전과 직후의 시선(아마도 고정 안구 움직임의 도움을 받았음)이{10}숫자/알파벳 인식에 가장 큰 기여를 했을 가능성이 높습니다. 실제로 우리는 참가자들이 클래스를 구별하기 위해 이미지의 진단 영역을 선택했으며 해당 영역에는 상향식(예: 시각적 대비) 및 하향식(숫자/알파벳 템플릿) 진단 정보가 혼합되어 있을 가능성이 있다고 추측합니다. 이는 참가자가 진단 패치를 선택하여 표면적으로 자극 클래스를 신속하게(평균 5개 샘플 이내) 구별한다는 우리의 발견과 일치합니다.

표 2. 숫자/알파벳을 인식하는 데 필요한 평균 샘플 수 측면에서 참가자와 RAM 모델 간의 효율성 비교. 관찰된 이미지 영역의 백분율은 괄호 안에 포함됩니다.

표 3. MTurk 실험에서 제시된 자극에 대한 RAM의 고정 맵 평가는 모든 클래스 및 샘플링에 대해 평균화되었습니다. 표준 개발자 괄호 안에 포함되어 있습니다.
결론
우리는 순차적 샘플링을 통해 손으로 쓴 숫자와 알파벳을 인식하기 위한 mcAT 데이터 세트를 도입했습니다. 데이터는 벤치마크 데이터 세트(MNIST, EMNIST)에서 선택한 이미지를 제시한 382명의 참가자로부터 수집되었습니다. 숫자/알파벳 클래스당 평균 169.1개의 응답이 기록됩니다. 데이터는 인간의 시각적 인식의 효율성을 밝히기 위해 엄격하게 분석됩니다. 참가자들은 인식을 위해 이미지의 12.8%만을 관찰했습니다. 우리는 참가자가 다음 샘플링에서 선택할 위치와 클래스를 예측하기 위한 기준 모델을 제안했습니다. 우리는 실험 조건과 데이터를 사용하여 인간 성과와 비교하여 주의 기반 강화 모델을 평가하는 방법을 보여주었습니다. 시선 추적 데이터에 비해 여러 가지 이점을 제공하는 이 mcAT 데이터 세트는 AI, ML 및 기타 영역의 주의 기반 모델 연구에서 중요한 격차를 메웁니다.
참고자료
1. 매사추세츠주 란자토(Ranzato)는 어디를 봐야 하는지 학습합니다. arXiv:1405.5488, (2014).
2. Ba, J., Salakhutdinov, RR, Grosse, RB, & Frey, BJ 기상-수면 반복 주의 모델을 학습합니다. NIPS, 2593–2601(2015).
3. Mnih, V. et al. 시각적 주의의 반복 모델. NIPS, 2204~2212(2014).
4. Ba, J., Mnih, V., & Kavukcuoglu, K. 시각적 주의를 통한 다중 객체 인식. arXiv:1412.7755 (2014).
5. Dutta, JK & Banerjee, B. 흘끗 본 횟수에 따른 분류 정확도의 변화. IJCNN, 447–453(IEEE, 2017).
6. Larochelle, H. & Hinton, GE 3차 볼츠만 기계와 중심와를 결합하는 방법을 학습합니다. NIPS, 1243–1251(2010).
7. Elsayed, G., Kornblith, S. & Le, QV Saccader: 시력에 대한 하드 어텐션 모델의 정확성 향상. NIPS, 702–714(2019).
8. van Beers, RJ Te 단속성 안구 운동의 가변성의 원인. J. Neurosci. 27(33), 8757-8770(2007).
9. Itti, L. & Baldi, P. 베이지안 놀라움은 인간의 관심을 끌고 있습니다. 비스. 결의안. 49(10), 1295-1306(2009).
10. Egner, S. et al. 주의 및 정보 획득: 마우스 클릭과 눈 움직임 주의 추적 비교. J. Eye Mov. 결의안. 11(6), (2018).
11. Peterson, MS, Kramer, AF & Irwin, DE 은밀한 주의 전환은 비자발적인 안구 운동보다 먼저 일어납니다. 지각. 정신 물리학. 66(3), 398-405(2004).
12. Jiang, M. et al. 실리콘: 맥락에서의 두드러짐. CVPR, 1072–1080(2015).
13. Kim, NW et al. BubbleView: 이미지 중요도 지도를 크라우드소싱하고 시각적 관심을 추적하기 위한 인터페이스입니다. ACM 트랜스. 계산. 흠. 상호작용. 24(5), 1–40(2017).
14. Sermanet, P., Frome, A. & Real, E. 세밀한 분류에 주의하세요. arXiv:1412.7054 (2014).
15. Egner, S., Itti, L. & Scheier, C. 주의 모델을 다양한 유형의 행동 데이터와 비교합니다. 조사하다. 안과. 비스. 과학. 41(4), S39(2000).
16. Navalpakkam, V. et al. 비선형 페이지 레이아웃이 있는 경우 눈-마우스 동작을 측정하고 모델링합니다. Proc에서 국제 회의 WWW, 953–964 (2013).
17. Matzen, LE, Stites, MC & Gastelum, ZN 시선 추적기 없이 시각적 검색 연구: 인공 중심와 평가. 인지. 결의안. 왕자 암시적. 6(1), 1–22(2021).
18. Tafi, AP et al. 서비스로서의 OCR: Google Docs OCR, Tesseract, ABBYY FineReader 및 Transym에 대한 실험적 평가입니다. Int. 증상 비스. 계산., 735–746(스프링거, 2016).
19. Memon, J., Sami, M., Khan, RA & Uddin, M. 필기 광학 문자 인식(OCR): 종합적인 체계적 문헌 검토(SLR). IEEE 액세스 8, 142642-142668(2020).
20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK 광학 문자 인식 시스템. Sof Computing을 사용한 다양한 언어의 광학 문자 인식 시스템, 9–41(Springer, 2017).
21. LeCun, Y. et al. 문서 인식에 적용된 그라데이션 기반 학습입니다. 진행 IEEE86(11), 2278-2324(1998).
22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: MNIST를 손으로 쓴 편지로 확장. arXiv:1702.05373, (2017).
23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: 이미지 생성을 위한 순환 신경망. ICML, 1462~1471(2015).
24. Friston, K. Te 자유 에너지 원리: 뇌에 대한 대략적인 안내?. 트렌드 코그. 과학. 13(7), 293-301(2009).
25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. 능동적 추론을 기반으로 한 선택적 주의 베이지안 모델을 소개합니다. 과학. 국회의원 9(1), 1~22(2019).
26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. & Durand, F. 다양한 평가 지표가 돌출 모델에 대해 무엇을 알려줍니까? IEEE 트랜스. 패턴 애널. 마하. 인텔. 41(3), 740-757(2018).
27. Itti, L. & Koch, C. 시각적 주의의 전산 모델링. Nat. Neurosci 목사. 2(3), 194-203(2001).
28. Lamme, VAF 의식적 시각을 생성하는 시각 기능. 앞쪽. 심리학., 11, (2020).
29. da Silva, MRD & Postma, M. 방황하는 마음, 방황하는 쥐: 방황하는 마음을 탐지하는 방법으로 컴퓨터 마우스 추적. 계산. 흠. 행동. 112, 106453(2020).
30. Schütz, AC, Braun, DI & Gegenfurtner, KR 안구 운동 및 인식: 선택적 검토. J. 비스. 11(5), 9~9(2011).
31. Intoy, J. & Rucci, M. 미세하게 조정된 눈 움직임은 시력을 향상시킵니다. Nat. 커뮤니케이터 11(1), 1–11(2020).






