그들은 소리로 키 입력을 결정하는 방법을 개발했습니다. 

소리로 키 입력 감지

소리에 의한 키 입력 감지는 청취 장치를 대상 가까이에 배치하여 달성됩니다.

정보를 얻고 X 섹션에 액세스하기 위해 발견 및/또는 개발된 방법에 상당히 감명받을 때마다 X 장치를 해킹합니다. 정보를 얻기 위해 CPU 팬에서 생성되는 소리와 벽을 통해 볼 수 있는 사용 등이 있습니다.

그래서 저는 개인적으로 이런 종류의 소식을 블로그에 공유하는 것을 정말 좋아하는데요, 오늘은 연구팀이 개발 한 새로운 방법 에 대한 소식을 전해드리겠습니다. 이 방법 은 근처 스마트폰으로 녹음하거나 근처 마이크로 캡처한 키 입력 소리를 분석하여 95%의 정확도로 키보드에 입력된 정보를 감지하는 기술입니다 .

본 연구에서 제시하는 입력 탐지 정확도는 언어 모델을 사용하지 않는 기존의 모든 음향 기반 문자-기호 분석 방법을 능가합니다. 제안된 방법은 공격자가 피해자 옆에 스마트폰을 두고 있거나 피해자가 기밀 정보를 입력하는 동안 음성 녹음을 확보한 경우(예: 피해자가 통신 중에 정보 시스템에 비밀번호로 로그인하는 경우) 입력된 비밀번호나 메시지를 파악하는 데 활용될 수 있습니다.

딥 러닝의 최근 발전, 마이크의 편재성, 개인 장치를 통한 온라인 서비스의 증가로 음향 사이드 채널 공격은 그 어느 때보다 키보드에 더 큰 위협이 됩니다.

입력은 다른 키를 누를 때 소리 특성과 볼륨 수준을 고려하는 기계 학습 모델을 기반으로 하는 분류기를 사용하여 다시 생성됩니다.

공격을 실행하려면 모델의 사전 학습이 필요하며 , 이 학습에는 입력 소리와 눌린 키 정보를 대조하는 과정이 포함된다고 언급되어 있습니다 . 이상적으로는 대상 컴퓨터에 설치된 악성 소프트웨어를 사용하여 모델을 학습시킬 수 있으며, 이를 통해 마이크 녹음과 키 입력 가로채기를 동시에 수행할 수 있습니다.

보다 현실적인 시나리오에서는 입력된 문자 메시지를 화상 회의 결과로 녹음된 세트의 오디오와 일치시켜 모델을 훈련하는 데 필요한 데이터를 수집할 수 있습니다. Zoom 및 Skype 화상 회의 입력 분석을 기반으로 모델을 교육할 때 입력 감지 정확도는 각각 93% 및 91,7%로 약간 감소합니다.

Zoom 회의의 오디오를 사용하여 기계 학습 모델을 교육하는 실험에서 키보드의 36개 키(0-9, a-z)를 각각 다른 손가락과 다른 힘으로 연속 25번 눌렀습니다.

각 펄스의 소리에 대한 데이터는 시간에 따른 소리의 주파수와 진폭 변화를 반영하는 스펙트로그램 이미지로 변환되었습니다.

스펙트로그램은 머신 비전 시스템에서 이미지 분류에 사용되는 CoAtNet 모델 기반 분류기 학습에 사용되었습니다 . 즉, 학습 과정에서 이미지는 각 키 입력의 스펙트로그램과 해당 키 이름을 비교합니다. 소리에 의해 눌린 키를 판별하기 위해 CoAtNet 모델은 전송된 스펙트로그램을 기반으로 가장 가능성이 높은 키를 반환합니다. 이는 이미지를 통해 객체를 인식할 때 가장 가능성이 높은 레이블을 반환하는 것과 유사합니다.

향후 연구원들은 스마트 스피커의 소리를 녹음하여 키보드 입력을 재현할 수 있는 가능성을 탐색하고, 입력 텍스트 판단의 정확성을 향상시키기 위해 전체 단어의 맥락에서 입력을 분류하는 언어 모델을 사용할 예정입니다.

마지막으로, 이 주제에 대해 더 자세히 알고 싶으시다면 다음 링크 에서 자세한 내용을 확인하실 수 있습니다.


Google에서 선호하는 검색 엔진으로 추가