הם פיתחו שיטה לקביעת הקשות לפי צליל 

זיהוי הקשות על ידי צליל

זיהוי הקשות באמצעות קול מושג על ידי הצבת מכשיר האזנה קרוב למטרה

בכל פעם אני די מתרשם מהשיטות שמתגלות ו/או מפותחות הן כדי להשיג מידע והן לגישה לקטע X, פורצים למכשיר X וזה שעד עכשיו אלו שעדיין מרתקות אותי מאוד הן אלו שמבוססות על צלילים המופקים על ידי מאוורר ה-CPU כדי לקבל מידע, כמו גם השימוש בו כדי לראות דרך קירות, בין רבים אחרים.

לכן, באופן אישי, אני מאוד אוהב לשתף את הסוג הזה של חדשות כאן בבלוג ובמקרה של היום אחלוק את החדשות על הפיתוח של שיטה שהוא יצר צוות חוקרים אשר הוא מבוסס על זיהוי המידע שהוזן במקלדת 95% מדויק בעת ניתוח צליל הקשות שהוקלטו על ידי סמארטפון סמוך או שנקלטו על ידי מיקרופון קרוב.

דיוק זיהוי קלט מוכח מתעלה על כל שיטות הניתוח האקוסטי תו לכל סמל ידוע בעבר הם לא משתמשים במודל שפה. ניתן להשתמש בשיטה המוצעת, למשל, לקביעת סיסמאות שהוזנו או הודעות מוקלדות, במצב בו התוקף הניח את הטלפון החכם שלו ליד הקורבן או קיבל הקלטת קול תוך כדי הזנת מידע סודי (למשל, כאשר במהלך תקשורת הקורבן מתעד עם סיסמה לכמה מערכות מידע).

עם ההתפתחויות האחרונות בתחום הלמידה העמוקה, נוכחותם של מיקרופונים ועלייתם של שירותים מקוונים באמצעות מכשירים אישיים, התקפות ערוצי צד אקוסטיות מהוות איום גדול יותר על המקלדות מאי פעם.

הקלט נוצר מחדש באמצעות מסווג המבוסס על מודל למידת מכונה שלוקח בחשבון מאפייני צליל ורמת עוצמת הקול בעת לחיצה על מקשים שונים.

מוזכר ש כדי לבצע פיגוע, נדרשת הכשרה מקדימה של המודל, הדורש התאמת צליל הקלט למידע על המקשים הנלחצים. בתנאים אידיאליים, ניתן לאמן את הדגם באמצעות תוכנות זדוניות המותקנות במחשב המותקף, מה שמאפשר להקליט בו זמנית קול ממיקרופון וליירט הקשות.

בתרחיש ריאליסטי יותר, ניתן היה לאסוף את הנתונים הדרושים לאימון המודל על ידי התאמת הודעות טקסט קלט עם אודיו מסט שהוקלט כתוצאה מוועידת וידאו. דיוק זיהוי הקלט בעת אימון מודל המבוסס על ניתוח קלט ועידות וידאו של Zoom ו-Skype יורד מעט ל-93% ו-91,7%, בהתאמה.

בניסוי לאימון מודל למידת מכונה באמצעות אודיו מכנס Zoom, כל אחד מ-36 המקשים (0-9, a-z) במקלדת נלחץ 25 פעמים ברציפות באצבעות שונות ובכוח שונה.

הנתונים על הצליל של כל לחיצה הוסבו לתמונה עם ספקטרוגרמה המשקפת את השינוי בתדירות ובמשרעת הצליל לאורך זמן

ספקטרוגרמות הועבר להדרכה למסווג על פי מודל CoAtNet, משמש לסיווג תמונות במערכות ראייה מלאכותית. כלומר, במהלך האימון התמונה מושווה עם הספקטרוגרמה של כל הקשה עם שם המקש. כדי לקבוע את המקשים שנלחצו על ידי הצליל, מודל CoAtNet מחזיר את המפתח הסביר ביותר בהתבסס על הספקטרוגרמה המשודרת, בדומה להחזרת התווית הסביר ביותר בעת זיהוי אובייקטים לפי התמונה שלהם.

בעתיד, החוקרים מתכוונים לבחון את האפשרות ליצור מחדש קלט מקלדת על ידי הקלטת צליל מרמקולים חכמים, וכדי לשפר את הדיוק בקביעת טקסט קלט, להשתמש במודל שפה שמסווג קלט בהקשר של מילים שלמות.

בסופו של דבר אם אתה מעוניין לדעת יותר על כך, אתה יכול לבדוק את הפרטים ב הקישור הבא.


הוסף כמקור מועדף