תוצאות ניסיוניות לסיווג גיל ומגדר הוערכו באמצעות ייצוגי מאפיינים מבוססי MFCC וייצוגים היברידיים עם מודלים של ML ו-DL. מערך הנתונים חולק לקבוצות אימון ובדיקה ביחס של 80:20, כאשר 80% שימשו לאימון ו-20% לבדיקה. חלוקה ברמת הדובר יושמה כדי למנוע מהקלטות של אותו דובר להופיע בשתי הקבוצות.
ההיפר-פרמטרים ופרטי המימוש של המסגרת המוצעת מסוכמים ב-טבלה 3. הניסויים נערכו במערכת המצוידת במעבד Intel i7-8265U CPU, ב-16 GB של RAM ובמעבד גרפי NVIDIA Tesla K80 GPU המריץ Windows 11. Python וספריית Scikit-learn שימשו לפיתוח מודלי ה-ML, בעוד שמסגרת ה-DL המוצעת מומשה באמצעות PyTorch. מודלים אלו הוערכו לצורך סיווג מגדר וגיל מתוך נתוני קול.
נעשה שימוש באופטימייזר Adam עם קצב למידה התחלתי של 1 × 10⁻4, β₂ = 0.999, ו-ε = 1 × 10⁻8. נעשה שימוש בגודל batch של 64 ובמקסימום של 50 epochs, כאשר הוגדר עצירה מוקדמת (early stopping) עם סבלנות (patience) של ארבעה epochs כדי להפחית overfitting. שיעור dropout של 0.3 הוחל על השכבות המחוברות במלואן לצורך רגולריזציה. Categorical cross-entropy שימש כפונקציית ההפסד עבור משימות הסיווג. מתזמן קצב הלמידה ReduceLROnPlateau שימש לניטור הפסד האימות (validation loss).
כדי למנוע דליפת נתונים ולהבטיח הערכה הוגנת, הוחלה הפרדה ברמת הדובר, כך ששום דובר לא הופיע הן בקבוצת האימון והן בקבוצת הבדיקה. בנוסף, בוצע אימות צולב של חמישה סבבים (five-fold cross-validation) כדי להעריך את יכולת ההכללה והחסינות של המודל המוצע.
תוצאות של מודלים המשתמשים במערך הנתונים המקורי
טבלה 4 מציגה את הביצועים של מספר מודלי ML ו-DL לסיווג מגדר על גבי מערך נתונים הכולל 28 שפות, ללא מאפייני MFCC. מדדי ההערכה ששימשו לבדיקה היו Precision, recall, F1-score ודיוק (accuracy).
מבין המודלים שהוערכו, EfficientNet-Lite השיג את הדיוק הגבוה ביותר של 83.48%, עם דיוק (precision) של 82.87%, רגישות (recall) של 84.28% ומדד F1-score של 83.54%. גם MobileNet ו-InceptionV3 הציגו ביצועים טובים, כאשר MobileNet השיג דיוק של 81.33% ו-F1-score של 83.11%, ו-InceptionV3 השיג דיוק של 80.77% ו-F1-score של 82.52%. מודל ה-CNN השיג דיוק של 75.71% ו-F1-score של 77.43%, בעוד ש-ResNet השיג דיוק של 74.37% ו-F1-score של 75.54%. המודלים SVM, RF, LR ו-ETC השיגו דיוקים בטווח של 71.42% עד 73.59% ומדדי F1-score בטווח של 72.48% עד 74.34%. VGG19 השיג דיוק נמוך יותר באופן יחסי של 70.56%, עם רגישות של 75.07% ו-F1-score של 74.17%. באופן כללי, EfficientNet-Lite ו-MobileNet הציגו את הביצועים החזקים ביותר מבין המודלים שהוערכו בעת שימוש במאפיינים המקוריים.
תוצאות של מודלים המשתמשים במאפייני MFCC
מאפייני MFCC הוערכו לאחר מכן לצורך סיווג מגדרי. טבלה 5 משווה בין ביצועיהם של מודלי ה-ML וה-DL תוך שימוש במאפייני MFCC על מערך נתונים הכולל 28 שפות.
EfficientNet-Lite השיג את הביצועים הגבוהים ביותר, עם דיוק (accuracy) של 92.64%, רגישות (precision) של 93.79%, recall של 94.92% ומדד F1-score של 94.84%. MobileNet השיג דיוק של 91.39% ומדד F1-score של 91.07%, בעוד ש-InceptionV3 השיג דיוק של 90.24% ומדד F1-score של 89.83%. ResNet השיג דיוק של 89.43% ומדד F1-score של 83.67%, בעוד ש-CNN השיג דיוק של 88.60% ומדד F1-score של 87.35%. VGG19 השיג דיוק של 87.48% ומדד F1-score של 85.58%.
מבין מודלי ה-ML המסורתיים, SVM השיג דיוק של 85.47% וציון F1 של 84.29%; RF השיג דיוק של 84.57% וציון F1 של 87.42%; LR השיג דיוק של 83.25% וציון F1 של 84.98%; ו-ETC השיג דיוק של 83.59% וציון F1 של 85.43%. באופן כללי, הכללת מאפייני MFCC שיפרה את ביצועיהם של רוב המודלים בהשוואה לתוצאות שהושגו באמצעות המאפיינים המקוריים. EfficientNet-Lite השיג את הביצועים הכוללים הגבוהים ביותר בניסוי זה.
תוצאות של מודלים המשתמשים במאפייני MFCC–wav2vec 2.0 היברידיים עם מערך הנתונים בשפה האנגלית
סט הניסויים הבא העריך סיווג מגדר באמצעות ייצוג תכונות היברידי של MFCC–wav2vec 2.0 על תת-הקבוצה בשפה האנגלית. ביצועי המודלים שהוערכו מוצגים ב-טבלה 6. EfficientNet-Lite השיג את הביצועים הגבוהים ביותר, עם דיוק (accuracy) של 97.87%, דיוק חיזוי (precision) של 98.61%, רגישות (recall) של 98.70%, ומדד F1 של 98.65%.
בין מודלי ה-ML המסורתיים, SVM השיג דיוק של 92.58% וציון F1 של 91.52%; ETC השיג דיוק של 91.49% וציון F1 של 92.79%; LR השיג דיוק של 90.64% וציון F1 של 91.34%; ו-RF השיג דיוק של 88.36% וציון F1 של 90.86%. באופן כללי, המודלים הדגימו ביצועים חזקים בתת-הקבוצה בשפה האנגלית, כאשר EfficientNet-Lite השיג את הערכים הגבוהים ביותר בכל מדדי ההערכה שדווחו.
תוצאות של תיקוף צולב חמיש-מגובה
בוצע אימות צולב חמיש-קיפול (Five-fold cross-validation) כדי להעריך את היציבות ואת יכולת ההכללה של המסגרת המוצעת. תוצאות האימות הצולב שהתקבלו באמצעות מערך הנתונים של קול בשפה האנגלית מוצגות ב- טבלה 7EfficientNet-Lite השיג סטיית תקן של ±0.0033 בחמשת הקיפולים (folds). השונות הנמוכה בין הקיפולים העידה על ביצועים יציבים תחת הגדרות האימות הצולב (cross-validation) שנבדקו.
סיווג גיל באמצעות נתוני קול
בנוסף לסיווג המגדר, הוערך סיווג הגיל באמצעות מספר מודלים ומאפייני MFCC. טבלה 8 מציגה את ביצועי המודלים שהוערכו עבור סיווג הגיל.
התוצאות הראו כי מודלי הלמידה המועברת (transfer-learning) השיגו רמות דיוק מעל 85%, כאשר MobileNet הגיע ל-85.23% ו-InceptionV3 הגיע ל-86.67%. EfficientNet-Lite השיג את הביצועים הגבוהים ביותר שדווחו, עם דיוק (accuracy) של 88.42%, דיוק חיזוי (precision) של 86.56%, ורגישות (recall) של 87.21%.
תיקוף של המסגרת המוצעת
כדי להעריך את המסגרת המוצעת על גבי מערך נתונים חיצוני, נערכו ניסויים נוספים באמצעות מערך הנתונים Mozilla Common Voice51סט המידע הכיל כ-500 שעות של הקלטות דיבור שנאספו מהמוניהם (crowdsourced), יחד עם מטא-נתונים דמוגרפיים נלווים, כולל מידע על גיל, מגדר ומבטא. הקורפוס אורגן לתתי-קבוות מוגדרות מראש של אימון, פיתוח ובדיקה. הקלטות השמע עובדו באמצעות אותו צינור עיבוד מקדימה (preprocessing pipeline) ששימש בניסויים העיקריים, כולל דגימה מחדש ל-16 kHz, חילוץ מאפייני MFCC ב-40 ממדים ויצירת שיבוצים (embeddings) של wav2vec 2.0 ב-768 ממדים. שני הייצוגים שורשרו כדי להפיק את וקטור המאפיינים ההיברידי ב-808 ממדים ששימש את VoiceNet-RAI. תוצאות התיקוף מוצגות ב- טבלה 9.
מודל EfficientNet-Lite עם ייצוג תכונות היברידי ברמה נמוכה וגבוהה השיג דיוק של 98.27% בסיווג מגדר, גבוה יותר מזה של המודלים האחרים שנבחנו. בין מודלי ה-ML, מודל RF השיג דיוק של 90.47%, מודל SVM דיוק של 90.69% ומודל LR דיוק של 89.75%. בין מודלי ה-DL האחרים, מודל ResNet השיג דיוק של 92.19%, בעוד שמודל VGG19 השיג 92.12%. ערכי הדיוק (precision), הרגישות (recall) ומדד ה-F1 המתאימים מופיעים ב-טבלה 9.
מחקר אבלציה על ייצוג ומיזוג מאפיינים
נערך מחקר אבלציה (ablation study) כדי להעריך את תרומתם של ייצוגי המאפיינים ששימשו במסגרת המוצעת. נבחנו ארבע תצורות: מאפיינים גולמיים/מקוריים, מאפייני MFCC בלבד, שיבודי (embeddings) wav2vec 2.0 בלבד, והייצוג ההיברידי המוצע של MFCC–wav2vec 2.0. EfficientNet-Lite שימש כמודל הנציג מכיוון שהשיג את הביצועים הגבוהים ביותר בכל הגדרות הניסוי שנבחנו. תוצאות האבלציה מוצגות ב- טבלה 10.
מודל הבסיס המשתמש במאפיינים גולמיים השיג דיוק של 83.48%, בעוד שהייצוג המבוסס על MFCC השיג דיוק של 92.64% וציון F1 של 94.84%. הייצוג ההיברידי MFCC–wav2vec 2.0 השיג דיוק של 97.87% וציון F1 של 98.65%. תחת חלוקות נתונים ותנאי אימון זהים עבור נתונים בשפה האנגלית, הייצוג ההיברידי MFCC–wav2vec 2.0 השיג דיוק של 97.87%, לעומת 92.64% עבור הייצוג המבוסס על MFCC בלבד.
ניסויים מבוקרים נערכו תוך שימוש במחיצות נתונים זהות, הגדרות אימון זהות ובארכיטקטורת EfficientNet-Lite כדי להעריך את התרומה של כל ייצוג תכונה. תכונות גולמיות/מקוריות, תכונות MFCC בלבד, שיבודי wav2vec 2.0 בלבד, והייצוג ההיברידי של MFCC–wav2vec 2.0 הושוו תחת תנאים אלו. תכנון ניסיוני זה שימש להערכת התרומות האישיות והמשולבות של ייצוגי התכונות.
ניתוח מובהקות סטטיסטית
כל תצורות המאפיינים בהשוואה זו הוערכו באמצעות אותה תת-קבוצה בשפה האנגלית, חלוקות נתונים זהות ברמת הדובר, ואותם חמישה קיפולים של אימות צולב (cross-validation folds). המודל המוצע השיג דיוק גבוה באופן מובהק מאשר תצורת המאפיינים הגולמיים (97.86 ± 0.23% לעומת 83.48 ± 0.24%; t (4) = 384.32, p < 0.001), תצורת MFCC בלבד (97.86 ± 0.23% לעומת 92.60 ± 0.32%; t (4) = 131.50, p < 0.001), ותצורת wav2vec 2.0 בלבד (97.86 ± 0.23% לעומת 95.34 ± 0.24%; t (4) = 126.00, p < 0.001), מה שמאשר כי השיפורים שהושגו ממיזוג MFCC–wav2vec 2.0 היו מובהקים סטטיסטית.
שיקולים של בינה מלאכותית אחראית והנחיות פריסה
בינה מלאכותית אחראית (Responsible AI) בסיווג דמוגרפי מבוסס קול דרשה התחשבות בהוגנות, שקיפות, פרטיות, פוטנציאל לשימוש לרעה וסיכונים הקשורים לפריסה, בנוסף לביצועים ניבויים. למרות שניתוח תתי-קבוצות סיפק הערכה אמפירית של הבדלי ביצועים בין קבוצות המגדר והשפה שנבחנו, לא ניתן היה לבסס הוגנות אך ורק על סמך דיוק סיווג דומה. לפיכך, מסגרת ה-VoiceNet-RAI הוערכה ממספר נקודות מבט של בינה מלאכותית אחראית.
ניתוח הגינות והטיה
ניתוח הוגנות נערך על פני תתי-קבוצות של מגדר ושפה כדי להעריך את מאפייני ה-Responsible AI של מסגרת ה-VoiceNet-RAI המוצעת. התוצאות מוצגות ב-טבלה 11. עבור הערכה לפי מגדר, ביצועי המודל נותחו בנפרד עבור דוברים זכרים ונקבות. התוצאות הראו שונות של פחות מ-1.5% בדיוק ובמדד ה-F1-score בין קבוצות המגדר שנבחנו.
עבור הערכה לשונית, נבחנו הביצועים בקבוצות השפות שנבדקו בתוך מאגר הנתונים של 28 שפות. התוצאות הראו סטייה ממוצעת של פחות מ-2% בדיוק בין הקבוצות שנבדקו, כאשר נצפתה סטייה גדולה יותר בחלק מהשפות בעלות משאבים מוגבלים עם מספר דגימות זמין נמוך יותר.
ההגינות נבחנה בנוסף באמצעות הפרש שוויון דמוגרפי (demographic parity difference), הפרש שוויון הזדמנויות (equal opportunity difference), שיעור השגויים החיוביים (FPR) ושיעור השגויים השליליים (FNR). הפרש השוויון הדמוגרפי כימת את ההבדלים בשיעורי התחזיות החיוביות בין קבוצות, בעוד שהפרש שוויון ההזדמנויות כימת את ההבדלים בשיעורי החיוביים האמיתיים (TPRs). ה-FPR וה-FNR שימשו לאפיון דפוסי שגיאה ספציפיים לתת-קבוצות. מדדים אלה השלימו את הדיוק ואת מדד ה-F1 ברמת תת-הקבוצה, וסיפקו מידע נוסף על הבדלים בביצועי המודל בין הקבוצות הדמוגרפיות והלשוניות שנבחנו. תחת הגדרות קבוצות המשנה ומערך הנתונים שנבחנו, התוצאות הצביעו על הבדלי ביצועים קטנים יחסית בין קבוצות המגדר והשפה שנבחנו. עם זאת, ממצאים אלו היו מוגבלים לקבוצות הדמוגרפיות והלשוניות שיוצגו במערכי הנתונים שנבחנו, ולא ביססו הגינות בקרב אוכלוסיות שאינן מיוצגות או בסביבות פריסה שונות.
יכולת הסבר ושקיפות
VoiceNet-RAI שילב מאפיינים אקוסטיים ניתנים לפירוש המבוססים על MFCC עם שיכומים (embeddings) קשריים של wav2vec 2.0. מחקר האבלציה העריך את התרומות של ייצוגי המאפיינים הבודדים והמשולבים. עם זאת, שיכומים של wav2vec 2.0 נותרו קשים יחסית לפירוש. לפיכך, ניתן יהיה לבחון שיטות הסבר לאחר מעשה (post-hoc) במחקרי המשך כדי לזהות את המאפיינים שתרמו בצורה החזקה ביותר לניבויים בודדים.
שמירה על הפרטיות
מכיוון שהקלטות קול הכילו מידע ביומטרי רגיש, פריסה השומרת על פרטיות דרשה נקיטת שיטות לצמצום נתונים, כולל עיבוד של המידע הדרוש למשימת הסיווג בלבד ומניעת אחסון מיותר של אודיו גולמי. אחסון מאובטח, גישה מבוקרת והסקה מקומית עשויים להפחית עוד יותר את סיכוני הפרטיות. גישות פורמליות לשמירה על פרטיות, כולל פרטיות דיפרנציאלית (differential privacy), לא נבחנו במחקר הנוכחי ונותרו כתחום לבדיקה עתידית.
פריסה אחראית
פריסה של VoiceNet-RAI תדרוש פיקוח אנושי, קבלת החלטות מודעת לרמת הביטחון (confidence-aware) וניטור ביצועים רציף. אין להשתמש בתחזיות בעלות רמת ביטחון נמוכה באופן עצמאי לצורך החלטות קריטיות, ויש להעריך מחדש את ביצועי המודל כאשר תנאי הפריסה שונים באופן מהותי מאלה המיוצגים במערכי הנתונים של האימון והתיקוף.
השוואה לטכניקות החדישות ביותר
הערכה השוואתית של המסגרת המוצעת לעומת גישות שפורסמו בעבר מוצגת ב-Table 12. נבחנו מחקרים שפורסמו בין השנים 2019 ל-2024, כולל גישות המבוססות על ML, DL ולמידה בהעברה (transfer learning). ההשוואה כללה מחקרים שדווחו בעבר באותו תחום יישום. כפי שמוצג ב-Table 12, המסגרת המוצעת השיגה דיוק מדווח גבוה יותר עבור סיווג מגדר וגיל מאשר הגישות שהושוו אליה. עם זאת, מכיוון שהמחקרים עשויים להיות שונים במערכי הנתונים, בהליכי עיבוד מקדימים, בחלוקת הנתונים ובפרוטוקולי ההערכה, ההשוואה שיקפה ביצועים מדווחים ולא השוואה ניסיונית מבוקרת פנים-אל-פנים.
זמינות נתונים:
נתוני הדיבור הגולמיים ששימשו במחקר זה זמינים לציבור מתוך מערכת הנתונים BVC Challenging Voice Set המארחת ב-GitHub ומתוך מערכת הנתונים Mozilla Common Voice. ניתן לגשת למערכת הנתונים BVC בכתובת https://github.com/OgeNI/BVC_Challenging_Voice_Set, בעוד שמערכת הנתונים Common Voice זמינה בכתובת https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

איור 1: דיאגרמת ארכיטקטורה. מתודולוגיית זרימת העבודה המלאה של המסגרת המוצעת. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.
| מקורות | מודלים | מערכי נתונים | תוצאות |
| 19 | GBC, DT, RF, SVM, NN | מערך הנתונים VoxForge | GBC 90% |
| 20 | Robustscaler, PCA ורגרסיה לוגיסטית
רגרסיה, מודל סדרתי | voice.mozilla.org | מודל רצפי 91%. |
| 21 | CNN, CRNN, TCN | מערך נתוני הקול של Mozilla | 80% CNN |
| 22, 23 | הפצה לאחור, עץ החלטה, Bagging,
RF, KNN, DNN, DL | Kaggle, מערך נתוני Mozilla Voice,
ארכיון מבטאים של הדיבור | Kaggle: Bagging, KNN ו-RF
98.10%. קול נפוץ: Bagging 55.39%. מבטא דיבור: Bagging 78.94%. |
| 24 | DNN, MLP, KNN, SVC, DT, RF,
SVC עם גרעין RBF, ADA, QDA, GNB, ResNET34 ו-ResNET50. | Mozilla Common Voice | ResNET50 98.57%. |
| 25 | ANN, SVM, RF, DT, NB, KNN | מאגר דיבורי ילדים של OGI, פרטי
קורפוס, מאגר נתונים ספציפי, | עבור זיהוי מגדר SVM 98%,
לזיהוי גיל RF 95% |
| 26 | SVM, DA, NB, DT, KNN, Ensem-
ble, LightGBM | Mozilla Common Voice, VoxCeleb | LGBM 91% |
| 27 | KNN, SVM, LR, SGD, Stacked
מודל | מקורים מגדריים שונים | מודל מצטבר 99.64% |
| 28 | רשת נוירונים עמוקה (DNN), מכונת וקטורים תומכים (SVM) | מקורות מגדריים שונים | SVM 97% |
| 29 | SVM, RF, CART, KNN | מערך הנתונים מכיל 3,169 דגימות | RF 93% |
| 30 | רשת עצבית קונבולוציונית (CNN) | מערך נתונים של נבדקים ניגריים | CNN 85.48%. |
| 31 | DT, RF, KNN, LR, SVM, ANN,
CNN2D | 3 מערכי נתונים מ-Kaggle | חיזוי מגדר: ANN 85.51%,
חיזוי גיל: ANN 89.20%. |
טבלה 1: סיכום של מחקרים קיימים על סיווג מגדר וגיל מבוסס קול, כולל מודלים, מערכי נתונים וביצועים שדווחו.
| מאפייני מערך הנתונים | תיאור / ערך |
| מספר הדוברים הכולל | 526 |
| דוברים זכרים | 336 |
| דוברות | 190 |
| סה"כ הקלטות | בערך 3,964 |
| מספר השפות | 28 |
| התפלגות לשונית | אנגלית ו-28 שפות מקומיות (אפמאי, אקוקו-אדו, אנאנג, אפיק, אקוי, פולאני, האוסה, איביביו, אידומה, איגאלה, איגבו, איגדה, איג'או, איקה, איקום, איקוור, אישאן, קאירי-קאירי, קאנורי, לוקאה, אורובו, יורובה, אובודו, אוגוני, אוקובו, אוקיריקה, טיב ואוקוואני. השבט הדומיננטי בקרב שפות מקוריות אלו במערך הנתונים הוא האיגבו. |
| קבוצות גיל | שלוש קבוצות גיל: צעירים (בני נוער ובני עשרים ומספר), מבוגרים (בני שלושים, ארבעים וחמישים) וקשישים (בני שישים, שבעים ושמונים) |
| התפלגות לפי קבוצות גיל | בני נוער (13–19 שנים) נמוך (< 10%)עשרים20–29 שניםגבוה מאוד (~35–45%)שלושים30–39 שניםגבוה (~20–30%)ארבעים40–49 שניםבינוני (~10–15%)חמישים50–59 שניםנמוך (~5–10%)שישים+60–80+ שניםדליל (< 5%) |
| משך ההקלטה | 3-10 שניות |
| תנאי ההקלטה | PCM ב-16 סיביות |
| קצב הדגימה המקורי | 44.1 kHz |
| קצב דגימה של עיבוד | 16 kHz |
| אורך מסגרת MFCC | 25 מילי-שנייה (ms) |
| חפיפת מסגרות MFCC / צעד (step) | 10 מילי-שניות |
| ייצוג MFCC | וקטור ממצע זמני בעל 39 ממדים |
| ייצוג wav2vec 2.0 | וקטור בעל 768 ממדים עם מיצוע זמני (temporally mean-pooled) |
| ייצוג ממוזג סופי | 807 ממדים |
| פיצול אימון-בדיקה | 80:20 |
| חלוקת נתונים | פיצול בלתי תלוי-דובר |
| תיקוף צולב | תיקוף צולב של 5 כפליים (5-fold cross-validation) |
| סט של נתוני תיקוף חיצוניים | Mozilla Common Voice |
טבלה 2: מאפיינים דמוגרפיים, כיסוי שפתי, חלוקת נתונים והגדרות עיבוד מקדימה של מאגר נתוני הדיבור ששימש ב-VoiceNet-RAI.
| Parameter | Value / Description |
| Framework | PyTorch |
| Hardware | NVIDIA GPU (CUDA-enabled) |
| Random seed | 42 |
| Optimizer | Adam |
| Initial Learning Rate | 1 × 10−4 |
| β₁ / β₂ | 0.9 / 0.999 |
| Adam epsilon | 1 × 10⁻⁸ |
| Batch Size | 64 |
| Epochs | 50 (Early stopping patience = 8) |
| Loss Function | Categorical Cross-Entropy |
| Normalization | Z-score normalization |
| Learning Rate Scheduler | ReduceLROnPlateau |
| Dropout Rate | 0.3 |
| Training time | 20min |
| Inference time/sample | 13 seconds |
| Feature Extraction | Feature Extraction |
| MFCC Coefficients | 40 |
| Window Size | 25 ms |
| Stride | 10 ms |
| wav2vec Variant | Base (pretrained) Embedding Dimension |
| Pooling Strategy | Mean pooling |
| Feature Fusion | Concatenation (MFCC + wav2vec) |
| MFCC Coefficients | 40 |
| Evaluation Protocol | Evaluation Protocol |
| Train-Test Split | Speaker-level separation |
| Cross-Validation | 5-Fold |
| Datasets | Mozilla Common Voice (28 languages + English subset) and BVC Gender & Age from Voice Challenging Dataset |
| Tasks | Gender and Age Classification |
טבלה 3: תצורת האימון, הגדרות חילוץ מאפיינים, היפר-פרמטרים ופרוטוקול הערכה ששימשו עבור VoiceNet-RAI.
| מודלים | דיוק | דיוק | רכישה מחדש (Recall) | מדד F1 (F1-score) |
| RF | 71.42 | 72.79 | 74.43 | 73.52 |
| LR | 73.59 | 74.22 | 75.40 | 74.34 |
| שרשראת העברת האלקטרונים (ETC) | 72.44 | 72.33 | 74.52 | 73.41 |
| מכונת וקטורים תומכים (SVM) | 73.52 | 72.60 | 72.39 | 72.48 |
| רשת עצבית קונבולוציונית (CNN) | 75.71 | 76.59 | 77.34 | 77.43 |
| VGG19 | 70.56 | 73.28 | 75.07 | 74.17 |
| ResNet | 74.37 | 73.49 | 76.68 | 75.54 |
| EfficientNet-Lite | 83.48 | 82.87 | 84.28 | 83.54 |
| MobileNet | 81.33 | 83.19 | 82.14 | 83.11 |
| InceptionV3 | 80.77 | 81.34 | 82.67 | 82.52 |
טבלה 4: ביצועי סיווג מגדר של מודלי ML ו-DL באמצעות מערך הנתונים של 28 שפות ללא מאפייני MFCC.
| מודלים | דיוק | דיוק | הסרה מהשוק | מדד F1 |
| RF | 84.57 | 86.53 | 87.39 | 87.42 |
| LR | 83.25 | 84.42 | 85.64 | 84.98 |
| שרשרת מעבירי האלקטרונים | 83.59 | 84.25 | 86.36 | 85.43 |
| מכונת וקטורים תומכים | 85.47 | 83.37 | 85.26 | 84.29 |
| רשת נוירונים קונבולוציונית | 88.60 | 86.75 | 88.46 | 87.35 |
| VGG19 | 87.48 | 85.49 | 85.80 | 85.58 |
| ResNet | 89.43 | 84.39 | 82.34 | 83.67 |
| EfficientNet-Lite | 92.64 | 93.79 | 94.92 | 94.84 |
| MobileNet | 91.39 | 90.64 | 91.15 | 91.07 |
| InceptionV3 | 90.24 | 88.81 | 90.70 | 89.83 |
טבלה 5: ביצועי סיווג מגדר של מודלי ML ו-DL באמצעות תכונות MFCC על מערך הנתונים של 28 שפות.
| מודלים | דיוק | דיוק | זיכרון חזרה (Recall) | מדד F1 (F1-score) |
| RF | 88.36 | 90.91 | 89.94 | 90.86 |
| LR | 90.64 | 92.24 | 91.30 | 91.34 |
| שרשרת העברת האלקטרונים (ETC) | 91.49 | 92.80 | 92.79 | 92.79 |
| SVM (מכונה וקטורית תומכת) | 92.58 | 92.75 | 90.64 | 91.52 |
| רשת עצבית קונבולוציונית (CNN) | 93.69 | 94.69 | 94.53 | 94.34 |
| VGG19 | 91.37 | 92.64 | 93.48 | 93.21 |
| ResNet | 95.28 | 96.39 | 95.52 | 95.43 |
| EfficientNet-Lite | 97.87 | 98.61 | 98.70 | 98.65 |
| MobileNet | 96.41 | 95.51 | 96.39 | 96.24 |
| InceptionV3 | 96.35 | 95.29 | 96.84 | 96.08 |
טבלה 6: ביצועי סיווג מגדר של מודלי ML ו-DL באמצעות ייצוג מאפיינים היברידי של MFCC–wav2vec 2.0 על תת-הקבוצה בשפה האנגלית.
| מודלים | דיוק | דיוק | כישרון זיכרון (Recall) | מדד F1 |
| קיפול ראשון | 97 | 93 | 96 | 94 |
| קיפול שני | 96 | 94 | 96 | 95 |
| פי שלושה | 97 | 94 | 95 | 95 |
| פי ארבעה | 96 | 93 | 95 | 94 |
| פי חמישה | 97 | 94 | 96 | 95 |
| ממוצע | 96.6 | 93.6 | 95.6 | 94.6 |
טבלה 7: ביצועי תיקוף צולב חמיש-פעמים של VoiceNet-RAI על תת-הקבוצה בשפה האנגלית.
| מודלים | דיוק | דיוק | הסריקה מחדש (Recall) | מדד F1 |
| RF | 80.15 | 78.68 | 79.27 | 79.04 |
| LR | 81.28 | 80.69 | 80.43 | 80.54 |
| שרשרת העברת אלקטרונים | 80.58 | 81.21 | 80.82 | 81.04 |
| מכונת וקטורים תומכים (SVM) | 82.54 | 81.31 | 82.14 | 81.78 |
| רשת נוירונים קונבולוציונית | 85.27 | 84.39 | 84.47 | 84.43 |
| VGG19 | 83.73 | 82.97 | 83.53 | 83.48 |
| ResNet | 82.68 | 81.42 | 80.78 | 81.95 |
| EfficientNet-Lite | 88.42 | 86.56 | 87.21 | 86.97 |
| MobileNet | 85.23 | 85.64 | 85.95 | 85.81 |
| InceptionV3 | 86.67 | 85.86 | 86.78 | 86.35 |
טבלה 8: ביצועי סיווג גיל של מודלי ML ו-DL במונחים של דיוק (accuracy), רבדיות (precision), רגישות (recall) ומדד F1-score.
| מודלים | דיוק | דיוק | הסרה (Recall) | מדד F1 |
| RF | 90.47 | 92.82 | 90.85 | 91.32 |
| LR | 89.75 | 90.44 | 89.61 | 90.03 |
| שרשרת העברת האלקטרונים (ETC) | 92.63 | 91.29 | 91.55 | 91.42 |
| מכונת וקטורים תומכים (SVM) | 90.69 | 91.84 | 91.81 | 91.82 |
| רשת נוירונים קונבולוציונית (CNN) | 94.63 | 95.52 | 94.24 | 94.94 |
| VGG19 | 92.12 | 91.34 | 90.52 | 91.10 |
| ResNet | 92.19 | 91.98 | 92.27 | 92.25 |
| EfficientNet-Lite | 98.27 | 98.63 | 98.44 | 98.56 |
| MobileNet | 97.28 | 96.36 | 97.01 | 96.40 |
| InceptionV3 | 95.85 | 96.18 | 97.35 | 97.17 |
טבלה 9: תוצאות תיקוף חיצוני לסיווג מגדר במאגר הנתונים Mozilla Common Voice באמצעות ייצוג תכונות היברידי של MFCC–wav2vec 2.0.
| תצורת מאפיינים | דיוק (%) | דיוק (Precision) (%) | F1-Score (%) |
| מאפיינים גולמיים (ללא MFCC) | 83.48 | 82.87 | 83.54 |
| MFCC בלבד | 92.64 | 93.79 | 94.84 |
| wav2vec 2.0 בלבד | 95.34 | 96.32 | 95.18 |
| MFCC + wav2vec (המוצע) | 97.87 | 98.61 | 98.65 |
טבלה 10: ניתוח אבלציה (Ablation analysis) של ייצוגי מאפיינים באמצעות EfficientNet-Lite.
| קבוצת הערכה | תת-קבוצה | דיוק (%) | מדד F1 (%) | FPR | FNR | הפרש שוויון דמוגרפי | הפרש שוויון הזדמנויות |
| מגדר | זכר | 97.95 | 97.95 | 0.021 | 0.024 | _ | _ |
| מגדר | נקבה | 97.62 | 98.50 | 0.024 | 0.027 | _ | _ |
| פער מגדרי | זכר לעומת נקבה | _ | _ | _ | _ | 0.012 | 0.003 |
| שפות בעלות משאבים גבוהים | 98.10 | 98.80 | 0.018 | 0.021 | _ | _ |
| שפות דלות-משאבים | 96.85 | 97.90 | 0.031 | 0.034 | _ | _ |
| פער שפתי | גבוה לעומת נמוך | _ | _ | _ | _ | 0.028 | 0.014 |
טבלה 11: הערכת הוגנות על פני תתי-קבוצות של מגדר ומשאבי שפה. קיצורים: FPR = שיעור חיוביים שגויים; FNR = שיעור שליליים שגויים. הפרש שוויון דמוגרפי והפרש הזדמנות שווה מייצגים פערים בין-קבוצתיים, ולכן הם מדווחים עבור השוואות בין תתי-קבוצות ולא עבור קבוצות בודדות. ערכי פער נמוכים יותר מעידים על התנהגות עקבית יותר של המודל בין הקבוצות.
| מקור | גישה | דיוק |
| 16 | סרטן כיס המרה (GBC) | 90%. |
| 17 | מודל סקוונסיאלי (Sequential Model) | 91% |
| 18 | רשת עצבית קונבולוציונית (CNN) | 80% |
| 19 | Bagging, KNN ו-RF | 98.10%. |
| 20 | ResNET50 | 98.57%. |
| 21 | מכונה וקטורית תומכת (SVM) | 98% |
| 22 | LGBM | 91% |
| 23 | מודל ערימה (Stacked model) | 99.64% |
| 24 | SVM (מכונת וקטורים תומכים) | 97% |
| 25 | RF | 93% |
| 26 | רשת נוירונים קונבולוציונית (CNN) | 85.48% |
| 27 | רשת עצבית מלאכותית | 89.20% |
| מחקר זה | EfficientNet-Lite | 97.87% |
טבלה 12: השוואת דיוק של VoiceNet-RAI מול גישות state-of-the-art שדווחו בעבר לסיווג מגדר וגיל מבוסס קול.