מאמר מחקר

שיטת ניתוח סמנטי לתמונות סצנה פנימית המבוססת על ידע מוקדם במבנה הבניין

29 צפיות

DOI:

10.3791/72054

11 באוגוסט 2026

במאמר זה

סיכום

מחקר זה מציע אלגוריתם שמקשר באופן הדוק בין התכונות ההיררכיות הוויזואליות שנלכדו על ידי מקודד טרנספורמטור היררכי עם חלון מוזז לעומק הקודם של תיבת הגבול התלת-ממדית של מנהטן שנוצרה על ידי זיהוי מקטעי קו, ובכך משיג שחזור סמנטי מדויק של סצנות פנימיות מורכבות.

תקציר

כדי להתמודד עם אי-רציפויות חיזוי סמנטי ועיוותי גבולות פיזיים הנגרמים מחסימת רהיטים בסצנות פנימיות מורכבות, מאמר זה מציע שיטת ניתוח סמנטי המנצלת יסודות מבנה-מבנה. התכנית משתמשת במקודד טרנספורמטור היררכי עם חלון מוזז כדי לחלץ תכונות ויזואליות רב-קנה מידה ומשלבת אלגוריתם זיהוי מקטעי קו בכיוון הגרדיאנט לבניית תיבת גבול תלת-ממדית של מנהטן. תיבת הגבול הזו מומרת לשדה מרחק חתום (SDF) לפני קידוד קווי המתאר הגאומטריים הבדידים לשדה פוטנציאל פיזי רציף. מנגנון קשב צולב מונחה על ידי מבנה מאלץ את האותות הוויזואליים להתיישר עם גבולות גאומטריים תלת-ממדיים אורתוגונליים אמיתיים, ומשיב את המשכיות התכונות באזורים מוסתרים. גרף שכנות מרחבית שנבנה מצמתים סופרפיקסלים מניע רשת קונבולוציונית גרפית (GCN) לאגד תכונות, תוך הבטחת עקביות סמנטית מקרוסקופית במישור הנשיאה הפיזי. שילוב של אובדן אנטרופיה צולבת ברמת הפיקסל ואובדן עקביות מבני מותאם אישית מחזק את המגבלות ומעניש תחזיות מחוץ לתחום. ניסויים במספר ריצות עצמאיות מראים כי החיתוך הממוצע מעל איחוד (mIoU) מגיע ל-68.7% עם סטיית תקן של 0.2%, וציון הגבול המבני F1 מגיע ל-76.4% עם סטיית תקן של 0.3%, מה שמאשר את הביצועים העמידים של המודולים המוצעים. עם גודל צומת תמונה יחיד של 256, זמן ההסקה הממוצע נשאר 61 מילישניות.

מבוא

ניתוח סמנטי לתמונת סצנה פנימית תופס מקום מרכזי במשימות קוגניציה מרחבית תלת-ממדית וחשיבה מרחבית אינטליגנטית 1,2. חילוץ תכונות ויזואליות בסביבות פיזיות אמיתיות לעיתים קרובות מופרע קשות על ידי פריסות מרחביות מורכבות3. פתרון ההפרדה הסמנטית ועיוות הגבול הפיזי של מבנה יסוד הבניין הנגרם מהסתרת רהיטים בקנה מידה גדול חשוב למחקר קוגניציה מרחבית 4,5. הסרה מדויקת של הפרעות מחפצים עמוסים והשבת הרצף הפיזי של אותם קיר ורצפה תקבעו ישירות את דיוק שחזור הסצנה התלת-ממדי וניתוח לוגי מרחבי גלובלי6. הפסקת הרציפות הסמנטית הנגרמת על ידי חסימת רהיטים בקנה מידה גדול והשפעת התיקון המבני של הנחיות הבנייה המוצעות מוצעות מוצגות באיור 1, כאשר הקלט האדום-ירוק-כחול (RGB) המוסתר בטבלה 1A, עיוות המסכה הבסיסי באיור 1B, ותוצאת תיקון המבנה הקודם באיור 1C משווים תחת אותו מצב סצנה פנימית.

כדי לעמוד בדרישות הדיוק של חשיבה לוגית מרחבית, רשתות חזותיות מונעות פיקסלים מרכזיות כיום מתמודדות עם מכשולים מרובים בהתמודדות עם סביבות פנימיות מורכבות 7,8. חללים פנימיים מלאים לעיתים קרובות ברהיטים צפופים וריהוט עמוס, מה שמוביל לאובדן משמעותי של אותות גבול ויזואליים נמוכים בתמונות9. מנגנוני חילוץ תכונות קונבנציונליים מסתמכים יתר על תגובות צבע ומרקם דו-ממדיות מקומיות, ללא הבנה מקרוסקופית של חוקי האורתוגונל הנוקשיםשל מבנים תלת-ממדיים מלאכותיים. מגבלה זו של שדה קליטה מקומי הופכת את הפצת התכונות למופרעת בקלות, מה שמקשה על הרחבת הטופולוגיה הגלובלית על פני חסימות11. כיום, יש צורך דחוף לפתור את הבעיה המרכזית של אי-רציפויות חיזוי סמנטי ועיוותים חמורים בגבולות פיזיקליים הנגרמים על ידי חסימה והפרעה12.

כדי להתמודד עם תקלות מבניות ביסודות הבניין הנגרמים מחסימה והפרעה, הקהילה האקדמית פיתחה מגוון אמצעי התערבות ממוקדים13. רשתות אגרגציה של תכונות חוצות-מודאליות מפצות ביעילות על החסרונות הטבועים במודאליות חזותית אחת בתפיסה מרחבית על ידי הכנסת מפות עומק או הקדימות טקסט המסייעות בתמונות אדום-ירוק-כחול (RGB)14,15. תפיסת גבולות ומסגרות בחירת הקשר אדפטיביות מזריקות אסטרטגיות לשיפור קווי המתאר הפיזיים לשלב פענוח התכונות, מה שמשפר משמעותית את התאמת הקצה של תוצאות החיזוי בסצנות מורכבות16,17. מודלים של הסקה המבוססים על GCNs ומנגנוני אינטראקציה בין תכונות משפרים משמעותית את חלקות התכונות ואת העקביות המקרו-סמנטית באזורים הומוגניים על ידי בניית חיבורים ברמת הצמתים18,19. שילוב קדימים מבניים מפורשים של מנהטן בצינור חילוץ התכונות הוויזואלי אוכף גבולות עקביות גאומטריים, המתמודדים עם אתגרי אי-רציפות תכונה הנגרמים מהסתרת אובייקטים קדמייםנרחבת 20.

כדי להתמודד עם האתגר המרכזי של תקלות חיזוי סמנטי ועיוותים חמורים של גבולות פיזיים הקשורים לתשתיות הבניין, מוצעת מסגרת ניתוח סמנטי המבוססת על מנגנון קישור בלולאה סגורה הכולל פריימים אדריכליים. מסגרת זו חורגת מצינורות הנדסיים נאיביים על ידי יצירת יישור מיפוי דו-כיווני בין שדות פוטנציאל גאומטריים רציפים למניפות תכונות ויזואליות נפרדות, ויוצרת סינרגיה לא טריוויאלית שמתקנת שגיאות הסתרה באמצעות חוקי מבנה. תכנית זו מתבססת על רשת עמוד שדרה חזותית רב-קנה מידה ואלגוריתם זיהוי מקטעי קו המבוסס על הערכת נקודת ההיעלמות, כדי להשיג תכונות מראה מקומיות וקדימויות קצה אורתוגונליות המייצגות את תיבת הגבול התלת-ממדית של מנהטן במקביל, ואז להפוך אותן ל-SDF. האלגוריתם משתמש במנגנון קשב צולב מונחה מבנה, המשתמש בתכונות ויזואליות כוקטורי שאילתה ומתייחס לתכונות SDF כמפתחות וערכים לחישובי מכפלת נקודה, ובכך מאלץ את האות הוויזואלי ליישר את הגבול הגאומטרי התלת-ממדי האמיתי במרחב התכונות. גרף שכנות מרחבית שנבנה מצמתים סופרפיקסלים ותכונות קצה קופלנריות מרחביות מוזן ל-GCN כדי לבצע אגרגציה של תכונות חוצות צמתים והעברת הודעות. תהליך אופטימיזציית הפרמטרים מקצה לקצה משתמש במשותף באנטרופיה חוצה ברמת הפיקסל ובפונקציית אובדן עקביות מבנית מותאמת אישית, שמגבילה ומענישה בקפדנות פיקסלים חזויים החוצים את גבול הבנייה-הקודם. צינור הניתוח הסמנטי המלא מסוכם באיור 2, המקשר בין קלט תמונת RGB, חילוץ גאומטרי מוקדם, יישור תשומת לב צולב, הסקת גרפי סופרפיקסל ופענוח מסכות סמנטיות בתוך ארכיטקטורה מאוחדת.

רשתות ניתוח סצנות מוקדמות הסתמכו על פעולות קונבולוציה ללכידת מרקמי מראה מקומיים, אך בשל מגבלות בשדות קליטה מקומיים, הן הראו קוהרנטיות סמנטית לא מספקת של מטרות בקנה מידה גדול21,22. מחקרים קודמים יישמו את מודול תשומת הלב העצמית של ארכיטקטורת הטרנספורמר הוויזואלי כדי להפיק מידע קונטקסטואלי גלובלי ולבנות תכונות אסוציאציה פיקסליות למרחקים ארוכים23,24. אסטרטגיות צבירת תכונות רב-תצוגות חוצות מודליות מפיקות את התכונות הגאומטריות התלת-ממדיות של הסצנה על ידי מיזוג ענני נקודת מפת עומק וקלטי פקודות טקסט25,26. מנגנוני קשב היברידיים למיקוד בתכונות בתחומים ספציפיים התבגרו בהדרגה. על ידי בניית גשרים לאינטראקציה בין תכונות, הם הפחיתו משמעותית את אובדן האנרגיה ואת דלילות התכונות בהעברת אותות חזותיים בקנה מידה רב-קנה מידה ושיפרו את עמידות הניתוח במבנים מורכבים. עיצובים מתקדמים של מקודדים משלבים ומסיקים במשותף פרטים מרחביים של תחום בתדר גבוה לצד תכונות גלובליות ומקומיות, ומחזקים את יכולת הרשת להבחין בין קטגוריות סמנטיות מדויקות עם דמיון גבוה ומשפרים את דיוק הניתוח הפנימיב-27,28. ההתקדמות האחרונה בארכיטקטורות סגמנטציה סמנטית מספקת מקורות חשובים לאופטימיזציה של יעילות חישובית ותפיסה מרחבית. מודלים שתוכננו לחיזוי צפוף ואגרגציה קונטקסטואלית רב-קנית מפיקים תכונות גאומטריות עדינות מרקעים מורכבים. אסטרטגיות ניתוק תכונות ומיזוג סינרגטי מתמודדות עם עמימות סמנטית באזורים גבוליים. מנגנוני קשב קלים ומודולי אגרגציה עם שער ממעלמים את התפלגות הפרמטרים, ובכך מאיצים את ההסקה תוך שמירה על פרטים מבניים מקומיים. יישום עיצובים אדריכליים יעילים אלו מספק הנחיות תיאורטיות להפחתת העומס החישובי של פעולות הסקה טופולוגיות לא-אוקלידיות בניתוח סצנות פנימיות.

הקדמת מבנה הבניין והערכת פריסה תלת-ממדית משמשות לתיקון שגיאות ניתוח חזותי מקומיות29. מחקרים קודמים חילצו תכונות גאומטריות אורתוגונליות ומקבילות של מבנים פנימיים כמגבלות הסקה להפחתת הטיית חיזוי רשת הנגרמת על ידי רקעים פנימיים עמוסים30,31. סכמות קיימות משתמשות באלגוריתמים לזיהוי מקטעי קו ובטכניקות ניתוח נקודות אבלציה לתמונה כדי ליצור קופסאות גבול תלת-ממדיות של מנהטן למיפוי הגבולות הפיזיים של חדרים ולסייע בלוקליזציה של תכונות ויזואליות בסיסיות32. הארכיטקטורה המשותפת של מודול מודול מודעות הגבול וההקשר הרב-קנה מידה משלבת באופן משתמע מידע מבני קודם בתהליך פענוח התכונות בממדים גבוהים, ומאלצת את הרשת להפיק מסכות סמנטיות התואמות במדויק את קווי המתאר הפיזיים האמיתיים, ובכך לשפר את המשוננות והטשטוש של קצוות האובייקטים33. עיצובים של פונקציית אובדן חצי-מפוקחת או חלשה עם תכונות שיפור גבולות נחקרו באופן נרחב. בהסתמך על נוסחאות מתמטיות קפדניות כדי להעניש התנהגות סיווג פיקסלים עצמאית שמפרה את כללי הטופולוגיה המרחביים, מובטחים החלקות הגאומטרית ושלמות המבנה של תוצאת הסגמנטציה הסופית ממקור אופטימיזציית הגרדיאנט34.

מחקרים מסוימים השתמשו ברשתות עצביות גרפיות לביצוע אגרגציה חוצת תחומים של תכונות ויזואליות והיגיון על יחסים טופולוגיים במרחב מממד גבוה35. אלגוריתם סגמנטציית הסופרפיקסל מחבר מראש בלוקים סמוכים עם תגובת צבע ותכונות טקסטורה דומות לצמתים מחוברים עצמאיים. אלגוריתם סגמנטציית הסופרפיקסל דוחס את היתירות החישובית של מבנה הגרף ברמת התמונה ושומר על הטופולוגיה הגיאומטרית הבסיסית של התמונה36. ה-GCN שנבנה על וקטור התכונות של הצומת בעל ממד גבוה, ומטריצת הסמיכות המייצגת קרבה מרחבית, מניעים את ההעברה הכיוונית היעילה ואת המיזוג האינטראקטיבי של מידע חזותי רב-קנה מידה לאורך הגרף הפיזי המחובר בתחום המרחבי37,38. היישום של מודול שיפור המידע הזמני ומנגנון חיבור דילוג רב-קנה מידה מדכא את ההחלקה וההומוגניזציה המופרזת של תכונות הצמתים שנוצרות בתהליך העברת הודעות עמוקות רב-שכבתיות39. טכנולוגיית טרנספורמציית גל גרף רב-קנה מידה, ואסטרטגיית אופטימיזציה ללמידת אלמנט פסאודו-תווית, מייעלות את מנגנון רעש הרקע של נוסחת עדכון תכונות הצמת, כך שתכונות עם אותן תכונות סמנטיות שומרות על מצב תגובה שיתופי בטופולוגיית רשתמורכבת 40. מנגנון ההסקה המבוסס על גרף ממפה רשתות פיקסלים רגולריות למרחבים טופולוגיים לא-אוקלידיים כדי לבצע חישובי אגרגציה של תכונות של מבנים לא סדירים ורכיבים פנימיים41.

פרוטוקול

מערכי נתונים של סצנות RGB פנימיות וההערות הסמנטיות שלהם הוכנו לפני ההדרכה ברשת. מערך הנתונים התלת-ממדי הפנימי הגדול ומערך הסצנות RGB-D הפנימי (ראו טבלת החומרים) התקבלו מהמאגרים הרשמיים שלהם. סצנות רכישה פנימיות שכללו סגירת רהיטים, שינויים בתאורה, הפרעת גבולות קיר ופריסות מרחביות מורכבות נשמרו כדי להתאים לתרחיש הניתוח המטרה. תוויות סמנטיות הומרו למסכות הערות PNG חד-ערוציות, וכל תמונות ה-RGB והמסכות הסמנטיות שונו לגודל 512 × 512 פיקסלים. במהלך ההדרכה יושמה הרחבת נתונים מקוונת, עם היפוך אופקי אקראי בהסתברות של 0.5, הגדלת בהירות אקראית בין 0.8 ל-1.2, וסיבוב אקראי בין −10° ל-+10° להרחבת התפלגות הפריסה המבנית. ערוצי RGB ננורמו עם ערכים ממוצעים של 0.485, 0.456 ו-0.406 וערכי סטיית תקן של 0.229, 0.224 ו-0.225. המדד התלת-ממדי הפנימי בקנה מידה גדול עקב אחרי חלוקת השחרור הרשמית ששימשה במחקר זה, עם 1201 סצנות אימון ו-312 סצנות אימות לפיתוח ואימות מודלים. מדד RGB-D לסצנות פנימיות עקב אחרי פרוטוקול ההערכה הרשמי, עם 795 תמונות אימון ו-654 תמונות בדיקה. לא הוחל חלוקה נוספת על בסיס אחוזים על שני המדדים הציבוריים הללו.

רשת עמוד השדרה הוויזואלי של טרנספורמטורים היררכיים עם חלון מוזז (ראו טבלת החומרים) הותחילה כעמוד השדרה של מקודד שנאי חלון נע. גודל ההטמעה של התיקון הוגדר כ-4 על 4 פיקסלים. מידות ההטמעה של ארבעת השלבים ההיררכיים הוגדרו ל-128, 256, 512 ו-1024, ומספר בלוקי השנאי בארבעת השלבים נקבע ל-2, 2, 18 ו-2. גודל חלון תשומת הלב המקומי הוגדר ל-7 על 7, ומספר ראשי תשומת הלב הוגדר ל-4, 8, 16 ו-32 בארבעת השלבים ההיררכיים. פונקציות הפעלה רציפה לא ליניאריות שימשו בתוך כל שכבות הפרספטרון הרב-שכבתיות. דגימה מרחבית בוצעה באמצעות פעולות מיזוג תיקונים עם צעד של 2 לאחר כל שלב היררכי. ארכיטקטורת הרשת המרכזית וההיפרפרמטרים של מודול ההסקה הקונבולוציונית סוכמו בטבלה 1.

לאחר מכן בוצעה חילוץ תכונות תשומת לב עצמית בחלון מוזז על מפות התכונות הקלטות. כל מפת תכונות חולקה לחלונות מקומיים לא חופפים עם ממדים מרחביים של 7 × 7. תשומת לב חלון רגילה ותשומת לב חלון מוסטת הוחלפו בין בלוקי שנאי חלונות מוזזים סמוכים. מרחק ההזזה המחזורי הוגדר ל-3 פיקסלים, וקידוד הטיית מיקום יחסית הוחל בכל חלון תשומת לב מקומי. תכונות ויזואליות מקומיות אוגדו באמצעות תשומת לב עצמית מרובת ראשים ליצירת ייצוגים היררכיים ורב-קנה מידה של תכונות.

קודמים מבניים של מנהטן הופקו מתמונות RGB פנימיות. מקטעי קצה מבניים זוהו באמצעות אלגוריתם זיהוי מקטעי קו בהתאם לכיוון הגרדיאנט. כיוונים מבניים דומיננטיים אוחדו באמצעות אלגוריתם קונצנזוס מדגם אקראי (RANSAC) (ראו טבלת החומרים) המבוסס על הערכת נקודת העלמות. שלושה כיוונים אורתוגונליים הדדית של מנהטן שוחזרו ליצירת ייצוג תיבת הגבול התלת-ממדית של מנהטן. הגבול המבני המשוחזר הומר למפת SDF על ידי חישוב המרחק האוקלידי המינימלי מכל פיקסל לקטע קו הגבול הקרוב ביותר.

תכונות קשב צולב מונחות על ידי מבנה נוצרו לאחר שהתכונות הוויזואליות והקדימות SDF הושגו. מניפולד התכונה הוויזואלית ממופה לטנזור השאילתה Q דרך מטריצת הטרנספורמציה הליניארית W תת-Q של כובע כפול R אל מטריצת היצירה W תת-Q של כובע כפול R למטריצת figure-protocol-1היצירה . שדה המרחק הרציף הקודם מופה לטנזור המפתח K ולטנזור הערך V דרך מטריצות figure-protocol-2הטרנספורמציה, וממד המודל הוגדר ל-512. מודולציה מרובת ראשים חילקה את מרחב ההקרנה ל-8 תת-מרחבים עצמאיים, כאשר לכל ראש ממד 64. הפריסה המרחבית הקודמת הקרינה קואורדינטות פיקסלים בדידות לשדה פוטנציאל רציף ויצרה את מטריצת הזיקה המבנית S כהטיה מרחבית מצטברת למודולציה של מטריצת הדמיון של מכפלת הנקודה. טנזור המאפיינים החזותיים שימש כמקור השאילתה, משום שניתוח סמנטי דורש שכל מיקום חזותי ישלף באופן פעיל ראיות עקביות מבנית מהמרחב הגאומטרי הקודם. הפריור של SDF שימש כמפתח ומקור ערך משום שהוא שומר מרחק גבול רציף ורמזים מבניים פנימיים-חיצוניים שמקורם בפריסת מנהטן. מונח מכפלת הנקודה-מדד את התאימות בין המראה הסמנטי לבין הפריור הגיאומטרי, בעוד שהמונח המבני המצטבר λS העביר את משקלי תשומת הלב לפיקסלים באותו מישור פיזי או קרוב לאותו קווי מתאר אדריכליים. המקדם λ ייצג את הביטחון בפריור המבני שהופק ושלט במידה שבה אילוצים אורתוגונליים קשיחים שולבו בהתפלגות הקשב. ניסוח זה הפחית את דיפוזיית המאפיינים החוצה גבולות שנגרמה על ידי הסתרת רהיטים ושמר על הרפיה אדפטיבית בפריסות שאינן במנהטן. התפלגות הקשב המונחית על ידי מבנה חושבה לפי משוואה 1.

משוואה 1: figure-protocol-3

כאשר A מציין את מטריצת אגרגציה מונחית מבנה, Q מציין את טנזור השאילתה שנוצר מתכונות חזותיות, K מציין את טנזור המפתח שנוצר מתכונות קודמות של SDF, V מציין את טנזור הערך שנוצר מייצוגים קודמים מבניים, dk מציין את ממד התכונה של טנזור המפתח, λ מציין את מקדם המשקל המבני האדפטיבי המשמש לזיהוי הביטחון הגיאומטרי של אזורים מקומיים ולהרפיית אילוצים אורתוגונליים קשיחים במרחב שאינו מנהטן פריסות, ו-S מציין את מטריצת הזיקה של SDF. החלוקה על ידי dk ייצבה את סולם הלוגיטים של תשומת הלב ומנעה מממדי תכונה גדולים לייצר משקלי קשב מרוכזים מדי. הפונקציה האקספוננציאלית המנורמלת (ראו טבלת החומרים) הפכה את ציוני הדמיון המודולציה להתפלגות מרחבית מנורמלת, שאפשרה לכל פיקסל לאסוף מידע מוקדם מבני בהתבסס על עקביות סמנטית וגאומטרית. עיצוב זה מסביר מדוע המראה הוויזואלי והפריבורים של הגבולות האדריכליים מתמזגים ברמת הקשב ולא על ידי שרשור תכונות ישיר.

גרף הטופולוגיה של סופרפיקסל נבנה ממפת תכונות מיושרת למבנה. מפת התכונות חולקה באמצעות אלגוריתם יצירת אזורים מרחביים. מספר הסופרפיקסל הוגדר ל-256, מקדם הקומפקטיות הוגדר ל-10, מקדם ההחלקה הגאוסיאנית הוגדר ל-1.0, ומספר האיטרציה הוגדר ל-10. מגבלות קרבה מרחבית נאכפו על ידי קביעת משקל מטרי המרחק ליחס קבוע של 1.0 למרחק מרחב הצבע של המאפיין במהלך האשכול, ובכך שמירה על יצירת צמתים אחידה על גבולות צפופים של בלאטרים. פיקסלים עם תגובות סמנטיות הומוגניות אוגדו לצמתים סופרפיקסלים. קשתות הגרף נבנו לפי יחסי סמיכות מרחביים, חוזק זיקה SDF, ומגבלות עקביות גאומטרית קו-פלנרית. תהליך הבנייה של מטריצת הזיקה המבנית והקישוריות הטופולוגית מוצג באיור 3, ומציג כיצד הנחיית SDF הוסבה ליחסים מרחביים ברמת הגרף.

ניסוח הגרף הוצג כדי להמיר הסקה צפופה על פי פיקסלים להסקה מרחבית לפי צמתים מעל אזורים מבניים הומוגניים. כל צומת סופרפיקסל ייצג אזור מקומי עם תגובה סמנטית דומה ורציפות מרחבית, בעוד שכל קשת ייצגה מסלול אמין להעברת תכונות בכפוף למגבלות של שכירות, זיקה למרחק-שדה ועקביות קו-פלנרית. עיצוב זה הפחית את ההשפעה של פיקסלים רועשים מבודדים ואפשר לאזורים סגורים על הקירות, הרצפה והתקרה לקבל הודעות מצמתים פיזיקליים סמוכים. לכן, מבנה הקצוות שימש כגשר מתמטי בין הנחיית SDF רציפה לבין הסקת גרפים לא-אוקלידית בדידתית.

רשת חשיבה קונבולוציונית גרפית בת שלוש שכבות הוגדרה עם ממדים נסתרים של 512, 256 ו-128. שכבת הקונבולוציה של הגרף ביצעה החלקה של מבנה הגרף בהתבסס על הקשרים המרחביים של הצמתים. הסכנות של הלולאה העצמית שמרה על המצב המקורי של כל צומת במהלך העברת הודעה, ומנעה מתכונות של אזור מבני קטן להימחק על ידי אזורים גדולים שמסביב. נורמליזציה סימטרית קנה מידה את רכיבי מטריצת השכנות לפי מכפלת שורשי הריבוע ההפוכים של דרגות הצמתים כך שצמתים במעלה גבוהה ונמוכה תרמו תחת גדלים נומריים דומים במהלך ההתפשטות. הפצת הזנה קדימה ביצעה אגרגציה מרחבית מקומית, שבה כל מצב צומת ספג תכונות בממדים גבוהים מאשכולות קו-פלנריים סמוכים לפני שהוחל פונקציית יישור לא ליניארית לפי אלמנט. ניסוח זה גרם לשכבת הקונבולוציה של הגרף להתקרב לדיפוזיה סמנטית לאורך מישורים פנימיים בעלי משמעות פיזיקלית, במקום להחלקה בלתי מוגבלת על גבולות של עצמים לא קשורים. תכונות הצמתים בגרף הוערכו לפי משוואה 2.

משוואה 2: figure-protocol-4

ההקרנה מתכונות פיקסל צפופות לצמתים סופרפיקסליים, העברת הודעות קונבולוציה גרפית והקרנת קואורדינטות אחורית מוצגות באיור 4, ומבהירות את מסלול האגרגציה של תכונות מרשתות תמונה רגילות לטופולוגיה שאינה אוקלידית וחזרה לייצוג סמנטי צפוף. ההיטל מתכונות פיקסל צפופות באיור 4A לצמתים סופרפיקסלים באיור 4B, העברת הודעות קונבולוציה גרפית באיור 4C, והקרנה אחורית בקואורדינטות באיור 4D מבהירות את מסלול אגרגציית התכונות מרשתות תמונה רגילות לטופולוגיה לא-אוקלידית וחזרה לייצוג סמנטי צפוף.

כאשר H(l) מציין את טנזור תכונת הצומת של שכבת הקונבולוציה של הגרף ה-l, Â מציין את מטריצת הסמיכות עם חיבורי לולאה עצמית, D מציין את מטריצת הדרגה המתאימה למטריצת השכנות, W(l) מציין את מטריצת המשקל הניתנת ללמידה של שכבת הקונבולוציה של הגרף ה-l, ו-σ מציין את פונקציית ההפעלה של יחידת הליניארית המתוקנת. המונח ÂH(l) אגד תכונות מצמתים סופרפיקסלים סמוכים, בעוד ש-D−1/2 ו-D−1/2 איזנו את תרומת הצמתים עם צפיפויות חיבור שונות. מטריצת הלמידה W(l) הקרינה תכונות צומת מצטברות למרחב סמנטי חדש, מה שמאפשר לשכבת הגרף להבחין בין עקביות מבנית לבין קרבה מרחבית רגילה. ההפעלה הלא-ליניארית שמרה על ההבדל בתגובות בין אזורים קו-פלנריים לא-קו-פלנריים לאחר הצטברות התכונות.

מאפייני סגמנטציה סמנטית פוענחו לאחר הסקת גרף. המפענח נבנה באמצעות שלושה שלבי דגימה דוגמת אינטרפולציה ביליניארית ופעולות מיזוג דילוג חוצה שכבות. תכונות מקודד מרחביות רדודות חוברו עם תכונות מפענח סמנטי ברמה גבוהה באמצעות מיזוג ערוץ-ערוץ. רזולוציית התכונה הוחזרה לגודל התמונה המקורי, ומפת החיזוי הסמנטית הסופית נוצרה דרך שכבת קונבולוציה 1 × 1.

רשת הניתוח הסמנטי המלאה אומנה באמצעות אופטימיזציה של דעיכת משקל-משקל מנותק (ראו טבלת החומרים). קצב הלמידה ההתחלתי הוגדר ל-0.0001, מקדם דעיכת המשקל ל-0.01, וגודל האצווה ל-8 עבור שני המדדים הציבוריים. קצב דעיכת המומנט הראשון נקבע ל-0.9, קצב דעיכת המומנט השני נקבע ל-0.999, ומקדם היציבות הנומרית של אפסילון נקבע ל-1 × 10⁻8. אובדן האימות נוטר בסוף כל תקופה, ונקודות ביקורת נשמרו כאשר ה-mIoU בקבוצת האימות עלה. הרשת אומנה ל-300 תקופות באמצעות אסטרטגיית דעיכת קצב למידה פולינומי עם עוצמת דעיכה של 0.9. חמש ריצות אימון עצמאיות בוצעו באמצעות אתחולים אקראיים שונים כדי לקבוע קו בסיס להערכה סטטיסטית קפדנית. הרשת עוצבה אופטימיזציה משותפת באמצעות אובדן אנטרופיה צולבת ברמת הפיקסלים ואובדן עקביות מבנית. כל הניסויים בוצעו על פלטפורמת מחשוב המצוידת בחומרת מחשוב מקבילית בזיכרון גבוה, ומידע מפורט על חומרה דווח בטבלת החומרים.

אופטימיזציה משותפת אכפה יישור גבולות גאומטריים על ידי חישוב גודל הגרדיאנט המרחבי של טנזור ההסתברות של המחלקה. אובדן העקביות המבנית שימש כרגלרייזר, כלומר מכפיל את נורמת גרדיאנטי החיזוי המרחביים בערכי SDF רציפים. ההיגיון המתמטי היה ששינויים בקטגוריות סמנטיות צריכים להתרכז בקרבת קווי המתאר האדריכליים האמיתיים, כאשר ה-SDF מתקרב לאפס, בעוד שפנים קירות, רצפות ותקרות שטוחים צריכים לשמור על תגובות סמנטיות חלקות. כאשר גרדיאנט חיזוי גדול הופיע רחוק מגבול מבני, מונח שדה המרחק הגדיל את העונש ומנע מעברים סמנטיים שגויים בתוך מישור פיזיקלי הומוגני. כאשר הופיע גרדיאנט חיזוי קרוב לקונטור של מרחק אפס, העונש נשאר מוגבל ושמר על מעברים לגיטימיים לאורך גבולות אדריכליים. אזורי מעבר סמנטיים הוגבלו ליישר את קווי המתאר של SDF, כפי שניתן במשוואה 3.

משוואה 3: figure-protocol-5

כאשר Lסך כולל מציין את פונקציית המטרה הסופית לאופטימיזציה, Lce מציין את אובדן האנטרופיה הצולב ברמת הפיקסל, Lscl מציין את אובדן העונש על עקביות מבנית, ו-α מציין את מקדם משקל ההפסד המבני. מונח האנטרופיה החוצה סיפק פיקוח סמנטי ברמת הפיקסל באמצעות מסכות אנוטציה, בעוד שמונח העקביות המבנית הטיל רגולריזציה גאומטרית באמצעות קודמים אדריכליים. מקדם המשקל α זיהוי קטגוריות מאוזן ויישור גבולות, ומונע מהאופטימיזציה להתאים יתר על דיוק תוויות מקומיות או קווי מתאר מבניים קשיחים. מטרה משותפת זו קישרה בין סמנטיקה חזותית, עקביות גבולות פיזיקלית ופרמטרים ניתנים לאימון לרשת בתוך יעד אופטימיזציה מאוחד.

תוצאות

סידור ניסיוני

מחקר זה השתמש בשני מאגרי נתונים סטנדרטיים לניתוח סצנות פנימיות, מערך נתונים תלת-ממדי רחב בקנה מידה פנימי ומערך RGB-D לסצנות פנימיות, כדי להעריך ביצועים ולכוונן את המודל. מאגר הנתונים התלת-ממדי הפנימי בקנה מידה גדול כולל סצנות פיזיקליות מורכבות וסריקות ריאליסטיות ותצוגות RGB ברזולוציה גבוהה, המספקת תוויות סמנטיות תלת-ממדיות מדויקות של פיקסל-אחר פיקסל ומסכות סגמנטציה דו-ממדיות בהקרנה מרחבית. נתוני שחזור הרשת של המרחב הפיזיקלי הריאליסטיים ותכונות המישור האורתוגונלי שלו יוצרים קריטריון השוואת אמת גאומטרית לבניית תיבת הגבול התלת-ממדית של מנהטן בענף החילוץ בצורה מדויקת. מאגר הנתונים של סצנות פנים RGB-D מכיל תמונות עומק פנימיות מוסתרות על ידי רהיטים ועומס, ומשמש לבדיקת דיוק הלוגי הגלובלי של הרשת ועמידותה להסתירות.

האלגוריתם משתמש ב-mIoU כדי למדוד את החפיפה המרחבית בין ההתפלגויות הסמנטיות החזויות והאמיתיות, תוך הכנסת ציון F1 בגבול מבני כדי להעריך באופן קפדני את דיוק ההתאמה בין המסכה החזויה לקצוות הפיזיקליים-מבניים במרחק אפס שמכוילים על ידי ה-SDF. סף שגיאה קבוע למרחק פיקסלים במרחב האוקלידי נקבע במהלך החישוב כדי לקבוע האם פיקסלי הקצוות שנוצרים על ידי הרשת חותכים את קווי המתאר הפיזיים האמיתיים של המבנים. מערכת הערכה כפולה זו מגבילה שגיאות סיווג בבלוקים סמנטיים רחבי שטח תוך חיזוק הערכה מיקרו-כמותית של אפקט השחזור הטופולוגי של קווים קשיחים. כדי לשמור על עקביות בין תצורת הנתונים הניסיוניים לתהליך האופטימיזציה, סוכמו בקנה המידה של מערך הנתונים והפרפרמטרים המרכזיים של האימון בטבלה 2. טבלה 2 מדווחת על תצורה ניסויית מוסמכת אחת לכתב היד המתוקן. מדד הבנצ'מרק התלת-ממדי הפנימי בקנה מידה גדול משתמש ב-1201 סצנות אימון ו-312 סצנות אימות, מדד RGB-D לסצנות פנימיות משתמש ב-795 תמונות אימון ו-654 תמונות בדיקה, ושני המדדים מאומנים בגודל אצווה של 8, קצב למידה התחלתי של 0.0001, מקדם דעיכת משקל של 0.01, ו-300 עידן אימון.

השוואה לשיטות מתקדמות

לפני הצגת טבלת השוואה כמותית של אלגוריתמים לניתוח סצנות פנימיות, סעיף זה מגדיר בקפידה את מדדי הבדיקה המשמשים במערכת ההערכה הרב-ממדית. כדי לשקף את ביצועי הסיווג של המודל בגרנולריות שונות, מערכת ההערכה משלימה למערכת הבדיקה שני מדדים נוספים: דיוק פיקסלים גלובלי (PixelAcc) ודיוק ממוצע במחלקות (MeanAcc). מדדים אלה יחד בונים מערכת אימות ביצועי אלגוריתמים מפורטת, ומבססת ייחוס תיאורטי קפדני לניתוח כמותי מאוחר יותר. כדי להעריך את דיוק הניתוח הסמנטי ועמידות ההסתרה של האלגוריתם המוצע במרחבים פיזיקליים מורכבים, בוצעו ניסויים השוואתיים עם אלגוריתמים קיימים על ערכת אימות הסצנה הפנימית RGB-D. ספריית מודלי ההשוואה מכסה מסגרות יסוד של מסכה-תשומת לב, טרנספורמרים היררכיים בראייה, צינורות סגמנטציה קונבולוציוני טהור מודרניים, ארכיטקטורות חיזוי צפופות מאוחדות ורשתות קשב חוצות ערוצים. הערכת הבנצ'מרק הורחבה לכלול קו בסיס של סגמנטציה מבוססת שנאי, קו בסיס מאוחד של חיזוי צפוף, קו בסיס מאוחד לזיהוי וסגמנטציה, בסיס ראייה בקנה מידה גדול, קו בסיס קונבולוציוני טהור, קו בסיס מבוסס מסכה-קשב, בסיס לאגרגציה של תכונות חוצה-מודלית, וקו בסיס של מיזוג תכונות מתקדם (ראו טבלת החומרים), תוך שימוש באותו סט אימות RGB-D לסצנות פנימיות, רזולוציית קלט, לוח אימונים ופרוטוקול מטרי. בארכיטקטורה המוצעת, הרשת המונחית על ידי מבנה משלבת עמוד שדרה חזותי רב-קנה מידה עם חלון מוזז, מודול קשב רוחב מונחה מבנה עם SDF, ו-GCN סופרפיקסל. ההשוואה המורחבת כוללת חיזוי צפוף מבוסס טרנספורמר, חיזוי צפוף מבוסס קונבולוציה, ניתוח מסכה-קשב, מיזוג תכונות חוצה מודליות ופרדיגמות מיזוג תכונות פרוגרסיביות, המאפשרת הערכה של תרומתה של התערבות גאומטרית גאומטרית מפורשת מול קווי בסיס רחבים יותר של ניתוח סצנות פנימיות.

טבלה 3 מפרטת את ביצועי ההערכה האובייקטיבית של כל רשת על המדדים הכמותיים המרכזיים, ומדווחת על ערכי הממוצע והסטיות התקן המתאימות בחמש ריצות עצמאיות. ההשוואה המורחבת של קו הבסיס מעריכה האם מנגנון ההיגיון המונחה-מבנה המוצע תורם לשיפור דיוק מעבר לעמודי השדרה הסטנדרטיים של חיזוי צפוף, רשתות סגמנטציה מבוססות מסכה ורשתות מיזוג תכונות RGB-D. נתונים ניסיוניים מראים שהאלגוריתם המוצע משיג רווחים יציבים בכל ארבעת המדדים הכמותיים. רשתות חיזוי צפופות מבוססות טרנספורמר ורשתות מסכה-קשב שמרו על יכולת מידול הקשר גלובלי חזקה, אך ערכי Boundary F1 שלהן נותרו נמוכים יותר בנוכחות עומס בחזית, משום שהמסכות החזויות לא כללו מגבלות גבול פיזיות מפורשות. רשתות היתוך חוצות-מודליות ופרוגרסיביות שיפרו את הרציפות הסמנטית המקומית, אך מיזוג התכונות שלהן עדיין התבסס בעיקר על מראה ותגובות עומק ולא על מבנה מוקדם במרחק מסומן. הרשת המונחית-מבנית המוצעת השיגה mIoU של 0.687 עם סטיית תקן של 0.002 וציון ממוצע בגבול F1 של 0.764 עם סטיית תקן של 0.003. ההשוואה המורחבת מצביעה על כך שהשיפור בביצועים לא נבע אך ורק משדרה חיזוי צפוף וגדול יותר, אלא משימוש משותף בהנחיית שדה מרחק מסומן, קשב צולב מודע למבנה והסקת טופולוגיה מבוססת גרפים.

כדי לנתח את דיוק ההסקה הלוגית הגלובלי של המודל תחת חסימות, זיהינו וחילצנו תרחישים טיפוסיים בקבוצת האימות שהיו חסומים קשות על ידי רהיטים ועמס אחר, והפקנו ויזואליזציות של מסכות חיזוי ברמת הפיקסל.

לאחר השיטה הוגדרו תהליך זרימת העבודה וההסקה הגרפית באיור 1, איור 2, איור 3 ואיור 4. איור 5 ממחיש את ההבדלים בתחזיות מורפולוגיות בין מודלים בתנאי חסימה קיצוניים. המלבנים האדומים במפת רשת ההשוואה האיכותית מסמנים אזורי קונפליקט מרכזיים שבהם הפינות ומשטחי הנושאים מוסתרים. מסכת הפלט מקו הבסיס של סגמנטציה מבוססת מסכה-קשב מראה החלקת קצוות בולטת והיצמדות בין מחלקות. למרות שקו הבסיס של אגרגציית תכונות בין-מודאלית וקו הבסיס של מיזוג תכונות פרוגרסיבי משלבים נתונים חוצים-מודליים, תוצאות החיזוי שלהם עדיין מציגות אי-רציפויות מבניות ועיוותי גבולות פיזיים. המסכה שנוצרת בשיטה המוצעת מציגה חפיפה מרחבית גבוהה עם תוויות האמת הקרקעית. מודלים בסיסיים, המוגבלים על ידי עקרונות מונעי פיקסלים בלבד, נוטים לאבד את שדות הקליטה המקומיים שלהם כאשר הם נסתרים. השיטה המוצעת עושה שימוש ב-GCN סופרפיקסל לביצוע העברת הודעות במרחב לא-אוקלידי, ובכך לשחזר את הפינות הבסיסיות והשלדים המרחביים הליניאריים המונחים על ידי גבולות גאומטריים סמויים. זה מאמת את ביצועי האנטי-הפרעות של הפתרון המוצע שלנו בפתרון פריסות פנימיות מורכבות מנקודת מבט מורפולוגית ויזואלית.

ניסוי אבלציה

כדי לנתח את התרומה האמיתית של כל רכיב עצמאי בארכיטקטורה המוצעת, מחקר זה בנה מבחן אבלציה מודולרי מורחב על סט אימות הסצנה הפנימית RGB-D. קו הבסיס של הבדיקה הוגדר לרשת סיווג קונבנציונלית עם רק עמוד השדרה הוויזואלי של שנאי חלון מוסט בסיסי. הערכה כמותית מדדה את התרומה העצמאית של תשומת לב צולבת מונחית מבנה, הטיית שדה מרחק מסומן, משקל מבני אדפטיבי, הסקת גרף סופרפיקסל, בניית קצוות קו-מישוריים, נרמול גרף סימטרי ואובדן עקביות מבנית. עיצוב אבלציה מורחב זה הפריד בין רווחי מודולים מצטברים להשפעות הסרת רכיבים, מה שהבהיר את גבול התרומה של כל בחירת עיצוב.

טבלה 4 ואיור 6 ממחישים את התפתחות הדיוק תחת הגדרות מורחבות של אבלציה מצטברת ומבוססת הסרה. רשת הטרנספורמטורים הבסיסית עם חלון מוזז חסרה מגבלות גבול פיזיקליות תלת-ממדיות, מה שמוביל לאגרגציה מוגבלת של תכונות ברקעים עמוסים. הוספת קשב צולב מונחה על ידי מבנה העלתה את ה-mIoU מ-0.615 ל-0.648 ואת ציון Boundary F1 מ-0.630 ל-0.685, מה שמראה כי שדה המרחק המסומן שיפר את היישור בין תכונות ויזואליות לקווי המתאר המבניים. הוספת הסקת גרף סופרפיקסל בלבד העלתה את ה-mIoU ל-0.641 ואת ציון Boundary F1 ל-0.676, מה שמעיד שההסקה טופולוגית לפי צמתים שיפרה את העקביות הסמנטית על פני אזורים פיזיקליים הומוגניים. הוספת אובדן עקביות מבנית בלבד העלתה את ה-mIoU ל-0.632 ואת ציון הגבול F1 ל-0.662, מה שמראה כי מונח ההפסד השפיע בעיקר על התאמת הגבול ולא על איגום הקשר רחב.

שילוב קשב צולב עם חשיבה גרפית העלה את mIoU ל-0.669 ואת ציון Boundary F1 ל-0.721, מה שמראה כי יישור ויזואלי-מבני והעברת הודעות בתחום הגרף יצרו השפעות משלימות. שילוב של תשומת לב צולבת עם אובדן עקביות מבנית השיג mIoU של 0.660 וציון Boundary F1 של 0.713, בעוד ששילוב של הסקת גרף עם אובדן עקביות מבנית השיג mIoU של 0.653 וציון Boundary F1 של 0.704. תוצאות זוגיות אלו מצביעות על כך שמודול הקשב החוצה סיפק את אות היישור הגיאומטרי הראשי, מודול ההסקה הגרפית הרחיב אות זה על פני אזורים קו-פלנריים, ואובדן העקביות המבנית שיפר את גבול המעבר הסמנטי במהלך האופטימיזציה.

אבלציה מבוססת הסרה הבהירה עוד יותר את תרומת הבחירות העיצוביות הפנימיות. הסרת ההטיה התוספתית של שדה מרחק מסומן הפחיתה את mIoU ל-0.656 ואת ציון הגבול F1 ל-0.698, ואישרה שמטריצת הזיקה המבנית הייתה מרכזית לדיכוי דיפוזיית תכונות חוצות גבולות. הסרת מקדם המשקל המבני האדפטיבי λ הפחיתה את mIoU ל-0.671 ואת ציון Boundary F1 ל-0.736, מה שמעיד על כך שמגבלה מבנית קבועה החלישה את תגובת המודל באזורים שאינם מנהטן ובאזורים עם הידרדרות ויזואלית. הסרת מגבלת הקשת הקופלנרית הפחיתה את mIoU ל-0.666 ואת ציון הגבול F1 ל-0.728, מה שמראה שקשתות גרף המבוססות רק על שכנות מקומית לא שמרו על עקביות פיזיקלית במישור. הסרת נורמליזציה של גרף סימטרי הפחיתה את mIoU ל-0.673 ואת ציון הגבול F1 ל-0.737, מה שמעיד כי התפשטות מאוזנת דרגה הייתה הכרחית לאגרגציה יציבה של צמתים. הרשת המונחית המבנית המלאה שהוצעה השיגה mIoU של 0.687 וציון Boundary F1 של 0.764, מה שמראה כי הרווח הסופי נבע מהאינטראקציה המתואמת בין תשומת לב מבנית, הסקת גרפים ואופטימיזציה מודעת לגבולות.

ניתוח מורכבות חישובית, זמן אימון ויעילות הסקה

כדי להעריך את העלות החישובית של חילוץ SDF, קשב צולב מונחה מבנה, והסקה קונבולוציונית בגרף סופרפיקסל, מחקר זה העריך את קנה המידה של הפרמטרים, פעולות בנקודה צפה, שימוש בזיכרון שיא, זמן אימון, השהיית הסקה במסגרת אחת, קצב פריימים ו-mIoU באותה פלטפורמת מחשוב. פעולות בנקודה צפה חושבו ברזולוציית קלט 512 ×-512. השהיית ההסקה נמדדה עם גודל אצווה של 1 לאחר חימום המודל, בעוד שקצב הפריימים המדווח חושב מהשהיית התמונה הממוצעת. זמן ההדרכה נמדד תחת אותו לוח זמנים של 300 עידנים, גודל אצווה של 8, הגדרות אופטימיזציה וצינור עיבוד נתונים מוקדם.

טבלה 5 מפרטת את הקשר בין קנה מידה של המודל, עלות ההדרכה, יעילות ההסקה ודיוק הניתוח עבור כל ארכיטקטורת רשת. עמודות mIoU ו-Boundary F1 בטבלה 5 משתמשות באותם ערכי סט אימות כולל כמו בטבלה 3 עבור כל מודל מתאים. שתי עמודות הדיוק הללו חזרו בטבלה 5 אך ורק כדי להשוות בין דיוק הניתוח לעלות החישובית. העלייה בפרמטרים ניתנים לאימון נבעה בעיקר משכבות ההקרנה של מפתח השאילתות במודול הקשב הצולב המונחה על ידי מבנה ומטריצות המשקל של שלוש שכבות הקונבולוציה של הגרפים. העלות הלא-ניתנת לאימון נגרמה בעיקר מיצירת SDF, חלוקת סופרפיקסלים ובניית שייכות גרפית. מכיוון שפעולות שאינן ניתנות לכיוון בוצעו פעם אחת עבור כל תמונה קלט, הן הגדילו את השהיית ההסקה אך לא הגדילו משמעותית את מספר הפרמטרים הניתנים לאימון. הפרדה זו מסבירה מדוע השיטה המוצעת הראתה עלייה מתונה בפרמטרים אך עלייה בולטת יותר בהשהייה. תוצאות המורכבות מראות שקו הבסיס של סגמנטציה מבוסס מסכה-קשב שמר על ספירת פרמטרים קטנה יותר וזמן השהיית הסקה קצר יותר, אך ציון Boundary F1 וה-mIoU שלו היו מוגבלים תחת חסימה חמורה בשל היעדר הנחיית גבול גאומטרית מפורשת ברשת. קו הבסיס של אגרגציה של תכונות חוצה מודליות דרש יותר פעולות בנקודה צפה וזמן אימון ארוך יותר, משום שאגרגציה חוצה מודליות יצרה עומס נוסף ליישור תכונות. קו הבסיס של מיזוג התכונות הפרוגרסיבי שמר על עלות חישובית בינונית, אך דיוק החיזוי שלו נותר נמוך יותר מזה של השיטה המוצעת תחת עיוות גבול. הרשת המונחית-מבנית המוצעת נושאת עלויות חישוביות נוספות בשל בניית SDF, הקרנת תשומת לב צולבת מבנית, בניית גרף סופרפיקסל והפצת קונבולוציה של גרף. המודל המלא השתמש ב-66.8 מיליון פרמטרים, 121.4 מיליארד פעולות נקודה צפה, 15.6 שעות אימון, 7.9 גיגה זיכרון שיא, 61 מילישניות של זמן הסקה במסגרת אחת, ו-16.4 פריימים לשנייה. למרות שהשהיית ההסקה הייתה גבוהה יותר מזו של קו הבסיס של מסכה-תשומת לב טהורה, המודל השיג mIoU של 0.687 וציון גבול F1 של 0.764, מה שמעיד שהעלות הנוספת תמכה בעיקר בתיקון גבולות מבני ובעקביות סמנטית מודעת לטופולוגיה.

כדי לייצג חזותית את האיזון המרחבי הדו-ממדי בין הסקאלה החישובית לדיוק האנליטי של המודל, נוצרה דיאגרמת התפלגות בועות המציגה את מספר פעולות הנקודה הצפה ואת mIoU של האלגוריתם. הוויזואליזציה המתוקנת דיווחה גם על זמן אימון והשהיית הסקה באזור ההערות של האיור, מה שאפשר השוואת רווחי דיוק ועלויות חישוב הן מנקודת מבט של אימון והן מנקודת מבט של פריסה. הציר האופקי שמר על פעולות נקודה צפה, הציר האנכי שמר על mIoU, גודל הבועה ייצג כמות פרמטר ניתנת לשיון, והתווית המצורפת דיווחה על זמן הסקה לכל שיטה.

איור 7 חושף את הקשר בין פעולות נקודה צפה, קנה מידה של פרמטרים, השהיית הסקה ודיוק הניתוח. השיטה המוצעת משיגה mIoU גבוה יותר מרשתות ההשוואה, בעוד ש-FLOPs ומספר הפרמטרים שלה נשארים קרובים לאלו של קווי הבסיס של מיזוג חוצה-מודאלי ופרוגרסיבי. השהיית פריים בודדת של 61 מילישניות מצביעה על כך שהענפים הנוספים של ה-SDF וההסקת גרפים יצרו עומס פריסת, אך ההשהיה נשארה בטווח הזמן האמיתי הנדרש למשימות פירוש סצנות פנימיות רבות. זמן האימון הוגדל ל-15.6 שעות מכיוון שבוצעו חילוץ מוקדם מבני, הקרנת קשב והסקת גרף בכל תקופת אימון. תוצאה זו מראה כי העלות החישובית של השיטה המוצעת מרוכזת בעיקר בהיגיון מבני מודע לגבולות ולא בהרחבת פרמטרים בלתי מבוקרת.

השוואה ספציפית בין אובדן עקביות מבני לאובדן מרחק מרחבי

אובדן רשת הטרנספורמציה ההפוכה לקוונטיזציה של מרחק טרנספורמציה מרחבי גבול משתמש בפרמטרי טרנספורמציה הומומורפיים כדי ללכוד הזזות גבול, ומדגים שמדדי מרחק מרחבי טהור עולים על אובדני אנטרופיה חוצה מסורתיים המבוססים על שינויים בתווית הפיקסלים. בהתבסס על קונצנזוס תיאורטי זה, מתבצעים ניסויי אימות מקבילים באמצעות שיטות הגבול-הגבלה להערכת הביצועים ההשוואתיים של אובדן עקביות מבני (SCL) המותאם אישית מבוסס תיבת הגבול במנהטן ביחס להתאמה לסצנה. הניסויים שומרים על הארכיטקטורה האנליטית של מיזוג עמוד שדרה חזותי רב-קנה מידה עם רשת הסקת גרפים, תוך החלפת מונח אובדן הגבול במהלך הפצה לאחור. ארבע רשתות אימות מקביליות מוגדרות: רשת המשתמשת רק באובדן אנטרופיה חוצה בסיסי חסרה מגבלות גאומטריות בממדים גבוהים; רשת עם אובדן אנטרופיה בינארית סטנדרטית (BCE) מבצעת פיקוח קונבנציונלי על סיווג בינארי קשת; רשת עם אובדן מרחק גבולי מרחבי נוסף מתמקדת בלכידת עיוותים מקומיים; ורשת המיישמת את ה-SCL המוצע מטילה עונשים טופולוגיים אורתוגונליים המבוססים על SDF. מדדי הקוונטיזציה בסט אימות הסצנה הפנימית RGB-D מוגבלים ל-mIoU ולציון F1 של הגבול המבני.

טבלה 6 מפרטת את מידת ההתערבות של אסטרטגיות אופטימיזציה לאחור שונות על קוגניציה לוגית מרחבית בסיסית. הערך החוצה-אנטרופיה בלבד בטבלה 6 מציין את הארכיטקטורה המוצעת שלנו שמאומנת אך ורק באובדן אנטרופיה צולבת ברמת הפיקסלים, תוך שמירה על עמוד השדרה הוויזואלי, ענף שדה מרחק מסומן, מודול קשב צולב מונחה על ידי מבנה, וסניף חשיבת גרף סופרפיקסל ללא שינוי. ערך זה אינו קו בסיס של Mask2Former ואין להשוות אותו לערך הכולל של Mask2Former בטבלה 3, שכן הוא משתמש באותו מודל. רשתות המסתמכות אך ורק על אובדן אנטרופיה חוצה בסיסי משיגות את ציון התאמת הגבול הנמוך ביותר. רשתות עם אובדן אנטרופיה בינארית סטנדרטית נוסף משיגות רווח קל, אך מנגנון זה עדיין גורם לטשטוש קצוות תחת חסימה בקנה מידה גדול. אובדן מרחק גבול מרחבי משפר את הציון באמצעות מנגנון תפיסה של טרנספורמציה מרחבית, ומתקן ביעילות קצוות מעוותים. אובדן העקביות המבנית המוצע במאמר זה מנצל ישירות את ה-SDF האמיתי כדי להטיל עונשים גרדיאנטים על מוטציות סמנטיות חריגות בתוך המשטח הפיזי הנושא עומס, ומשיג את הציון הגבוה ביותר של F1 בגבול המבני.

כדי להשוות ויזואלית את ההשפעות המניעות של תצורות פונקציות אובדן שונות על דיוק חיזוי המסכה והתאמת גבולות, ציירנו תרשימי עמודות מקובצים בין אסטרטגיות אופטימיזציה שונות.

איור 8 ממחיש את שיפור הביצועים השלבי הנובע משדרוג ממד התפיסה המרחבית של פונקציית האובדן. תרשים הקו המייצג את ציון F1 של הגבול המבני מציג מגמת עלייה משמעותית. נתונים ניסיוניים מראים שמנגנון העונש המותאם הזה מאלץ את מיקום הקפיצה המרחבית של הקטגוריה החזויה להתאים בדיוק לקווי המתאר הפיזיים האורתוגונליים. מנגנון עונש שדה המרחק, המותאם לפריימים אורתוגונליים פנימיים, משיג דיוק גבוה יותר מאובדן לכידת הגבול המרחבי הכללי, ובכך יוצר מסלול אופטימיזציה יעיל לטיפול בתקלות מורכבות בבניין.

בדיקות עמידות של התפלגות חסימה קיצונית, מבנים חריגים ותנאי תאורה מאתגרים

יחסים מרחביים מורכבים בין אובייקטים והסתרה הדדית משפיעים לרעה על הקוגניציה המרחבית התלת-ממדית הגלובלית. ארכיטקטורת החיזוי המשותף מדגישה את התפקיד התומך של מגבלות פריסת הסצנה בהפקת המסכה הבסיסית. בחינת מגבלות האנטי-הפרעות של האלגוריתם תחת אובדן אות ויזואלי בשטחים גדולים ופריסות מרחביות חריגות שמפרות את ההנחה הפיזיקלית האורתוגונלית התלת-ממדית מגדירה בבירור את גבול היישום האפקטיבי של האלגוריתם ויש לה ערך מרכזי שניתן להוכיח. בהתבסס על אחוז הרהיטים הגדולים המוסתרים בתוויות האמת הקרקעית, סט הבדיקה של RGB-D מתחלק לשלוש תת-קבוצות קשות יותר: חסימה קלה, בינונית וחמורה. במקביל, סצנות שאינן טיפוסיות למנהטן עם תקרות משופעות או קירות מעוקלים מחולקות ידנית לבניית סטים של בדיקות גבולות חריגות, וסצנות עם תנאי תאורה נמוכה מאוד, חשיפה יתר, ומשטחים גדולים של זכוכית מבריקה או שקופה מחולקות לתת-קבוצות תאורה ומרקמים מאתגרות. ספריית מודל ההשוואה כוללת קו בסיס של סגמנטציה מבוססת מסכה-קשב; ארכיטקטורת סגמנטציה כללית המבוססת על תשומת לב מסכה ללכידת הקשר גלובלי; קו בסיס לאגרגציה של תכונות חוצה-מודאלית המשתמש באסטרטגיית אגרגציה בין-מודלית מקיפה; וקו בסיס של מיזוג תכונות פרוגרסיבי המשלב מנגנון הפקת תכונות פרוגרסיבי רב-שלבי. כל קו בסיס השוואה, עמוד השדרה הוויזואלי של המיזוג וארכיטקטורת ניתוח רשת ההסקה הגרפית שנבנתה במאמר זה מוערכים באופן עצמאי על תת-הקבוצות הנ"ל, וגרדיאנט דעיכת הדיוק של כל מודל מנותח סטטיסטית.

טבלה 7 מדווחת על מדדי עמידות ספציפיים לתת-קבוצה תחת חסימה קלה, בינונית וחמורה, תאורה מאתגרת, הפרעות מרקם ואנומליה שאינה מנהטן. טבלה 7 מפרטת את השינויים בדיוק חיזוי המסכות של מודלים שונים תחת הפרעות מרחביות. טבלה 7 מדווחת על ערכי mIoU ספציפיים לתת-קבוצה עבור מודלים שונים בתנאי הפרעות מרחביות, המחושבים רק בתוך תת-הקבוצה המתאימה להסתרה, תאורה, טקסטורה או תת-קבוצה שאינה מנהטן, ולא על סט האימות הכולל של RGB-D לסצנות פנימיות. בתת-הקבוצות של חסימה קלה ובינונית, כל המודלים שומרים על דיוק בסיסי. עם עליית שטח החסימה, מודלי הבסיס המבוססים על כללים מונעי פיקסלים מראים ירידה ביחס החיתוך-איחוד (IU) בתת-הקבוצה המוסתרת מאוד. קו הבסיס של סגמנטציה מבוססת מסכה על קשב וקו הבסיס של איגוד תכונות חוצה-מודאלי סובלים מאובדן דיוק משמעותי בתת-קבוצה זו. ארכיטקטורת חילוץ תכונות פרוגרסיבית רב-שלבית של קו הבסיס של מיזוג תכונות פרוגרסיבי מציגה ירידה חמורה בביצועים. הפתרון המוצע מסתמך על תכונות שלד תלת-ממדיות מפורשות כדי לכפות יישור של אותות ויזואליים פגומים, לשמור על צורת מסכה יציבה על תת-הקבוצה החסימה מאוד ולהדגים יציבות טופולוגית של פלט המסכה הסמנטית. בתת-הקבוצות המאתגרות של תאורה וטקסטורה, גלאי מקטעי הקו מפספס קצוות מבניים באזורים עם השתקפויות חזקות וזכוכית שקופה, מה שמוביל להפרעות מקומיות ב-SDF. הקואורדינטות הגאומטריות השגויות עוברות דרך מטריצת הזיקה המבנית ואובדן העקביות המבנית, ובכך מיישמות עונשים חריגים על התכונות הסמנטיות וגורמות לסטיות מתאימות בתחזיות הגבול. מנגנון ההיגיון הגלובלי של ההקשר המרחבי של GCN משלים קדימונים גאומטריים חסרים עם זיקות מבניות סמוכות, שומר על דיוק הניתוח הכולל בטווח דעיכה מקובל וחושף את הגבול של יכולות התפיסה החזותית של האלגוריתם תחת הפרעות פיזיקליות מורכבות. בתת-הקבוצה הלא-אנומליה של מנהטן, הפריור SDF בשכבה התחתונה של מודל זה יוצר הטיית מיפוי קלה, מה שמוביל לביצועים מעט נמוכים יותר מקו הבסיס של מיזוג תכונות פרוגרסיביות. מקדם המשקל המבני האדפטיבי במודול הקשב הצולב מעריך באופן דינמי את העקביות של גרדיאנטים של המבנה הפיזיקלי הבסיסי. בסצנות עם קירות מעוגלים או תקרות משופעות, מקדם זה מפחית אוטומטית את משקל האילוץ של ה-SDF, ומעודד את הרשת להסתמך על מנגנון הצומת המקומי של גרף הסופרפיקסל כדי לשמור על קוהרנטיות סמנטית באזורים הומוגניים, ובכך ליצור מנגנון פיצוי גיאומטרי יעיל לפריסות מרחביות שאינן במנהטן.

כדי להדגים ויזואלית את ההשפעה השלילית של חומרת החסימה על דיוק הרזולוציה, שרטטנו גרפי קווים המראים את הירידה בדיוק במודלים שונים של אלגוריתמים.

איור 9 חושף ויזואלית את ההבדלים בעמידות בין פרדיגמות שונות לחילוץ תכונות בסביבות פיזיות קיצוניות. שלושת הקווים המקווקווים המייצגים את מודלי הבסיס מציגים מגמת ירידה משמעותית בצמתים חסומים מאוד, המשקפים את המגבלות של שדות קליטה קונבנציונליים בהפקת תכונות תחת אובדן אות בקנה מידה גדול. הקו המוצק המייצג את השיטה המוצעת שומר על מסלול דעיכה מתון יחסית. נתונים ניסיוניים מראים כי הקישור בין קודמים אדריכליים תלת-ממדיים מפורשים לבין מנגנוני הסקה מבוססי גרף מספק תמיכה מבנית למשימות ניתוח סצנות עמידות להסתרה ומשפר את ביצועי הכללת המודל בסביבות מורכבות.

ניתוח רגישות מרחבית של חלוקת צמתים בגרפי טופולוגיה

פרמטר קצב הדגימה של הפחתת הממד של מודול הקונבולוציה של גרף במרחב קואורדינטות שולט ישירות באיכות שדה הקליטה ובעומס החישובי של רשת הגרפים. בהתאם למסגרת התיאורטית של מאמר זה, מחקר זה בוחן כיצד מספר הצמתים הגרפים הדיסקרטיים הנוצרים על ידי אשכולות איטרטיביים ליניאריים פשוטים משפיע על ביצועי הסקה טופולוגית לא-אוקלידית, במטרה לספק תמיכה קפדנית לבחירת היפרפרמטרים. נערכו ניסויים לכוונון פרמטרי בקרת האתחול של אלגוריתם האשכול, תוך התערבות בכוח בהפחתת הממד הדינמי של מרחב התכונות, וקבעו את מספר מחיצות הצמתים בגרף סופרפיקסל ל-64, 128, 256, 512 ו-1024. במסגרת מדד בדיקה מיושר בקפדנות, יחס החיתוך מעל האיחוד הממוצע (IoU), ציון F1 בגבול מבני, וזמן הסקה ממוצע לכל תמונה ברזולוציה גבוהה נרשמו בו-זמנית בגדלים טופולוגיים שונים.

טבלה 8 מפרטת את הקשר בין דרגת הפחתת הממד הדינמי במרחב התכונות לבין דיוק אנליטי ועלות חישובית. הגדרת מספר הצמתים נמוך מדי מובילה לתת-סגמנטציה של תכונות התמונה, מה שגורם לתכונות הסמנטיות של אובייקטים קטנים להתמזג עם תכונות קיר בקנה מידה גדול, ובכך מפחית מדדי דיוק שונים. ככל שסולם חלוקת הצמתים גדל, הרגישות של המודל לפרטים מרחביים מקומיים משתפרת משמעותית. הגדלת מספר הצמתים ל-512 ו-1024 גורמת לפיצול אזורים הומוגניים, מחלישה את אפקט ההחלקה על תכונות מקרוסקופיות ברשתות עצביות גרפיות, מגדילה את הממדיות של מטריצת יחסי הצמתים, ומאריכה את זמן ההסקה. תצורת פרמטרים עם מספר קבוע של צמתים של 256 מובילה לערכים הגבוהים ביותר של יחס החיתוך-איחוד וציון הגבול.

כדי לייצג ויזואלית את הפשרה בין דיוק לכוח חישוב בהסקה טופולוגית לא-אוקלידית, צויר גרף סטטיסטי דו-צירי המראה רגישות לגודל הצמת.

איור 10 ממחיש את ההיגיון הבסיסי שבו מספר הצמתים הגרפיים הדיסקרטיים משפיע על התפתחות מאפייני הרשת. פס הרקע המייצג את זמן החישוב מציג עלייה חדה לאחר שמספר הצמתים עולה על סף 256. הקו הכפול המייצג דיוק מגיע לשיא ב-256 על הציר האופקי, ואז יורד באופן סביר בשל השפעות השבר. הנתונים הכמותיים האובייקטיביים ומגמת ההתפתחות הוויזואלית עקביים מאוד, ומראים כי שמירה על גודל גרף החישוב ב-256 צמתים מאזנת בין עיבוד חומרה להסקה לוגית תחת תצורת הפרמטרים הקבועים הנוכחית. הירידה החמורה בביצועים הנגרמת מסטייה ממספר הצמתים הזו חושפת את הרגישות הגבוהה של אסטרטגיית סגמנט הסופרפיקסל הקבוע לכיוון היפרפרמטרים ומדגישה את הצורך לפתח מנגנון דינמי לבחירת צמתים.

זמינות נתונים:

נתוני הבנצ'מרק הגולמיים שנותחו במחקר זה זמינים לציבור במאגרים הרשמיים המפורטים בטבלת החומרים. המדד התלת-ממדי הפנימי בקנה מידה גדול הוגשה כגרסה הרשמית של ScanNet v2, עם מזהה שחרור מערך הנתונים ScanNet v2. מדד RGB-D לסצנה פנימית נגיש דרך שחרור NYU Depth Dataset V2, עם מזהה שחרור NYU Depth Dataset V2. הפרסום התיאורי DOI עבור מדד התלת-ממד הפנימי בקנה מידה גדול הוא 10.1109/CVPR.2017.261, והפרסום התיאורי DOI עבור מדד הסצנה הפנימית RGB-D הוא 10.1007/978-3-642-33715-4_54. לא נוצרו תמונות גולמיות חדשות או מערכי נתונים RGB-D חדשים במחקר זה. קבצי הפיצול המעובדים, קבצי תצורת האימון, יומני הערכה גולמיים, קבצי מקור מספריים התומכים בטבלה 2, טבלה 3, טבלה 4, טבלה 5, טבלה 6, טבלה 7 וטבלה 8, ואיור 5, איור 6, איור 7, איור 8, איור 9 ואיור 10, משקלי מודלים מאומנים וקוד מקור הופקדו ב-figshare תחת DOI: 10.6084/m9.figshare.32906765. רשומת figshare מספקת את כל נתוני התוצאה הגולמיים הנדרשים לשחזור הטבלאות והאיורים הכמותיים המדווחים בכתב יד זה. המאגר מכיל את מסכות החיזוי, קבצי הערכת גבולות, סקריפטים של חישוב מטרים, נקודות ביקורת של מודלים, וקבצי מקור טבלאות המשמשים לניתוחי mIoU המדווחים, Boundary F1, PixelAcc, MeanAcc, מורכבות חישובית, עמידות, אימות אובדן-פונקציה, ורגישות לחלוקת צמתים.

figure-results-1
איור 1: השוואה בין אי-רציפות סמנטית להשפעות תיקון מבני מוקדם בתרחישי הסתרה פנימיים מורכבים. (A) תמונת RGB מקורית עם הסתרת רהיטים בקנה מידה גדול. (ב) פלט של מודל הבסיס המסורתי המדגיש עיוות גבולות פיזיקליים ופגמים בחוסר רציפות סמנטי. (ג) פלט השיטה המוצעת עם שכבת פרספקטיבה בקווים מקווקו ציאן שממפה במפורש את שלד המבנה התלת-ממדי לתיקון טופולוגי של תכונות פגועות של המבנה הבסיסי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-2
איור 2: מסגרת ניתוח סמנטית כוללת מונחית על ידי בניית קודמים מבניים. הדיאגרמה מתארת את הצינור המלא החל מהקלט של תמונת RGB, דרך ענף חילוץ תכונות ויזואליות עם חלון מוזז וענף חילוץ המבנה לפני המבנה, אל מודול תשומת לב צולבת מונחה-מבנה, אחריו הסקת טופולוגיה דרך GCN סופרפיקסל, ולבסוף פענוח למפת סמנטית צפופה. פריסות מפורטות של חישוב מטריצת הזיקה תשומת לב, העברת הודעות גרף, ופונקציות אובדן אופטימיזציה משותפות מוצגות מימין. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-3
איור 3: תרשים זרימה של מטריצת זיקה ובניית קישוריות טופולוגית. התרשים מפרט את צינור המיפוי המתמטי שלב אחר שלב, ומציג את הטרנספורמציה ממפת שדה מרחק הקלט וזוגות פיקסלים נבחרים, דרך חילוץ תכונות פוטנציאל גיאומטרי רציף והערכת עקביות גרדיאנט, ועד למטריצת הזיקה המנורמלת המשמשת כהטיה מרחבית מפורשת למנגנון תשומת לב צולב. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-4
איור 4: דיאגרמה סכמטית של הקרנת צמתים קונבולוציה בגרף סופרפיקסל ואגרגציית תכונות. הפאנל מפרט את תהליך ההסקה הטופולוגית הלא-אוקלידי: (א) תכונות פיקסל צפופות המציגות את מטריצת התכונות המקומית המקורית וגבולות אשכולות סופר-פיקסלים; (B) בניית טופולוגיית גרף סופרפיקסל הממפה את הרשת הסדירה לצמתים בדידים וקשתות מחוברות פיזיקלית; (C) העברת הודעות קונבולוציונית בגרף ומבצעת אגרגציה כיוונית של תכונות מקומיות; ו-(D) הקרנת קואורדינטות אחורית המציגה את תכונות העקביות הסמנטית המאקרוסקופית המשוחזרות על הרשת הצפופה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-5
איור 5: דיאגרמת רשת השוואה איכותית. המטריצה מספקת הערכת ביצועים ויזואלית בין סצנות פנימיות שונות לפי שורות, תוך השוואה בין קלטי RGB פנימיים ופריסות אמת קרקעית לבין פלטי קו הבסיס של סגמנטציה מבוססת מסכה-קשב, קו הבסיס של איגוד תכונות חוצה-מודלי, קו הבסיס של מיזוג תכונות פרוגרסיבי, והשיטה המוצעת, שמצליחה לשחזר פינות חסומות ומיישרת משטחים נושאי עומס. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-6
איור 6: תוצאות אבלציה לאינטגרציה מצטברת של מודולים. תרשים הדו-צירי מדגים את התפתחות הביצועים שלב אחר שלב בין הגדרות אבלציה מודולריות שונות, ומציג את המסלול החיובי כלפי מעלה של החיתוך הממוצע מעל האיחוד (mIoU) כברים ואת ציון הגבול המבני F1 כגרף קו מהבסיס אל המסגרת המלאה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-7
איור 7: מורכבות חישובית, זמן אימון והתפלגות יעילות הסקה. תרשים הבועות הרב-ממדי חושף את הפשרות בין תקורה חישובית לבין דיוק הניתוח. הציר האופקי מודד פעולות נקודה צפה (FLOPs), הציר האנכי מציין mIoU, גודל הבועה מייצג את קנה המידה של הפרמטרים הניתנים להדרכה, ותוויות הטקסט הסמוכות מדווחות על השהיה ההסקה במסגרת אחת לכל ארכיטקטורת רשת. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-8
איור 8: היסטוגרמה של דיוק גבול וניקוד מטרי תחת תצורות פונקציות אובדן שונות. תרשים העמודות המקובץ משווה את ההשפעות המניעות של אסטרטגיות אופטימיזציה שונות על הלוגיקה המרחבית הבסיסית, וממחיש את הרווחים המשמעותיים בציון mIoU ובציון F1 בגבולות מבניים שהושגו על ידי שדרוג מניסוחי חוצה אנטרופיה סטנדרטיים לאובדן העקביות המבנית המוצע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-9
איור 9: גרף קווי המראה את הקשר בין חומרת ההסתרה לירידה בביצועים. העקומה עוקבת אחרי הירידה בדיוק בין פרדיגמות שונות לחילוץ תכונות ברמות חסימה קלות, בינוניות וחמורות, ומדגישה את היציבות הטופולוגית החזקה ויכולת האנטי-הפרעות של המסגרת המונחית המבנה המוצעת לעומת קווי בסיס מונעי פיקסלים בלבד. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

figure-results-10
איור 10: ניתוח רגישות של קנה מידה של צומת סופרפיקסל. הגרף הסטטיסטי הביאקסיאלי ממחיש את הפשרה בין מהירות עיבוד חומרה לבין דיוק ההסקה הלוגית בין גדלי חלוקת גרפים שונים, ומראה כיצד מספר צמתי הסופרפיקסל משפיע על מדדי הדיוק ומוביל לעלייה חדה בזמן ההסקה הממוצע. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

מיספור שכבת הרשתממד תכונת הצומת הקלטממד תכונת צומת הפלטהגדרת הסתברות של השבתה אקראית
15122560.15
22562560.15
32561280.1
4128640.05

טבלה 1: טבלת תצורת היפרפרמטרים של ארכיטקטורת רשת למודול הסקה קונבולוציונית. הטבלה מדווחת על מספרי שכבת הרשת, ממדי תכונות הקלט-צומת, ממדי תכונות פלט-צומת, והגדרות הסתברות השבתה אקראית המשמשות ברשת ההסקה הגרפית.

פריט קונפיגורציהמדד תלת-ממדי פנימי בקנה מידה גדולמדד סצנה פנימית RGB-D
מזהה שחרור רשמיScanNet v2מערך נתוני עומק של NYU V2
דגימות אימון ששימשו במחקר זה1201 סצנות795 תמונות
דגימות אימות או בדיקה המשמשות להערכה312 סצנות אימות654 תמונות בדיקה
קטגוריות סמנטיות כוללות2040
רזולוציית תמונה בקלט512 × 512512 × 512
קצב הלמידה ההתחלתי0.00010.0001
ספירת דגימות קלט אצווה88
מקדם דעיכת משקל0.010.01
תקופות האימון הכוללות300300
מספר ריצות עצמאיות55

טבלה 2: תצורת היפרמטר של מאגר נתונים ניסיוני ומאוחד של מאגר נתונים. הטבלה מדווחת על הגדרות חלוקה למערכי נתונים תלת-ממדיים פנימיים רחבי היקף ו-RGB-D במערכי נתוני סצנות פנימיות, ספירות קטגוריות סמנטיות, הגדרות קצב למידה, ספירת דגימה של קלט אצווה, קצב דעיכת משקל, וספירת איטרציות האימון הכוללת.

ארכיטקטורת מודל רשתmIoUגבול F1PixelAccMeanAcc
SegFormer0.596 ± 0.0030.635 ± 0.0040.838 ± 0.0030.704 ± 0.004
ConvNeXt UperNet0.604 ± 0.0030.642 ± 0.0040.846 ± 0.0030.713 ± 0.004
Mask2Former0.612 ± 0.0030.654 ± 0.0040.853 ± 0.0030.721 ± 0.004
וואן-פורמר0.621 ± 0.0020.663 ± 0.0030.861 ± 0.0030.733 ± 0.003
MaskDINO0.628 ± 0.0020.667 ± 0.0030.869 ± 0.0030.741 ± 0.003
CCANet0.635 ± 0.0030.671 ± 0.0040.876 ± 0.0030.745 ± 0.004
InternImage UperNet0.641 ± 0.0020.692 ± 0.0030.884 ± 0.0020.756 ± 0.003
CMPFFNet0.658 ± 0.0020.712 ± 0.0030.891 ± 0.0020.773 ± 0.003
SGCA_GCN0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

טבלה 3: השוואה כמותית כוללת של קווי בסיס לניתוח סצנות פנימיות על ערכת אימות סצנות RGB-D. הטבלה מדווחת על mIoU, ציון Boundary F1, דיוק פיקסלים גלובלי, ודיוק ממוצע של מחלקות עבור קו הבסיס של סגמנטציה מבוססת מסכה-קשב, בסיס אגרגציה של תכונות חוצה-מודאלית, קו בסיס מיזוג תכונות פרוגרסיבי, וארכיטקטורת רשת מונחית מבנה מוצעת.

תצורת ארכיטקטורת הרשתmIoUגבול F1PixelAccMeanAcc
עמוד שדרה עם חלון מוסט בסיסי0.615 ± 0.0030.630 ± 0.0040.842±0.0030.706 ± 0.004
עמוד שדרה בתוספת קשב משולב מונחה מבנה0.648 ± 0.0030.685 ± 0.0040.874 ± 0.0030.748 ± 0.004
הסקת גרף גב פלוס סופרפיקסל0.641 ± 0.0030.676 ± 0.0040.868 ± 0.0030.741 ± 0.004
עמוד שדרה ואובדן עקביות מבני0.632 ± 0.0030.662 ± 0.0040.859 ± 0.0030.732 ± 0.004
עמוד שדרה בתוספת קשב חוצה והסקת גרפים0.669 ± 0.0020.721 ± 0.0030.897 ± 0.0020.782 ± 0.003
עמוד שדרה בתוספת קשב חוצה ואובדן עקביות מבנית0.660 ± 0.0020.713 ± 0.0030.889 ± 0.0020.773 ± 0.003
עמוד שדרה בתוספת הסקת גרף ואובדן עקביות מבני0.653 ± 0.0030.704 ± 0.0030.881 ± 0.0030.765 ± 0.003
מודל מלא ללא הטיית חיבור שדה מרחק חתום0.656 ± 0.0030.698 ± 0.0040.884 ± 0.0030.761 ± 0.004
מודל מלא ללא משקלול מבני אדפטיבי λ0.671 ± 0.0020.736 ± 0.0030.904 ± 0.0020.792 ± 0.003
מודל מלא ללא אילוץ קשת קו-מישורי0.666 ± 0.0020.728 ± 0.0030.899 ± 0.0020.786 ± 0.003
מודל מלא ללא נרמול גרף סימטרי0.673 ± 0.0020.737 ± 0.0030.906 ± 0.0020.795 ± 0.003
SGCA_GCN מלא0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

טבלה 4: ניתוח אבלציה כמותי מורחב של רכיבים מרכזיים. הטבלה מדווחת על אינטגרציה מצטברת של מודולים, שילובי מודולים זוגיים והגדרות הסרת רכיבים כדי לכמת את התרומות העצמאיות והשיתופיות של תשומת לב צולבת מונחית מבנה, הטיית שדה מרחק מסומן, משקל מבני אדפטיבי, הסקת גרף סופרפיקסל, בניית קצוות קופלנרית, נרמול גרף סימטרי ואובדן עקביות מבני.

ארכיטקטורת מודל רשתפרמטריםFLOPsזיכרון שיאזמן האימוןזמן הסקהFPSmIoUגבול F1
SegFormer83.7 מ'80.1 G6.1 GB10.6 שעות44 מילישניות22.70.5960.635
ConvNeXt UperNet60.2 מ'91.5 G6.4 GB11.2 שעות47 מילישניות21.30.6040.642
Mask2Former44.0 מ'74.6 G5.8GB9.4 שעות41 מילישניות24.40.6120.654
וואן-פורמר64.1 מ'103.2 G7.0 GB12.9 שעות55 מילישניות18.20.6210.663
MaskDINO52.8 מ'96.8 G6.8 GB12.1 שעות52 מילישניות19.20.6280.667
CCANet63.5 מ'118.7 G7.6 GB14.8 שעות67 מילישניות14.90.6350.671
InternImage UperNet70.4 מ'112.3 G7.4GB14.2 שעות64 מילישניות15.60.6410.692
CMPFFNet58.9 מ'104.6 G7.1 ג'יגה-בייט13.1 שעות59 מילישניות16.90.6580.712
SGCA_GCN66.8 מ'121.4 G7.9 GB15.6 שעות61 מילישניות16.40.6870.764

טבלה 5: השוואת מורכבות חישובית, זמן אימון ויעילות הסקה עם דיוק כולל של קבוצת אימות. הטבלה מדווחת על פרמטרים ניתנים לאימון, פעולות נקודה צפה, שימוש בזיכרון שיא, זמן אימון ל-300 אפוקים, השהיית הסקה במסגרת אחת, פריימים לשנייה, mIoU, וציון Boundary F1 עבור השיטה המוצעת ורשתות השוואה.

תצורת פונקציית אובדןmIoUגבול F1
אנטרופיה חוצה (CE) בלבד0.6690.721
CE + גבול לפני הספירה0.6740.738
אובדן CE + InverseForm0.6810.752
CE + Ours SCL0.6870.764

טבלה 6: השוואה כמותית של אימות פונקציית אובדן. הטבלה מדווחת על ציון mIoU ו-Boundary F1 תחת אובדן אנטרופיה צולבת, אובדן אנטרופיה חוצה בינארי של גבול, אובדן טרנספורמציה הפוכה, ואובדן העקביות המבנית המוצע.

ארכיטקטורת מודל אלגוריתמיחסימה קלההסתרה בינוניתחסימה חמורהסט האנומליות של לא-מנהטןתת-קבוצה של הפרעות טקסטורה
(mIoU)(mIoU)(mIoU)(mIoU)(mIoU)
Mask2Former0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

טבלה 7: ניתוח עמידות ספציפית לתת-קבוצה של התפלגות חסימה קיצונית ומבנים שאינם מנהטן. הטבלה מדווחת על שינויים בדיוק הניתוח בין תת-קבוצות של חסימה קלה, חסימה בינונית, חסימה חמורה, תאורה מאתגרת, הפרעות טקסטורה ולא-אנומליה של מנהטן.

מספר הצמתים של סופר-סקאלהmIoUגבול F1זמן הסקה ממוצע (ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

טבלה 8: ניתוח רגישות מרחבית של סקאלה חלוקת צמתים בגרף טופולוגיה. הטבלה מדווחת על mIoU, ציון F1 של הגבול המבני, וזמן ההסקה הממוצע בין הגדרות שונות של צמתים סופרפיקסלים.

דיון

האלגוריתם של מאמר זה מחבר באופן הדוק את התכונות ההיררכיות הוויזואליות שנלכדות על ידי מקודד טרנספורמטור היררכי עם חלון מוזז לעומק הקודם של תיבת הגבול התלת-ממדית של מנהטן שנוצרה על ידי זיהוי מקטעי קווים, ובכך משיג שחזור סמנטי מדויק של סצנות פנימיות מורכבות. מנגנון קשב צולב מונחה על ידי מבנה מאלץ את האות הוויזואלי ליישר את הגבול הגיאומטרי האמיתי שמכויל על ידי SDF, ובכך משיב את הרציפות של תכונות ברמה נמוכה באזורים42 המוסתרים מקומית. גרף טופולוגיה נבנה באמצעות צמתים סופרפיקסליים הנוצרים על ידי אלגוריתם אשכולות מקומי איטרטיבי, שמניע GCN לבצע אגרגציה של תכונות תחת מגבלות קו-פלנריות פיזיקליות, ומבטיח את עקביות ההתפלגות הסמנטית המאקרוסקופית43. תוצאות ניסיוניות מראות שהשיטה משיגה יחס חיתוך ממוצע על יחס איחוד של 68.7% עם סטיית תקן של 0.2%, ערך הנדסי מעשי, ציון F1 בגבול מבני של 76.4% עם סטיית תקן של 0.3%, וזמן הסקה ממוצע של 61 מילישניות עם תצורה של 256 צמתים סופרפיקסלים, המשקף פשרה מכוונת של מתן עדיפות לדיוק שחזור הגבול על פני יעילות ההסקה הסופית44. בדיקות עמידות מראות עוד כי המודל מפגין יכולות תיקון טופולוגיות חזקות בתנאים קיצוניים של אובדן אות חזותי בקנה מידה גדול. על ידי הכנסת אובדן עקביות מבנית, משתפר דיוק יישור המסכה החזויה עם הגבול הפיזי במרחק אפס שמכויל על ידי ה-SDF, ומושגת אופטימיזציה סינרגטית של מורכבות חישובית ואיכות ניתוח45. שיטה זו מספקת גישת מיזוג תכונות המבוססת על חוקי המרחב התלת-ממדי ומדגימה עקביות לוגית בתיקון טופולוגיה כאשר מדובר בחסימת רהיטים בקנה מידה גדול ועיוות גבול פיזי46. תוצאות המחקר מספקות מסגרת אילוצים פיזיקלית-גאומטרית חזקה לחשיבה מרחבית חכמה ולשחזור תלת-ממדי מדויק מאוד, ויש להן ערך הנדסי מעשי לניווט חזותי של רובוטים ולמשימות זיהוי סצנות בסביבות פיזיות אמיתיות.

מנגנון הגזירה של טופולוגיה גאומטרית, התלוי מאוד בהיפותזת עולם מנהטן, סובל מהטיית התאמה כאשר עוסקים בחללים אדריכליים לא סדירים עם קירות מעוקלים או גבולות לא אורתוגונליים47. כדי להתגבר על צוואר הבקבוק של המידול הגאומטרי הזה, איטרציות רשת הבאות ישלבו אלגוריתמים של התאמת משטח פולינומים רב-דרגות ומודולים רציונליים לא אחידים של עקומת B-spline לתוך הענף הפיזיקלי-פריור. אסטרטגיית המידול המרחבי האוניברסלית הזו מתרגמת קווים אורתוגונליים קשיחים לגבולות טופולוגיים ניתנים לעיוות דינמי, ובכך משפרת באופן מתמיד את דיוק הניתנים לניתוח האלגוריתם בפריסות מרחביות פנימיות חריגות.

החילוץ הגאומטרי הקודם נשען על גלאי מקטעי קו בסיסי, מה שמשאיר את המערכת פגיעה לעיוות מבני של המסכה בעת עיבוד סצנות פנימיות הנשלטות על ידי חומרים מחזירי אור או שקופים48. אובדן העקביות המבנית מפעיל ישירות את ה-SDF שנוצר על ידי הגלאי הזה, ויוצר לולאת תלות סגורה בין חילוץ קודם לאופטימיזציה של גרדיאנט. כאשר הפרעות ויזואליות גורמות לזיהוי אנומליים של מקטעי הקו, הקואורדינטות הגאומטריות הפגומות ממופות ל-SDF ומוגברות ישירות על ידי אובדן העקביות המבנית במהלך ההפצה האחורית, ובכך מאלצים את פרמטרי הרשת להתאים לגבולות פיזיים שגויים49. איטרציות אלגוריתמיות מאוחרות יותר יכניסו ענפי היתוך אדפטיביים רב-מודליים לקליטת מפות עומק עמוקות ונתוני רדיומטריה אינפרא-אדומים, ובכך יפרקו תפיסה מבנית גאומטרית ממגבלות תאורה באור נראה וירחבו את גבול ההיגיון המרחבי בסביבות אופטיות קיצוניות.

כדי לפתור את צוואר הבקבוק ברגישות הביצועים שנגרם על ידי קנה המידה הקבוע של צומת סופרפיקסל, מחקר נוסף יעצב מודול איגום גרפים אדפטיבי שניתן ללמידה ויקבע באופן דינמי את סכמת חלוקת הצמתים בהתבסס על מורכבות התמונה, ובכך יבטל את התלות של הרשת בכיולון ידני של היפרפרמטרים. כדי להתמודד עם מגבלות פריסת החומרה הנגרמות על ידי העומס החישובי של רשת גרף הסופרפיקסלים, תוכניות אופטימיזציה עתידיות יכללו מנגנוני ניתוק תכונות קלים ומודולים לאגרגציה עם שערים, כדי לדחוס את קנה המידה של הפרמטרים ולהאיץ את פעולות המטריצות של ענף50 הגאומטרי הקדם.

גילויים

המחברים מצהירים שאין להם ניגודי עניינים פיננסיים.

תודות

מימון: תוכנית מחקר ופיתוח מרכזית של שאאנשי (תוכנית מס' 2024CY2-GJHX-76).

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

מקורות

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

מאמרים קשורים