הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר מחקר

שיטת ניתוח סמנטי לתמונות סצנה פנימית המבוססת על ידע מוקדם במבנה הבניין

54 צפיות

⸱

DOI:

10.3791/72054

⸱

11 באוגוסט 2026

במאמר זה

סיכום

מחקר זה מציע אלגוריתם שמקשר באופן הדוק בין התכונות ההיררכיות הוויזואליות שנלכדו על ידי מקודד טרנספורמטור היררכי עם חלון מוזז לעומק הקודם של תיבת הגבול התלת-ממדית של מנהטן שנוצרה על ידי זיהוי מקטעי קו, ובכך משיג שחזור סמנטי מדויק של סצנות פנימיות מורכבות.

תקציר

כדי להתמודד עם אי-רציפויות חיזוי סמנטי ועיוותי גבולות פיזיים הנגרמים מחסימת רהיטים בסצנות פנימיות מורכבות, מאמר זה מציע שיטת ניתוח סמנטי המנצלת יסודות מבנה-מבנה. התכנית משתמשת במקודד טרנספורמטור היררכי עם חלון מוזז כדי לחלץ תכונות ויזואליות רב-קנה מידה ומשלבת אלגוריתם זיהוי מקטעי קו בכיוון הגרדיאנט לבניית תיבת גבול תלת-ממדית של מנהטן. תיבת הגבול הזו מומרת לשדה מרחק חתום (SDF) לפני קידוד קווי המתאר הגאומטריים הבדידים לשדה פוטנציאל פיזי רציף. מנגנון קשב צולב מונחה על ידי מבנה מאלץ את האותות הוויזואליים להתיישר עם גבולות גאומטריים תלת-ממדיים אורתוגונליים אמיתיים, ומשיב את המשכיות התכונות באזורים מוסתרים. גרף שכנות מרחבית שנבנה מצמתים סופרפיקסלים מניע רשת קונבולוציונית גרפית (GCN) לאגד תכונות, תוך הבטחת עקביות סמנטית מקרוסקופית במישור הנשיאה הפיזי. שילוב של אובדן אנטרופיה צולבת ברמת הפיקסל ואובדן עקביות מבני מותאם אישית מחזק את המגבלות ומעניש תחזיות מחוץ לתחום. ניסויים במספר ריצות עצמאיות מראים כי החיתוך הממוצע מעל איחוד (mIoU) מגיע ל-68.7% עם סטיית תקן של 0.2%, וציון הגבול המבני F1 מגיע ל-76.4% עם סטיית תקן של 0.3%, מה שמאשר את הביצועים העמידים של המודולים המוצעים. עם גודל צומת תמונה יחיד של 256, זמן ההסקה הממוצע נשאר 61 מילישניות.

מבוא

ניתוח סמנטי לתמונת סצנה פנימית תופס מקום מרכזי במשימות קוגניציה מרחבית תלת-ממדית וחשיבה מרחבית אינטליגנטית 1,2. חילוץ תכונות ויזואליות בסביבות פיזיות אמיתיות לעיתים קרובות מופרע קשות על ידי פריסות מרחביות מורכבות3. פתרון ההפרדה הסמנטית ועיוות הגבול הפיזי של מבנה יסוד הבניין הנגרם מהסתרת רהיטים בקנה מידה גדול חשוב למחקר קוגניציה מרחבית 4,5. הסרה מדויקת של הפרעות מחפצים עמוסים והשבת הרצף הפיזי של אותם קיר ורצפה תקבעו ישירות את דיוק שחזור הסצנה התלת-ממדי וניתוח לוגי מרחבי גלובלי6. הפסקת הרציפות הסמנטית הנגרמת על ידי חסימת רהיטים בקנה מידה גדול והשפעת התיקון המבני של הנחיות הבנייה המוצעות מוצעות מוצגות באיור 1, כאשר הקלט האדום-ירוק-כחול (RGB) המוסתר בטבלה 1A, עיוות המסכה הבסיסי באיור 1B, ותוצאת תיקון המבנה הקודם באיור 1C משווים תחת אותו מצב סצנה פנימית.

כדי לעמוד בדרישות הדיוק של חשיבה לוגית מרחבית, רשתות חזותיות מונעות פיקסלים מרכזיות כיום מתמודדות עם מכשולים מרובים בהתמודדות עם סביבות פנימיות מורכבות 7,8. חללים פנימיים מלאים לעיתים קרובות ברהיטים צפופים וריהוט עמוס, מה שמוביל לאובדן משמעותי של אותות גבול ויזואליים נמוכים בתמונות9. מנגנוני חילוץ תכונות קונבנציונליים מסתמכים יתר על תגובות צבע ומרקם דו-ממדיות מקומיות, ללא הבנה מקרוסקופית של חוקי האורתוגונל הנוקשיםשל מבנים תלת-ממדיים מלאכותיים. מגבלה זו של שדה קליטה מקומי הופכת את הפצת התכונות למופרעת בקלות, מה שמקשה על הרחבת הטופולוגיה הגלובלית על פני חסימות11. כיום, יש צורך דחוף לפתור את הבעיה המרכזית של אי-רציפויות חיזוי סמנטי ועיוותים חמורים בגבולות פיזיקליים הנגרמים על ידי חסימה והפרעה12.

כדי להתמודד עם תקלות מבניות ביסודות הבניין הנגרמים מחסימה והפרעה, הקהילה האקדמית פיתחה מגוון אמצעי התערבות ממוקדים13. רשתות אגרגציה של תכונות חוצות-מודאליות מפצות ביעילות על החסרונות הטבועים במודאליות חזותית אחת בתפיסה מרחבית על ידי הכנסת מפות עומק או הקדימות טקסט המסייעות בתמונות אדום-ירוק-כחול (RGB)14,15. תפיסת גבולות ומסגרות בחירת הקשר אדפטיביות מזריקות אסטרטגיות לשיפור קווי המתאר הפיזיים לשלב פענוח התכונות, מה שמשפר משמעותית את התאמת הקצה של תוצאות החיזוי בסצנות מורכבות16,17. מודלים של הסקה המבוססים על GCNs ומנגנוני אינטראקציה בין תכונות משפרים משמעותית את חלקות התכונות ואת העקביות המקרו-סמנטית באזורים הומוגניים על ידי בניית חיבורים ברמת הצמתים18,19. שילוב קדימים מבניים מפורשים של מנהטן בצינור חילוץ התכונות הוויזואלי אוכף גבולות עקביות גאומטריים, המתמודדים עם אתגרי אי-רציפות תכונה הנגרמים מהסתרת אובייקטים קדמייםנרחבת 20.

כדי להתמודד עם האתגר המרכזי של תקלות חיזוי סמנטי ועיוותים חמורים של גבולות פיזיים הקשורים לתשתיות הבניין, מוצעת מסגרת ניתוח סמנטי המבוססת על מנגנון קישור בלולאה סגורה הכולל פריימים אדריכליים. מסגרת זו חורגת מצינורות הנדסיים נאיביים על ידי יצירת יישור מיפוי דו-כיווני בין שדות פוטנציאל גאומטריים רציפים למניפות תכונות ויזואליות נפרדות, ויוצרת סינרגיה לא טריוויאלית שמתקנת שגיאות הסתרה באמצעות חוקי מבנה. תכנית זו מתבססת על רשת עמוד שדרה חזותית רב-קנה מידה ואלגוריתם זיהוי מקטעי קו המבוסס על הערכת נקודת ההיעלמות, כדי להשיג תכונות מראה מקומיות וקדימויות קצה אורתוגונליות המייצגות את תיבת הגבול התלת-ממדית של מנהטן במקביל, ואז להפוך אותן ל-SDF. האלגוריתם משתמש במנגנון קשב צולב מונחה מבנה, המשתמש בתכונות ויזואליות כוקטורי שאילתה ומתייחס לתכונות SDF כמפתחות וערכים לחישובי מכפלת נקודה, ובכך מאלץ את האות הוויזואלי ליישר את הגבול הגאומטרי התלת-ממדי האמיתי במרחב התכונות. גרף שכנות מרחבית שנבנה מצמתים סופרפיקסלים ותכונות קצה קופלנריות מרחביות מוזן ל-GCN כדי לבצע אגרגציה של תכונות חוצות צמתים והעברת הודעות. תהליך אופטימיזציית הפרמטרים מקצה לקצה משתמש במשותף באנטרופיה חוצה ברמת הפיקסל ובפונקציית אובדן עקביות מבנית מותאמת אישית, שמגבילה ומענישה בקפדנות פיקסלים חזויים החוצים את גבול הבנייה-הקודם. צינור הניתוח הסמנטי המלא מסוכם באיור 2, המקשר בין קלט תמונת RGB, חילוץ גאומטרי מוקדם, יישור תשומת לב צולב, הסקת גרפי סופרפיקסל ופענוח מסכות סמנטיות בתוך ארכיטקטורה מאוחדת.

רשתות ניתוח סצנות מוקדמות הסתמכו על פעולות קונבולוציה ללכידת מרקמי מראה מקומיים, אך בשל מגבלות בשדות קליטה מקומיים, הן הראו קוהרנטיות סמנטית לא מספקת של מטרות בקנה מידה גדול21,22. מחקרים קודמים יישמו את מודול תשומת הלב העצמית של ארכיטקטורת הטרנספורמר הוויזואלי כדי להפיק מידע קונטקסטואלי גלובלי ולבנות תכונות אסוציאציה פיקסליות למרחקים ארוכים23,24. אסטרטגיות צבירת תכונות רב-תצוגות חוצות מודליות מפיקות את התכונות הגאומטריות התלת-ממדיות של הסצנה על ידי מיזוג ענני נקודת מפת עומק וקלטי פקודות טקסט25,26. מנגנוני קשב היברידיים למיקוד בתכונות בתחומים ספציפיים התבגרו בהדרגה. על ידי בניית גשרים לאינטראקציה בין תכונות, הם הפחיתו משמעותית את אובדן האנרגיה ואת דלילות התכונות בהעברת אותות חזותיים בקנה מידה רב-קנה מידה ושיפרו את עמידות הניתוח במבנים מורכבים. עיצובים מתקדמים של מקודדים משלבים ומסיקים במשותף פרטים מרחביים של תחום בתדר גבוה לצד תכונות גלובליות ומקומיות, ומחזקים את יכולת הרשת להבחין בין קטגוריות סמנטיות מדויקות עם דמיון גבוה ומשפרים את דיוק הניתוח הפנימיב-27,28. ההתקדמות האחרונה בארכיטקטורות סגמנטציה סמנטית מספקת מקורות חשובים לאופטימיזציה של יעילות חישובית ותפיסה מרחבית. מודלים שתוכננו לחיזוי צפוף ואגרגציה קונטקסטואלית רב-קנית מפיקים תכונות גאומטריות עדינות מרקעים מורכבים. אסטרטגיות ניתוק תכונות ומיזוג סינרגטי מתמודדות עם עמימות סמנטית באזורים גבוליים. מנגנוני קשב קלים ומודולי אגרגציה עם שער ממעלמים את התפלגות הפרמטרים, ובכך מאיצים את ההסקה תוך שמירה על פרטים מבניים מקומיים. יישום עיצובים אדריכליים יעילים אלו מספק הנחיות תיאורטיות להפחתת העומס החישובי של פעולות הסקה טופולוגיות לא-אוקלידיות בניתוח סצנות פנימיות.

הקדמת מבנה הבניין והערכת פריסה תלת-ממדית משמשות לתיקון שגיאות ניתוח חזותי מקומיות29. מחקרים קודמים חילצו תכונות גאומטריות אורתוגונליות ומקבילות של מבנים פנימיים כמגבלות הסקה להפחתת הטיית חיזוי רשת הנגרמת על ידי רקעים פנימיים עמוסים30,31. סכמות קיימות משתמשות באלגוריתמים לזיהוי מקטעי קו ובטכניקות ניתוח נקודות אבלציה לתמונה כדי ליצור קופסאות גבול תלת-ממדיות של מנהטן למיפוי הגבולות הפיזיים של חדרים ולסייע בלוקליזציה של תכונות ויזואליות בסיסיות32. הארכיטקטורה המשותפת של מודול מודול מודעות הגבול וההקשר הרב-קנה מידה משלבת באופן משתמע מידע מבני קודם בתהליך פענוח התכונות בממדים גבוהים, ומאלצת את הרשת להפיק מסכות סמנטיות התואמות במדויק את קווי המתאר הפיזיים האמיתיים, ובכך לשפר את המשוננות והטשטוש של קצוות האובייקטים33. עיצובים של פונקציית אובדן חצי-מפוקחת או חלשה עם תכונות שיפור גבולות נחקרו באופן נרחב. בהסתמך על נוסחאות מתמטיות קפדניות כדי להעניש התנהגות סיווג פיקסלים עצמאית שמפרה את כללי הטופולוגיה המרחביים, מובטחים החלקות הגאומטרית ושלמות המבנה של תוצאת הסגמנטציה הסופית ממקור אופטימיזציית הגרדיאנט34.

מחקרים מסוימים השתמשו ברשתות עצביות גרפיות לביצוע אגרגציה חוצת תחומים של תכונות ויזואליות והיגיון על יחסים טופולוגיים במרחב מממד גבוה35. אלגוריתם סגמנטציית הסופרפיקסל מחבר מראש בלוקים סמוכים עם תגובת צבע ותכונות טקסטורה דומות לצמתים מחוברים עצמאיים. אלגוריתם סגמנטציית הסופרפיקסל דוחס את היתירות החישובית של מבנה הגרף ברמת התמונה ושומר על הטופולוגיה הגיאומטרית הבסיסית של התמונה36. ה-GCN שנבנה על וקטור התכונות של הצומת בעל ממד גבוה, ומטריצת הסמיכות המייצגת קרבה מרחבית, מניעים את ההעברה הכיוונית היעילה ואת המיזוג האינטראקטיבי של מידע חזותי רב-קנה מידה לאורך הגרף הפיזי המחובר בתחום המרחבי37,38. היישום של מודול שיפור המידע הזמני ומנגנון חיבור דילוג רב-קנה מידה מדכא את ההחלקה וההומוגניזציה המופרזת של תכונות הצמתים שנוצרות בתהליך העברת הודעות עמוקות רב-שכבתיות39. טכנולוגיית טרנספורמציית גל גרף רב-קנה מידה, ואסטרטגיית אופטימיזציה ללמידת אלמנט פסאודו-תווית, מייעלות את מנגנון רעש הרקע של נוסחת עדכון תכונות הצמת, כך שתכונות עם אותן תכונות סמנטיות שומרות על מצב תגובה שיתופי בטופולוגיית רשתמורכבת 40. מנגנון ההסקה המבוסס על גרף ממפה רשתות פיקסלים רגולריות למרחבים טופולוגיים לא-אוקלידיים כדי לבצע חישובי אגרגציה של תכונות של מבנים לא סדירים ורכיבים פנימיים41.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

מערכי נתונים של סצנות RGB פנימיות וההערות הסמנטיות שלהם הוכנו לפני ההדרכה ברשת. מערך הנתונים התלת-ממדי הפנימי הגדול ומערך הסצנות RGB-D הפנימי (ראו טבלת החומרים) התקבלו מהמאגרים הרשמיים שלהם. סצנות רכישה פנימיות שכללו סגירת רהיטים, שינויים בתאורה, הפרעת גבולות קיר ופריסות מרחביות מורכבות נשמרו כדי להתאים לתרחיש הניתוח המטרה. תוויות סמנטיות הומרו למסכות הערות PNG חד-ערוציות, וכל תמונות ה-RGB והמסכות הסמנטיות שונו לגודל 512 × 512 פיקסלים. במהלך ההדרכה יושמה הרחבת נתונים מקוונת, עם היפוך אופקי אקראי בהסתברות של 0.5, הגדלת בהירות אקראית בין 0.8 ל-1.2, וסיבוב אקראי בין −10° ל-+10° להרחבת התפלגות הפריסה המבנית. ערוצי RGB ננורמו עם ערכים ממוצעים של 0.485, 0.456 ו-0.406 וערכי סטיית תקן של 0.229, 0.224 ו-0.225. המדד התלת-ממדי הפנימי בקנה מידה גדול עקב אחרי חלוקת השחרור הרשמית ששימשה במחקר זה, עם 1201 סצנות אימון ו-312 סצנות אימות לפיתוח ואימות מודלים. מדד RGB-D לסצנות פנימיות עקב אחרי פרוטוקול ההערכה הרשמי, עם 795 תמונות אימון ו-654 תמונות בדיקה. לא הוחל חלוקה נוספת על בסיס אחוזים על שני המדדים הציבוריים הללו.

רשת עמוד השדרה הוויזואלי של טרנספורמטורים היררכיים עם חלון מוזז (ראו טבלת החומרים) הותחילה כעמוד השדרה של מקודד שנאי חלון נע. גודל ההטמעה של התיקון הוגדר כ-4 על 4 פיקסלים. מידות ההטמעה של ארבעת השלבים ההיררכיים הוגדרו ל-128, 256, 512 ו-1024, ומספר בלוקי השנאי בארבעת השלבים נקבע ל-2, 2, 18 ו-2. גודל חלון תשומת הלב המקומי הוגדר ל-7 על 7, ומספר ראשי תשומת הלב הוגדר ל-4, 8, 16 ו-32 בארבעת השלבים ההיררכיים. פונקציות הפעלה רציפה לא ליניאריות שימשו בתוך כל שכבות הפרספטרון הרב-שכבתיות. דגימה מרחבית בוצעה באמצעות פעולות מיזוג תיקונים עם צעד של 2 לאחר כל שלב היררכי. ארכיטקטורת הרשת המרכזית וההיפרפרמטרים של מודול ההסקה הקונבולוציונית סוכמו בטבלה 1.

לאחר מכן בוצעה חילוץ תכונות תשומת לב עצמית בחלון מוזז על מפות התכונות הקלטות. כל מפת תכונות חולקה לחלונות מקומיים לא חופפים עם ממדים מרחביים של 7 × 7. תשומת לב חלון רגילה ותשומת לב חלון מוסטת הוחלפו בין בלוקי שנאי חלונות מוזזים סמוכים. מרחק ההזזה המחזורי הוגדר ל-3 פיקסלים, וקידוד הטיית מיקום יחסית הוחל בכל חלון תשומת לב מקומי. תכונות ויזואליות מקומיות אוגדו באמצעות תשומת לב עצמית מרובת ראשים ליצירת ייצוגים היררכיים ורב-קנה מידה של תכונות.

קודמים מבניים של מנהטן הופקו מתמונות RGB פנימיות. מקטעי קצה מבניים זוהו באמצעות אלגוריתם זיהוי מקטעי קו בהתאם לכיוון הגרדיאנט. כיוונים מבניים דומיננטיים אוחדו באמצעות אלגוריתם קונצנזוס מדגם אקראי (RANSAC) (ראו טבלת החומרים) המבוסס על הערכת נקודת העלמות. שלושה כיוונים אורתוגונליים הדדית של מנהטן שוחזרו ליצירת ייצוג תיבת הגבול התלת-ממדית של מנהטן. הגבול המבני המשוחזר הומר למפת SDF על ידי חישוב המרחק האוקלידי המינימלי מכל פיקסל לקטע קו הגבול הקרוב ביותר.

תכונות קשב צולב מונחות על ידי מבנה נוצרו לאחר שהתכונות הוויזואליות והקדימות SDF הושגו. מניפולד התכונה הוויזואלית ממופה לטנזור השאילתה Q דרך מטריצת הטרנספורמציה הליניארית W תת-Q של כובע כפול R אל מטריצת היצירה W תת-Q של כובע כפול R למטריצת figure-protocol-1היצירה . שדה המרחק הרציף הקודם מופה לטנזור המפתח K ולטנזור הערך V דרך מטריצות figure-protocol-2הטרנספורמציה, וממד המודל הוגדר ל-512. מודולציה מרובת ראשים חילקה את מרחב ההקרנה ל-8 תת-מרחבים עצמאיים, כאשר לכל ראש ממד 64. הפריסה המרחבית הקודמת הקרינה קואורדינטות פיקסלים בדידות לשדה פוטנציאל רציף ויצרה את מטריצת הזיקה המבנית S כהטיה מרחבית מצטברת למודולציה של מטריצת הדמיון של מכפלת הנקודה. טנזור המאפיינים החזותיים שימש כמקור השאילתה, משום שניתוח סמנטי דורש שכל מיקום חזותי ישלף באופן פעיל ראיות עקביות מבנית מהמרחב הגאומטרי הקודם. הפריור של SDF שימש כמפתח ומקור ערך משום שהוא שומר מרחק גבול רציף ורמזים מבניים פנימיים-חיצוניים שמקורם בפריסת מנהטן. מונח מכפלת הנקודה-מדד את התאימות בין המראה הסמנטי לבין הפריור הגיאומטרי, בעוד שהמונח המבני המצטבר λS העביר את משקלי תשומת הלב לפיקסלים באותו מישור פיזי או קרוב לאותו קווי מתאר אדריכליים. המקדם λ ייצג את הביטחון בפריור המבני שהופק ושלט במידה שבה אילוצים אורתוגונליים קשיחים שולבו בהתפלגות הקשב. ניסוח זה הפחית את דיפוזיית המאפיינים החוצה גבולות שנגרמה על ידי הסתרת רהיטים ושמר על הרפיה אדפטיבית בפריסות שאינן במנהטן. התפלגות הקשב המונחית על ידי מבנה חושבה לפי משוואה 1.

משוואה 1: figure-protocol-3

כאשר A מציין את מטריצת אגרגציה מונחית מבנה, Q מציין את טנזור השאילתה שנוצר מתכונות חזותיות, K מציין את טנזור המפתח שנוצר מתכונות קודמות של SDF, V מציין את טנזור הערך שנוצר מייצוגים קודמים מבניים, dk מציין את ממד התכונה של טנזור המפתח, λ מציין את מקדם המשקל המבני האדפטיבי המשמש לזיהוי הביטחון הגיאומטרי של אזורים מקומיים ולהרפיית אילוצים אורתוגונליים קשיחים במרחב שאינו מנהטן פריסות, ו-S מציין את מטריצת הזיקה של SDF. החלוקה על ידי dk ייצבה את סולם הלוגיטים של תשומת הלב ומנעה מממדי תכונה גדולים לייצר משקלי קשב מרוכזים מדי. הפונקציה האקספוננציאלית המנורמלת (ראו טבלת החומרים) הפכה את ציוני הדמיון המודולציה להתפלגות מרחבית מנורמלת, שאפשרה לכל פיקסל לאסוף מידע מוקדם מבני בהתבסס על עקביות סמנטית וגאומטרית. עיצוב זה מסביר מדוע המראה הוויזואלי והפריבורים של הגבולות האדריכליים מתמזגים ברמת הקשב ולא על ידי שרשור תכונות ישיר.

גרף הטופולוגיה של סופרפיקסל נבנה ממפת תכונות מיושרת למבנה. מפת התכונות חולקה באמצעות אלגוריתם יצירת אזורים מרחביים. מספר הסופרפיקסל הוגדר ל-256, מקדם הקומפקטיות הוגדר ל-10, מקדם ההחלקה הגאוסיאנית הוגדר ל-1.0, ומספר האיטרציה הוגדר ל-10. מגבלות קרבה מרחבית נאכפו על ידי קביעת משקל מטרי המרחק ליחס קבוע של 1.0 למרחק מרחב הצבע של המאפיין במהלך האשכול, ובכך שמירה על יצירת צמתים אחידה על גבולות צפופים של בלאטרים. פיקסלים עם תגובות סמנטיות הומוגניות אוגדו לצמתים סופרפיקסלים. קשתות הגרף נבנו לפי יחסי סמיכות מרחביים, חוזק זיקה SDF, ומגבלות עקביות גאומטרית קו-פלנרית. תהליך הבנייה של מטריצת הזיקה המבנית והקישוריות הטופולוגית מוצג באיור 3, ומציג כיצד הנחיית SDF הוסבה ליחסים מרחביים ברמת הגרף.

ניסוח הגרף הוצג כדי להמיר הסקה צפופה על פי פיקסלים להסקה מרחבית לפי צמתים מעל אזורים מבניים הומוגניים. כל צומת סופרפיקסל ייצג אזור מקומי עם תגובה סמנטית דומה ורציפות מרחבית, בעוד שכל קשת ייצגה מסלול אמין להעברת תכונות בכפוף למגבלות של שכירות, זיקה למרחק-שדה ועקביות קו-פלנרית. עיצוב זה הפחית את ההשפעה של פיקסלים רועשים מבודדים ואפשר לאזורים סגורים על הקירות, הרצפה והתקרה לקבל הודעות מצמתים פיזיקליים סמוכים. לכן, מבנה הקצוות שימש כגשר מתמטי בין הנחיית SDF רציפה לבין הסקת גרפים לא-אוקלידית בדידתית.

רשת חשיבה קונבולוציונית גרפית בת שלוש שכבות הוגדרה עם ממדים נסתרים של 512, 256 ו-128. שכבת הקונבולוציה של הגרף ביצעה החלקה של מבנה הגרף בהתבסס על הקשרים המרחביים של הצמתים. הסכנות של הלולאה העצמית שמרה על המצב המקורי של כל צומת במהלך העברת הודעה, ומנעה מתכונות של אזור מבני קטן להימחק על ידי אזורים גדולים שמסביב. נורמליזציה סימטרית קנה מידה את רכיבי מטריצת השכנות לפי מכפלת שורשי הריבוע ההפוכים של דרגות הצמתים כך שצמתים במעלה גבוהה ונמוכה תרמו תחת גדלים נומריים דומים במהלך ההתפשטות. הפצת הזנה קדימה ביצעה אגרגציה מרחבית מקומית, שבה כל מצב צומת ספג תכונות בממדים גבוהים מאשכולות קו-פלנריים סמוכים לפני שהוחל פונקציית יישור לא ליניארית לפי אלמנט. ניסוח זה גרם לשכבת הקונבולוציה של הגרף להתקרב לדיפוזיה סמנטית לאורך מישורים פנימיים בעלי משמעות פיזיקלית, במקום להחלקה בלתי מוגבלת על גבולות של עצמים לא קשורים. תכונות הצמתים בגרף הוערכו לפי משוואה 2.

משוואה 2: figure-protocol-4

ההקרנה מתכונות פיקסל צפופות לצמתים סופרפיקסליים, העברת הודעות קונבולוציה גרפית והקרנת קואורדינטות אחורית מוצגות באיור 4, ומבהירות את מסלול האגרגציה של תכונות מרשתות תמונה רגילות לטופולוגיה שאינה אוקלידית וחזרה לייצוג סמנטי צפוף. ההיטל מתכונות פיקסל צפופות באיור 4A לצמתים סופרפיקסלים באיור 4B, העברת הודעות קונבולוציה גרפית באיור 4C, והקרנה אחורית בקואורדינטות באיור 4D מבהירות את מסלול אגרגציית התכונות מרשתות תמונה רגילות לטופולוגיה לא-אוקלידית וחזרה לייצוג סמנטי צפוף.

כאשר H(l) מציין את טנזור תכונת הצומת של שכבת הקונבולוציה של הגרף ה-l, Â מציין את מטריצת הסמיכות עם חיבורי לולאה עצמית, D מציין את מטריצת הדרגה המתאימה למטריצת השכנות, W(l) מציין את מטריצת המשקל הניתנת ללמידה של שכבת הקונבולוציה של הגרף ה-l, ו-σ מציין את פונקציית ההפעלה של יחידת הליניארית המתוקנת. המונח ÂH(l) אגד תכונות מצמתים סופרפיקסלים סמוכים, בעוד ש-D−1/2 ו-D−1/2 איזנו את תרומת הצמתים עם צפיפויות חיבור שונות. מטריצת הלמידה W(l) הקרינה תכונות צומת מצטברות למרחב סמנטי חדש, מה שמאפשר לשכבת הגרף להבחין בין עקביות מבנית לבין קרבה מרחבית רגילה. ההפעלה הלא-ליניארית שמרה על ההבדל בתגובות בין אזורים קו-פלנריים לא-קו-פלנריים לאחר הצטברות התכונות.

מאפייני סגמנטציה סמנטית פוענחו לאחר הסקת גרף. המפענח נבנה באמצעות שלושה שלבי דגימה דוגמת אינטרפולציה ביליניארית ופעולות מיזוג דילוג חוצה שכבות. תכונות מקודד מרחביות רדודות חוברו עם תכונות מפענח סמנטי ברמה גבוהה באמצעות מיזוג ערוץ-ערוץ. רזולוציית התכונה הוחזרה לגודל התמונה המקורי, ומפת החיזוי הסמנטית הסופית נוצרה דרך שכבת קונבולוציה 1 × 1.

רשת הניתוח הסמנטי המלאה אומנה באמצעות אופטימיזציה של דעיכת משקל-משקל מנותק (ראו טבלת החומרים). קצב הלמידה ההתחלתי הוגדר ל-0.0001, מקדם דעיכת המשקל ל-0.01, וגודל האצווה ל-8 עבור שני המדדים הציבוריים. קצב דעיכת המומנט הראשון נקבע ל-0.9, קצב דעיכת המומנט השני נקבע ל-0.999, ומקדם היציבות הנומרית של אפסילון נקבע ל-1 × 10⁻8. אובדן האימות נוטר בסוף כל תקופה, ונקודות ביקורת נשמרו כאשר ה-mIoU בקבוצת האימות עלה. הרשת אומנה ל-300 תקופות באמצעות אסטרטגיית דעיכת קצב למידה פולינומי עם עוצמת דעיכה של 0.9. חמש ריצות אימון עצמאיות בוצעו באמצעות אתחולים אקראיים שונים כדי לקבוע קו בסיס להערכה סטטיסטית קפדנית. הרשת עוצבה אופטימיזציה משותפת באמצעות אובדן אנטרופיה צולבת ברמת הפיקסלים ואובדן עקביות מבנית. כל הניסויים בוצעו על פלטפורמת מחשוב המצוידת בחומרת מחשוב מקבילית בזיכרון גבוה, ומידע מפורט על חומרה דווח בטבלת החומרים.

אופטימיזציה משותפת אכפה יישור גבולות גאומטריים על ידי חישוב גודל הגרדיאנט המרחבי של טנזור ההסתברות של המחלקה. אובדן העקביות המבנית שימש כרגלרייזר, כלומר מכפיל את נורמת גרדיאנטי החיזוי המרחביים בערכי SDF רציפים. ההיגיון המתמטי היה ששינויים בקטגוריות סמנטיות צריכים להתרכז בקרבת קווי המתאר האדריכליים האמיתיים, כאשר ה-SDF מתקרב לאפס, בעוד שפנים קירות, רצפות ותקרות שטוחים צריכים לשמור על תגובות סמנטיות חלקות. כאשר גרדיאנט חיזוי גדול הופיע רחוק מגבול מבני, מונח שדה המרחק הגדיל את העונש ומנע מעברים סמנטיים שגויים בתוך מישור פיזיקלי הומוגני. כאשר הופיע גרדיאנט חיזוי קרוב לקונטור של מרחק אפס, העונש נשאר מוגבל ושמר על מעברים לגיטימיים לאורך גבולות אדריכליים. אזורי מעבר סמנטיים הוגבלו ליישר את קווי המתאר של SDF, כפי שניתן במשוואה 3.

משוואה 3: figure-protocol-5

כאשר Lסך כולל מציין את פונקציית המטרה הסופית לאופטימיזציה, Lce מציין את אובדן האנטרופיה הצולב ברמת הפיקסל, Lscl מציין את אובדן העונש על עקביות מבנית, ו-α מציין את מקדם משקל ההפסד המבני. מונח האנטרופיה החוצה סיפק פיקוח סמנטי ברמת הפיקסל באמצעות מסכות אנוטציה, בעוד שמונח העקביות המבנית הטיל רגולריזציה גאומטרית באמצעות קודמים אדריכליים. מקדם המשקל α זיהוי קטגוריות מאוזן ויישור גבולות, ומונע מהאופטימיזציה להתאים יתר על דיוק תוויות מקומיות או קווי מתאר מבניים קשיחים. מטרה משותפת זו קישרה בין סמנטיקה חזותית, עקביות גבולות פיזיקלית ופרמטרים ניתנים לאימון לרשת בתוך יעד אופטימיזציה מאוחד.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

סידור ניסיוני

מחקר זה השתמש בשני מאגרי נתונים סטנדרטיים לניתוח סצנות פנימיות, מערך נתונים תלת-ממדי רחב בקנה מידה פנימי ומערך RGB-D לסצנות פנימיות, כדי להעריך ביצועים ולכוונן את המודל. מאגר הנתונים התלת-ממדי הפנימי בקנה מידה גדול כולל סצנות פיזיקליות מורכבות וסריקות ריאליסטיות ותצוגות RGB ברזולוציה גבוהה, המספקת תוויות סמנטיות תלת-ממדיות מדויקות של פיקסל-אחר פיקסל ומסכות סגמנטציה דו-ממדיות בהקרנה מרחבית. נתוני שחזור הרשת של המרחב הפיזיקלי הריאל...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

האלגוריתם של מאמר זה מחבר באופן הדוק את התכונות ההיררכיות הוויזואליות שנלכדות על ידי מקודד טרנספורמטור היררכי עם חלון מוזז לעומק הקודם של תיבת הגבול התלת-ממדית של מנהטן שנוצרה על ידי זיהוי מקטעי קווים, ובכך משיג שחזור סמנטי מדויק של סצנות פנימיות מורכבות. מנגנון קשב צולב מונחה על ידי מבנה מאלץ את האות הוויזואלי ליישר את הגבול הגיאומטרי האמיתי שמכויל על ידי SDF, ובכך משיב את הרציפות של תכונות ברמה נמוכה באזורים42 המוסתרים מקומית. גרף טופולוגיה נבנה באמצעות צמתים סו...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

המחברים מצהירים שאין להם ניגודי עניינים פיננסיים.

תודות

מימון: תוכנית מחקר ופיתוח מרכזית של שאאנשי (תוכנית מס' 2024CY2-GJHX-76).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

מקורות

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

הסתברויות מוקדמות למבנה בנייןטרנספורמר היררכיזיהוי קטעי קותיבת חריצה תלת-ממדית מסוג מנהטןשדה מרחק חתוםמנגנון תשומת לב צולבתרשת קונבולוציית גרפיםהפסד עקביות מבנית