Araştırma makalesi

İnsan-YZ İşbirliğini Geliştirmek İçin Adaptif Çok Modlu Etkileşim Çerçeveleri Tasarlamak

DOI:

10.3791/69830

24 Şubat 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, çevrimiçi adaptasyon ve dikkat odaklı multimodal füzyon ile Dinamik Zaman Bükülmesi (DTW) tabanlı hiyerarşik hizalama mekanizması önermekte; böylece güvenilir uzun ufuk niyet tahmini ve görev takibi mümkün olmaktadır. Hafif bir açıklanabilirlik modülü, yorumlanabilirliği artırır ve insan-yapay zeka iş birliğine güveni artırır. Yaklaşım hem robotik hem de sanal etkileşimli sistemlere genelleştirilir.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Etkili ve doğal insan-yapay zeka iş birliği sağlamak, özellikle dinamik gerçek dünya ortamlarında büyük bir zorluk olarak kalmaktadır. Mevcut çerçeveler genellikle katı tek modal girdiler veya kural tabanlı çoklu modal birleşme ile sınırlanır; bu da onların dayanıklılığını, kişiselleştirilmesini ve uyum sağlamlığını sınırlar. Bu çalışma, vizyona dayalı poz tahmini ve konuşma tabanlı komut anlayışını hiyerarşik bir insan niyeti tahmin modeli içinde entegre eden uyarlanabilir çok modlu bir etkileşim çerçevesi tanıtmaktadır. Çerçeve, insan davranışını uzun vadeli planlama için yapılandırılmış görev grafikleriyle uyumlu hale getirmek amacıyla eylem tahmini ve Dinamik Zaman Bükme için Transformer tabanlı dizi modelleri kullanır. Statik modalite anahtarlamaya dayanan önceki yaklaşımların aksine, mimarimiz en bilgilendirici girdileri dinamik olarak ağırlıklandırmak için dikkat odaklı bir füzyon mekanizması uygular. Ayrıca, çevrimiçi bir uyarlama modülü, kullanıcı davranışına gerçek zamanlı uyum sağlar ve kullanıcı güvenini artırmak için hafif bir açıklanabilirlik katmanıyla tamamlanır. İşbirlikçi bir montaj görevinde deneysel değerlendirme, görev performansında (%24'e kadar), niyet tahmin doğruluğunda (%18'e kadar) ve kullanıcı memnuniyetinde önemli artışlar gösterir. Bu sonuçlar, uyarlanabilir çok modlu etkileşim çerçevelerinin etkinliğini ve çok yönlülüğünü vurgularak, işbirlikçi zekayı daha güvenilir, şeffaf ve insan odaklı yapay zeka sistemlerine ilerletme potansiyelini desteklemektedir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

İnsan-robot iş birliği (HRC), özellikle robotların insan merkezli ortamlarda giderek daha fazla kullanıldığı bir dönemde araştırmanın önemli alanlarından biri olmuştur. Kısa vadeli HRC için çerçeveler ve teknolojiler önemli ölçüdegelişmiş olsa da 1,2, uzun vadeli HRC henüz olgunlaşmamış3. Endüstriyel uygulamalarda, uzun vadeli HRC'nin sömürülmesi, karmaşık üretim süreçlerinde verimlilik ve uyum sağlama yeteneğinde belirgin bir artışa yolaçabilir 4. Ev ortamlarında, robotlar refakatçi olarak veya yaşlı bakım ajanları olarak uzun vadeli HRC 5 ile yaşam kalitesini artırma potansiyeline sahiptir. Tıp toplum makinelerini, ev ve bakım verenlerin yerine koyuyor ve demans, otizm ve ek fiziksel veya zihinsel hastalıklarla ilgili etkilenen rolü kapsamayayerleştirir. 6. Aynı zamanda, seyahat ve dostluk alanları kullanıcı bilgisini geliştirmek için endüstriyelrobotları kullanır 7. Akıllı mühendislikte amaç, YZ'yi insan merkezli bir şekilde kullanarak yetkinlikleri geri kazanmak ve kişiselleştirilmiş ürünler üretmektir; bu aşama Endüstri 5.0 olarak bilinir. İnsan-YZ ve insan-robot iş birliği sistemleri, 8,9,10 gibi çeşitli uygulama alanlarında incelenmiştir; Ancak, son araştırmalar giderek daha fazla güvenilir niyet tahmini ve uzun ufuk görev anlayışı gerektiren işbirlikçi robotik ortamlara odaklanmaktadır.

Yapay zeka zaten günlük yaşamın derinlemesine yerleşmiş durumda ve kendi kendini yöneten veya yarı otonom uygulamaları iş dünyasının birçok alanında giderek daha fazla ortaya çıkıyor. Bu sadece iyi çalışan iş fonksiyonlarının şu anda teknolojideki değişikliklere uyum sağlayabilen sistemlere ve organizasyonel zorluklara duyarlılığa ihtiyaç duyduğunubelirtir. Bu nedenle, yapay zekanın benimsenmesi ve uygulanması sürecinde hibritleşme yoluyla insan eylemini geliştirme gerekliliği, bazı engellerin aşılmasını kolaylaştırıyor. Sonuç olarak, hibrit sistemler yapay ve insan zekasını birleştirerek karmaşık görevleri birlikte başarır, daha iyi sonuçlar sağlar ve meslektaşlarından öğrenerek becerilerini geliştirir. Bu nedenle, hibrit zeki sistemler12, iş birliği ve güçlendirilmiş zeka gibi genişletilmiş kavramlar, çeşitli yapay zeka modalitelerini entegre ederek iş birliğini artırma araştırmalarını ve anlayışını gayri resmi olarak şekillendiriyor.

"Güven" terimi, insan ilişkilerinde duygusal bağı tanımlayan kişilerarası ilişki çalışmalarından türemiştir. Örneğin, yazar13, güven seviyesinin teknik olarak iş birliği yapan tarafların duygularını, sözde çekiciliğini ve etik unsurlarını belirlediğini belirlemiştir. Sosyolojik olarak, kişilerarası güven varyasyonları ayrı refah, toplumsal etkileşim, sosyo-ekonomik büyüme ve pratik davranış üzerinde derin etkileryaratır 14,15,16. HRI, özünde, sosyal hizmet uzmanları ile zeki otomatlar arasındaki prosedürel konuşmaları geleneksel otomatların dil engellerinin ötesine bir köprüyapmaya yönelik bir girişimdir 17. Bu tür etkileşim, otonom sistemlerin hesaplama güçlerini insan sezgisiyle birleştirerek çeşitli uygulama ortamlarında etkili iş birliği sağlar. Otomatların kullanımı gerçek avantajlar getirir: finansal giderlerde önemli azalmalar, ekolojik ayak izinin azalması ve insan riskinin çok daha azıdır. Ancak başarıların ortasında, insanın robotlara olan güveni, özellikle etkileşimin genel kalitesini değerlendirirken bir temeltaştır.

Robotlara verilen insan güveni düzeyi, birçok alanda onların önemini ve merkezi rollerini yansıtır. Sağlıkta, robot güveni, HRI'ya göre tıbbi kaynakların dağılımını ve bulaşıcı hastalıkların bastırılmasının verimliliğinietkiler 20,21,22. Asker uygulamalarında, otomatlara olan sosyal inanç seviyesi, asker soruşturma cihazı stratejilerinin operatif yetkinlik seviyesini ve savaş taşımacılığının doğrulukseviyesini kontrol eder 23,24. Ayrıca, makinelere olan inanç, yapay zekanın spekülatif asker politika yapımında aktif inanç standartlaştırma mekanizmalarının teslimiyet ve kullanımınıetkiler 25. Çevresel araştırmalarda, örneğin üst düzey bedensel hareket araştırmalarında bile, sonuçların mantıklılığı HRI26'ya olan inanç derecesine bağlıdır. Ancak önemli bir uyarı, artan karar verme zorluklarının bu güveni zedeleyebileceği ve etkileşimitehlikeye atabileceğidir. Tablo 1, birkaç çalışmanın karşılaştırmalı genel bakışını açıklar.

Makale (Yıl, Kaynak)Ana AmaçlarAna Yöntemler ve Modalitelerİçgörüler
Xie & Park (2021, arXiv) [28]Duygusal sosyal robotlarla robot etkileşimlerini özelleştirinHem sözlü hem de sözsüz ipuçlarına (vücut pozisyonu, konuşma ve yüz ifadeleri) dayalı Pekiştirme Öğrenme PolitikasıRL eğitimi alan bir robotun davranışı insan duygularına yanıt olarak değişir, bu da sadeliği ve etkileşimi artırır.
Li ve ark. (2022, IEEE T-IE) [29]Üretim montajı için proaktif desteği kolaylaştırmakNiyet tahmini, transfer öğrenme ve çoklu modal öğrenme (görsel + iskelet)Temel seviyelere kıyasla robot proaktivitesinin iyileştirilmesi; Montaj sırasında daha hızlı ve hassas eylem tahmini
Abdelrahman ve ark. (2022, IEEE Erişimi) [30]Grup HRI'da gerçek zamanlı katılımın tahminiKural tabanlı sınıflandırma, derin öğrenme ve vizyona dayalı bakış/baş duruşu ile birleşimi≥%90 F puanı; fiziksel yapılandırmalarda aynı anda birkaç kullanıcıyı yönetir
Chiossi ve ark. (2025, arXiv) [31]Üretim ortamlarında multimodal, dinamik niyetli iletim için yapıTeorik çok yönlü düzen: SAT şeffaflık katmanları; haptik, işitsel ve görsel modlarKavramsal çerçeveyi oluşturur ve tasarım ortamının ortamını, planlamasını ve amacını açıklar.
McGrath ve ark. (2024, arXiv) [32]Uyum sağlayabilen insan-yapay zeka ilişkilerine güvenin gelişimini modelleyin.Takım aşamaları ve güven öncülleri; Belirli modalitelere bağımlı olmayan dinamik bir güven modeliTüm etkileşim ve zaman aşamaları için güvene dayalı tasarım ilkeleri sunar.
Fragiadakis ve ark. (2024, arXiv) [33]İnsanlar ile yapay zeka arasındaki iş birliğinin değerlendirilmesini standartlaştırın.HAIC moduna göre karar ağacı tarafından seçilen metrikler; Karma yöntemli metriklerÇerçeve, yapay zeka/insan merkezli, simbiyotik etkileşim modaliteleri için ilgili metriklerin seçilmesine yardımcı olur.
Younis ve ark. (2023, MDPI) [34]Demografik çıkarım kullanarak bağlama uyum sağlayan HRIYaş ve cinsiyet, görme ve ses modelleri kullanılarak tahmin edilir ve robot davranışları uygun şekilde ayarlanır.Anket, yaklaşımları özetler ve HRI'da kişiselleştirilmiş uyumun önemini vurgular.

Tablo 1: İnsan-Yapay Zeka İşbirliği'nde yapılan son araştırmaların karşılaştırmalı bir genel bakışı, her çalışmanın temel hedeflerini, metodolojilerini ve bulgularını vurgular. Çalışmada kullanılan veri setleri, özellikleri, büyüklükleri, modaliteleri ve katılımcı dağılımı.

Mevcut hiyerarşik ve çok modlu insan-robot iş birliği (HRC) çerçevesi, görsel ve işsel modalitelerin uzun vadeli iş birliği için kullanılmasında etkileyici ilerleme gösterse de, hâlâ bir dizi araştırma eksikliği mevcut ve bu da daha genel İnsan-Yapay Zeka iş birliği ortamlarına uygulanabilirliğini engelliyor. Örneğin, mevcut çerçeve çoğunlukla fiziksel robotiklere (örneğin KINOVA GEN3 kolu) uygulanabilir ve çeşitli dijital ortamlarda bulunan bedensiz veya sanal yapay zeka ajanlarına aktarılamamaktadır28. İkinci olarak, çoklu modalite görme ve konuşma ile ele alınırken, sistem kullanıcı durumu veya görev zorluğu29'a göre dinamik, bağlama bağlı bir füzyon yerine önceden tanımlanmış bir modalite-değiştirme stratejisi uygular. Üçüncü olarak, yaklaşım görev verimliliği ve dayanıklılığını vurgular ancak kullanıcı güveni, bilişsel yük veya duygusal durumu özel olarak modellemez; bunlar uzun vadeli iş birliği ve sistem açıklanabilirliği için gereklidir. Ayrıca, açıklanabilirlik süreçleri karar alma süreçlerinde yoksa, insan yorumlanabilirliği ve sistemin uyarlanabilir davranışına olan güveni sınırlıdır. Son olarak, değerlendirme çoklu alanlı doğrulama olmadan tek bir alan (oyuncak araba montajı) ile sınırlıdır ve gerçek dünyadadeğişkenlik gösterir 30. Bu tür boşluklar, heterojen giriş kanallarını dinamik olarak birleştiren ve insan niyetini, güvenini ve bağlamını gerçek zamanlı modelleyerek İnsan-YZ iş birliğini güçlendiren genelleştirilmiş, uyarlanabilir ve insan merkezli çok modlu bir etkileşim çerçevesinin geliştirilmesini gerektirir.

Bu çalışmanın en önemli amacı, görme ve konuşma modalitelerini gerçek zamanlı kullanıcı modellemesi ile birleştiren uyarlanabilir çok modlu bir etkileşim sistemi tasarımı yoluyla insan-yapay zeka iş birliğini en üst düzeye çıkarmaktır. Uzun vadeli sağlam insan-robot iş birliğinin sağlam temeli üzerine inşa edilen bu çalışma, çoklu modal mimariyi robotik dışındaki genel yapay zeka sistemlerine, örneğin sanal ajanlar ve akıllı arayüzlere genelleştirecektir. Ana vurgu, düşük seviyeli eylem anlayışı ile yüksek seviyeli görev ilerleme takibi ile entegre edilen hiyerarşik planlama mekanizmaları aracılığıyla dinamik niyet tahminidir. Kural tabanlı sistemlerin aksine, burada sunulan çerçeve, kullanıcı özel model güncellemeleri ve bağlam farkında modalite birleşimi gibi uyarlanabilir öğrenme yöntemlerini kullanarak etkileşim davranışını kullanıcı tercihlerine, bilişsel duruma ve çevresel dinamiklere göre dinamik olarak uyarlayacaktır. Ayrıca, çerçeve, kullanıcıların yapay zeka seçimlerini anlamalarını ve geri bildirim vermesini sağlayan açıklanabilir etkileşim akıl yürütme ile şeffaflık ve güveni artırmayı da hedefliyor. Son olarak, bu araştırma farklı iş birlikleri bağlamlarında etkileşim akıcılığını, görev etkinliğini ve uzun vadeli kullanıcı memnuniyetini artırmayı amaçlamaktadır.

Bu makale, görsel ve işitsel modaliteleri dinamik olarak birleştirerek insan-yapay zeka iş birliğini teşvik etmeyi amaçlayan yeni bir Adaptif Çok Modal Etkileşim Çerçevesi tanıtmaktadır. 'Tek modal' sistem, görev yürütme ve niyet tahmini için yalnızca tek bir giriş modalitesi (örneğin görsel veya konuşma) kullanan, bilgiyi birden fazla kanal üzerinden entegre etmeden kullanılan bir modeli ifade eder. 'Uyum sağlamayan' sistem, Kural Tabanlı Geçiş temeli gibi, kullanıcı eylemlerine veya bağlama göre davranışını ayarlamayan kural tabanlı veya sabit strateji sistemini ifade eder. Bu temel çizgiler, önerdiğimiz dikkat odaklı füzyon modeli Transformer ile uygulanan multimodal algı ve adaptif etkileşim stratejilerinin avantajlarını değerlendirmek için referans noktaları sağlar. Önceki hiyerarşik HRCparadigmaları 31'e dayanarak, yöntemimiz birkaç önemli yenilik getirir:

Bu çalışma, beklenen düşük seviyeli insan eylemlerini hiyerarşik görev grafiğindeki düğümlere eşleyen Dinamik Zaman Bükülmesi (DTW) tabanlı bir hizalama mekanizması sunmaktadır; önceki çoklu modal etkileşim sistemlerinin çoğunlukla kısa vadeli eylem tanımasınaodaklanmasının aksine. Zamansal öngörülemezlik ve gürültülü multimodal girdiler karşısında, bu güvenilir uzun ufuk niyet tahmini ve görev ilerleme takibi sağlar.

Etkileşim sırasında niyet çıkarımı ve eylem tahmin modellerini sürekli güncelleyen çevrimiçi bir uyarlama modülü önerilen sisteme dahil edilmiştir. Bu, sistemin benzersiz kullanıcı davranışlarına, tercihlerine ve bağlamsal değişikliklere dinamik olarak uyum sağlamasını sağlayarak statik veya çevrimdışı eğitimli çok modlu modellerin dezavantajlarını aşıyor.

Görsel ve işitsel modaliteler, her zaman adımında bağlamsal önemlerine göre benzersiz dikkat odaklı bir füzyon tekniği kullanılarak dinamik olarak ağırlıklandırılır. Bu veri odaklı füzyon yaklaşımı, çeşitli etkileşim ortamlarında dayanıklılığı artırır ve kural tabanlı modalite değişimini değiştirir.

Bu çalışma, uyarlanabilir insan-yapay zeka sistemlerindeki yorumlanabilirlik boşluğunu kapatmak için hiyerarşik planlama ve birleşme kararlarını anlaşılır gerekçelere dönüştüren hafif bir açıklanabilirlik modülünü içermektedir. Bu, uzun vadeli iş birliğinin kalitesini artırır ve doğru güven kalibrasyonunu teşvik eder.

Önerilen yaklaşım, bedenlenmiş robotların ötesine sanal ajanlar ve akıllı arayüzler gibi genelleştirmeyi amaçlamaktadır; bu yaklaşım, robotik platformla gerçek dünyada ortak bir montaj etkinliğinde kanıtlanmış olmasına rağmen, birçok insan-yapay zeka işbirliği alanında faydasını genişletmektir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

İnsan-yapay zeka iş birliğini artırmak için önerilen mimari, vizyon ve konuşma modalitelerini dinamik, hiyerarşik bir akıl yürütme çerçevesinde birleştiren uyarlanabilir çok modlu etkileşim boru hattı kullanır. Bu çalışma, daha önce yayımlanmış deneylerden kamuya açık verileri kullandı. Yeni insan denek dahil edilmedi ve ek etik onay gerekmiyordu.

Önerilen uyarlanabilir çok modlu etkileşim mimarisi

Temelde, sistem algı modülleriyle başlar; örneğin görsel akış, RGB-D sensörleri kullanarak kullanıcı duruşunu ve hareketini yakalar; bir ses akışı ise hafif bir ASR (Otomatik Konuşma Tanıma) motoruyla konuşma girişlerini analiz eder. Bu ham girdiler, düşük seviyeli insan eylemleri hakkında mantık yürütmek için poz ve komut dizilerindeki zamansal bağımlılıkları kodlayan Transformer tabanlı eylem tahmin modülüne aktarılır. Daha sonra, üst düzey iş birliği planlamasını mümkün kılmak için, Dinamik Zaman Bükülme (DTW) mekanizması, tespit edilen eylemleri önceden tanımlanmış bir görev grafiğinin düğümleriyle hizalayarak kullanıcı hedeflerini ve sonraki eylemleri tahmin eder. Yeni dikkat tabanlı bir füzyon modülü, her zaman adımında hangi modalite'nin (ses mi yoksa görme) en bağlamsal olarak önemli bilgiyi verdiğine karar verir ve giriş ağırlıklarını dinamik olarak ayarlar. Etkileşimi bireyselleştirmek için sistem, gerçek zamanlı eylem tahmincilerini kullanıcı davranışına uyarlayarak çevrimiçi model uyarlamasını içerir. Hafif bir açıklanabilirlik modülü, şeffaflık ve güveni artırmak için tahmin edilen niyetlerin ve yapay zeka kararlarının kullanıcı dostu özetlerini de oluşturur. Tüm sistem, simüle edilmiş ama gerçek dünya kooperatif bir montaj ortamında test ediliyor; bu da tek modlu ve adaptif-multimodal ortamlar arasında karşılaştırma imkanı sağlıyor. Böyle bir yaklaşım, tüm alanlarda yapay zeka ajanlarıyla daha uyum sağlayabilici, daha sezgisel ve daha güvenilir iş birliğini kolaylaştırır.

Şekil 1 , İnsan-Yapay Zeka iş birliğini geliştirmeyi amaçlayan Uyarlanabilir Çok Modlu Etkileşim Çerçevesi'nin mimarisini göstermektedir. Giriş, iki ana algılama cihazına dayanan Giriş Toplama aşamasıyla başlar: derinlik artırılmış görsel bilgileri (örneğin insan duruşu ve hareketi) gözlemlemek için RGB-D kamera ve konuşma komutlarını toplamak için yönlü bir mikrofon. Ham sinyaller daha sonra Ön İşleme modülünden geçer; bu modül, girişi akışlarını temizlemek, normalleştirmek ve biçimlendirmek yoluyla sessel-görsel verileri sonraki analiz için işler. Daha sonra, boru hattı Özellik Çıkarma aşamasına geçer; burada veri iki akışa ayrılır: Poz tahmin algoritmalarıyla poz ve hareket özelliklerini izole eden Görsel Akış ve konuşmayı yorumlanabilir komut gömülmelerine dönüştüren Ses Akışı. Çok boyutlu öz-dikkat ve zamansal konumsal kodlama kullanarak etkileşim dizileri arasında uzun menzilli karşılıklı bağımlılığı ifade eden multimodal bir Transformer kodlayıcı, ardından birleşmiş temsili işler. Kullanıcının mevcut hedef durumu, uzun ufuk niyet ve görev ilerleme tahmincisi ile tahmin edilir ve düşük seviyeli eylemler, DTW tabanlı bir hizalama modülü tarafından güvenilir görev takibi için hiyerarşik görev grafiğindeki düğümlere eşlenir. Füzyon ağırlıkları ve tahmin parametreleri, etkileşim geri bildirimine yanıt olarak çevrimiçi model uyarlama döngüsü aracılığıyla sürekli güncellenir ve açıklanabilirlik modülü, açıklık ve güveni artırmak için açık açıklamalar sağlar. Tüm ürün hattı, sistemin dinamik görevler ve ortamlar üzerinde kullanıcılarla uyumlu ve verimli bir şekilde birlikte çalışmasını sağlar.

figure-protocol-1
Şekil 1: Transformatörlere dayalı önerilen çok modlu etkileşim çerçevesinin genel bakışı. Görsel ve işitsel verileri kodlamak ve dinamik olarak entegre etmek için dikkat yönlendirilmiş bir teknik kullanılır. Hiyerarşik görev modellemesi ve çevrimiçi adaptasyonu entegre eden bir Transformer modülü, uzun ufuk niyet tahmini ve görev ilerlemesi tahmini için birleşmiş temsilleri işler. . Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Önerilen sistem, şeffaflığı ve kullanıcı güvenini artırmak için çoklu modlu birleşme ve hiyerarşik planlama bileşenleriyle birlikte çalışan hafif bir açıklanabilirlik modülünü içeriyor. Modül, DTW tabanlı görev grafiği hizalamasından (örneğin, mevcut görev ilerlemesi ve beklenen sonraki eylem) ve dikkat tabanlı birleşme katmanından (örneğin, modalite önem ağırlıkları) yorumlanabilir ipuçları türetir. Bu ipuçları, konuşulan komutların veya görsel jestlerin sistem seçimini etkileyip etkilemediği ve beklenen eylemin daha geniş çalışma planına nasıl uyduğu gibi insanlar için anlaşılır açıklamalara dönüştürülür. Kullanıcılar, sistem davranışını anlamalarına, tahmin etmelerine ve gerekirse düzeltmelerine yardımcı olan kısa yazılı veya görsel geri bildirim şeklinde açıklamalar alırlar. Değerlendirmede belirtilen artan kullanıcı mutluluğu, etkileşim akıcılığı ve güvenle ilgili metrikler, açıklanabilirlik farkındalığının dolaylı göstergeleridir. Bulgular, uzun vadeli insan-yapay zeka etkileşiminde, yapay zeka kararları için şeffaf gerekçelerin kullanıcı güvenini artırdığını, iş birliğini kolaylaştırdığını ve uyarlanabilir sistem davranışının kabulünü artırdığını ima ediyor.

Giriş verileri

İnsan-YZ iş birliği için öngörülen çerçevede girdi edinimi, insan eylem ve niyetlerini etkili şekilde gerçekleştirmek için hem görme hem de işitme modalitelerini birleştiren yapılandırılmış çok modlu algılama mekanizması aracılığıyla gerçekleştirilir. Görsel girdi, insanların gerçek zamanlı poz bilgilerini, mekansal konumunu ve çevrenin bağlamını yakalayan RGB-D kamera ile elde edilir. Görsel veriler, BlazePose gibi önceden eğitilmiş modeller aracılığıyla işlenir ve etkileşim görevleri için üst gövde anahtar noktaları elde edilir. Aynı zamanda, işitsel bilgi yönlü bir mikrofondan elde edilir ve önceden eğitilmiş bir DeepSpeech modeliyle yorumlanarak, anlaşılmazlığı açıklayan veya ek olarak belirsiz görsel ipuçları sağlayan konuşma komutlarını tanımlar. İşbirlikçi ortamlarda, çift giriş sistemi dinamik uyum ve bağlam farkında algı sunar. Eğitim ve değerlendirme veri seti, dört kullanıcıdan kontrollü ve yarı yapılandırılmış ortamlarda toplanan montaj ve teslim davranışları gibi çeşitli etkileşim aktiviteleri için 5.000'den fazla çoklu modal insan hareketyörüngesi 1 içerir. Genelleştirmeyi artırmak için, sistem çevrimiçi model uyarlamasını mümkün kılarak kullanıcı davranışı ve çevresel dinamiklerin değişmesiyle modelin tahminlerini gerçek zamanlı olarak güncellemesini sağlar.

Veri seti açıklaması

Önerilen çerçeve için eğitim ve değerlendirme veri seti, KINOVA GEN3 robot1 kullanılarak oyuncak araba montaj görevi kapsamında yapılan gerçek dünya insan-robot iş birliği deneylerinden elde edilmiştir. Deneysel ortam, hem görsel hem de işitsel modaliteleri içeren çoklu modal etkileşimi kapsayan uzun vadeli işbirlikçi faaliyetleri taklit etmeyi amaçladı. Özellikle, eğitim veri seti iki kullanıcıdan alınan 3.003 yörünge dizisinden oluşur ve test veri seti, model genellemesini değerlendirmek için iki yeni kullanıcının verileri dahil olmak üzere 2.088 dizi içerir. Her yörünge, BlazePose ile alınan üst gövde pozu anahtarlarının 5 adımlı dizisini ve DeepSpeech33 tarafından aktarılan ilgili konuşma komutlarını kaydeder. Toplanan veriler, nesne teslimatı, araç kullanımı ve işbirlikçi eylemler gibi faaliyetlerde insan hareketleri ve komut ifadesindeki doğal çeşitliliği yansıtmaktadır. Multimodal veri seti, DLinear eylem ve yörünge tahmin modellerinin denetimli öğreniminin temelini oluşturur ve sadece görme, sadece ses ve multimodal koşullarda yapılan kullanıcı çalışmalarında merkezi kıstattır. Farklı kullanıcı türleri ve gerçekçi gürültü koşullarının dahil edilmesi, kalıcı HRC sistemleri için dayanıklılık ve uyum sağlama testlerini garanti eder. Tablo 2 , ayrıntılı veri seti açıklamasını gösterir.

NiteliklerDetaylar
Veri Seti AdıOyuncak Araba Montajı Veri Seti (kurum içinde toplanmıştır)
Koleksiyon OrtamıKINOVA GEN3 koluyla gerçek dünya HRC deneyi
Kullanıcı sayısı (Eğitim)2 kullanıcı
Kullanıcı sayısı (test)4 kullanıcı (2 eğitim setinden, 2 görünmemiş)
Toplam Yörüngeler (Eğitim)3.003 yörünge
Toplam Yörüngeler (Test)2.088 yörünge
Ele Geçirilen ModalitelerGörsel (RGB-D poz için), Ses (Konuşma komutları)
Veri FormatıAnahtar noktaları pozla (BlazePose'dan), konuşmadan metne komutları
Zamansal ÇözümHer yörünge 5 zaman adımı içerir
Görevler3 ana görev: Seç ve yerleştir, nesne döndürme, işbirlikçi montaj
KullanımEylem/yörünge tahmin modellerinin denetimli eğitimi; Kullanıcı çalışması

Tablo 2: Veri Seti Tanımı. Programlama çerçevesi, donanım ayarları ve değerlendirme ortamı dahil olmak üzere simülasyon ortamı hakkında bilgiler.

Veri seti ön işleme

İnsan-yapay zeka iş birliğinde uyarlanabilir çoklu modal etkileşimi mümkün kılmak için, görsel (RGB ve derinlik görüntüleri), işitsel (konuşma komutları) ve zamansal davranış verileri (poz anahtar noktaları) gibi ham veri seti yapılandırılmış ön işlemeye tabi tutulur. Görsel veriler ilk olarak BlazePose veya OpenPose'dan türetilen bir poz tahmin modeli fpose ile çıkarılır. Frame t için, insan poz vektörü şu şekilde tanımlanır:

figure-protocol-2(1)

Burada k, anahtar noktaların sayısıdır ve her anahtar nokta 2B koordinatlar içerir. Dizileri gövde uzunluğuna göre normalleştirilir ve zamanla Savitzky-Golay filtresi ile düzleştirilir:

figure-protocol-3(2)

burada w, filtreleme penceresinin büyüklüğüdür. İkinci olarak, ham ses akışları At, Ses Aktivite Dedektörü (VAD) kullanılarak parçalara bölünür. Güvenilir segmentler, komut tokenlarını çıkarmak için bir konuşma tanıma modeli fkonuşmasına (örneğin DeepSpeech) beslenir:

figure-protocol-4(3)

burada V, tanınan komutların kelime dağarcığıdır. Entegrasyon için, tüm komut belirtekenleri görsel poz zaman damgalarına zaman damgalarına göre zamanla hizalanır ve interpolasyon tabanlı hizalama fonksiyonu τ:

figure-protocol-5(4)

Üçüncü olarak, zamansal niyet eğitim dizilerini figure-protocol-6oluşturmak için , yörünge dizilerini ve ilgili konuşma komutlarını figure-protocol-7tanımlarız. Bunlar, l boyutunda sürgülü pencerelerle sabit uzunluklu segmentlere pencerelenmiştir:

figure-protocol-8(5)

figure-protocol-9(6)

Son olarak, yörünge tabanlı tahmin modellerinde yakınsamaya yönelik anahtar nokta boyutu başına sıfır ortalama ve birim varyansı olarak girdiler normalleştirilir:

figure-protocol-10(7)

buradaμ j, σj eğitim setini tamamlayan anahtar noktanın ortalaması ve standart sapmasıdır.

Özellik çıkarımı

Tanımlanan uyarlanabilir çok modlu etkileşim paradigmasında, görsel, işitsel ve bağlamsal görev özelliklerinin birleştirilmesiyle güçlü ve gerçek zamanlı iş birliği mümkün olur. Özellik çıkarma süreci, iki ana modaliteden eşzamanlı veri toplama ile başlar: görsel sinyaller figure-protocol-11 ve sesli sinyaller figure-protocol-12, zaman adımı t ile indekslenir. Bu gözlemler, insan davranışı, niyet ve konuşma komutlarıyla ilgili yüksek düzey anlamsal özellikler elde etmek için ilgili algı modüllerinden geçirilir.

Görsel özelliklerin çıkarılması

RGB-D kameralardan alınan ham görsel veriler figure-protocol-13, insan poz tahmincisi (örneğin, BlazePose) aracılığıyla beslenir; figure-protocol-14bu da k, tespit edilen anahtar nokta sayısını temsil eder ve her biri 3D koordinatlar içerir:

figure-protocol-15(8)

Bu anahtar noktalar, trend mevsimsel ayrıştırma yoluyla hareket dinamiklerinin çıkarıldığı bir poz yörüngesine figure-protocol-16zamanla gömülüşüdür:

figure-protocol-17(9)

burada ∈_t kalıntı gürültüyü temsil eder.

Ses özelliklerinin çıkarılması

Ses girdisifigure-protocol-18 , önceden eğitilmiş bir konuşma tanıma modeli (örneğin, DeepSpeech) üzerinden işlenir ve tokenize bir komut temsili figure-protocol-19üretir, burada n token uzunluğudur:

figure-protocol-20(10)

Multimodal füzyon

Birleşik bir etkileşim bağlamı oluşturmak için, özellikleri güven ve karşılıklı bilgiye dayalı güven ağırlıklı bir dikkat ile birleştiriyoruz:

figure-protocol-21(11)

buradaφ V ve φA, görsel ve işitsel özelliklerin ortak bir gizli uzaya projeksiyon fonksiyonlarıdır veα t∈[0,1] entropi temelinde hesaplanan dinamik bir modalite ağırlıklandırma terimidir:

figure-protocol-22(12)

Burada figure-protocol-23 ve figure-protocol-24 hedefleri, hedef durum g ile gözlemlenen modaliteler arasındaki karşılıklı bilgilerdir.

Bağlamsal Gömülme Kullanarak Planlama

Son çok modlu özellik vektörü Ft , görev bağlamı ve ilerleme Pt ile zenginleştirilir ve uyarlanabilir planlama modülünün durum girdisi olur:

figure-protocol-25(13)

Bu çıkarılan özellik xt , dinamik ve belirsiz ortamlarda uyum sağlayıcı ve sağlam insan-yapay zeka iş birliğini destekleyen aşağı akış niyet tahmin ve hareket planlama modellerine giriş olarak kullanılır.

Görev Grafiği Hizalanması ile eylem ve plan tahmini

Multimodal özellik çıkarma sürecini takip etmek, konuşma niyeti (ses), poz yörüngesi (görsel) ve bağlamsal (örneğin, görev günlükleri veya duygu) verilerinin sonraki işlemede entegre edildiği ve uyarlanabilir insan eylem tahmini ve hiyerarşik görev grafiği hizalanması kullanılarak plan çıkarımı içerir.

Zaman adımı t aşamasındaki entegre multimodal özellik vektörü şu şekilde temsil edilsin:

figure-protocol-26(14)

Sistem, başlangıçta düşük seviyeli insan eylemini f eylemi fonksiyonu aracılığıyla tahmin eder; bu genellikle tekrarlayan kodlayıcı-kodlayıcı veya transformatör olarak temsil edilir:

figure-protocol-27(15)

burada F(t-k:t), son k zaman adımındaki özellik birleşme dizisini gösterir ve figure-protocol-28 eylem kümesi A'dan tahmin edilen eylemdir. Modül, adaptif kayıpla çevrimiçi ince ayarlanmıştır:

figure-protocol-29(16)

Burada CE, eylem sınıflandırması çapraz entropi kaybıdır, ikinci terim ise iyi bir gelecek yörüngesi tahminini yönlendirir.

Yüksek seviyeli plan tahmini için, görevi Hiyerarşik Görev Grafı G = (N, E) boyunca bir ilerleme olarak çerçeveleriz; burada her düğüm ni ∈N bir alt görev veya ara hedefi gösterir. Amaç, gözlemlenen eylem dizisini referans görev yolu R*∈G ile karşılaştırarak mesafeyi azaltmaktır:

figure-protocol-30(17)

Burada Pt , mevcut ilerleme izini, d(⋅) ise Dinamik Zaman Bükülmesi (DTW) mesafesini veya yumuşak hizalama metrikini gösterir.

Nihai plan düzeyindeki niyet figure-protocol-31, tahmin edilen eylemin bir ̂_t ile hizalanmış yolda figure-protocol-32en olası sonraki adıma yansıtılmasıyla türetilir:

figure-protocol-33(18)

Bu hiyerarşik çözümleme, belirsiz veya gürültülü duyusal girdiler olsa bile, sistemin mevcut görev dizisiyle uyumlu en bağlamsal olarak ilgili yüksek seviyeli niyeti seçmesini garanti eder. Bu öngörücü planlama, sadece iş birliği verimliliğini artırmakla kalmaz, aynı zamanda çoklu aşamalı İnsan-YZ etkileşiminde öngörü ve uyum sağlama yeteneğini de artırır.

Multimodal füzyon (dikkat temelli) mekanizması

Uyarlanabilir insan-yapay zeka iş birliğinde, kullanıcı niyetinin doğru yorumlanması için birkaç duyusal modalitenin (örneğin, görsel: insan pozu, yörünge; işitsel: konuşma komutları) çoklu modal entegrasyonu gereklidir. Kural temelli veya statik bir füzyon yaklaşımı, gerçek dünyadaki dinamik insan etkileşimleriyle başa çıkamaz. Bunun için, her zaman adımında her modaliteyi bağlamsal önemine göre dinamik olarak ağırlıklandıran dikkat üzerine bir füzyon mekanizması sunulmaktadır.

Görsel ve işitsel modalitelerden çıkarılan özellik vektörlerini sırasıyla ve figure-protocol-34olarak figure-protocol-35 belirtelim. Bu vektörler, önceki işlem boru hatlarından elde edilen anlamsal bilgileri kodlar; örneğin, görsel özellikler poz tahmini ve eylem tahminiyle ortaya çıkabilirken, ses özellikleri DeepSpeech veya wav2vec gibi modeller kullanılarak konuşma gömülmelerinden türetilebilir.

Dikkat tabanlı füzyonun amacı, her modalitenin göreceli önemini yakalayan modalite-spesifik dikkat ağırlıklarını hesaplamaktır. Bu yumuşak dikkat mekanizması kullanılarak yapılır.

Dikkat ağırlık hesaplaması

İlk adımda, her iki vektör de öğrenilebilir bir dönüşümle paylaşılan bir dikkat alanına dönüştürülür. Yani, her i∈{V,A} modalitesi için ara dikkat puanı şu şekilde hesaplanır:

figure-protocol-36(19)

burada figure-protocol-37 ve figure-protocol-38 dikkat ağı öğrenilebilir parametrelerdir ve tanh doğrusal olmayan bir aktivasyon fonksiyonudur. Bu dönüşüm, modelin her modalitede yüksek seviyeli korelasyonları ve bağlamsal önemliliği çıkarmasını sağlar.

Bu normalize edilmemiş dikkat puanları e, V ve αA , daha sonra softmax fonksiyonuyla normalize edilir ve toplamları 1'e ulaşır

figure-protocol-39(20)

Burada, αV ve αA , görsel ve işitsel modaliteler üzerindeki dikkat ağırlıklarıdır. Ağırlıklar uyarlanabilir ve mevcut görev kontekstine, sinyal kalitesine ve kullanıcı aktivitesine bağlı olarak zamanla güncellenir.

figure-protocol-40(21)

Ortaya çıkan birleşmiş temsil figure-protocol-41, giriş modalitesi vektörlerinin ağırlıklı bir kombinasyonu olarak elde edilir:

Bu birleşik vektör, görsel ve işitsel bilginin ortak anlamını, en bilgilendirici akışı aktif olarak vurgulayan bir şekilde kodlar. Daha sonra görev grafiği eşleştirme, niyet tahmini veya robot hareket planlama motoru gibi sonraki modüllere aktarılır.

Algoritma 1: Multimodal Dikkate Dayalı Füzyon

Giriş: Görsel özellik vektörü hV∈Rd, Ses özelliklerinin vektörü hA∈Rd

Öğrenilebilir parametreler: W∈Rk*d,w∈Rk ve b∈Rk

Çıktı: füzelenmiş temsil hfused∈Rd.

Adım 1: Denklem 19 kullanarak ara temsilleri belirleyin

Adım 2: Denklem 20 kullanarak dikkat puanlarını normalleştirmek için Softmax kullanın

Adım 3: Denklem 21 kullanarak birleşen vektörü hesaplayın

Adım 4: Geri dönüşh, sigortalı

Dikkat Temelli Çok Modlu Füzyon algoritması, görsel ve ses akışları gibi çeşitli giriş modalitelerinin özelliklerini bağlam duyarlı bir şekilde akıllı bir şekilde birleştirme imkanı sunar. Birleşme, her modalitenin tamamlayıcı ancak değişken bilgi sunduğu sistemlerde gereklidir; örneğin insan-yapay zeka iş birliği ortamlarında görme jestleri veya vücut pozisyonunu yakalarken, ses konuşma komutlarını veya ses sinyallerini yakalar.

Algoritma 1, her modalite için ara temsilleri belirleyerek başlar. Her iki modeli de hesaplamak için, görsel akış için eV ve sesakışı için e, paylaşılan sinir ağı katmanı önce ilgili özellik vektörlerinde doğrusal olmayan bir dönüşüm gerçekleştirir. Daha sonra,V ve α A α dikkat ağırlığı, ara puanlar üzerinde softmax fonksiyonu uygulanarak hesaplanır. Bu, ağırlıkların pozitif olmasına ve toplamının 1'e ulaşmasına yardımcı olur; böylece her modaliteden gelen katkılar normalleştirilir. Bir modalite, modellendiği gibi, ne kadar bilgilendirici olursa, dikkat ağırlığı o kadar artar.

Sonuç olarak, algoritma h'nin birleşmiş tasvirini, grafik ve ses özellik vektörlerinin ağırlıklı kombinasyonu üzerinden hesaplar; bu vektörlerin ilgili dikkat ağırlıklarıyla normalleştirilmiştir. Bu birleşmiş vektör, her iki modaliteyi veri odaklı, bağlama duyarlı bir şekilde birleştirir ve niyet tanıma, karar alma veya robot hareket planlaması gibi sonraki görevler için hizmet verir. Toplamda, bu algoritma sistemin sabit veya kural tabanlı füzyon yaklaşımları kullanmak yerine, belirli bir anda en ilgili modalite veya modalite kombinasyonuna dinamik olarak odaklanmasını sağlar. Bu da çerçeveyi dinamik insan-yapay zeka etkileşim durumlarında daha güçlü, esnek ve duyarlı hale getirir.

Şekil 2, görsel ve işitsel girdilerin bağlam duyarlı entegrasyonunda çalışan Dikkat Temelli Çok Modlu Füzyon mekanizmasının iş akışını göstermektedir. Görsel Özellik Çıkarma (Görsel Özellik Çıkarma) iş akışının ilk adımıdır ve giriş görüntüleri veya videodan (örneğin RGB-D kameralar) mekânsal veya pozla ilgili özelliklerin çıkarılmasını içerir. Bunlar, daha sonra görsel bilginin en bilgilendirici içeriğini vurgulamayı öğrenen bir Görsel Dikkat modülüne girilir. Paralel olarak, Ses Dikkat modülleri konuşma komutlarından gelen konuşma gömülmelerini veya ses belirtetörlerini işler ve farklı işitsel sinyallere bağlamsal önem yükler. Ortaya çıkan dikkat ağırlıklı özellikler, dikkat tabanlı bir füzyon katmanı aracılığıyla entegre edilir ve kalıntı bağlantılar ve katman normalizasyonu ile konum bazında besleme ağına aktarılır ve standart bir Transformer kodlayıcı bloğu oluşturur. Çıktı, değişken etkileşim koşullarında sağlam uzun ufuk niyet tahmini ve uyarlanabilir karar vermeyi destekleyen birleşik bir multimodal gömdürmedir. Bu tasarım, sistemin herhangi bir noktada daha sağlam modaliteye seçici olarak odaklanmasını sağlar ve gerçek zamanlı insan-yapay zeka etkileşiminde sağlamlığı ve yorumlanabilirliği artırır.

figure-protocol-42
Şekil 2: Dikkat yönlendirilen çok modlu füzyon modülünün ayrıntılı yapısı. Her zaman adımında bağlam farkında birleşmiş bir temsil oluşturmak için, modalite-spesifik kodlayıcılar görsel ve işitsel akışlardan özellikleri toplar. Bu özellikler, veri odaklı dikkat mekanizması kullanılarak dinamik olarak ağırlıklandırılır. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Çevrimiçi model uyarlaması

Farklı kullanıcı davranışları ve bağlamları altında yüksek kaliteli insan-yapay zeka iş birliğini sağlamak için, çerçevemiz etkileşim sırasında kullanıcıya özgü modelleri aşamalı olarak optimize eden çevrimiçi bir model uyarlama mekanizması içermektedir. Modül, gerçek zamanlı davranışsal sinyalleri (örneğin, poz, jest yörüngeleri, konuşma tonu) takip eder ve temel öngörücü modelleri kademeli öğrenme algoritmalarıyla günceller. Özellikle, yörünge tahmini ve niyet tanıma modelleri, son girdilerle gradyan tabanlı ince ayar veya düşük seviye uyumu (LoRA) yoluyla ince ayar edilir; böylece sistem tamamen yeniden eğitilmek zorunda kalmadan değişen kullanıcı davranışına veya göreve özgü gereksinimlere uyum sağlayabilir.

Geri bildirim katmanı, hem örtük geri bildirim (örneğin, düzeltmeler, tereddütler, gecikmeler) hem de açık komutlar (örneğin, konuşma veya arayüz) aracılığıyla uyum ile uyumlu bir şekilde hareket eder. İki amacı vardır: Multimodal ipuçlarının önemini uyarlayıcı olarak kalibre etmek ve güven/güven ölçümlerini karar ve kontrol modüllerine iletmek.

Geri bildirim döngüsü, daha akıcı görev performansı ve kullanıcı odaklı yanıtlar sağlar. Güven ve şeffaflığı beslemek için, çerçeve düşük seviyeli model kararlarını insan tarafından anlaşılabilir gerekçelere dönüştüren açıklanabilirlik modülünü entegre eder. Multimodal füzyon transformatöründen gelen mantık haritalarını kullanır ve görev grafiği boyunca mantık iziyle desteklenir. Bu gerekçeyi isteğe bağlı olarak bir arayüz veya işitsel yardımcı aracılığıyla sunarak kullanıcıların sistem davranışını anlamasını ve hatta belki de düzeltmesini sağlayabilir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada önerilen uyarlanabilir çok modlu etkileşim modeli bu endişeleri ele alır ve görme ve konuşma modalitelerini gerçek zamanlı kullanıcı uyum süreçleriyle sorunsuz birleştirerek insan-yapay zeka iş birliğini büyük ölçüde geliştirir. Temel hiyerarşik multimodal sistemin aksine, yaklaşımımız kişiselleştirilmiş bir geri bildirim döngüsü ve daha sezgisel ve bağlam farkında etkileşim sağlayan bilişsel yük farkında uyumu içerir. Nesne işleme, bileşen sunumu ve ardına dayalı hedef tamamlama ...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bulgular, önerilen uyarlanabilir çok modlu etkileşim temelinin insan-yapay zeka iş birliğini güçlendirmek için verimliliğini kesin olarak göstermektedir.

Görev Tamamlama Süresi (TCT), İnsan Niyeti Tahmin Doğruluğu (HIPA), Çok Modlu Birleşme Verimliliği (MFE), Hata Kurtarma Oranı (ERR), Kullanıcı Memnuniyeti Puası (USS) ve Etkileşim Akıcılığı Endeksi (ISI) gibi standart değerlendirme puanlarının yanı sıra, uyarlanabilir çok modlu çerçevelerin derinlemesine anal...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların çıkar çatışması yoktur.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, Çin'in Wuxi kentindeki Jiangnan Üniversitesi Tasarım Fakültesi'nin desteğini minnettarlıkla takdir ediyor.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
RGB-D Kamera (Intel RealSense D435)Intel CorporationD435Derinlik çözünürlüğü 1280 ve kez; 720 px @ 30 fps; RGB çözünürlük 1920 ve kez; 1080 px @ 30 fps; kullanıcı pozu, vücut hareketleri ve mekansal bağlamı yakalamak için kullanılır
Yönlü MikrofonGenel / Birden fazla satıcıYokGeniş bantlı, gürültü engelleyici mikrofon (16 kHz&ntir; 44.1 kHz); Konuşulan komutları toplamak için kullanılır
BlazePose (önceden eğitilmiş model)Googlehttps://developers.google.com/mediapipe/solutions/vision/pose33 anahtar noktaya sahip poz tahmin modeli; Gerçek zamanlı insan pozu çıkarımı
OpenPose (önceden eğitilmiş model)CMU Algısal Hesaplama Laboratuvarıhttps://github.com/CMU-Perceptual-Computing-Lab/openposeHareket yörüngelerini çıkarmak için kullanılan çok kişilik poz tahmin çerçevesi
DeepSpeech ASR MotoruMozillav0.9.3Konuşmadan metne transkripsiyon için önceden eğitilmiş otomatik konuşma tanıma modeli
wav2vec 2.0 ASR MotoruMeta AIhttps://github.com/facebookresearch/fairseqGerçek zamanlı konuşma işleme için kendi denetimli konuşma temsili modeli
Transformatör Tabanlı Eylem Tahmin Modeli (DLinear / Seq2Seq)Özel uygulamaYokKısa vadeli eylem tahmini için özel zamanlı kodlayıcı-kodlayıcı mimarisi
Dinamik Zaman Bükülmesi (DTW) ModülüÖzel / Bilim Temellihttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.htmlKullanıcı eylemlerini önceden tanımlanmış görev grafikleriyle eşleştirmek için yumuşak hizalama algoritması
Dikkat Odaklı Çok Modlu Füzyon AğıÖzel uygulamaYokGörme ve konuşma girdilerini birleştirmek için güven ağırlıklı dikkat mekanizması
Çevrimiçi Uyarlama Modülü (LoRA / Gradient tabanlı)Özel uygulamahttps://github.com/microsoft/LoRAKullanıcı davranışına uyum sağlamak için hafif, parametre açısından verimli ince ayar
Açıklanabilirlik Modülü (Kural Tabanlı + Dikkat Haritaları)Özel uygulamaYokKurallar ve dikkat görselleştirmeleri kullanarak yorumlanabilir karar gerekçesi sağlar
KINOVA Gen3 Robotik KolKINOVA RobotikGen3entegre tork sensörlerine sahip 7-DOF robotik manipülatör; İşbirlikçi oyuncak araba montajında kullanılıyor
Kooperatif Montaj Simülasyon OrtamıÖzel ortamYokMultimodal iş birliği kıyaslaması için kullanılan gerçek dünya oyuncak araba montaj kurulumu
Değerlendirme Metrikleri (TCT, HIPA, MFE, Latency, ERR, USS, ISI)Özel tanımlarYokİşbirliği verimliliği, doğruluğu ve güveni değerlendirmek için nicel ve kullanıcı odaklı metrikler

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaboration with robust plan recognition and trajectory prediction. IEEE Robot Autom Lett. 5, 2602-2609 (2020).
  3. Abuduweili, A., Li, S., Liu, C. Adaptable human intention and trajectory prediction for human-robot collaboration. arXiv. , (2019).
  4. Amirova, A., Rakhymbayeva, N., Yadollahi, E., Sandygulova, A., Johal, W. Ten years of human-NAO interaction research: A scoping review. Front Robot AI. 8, 744526(2021).
  5. Liu, R., Liu, C. Human motion prediction using adaptable recurrent neural networks and inverse kinematics. IEEE Control Syst Lett. 5, 1651-1656 (2021).
  6. Wang, T., Zhao, Y., Chen, L., Li, Q., Xu, Y., Zhang, H. Multimodal human-robot interaction for human-centric smart manufacturing: A survey. Adv Intell Syst. 6, 2300359(2024).
  7. Ergonomic adaptation of robotic movements in human-robot collaboration. van den Broek, M. K., Moeslund, T. B. Companion Proc. ACM/IEEE Int Conf Hum-Robot Interact, 2020, 499-501 (2020).
  8. Human-robot collaboration using multimodal perception. Yang, Y., et al. Proc IEEE Int Conf Robot Biomimetics (ROBIO), , 358-363 (2021).
  9. Sawadwuthikul, G., et al. Intelligent manufacturing with deep reinforcement learning. IEEE Trans Ind Inform. 18, 1883-1894 (2022).
  10. Multimodal robotic manipulation in collaborative tasks. Huang, W., Gu, J., Duan, P., Hou, S., Zheng, Y. Proc IEEE Int Conf Robot Autom (ICRA), , 14213-14219 (2021).
  11. Dellermann, D., et al. The future of human-AI collaboration: A taxonomy of design knowledge for hybrid intelligence systems. arXiv. , (2021).
  12. Ostheimer, J., Chowdhury, S., Iqbal, S. An alliance of humans and machines for machine learning: Hybrid intelligent systems and their design principles. Technol. Soc. 66, 101647(2021).
  13. Afsar, B., Al-Ghazali, B. M., Cheema, S., Javed, F. Cultural intelligence and innovative work behavior: The role of work engagement and interpersonal trust. Eur J Innov Manag. 24, 1082-1109 (2020).
  14. Spadaro, G., Gangl, K., Van Prooijen, J. W., Van Lange, P. A. M., Mosso, C. O. Enhancing feelings of security: How institutional trust promotes interpersonal trust. PLoS ONE. 15, e0237934(2020).
  15. Pavez, I., Gómez, H., Laulié, L., González, V. A. Project team resilience: The effect of group potency and interpersonal trust. Int J Proj Manag. 39, 697-708 (2021).
  16. Yuan, H., Long, Q., Huang, G., Huang, L., Luo, S. Different roles of interpersonal trust and institutional trust in COVID-19 pandemic control. Soc Sci Med. 293, 114677(2022).
  17. Yun, Y., Ma, D., Yang, M. Human-computer interaction-based decision support systems with applications in data mining. Future Gener Comput Syst. 114, 285-289 (2021).
  18. Nazar, M., Alam, M. M., Yafi, E., Su'ud, M. M. A systematic review of human-computer interaction and explainable artificial intelligence in healthcare. IEEE Access. 9, 153316-153348 (2021).
  19. Ho, Y. H., Tsai, Y. J. Open collaborative platforms for multi-drone search and rescue operations. Drones. 6, 132(2022).
  20. VAHAK: A blockchain-based outdoor delivery scheme using UAVs for healthcare 4.0 services. Gupta, R., et al. Proc IEEE INFOCOM Workshops, , 255-260 (2020).
  21. BloCoV6: A blockchain-based 6G-assisted UAV contact tracing scheme for COVID-19. Zuhair, M., Patel, F., Navapara, D., Bhattacharya, P., Saraswat, D. Proc 2nd Int Conf. Intell Eng Manag (ICIEM), , 271-276 (2021).
  22. Sahoo, S. K., et al. Intelligent trust-based utility and reusability model using UAV-assisted sensor networks. Appl Sci. 12, 1317(2022).
  23. Ko, Y., et al. Drone secure communication protocol for future sensitive military applications. Sensors. 21, 2057(2021).
  24. Gupta, R., Kumari, A., Tanwar, S., Kumar, N. Blockchain-envisioned softwarized multi-swarming UAVs to tackle COVID-19 situations. IEEE Netw. 35, 160-167 (2020).
  25. Tomsett, R., et al. Rapid trust calibration through interpretable and uncertainty-aware. Patterns. 1, 100049(2020).
  26. Huang, R., Zhou, H., Liu, T., Sheng, H. Multi-UAV collaboration to survey Tibetan antelopes in Hoh Xil. Drones. 6, 196(2022).
  27. Seeber, I., et al. Machines as teammates: A research agenda on AI in team collaboration. Inf Manag. 57, 103174(2020).
  28. Ajoudani, A., et al. Progress and prospects of the human-robot collaboration. Auton Robots. 42, 957-975 (2018).
  29. Oviatt, S., et al. The Handbook of Multimodal-Multisensor Interfaces, Volume 1: Foundations, User Modeling, and Common Modality Combinations. , Association for Computing Machinery. New York, NY, USA. (2017).
  30. Villani, V., Pini, F., Leali, F., Secchi, C. Survey on human-robot collaboration in industrial settings. Mechatronics. 55, 248-266 (2018).
  31. Nikolaidis, S., et al. Human-robot collaboration in manufacturing: Quantitative evaluation of predictable, convergent robot behavior. Auton Robots. 41, 123-140 (2017).
  32. Roggen, D., Junker, M., Transter, G., Roques, D. L. Collecting complex activity datasets in smart environments. J Ambient Intell Humaniz Comput. 1, 1-17 (2009).
  33. Bazarevsky, V., et al. BlazePose: On-device real-time body pose tracking. arXiv. , (2020).
  34. Garcia, S., Gomez-Donoso, F., Cazorla, M. Enhancing human-robot interaction: Development of a multimodal robotic assistant for user emotion recognition. Appl Sci. 14, 11914(2024).
  35. Li, S., et al. Toward proactive human-robot collaborative assembly: A multimodal transfer-learning-enabled action prediction approach. IEEE Trans Ind Electron. 69, 8579-8588 (2021).
  36. Abdelrahman, A. A., Almotiri, J., Yaseen, Q., Alanazi, A., Alotaibi, B. Multimodal engagement prediction in multiperson human-robot interaction. IEEE Access. 10, 61980-61991 (2022).
  37. Chiossi, F., et al. Designing intent: A multimodal framework for human-robot cooperation in industrial workspaces. arXiv. , (2025).
  38. McGrath, M. J., Chen, Y., Patel, A., Smith, J., Rao, V. Collaborative human-AI trust (CHAI-T): A process framework for active management of trust in human-AI collaboration. arXiv. , (2024).
  39. Fragiadakis, G., Nikas, C., Karageorgiou, E., Papadopoulos, A. Evaluating human-AI collaboration: A review and methodological framework. arXiv. , (2024).
  40. Younis, H. A., Khan, S., Raza, M., Ahmed, F., Mahmood, T. Multimodal age and gender estimation for adaptive human-robot interaction: A systematic literature review. Processes. 11, 1488(2023).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Adaptif er evelerPoz KestirimiKonu ma Komutu AnlamaNiyet ng r sTransformer ModelleriDikkat F zyonuDinamik Zaman B kmesiA klanabilir Yapay Zeka

İlgili makaleler