Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Sağlık Bilimleri / Halk Sağlığı / LLM Destekli Mobil Robotla Ev Ortamında Aktif Sağlık Değerlendirmesi ve Fiziksel Yardım
Bilgisayar Bilimi

LLM Destekli Mobil Robotla Ev Ortamında Aktif Sağlık Değerlendirmesi ve Fiziksel Yardım

Bu çalışma, yaşlı bireylerin evde sağlık izlemini pasif ölçüm cihazlarından aktif algılama ve fiziksel yardıma taşıyabilecek bir mobil robot sistemi geliştirmeyi incelemektedir.

04/08/2026  Veri Anla 42 görüntüleme
LLM Destekli Mobil Robotla Ev Ortamında Aktif Sağlık Değerlendirmesi ve Fiziksel Yardım

Bu çalışma, yaşlı bireylerin evde sağlık izlemini pasif ölçüm cihazlarından aktif algılama ve fiziksel yardıma taşıyabilecek bir mobil robot sistemi geliştirmeyi incelemektedir. Sistem; doğal dilde söylenen belirsiz sağlık yakınmalarını yorumlayan bir büyük dil modeli, görevleri güvenli ve belirlenimci biçimde yürüten sonlu durum makinesi, fiziksel güvenlik sınırları, uyarlamalı görüntü tabanlı görsel servo kontrol ve kan basıncı ölçümüne yardımcı olan görsel ankrajlı hareket stratejisini bir araya getirmiştir. Yirmi yaşlı gönüllünün katıldığı bir aylık saha çalışmasında görüntü edinme sürecinin nihai başarı oranı %95, kan basıncı ölçümüne yardım iş akışının başarısı %90'ın üzerinde ve genel uzun görev zinciri başarısı %70 olarak bildirilmiştir. Bununla birlikte çalışma hakem değerlendirmesinden geçmemiştir; klinik tanı doğruluğunu, tıbbi sonuçları veya sistemin gözetimsiz ev kullanımındaki uzun dönem güvenliğini kanıtlamamaktadır.

Robotun temel yaklaşımı, büyük dil modelini doğrudan motorlara komuta eden bir denetleyici olarak kullanmak yerine, dil modelinin çıktısını önceden tanımlanmış robot becerileriyle sınırlandırmaktır. “Başım dönüyor” gibi yapılandırılmamış bir ifade önce konuşma tanıma ve anlamsal çözümlemeden geçirilmekte, ardından bilgi erişimi destekli üretim sistemi sağlıkla ilgili görev olasılıklarını değerlendirmekte ve sonuç bir Plan JSON dizisine dönüştürülmektedir. Sonlu durum makinesi ile güvenlik korumaları, bu planı ancak kuvvet, hız, mesafe, iletişim ve cihaz durumu gibi fiziksel koşullar sağlandığında yürütmektedir.

Türkiye açısından anlamı ve gerekli uyarlamalar

Çalışmanın evde yaşlı bakımı, huzurevi hizmetleri, hareket kısıtlı bireylere ölçüm desteği ve bakım personelinin rutin iş yükünün azaltılması açısından Türkiye'ye uyarlanabilir bir mühendislik yaklaşımı bulunmaktadır. Ancak doğrudan uygulama için Türkçe konuşma tanıma sisteminin yaşlı bireylerin ses özellikleri, bölgesel ağızlar ve farklı konuşma hızlarıyla yeniden eğitilmesi gerekir. Çalışmada standart Mandarin konuşmasında %90'ın üzerinde bildirilen niyet tanıma başarısının güçlü bölgesel aksanlarda yaklaşık %50'ye düşmesi, Türkçe ve yerel ağız doğrulamasının zorunlu olduğunu göstermektedir.

Türkiye'de kullanılacak bir sürümün Türkçe acil durum ifadeleri, yerel bakım protokolleri, mahremiyet gereksinimleri, tıbbi cihaz bağlantıları ve yetkili sağlık personeline yönlendirme kurallarıyla ayrıca doğrulanması gerekir. Kan basıncı ölçümüne fiziksel olarak yardım eden robotun görevi tamamlaması, ölçülen değerin klinik doğruluğunu kendiliğinden kanıtlamaz. Bu nedenle sertifikalı referans cihazlarla ölçüm karşılaştırması, bağımsız güvenlik testleri, etik kurul değerlendirmesi, farklı ev tiplerinde saha çalışması ve çok merkezli kullanıcı deneyleri yapılmadan klinik veya yaygın ev kullanımı sonucu çıkarılamaz.

Araştırmanın temel problemi nedir?

Geleneksel ev tipi sağlık yönetiminde elektronik tansiyon cihazı, termometre ve benzeri araçlar genellikle kullanıcının ölçümü kendisinin başlatmasını, cihazı doğru yerleştirmesini ve sonucu yorumlamasını gerektirir. Hareket kısıtlı, görme veya işitme sorunu bulunan ya da bilişsel yükü azaltılması gereken yaşlı bireyler açısından bu yaklaşım önemli bir kullanım engeli oluşturabilir. Çalışma, sağlıkla ilgili bir yakınmayı anlayan, kullanıcıyı bulan, uygun ölçüm görevini başlatan, görüntüleme koşullarını düzelten ve fiziksel ölçüm cihazına erişimi kolaylaştıran bütünleşik bir robot geliştirmeyi hedeflemektedir.

Araştırmacılar üç mühendislik boşluğuna odaklanmıştır:

  • “Başım dönüyor” gibi belirsiz doğal dil ifadelerinin güvenli ve uygulanabilir robot görevlerine dönüştürülmesi.
  • Büyük dil modellerinin olası halüsinasyonlarının insan bedenine yakın çalışan bir robotta tehlikeli harekete dönüşmesinin engellenmesi.
  • Ev içi haritalama sistemlerinin santimetre ölçeğindeki konum hatalarına rağmen yüz, ağız ve kol gibi hedeflere hassas biçimde yaklaşılması.

Sistem hangi bileşenlerden oluşmaktadır?

Robotun fiziksel yapısı hareketli bir taban, altı serbestlik dereceli işbirlikçi robot kolu, RGB-D kamera, LiDAR, mikrofon dizisi, görünür ışık kamerası, uzun dalga kızılötesi kamera, kuvvet-tork algılama bileşenleri ve gövdeye yerleştirilmiş silindir biçimli bir kan basıncı ölçüm cihazından oluşmaktadır. Esnek bir manşeti robot eliyle kullanıcının koluna sarmak yerine, kullanıcının kolunu sabit bir silindir içine uzatması istenmiştir. Bu tercih, esnek malzeme manipülasyonunun karmaşıklığını azaltmakta; ancak kullanıcının verilen sesli yönlendirmeyi anlayıp kolunu uygun konuma getirebilmesini gerektirmektedir.

Şekil 1, hareketli taban, robot kolu, algılama başlığı ve tıbbi yüklerin fiziksel prototip üzerindeki yerlerini göstermektedir. Görselde çevre izleme sensörü, mikrofon dizisi, iki ve üç boyutlu kameralar, kızılötesi kamera, LED dolgu ışığı, kuvvet kontrol modülü, ses tanıma birimi, ana etkileşim ekranı ve çeşitli haberleşme kartları ayrı ayrı işaretlenmiştir. Şekil 2 ise görsel, kuvvet ve ses verilerinin uç bilişim denetleyicisinde birleştirilmesini; hareket komutlarının ROS 2 üzerinden tabana ve kola iletilmesini; üst düzey dil modeli işlemlerinin bulut bağlantısıyla yürütülmesini açıklamaktadır.

Bulut-uç mimarisi nasıl çalışmaktadır?

Yazılım mimarisi dört katmanlıdır:

  1. Etkileşim katmanı: Kullanıcı konuşmasını otomatik konuşma tanıma sistemiyle metne ve yapılandırılmış niyete dönüştürür.
  2. Orkestrasyon katmanı: Büyük dil modeli, sistem yönergeleri, bilgi erişimi destekli üretim veritabanı ve beceri kayıt defterini kullanarak görev planı oluşturur.
  3. Yürütme katmanı: Plan JSON içindeki görevleri sonlu durum makinesiyle sıralar ve her hareketi güvenlik korumalarından geçirir.
  4. ROS 2 ve donanım katmanı: Navigasyon, görsel takip, robot kolu kontrolü ve kan basıncı cihazı gibi fiziksel düğümleri çalıştırır.

Şekil 3'te kullanıcı sesinin önce konuşma tanıma birimine, ardından LLM planlama çekirdeğine, sonlu durum makinesine ve fiziksel donanıma aktarılması gösterilmektedir. Şekil 4, bu süreci daha ayrıntılı biçimde üç parçaya ayırmaktadır: sisteme verilen güvenlik ve görev yönergeleri, LLM tarafından üretilen Plan JSON ve her becerinin giriş parametreleri, ön koşulları ile güvenlik sınırlarını tanımlayan Beceri Kayıt Defteri.

Beceri Kayıt Defteri neden önemlidir?

Büyük dil modeli serbest biçimli motor komutları üretmemektedir. Bunun yerine align_face_ibvs, incremental_move, measure_bp ve capture_face_rgb gibi önceden tanımlanmış becerileri çağırabilmektedir. Her beceri için gerekli hedef, hassasiyet, ön koşul ve fiziksel güvenlik sınırı belirlenmiştir. Örneğin yüz hizalama becerisinin çalışabilmesi için yüzün kameranın görüş alanında bulunması; kan basıncı ölçüm becerisinde ise temas kuvvetinin 5 N sınırının altında tutulması gerekmektedir.

Bu ayrım, olasılıksal dil modelini fiziksel sistemin güvenlik sorumluluğundan ayırmaktadır. LLM hangi becerilerin hangi sırayla çağrılacağını önermekte, ancak motor hızları, kuvvet kesme koşulları, çarpışma denetimi ve geri çekilme hareketleri belirlenimci denetleyiciler tarafından yürütülmektedir.

Fiziksel güvenlik korumaları nelerdir?

Çalışmada tanımlanan temel korumalar aşağıdaki tabloda özetlenmiştir:

Güvenlik mekanizmasıİzlenen riskTetikleme ve sistem tepkisi
Kuvvet kesmeRobot kolunun kullanıcıyla sert çarpışmasıTemas kuvveti 5 N değerini aşarsa acil durdurma ve geri çekilme yörüngesi
Yakınlık hız sınırıYüze yakın bölgede aşırı uç-efektör hızıYüz ile uç-efektör mesafesi 30 cm'nin altındaysa doğrusal hız 0,02 m/s altında tutulur
Kartezyen çalışma alanı sınırıKolun baş veya kritik vücut bölgelerine girmesiÖnceden tanımlanan dışlama bölgelerine giren hareket planı reddedilir
Tekillikten kaçınmaRobot eklemlerinde aşırı hız veya titreşimJacobian koşul sayısı eşik değere yaklaşınca sönümlü en küçük kareler yöntemiyle hareket yavaşlatılır veya durdurulur
Öz çarpışma tahminiKolun robot gövdesine, ekrana veya kameraya çarpmasıTahmin edilen parça mesafesi yaklaşık 2 cm güvenlik payının altına düşerse hareket kesilir
Denetleyici haberleşme bekçisiÜst düzey yazılımın çökmesiyle motorların kontrolsüz kalması50 ms içinde kalp atışı mesajı alınmazsa motor sürücüleri devre dışı bırakılır
Tıbbi cihaz bağlantı bekçisiManşet şişikken Bluetooth veya seri bağlantının kesilmesi100 ms'den uzun iletişim kaybında donanımsal hızlı tahliye valfi manşeti söndürür

Kan basıncı cihazı şişirme veya ölçüm durumundayken hareketli taban ile robot kolunun bütün hareket serbestlikleri sürücü düzeyinde kilitlenmektedir. Şişirme başlamadan önce Bluetooth bağlantı gecikmesinin 100 ms'nin altında olması, kullanıcının kolunun silindire tam girdiğinin görsel ve fotoelektrik algılayıcılarla doğrulanması ve robotun ataletsel ölçüm birimine göre hareketsiz bulunması gerekmektedir.

Bu mekanizmalar güvenlik tasarımının önemli parçalarıdır; ancak çalışmada bağımsız bir güvenlik sertifikası, kapsamlı tehlike analizi, başarısızlık türleri ve etkileri analizi veya resmî ISO uygunluk belgesi sunulmamıştır. Bu nedenle mekanizmalar, prototipte tanımlanan ve yazarlarca test edildiği bildirilen korumalar olarak değerlendirilmelidir.

Kaba konumlandırma nasıl yapılmaktadır?

Robot önce küresel harita ve LiDAR tabanlı navigasyonla kullanıcının bulunduğu bölgeye yaklaşmaktadır. Kullanıcının yüzü algılandıktan sonra yüz sınırlayıcı kutusunun görüntüdeki yüksekliği, yaklaşık hedef uzaklığını hesaplamak için kullanılmaktadır. Kamera iç parametre matrisi şöyledir:

\[ K = \begin{bmatrix} f_x & 0 & c_x \\ 0 & f_y & c_y \\ 0 & 0 & 1 \end{bmatrix} \]

Burada \(f_x\) ve \(f_y\), piksel cinsinden yatay ve düşey odak uzaklıklarını; \(c_x\) ve \(c_y\) görüntünün asal noktasını belirtmektedir. Görüntüde ölçülen yüz yüksekliği \(h\), kabul edilen gerçek yüz yüksekliği \(H\) ve hedef uzaklığı \(Z\) arasındaki ilişki şu şekilde kurulmuştur:

\[ Z = \frac{f_y H}{h} \]

\(H\) metre, \(h\) piksel ve \(f_y\) piksel olarak kullanıldığında \(Z\) metre cinsinden yaklaşık uzaklıktır. Yüz görüntüde büyüdükçe hesaplanan uzaklık azalır. Bununla birlikte çalışmada kullanılan antropometrik \(H\) değerinin ne olduğu ve farklı yüz boyutlarına nasıl uyarlandığı açıklanmamıştır.

Hedefin kamera koordinatları ve yatay yön sapması aşağıdaki ilişkilerle hesaplanmaktadır:

\[ X = \frac{Z(u-c_x)}{f_x}, \qquad Y = \frac{Z(v-c_y)}{f_y}, \qquad \theta = \arctan\left(\frac{u-c_x}{f_x}\right) \]

\(u\) ve \(v\), yüz merkezinin görüntü koordinatlarıdır. \(X\), \(Y\) ve \(Z\) metre cinsinden yaklaşık konumu; \(\theta\) ise radyan veya dereceye dönüştürülebilen yatay açı sapmasını temsil eder.

Hareketli tabanın doğrusal ve açısal hızı oransal bir denetim yasasıyla belirlenmektedir:

\[ v = k_z(Z-Z^*), \qquad \omega = k_\theta \theta \]

İstenen durma uzaklığı \(Z^*=1,0\) m olarak seçilmiştir. \(k_z\) ve \(k_\theta\) oransal kazançlardır. Sistem bu aşamada kullanıcıyı robot kolunun yaklaşık 0,8-1,2 m aralığındaki çalışma bölgesine taşımayı amaçlamaktadır.

Uyarlamalı görüntü tabanlı görsel servo kontrol nasıl çalışmaktadır?

Kaba navigasyonun santimetre ölçeğindeki hataları, yüz veya ağız görüntüsü için yeterli görülmemiştir. İnce hizalamada görüntüdeki hedef noktalarının mevcut konumu ile istenen konumu arasındaki hata doğrudan robot kolunun hareketine dönüştürülmektedir.

Görüntü özellik vektörü \(\mathbf{s}\) ile kameranın altı boyutlu uzamsal hızı \(\mathbf{v}_c\) arasındaki temel ilişki şöyledir:

\[ \dot{\mathbf{s}} = \mathbf{L}_s(\mathbf{s},Z,\boldsymbol{\theta}_{cam})\mathbf{v}_c \]

\(\mathbf{L}_s\), görüntü Jacobianı veya etkileşim matrisi olarak adlandırılır. Klasik yöntemde bu matris kamera iç parametrelerine ve hedef derinliğine bağlı olarak analitik hesaplanır. Ev ortamında odak uzaklığı, derinlik tahmini ve el-göz kalibrasyonundaki hatalar bu matrisi bozabileceği için araştırmacılar Jacobianı çevrim sırasında güncellemiştir.

Broyden çevrim içi Jacobian güncellemesi

Tahmin edilen Jacobian aşağıdaki Broyden güncellemesiyle yenilenmektedir:

\[ \hat{\mathbf{L}}_{k+1} = \hat{\mathbf{L}}_k + \alpha \frac{\left(\Delta\mathbf{s}_k-\hat{\mathbf{L}}_k\Delta\mathbf{X}_{c,k}\right)\Delta\mathbf{X}_{c,k}^{T}}{\Delta\mathbf{X}_{c,k}^{T}\Delta\mathbf{X}_{c,k}+\delta} \]

\(\Delta\mathbf{s}_k\), iki kontrol çevrimi arasındaki görüntü özelliği değişimini; \(\Delta\mathbf{X}_{c,k}\), kameranın gerçekleşen öteleme ve dönme artışını; \(\alpha\), yeni gözleme verilen ağırlığı belirleyen unutma katsayısını; \(\delta\) ise paydanın sıfıra yaklaşmasını önleyen küçük sönümleme terimini temsil eder. Formül, tahmin edilen görüntü hareketi ile gözlenen görüntü hareketi arasındaki hatayı küçültmeye çalışmaktadır.

İlk Jacobian, yaklaşık derinlik ve odak uzaklığıyla şu biçimde kurulmaktadır:

\[ \mathbf{L}_0 = \begin{bmatrix} -\frac{f}{Z} & 0 & \frac{u}{Z} & \frac{uv}{f} & -\frac{f^2+u^2}{f} & v \\ 0 & -\frac{f}{Z} & \frac{v}{Z} & \frac{f^2+v^2}{f} & -\frac{uv}{f} & -u \end{bmatrix} \]

Başlangıç matrisi hatalı olsa bile sonraki kamera hareketleri ile görüntü değişimleri kullanılarak yerel modelin düzeltilmesi hedeflenmektedir. Ancak deneylerde kullanılan \(\alpha\) ve \(\delta\) değerleri açıkça verilmemiştir. Metinde Broyden güncellemesine yapılan bir atıf “Eq. X” biçiminde tamamlanmamış yer tutucu olarak kalmıştır.

Kontrol yasası ve hareket doygunluğu

Görüntü hatası \(\mathbf{e}=\mathbf{s}-\mathbf{s}^*\) olarak tanımlandığında kamera hızı şu şekilde hesaplanmaktadır:

\[ \mathbf{v}_c = -\lambda \hat{\mathbf{L}}_k^{+}\mathbf{e} \]

\(\hat{\mathbf{L}}_k^{+}\), tahmin edilen Jacobianın Moore-Penrose sözde tersidir; \(\lambda\) ise hata azaltma hızını belirleyen kazançtır. Denetim ayrık konum artışına çevrildiğinde:

\[ \Delta\mathbf{x}_{c,k} = -\eta \hat{\mathbf{L}}_k^{+}\mathbf{e}_k, \qquad \eta=\lambda\Delta t \]

\(\eta\), örnekleme süresi ile denetim kazancının çarpımından oluşan boyutsuz adım katsayısıdır. Görüntü algılamasında büyük hata oluştuğunda robot kolunun ani sıçrama yapmasını önlemek için konum artışının normu sınırlandırılmaktadır:

\[ \|\Delta\mathbf{x}_{c,k}\| > \delta_{max} \Rightarrow \Delta\mathbf{x}_{c,k} \leftarrow \delta_{max}\frac{\Delta\mathbf{x}_{c,k}}{\|\Delta\mathbf{x}_{c,k}\|} \]

Çalışmada örnek azami çevrim hareketi \(\delta_{max}=5\) cm olarak verilmiştir. Bu değer tüm yönlerde aynı Öklid normu sınırını uygular. Güvenli Kartezyen hareket daha sonra robot eklem hareketine dönüştürülür:

\[ \Delta\mathbf{q}_{joint} = \mathbf{J}_{robot}^{-1}(\mathbf{q})\mathbf{T}_{c}^{e}\Delta\mathbf{x}_{c,k} \]

\(\mathbf{J}_{robot}\) robot kolunun kinematik Jacobianını, \(\mathbf{T}_{c}^{e}\) kamera ile uç-efektör arasındaki el-göz dönüşümünü ve \(\Delta\mathbf{q}_{joint}\) eklem açı değişimlerini temsil etmektedir.

Görünür ışık ve kızılötesi kamera nasıl eşleştirilmektedir?

Kızılötesi görüntüler düşük çözünürlüklü ve doku bakımından zayıf olduğundan, yüz anahtar noktaları görünür ışık kamerasında belirlenmektedir. Görünür kamera hedefe hizalandıktan sonra iki kameranın uç-efektöre göre önceden kalibre edilmiş dönüşümleri kullanılarak kızılötesi kameranın yeni konumu hesaplanmaktadır:

\[ \mathbf{T}_{e2}^{b} = \mathbf{T}_{e1}^{b}\mathbf{T}_{v}^{e}\mathbf{T}_{target}^{v} \left(\mathbf{T}_{target}^{th}\right)^{-1} \left(\mathbf{T}_{th}^{e}\right)^{-1} \]

Bu kinematik zincir, görünür kameranın gördüğü yüz bölgesini kızılötesi kameranın görüş alanına taşımayı amaçlamaktadır. Araştırmacılar robot kolunun ±0,02 mm tekrarlanabilirlik değerine dayanarak iki görüntü türü arasında hassas uzamsal kayıt sağlandığını belirtmektedir. Ancak çalışmada bu çok kipli eşleştirmenin bağımsız kayıt hatası dağılımı veya insan üzerinde sıcaklık ölçüm doğruluğu verilmemiştir.

Görüntü kalitesi kapalı çevrimi nedir?

Sistem yalnızca hedefi görüntünün merkezine getirmekle yetinmemekte; netlik, ışık ve hedef bölgenin kadraja sığması için birleşik bir kalite puanı hesaplamaktadır:

\[ Q_{score} = w_1 I_{clarity} + w_2 I_{light} + w_3 I_{complete} \]

\(I_{clarity}\), Laplasyen varyansıyla bulanıklık veya odak durumunu; \(I_{light}\), görüntünün Y kanalı histogramıyla pozlamayı; \(I_{complete}\), hedef bölgenin görüş alanı içinde kalmasını kesişim-birleşim oranıyla değerlendirmektedir. \(w_1\), \(w_2\) ve \(w_3\) bu bileşenlerin ağırlıklarıdır.

Kalite puanı 90'ın altında kaldığında robot iki tür düzeltme uygulamaktadır:

  • Netlik düşükse kamera optik eksen boyunca 2-5 mm'lik adımlarla ileri veya geri hareket ettirilir.
  • Pozlama yetersizse uç-efektördeki LED aydınlatmanın görev çevrimi %10'luk artışlarla yükseltilir.

Şekil 5, içte Broyden güncellemeli kinematik kontrol çevrimi ve dışta görüntü kalite değerlendirmesi bulunan iki çevrimli yapıyı göstermektedir. Bununla birlikte \(Q_{score}\) bileşenlerinin ölçeği, ağırlıkların sayısal değerleri ve 90 eşiğinin nasıl belirlendiği incelenen sürümde açıklanmamıştır. Bu eksiklik yöntemin başka bir laboratuvarda aynı biçimde yeniden kurulmasını zorlaştırmaktadır.

Görsel ankraj ve öğretilmiş hareket dizisi nasıl çalışmaktadır?

Küresel eşzamanlı konumlandırma ve haritalama sisteminde iç mekân hatasının ±5 cm'yi aşabildiği belirtilmiştir. Kan basıncı cihazını kullanıcının koluna yaklaştırmak için yüz, yerel ve kolay algılanabilir bir görsel ankraj olarak seçilmiştir. Robot yüzü görüntü merkezine getirdiği anda yerel koordinat sistemini sıfırlamakta ve sonraki hareketi küresel harita yerine bu başlangıç durumuna göre yürütmektedir.

Bir operatör, yüz hizalı başlangıç konumundan kol ile kan basıncı cihazının hizalandığı son konuma kadar robotu önceden yönlendirmektedir. Hareket artışları 5 Hz hızında kaydedilmektedir:

\[ T=\{(\Delta x_1,\Delta\theta_1),(\Delta x_2,\Delta\theta_2),\ldots,(\Delta x_n,\Delta\theta_n)\} \]

Çevrim içi kullanımda yüz yeniden hizalandıktan sonra bu hareket dizisi açık çevrim olarak oynatılmaktadır:

\[ x_k=x_{k-1}+\Delta x_k\cos(\theta_{k-1}) \]

\[ y_k=y_{k-1}+\Delta x_k\sin(\theta_{k-1}) \]

\[ \theta_k=\theta_{k-1}+\Delta\theta_k \]

Bu yöntem kısa mesafedeki odometri doğruluğundan yararlanmakta ve küresel harita sürüklenmesini azaltmaktadır. Bununla birlikte son bölüm açık çevrimdir; kullanıcının yüzü hizalama sonrasında belirgin biçimde hareket ederse doğrudan kol takibi yapan sürekli kapalı çevrimli bir düzeltme tanımlanmamıştır. Çalışma başarısını, kullanıcının görece sabit oturduğu ve sesli yönlendirmeye küçük kol hareketleriyle katıldığı denemelerde bildirmiştir.

Şekiller ve grafikler ne göstermektedir?

  • Şekil 1: Robot prototipindeki algılama, hareket, aydınlatma, iletişim ve kullanıcı arayüzü bileşenlerinin yerleşimini göstermektedir.
  • Şekil 2: Sensörlerden uç bilişime, ROS 2 iletişim ağına ve eyleyicilere uzanan elektriksel veri akışını göstermektedir.
  • Şekil 3: Kullanıcı konuşmasından LLM planlamasına, sonlu durum makinesine ve fiziksel yürütmeye uzanan dört katmanı açıklamaktadır.
  • Şekil 4: Sistem yönergesi ve RAG bağlamının Plan JSON'a, Plan JSON'un da güvenlik sınırları tanımlanmış robot becerilerine dönüştürülmesini göstermektedir.
  • Şekil 5: Görüntü hatası, çevrim içi Jacobian tahmini, hareket doygunluğu, ters kinematik ve kalite puanı arasındaki çift kapalı çevrimi göstermektedir.
  • Şekil 6: “Başım dönüyor” komutundan ses kaynağının bulunmasına, yüze yaklaşmaya, yüz ve ağız görüntüsü almaya, kan basıncı cihazını konumlandırmaya ve sonuç üretmeye uzanan altı fiziksel aşamayı göstermektedir.
  • Şekil 7: Baş dönmesi ifadesinin bilgi erişimli LLM tarafından kan basıncı kontrolü görevine dönüştürülmesini ve verinin geri beslenmesini örnekleyen bir sıralama diyagramıdır.
  • Şekil 8: Düşük kazançta \(\eta=0,05\) için görüntü hatalarının aşım yapmadan yavaş ve tekdüze biçimde azaldığını; yanlış parametrelerin uzamsal yolu eğrileştirdiğini göstermektedir.
  • Şekil 9: \(\eta=0,5\) değerinde başlangıç hatasının büyük kısmının ilk birkaç çevrimde giderildiğini ve test edilen grupların 3-7 çevrim içinde yakınsadığını göstermektedir.
  • Şekil 10: Sabit Jacobian ile uyarlamalı Jacobianı karşılaştırmakta; uyarlamalı yöntemin 1-2 güncellemeden sonra odak uzaklığının eksik veya fazla tahmin edilmesinden kaynaklanan yavaşlık ve aşım eğilimini azalttığını göstermektedir.

Şekil 8-10'daki sonuçlar fiziksel prototip üzerinde değil, mekanik çarpışma riskini önlemek amacıyla kurulmuş sayısal benzetimlerde elde edilmiştir. Bu nedenle grafikler algoritmanın test edilen model ve bozucu parametreler altındaki davranışını desteklemekte; bütün ev koşullarında kararlılığı veya çarpışmasız çalışmayı tek başına kanıtlamamaktadır.

Çalışmanın desteklediği sonuçlar

  • LLM çıktısının beceri kayıt defteri, sonlu durum makinesi ve fiziksel güvenlik sınırlarıyla ayrılması uygulanabilir bir güvenlik mimarisi sunmaktadır.
  • Uyarlamalı IBVS, test edilen kamera parametresi hatalarında sabit parametreli yönteme göre daha hızlı yakınsama göstermiştir.
  • Kalite geri beslemesi, açık çevrim görüntü edinme başarısını bildirilen %72 düzeyinden %95'e çıkarmıştır.
  • Yüzü yerel referans olarak kullanan hareket stratejisi, cihaz-kol hizalama hatasını geleneksel küresel navigasyondaki 10 cm'nin üzerindeki değerden 2 cm'nin altına indirmiştir.
  • Standart Mandarin konuşmasında sistemin doğal dil niyetlerini işleyebildiği ve çok aşamalı görev planları üretebildiği gösterilmiştir.

Çalışmanın kanıtlamadığı sonuçlar

  • Sistem, hastalık tanısı koyma veya baş dönmesinin nedenini belirleme doğruluğu açısından değerlendirilmemiştir.
  • Yüz ve dil görüntülerinin klinik tanı doğruluğu, hekim değerlendirmesi veya referans testlerle karşılaştırılmamıştır.
  • Kan basıncı iş akışının tamamlanması ölçüm cihazının tıbbi doğruluğunun doğrulandığı anlamına gelmez.
  • Bir aylık saha testi, yıllar süren gözetimsiz ev kullanımında güvenlik veya dayanıklılık kanıtı değildir.
  • Yirmi gönüllünün sonuçları farklı ülkelerdeki, dillerdeki ve sağlık durumlarındaki bütün yaşlı nüfusa genellenemez.
  • Çalışma bakım personeli iş yükünün, hastane başvurularının veya sağlık maliyetlerinin azaldığını göstermemiştir.
  • Özette bildirilen %90 güvensiz talimat engelleme oranı için test edilen talimat sayısı, risk sınıfları, yanlış kabul ve yanlış ret oranları açıklanmamıştır.

Çalışmanın Yöntemi ve Bulguları

Deney düzeni ve katılımcılar

Yöntem öğesiÇalışmada bildirilen özellikYorum sınırı
Saha süresiYaşlı bakım tesisinde bir ayUzun dönem ev kullanımı veya yıllık dayanıklılık gösterilmemiştir
Katılımcı sayısı20 yaşlı gönüllüÖrneklem küçük ve tek tesisle sınırlıdır
YaşOrtalama 72,5; standart sapma 4,8 yılYaş aralığı ve yaşa göre alt grup analizi verilmemiştir
OrtamlarYatak odası, oturma odası ve ortak etkinlik alanlarıBağımsız konut çeşitliliği ayrıntılı tanımlanmamıştır
Çevresel değişkenlerHareketli personel, sandalyeler, kapılar, doğal-yapay ışık geçişleri ve arka plan gürültüsüHer koşulun deneme sayısı ve zorluk düzeyi ayrı raporlanmamıştır
Katılımcı özellikleriFarklı aksanlar, boylar, vücut tipleri ve hipertansiyon veya hareket kısıtlılığı gibi durumlarCinsiyet dağılımı, dahil etme-dışlama ölçütleri ve sağlık durumuna göre sonuçlar verilmemiştir
Etik süreçTesis yönetiminin izni ve sözlü bilgilendirilmiş onamAdı belirtilen bağımsız etik kurul veya onay numarası bulunmamaktadır

Robot ve işlem altyapısı

  • LiDAR destekli hareketli taban ve diferansiyel sürüş mekanizması.
  • Altı serbestlik dereceli işbirlikçi robot kolu.
  • RGB-D kamera, 4K görünür ışık kamerası ve uzun dalga kızılötesi kamera.
  • 360 derece ses kaynağı belirlemeyi destekleyen mikrofon dizisi.
  • NVIDIA Jetson Orin sınıfı uç bilişim platformu, Ubuntu ve ROS 2.
  • CAN veya EtherCAT ile düşük düzey hareket denetimi; BLE, RS-232 ve USB ile tıbbi cihaz iletişimi.
  • Gövdeye bütünleştirilmiş silindir tipi kan basıncı ölçüm cihazı.

Donanım açıklamasında robot kolu örneği JAKA Zu 5 olarak verilirken sayısal benzetim bölümünde JAKA Zu 7 kinematik modeli kullanılmıştır. Bu değişikliğin neden yapıldığı ve fiziksel prototip ile benzetim arasındaki farkın sonuçları nasıl etkilediği açıklanmamıştır.

Temel performans sonuçları

Ölçülen değişkenBildirilen sonuçSonucun kapsamı
LLM planlama gecikmesi2000 ms; standart sapma 280 msKullanıcı niyetinin çıkarılmasından Plan JSON'un gönderilmesine kadar
Uzun görev zinciri başarısı%70Navigasyon, konuşma ve manipülasyonu birlikte içeren bileşik görevler
İstisna sonrası geri dönüşOrtalama 5 saniyeGüvenlik korumasının tetiklenmesinden sistem durumunun geri alınmasına kadar
Standart Mandarin niyet tanıma%90'ın üzerinde500'den fazla günlük konuşma testi
Güçlü bölgesel aksanlarda başarıYaklaşık %50Ön uç konuşma tanıma sisteminin belirgin sınırlılığı
Kaba hedef yakalama%80Aşırı aydınlatma ve ağır örtülmede başarısızlıklar bildirilmiştir
İnce hizalama uzaklık hatası10 mm'nin altındaYüz hedefi ile uç-efektör arasındaki eksenel hata
İnce hizalama açı hatası1,5 derecenin altındaYaw yönelimi
İnce hizalama süresiOrtalama 2,6 saniyeNormal parametre koşulları
%30 odak uzaklığı hatasında yakınsamaYaklaşık 7 çevrim ve 10 saniyeÇevrim içi Jacobian uyarlamasıyla
Toplam görüntü edinme süresiOrtalama 30 saniyeKaba yaklaşma, ince hizalama ve kalite düzeltmeleri dahil
Açık çevrim görüntü başarısı%72Kalite geri beslemesi öncesi
Kapalı çevrim nihai görüntü başarısı%95LED ve Z ekseni düzeltmeleri sonrası
Ortalama görüntü kalite artışı%30Sabit kamera çekimine göre; ölçüm ölçeğinin ayrıntısı verilmemiştir
Görsel ankraj sonrası konum hatası2 cm'nin altındaKüresel harita yaklaşımındaki 10 cm'nin üzerindeki hataya karşı
Kan basıncı ölçümüne yardım başarısı%90'ın üzerindeKullanıcının görece sabit oturduğu 500'den fazla deneme

Tablodaki oranlar farklı alt görevleri ifade etmektedir. %95 değeri kaliteli görüntü edinimini, %90'ın üzerindeki değer kan basıncı cihazına fiziksel yönlendirme iş akışını ve %70 değeri navigasyon, konuşma ve manipülasyonun tamamını içeren uzun görev zincirini göstermektedir. Özet ve sonuç bölümünde ayrıca %92 “uçtan uca başarı” bildirilmiş; ancak bu değerin hesaplandığı deneme havuzu, başarı tanımı ve %70 görev zinciri oranıyla ilişkisi açıklanmamıştır.

Uyarlamalı kontrol benzetimi

Parametre dayanıklılığı deneylerinde gerçek odak uzaklığının %70'i ve %130'u başlangıç değeri olarak kullanılmış, ilk derinlik tahminine ayrıca %20 hata eklenmiştir. Düşük kazançlı \(\eta=0,05\) koşulunda bütün gruplar yavaş ve aşım oluşturmayan bir yakınsama göstermiştir. Daha yüksek \(\eta=0,5\) koşulunda başlangıç görüntü hatasının yaklaşık %90'ı ilk 1-2 çevrimde azaltılmış ve test edilen gruplar 3-7 çevrim içinde kararlı duruma ulaşmıştır.

Sabit Jacobian ile uyarlamalı Jacobian karşılaştırmasında, odak uzaklığının düşük tahmin edildiği durumda uyarlamalı yöntem ilk güncellemelerden sonra aşırı kazancı düzeltmiş; yüksek tahmin edildiği durumda ise sabit yöntemin uzun kuyruklu yavaş yakınsamasını azaltmıştır. Bu sonuçlar, Broyden güncellemesinin test edilen parametre bozulmalarına karşı yararlı olduğunu göstermektedir. Ancak deneyler sayısal benzetimdir ve “sıfırdan, kalibrasyonsuz kullanım” iddiasının farklı kameralar, robotlar ve gerçek kullanıcı hareketleri altında ayrıca doğrulanması gerekir.

İstatistiksel değerlendirme

Çalışmada yaş ve planlama gecikmesi için ortalama ile standart sapma verilmiştir. Bunun dışında güven aralığı, p değeri, etki büyüklüğü, örneklem gücü, rastgeleleştirme veya körleme raporlanmamıştır. Metinde başarı oranının “anlamlı biçimde” yükseldiği ifade edilse de %72 ile %95 arasındaki fark için bir istatistiksel anlamlılık testi sunulmamıştır. Denemelerin aynı kullanıcılar üzerinde tekrarlanması nedeniyle gözlemlerin bağımsızlığı ve kişi başına düşen deneme sayısı da açıklanmamıştır.

Çalışmanın güçlü yönleri

  • Dil modeli, güvenlik ve fiziksel kontrol sorumluluklarını katmanlara ayıran açık bir mimari sunması.
  • Algılama kalitesini robot hareketi ve aydınlatmayla kapalı çevrimde iyileştirmesi.
  • Küresel harita hatasını insan bedenine bağlı yerel bir görsel referansla azaltması.
  • Sadece laboratuvar benzetimiyle yetinmeyip yaşlı bakım tesisinde fiziksel prototip denemesi yapması.
  • Standart konuşma ile bölgesel aksan arasındaki performans farkını açıkça bildirmesi.
  • Kuvvet, hız, çarpışma, iletişim ve tıbbi cihaz arızası için birden fazla bağımsız güvenlik katmanı tanımlaması.

Temel sınırlılıklar

  • Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.
  • Katılımcı sayısı 20 ve saha süresi yalnızca bir aydır.
  • Klinik tanı doğruluğu veya kan basıncı ölçüm doğruluğu referans yöntemle karşılaştırılmamıştır.
  • Yüz ve dil görüntülerinin tıbbi anlamı için hekim değerlendirmesi, duyarlılık, özgüllük veya tanısal AUC verilmemiştir.
  • Görev başarı oranları arasında %70, %90'ın üzeri, %92 ve %95 değerleri bulunmakta; ortak payda ve başarı tanımları tam açıklanmamaktadır.
  • Özetteki %90 güvensiz talimat engelleme oranının deney ayrıntıları raporlanmamıştır.
  • \(Q_{score}\) ağırlıkları, bazı denetim kazançları ve eşik belirleme yöntemi verilmemiştir.
  • Donanım açıklaması ile benzetim modelindeki robot kolu modeli farklıdır.
  • Güçlü aksanlarda konuşma tanıma başarısı yaklaşık yarıya düşmüştür.
  • Kod, ham veri, deneme günlükleri ve yeniden üretim paketi incelenen sürümde paylaşılmamıştır.
  • Bağımsız etik kurul adı veya etik onay numarası belirtilmemiştir.
  • Yazarların ISO 13482 uygunluğu ifadesini destekleyen bağımsız sertifikasyon belgesi sunulmamıştır.
  • Bulut tabanlı dil modeli kullanımı gecikme, bağlantı sürekliliği ve görsel-sağlık verilerinin mahremiyeti açısından ek doğrulama gerektirmektedir.

Kaynak ve Yöntem Notu

Çalışmanın tam özgün adı: Active Visual Health Assessment and Physical Assistance in Unstructured Home Environments via an LLM-Driven Mobile Manipulator

Yazarlar: Ziqi Wang; Bruce Qing Tang; Chang Liu; Changqing Liu; Shuaiyu Wang.

Yazar sıralaması ve kurumlar:

  • Ziqi Wang — School of Mechanics and Engineering Science, Peking University, Beijing, Çin.
  • Bruce Qing Tang — Tianjin ENNEW Generalist Technology Co., Ltd., Tianjin, Çin.
  • Chang Liu — School of Mechanics and Engineering Science, Peking University, Beijing, Çin.
  • Changqing Liu — Tianjin ENNEW Generalist Technology Co., Ltd., Tianjin, Çin.
  • Shuaiyu Wang — Tianjin ENNEW Generalist Technology Co., Ltd., Tianjin, Çin.

Eş birinci yazar: Eş katkı veya eş birinci yazar bilgisi incelenen sürümde yer almamaktadır.

Sorumlu yazar: PDF'deki yıldız işaretleri Bruce Qing Tang ve Chang Liu'yu sorumlu yazar olarak göstermektedir. SSRN kayıt özetinde Bruce Tang ayrıca “Contact Author” olarak listelenmektedir. İncelenen PDF'de yıldız işaretlerinin anlamını açıklayan ayrı bir dipnot veya sorumlu yazar e-posta adresi bulunmamaktadır.

DOI:10.2139/ssrn.7193872

Dergi: Hakemli bir dergi adı yer almamaktadır.

Yayın platformu: SSRN.

Platform sahibi: Elsevier Inc. SSRN burada preprint dağıtım platformudur; çalışma Elsevier tarafından yayımlanmış hakemli bir dergi makalesi olarak değerlendirilmemelidir.

Yayın yılı: 2026.

Kaynak türü: Fiziksel prototip saha deneyleri ile sayısal kontrol benzetimlerini birleştiren mühendislik araştırması preprinti.

Hakemlik durumu: Bu çalışma bir preprinttir ve hakem değerlendirmesinden geçmemiştir.

Resmî kaynak:SSRN resmî çalışma kaydı.

Bu Türkçe açıklama, yüklenen çalışmanın 34 sayfalık sürümü; metinleri, formülleri, tabloları, robot mimarisi görselleri, deney görüntüleri ve yakınsama grafikleri incelenerek hazırlanmıştır. Bilimsel içerik için çalışma dışında yeni bir bulgu eklenmemiştir. Dış kaynak kontrolü yalnızca DOI, SSRN kaydı, platform ve yayın durumunun bibliyografik doğrulanması amacıyla kullanılmıştır.

Çalışmanın sonuçları teknik prototip düzeyindedir. Yüz veya dil görüntüsünün alınması klinik tanı doğruluğu, kan basıncı iş akışının tamamlanması ölçüm doğruluğu ve bir aylık saha kullanımı uzun dönem güvenlik anlamına gelmez. Sistem gerçek evlerde, farklı dillerde, farklı sağlık durumlarında ve bağımsız denetim altında doğrulanmadan klinik karar veren veya gözetimsiz sağlık hizmeti sunan bir robot olarak değerlendirilmemelidir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy