Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Sağlık Bilimleri / Diş Hekimliği / Panoramik Diş Röntgenlerinde Sınırı Gören Yapay Zekâ: Laplasyen Kenar Kılavuzlu SAM 2 ile Milimetre Altı Diş Segmentasyonu
Diş Hekimliği

Panoramik Diş Röntgenlerinde Sınırı Gören Yapay Zekâ: Laplasyen Kenar Kılavuzlu SAM 2 ile Milimetre Altı Diş Segmentasyonu

Panoramik dental radyografiler, tek bir görüntüde üst ve alt çeneyi, dişleri ve çevredeki anatomik yapıları geniş ölçekte gösterebildiği için ortodontik planlama, implant değerlendirmesi ve dental tarama süreçlerinde yaygın biçimde kullanılmaktadır.

18/07/2026  Veri Anla 48 görüntüleme
Panoramik Diş Röntgenlerinde Sınırı Gören Yapay Zekâ: Laplasyen Kenar Kılavuzlu SAM 2 ile Milimetre Altı Diş Segmentasyonu

Panoramik dental radyografiler, tek bir görüntüde üst ve alt çeneyi, dişleri ve çevredeki anatomik yapıları geniş ölçekte gösterebildiği için ortodontik planlama, implant değerlendirmesi ve dental tarama süreçlerinde yaygın biçimde kullanılmaktadır. Ancak bu görüntülerde diş kökü ile alveol kemiği, periodontal ligament aralığı ve komşu dişler arasındaki sınırlar çoğu zaman düşük kontrastlıdır. Metal restorasyonlar, hava yolu gölgeleri, geometrik üst üste binmeler ve görüntüleme artefaktları da otomatik sınır belirlemeyi zorlaştırmaktadır.

Bu çalışmada araştırmacılar, panoramik radyografilerde dişlerin dış sınırlarını daha hassas belirlemek için EGA-SAM2-UNet adını verdikleri bir yapay zekâ mimarisi geliştirmiştir. Sistem, genel görüntüler üzerinde önceden eğitilmiş SAM 2 temel modelini, panoramik radyografilerin kendine özgü gri ton ve doku dağılımına uyarlamaktadır.

Modelin temel yeniliği, Edge-Guided Attention yani Kenar Kılavuzlu Dikkat modülüdür. Önceki yöntemlerin çoğunda kenar bilgisi, modele sonradan eklenen bir yardımcı özellik veya ayrı bir sınır kaybı olarak kullanılmıştır. Bu çalışmada ise Laplasyen kenar operatörüyle elde edilen yapısal bilgi, kanal ve uzamsal dikkat ağırlıklarının hesaplanmasının doğrudan içine yerleştirilmiştir. Böylece model yalnızca “diş nerede?” sorusuna değil, “diş ile çevresindeki kemik tam olarak nerede ayrılıyor?” sorusuna da odaklanmaya zorlanmaktadır.

SAM 2 kodlayıcısının bütün parametrelerini yeniden eğitmek yerine Düşük Dereceli Uyarlama, yani LoRA kullanılmıştır. Bu yöntemle model parametrelerinin %99,5’ten fazlası dondurulmuş, yalnızca yaklaşık %0,43–0,47’lik küçük bir bölüm eğitilmiştir. Çok ölçekli RFB blokları farklı büyüklükteki anatomik örüntüleri toplarken, yukarıdan aşağı çapraz dikkat mekanizması yüksek düzeyli diş bilgisini düşük düzeyli doku ayrıntılarıyla birleştirmiştir.

Model, MICCAI STS 2024 ve DENTEX adlı iki kamuya açık panoramik radyografi veri seti üzerinde değerlendirilmiştir. MICCAI STS 2024 doğrulama kümesinde EGA-SAM2-UNet için Dice benzerlik katsayısı %93,9, birleşim-kesişim oranı %88,5, ortalama simetrik sınır uzaklığı 0,18 mm ve HD95 sınır hatası 0,79 mm olarak bildirilmiştir.

MedSAM modelinin HD95 değeri 1,02 mm iken önerilen yöntemde bu değerin 0,79 mm’ye düşmesi, araştırmacılar tarafından sınır konumlandırmasında göreli %22,6 iyileşme olarak yorumlanmıştır. Bu oran Dice başarısındaki 22,6 puanlık artış anlamına gelmez; 95. yüzdelik sınır uzaklığındaki göreli azalmayı ifade eder.

Model MICCAI STS 2024 üzerinde eğitilip herhangi bir ek DENTEX uyarlaması yapılmadan DENTEX doğrulama kümesinde sınandığında Dice %91,2 ve HD95 0,95 mm olarak korunmuştur. Sonuçlar farklı görüntüleme cihazları ve merkezler arasında belirli ölçüde aktarılabilirlik bulunduğunu göstermektedir. Bununla birlikte veri alanı değiştiğinde Dice 2,7 yüzde puan azalmış ve HD95 0,16 mm yükselmiştir.

Ablasyon deneyleri, performans artışının tek bir bileşenden gelmediğini göstermiştir. LoRA uyarlaması, çok ölçekli RFB blokları, çapraz dikkat, EGA ve yarı denetimli öğrenme sırasıyla eklendikçe Dice %89,7’den %93,9’a yükselmiş; HD95 1,49 mm’den 0,79 mm’ye düşmüştür. En belirgin tek modül katkılarından biri, kenar bilgisinin dikkat hesaplamasına eklenmesiyle sınır hatasında elde edilmiştir.

Çalışma klinik açıdan umut verici bir görüntü segmentasyonu yöntemi sunmaktadır; ancak bir tanı sistemi değildir. Çürük, periapikal lezyon, periodontal kemik kaybı veya implant uygunluğu teşhis etmemektedir. Sonuçlar kamuya açık veri setleri üzerindeki hesaplamalı deneylere dayanmaktadır. İnsan uzmanlar arası sınır çizim farklılığıyla doğrudan karşılaştırma yapılmamış, gerçek klinik kararları veya hasta sonuçlarını iyileştirdiği gösterilmemiştir.

Detaylı Açıklama

Araştırmanın temel problemi nedir?

Bir görüntü segmentasyon sistemi, görüntüdeki her pikselin hangi yapıya ait olduğunu belirlemeye çalışır. Diş segmentasyonunda amaç, her dişi çevresindeki alveol kemiğinden, yumuşak doku gölgelerinden ve komşu dişlerden ayıran doğru bir maske oluşturmaktır.

Panoramik radyografilerde bu işlem birkaç nedenle güçtür:

  • Diş kökü ile alveol kemiğinin radyografik yoğunlukları birbirine yaklaşabilir.
  • Periodontal ligament aralığı çok ince ve düşük kontrastlı olabilir.
  • Komşu dişler özellikle çapraşıklıkta üst üste binebilir.
  • Kök uçlarının sınırları çevredeki kemik dokusu içinde silikleşebilir.
  • Metal dolgu, kron ve kanal tedavileri yüksek yoğunluklu artefaktlar oluşturabilir.
  • Maksiller hava yolu ve diğer anatomik gölgeler dişlere benzeyen yanlış kenarlar meydana getirebilir.
  • Panoramik görüntüleme, üç boyutlu anatomiyi iki boyutlu düzleme yansıttığı için büyütme ve geometrik bozulma içerir.

Bir model dişin genel alanını doğru bulduğu hâlde sınırını birkaç piksel dışarı taşırabilir. Bu durum özellikle iki komşu dişin tek bir bütün gibi birleşmesine, kök sınırının kemiğe taşmasına veya diş yüzeyinin bir bölümünün kaybolmasına neden olabilir.

Bu nedenle yüksek Dice değeri tek başına yeterli değildir. Diş alanının büyük kısmı doğru sınıflandırılmış olsa bile klinik açıdan önemli sınır bölgelerinde hata bulunabilir. Çalışma bu nedenle hem bölgesel örtüşmeyi hem de sınır uzaklığını ölçen metrikler kullanmıştır.

Manuel segmentasyon neden yeterli görülmüyor?

Panoramik radyografide bütün dişlerin elle sınırlandırılması zaman alıcıdır. Aynı uzman farklı zamanlarda aynı görüntüyü biraz farklı çizebilir; iki uzman arasında da sınır tercihi değişebilir. Büyük görüntü veri tabanlarında her dişi tek tek işaretlemek klinik iş yükünü artırır.

Otomatik segmentasyon şu işlemler için temel bir ön adım olabilir:

  • Dişlerin otomatik numaralandırılması,
  • Diş eksikliklerinin belirlenmesi,
  • Ortodontik ark ve diş konumu analizi,
  • Kök çevresindeki anatomik mesafelerin hesaplanması,
  • İmplant planlama yazılımlarında diş bölgelerinin ayrıştırılması,
  • Dental görüntülerin yapay zekâ ile taranması,
  • Patoloji analizinden önce normal anatomik yapıların ayrılması.

Bununla birlikte otomatik segmentasyonun güvenilir olabilmesi için yalnızca dişin genel konumunu değil, servikal bölgeyi, kök ucunu ve komşu dişler arasındaki ince sınırları da doğru belirlemesi gerekir.

Literatürdeki temel boşluk nedir?

Çalışmaya göre önceki sistemler kenar bilgisini genellikle iki şekilde kullanmıştır:

  1. Modelin tahmini ile gerçek sınır arasındaki farkı cezalandıran yardımcı bir sınır kaybı eklemek,
  2. Sobel, Canny veya Laplasyen ile çıkarılan kenar haritasını giriş görüntüsüne ya da ara özelliklere ek kanal olarak birleştirmek.

Bu yaklaşımlarda kenar bilgisi dikkat mekanizmasının dışında kalmaktadır. Model önce kendi dikkat ağırlıklarını hesaplamakta, kenar bilgisi ise yalnızca girişe ek özellik veya çıkışı denetleyen ceza olarak kullanılmaktadır.

EGA-SAM2-UNet’in önerdiği değişiklik, kenar bilgisini doğrudan dikkat ağırlıklarının hesaplanmasına sokmaktır. Böylece kenar haritası yalnızca modele verilen başka bir veri değildir; hangi özellik kanalının ve hangi görüntü konumunun önemli olduğuna karar veren mekanizmanın bir parçası hâline gelmektedir.

SAM 2 neden doğrudan kullanılamadı?

SAM 2, geniş ve genel görüntü koleksiyonlarından öğrenilmiş bir görsel temel modeldir. Doğal fotoğraflardaki insanlar, araçlar veya nesneler ile panoramik dental radyografiler aynı doku ve kontrast özelliklerine sahip değildir.

Panoramik görüntülerde:

  • Renk bilgisi bulunmaz,
  • Gri ton farklılıkları çok küçüktür,
  • Anatomik yapılar üst üste biner,
  • Diş ile kemik sınırı doğal fotoğraflardaki nesne sınırından daha belirsizdir,
  • Artefaktlar gerçek anatomik kenarlar gibi görünebilir.

Bu alan farkı nedeniyle SAM’ın sıfırdan uyarlama yapılmadan kullanılan sürümü çalışmada %83,6 Dice ve 1,87 mm HD95 ile sınırlı kalmıştır. Bu sonuç, güçlü bir genel görüntü modelinin tıbbi görüntülerde doğrudan güvenilir sonuç vermeyebileceğini göstermektedir.

LoRA ile parametre verimli uyarlama

SAM 2’nin bütün ağırlıklarını yeniden eğitmek yüksek bellek, hesaplama ve veri gerektirir. Araştırmacılar bunun yerine LoRA kullanmıştır.

Çalışmada önceden eğitilmiş ağırlık matrisi \(W_0\) için güncelleme şu düşük dereceli çarpımla sınırlandırılmıştır:

\[ \Delta W=BA \]

İleri geçiş denklemi şöyledir:

\[ h=W_0x+\Delta Wx=W_0x+BAx \]

Burada:

  • \(W_0\), SAM 2’den gelen ve büyük ölçüde dondurulan önceden eğitilmiş ağırlık matrisidir.
  • \(x\), katmana verilen giriş özelliğidir.
  • \(\Delta W\), dental radyografi alanına uyum sağlamak için öğrenilen küçük güncellemedir.
  • \(A\) ve \(B\), düşük dereceli eğitilebilir matrislerdir.
  • \(r\), düşük dereceyi gösterir ve ana matris boyutlarından çok daha küçüktür.
  • \(h\), uyarlanmış katmanın çıktısıdır.

Gündelik bir benzetmeyle modelin bütün bilgisini yeniden yazmak yerine, panoramik radyografiler için küçük bir “düzeltme eki” öğrenilmektedir. Böylece genel görsel bilgi korunurken diş dokularının yoğunluk örüntülerine uyum sağlanmaktadır.

Deneylerde LoRA derecesi \(r=16\), ölçek katsayısı \(\alpha=32\) olarak belirlenmiş ve Transformer bloklarındaki sorgu, anahtar ve değer izdüşümlerine uygulanmıştır.

LoRA parametreleri yaklaşık 0,42 milyon olarak bildirilmiştir. Bu, modelin toplam parametrelerinin yaklaşık %0,43’üne karşılık gelmektedir. Metnin farklı bölümlerinde yaklaşık %0,47 değeri de kullanılmaktadır; iki oran da modelin çok küçük bir bölümünün eğitildiğini ifade etmektedir.

Çok ölçekli RFB blokları ne yapıyor?

Diş sınırları tek bir boyut ölçeğinde değildir. Ön dişlerin ince kökleri, azı dişlerinin çok köklü anatomisi, geniş kronlar ve çok ince periodontal aralıklar farklı görsel ölçeklerde bilgi gerektirir.

RFB, yani Receptive Field Block, farklı genişletme oranlarına sahip paralel evrişimler kullanmaktadır. Çalışmada genişletme oranları:

\[ r=\{1,3,5\} \]

olarak verilmiştir.

Küçük alıcı alanlar ince yerel ayrıntıları, daha geniş alıcı alanlar ise dişin genel biçimini ve çevresel bağlamı yakalamaya yardımcı olur. Böylece model yalnızca tek bir piksel çevresine değil, farklı büyüklükte anatomik bölgelere bakabilir.

Yukarıdan aşağı çapraz dikkat neden kullanıldı?

Kodlayıcının erken katmanları ince doku ve kenar bilgisi taşırken derin katmanları “bu yapı bir diştir” gibi daha yüksek düzeyli anlamsal bilgi taşır. Erken özellikler ayrıntılıdır fakat artefaktlardan etkilenebilir; derin özellikler anlamlıdır fakat uzamsal ayrıntıları daha kabadır.

Çalışmada üst kod çözücü katmanından gelen özellikler sorgu, kodlayıcıdan gelen atlama bağlantısı özellikleri ise anahtar ve değer olarak kullanılmıştır:

\[ F_{\mathrm{fused}}= \operatorname{Attention} \left( Q=F_{\mathrm{up}}, K=F_{\mathrm{enc}}, V=F_{\mathrm{enc}} \right) \]

Burada:

  • \(F_{\mathrm{up}}\), önceki kod çözücü katmanından büyütülerek gelen yüksek düzeyli özelliktir.
  • \(F_{\mathrm{enc}}\), kodlayıcının karşılık gelen seviyesindeki ayrıntılı özelliktir.
  • \(Q\), sorguyu; \(K\), anahtarı; \(V\), değeri temsil eder.
  • \(F_{\mathrm{fused}}\), anlamsal bilgiyle süzülmüş birleşik özelliktir.

Amaç, EGA modülüne ulaşmadan önce dişle ilgisiz gölge ve artefaktların bir bölümünü elemek, düşük seviyeli ayrıntıları yüksek seviyeli diş bilgisiyle kalibre etmektir.

Laplasyen operatörü neden seçildi?

Laplasyen, görüntü yoğunluğundaki ikinci dereceden değişimleri inceleyen bir kenar operatörüdür. Çalışmanın belirttiği temel avantajı izotropik olmasıdır. Bu, kenarın yönü değişse bile benzer biçimde yanıt verebilmesi anlamına gelir.

Diş sınırları tek yönde değildir:

  • Komşu dişlerin arasında daha çok düşey,
  • Mine-sement birleşimi çevresinde daha çok yatay,
  • Kök uçlarında eğik ve kavisli sınırlar bulunabilir.

Sobel gibi birinci dereceden operatörler belirli yönlere daha duyarlıdır ve bütün yönleri yakalayabilmek için farklı çekirdekler gerektirir. Laplasyen ise bütün yönlerdeki yoğunluk değişimlerine tepki verebilir.

Çalışmada frekans alanındaki Laplasyen davranışı şu şekilde verilmiştir:

\[ H(u,v)=-(u^2+v^2) \]

Burada:

  • \(u\) ve \(v\), görüntünün iki uzamsal frekans yönünü,
  • \(H(u,v)\), Laplasyen filtrenin frekans yanıtını temsil eder.

Frekans büyüdükçe \((u^2+v^2)\) terimi artmaktadır. Bu nedenle Laplasyen, hızlı yoğunluk geçişlerini yani kenarları güçlendiren yüksek geçiren bir filtre gibi davranır. Geniş ve homojen dentin veya pulpa bölgeleri daha düşük frekanslıyken diş-kemik geçişi gibi sınırlar daha yüksek frekanslı bileşenler içerir.

Kenar bilgisi hangi görüntüye uygulanıyor?

EGA modülü, Laplasyen operatörünü doğrudan ham panoramik görüntüye uygulamakla sınırlı değildir. Operatör, ağın ara özellik haritasına kanal bazında uygulanmaktadır.

Çalışmada kenar tanımlayıcısı şu denklemle oluşturulmuştur:

\[ E= \operatorname{ReLU} \left( \mathcal{B} \left( \operatorname{Conv}_{dw}(F,K_{\mathrm{Lap}}) \right) \right) \]

Burada:

  • \(F\in\mathbb{R}^{C\times H\times W}\), ara özellik haritasıdır.
  • \(C\), kanal sayısını; \(H\) ve \(W\), uzamsal boyutları gösterir.
  • \(K_{\mathrm{Lap}}\), sabit 3×3 Laplasyen çekirdeğidir.
  • \(\operatorname{Conv}_{dw}\), her özellik kanalını ayrı işleyen derinlik yönlü evrişimdir.
  • \(\mathcal{B}\), Batch Normalization işlemini ifade eder.
  • ReLU, negatif değerleri bastıran aktivasyon fonksiyonudur.
  • \(E\), dikkat hesaplamasında kullanılacak yapısal kenar tanımlayıcısıdır.

Örnek Laplasyen çekirdeği şöyledir:

\[ K_{\mathrm{Lap}}= \begin{bmatrix} 0 & 1 & 0\\ 1 & -4 & 1\\ 0 & 1 & 0 \end{bmatrix} \]

Bu sabit çekirdek ağ tarafından yeniden öğrenilmez. Araştırmacıların gerekçesine göre sınır pikselleri toplam görüntünün %5’inden az olduğu için tamamen öğrenilebilir bir kenar filtresinde sınır gradyanları arka plan piksellerinin baskınlığı altında kaybolabilir. Sabit Laplasyen çekirdeği, eğitim sürecinden bağımsız bir kenar dayanağı sağlamaktadır.

Kanal dikkati nasıl hesaplanıyor?

Kanal dikkati, “hangi özellik haritaları sınır açısından daha önemlidir?” sorusuna yanıt verir. Kenar haritası önce küresel ortalama havuzlama ile her kanal için özetlenir, ardından çok katmanlı algılayıcıdan geçirilir:

\[ M_c(E)= \sigma \left( \operatorname{MLP} \left( \operatorname{GAP}(E) \right) \right) \]

Burada:

  • \(\operatorname{GAP}\), küresel ortalama havuzlamadır.
  • MLP, çok katmanlı algılayıcıdır.
  • \(\sigma\), değerleri 0–1 aralığına taşıyan sigmoid fonksiyonudur.
  • \(M_c(E)\), her özellik kanalının önem ağırlığıdır.

Uzamsal dikkat nasıl hesaplanıyor?

Uzamsal dikkat ise “görüntünün hangi konumlarına daha fazla odaklanılmalıdır?” sorusuna yanıt verir. Kenar haritası 7×7 evrişim ve sigmoid fonksiyonundan geçirilir:

\[ M_s(E)= \sigma \left( \operatorname{Conv}_{7\times7}(E) \right) \]

Burada \(M_s(E)\), görüntü yüksekliği ve genişliği boyunca her konuma verilen uzamsal dikkat ağırlığıdır.

Kanal dikkati hangi özellik türlerinin önemli olduğunu, uzamsal dikkat ise sınırların görüntüde nerede bulunduğunu belirlemeye çalışır.

EGA modülünün nihai birleşimi

Kanal ve uzamsal dikkat paralel biçimde orijinal özellik haritasına uygulanmış ve artık bağlantısıyla birleştirilmiştir:

\[ F_{\mathrm{EGA}} = F+ \left(F\otimes M_c(E)\right) + \left(F\otimes M_s(E)\right) \]

Burada:

  • \(F\), EGA modülüne giren ana özellik haritasıdır.
  • \(\otimes\), eleman bazında çarpımı ifade eder.
  • \(F\otimes M_c(E)\), kanal açısından yeniden ağırlıklandırılmış özellikleri,
  • \(F\otimes M_s(E)\), uzamsal olarak yeniden ağırlıklandırılmış özellikleri,
  • \(F_{\mathrm{EGA}}\), kenar duyarlılığı artırılmış nihai çıktıyı gösterir.

Orijinal \(F\) özelliğinin sonuçta korunması artık bağlantısıdır. Bu bağlantı, kenar modülünün mevcut anlamsal bilgiyi tamamen değiştirmesini önler ve yalnızca sınırla ilgili özellikleri güçlendirmesini sağlar.

Şekil 1 mimarinin hangi akışını gösteriyor?

Çalışmanın mimari şemasında panoramik radyografi önce LoRA adaptörleri eklenmiş SAM 2 kodlayıcısından geçmektedir. Kodlayıcının dört farklı seviyesinden özellik haritaları çıkarılmaktadır.

Her seviyede:

  1. RFB blokları farklı ölçeklerde bağlam toplamaktadır.
  2. Üst seviyeden gelen bilgi çapraz dikkat yoluyla alt seviyeyi kalibre etmektedir.
  3. EGA modülü Laplasyen kenar öncülünü kanal ve uzamsal dikkate aktarmaktadır.
  4. Kod çözücü blokları görüntünün çözünürlüğünü kademeli biçimde yeniden yükseltmektedir.
  5. Son aşamada bütün dişleri gösteren segmentasyon maskesi üretilmektedir.

Şema, modelin yalnızca en derin SAM 2 özelliğini kullanmadığını; yüksek çözünürlüklü yüzey ayrıntıları ile düşük çözünürlüklü anlamsal bilgiyi hiyerarşik olarak birleştirdiğini göstermektedir.

Şekil 2 EGA modülünü nasıl açıklıyor?

EGA çalışma şemasında ara özellik önce Laplasyen çekirdek evrişimi, Batch Normalization ve ReLU’dan geçirilerek \(E\) kenar haritasına dönüştürülmektedir.

Bu harita daha sonra iki paralel kola ayrılmaktadır:

  • Kanal kolunda GAP, MLP ve sigmoid,
  • Uzamsal kolda 7×7 evrişim ve sigmoid uygulanmaktadır.

İki kolun ürettiği dikkat ağırlıkları orijinal özellikle çarpılmakta ve artık birleştirme modülünde ana özellikle toplanmaktadır. Bu görsel, kenarın ayrı bir yan ağ olarak tutulmadığını; doğrudan dikkat ağırlıklarını üreten çekirdek bilgi olduğunu açıkça göstermektedir.

Kayıp fonksiyonu nasıl düzenlendi?

Model, Dice kaybı ile ikili çapraz entropi kaybının ağırlıklı toplamıyla eğitilmiştir:

\[ \mathcal{L} = \lambda_{\mathrm{Dice}}\mathcal{L}_{\mathrm{Dice}} + \lambda_{\mathrm{BCE}}\mathcal{L}_{\mathrm{BCE}} \]

Çalışmada:

\[ \lambda_{\mathrm{Dice}}=0.7, \qquad \lambda_{\mathrm{BCE}}=0.3 \]

olarak kullanılmıştır.

Dice kaybı şu biçimde verilmiştir:

\[ \mathcal{L}_{\mathrm{Dice}} = 1- \frac{ 2\sum_i y_ip_i+\epsilon }{ \sum_i y_i+\sum_i p_i+\epsilon } \]

Burada:

  • \(y_i\), \(i\). pikselin gerçek sınıfını,
  • \(p_i\), modelin aynı piksel için ürettiği diş olasılığını,
  • \(\epsilon\), sıfıra bölünmeyi önleyen küçük düzeltme terimini ifade eder.

Dice kaybı, diş pikselleri ile çok daha geniş arka plan arasında oluşan sınıf dengesizliğine karşı bölgesel örtüşmeyi desteklemektedir.

İkili çapraz entropi kaybı şöyledir:

\[ \mathcal{L}_{\mathrm{BCE}} = -\frac{1}{N} \sum_i \left[ y_i\log(p_i) + (1-y_i)\log(1-p_i) \right] \]

Burada \(N\), değerlendirilen toplam piksel sayısıdır. BCE her pikselin diş veya arka plan olarak doğru sınıflandırılmasını teşvik etmektedir.

Verilen formüllerde ayrı bir kenar kaybı bulunmamaktadır. Çalışmanın önemli tasarım iddialarından biri de budur: sınır duyarlılığı ek bir kenar kaybından değil, EGA modülünün dikkat hesaplamasından sağlanmaktadır.

Yarı denetimli öğrenme neden kullanıldı?

MICCAI STS 2024 veri setinde yalnızca 30 eğitim görüntüsünün ayrıntılı etiketi bulunurken 2.350 görüntü etiketsizdir. Araştırmacılar bu büyük etiketsiz kısmı tamamen dışlamak yerine öğretmen-öğrenci düzeninde yarı denetimli öğrenme kullanmıştır.

Etiketli görüntülerde gerçek segmentasyon maskeleriyle Dice ve BCE kaybı hesaplanmıştır. Etiketsiz görüntülerde ise üstel hareketli ortalamayla güncellenen öğretmen model sahte etiketler üretmiş, öğrenci modelin bu sonuçlarla tutarlı tahmin oluşturması amaçlanmıştır.

Her GPU’daki sekiz görüntülük mini grupta:

  • 1 etiketli görüntü,
  • 7 etiketsiz görüntü

kullanılmıştır. Dört GPU ile etkili mini grup büyüklüğü 32 olmuştur.

Bu yaklaşım etiketleme maliyetini azaltabilmektedir; ancak öğretmen modelin hatalı sahte etiketleri özellikle metal restorasyonlu veya ciddi çapraşıklık bulunan görüntülerde öğrenci modele aktarılabilir. Çalışma da sahte etiketlerin bağımsız uzman kontrolünden geçirilmediğini sınırlılık olarak kabul etmektedir.

MICCAI STS 2024 veri seti

Alt kümeGörüntü sayısıEtiketli diş örneği
Etiketli eğitim30420
Etiketsiz eğitim2.350–
Doğrulama20280
Gizli test100Gizli
Toplam2.500700 açık etiketli diş

Görüntü çözünürlükleri 1932×1050 ile 2560×1440 piksel arasında değişmektedir. Ana karşılaştırma tablosundaki sonuçlar, 20 görüntülük doğrulama kümesinin beş bağımsız eğitim çalışmasında değerlendirilmesine dayanmaktadır. PDF’de 100 görüntülük gizli test kümesine ait ayrı bir performans tablosu sunulmamıştır.

DENTEX veri seti

DENTEX, üç farklı klinik kurumdan elde edilen 1.005 panoramik radyografiyi içermektedir. Görüntüler farklı cihazlar ve çekim protokollerinden geldiği için gerçek klinik çeşitliliğe daha yakın bir alan değişimi sunmaktadır.

Alt kümeGörüntü sayısı
Eğitim705
Doğrulama50
Gizli test250
Toplam1.005

Etiketler bir yıllık deneyime sahip diş hekimliği öğrencisi tarafından hazırlanmış, 15 yıldan fazla klinik deneyimi bulunan diş hekimi tarafından kontrol edilip düzeltilmiştir.

Çalışma DENTEX’in diş numaralandırma alt kümesindeki piksel düzeyli diş segmentasyon etiketlerini kullanmıştır. Çürük, derin çürük, periapikal lezyon ve gömülü diş gibi tanı etiketleri bu araştırmanın ana hedefi olmamıştır.

Görüntü ön işleme

Bütün görüntülere standartlaştırılmış ön işleme uygulanmıştır:

  1. Piksel yoğunlukları min–maks ölçekleme ile 0–1 aralığına getirilmiştir.
  2. Görüntüler bikübik enterpolasyonla 1024×1024 piksele yeniden boyutlandırılmıştır.
  3. Rastgele yatay çevirme uygulanmıştır.
  4. ±15 derece rastgele döndürme yapılmıştır.
  5. Parlaklık ve kontrast ±%10 değiştirilmiştir.

Bu işlemler modelin farklı çekim koşullarına karşı daha dayanıklı olmasını amaçlamaktadır. Ancak yeniden boyutlandırma çok ince anatomik sınırların piksel temsilini değiştirebilir. Ayrıca çalışma, yeniden boyutlandırılmış görüntülerde piksel uzaklıklarının milimetreye nasıl dönüştürüldüğünü ayrıntılı biçimde açıklamamaktadır.

Eğitim protokolü

ParametreÇalışmada kullanılan değer
YazılımPyTorch 2.1.0
Donanım4 × NVIDIA RTX 3090, her biri 24 GB
Eğitim süresi100 epoch
OptimizasyonAdamW
Başlangıç öğrenme oranı\(1\times10^{-4}\)
Ağırlık çürümesi\(1\times10^{-2}\)
Öğrenme oranı planıKosinüs azalması, ilk 5 epoch ısınma
Mini grupGPU başına 8; toplam 32
Gradyan kırpmaAzami norm 1,0
Erken durdurmaDoğrulama Dice için 15 epoch sabır
LoRA derecesi16
LoRA ölçeği32

Performans ölçütleri ne anlama geliyor?

Dice benzerlik katsayısı

Tahmin edilen diş maskesi ile uzman etiketinin ne ölçüde örtüştüğünü gösterir. %100’e yaklaştıkça örtüşme artar. Ancak geniş diş iç alanlarının doğru bulunması, ince sınır hatalarının etkisini görece azaltabilir.

IoU

Tahmin ile gerçek maskenin kesişiminin birleşimlerine oranıdır. Dice gibi bölgesel doğruluğu ölçer, ancak matematiksel ölçeği daha katıdır.

ASD

Tahmin edilen ve gerçek sınırlar arasındaki çift yönlü ortalama mesafeyi ölçer. Düşük değer daha iyidir.

HD95

İki sınır arasındaki mesafelerin 95. yüzdeliğini ölçer. En kötü %5’lik uç değerleri dışarıda bırakarak sınırın büyük bölümündeki kötü durum hatasını temsil eder.

HD95 = 0,79 mm, bütün sınır noktalarının azami hatasının 0,79 mm olduğu anlamına gelmez. Sınır uzaklıklarının %95’inin bu değerin altında kaldığını ifade eden dayanıklı bir ölçüttür; kalan %5 içinde daha büyük hatalar bulunabilir.

İstatistiksel değerlendirme nasıl yapıldı?

Bütün deneyler farklı rastgele başlangıçlarla beş kez tekrarlanmıştır. Her metrik için ortalama ve standart sapma bildirilmiştir.

Yöntemler arasındaki farklar:

  • Görüntü düzeyinde Wilcoxon işaretli sıralar testi,
  • Dört metrik için Bonferroni düzeltmesi,
  • Aile düzeyinde \(\alpha=0,05\),
  • 1.000 yeniden örneklemeli bootstrap ile %95 güven aralığı

kullanılarak değerlendirilmiştir.

Ana analizde 20 doğrulama görüntüsünün beş koşudaki değerleriyle en az \(n=100\) gözlem oluşturulmuştur. PDF, aynı görüntülerin farklı koşulardaki tekrarlarının bağımlılık yapısının istatistiksel modelde ayrıca ele alınıp alınmadığını ayrıntılandırmamaktadır.

Ana model karşılaştırması

ModelDice (%)IoU (%)ASD (mm)HD95 (mm)
UNet91,3 ± 0,484,3 ± 0,50,25 ± 0,031,12 ± 0,08
UNet++91,4 ± 0,385,2 ± 0,40,27 ± 0,021,28 ± 0,06
nnUNet92,1 ± 0,385,9 ± 0,50,21 ± 0,030,97 ± 0,07
Swin-UNet91,2 ± 0,484,5 ± 0,50,25 ± 0,021,05 ± 0,07
TransUNet91,5 ± 0,584,8 ± 0,60,24 ± 0,041,03 ± 0,08
SAM, sıfır atış83,6 ± 1,272,5 ± 1,10,47 ± 0,081,87 ± 0,15
MedSAM90,6 ± 0,582,8 ± 0,60,24 ± 0,031,02 ± 0,09
SAM2-Adapter92,3 ± 0,586,1 ± 0,60,20 ± 0,040,94 ± 0,08
EGA-SAM2-UNet93,9 ± 0,288,5 ± 0,30,18 ± 0,010,79 ± 0,04

Önerilen yöntem dört metriğin tamamında karşılaştırılan modellerden daha iyi sonuç vermiştir. MedSAM, nnUNet, UNet++ ve Swin-UNet ile yapılan ikili karşılaştırmalardaki düzeltilmiş p değerleri 0,05’in altında bildirilmiştir.

%22,6 sınır iyileşmesi nasıl hesaplanıyor?

MedSAM için HD95 1,02 mm, önerilen model için 0,79 mm’dir. Göreli azalma:

\[ \frac{1.02-0.79}{1.02}\times100 \approx22.6\% \]

olarak hesaplanmaktadır.

Bu oran sınır hatasının göreli azalmasıdır. Modelin genel doğruluğunun %22,6 arttığı veya klinik hata riskinin %22,6 azaldığı anlamına gelmez.

Kenar operatörlerinin karşılaştırılması

Kenar yöntemiDice (%)IoU (%)ASD (mm)HD95 (mm)
Kenar yok, yalnız CA93,086,80,190,95
Sobel93,287,00,190,91
Canny93,387,20,180,88
Öğrenilebilir 3×3 evrişim93,186,90,200,93
Laplasyen EGA93,988,50,180,79

Laplasyen, ikinci en iyi Canny sonucuna göre HD95’i 0,88 mm’den 0,79 mm’ye düşürmüştür. Araştırmacılar bu yaklaşık %10,2 göreli azalmayı Laplasyenin yön bağımsız yapısı, sıfır geçişli sınır yerelleştirmesi ve eğitimden bağımsız sabit kenar dayanağıyla açıklamaktadır.

Öğrenilebilir 3×3 evrişimin Laplasyenden daha düşük performans göstermesi, az sayıdaki sınır pikselinin eğitim sırasında arka plan gradyanları altında kalabileceği görüşünü destekleyen deneysel bir bulgu olarak yorumlanmıştır.

Modüller tek tek ne kadar katkı sağladı?

YapılandırmaDice (%)HD95 (mm)
Dondurulmuş SAM 2 + standart UNet kod çözücü89,71,49
+ LoRA91,81,15
+ RFB92,51,05
+ Çapraz dikkat93,00,95
+ EGA, yalnız 30 etiketli görüntü93,40,86
+ Yarı denetimli öğrenme93,90,79

LoRA’nın eklenmesi Dice değerini 2,1 puan artırmış ve HD95’i 0,34 mm düşürmüştür. Bu, doğal görüntü alanından radyografi alanına uyarlamanın temel önemini göstermektedir.

EGA, yalnızca 30 etiketli görüntü kullanıldığında bile HD95’i 0,95 mm’den 0,86 mm’ye düşürmüştür. Etiketsiz görüntüler de eklendiğinde değer 0,79 mm’ye inmiştir.

Kanal ve uzamsal dikkat neden paralel kullanıldı?

Dikkat yapılandırmasıDice (%)HD95 (mm)
Dikkat yok93,00,95
Yalnız kanal93,20,91
Yalnız uzamsal93,40,87
Kanal → uzamsal, seri93,60,84
Kanal + uzamsal, paralel93,90,79

Uzamsal dikkat sınırın görüntü üzerindeki konumunu doğrudan hedeflediği için kanal dikkatinden daha büyük HD95 iyileşmesi sağlamıştır. Paralel kullanım, hangi özellik kanallarının önemli olduğu ile sınırın nerede bulunduğu sorularını aynı anda yanıtlamıştır.

Farklı veri setine aktarım

Değerlendirme alanıDice (%)IoU (%)ASD (mm)HD95 (mm)
MICCAI STS 202493,988,50,180,79
DENTEX91,285,10,230,95
Fark−2,7 puan−3,4 puan+0,05 mm+0,16 mm

Model DENTEX için yeniden eğitilmeden veya alan uyarlaması yapılmadan değerlendirilmiştir. Bu nedenle sonuç, farklı merkez ve cihazlara aktarım açısından önemlidir. Ancak Mann–Whitney U testi iki veri setindeki Dice dağılımları arasında anlamlı fark bulunduğunu göstermiştir:

\[ p=0.003 \]

Başka bir ifadeyle alan değişimi performansı gerçek ve ölçülebilir biçimde düşürmüştür; model bütün klinik merkezlerde aynı doğrulukta çalışmamaktadır.

Zor olgularda performans

Alt grupGörüntü sayısıDice (%)HD95 (mm)
Standart1095,20,65
Zorlu693,50,82
Çok zor491,80,95

Çok zor grup; şiddetli çapraşıklık, metal restorasyon artefaktları ve endodontik tedavili dişler içermektedir. Performans standart olgulara göre düşmüş, ancak çalışmada bildirilen HD95 0,95 mm düzeyinde kalmıştır.

Alt grup sayıları oldukça küçüktür. Özellikle çok zor grupta yalnızca dört görüntü bulunduğu için bu sonuçların geniş klinik popülasyonlara genellenmesi dikkat gerektirir.

Diş türlerine göre sonuçlar

Diş türüEGA Dice (%)nnUNet Dice (%)EGA HD95 (mm)nnUNet HD95 (mm)
Kesici dişler95,993,40,510,74
Kaninler95,092,50,600,85
Premolarlar93,691,10,791,02
Molarlar91,788,80,971,31

En düşük başarı çok köklü ve daha karmaşık morfolojiye sahip azı dişlerinde görülmüştür. Buna rağmen EGA’nın nnUNet’e karşı en büyük Dice farkı da molarlarda elde edilmiştir. Araştırmacılar bunu, karmaşık ve birbirine temas eden kök-kron sınırlarında açık kenar bilgisinin daha fazla yarar sağlamasıyla açıklamaktadır.

Şekil 3 ne gösteriyor?

Görsel karşılaştırmada özgün panoramik radyografi, EGA uygulanmadan önceki model yanıtı ve EGA sonrasındaki yanıt yan yana sunulmaktadır.

EGA öncesi görselleştirmede yüksek tepki alanları dişlerin çevresine daha geniş ve dağınık biçimde yayılmaktadır. Özellikle komşu dişlerin temas ettiği bölgelerde özellikler birbirine karışmaktadır.

EGA sonrasında yanıtların diş konturlarında daha ince ve belirgin biçimde yoğunlaştığı görülmektedir. Yazarlar bu değişimi, çapraşık veya üst üste binen dişlerde “maske taşması” olarak tanımlanan bir dişe ait maskenin komşu dişe yayılmasının azalmasıyla ilişkilendirmiştir.

Bu görsel nitel destek sağlamaktadır; tek başına ölçülmüş klinik doğruluk kanıtı değildir. Nicel sonuçlar Dice, ASD ve HD95 tablolarıyla değerlendirilmiştir.

Hesaplama maliyeti

ModelParametreFLOPsÇıkarım süresi
UNet31,0 milyon54,8 G25 ± 2 ms
nnUNet31,2 milyon55,1 G26 ± 2 ms
MedSAM95,6 milyon172,4 G118 ± 6 ms
SAM2-UNet, tam ince ayar96,1 milyon178,6 G122 ± 7 ms
EGA-SAM2-UNet96,8 milyon182,3 G124 ± 6 ms

EGA modülü yaklaşık 0,28 milyon ek parametre, 3,7 G FLOPs ve görüntü başına yaklaşık 2 ms ek süre getirmiştir. Toplam maliyete oranla bu artış yaklaşık %2 olarak yorumlanmıştır.

124 ms’lik süre NVIDIA RTX 3090 üzerinde ölçülmüştür. Daha düşük donanımlı klinik bilgisayarlarda, merkezi işlemcide veya farklı yazılım yapılandırmalarında aynı hızın elde edileceği gösterilmemiştir.

Klinik açıdan 0,79 mm ne anlama gelebilir?

Yazarlar, ortodontik ve implant planlamasında yaklaşık 1 mm düzeyindeki ölçüm doğruluğunun önemli olduğunu savunmaktadır. İmplant ile komşu kök arasında 1,5–2,0 mm güvenlik mesafesi gerektiğini ve panoramik görüntülerde yaklaşık %10 geometrik büyütme hatası bulunabildiğini belirtmektedir.

nnUNet’in 0,97 mm HD95 değerinden önerilen modelin 0,79 mm değerine geçilmesi, sınır belirsizliğinde 0,18 mm azalma anlamına gelmektedir. Araştırmacılar bunun dar anatomik alanlarda ek güvenlik payı sağlayabileceğini öne sürmektedir.

Ancak bu değerlendirme doğrudan implant yerleştirme deneyi değildir. Modelin segmentasyon çıktısı kullanılarak yapılan gerçek implant planlarının daha güvenli olduğu, komplikasyonları azalttığı veya CBCT gereksinimini ortadan kaldırdığı gösterilmemiştir.

Panoramik radyografi geometrik büyütme ve üst üste binme içerdiğinden, düşük segmentasyon hatası görüntünün temel fiziksel sınırlamalarını ortadan kaldırmaz.

Çalışmanın güçlü yönleri

  • Kenar bilgisini yardımcı giriş veya kayıp yerine dikkat hesaplamasının içine yerleştirmesi,
  • Laplasyen, Sobel, Canny ve öğrenilebilir filtreleri kontrollü biçimde karşılaştırması,
  • LoRA, RFB, çapraz dikkat, EGA ve yarı denetimli öğrenmenin katkılarını ayrı ayrı incelemesi,
  • Beş farklı rastgele başlangıçla deney tekrarı yapması,
  • Hem bölgesel örtüşme hem de sınır uzaklığı metriklerini kullanması,
  • Wilcoxon testi, Bonferroni düzeltmesi ve bootstrap güven aralıkları bildirmesi,
  • Farklı merkezlerden gelen DENTEX verileriyle alan dışı değerlendirme yapması,
  • Standart, zorlu ve çok zor olguları ayrı incelemesi,
  • Diş türlerine göre performansı değerlendirmesi,
  • Parametre, FLOPs ve çıkarım süresini raporlaması,
  • Kamuya açık veri setleri kullanması.

Çalışmanın sınırlılıkları

  • Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.
  • Ana denetimli eğitim yalnızca 30 tam etiketli görüntüye dayanmaktadır.
  • 2.350 etiketsiz görüntü için üretilen sahte etiketler bağımsız uzman kontrolünden geçirilmemiştir.
  • Ana karşılaştırma sonuçları 20 görüntülük doğrulama kümesinde verilmiştir; 100 görüntülük gizli test kümesine ait ayrı sonuç raporlanmamıştır.
  • DENTEX değerlendirmesi 50 görüntülük doğrulama kümesinde yapılmıştır; gizli test sonuçları verilmemiştir.
  • İnsan uzmanlar arasındaki segmentasyon farklılığı ölçülmemiştir.
  • 0,79 mm HD95’in uzman düzeyine ne kadar yakın olduğu bilinmemektedir.
  • Panoramik görüntüler yeniden 1024×1024’e boyutlandırılmıştır; piksel-milimetre dönüşüm yöntemi ayrıntılı açıklanmamıştır.
  • İstatistiksel örnek sayısı aynı 20 görüntünün beş eğitim koşusunda değerlendirilmesiyle oluşturulmuştur; tekrarlı ölçümlerin bağımlılık yapısı ayrıntılandırılmamıştır.
  • Ablasyon analizi bileşenleri sırayla eklemiş, bileşenler arasındaki etkileşimleri faktöriyel tasarımla incelememiştir.
  • Model yalnızca yapısal diş segmentasyonu yapmaktadır.
  • Çürük, periapikal lezyon, periodontal kemik kaybı veya gömülü diş tanısı değerlendirilmemiştir.
  • Gerçek klinik iş akışında prospektif kullanım yapılmamıştır.
  • Segmentasyonun tedavi kararlarını veya hasta sonuçlarını iyileştirdiği gösterilmemiştir.
  • DENTEX’te anlamlı performans düşüşü görülmüş, farklı merkezlerde tam eşdeğer sonuç korunmamıştır.
  • Çok zor alt grup yalnızca dört görüntü içermektedir.
  • EGA’nın kodlayıcıdan bağımsız olduğu ileri sürülmektedir; ancak deneysel doğrulama yalnızca SAM 2 kodlayıcısıyla yapılmıştır.
  • ResNet veya ConvNeXt gibi farklı kodlayıcılarda performans gösterilmemiştir.
  • Kod deposu, eğitilmiş model ağırlıkları veya tam yeniden üretim bağlantısı PDF’de verilmemiştir.
  • Çıkarım süresi yalnızca RTX 3090 üzerinde ölçülmüştür.

Çalışma ne söylüyor, ne söylemiyor?

Çalışmanın gösterdiğiÇalışmanın göstermediği
Laplasyen kenar öncülünün dikkat hesaplamasına eklenmesi doğrulama verilerinde sınır metriklerini iyileştirmiştir.Laplasyenin bütün tıbbi görüntü görevlerinde en iyi operatör olduğu kanıtlanmamıştır.
EGA-SAM2-UNet, karşılaştırılan modellerden daha yüksek Dice ve daha düşük HD95 elde etmiştir.Modelin bütün klinik merkezlerde aynı başarıyı göstereceği kanıtlanmamıştır.
MICCAI’den DENTEX’e doğrudan aktarımda performansın büyük kısmı korunmuştur.Alan değişiminden etkilenmediği söylenemez; performans anlamlı biçimde düşmüştür.
LoRA, modelin küçük bir parametre bölümüyle dental alana uyarlanmasını sağlamıştır.Bütün eğitim sürecinin düşük donanımlı tek bir bilgisayarda yapıldığı gösterilmemiştir.
Model dişlerin piksel düzeyinde sınırlarını üretmektedir.Çürük, enfeksiyon, tümör veya periodontal hastalık tanısı koymamaktadır.
HD95 0,79 mm olarak bildirilmiştir.Bütün sınır noktalarının hatasının 0,79 mm’den az olduğu söylenemez.
Zorlu olgularda 0,95 mm HD95 korunmuştur.Metal artefaktlı bütün olgularda güvenilir sonuç garanti edilmemektedir.
Azı dişlerinde nnUNet’e göre daha yüksek performans elde edilmiştir.Azı dişlerindeki segmentasyonun hatasız olduğu söylenemez; en düşük Dice yine bu gruptadır.
Model yaklaşık 124 ms’de görüntü işleyebilmiştir.Her klinik bilgisayarda aynı hızla çalışacağı gösterilmemiştir.
Mimari teorik olarak farklı kodlayıcılarla birleştirilebilir.Kodlayıcıdan bağımsızlık farklı kodlayıcı deneyleriyle doğrulanmamıştır.

Geçmiş, bugün ve gelecek açısından önemi

Geçmiş açısından dental segmentasyon önce klasik kenar operatörleri, eşikleme ve kümeleme yöntemlerine dayanmıştır. CNN döneminde UNet gibi mimariler görüntü özelliklerini öğrenmeye başlamış, ancak düşük kontrastlı sınırlar ve uzun mesafeli anatomik ilişkiler sorun olmaya devam etmiştir.

Transformer ve temel model döneminde genel görsel bilgi çok daha güçlü hâle gelmiştir. Buna rağmen bu modeller doğal görüntülerde öğrendikleri bilgiyi tıbbi radyografiye doğrudan aktardıklarında alan farkı ve sınır duyarsızlığı ortaya çıkmıştır.

Bugün açısından çalışma, klasik görüntü işlemedeki sabit Laplasyen operatörü ile modern dikkat mekanizmasını bir araya getirmektedir. Temel fikir, klasik ve öğrenilebilir yöntemleri birbirinin alternatifi olarak görmek yerine sabit geometrik öncülleri öğrenilmiş temsilin içine yerleştirmektir.

Gelecek açısından benzer kenar kılavuzlu dikkat modülleri şu alanlarda araştırılabilir:

  • Retina damarlarının ayrılması,
  • Histopatolojide hücre zarlarının sınırlandırılması,
  • Ultrason görüntülerinde lezyon sınırları,
  • Periodontal kemik seviyesi analizi,
  • Periapikal lezyon segmentasyonu,
  • Çürük ve restorasyon sınırlarının belirlenmesi,
  • CBCT’de üç boyutlu diş ve kök segmentasyonu.

Ancak bu genellenebilirlik henüz deneysel olarak gösterilmemiştir. Gelecek çalışmaların farklı anatomik bölgeler, farklı cihazlar ve prospektif klinik veriler üzerinde doğrulama yapması gerekmektedir.

Çalışmanın Yöntemi ve Bulguları

Teknik iş akışının özeti

AşamaUygulanan işlemAmaç
GirdiPanoramik dental radyografiDişlerin piksel düzeyinde ayrılması
Ön işleme0–1 normalizasyon ve 1024×1024 yeniden boyutlandırmaGörüntüleri ortak ölçekte sunmak
Veri artırmaYatay çevirme, ±15° döndürme, ±%10 parlaklık/kontrastGenelleme kapasitesini artırmak
KodlayıcıSAM 2 Vision TransformerHiyerarşik görsel özellikler çıkarmak
UyarlamaLoRA, \(r=16\), \(\alpha=32\)Az sayıda parametreyle radyografi alanına uyum
Çok ölçekli işlemeRFB, genişletme oranları 1, 3 ve 5Farklı büyüklükteki anatomik örüntüleri yakalamak
Özellik birleştirmeYukarıdan aşağı çapraz dikkatYüksek seviye anlam ile düşük seviye ayrıntıyı birleştirmek
Kenar çıkarmaSabit 3×3 Laplasyen çekirdeğiDüşük kontrastlı geçişleri belirlemek
Dikkat kalibrasyonuParalel kanal ve uzamsal dikkatÖnemli özellikleri ve sınır konumlarını güçlendirmek
Kod çözmeUNet benzeri hiyerarşik yeniden yapılandırmaTam çözünürlüklü diş maskesi üretmek
EğitimDice + BCE ve yarı denetimli tutarlılıkEtiketli ve etiketsiz veriden yararlanmak

Temel denklemler

İşlemDenklemİşlev
LoRA\(h=W_0x+BAx\)Dondurulmuş ana modele düşük dereceli güncelleme eklemek
Çapraz dikkat\(F_{\mathrm{fused}}=\operatorname{Attention}(F_{\mathrm{up}},F_{\mathrm{enc}},F_{\mathrm{enc}})\)Kodlayıcı ayrıntılarını yüksek seviye anlamla süzmek
Kenar çıkarma\(E=\operatorname{ReLU}(\mathcal{B}(\operatorname{Conv}_{dw}(F,K_{\mathrm{Lap}})))\)Ara özelliklerden yapısal kenar tanımlayıcısı üretmek
Kanal dikkati\(M_c(E)=\sigma(\operatorname{MLP}(\operatorname{GAP}(E)))\)Sınırla ilişkili özellik kanallarını seçmek
Uzamsal dikkat\(M_s(E)=\sigma(\operatorname{Conv}_{7\times7}(E))\)Sınırın bulunduğu görüntü konumlarını seçmek
EGA birleşimi\(F_{\mathrm{EGA}}=F+F\otimes M_c(E)+F\otimes M_s(E)\)Semantik özellik ile iki tür kenar dikkatini birleştirmek
Toplam kayıp\(\mathcal{L}=0.7\mathcal{L}_{Dice}+0.3\mathcal{L}_{BCE}\)Bölgesel örtüşme ve piksel doğruluğunu birlikte optimize etmek

Veri ve eğitim özeti

BaşlıkDeğer
MICCAI toplam görüntü2.500
Etiketli eğitim görüntüsü30
Etiketsiz eğitim görüntüsü2.350
Doğrulama görüntüsü20
DENTEX toplam görüntü1.005
Bağımsız eğitim koşusu5
Eğitim epoch sayısı100
LoRA eğitilebilir parametreYaklaşık 0,42 milyon
Toplam model parametresi96,8 milyon

Ana sayısal sonuçlar

DeğerlendirmeSonuç
MICCAI Dice%93,9 ± 0,2
MICCAI IoU%88,5 ± 0,3
MICCAI ASD0,18 ± 0,01 mm
MICCAI HD950,79 ± 0,04 mm
HD95 için %95 güven aralığı0,75–0,83 mm
Dice için %95 güven aralığı%93,7–94,1
MedSAM’a göre göreli HD95 azalması%22,6
DENTEX Dice%91,2 ± 0,5
DENTEX HD950,95 ± 0,06 mm
Zor olgularda Dice%91,8 ± 0,5
Zor olgularda HD950,95 ± 0,07 mm
Molar Dice%91,7 ± 0,5
Molar HD950,97 ± 0,07 mm
Görüntü başına çıkarım süresi124 ± 6 ms, RTX 3090 üzerinde

Bilimsel sonuçların teknik yorumu

Çalışmanın en önemli bulgusu yalnızca daha yüksek Dice değeri değildir. Modelin en belirgin avantajı, sınır hatasını temsil eden HD95 ölçütünde görülmüştür.

Bu sonuç, panoramik radyografilerde genel diş alanının zaten güçlü modellerle büyük ölçüde bulunabildiğini; asıl geliştirme alanının düşük kontrastlı kök, boyun ve dişler arası sınırlar olduğunu göstermektedir.

Sabit Laplasyen operatörü tek başına son segmentasyonu üretmemektedir. Operatör, öğrenilmiş özelliklerin hangi bölümlerine dikkat edileceğini yönlendirmektedir. Bu nedenle çalışma klasik görüntü işleme ile derin öğrenmenin birbirini tamamlayabileceğine ilişkin bir örnek sunmaktadır.

Ancak sonuçların klinik değere dönüşebilmesi için modelin farklı ülkelerden, cihazlardan ve hasta gruplarından gelen prospektif görüntülerde sınanması; uzmanlar arası referans farklılığının belirlenmesi ve segmentasyon çıktılarının gerçek tedavi planlarına etkisinin ölçülmesi gerekmektedir.

Kaynak ve Yöntem Notu

Bu içerik, Yukun Du, Rui Zhang, Yude Ji, Jiaqian Song ve Bo Ma tarafından hazırlanan “Hierarchical Refinement of SAM 2 via Edge-Guided Attention for High-Fidelity Dental Segmentation in Panoramic Radiography” başlıklı çalışmaya dayanmaktadır.

Yazarlar Shihezi Üniversitesi Bilgi Bilimi ve Teknolojisi Fakültesi ile Shihezi Üniversitesi Klinik Tıp Fakültesi bünyesinde çalışmaktadır.

Belge, panoramik dental radyografi segmentasyonu için yeni bir yapay zekâ mimarisi geliştiren hesaplamalı yöntem geliştirme ve karşılaştırmalı performans araştırması niteliğinde bir preprinttir.

Metinde açıkça “This preprint research paper has not been peer reviewed” ifadesi bulunmaktadır. Dolayısıyla çalışma hakem değerlendirmesinden geçmemiştir. PDF’de doğrulanabilir nihai dergi kabulü veya çalışmanın kendisine ait DOI bilgisi bulunmamaktadır.

Çalışmada yalnızca kamuya açık MICCAI STS 2024 ve DENTEX görüntü veri setleri kullanılmıştır. Yazarlar doğrudan yeni hasta verisi toplamamış, hastalara görüntüleme veya klinik müdahale uygulamamıştır.

Araştırma, Shihezi Üniversitesi İnovasyon ve Gelişim Özel Projesi kapsamında CXFZ202309 numaralı destekle finanse edilmiştir. Yazarlar mali veya kişisel çıkar çatışması bulunmadığını bildirmiştir.

Ana performans sonuçları MICCAI STS 2024 veri setindeki 20 görüntülük doğrulama kümesinde beş eğitim koşusu üzerinden verilmiştir. Veri setinde 100 görüntülük gizli test kümesi bulunmasına rağmen PDF’de bu kümeye ait ayrı sonuç tablosu sunulmamıştır.

DENTEX alan dışı değerlendirmesi 50 görüntülük doğrulama kümesinde yapılmıştır. Sonuçlar farklı veri alanında genelleme potansiyeli göstermektedir; ancak Dice değerindeki 2,7 puanlık düşüş, alan farkının tamamen ortadan kaldırılmadığını göstermektedir.

Çalışma klinik deney değildir. Modelin implant komplikasyonlarını azalttığı, ortodontik tedavi sonuçlarını iyileştirdiği veya diş hekimi değerlendirmesinin yerine geçtiği gösterilmemiştir.

EGA-SAM2-UNet yalnızca diş yapılarının segmentasyonunu hedeflemektedir. Çürük, periodontal hastalık, periapikal patoloji, tümör veya diğer dental hastalıklar için doğrulanmış tanı sistemi değildir.

Çalışmada bildirilen HD95 değerleri sınır uzaklığı ölçütleridir. Bu değerler görüntüleme sisteminin geometrik büyütme, üst üste binme ve radyografik bozulma gibi temel fiziksel sınırlamalarını ortadan kaldırmaz.

EGA modülünün kodlayıcıdan bağımsız olduğu mimari açıdan ileri sürülmektedir; ancak araştırmada yalnızca SAM 2 tabanlı yapı deneysel olarak değerlendirilmiştir. Farklı CNN veya Transformer kodlayıcılarıyla genellenebilirlik henüz doğrulanmamıştır.

Bu içerik yalnızca yüklenen PDF’deki yöntem, matematiksel denklemler, deney protokolü, şekiller, tablolar ve yazarların yorumları temel alınarak hazırlanmıştır. PDF’de bulunmayan tanı başarısı, klinik güvenlik garantisi, bütün görüntüleme cihazlarında eşit performans veya insan uzman düzeyine ulaşıldığı iddiası eklenmemiştir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy