Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Sosyal Bilimler / Finansal ve Yatırım Planlama / Gayrimenkul Pazar İstihbaratı İçin Makine Öğrenmesi Tabanlı Alıcı Segmentasyonu ve Yatırım Profilleme
Finansal ve Yatırım Planlama

Gayrimenkul Pazar İstihbaratı İçin Makine Öğrenmesi Tabanlı Alıcı Segmentasyonu ve Yatırım Profilleme

Alıcı segmentasyonu, aynı gayrimenkul pazarında işlem yapan müşterileri satın alma sıklığı, işlem değeri, birim alan fiyatı, yaş ve memnuniyet gibi davranışsal/işlemsel özelliklerine göre benzer gruplara ayırmayı amaçlar.

21/09/2026  Veri Anla 84 görüntüleme
Gayrimenkul Pazar İstihbaratı İçin Makine Öğrenmesi Tabanlı Alıcı Segmentasyonu ve Yatırım Profilleme

Alıcı segmentasyonu, aynı gayrimenkul pazarında işlem yapan müşterileri satın alma sıklığı, işlem değeri, birim alan fiyatı, yaş ve memnuniyet gibi davranışsal/işlemsel özelliklerine göre benzer gruplara ayırmayı amaçlar. Bu çalışma, 2.000 müşteri kaydı ile 10.000 gayrimenkul ilanını kullanarak K-Means tabanlı üç müşteri segmenti oluşturuyor ve bu segmentleri gayrimenkul pazarlaması ile müşteri yönetimi açısından yorumluyor.

Gayrimenkul veri setindeki 10.000 ilanın 7.305'i satılmış, 2.695'i ise Available durumundadır. Satılmış kayıtlar müşterilerle eşleştirilmiş; her müşteri için ortalama satış fiyatı, medyan satış fiyatı, ortalama ft² başına fiyat, alış sayısı ve toplam işlem/ilan sayısı hesaplanmış; bunlara memnuniyet puanı ve yaş eklenerek yedi boyutlu sayısal kümeleme tablosu oluşturulmuştur.

Çalışma K-Means algoritmasını k=2 ile k=8 arasında karşılaştırmaktadır. Burada önemli bir metodolojik ayrıntı vardır: Silhouette Score ile Calinski–Harabasz Index'in en yüksek değerleri k=2'de ortaya çıkmaktadır. k=3, metriklerin mutlak optimumu olduğu için değil; Calinski–Harabasz eğrisindeki ilk anlamlı kırılma, k=3'te hâlâ kabul edilebilir görülen Silhouette seviyesi ve projenin en az üç iş açısından yorumlanabilir segment istemesi nedeniyle seçilmiştir.

Sonuçta 51 kişilik küçük ve sık işlem yapan bir grup, 813 kişilik yüksek işlem değerine sahip grup ve 1.136 kişilik büyük ana akım grup oluşmuştur. Kaynak bunları sırasıyla Premium Buyers, Mid-Market Buyers ve Mainstream Buyers olarak adlandırmaktadır. Ancak “Premium” etiketi en pahalı gayrimenkulleri alan grup anlamına gelmemektedir; en yüksek ortalama ve medyan satış fiyatı Cluster 1'de görülmektedir.

Gayrimenkul müşterilerini neden tek bir kitle olarak ele almamak gerekiyor?

Gayrimenkul platformunda ilk evini alan birey, tekrar tekrar mülk satın alan yatırımcı, şirket hesabı veya daha yüksek fiyatlı birimlere yönelen müşteri aynı satın alma davranışına sahip değildir. Tek bir pazarlama mesajı bütün bu grupların ihtiyaçlarını aynı doğrulukla hedefleyemez.

Çalışmanın amacı bu farkları önceden tanımlanmış müşteri etiketleriyle dayatmak yerine, işlem verisinin içindeki örüntüleri gözetimsiz öğrenmeyle ortaya çıkarmaktır.

Müşteri veri seti

2.000 müşteriden oluşan veri setinde bireysel müşterilerin oranı %94,9, şirketlerin oranı %5,1'dir. Cinsiyet dağılımı yaklaşık dengelidir. Müşterilerin %76,9'u ABD'dedir ve California tek başına %31,7'lik payla baskın bölgedir.

Satın alma amacı açısından müşterilerin %69,3'ü Home, %30,8'i Investment kategorisindedir. Kredi başvurusu yapanların oranı %36,8; yapmayanların oranı %63,2'dir. Ortalama memnuniyet puanı 5 üzerinden 3,03'tür.

Gayrimenkul veri seti

ÖzellikKaynakta raporlanan yapı
Toplam ilan10.000
Sold7.305 (%73,1)
Available2.695 (%26,9)
Alan411–1.957 ft²
Satış fiyatıYaklaşık 100.000–730.000 ABD doları
Ft² başına fiyatYaklaşık 220–430 ABD doları
Apartments%85,5
Office%14,5

Eksik veriler gerçekten rastgele mi?

Available durumundaki ilanlarda client_ref bulunmamaktadır; çünkü bu mülk henüz bir müşteriye bağlanmamıştır. Kaynak bu yapıyı MNAR olarak tanımlamaktadır.

Pratik açıdan önemli nokta, eksikliğin veri hatası gibi görünmemesidir: missing değerler Available statüsüyle sistematik biçimde örtüşmektedir. Kümeleme yalnız müşteriyle eşleşmiş satılmış ilanlardan üretildiği için Available kayıtların boş client_ref alanı doğrudan küme modeline dahil edilmemiştir.

Hangi özellikler müşteriyi temsil ediyor?

Satılmış ilanlar client_id = client_ref üzerinden müşterilerle birleştirilmiş ve her müşteri için aşağıdaki yedi sayısal özellik hazırlanmıştır:

Özellikİşlevi
avg_sale_priceMüşterinin aldığı mülklerin ortalama işlem değeri
median_sale_priceSatın alma fiyatlarının medyanı
avg_price_per_sqftOrtalama ft² başına ödenen fiyat
purchases_countSatın alma sıklığı
total_listingsMüşteriyle ilişkili toplam işlem/ilan yoğunluğu
satisfaction_scoreMemnuniyet puanı
age1 Ocak 2025 referans tarihinden türetilen yaş

Neden StandardScaler kullanıldı?

K-Means, noktalar arasındaki Öklid mesafesine dayanır. Satış fiyatları yüz binlerle ifade edilirken memnuniyet puanı 1–5 aralığındadır. Ham değerler doğrudan modele verilirse büyük sayısal ölçeğe sahip fiyat değişkenleri mesafeyi baskılar.

Bu nedenle bütün yedi sayısal özellik sıfır ortalama ve birim standart sapma olacak şekilde StandardScaler ile standartlaştırılmıştır.

Çalışmanın Yöntemi ve Bulguları

K-Means nasıl çalışıyor?

K-Means, veri noktalarını önceden belirlenen k sayıda kümeye dağıtır ve her gözlemi kendisine en yakın küme merkezine atar. Algoritma, kümelerin kendi içindeki toplam kareli mesafeyi küçültmeye çalışır.

Bu çalışmada k=2, 3, 4, 5, 6, 7 ve 8 seçenekleri karşılaştırılmıştır.

Silhouette Score ne ölçüyor?

Silhouette Score, bir müşterinin kendi kümesindeki diğer müşterilere ne kadar yakın olduğunu ve en yakın alternatif kümeye ne kadar uzak olduğunu aynı ölçütte birleştirir.

Değer +1'e yaklaştıkça ayrım güçlü, sıfıra yaklaştıkça kümeler üst üste binen, negatif olduğunda ise bazı gözlemler yanlış kümeye atanmış olabilir.

Calinski–Harabasz Index ne ölçüyor?

Calinski–Harabasz Index, kümeler arasındaki yayılımı küme içi yayılımla karşılaştırır. Daha yüksek değer, genel olarak daha kompakt ve birbirinden ayrılmış kümeler anlamına gelir.

k=3 gerçekten en iyi küme sayısı mı?

Kaynağın kendi metrik sonuçlarına göre salt matematiksel anlamda kesin biçimde değil. Her iki iç doğrulama ölçütü de en yüksek değerini k=2'de almıştır. k=3; CH eğrisindeki ilk kırılma, görece kararlı Silhouette sonucu ve projenin üç iş segmenti istemesi nedeniyle tercih edilen bir uzlaşmadır.

Calinski–Harabasz Index k=2'de yaklaşık 506 iken k=8'de yaklaşık 347'ye kadar sürekli düşmektedir. Silhouette değerleri ise bütün k seçeneklerinde sıfıra yakın kalmaktadır.

Dolayısıyla çalışmanın üçlü segmentasyonu iş açısından yorumlanabilir olabilir; ancak verinin doğal olarak kesin ve güçlü üç kümeye ayrıldığı iddiası bu metriklerle güçlü biçimde desteklenmemektedir.

Küme büyüklükleri

KümeKaynak etiketiMüşteriPay
Cluster 0Premium Buyers51%2,5
Cluster 1Mid-Market Buyers813%40,6
Cluster 2Mainstream Buyers1.136%56,8

PCA görseli ne gösteriyor?

Yedi boyutlu standartlaştırılmış müşteri özellikleri, yalnız görselleştirme amacıyla iki ana bileşene indirgenmiştir.

Kaynağın 15–16. sayfalardaki PCA grafiğinde Cluster 0 üst-sağ bölgede daha kompakt ve diğerlerinden belirgin biçimde uzak görünmektedir. Cluster 1 ve Cluster 2 ise diyagonal yönde kısmen üst üste binmektedir.

Bu görsel segment yapısını anlamayı kolaylaştırır; ancak PCA grafiği modelden sonra üretildiği için bağımsız bir dış doğrulama testi değildir.

ANOVA sonuçları

ÖzellikF-istatistiğip-değeri
median_sale_price1609,44<0,001
avg_sale_price1436,81<0,001
purchases_count1049,91<0,001
avg_price_per_sqft83,01<0,001
age8,490,0002

Bu sonuçlar kümeler arasında söz konusu özelliklerde büyük farklar bulunduğunu göstermektedir.

Ancak bu özellikler aynı zamanda K-Means'in kümeleri oluştururken kullandığı değişkenlerdir. Dolayısıyla ANOVA'nın anlamlı çıkması bağımsız örneklemde yapılan doğrulamayla eşdeğer değildir. Segmentlerin kararlılığını daha güçlü değerlendirmek için yeniden örnekleme, bootstrap/stability analizi, holdout benzeri yaklaşım veya alternatif kümeleme yöntemleriyle karşılaştırma daha güçlü ek kanıt sağlayabilir.

Cluster 0: Premium Buyers

Cluster 0 yalnız 51 müşteriden oluşmasına rağmen en yüksek memnuniyet, yaş, purchases_count ve total_listings değerlerine sahiptir.

Dikkat çekici biçimde fiyat özelliklerinde lider değildir. Kaynak bu nedenle grubu tek işlemde en pahalı mülkü alan müşterilerden çok, tekrar eden işlemleri bulunan sadık ve yüksek değerli ilişki müşterileri olarak yorumlamaktadır.

Dolayısıyla “Premium” etiketi burada ilişki ve işlem frekansı primi şeklinde okunmalıdır.

Cluster 1: Mid-Market Buyers

813 kişilik Cluster 1, en yüksek ortalama ve medyan satış fiyatına sahiptir. Alış sıklığı Cluster 0'a göre daha ılımlıdır.

Kaynak bu grubu tek veya daha az sayıda fakat yüksek değerli satın alma yapan, daha büyük apartment veya office birimlerine yönelebilen müşteriler şeklinde yorumlamaktadır.

Bu nedenle “Mid-Market” adı ilk bakışta yanıltıcı olabilir; işlem fiyatı bakımından grubun kendisi üç küme içinde üst uçta bulunmaktadır.

Cluster 2: Mainstream Buyers

1.136 müşteriyle en büyük segmenttir. Standardize özelliklerin çoğunda ortalamanın altında kalır ve kaynak tarafından fiyat duyarlı, giriş seviyesi veya ana akım müşteri tabanı olarak yorumlanır.

Bu segmentin büyüklüğü nedeniyle düşük müşteri başına değer, toplam ticari öneminin düşük olduğu anlamına gelmez.

Segmentlerden doğrudan pazarlama kararı çıkarmak güvenli mi?

Segmentler müşteri davranışı hakkında kullanılabilir hipotezler üretir; ancak rapordaki pazarlama önerilerinin kendisi deneysel olarak sınanmamıştır. “Bu segmente şu kampanya uygulanırsa dönüşüm artar” gibi nedensel sonuçlar için A/B testleri, prospektif kampanyalar veya bağımsız doğrulama gerekir.

Premium gruba önerilen yaklaşım

Kaynak bütün 51 müşteri için premium CRM/ilişki yöneticisi, yeni envantere erken erişim, kişiselleştirilmiş portföy incelemeleri ve referral programları önermektedir.

Bu önerilerin mantığı yüksek tekrar işlem ve memnuniyet düzeyidir; fakat rapor referral teşvikinin gerçekten daha yüksek dönüşüm sağlayacağını test etmemektedir.

Mid-Market gruba önerilen yaklaşım

Kaynak daha büyük alanlı ve Office birimlere upsell, yaklaşık 350.000–500.000 dolar ve 1.100 ft² üzeri ilanların hedeflenmesi ve Agency kanalında kampanya yapılmasını önermektedir.

Bunlar küme profilinden türetilmiş hedefleme kurallarıdır; satış artışı deneysel olarak ölçülmemiştir.

Mainstream gruba önerilen yaklaşım

Website/SEO optimizasyonu, kredi olanaklarının görünürlüğü ve 800 ft² altı, 250.000 dolar altı giriş seviyesi ilanların öne çıkarılması önerilmektedir.

Ayrıca ikinci satın almayı teşvik ederek Mainstream'den Mid-Market'e müşteri geçişi oluşturacak sadakat mekanizmaları düşünülmektedir.

Segment etiketi ile müşteri personası aynı şey mi?

Hayır.

K-Means yalnız üç veri güdümlü küme oluşturmuştur. Proje brifinde ise dört iş personası vardır: Global Investors, Luxury Investors, Corporate Buyers ve First-Time Buyers.

Kaynak, üç kümeyi bu dört persona ile sonradan eşleştirmektedir. Örneğin Cluster 0 hem Global Investors hem Luxury Investors ile ilişkilendirilirken Cluster 2 içinde loan_applied = Yes olanlar First-Time Buyers olarak ayrıca bölünebilir.

Bu ikinci aşama K-Means tarafından keşfedilmiş yeni küme değildir; kural tabanlı iş sınıflandırmasıdır.

Streamlit dashboard ne sağlıyor?

Rapor dört temel panel tanımlamaktadır:

Panelİçerik
Buyer Segmentation OverviewKüme dağılımı ve büyüklüğü
Investor Behaviour DashboardSegment bazında fiyat ve kredi örüntüleri
Geographic Buyer AnalysisBölgesel dağılım ve cluster haritası
Segment Insights PanelÖzellik ortalamaları ve normalize heatmap

Country, region, acquisition purpose ve client type filtrelerinin bütün grafiklere dinamik olarak uygulanabildiği belirtilmektedir.

Literatür bölümündeki iki önemli doğrulama sorunu

Rapor, Limsombunchai ve arkadaşlarının buyer-segment bazlı hedonic modelleri sınadığını aktarmaktadır. Bağımsız bibliyografik kayıt ise çalışmanın 200 Christchurch evi üzerinde hedonic price model ile artificial neural network karşılaştırması olduğunu göstermektedir. Dolayısıyla kaynak rapordaki segmentasyon tanımı bu makaleyle uyumlu görünmemektedir.

Antipov ve Pokryshevskaya (2012) için de benzer sorun vardır. Rapor bunu K-Means'ten türeyen buyer segmentlerine ensemble classification uygulaması gibi anlatırken özgün çalışma Random Forest ile konut mass appraisal ve CART tabanlı model diagnostiklerine odaklanmaktadır.

Bu durum ana K-Means analizindeki sayıları kendiliğinden geçersiz kılmaz; fakat literatür bölümündeki bazı gerekçelendirmelerin kaynaklarıyla yeniden eşleştirilmesi gerektiğini gösterir.

Çalışmanın güçlü tarafları

Veri temizleme adımları açık biçimde belgelenmiştir. Kategorik değişkenlerle kümeleme değişkenleri birbirinden ayrılmıştır. Standardizasyon gerekçesi doğru problemle bağlantılıdır. Küme büyüklükleri, PCA, ANOVA ve segment profilleri birlikte sunulmuştur. Dashboard, teknik çıktıyı iş kullanıcılarına taşıma amacını açık hale getirmektedir.

Çalışmanın sınırlılıkları

Birinci sınırlılık, k=3 kararının iş gereksiniminden etkilenmesidir. İkinci sınırlılık, düşük Silhouette değerlerinin segment sınırlarının güçlü olmadığını düşündürmesidir.

Üçüncü sınırlılık, aynı değişkenlerle kurulan kümelerin yine aynı değişkenler üzerinden ANOVA ile “doğrulanmasıdır”. Dördüncü sınırlılık, segment etiketlerinin — özellikle “Premium” ve “Mid-Market” — doğrudan sayısal fiyat sırasıyla örtüşmemesidir.

Beşinci sınırlılık, yalnız mevcut işlem davranışının kullanılmasıdır. Zaman boyutu, müşteri yaşam boyu değeri, piyasa faizi, konut endeksi ve makroekonomik rejimler modele dahil değildir.

Altıncı sınırlılık, veri tabanının coğrafi olarak güçlü biçimde ABD ve özellikle California ağırlıklı olmasıdır. Bu nedenle segmentlerin başka ülke veya pazarlara doğrudan taşınabilirliği gösterilmiş değildir.

Genel sonuç

Bu çalışma, gayrimenkul müşteri tabanını tek bir kitle olarak görmek yerine işlem davranışından hareketle üç ticari profil oluşturmayı amaçlayan uygulanabilir bir veri bilimi iş akışı sunmaktadır.

Üçlü yapı iş açısından anlaşılırdır: küçük fakat yüksek sıklıklı sadık müşteriler, daha yüksek fiyatlı işlemlere yönelen orta büyüklükte grup ve büyük hacimli ana akım müşteri tabanı.

Bununla birlikte k=3'ün mutlak istatistiksel optimum olduğu sonucu kaynak veriler tarafından güçlü biçimde desteklenmemektedir. Dahili metrikler k=2'yi daha yüksek puanlamış, k=3 kısmen iş gereksinimi nedeniyle seçilmiştir.

Bu nedenle raporun en güçlü kullanımı, “pazardaki doğal üç müşteri sınıfını kesin olarak keşfettik” iddiasından çok, müşteri hedefleme ve dashboard geliştirme için yorumlanabilir bir operasyonel segmentasyon prototipi olarak görülmesidir.

Kaynak ve Yöntem Notu

Özgün çalışma:Machine Learning Based Buyer Segmentation and Investment Profiling for Real Estate Market Intelligence.

Yazar: Gokul Mallabathula.

Kaynak dosyadaki rol: Data Science Intern, Unified Mentor | Parcl Real Estate Intelligence Project.

Kaynak türü: Uygulamalı veri bilimi / gayrimenkul müşteri segmentasyonu proje raporu.

Dosya üzerindeki tarih: Haziran 2025.

SSRN metadata'sı: Date Written 31 Mayıs 2026; Posted 25 Haziran 2026; SSRN abstract 6881578.

DOI: 10.2139/ssrn.6881578.

Tarih uyuşmazlığı: PDF kapağındaki Haziran 2025 ile SSRN metadata'sındaki 2026 tarihleri uyuşmamaktadır. Verianla bu farkı düzeltmeden görünür tutmaktadır.

Hakemlik: Çalışmanın hakemli dergi version-of-record olduğuna dair kanıt bulunmamaktadır; proje/SSRN çalışma metni olarak değerlendirilmiştir.

Lisans: SSRN kaydı hakların saklı olduğunu ve izin olmadan yeniden kullanıma izin verilmediğini belirtmektedir. Bu nedenle kaynak grafiklerinin tasarımı doğrudan kopyalanmamalıdır.

Veri: 2.000 müşteri, 10.000 gayrimenkul ilanı; bunların 7.305'i satılmış, 2.695'i Available durumundadır.

Kümeleme tablosu: 2.000 müşteri üzerinde yedi sayısal özellik.

Özellikler: avg_sale_price, median_sale_price, avg_price_per_sqft, purchases_count, total_listings, satisfaction_score ve age.

Ölçekleme: StandardScaler.

Ana algoritma: K-Means.

k adayları: 2–8.

İç doğrulama metrikleri: Silhouette Score ve Calinski–Harabasz Index.

k seçimi sınırı: Her iki metrik k=2'de zirve yapmıştır. k=3; CH eğrisindeki ilk kırılma, yorumlanabilirlik ve en az üç iş segmenti gereksinimi birlikte değerlendirilerek seçilmiştir.

PCA: Yedi boyutlu standartlaştırılmış özelliklerin iki boyutlu görselleştirilmesi için kümelemeden sonra uygulanmıştır.

İstatistiksel analiz: One-way ANOVA ve Tukey HSD. Aynı özelliklerin hem kümeleme hem sonradan anlamlılık testinde kullanılması nedeniyle bu testler bağımsız dış küme doğrulaması değildir.

Segmentler: Cluster 0 — Premium Buyers, n=51; Cluster 1 — Mid-Market Buyers, n=813; Cluster 2 — Mainstream Buyers, n=1.136.

Etiket sınırı: Cluster 0'ın “Premium” adı en yüksek satın alma fiyatına dayanmamaktadır; en yüksek avg_sale_price ve median_sale_price Cluster 1'de bulunmaktadır.

Dashboard: Streamlit tabanlı dört sekmeli dashboard raporlanmaktadır. PDF içinde bağımsız olarak çalıştırılabilir kod deposu veya deployment bağlantısı doğrulanmamıştır.

Literatür kontrolü: Limsombunchai et al. (2004) ve Antipov & Pokryshevskaya (2012) kaynaklarının rapordaki açıklaması, doğrulanabilen özgün çalışma konularıyla tam uyuşmamaktadır. Bu nedenle söz konusu atıflar Verianla metninde segmentasyon yönteminin doğrudan kanıtı olarak kullanılmamıştır.

Gelecek çalışma: Kaynak hiyerarşik kümelemeyle k=3 çözümünün sınanmasını, zamansal işlem verisiyle lifetime-value modelleri kurulmasını, coğrafi kapsamın genişletilmesini ve faiz oranları/bölgesel konut endeksleri gibi makroekonomik göstergelerin eklenmesini önermektedir.

Verianla hazırlama yöntemi: Kaynağın veri büyüklükleri, model adımları, segment sonuçları ve iş önerileri korunmuş; fakat k=3 seçiminin gücü, post-clustering ANOVA'nın doğrulama niteliği, segment isimlerinin anlamı ve literatür atıfları kaynak dışı kesinlik üretmeden metodolojik olarak ayrıştırılmıştır. Kaynakta bulunmayan satış artışı, yatırım getirisi veya tahmin performansı üretilmemiştir.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy