
Bu çalışma, kişisel ve öğrencilik yaşamına ilişkin tavsiyelerin ChatGPT’ye veya bir insan uzmana atfedilmesinin, mesajın yazım kalitesinin ve katılımcıların yapay zekâya yönelik tutumlarının algılanan güvenilirlik ile tavsiyeye uyma isteğini nasıl etkilediğini incelemiştir. Araştırmaya ana dili Fransızca olan 175 kişi katılmış; her katılımcı beşi iyi, beşi kötü yapılandırılmış toplam on tavsiye senaryosunu değerlendirmiştir. Sıralı yanıtların ve tekrarlı ölçümlerin yapısına uygun kümülatif bağlantılı karma modeller kullanılmıştır. Sonuçlar, mesajın ChatGPT’ye veya insan uzmana atfedilmesinin tek başına güvenilirlik ya da tavsiyeye uyma üzerinde anlamlı bir etkisi olmadığını; iyi yazılmış mesajların ise güvenilirliği anlamlı biçimde artırdığını göstermiştir. Mesaj kalitesinin tavsiyeye uyma üzerindeki genel ana etkisi anlamlı değildir.
Yapay zekâya daha olumlu yaklaşan katılımcılar genel olarak mesajları daha güvenilir bulmuş ve tavsiyelere daha fazla uyma isteği göstermiştir. Ancak bu eğilim yalnızca ChatGPT etiketi taşıyan mesajlarla sınırlı değildir; insan uzman etiketi taşıyan mesajlarda da görülmüştür. Keşifsel analizler, yapay zekâya olumlu tutumun özellikle iyi yazılmış mesajların değerlendirilmesini güçlendirdiğini, kötü yazılmış mesajlara ise otomatik bir güven sağlamadığını göstermektedir. Entelektüel alçakgönüllülük ana modellerde doğrudan bir belirleyici değildir; fakat keşifsel sonuçlarda iyi ve kötü yazılmış mesajları ayırt etme duyarlılığıyla ilişkili görünmektedir.
Çalışmanın en önemli yorum sınırı, gerçek ChatGPT cevaplarının gerçek insan uzman cevaplarıyla karşılaştırılmamış olmasıdır. Araştırmacılar bütün tavsiye metinlerini çalışma için hazırlamış ve aynı metni yalnızca farklı kaynak etiketleriyle göstermiştir. Dolayısıyla sonuçlar, yapay zekâ tarafından gerçekten üretilen tavsiyelerin kalitesini veya güvenilirliğini değil, katılımcıların bir mesaja “ChatGPT” ya da “insan uzman” etiketi verildiğinde nasıl tepki verdiğini açıklamaktadır. Çalışma ayrıca hakem değerlendirmesinden geçmemiş bir preprinttir.
Türkiye açısından değerlendirme: Araştırma deseni Türkiye’de üniversite öğrencileri, öğretmen adayları, psikolojik danışmanlık öğrencileri ve farklı yaş gruplarıyla yeniden uygulanabilir. Böyle bir uyarlamada tavsiyeler Türkçe hazırlanmalı; mesajların dilsel akıcılığı, kültürel uygunluğu ve güvenlik içeriği ayrı ayrı değerlendirilmelidir. Kaynak etiketi deneylerine ek olarak gerçek uzman cevapları, doğrudan büyük dil modelleri tarafından oluşturulan cevaplar ve insan-yapay zekâ ortak üretimi karşılaştırılmalıdır. Türkiye için sonuç çıkarabilmek amacıyla farklı üniversitelerden, eğitim düzeylerinden ve yapay zekâ deneyimlerinden katılımcılar alınmalı; yalnızca “tavsiyeye uyma niyeti” değil, sonraki gerçek davranış da ölçülmelidir. Fransızca konuşan, çoğunluğu genç ve kadın katılımcılardan elde edilen bu sonuçlardan Türkiye’deki bütün öğrencilerin veya toplumun yapay zekâya aynı biçimde yaklaşacağı doğrudan çıkarılamaz.
Araştırmanın temel sorusu nedir?
Araştırma üç temel soruya odaklanmaktadır. Birincisi, aynı tavsiye ChatGPT’ye atfedildiğinde insan uzmana atfedildiği zamandan daha farklı mı değerlendirilmektedir? İkincisi, açık biçimde yapılandırılmış ve somut öneriler sunan mesajlar; belirsiz, tekrarlı ve kararsız ifadeler içeren mesajlardan daha güvenilir ve uygulanabilir mi bulunmaktadır? Üçüncüsü, yapay zekâya yönelik tutumlar ile entelektüel alçakgönüllülük bu değerlendirmeleri değiştirmekte midir?
Çalışma, ikna araştırmalarındaki iki işlem yolundan hareket etmektedir. Sezgisel işlemde kişi, mesajı ayrıntılı biçimde incelemek yerine “Bunu bir uzman söyledi” veya “Bunu yapay zekâ üretti” gibi kaynak ipuçlarına dayanabilir. Sistematik işlemde ise mesajın gerekçeleri, tutarlılığı, açıklığı ve somutluğu daha dikkatli değerlendirilir. Araştırmacılar, yapay zekâ tavsiyelerinde bu iki yolun hangisinin daha belirleyici olduğunu sınamak istemiştir.
Kaynak etkisi nasıl test edilmiştir?
Deneyde kaynak, katılımcılar arası bir değişken olarak düzenlenmiştir. Katılımcılar rastgele iki gruptan birine atanmıştır:
- Bir gruba tavsiyelerin ChatGPT tarafından verildiği söylenmiştir.
- Diğer gruba aynı tavsiyelerin bir insan uzman veya psikolog tarafından verildiği söylenmiştir.
Kaynak koşulları arasında tavsiye metninin içeriği değiştirilmemiştir. Yalnızca cevabın üzerinde gösterilen kaynak etiketi farklıdır. Bu yöntem, metnin gerçek kalitesini sabit tutarak yalnızca “yapay zekâ” veya “insan” etiketinin etkisini sınamak için kullanılmıştır.
Bu ayrıntı, sonuçların doğru yorumlanması açısından kritiktir. Araştırma, ChatGPT’nin ürettiği özgün bir cevabı insan uzmanın yazdığı özgün bir cevapla karşılaştırmamaktadır. Katılımcılar kaynağın gerçek olduğuna inandırılmış, fakat karşılaştırılan unsur gerçekte yalnızca kaynak bilgisidir.
Mesaj kalitesi nasıl değiştirilmiştir?
Her senaryo için iyi ve kötü yazılmış olmak üzere iki cevap sürümü hazırlanmıştır. Yüksek kaliteli mesajların iki temel özelliği bulunmaktadır:
- Problem tanımı, somut öneriler ve sonraki adımlar arasında düzenli bir düşünce akışı bulunması,
- “Bir adım geri çekilin”, “duygularınızı açıkça ifade edin” veya “dışarıdan destek alın” gibi belirli ve uygulanabilir öneriler sunulması.
Düşük kaliteli mesajlar ise açık bir düşünce ilerlemesine sahip değildir. “Belki”, “duruma bağlı”, “işe yarayabilir”, “ama daha kötü de olabilir” gibi çok sayıda olasılık ve belirsizlik ifadesi içermektedir. Bu cevaplar aynı konunun çevresinde dolaşmakta, fakat belirgin bir karar veya eylem yolu önermemektedir.
Örneğin duygusal manipülasyon içeren bir ilişki senaryosunda yüksek kaliteli cevap, sağlıksız ilişki belirtilerini tanımlamakta, kişinin durumuna dışarıdan bakmasını önermekte, konuşmada kullanabileceği somut bir ifade vermekte ve gerektiğinde arkadaş, aile veya terapist desteği aramasını söylemektedir. Düşük kaliteli sürüm ise konuşmak, beklemek, tepki vermemek veya ilişkiyi sorgulamak gibi birbiriyle yarışan seçenekleri sıralamakta; her seçeneğin işe yarayıp yaramayacağını belirsiz bırakmaktadır.
Deneyde hangi senaryolar kullanılmıştır?
Araştırmacılar akademik, duygusal ve kişiler arası güçlükler yaşayan öğrencileri konu alan on kısa yaşam senaryosu oluşturmuştur. Örneklerden birinde yakın arkadaşıyla tartışan ve yalnızlık yaşayan bir öğrenci, arkadaşlığı düzeltmek ve yalnızlıktan çıkmak için ne yapabileceğini sormaktadır. Başka bir örnekte, duygusal manipülasyon yaşadığını düşünen bir kişi ilişkideki dengesini yeniden kurmaya çalışmaktadır.
Her katılımcı on senaryonun tamamını görmüştür. Bunların beşine iyi yazılmış, beşine kötü yazılmış cevap eşleştirilmiştir. Hangi senaryonun hangi kalite sürümüyle gösterileceği Qualtrics üzerinden rastgele belirlenmiştir. Böylece belirli bir senaryonun sürekli iyi veya sürekli kötü cevapla eşleşmesinin önüne geçilmek istenmiştir.
Deney akış şeması ne göstermektedir?
Çalışmanın işlem şeması, onam ve demografik bilgilerden sonra katılımcıların rastgele yapay zekâ veya insan kaynağı koşuluna dağıtıldığını göstermektedir. Her kaynak grubundaki katılımcılar on senaryo değerlendirmiş; bunların beşinde iyi, beşinde kötü yazılmış mesaj görmüştür. Kaynak katılımcılar arasında, mesaj kalitesi ise aynı katılımcının içinde değişmiştir.
Deneyin ikinci aşamasında yapay zekâya yönelik tutum, entelektüel alçakgönüllülük ve sosyodemografik bilgiler ölçülmüştür. Bu ölçeklerin senaryolardan sonra verilmesinin amacı, katılımcıların yapay zekâ hakkındaki düşüncelerine önceden dikkat çekerek cevap değerlendirmelerini yönlendirmemektir.
Araştırmanın hipotezleri nelerdir?
| Hipotez | Beklenti | Sonuç |
|---|---|---|
| H1: Kaynak etkisi | İnsan uzmana atfedilen mesajların ChatGPT mesajlarından daha güvenilir bulunması ve daha fazla takip edilmesi beklenmiştir. | Desteklenmemiştir. Kaynağın iki sonuç üzerinde de anlamlı ana etkisi bulunmamıştır. |
| H2: Mesaj kalitesi | İyi yazılmış mesajların daha güvenilir bulunması ve daha fazla takip edilmesi beklenmiştir. | Kısmen desteklenmiştir. Güvenilirlik artmış, fakat tavsiyeye uyma üzerindeki ana etki anlamlı olmamıştır. |
| H3: Kaynak ve kalite etkileşimi | Kalitesiz mesajlarda katılımcıların kaynağa daha çok dayanması ve insan uzmanı tercih etmesi beklenmiştir. | Desteklenmemiştir. Kaynak ile kalite arasında anlamlı etkileşim bulunmamıştır. |
| H4: Yapay zekâ tutumunun kaynak etkisini değiştirmesi | Yapay zekâya olumlu yaklaşanlarda insan ve ChatGPT etiketleri arasındaki farkın azalması beklenmiştir. | Desteklenmemiştir. Yapay zekâ tutumu kaynak etkisini anlamlı biçimde değiştirmemiştir. |
| H5: Entelektüel alçakgönüllülük | Entelektüel alçakgönüllülüğün güvenilirlik ve tavsiyeye uyma değerlendirmelerini artırması beklenmiştir. | Desteklenmemiştir. Ana etkiler anlamlı değildir; yalnızca keşifsel etkileşimler bulunmuştur. |
Kaynak etiketi neden beklenen etkiyi göstermemiş olabilir?
Katılımcılar, mesajların içeriğini, tutarlılığını ve uygulanabilirliğini doğrudan değerlendirmekle görevlendirilmiştir. Araştırmacılar, bu talimatın kişileri yalnızca “yapay zekâ” veya “insan” etiketine dayanan hızlı bir yargıdan uzaklaştırarak mesaja daha analitik yaklaşmaya yöneltmiş olabileceğini düşünmektedir.
Bulgular, ChatGPT etiketinin otomatik bir güven kaybı veya otomatik bir üstünlük oluşturmadığını göstermektedir. Aynı içerik ChatGPT’ye atfedildiğinde, ortalama olarak insan uzman etiketi taşıyan aynı içerikten anlamlı biçimde daha az veya daha fazla güvenilir bulunmamıştır. Benzer biçimde, tavsiyeye uyma niyeti de yalnızca kaynak etiketi nedeniyle değişmemiştir.
Mesaj kalitesi neyi değiştirmiştir?
İyi yazılmış tavsiyeler, kaynak etiketi ne olursa olsun daha güvenilir bulunmuştur. Bu sonuç, açık bir düşünce akışının, belirli önerilerin ve gerekçelendirilmiş bir mesaj yapısının güvenilirlik değerlendirmesinde önemli olduğunu göstermektedir.
Buna karşılık mesaj kalitesinin tavsiyeye uyma üzerindeki genel ana etkisi anlamlı değildir. Betimsel ortalamalarda iyi yazılmış mesajlara uyma puanları daha yüksek görünse de sıralı karma model, diğer değişkenler ve etkileşimler dikkate alındığında bu genel farkı istatistiksel olarak doğrulamamıştır. Bu nedenle “iyi yazılmış her tavsiye mutlaka uygulanır” sonucu çıkarılamaz.
Yapay zekâya yönelik tutumların rolü nedir?
Yapay zekâya daha olumlu yaklaşan katılımcılar, kaynağın ChatGPT veya insan olarak gösterilmesinden bağımsız biçimde mesajları genel olarak daha güvenilir bulmuş ve tavsiyelere daha fazla uyma isteği göstermiştir. Bu sonuç, yapay zekâya yönelik tutumun yalnızca yapay zekâ etiketli içeriklere yönelik dar bir önyargı gibi çalışmadığını göstermektedir.
Keşifsel analizlerde daha ayrıntılı bir örüntü ortaya çıkmıştır. Yapay zekâya olumlu tutum, iyi yazılmış mesajlarda güvenilirlik ve tavsiyeye uyma değerlendirmelerini artırmıştır. Kötü yazılmış mesajlarda ise yapay zekâ tutumuyla değerlendirme arasında anlamlı ilişki bulunmamıştır. Başka bir ifadeyle, yapay zekâya olumlu yaklaşmak kötü yapılandırılmış bir tavsiyeyi otomatik olarak kabul etmek anlamına gelmemiştir.
Entelektüel alçakgönüllülük ne anlama gelmektedir?
Entelektüel alçakgönüllülük, kişinin kendi bilgisinin sınırlı olabileceğini kabul etmesi, yanılabileceğini düşünmesi ve yeni kanıtlar karşısında görüşünü değiştirmeye açık olmasıdır. Araştırmada bu özellik, Kapsamlı Entelektüel Alçakgönüllülük Ölçeği’nin görüşleri değiştirmeye açıklık ile düşünce ve ego bağımsızlığı boyutları üzerinden ölçülmüştür.
Ana analizlerde entelektüel alçakgönüllülük güvenilirlik veya tavsiyeye uyma üzerinde anlamlı bir genel etki göstermemiştir. Bununla birlikte keşifsel analizler, yüksek entelektüel alçakgönüllülüğe sahip katılımcıların iyi ve kötü mesajlar arasında daha güçlü ayrım yaptığını göstermektedir. Bu katılımcılar iyi yazılmış tavsiyeleri daha olumlu, kötü yazılmış tavsiyeleri ise daha olumsuz değerlendirmiştir.
Ayrıca yüksek entelektüel alçakgönüllülük düzeyinde insan uzmana atfedilen mesajlar ChatGPT’ye atfedilenlerden daha güvenilir bulunmuştur. Tavsiyeye uyma açısından entelektüel alçakgönüllülük insan uzman etiketi taşıyan mesajlarda pozitif bir ilişki gösterirken, ChatGPT etiketinde anlamlı ilişki göstermemiştir. Bu sonuçlar doğrulayıcı ana modelin parçası değil, sonradan yapılan keşifsel analizlerdir ve yeni araştırmalarda yeniden sınanmalıdır.
Güvenilirlik grafiği ne göstermektedir?
Çalışmanın 27. sayfasındaki Şekil 4, yapay zekâya yönelik tutum ile tahmini güvenilirlik arasındaki ilişkiyi mesaj kalitesine göre göstermektedir. İyi yazılmış mesajları temsil eden çizgi, yapay zekâya yönelik tutum olumlu hâle geldikçe belirgin biçimde yükselmektedir. Kötü yazılmış mesajların çizgisi ise yataya yakın ve hafif aşağı yönlüdür. Gölgeli alanlar yüzde 95 güven aralıklarını göstermektedir.
Grafiğin dikey ekseni, Tablo 1’deki doğrudan 1-7 Likert ortalaması değildir; sıralı karma modelden elde edilen tahmini ölçek değeridir. Bu nedenle grafikteki 0, 1, 2 ve 3 gibi değerler ham güvenilirlik puanlarıyla doğrudan karşılaştırılmamalıdır.
Tavsiyeye uyma grafiği ne göstermektedir?
Çalışmanın 30. sayfasındaki Şekil 5’te benzer bir örüntü tavsiyeye uyma için görülmektedir. İyi yazılmış mesajlarda yapay zekâya yönelik olumlu tutum arttıkça tahmini uyma isteği yükselmiştir. Kötü yazılmış mesajlarda çizgi yaklaşık yatay kalmıştır. Bu grafik de model tahminlerini ve yüzde 95 güven aralıklarını göstermektedir.
Çalışmanın desteklediği sonuçlar nelerdir?
- Aynı içerik üzerinde yalnızca ChatGPT veya insan etiketi kullanılması, güvenilirlik ve tavsiyeye uyma değerlendirmelerini tek başına anlamlı biçimde değiştirmemiştir.
- Açık, düzenli ve somut öneriler içeren mesajlar daha güvenilir bulunmuştur.
- Mesaj kalitesinin tavsiyeye uyma üzerindeki genel ana etkisi istatistiksel olarak anlamlı değildir.
- Yapay zekâya olumlu tutum, genel olarak daha yüksek güvenilirlik ve tavsiyeye uyma değerlendirmeleriyle ilişkilidir.
- Olumlu yapay zekâ tutumu, kötü yazılmış mesajların eleştirilmeden kabul edilmesine yol açmamıştır.
- Entelektüel alçakgönüllülüğün doğrudan ana etkisi bulunmamıştır.
- Keşifsel sonuçlar, bireysel özelliklerin mesaj kalitesine duyarlılığı değiştirebileceğini düşündürmektedir.
Çalışma neyi kanıtlamamaktadır?
- ChatGPT tarafından gerçekten üretilen tavsiyelerin insan uzmanların gerçek tavsiyeleri kadar iyi olduğunu kanıtlamamaktadır.
- ChatGPT’nin psikolog, psikolojik danışman veya başka bir uzman yerine kullanılabileceğini göstermemektedir.
- Katılımcıların gerçek yaşamda tavsiyeleri uyguladığını göstermemektedir; yalnızca uygulama niyeti ölçülmüştür.
- Mesajların klinik doğruluğunu, güvenliğini veya psikolojik yararını değerlendirmemektedir.
- Yapay zekâya olumlu yaklaşan kişilerin bütün yapay zekâ içeriklerine koşulsuz güvendiğini göstermemektedir.
- Fransa’daki genç katılımcılardan elde edilen sonuçların bütün ülkelere ve yaş gruplarına genellenebileceğini göstermemektedir.
- Keşifsel entelektüel alçakgönüllülük etkileşimlerinin kesin ve tekrarlanmış bulgular olduğunu göstermemektedir.
- Kaynak etiketinin başka alanlarda, özellikle tıbbi, hukuki veya yüksek riskli kararlarda etkisiz olacağını kanıtlamamaktadır.
Güçlü yönler nelerdir?
Çalışmanın temel güçlü yönü, kaynak ile mesaj içeriğini birbirinden ayırmasıdır. Aynı metnin yalnızca kaynak etiketi değiştirilerek sunulması, gözlenen bir farkın metin kalitesinden değil kaynak bilgisinden kaynaklanıp kaynaklanmadığını daha temiz biçimde sınamaya olanak vermektedir.
Her katılımcının hem iyi hem kötü yazılmış mesajları değerlendirmesi, kişisel değerlendirme eğilimlerinin kalite karşılaştırmasını tamamen belirlemesini önlemektedir. Senaryo ve katılımcı düzeyindeki tekrarlı ölçümleri dikkate alan kümülatif bağlantılı karma modellerin kullanılması da 1-7 arasındaki sıralı yanıtların yapısına uygundur.
Çalışmada güvenilirlik ile tavsiyeye uyma isteğinin ayrı sonuçlar olarak incelenmesi de önemlidir. Bir kişi bir mesajı tutarlı ve güvenilir bulduğu hâlde onu uygulamak istemeyebilir. Araştırma bu iki değerlendirmeyi aynı kavram olarak kabul etmemiştir.
Başlıca sınırlılıklar nelerdir?
- Çalışma hakem değerlendirmesinden geçmemiş bir preprinttir.
- 286 kişi araştırmaya başlamış, yalnızca tamamlayan 175 kişi analize alınmıştır; tamamlamayanların özellikleri ayrıntılı olarak incelenmemiştir.
- Örneklem çoğunlukla genç yetişkinlerden ve kadınlardan oluşmaktadır.
- Bütün katılımcıların ana dili Fransızcadır; kültürler arası genellenebilirlik sınırlıdır.
- Senaryolar kısa ve kurgusaldır; gerçek yaşamın karmaşıklığını tam olarak yansıtmayabilir.
- Katılımcılar on senaryoyu art arda değerlendirdiği için yorgunluk veya dikkat azalması oluşmuş olabilir.
- Tavsiyeye uyma tek bir öz bildirim maddesiyle ölçülmüş, gerçek davranış izlenmemiştir.
- Kaynak manipülasyonu gerçek üretim kaynağını değil, yalnızca sunulan etiketi değiştirmiştir.
- Yüksek ve düşük kalite koşulları yalnızca mesajın yapısını değil, kesinlik tonunu ve somutluk düzeyini de birlikte değiştirmiştir; bu unsurların bağımsız etkileri ayrıştırılmamıştır.
- Entelektüel alçakgönüllülük etkileşimleri doğrulayıcı modelin değil keşifsel analizlerin sonucudur.
- Veri erişimi konusunda ana metin ile son başlık sayfasında farklı ifadeler bulunmaktadır.
Çalışmanın Yöntemi ve Bulguları
Örneklem özellikleri
| Örneklem özelliği | Çalışmada bildirilen değer |
|---|---|
| Araştırmaya başlayan kişi sayısı | 286 |
| Son analize alınan katılımcı sayısı | 175 |
| Dil | Ana dili Fransızca olan katılımcılar |
| Ortalama yaş | 25 yıl |
| Yaş standart sapması | 4,90 yıl |
| Yaş aralığı | 18-45 yıl |
| Kadın | %68,9 |
| Erkek | %29,9 |
| İkili olmayan cinsiyet kimliği | %1,1 |
| Katılımcı bulma kanalları | SurveyCircle, sosyal medya ve kişisel yönlendirme |
Deney deseni
| Değişken | Türü | Düzeyleri | Uygulama biçimi |
|---|---|---|---|
| Mesaj kaynağı | Katılımcılar arası faktör | ChatGPT veya insan uzman | Katılımcı yalnızca bir kaynak koşuluna rastgele atanmıştır. |
| Mesaj kalitesi | Katılımcı içi faktör | İyi yazılmış veya kötü yazılmış | Her katılımcı beş iyi ve beş kötü yazılmış mesaj değerlendirmiştir. |
| Yapay zekâya yönelik tutum | Sürekli bireysel değişken | Düşükten yükseğe | Altı maddelik ölçekle ölçülmüştür. |
| Entelektüel alçakgönüllülük | Sürekli bireysel değişken | Düşükten yükseğe | On maddelik kısa ölçeğin iki alt boyutuyla ölçülmüştür. |
Ölçüm araçları
| Ölçülen yapı | Ölçüm biçimi | Ölçek |
|---|---|---|
| Algılanan güvenilirlik | “Cevap güvenilirdir” ve “Cevap tutarlıdır” maddeleri | 1: Kesinlikle katılmıyorum – 7: Kesinlikle katılıyorum |
| Tavsiyeye uyma | “Bu cevabı takip etmeye istekli olurdum” maddesi | 1-7 Likert ölçeği |
| Senaryoya aşinalık | Kendisinin veya yakın çevresinin benzer durumla karşılaşma sayısı | 0-10 |
| Duygusal etkilenme | Senaryonun kişiyi ne ölçüde etkileyeceği | 1-7 Likert ölçeği |
| Entelektüel alçakgönüllülük | Görüşü değiştirmeye açıklık ve düşünce-ego bağımsızlığı | On madde; alt ölçek güvenilirlikleri α = 0,90 ve α = 0,83 |
| Yapay zekâya yönelik tutum | Güven, kabul ve duygusal tepkiyi ölçen altı madde | Ölçek güvenilirliği α = 0,86 |
Senaryolar arasında aşinalık ve duygusal etkilenme bakımından anlamlı fark bulunmadığı için bu değişkenler ana modellere kontrol değişkeni olarak eklenmemiştir.
İstatistiksel analiz
Bağımlı değişkenler 1-7 arasındaki sıralı Likert yanıtlarından oluştuğu ve aynı katılımcılar birden fazla senaryoyu değerlendirdiği için kümülatif bağlantılı karma modeller kullanılmıştır. Modeller logit bağlantı fonksiyonuyla kurulmuştur. Analizler R 4.5.1 yazılımında “ordinal” paketiyle gerçekleştirilmiştir. Sonraki ikili karşılaştırmalar “emmeans” paketiyle yapılmış ve çoklu karşılaştırmalar için p değerleri düzeltilmiştir.
Karma model yaklaşımı, yanıtların hem katılımcılar hem de senaryolar içinde kümelenmesini dikkate almaktadır. Böylece aynı kişinin genel olarak yüksek puan verme eğilimi ile bazı senaryoların diğerlerinden daha kolay veya zor değerlendirilmesi, deneysel etkilerden ayrıştırılmaya çalışılmıştır.
Koşullara göre betimsel ortalamalar
| Kaynak | Mesaj kalitesi | Güvenilirlik ortalaması ve SS | Tavsiyeye uyma ortalaması ve SS |
|---|---|---|---|
| ChatGPT | İyi yazılmış | 6,14 (0,83) | 6,03 (0,93) |
| ChatGPT | Kötü yazılmış | 5,85 (0,92) | 5,43 (1,03) |
| İnsan uzman | İyi yazılmış | 6,26 (0,78) | 6,22 (0,75) |
| İnsan uzman | Kötü yazılmış | 5,47 (1,12) | 5,34 (1,10) |
Bu değerler katılımcı düzeyindeki betimsel ortalamalardır. İstatistiksel sonuçlar, bu ortalamaların doğrudan karşılaştırılmasına değil sıralı karma model tahminlerine dayanmaktadır.
Güvenilirliğe ilişkin doğrulayıcı sonuçlar
| Test edilen etki | İstatistiksel sonuç | Yorum |
|---|---|---|
| Mesaj kaynağı | χ2(1) = 1,82; p = 0,177 | ChatGPT ve insan uzman etiketleri arasında anlamlı ana fark yoktur. |
| Mesaj kalitesi | χ2(1) = 4,84; p = 0,028 | İyi yazılmış mesajlar daha güvenilir bulunmuştur. |
| Kaynak × kalite | χ2(1) = 1,42; p = 0,234 | Kalitenin etkisi kaynak etiketine göre anlamlı biçimde değişmemiştir. |
| Yapay zekâya yönelik tutum | χ2(1) = 9,18; p = 0,002 | Daha olumlu tutum daha yüksek güvenilirlik değerlendirmesiyle ilişkilidir. |
| Kaynak × yapay zekâ tutumu | χ2(1) = 1,23; p = 0,268 | Yapay zekâ tutumu yalnızca ChatGPT etiketli mesajlara özgü bir etki göstermemiştir. |
| Entelektüel alçakgönüllülük | χ2(1) = 2,80; p = 0,094 | Anlamlı ana etki bulunmamıştır. |
Güvenilirliğe ilişkin keşifsel sonuçlar
| Keşifsel analiz | Sonuç | Ayrıntı |
|---|---|---|
| Yapay zekâ tutumu × mesaj kalitesi | χ2(1) = 16,82; p < 0,001 | İyi mesajlarda eğim 0,77; %95 GA [0,29, 1,25]. Kötü mesajlarda eğim −0,22; %95 GA [−0,69, 0,24]. |
| Kaynak × kalite × yapay zekâ tutumu | χ2(1) = 0,76; p = 0,384 | Kaliteye duyarlılığın ChatGPT ve insan etiketlerine göre farklılaştığı gösterilmemiştir. |
| Entelektüel alçakgönüllülük × kalite | χ2(1) = 46,77; p < 0,001 | İyi mesajlarda eğim 0,996; kötü mesajlarda −0,495’tir. |
| Entelektüel alçakgönüllülük × kaynak | χ2(1) = 4,40; p = 0,036 | Yüksek entelektüel alçakgönüllülük düzeyinde insan etiketi daha güvenilir değerlendirilmiştir. |
Tavsiyeye uymaya ilişkin doğrulayıcı sonuçlar
| Test edilen etki | İstatistiksel sonuç | Yorum |
|---|---|---|
| Mesaj kaynağı | χ2(1) = 0,36; p = 0,548 | ChatGPT ve insan uzman etiketleri arasında anlamlı ana fark yoktur. |
| Mesaj kalitesi | χ2(1) = 1,18; p = 0,277 | Mesaj kalitesinin genel ana etkisi anlamlı değildir. |
| Kaynak × kalite | χ2(1) = 2,07; p = 0,151 | Kalite etkisinin kaynağa göre değiştiği gösterilmemiştir. |
| Yapay zekâya yönelik tutum | χ2(1) = 5,76; p = 0,016 | Daha olumlu tutum daha yüksek tavsiyeye uyma isteğiyle ilişkilidir. |
| Kaynak × yapay zekâ tutumu | χ2(1) = 0,03; p = 0,852 | Tutumun etkisi yalnızca ChatGPT etiketine özgü değildir. |
| Entelektüel alçakgönüllülük | χ2(1) = 1,70; p = 0,192 | Anlamlı ana etki bulunmamıştır. |
Tavsiyeye uymaya ilişkin keşifsel sonuçlar
| Keşifsel analiz | Sonuç | Ayrıntı |
|---|---|---|
| Yapay zekâ tutumu × mesaj kalitesi | χ2(1) = 9,44; p = 0,002 | İyi mesajlarda eğim 0,63; %95 GA [0,24, 1,02]. Kötü mesajlarda eğim yaklaşık 0’dır. |
| Kaynak × kalite × yapay zekâ tutumu | χ2(1) = 1,34; p = 0,247 | Kalite ve tutum ilişkisinin kaynak etiketine göre farklılaştığı gösterilmemiştir. |
| Entelektüel alçakgönüllülük × kalite | χ2(1) = 51,63; p < 0,001 | İyi mesajlarda eğim 0,71; kötü mesajlarda −0,83’tür. Eğim farkı p < 0,0001 düzeyindedir. |
| Entelektüel alçakgönüllülük × kaynak | χ2(1) = 4,40; p = 0,036 | Entelektüel alçakgönüllülük insan etiketinde uyma isteğini artırmış, ChatGPT etiketinde anlamlı ilişki göstermemiştir. |
Sonuçların uygulama açısından anlamı
Çalışma, tavsiye sunan sistemlerde yalnızca “yapay zekâ tarafından üretildi” veya “uzman tarafından yazıldı” etiketi kullanmanın değerlendirmeleri tek başına belirlemeyebileceğini göstermektedir. Mesajın düzeni, açık gerekçeleri ve somut önerileri güvenilirlik açısından daha belirgin görünmektedir.
Bununla birlikte iyi bir yazım biçimi, tavsiyenin bilimsel olarak doğru, güvenli veya kişiye uygun olduğunu tek başına garanti etmez. Deney yalnızca katılımcıların algısını ölçmüştür; mesajların içerik doğruluğunu bağımsız uzmanlara değerlendirmemiştir. Bu nedenle uygulamalarda akıcı ve ikna edici dilin, içerik doğrulaması ve uzman denetiminin yerine geçirilmemesi gerekir.
Kaynak ve Yöntem Notu
| Kaynak kimliği alanı | Doğrulanan bilgi |
|---|---|
| Çalışmanın tam özgün adı | Evaluating AI-Generated Advice: Source Cues, Argument Quality, and Individual Differences in Credibility and Adherence |
| Yazarlar ve sıraları | 1. Elodie Andrieu; 2. Aurélie Pistono; 3. Franck Amadieu |
| Eş birinci yazar | Eş katkı veya eş birinci yazarlık bilgisi yer almamaktadır. |
| Sorumlu yazar | Elodie Andrieu |
| Kurum | CLLE Laboratory (Cognition, Languages, Language, Ergonomics), Toulouse Jean Jaurès University, Toulouse, Fransa |
| DOI | 10.2139/ssrn.7002154 |
| Dergi | Hakemli bir dergi adı bulunmamaktadır. |
| Yayınevi | Hakemli dergi yayınevi bilgisi bulunmamaktadır. |
| Yayın platformu | SSRN |
| Yayın yılı | 2026 |
| SSRN’ye yüklenme tarihi | 26 Haziran 2026 |
| Kaynak türü | Çevrim içi, karma desenli deneysel araştırma preprinti |
| Hakemlik durumu | Hakem değerlendirmesinden geçmemiştir. |
| Resmî yayın bağlantısı | SSRN resmî çalışma sayfası |
| Veri ve analiz materyalleri | Open Science Framework proje sayfası |
Bu çalışma hakem değerlendirmesinden geçmemiş bir preprinttir; sonuçları bu sınırlılık dikkate alınarak okunmalıdır. DOI, SSRN çalışma kaydını tanımlamaktadır ve hakemli bir dergi yayınına ait DOI olarak sunulmamalıdır.
Araştırma protokolü Toulouse Jean Jaurès Üniversitesi Etik Kurulu tarafından 24 Mart 2025 tarihinde, 2025_1040 numaralı proje kapsamında onaylanmıştır. Katılımcılardan bilgilendirilmiş onam alınmış, katılım gönüllü ve anonim olarak yürütülmüştür.
Yazar katkıları beyanına göre Elodie Andrieu kavramsallaştırma, yöntem, araştırma, veri düzenleme, biçimsel analiz, görselleştirme ve ilk taslak yazımını üstlenmiştir. Aurélie Pistono danışmanlık ile inceleme ve düzenlemeye; Franck Amadieu ise kavramsallaştırma, yöntem, danışmanlık ve inceleme-düzenlemeye katkı sağlamıştır. Çalışma için özel bir kamu, ticari veya kâr amacı gütmeyen kuruluş finansmanı alınmadığı ve yazarların çıkar çatışması bildirmediği belirtilmiştir.
Yazarlar, metnin hazırlanmasında dil iyileştirmesine yardımcı olmak amacıyla ChatGPT kullandıklarını; üretilen içeriği gözden geçirip düzenlediklerini ve çalışmanın sorumluluğunu üstlendiklerini beyan etmektedir.
Veri erişimi konusunda çalışma içinde bir tutarsızlık bulunmaktadır. Ana metin, veri ve analiz betiklerinin Open Science Framework üzerinde açık olduğunu belirtmektedir. Dosyanın sonundaki başlık sayfası ise verilerin sorumlu yazardan makul talep üzerine alınabileceğini söylemektedir. OSF proje bağlantısı mevcut olmakla birlikte iki veri erişim beyanı aynı açıklığı taşımamaktadır.
Bu Verianla makalesinin bilimsel içeriği yalnızca yüklenen çalışmaya dayanarak hazırlanmıştır. Dış kaynaklar yalnızca DOI, yazar sırası, SSRN yüklenme tarihi, yayın platformu ve resmî veri projesi gibi bibliyografik bilgileri doğrulamak amacıyla kullanılmıştır. Çalışmada bulunmayan deneysel bulgu veya dış bilimsel sonuç eklenmemiştir.
Çalışmanın temel sınırlılıkları; örneklemin genç ve ağırlıklı olarak kadın katılımcılardan oluşması, yalnızca Fransızca konuşan katılımcıların incelenmesi, kısa kurgusal senaryolar kullanılması, gerçek davranış yerine tavsiyeye uyma niyetinin ölçülmesi ve gerçek ChatGPT çıktılarının gerçek insan uzman cevaplarıyla karşılaştırılmamış olmasıdır. Entelektüel alçakgönüllülüğe ilişkin etkileşimler keşifsel niteliktedir ve bağımsız örneklemlerde doğrulanmalıdır.

Bir yorum bırakın
E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir