Akademik araştırmalar, anlaşılır dil

Verianla | Akademik Araştırmalardan Türkçe Ekonomi ve Bilim İçerikleri

27 Eylül 2026, Pazar
VERİANLABağımsız bilim yayıncılığı
Menüyü aç veya kapat
...
Home / Sosyal Bilimler / Eğitim / Yapay Zekâ Destekli Akademik İngilizce Yazma: Güçlü Ön-Son Kazanımlar, Sınırlı Nedensel Kanıt
Eğitim

Yapay Zekâ Destekli Akademik İngilizce Yazma: Güçlü Ön-Son Kazanımlar, Sınırlı Nedensel Kanıt

ChatGPT ve Grammarly gibi yapay zekâ destekli yazma araçları öğrencilere sözcük seçimi, tekrarların azaltılması, dilbilgisi, cümle yapısı ve metin düzeni hakkında hızlı öneriler sunmaktadır.

29/07/2026  Veri Anla 63 görüntüleme
Yapay Zekâ Destekli Akademik İngilizce Yazma: Güçlü Ön-Son Kazanımlar, Sınırlı Nedensel Kanıt

ChatGPT ve Grammarly gibi yapay zekâ destekli yazma araçları öğrencilere sözcük seçimi, tekrarların azaltılması, dilbilgisi, cümle yapısı ve metin düzeni hakkında hızlı öneriler sunmaktadır. Ancak bir öğrencinin bu araçlarla daha iyi bir metin oluşturması, aynı beceriyi araç kapatıldığında da edindiği anlamına gelmez. Bu araştırma, yapay zekâ destekli sözcük çalışmasının İngilizceyi yabancı dil olarak öğrenen üniversite öğrencilerinin akademik yazılarıyla nasıl ilişkilendiğini incelemiştir.

Araştırma Suudi Arabistan’daki orta büyüklükte bir üniversitede yürütülmüş; işletme, mühendislik ve bilgisayar bilimi alanlarından 160 lisans öğrencisi çalışmaya katılmıştır. Öğrenciler ENGL 101, ENGL 102 ve ENGL 201 derslerine kayıtlıdır. Katılımcıların yüzde 18’i B1, yüzde 58’i B2, yüzde 24’ü C1 düzeyinde sınıflandırılmıştır.

Öğrenciler bir dönem boyunca ChatGPT ve Grammarly ile desteklenen yazma etkinliklerine katılmıştır. Program; araç kullanım eğitimi, etik ve akademik dürüstlük bilgilendirmesi, kişiselleştirilmiş öğrenme planları, yönlendirilmiş yazma oturumları, bağımsız çalışma, oyunlaştırılmış etkinlikler ve aralıklı sözcük tekrarını birlikte içermiştir. Özette sekiz yönlendirilmiş yazma oturumu yapıldığı belirtilmektedir; yöntem bölümünde ise bu oturumların süresi ve haftalara dağılımı ayrıntılı olarak verilmemiştir.

Dönem başında ve sonunda yazılan 150–300 kelimelik metinler sözcüksel çeşitlilik, sözcük doğruluğu, akademik eşdizimler, alan terimleri, bağlaç kullanımı, tutarlılık ve düzen bakımından incelenmiştir. Sözcüksel çeşitliliği gösteren MTLD ortalaması 73’ten 92’ye, akademik sözcüklerin oranı yüzde 7,5’ten yüzde 12,2’ye ve doğru alan terimi kullanımı bin kelimede 18’den 28’e yükselmiştir. Sözcüksel hata oranı bin kelimede 28’den 16,5’e düşmüş; insan değerlendiricilerin verdiği tutarlılık puanı 6 üzerinden 3,4’ten 4,2’ye çıkmıştır.

Bu değişimlerin tamamı p<0,001 düzeyinde istatistiksel olarak anlamlı bildirilmiş ve birçok ölçütte büyük etki büyüklükleri hesaplanmıştır. Öğrenciler araçların yararlılığına 5 üzerinden 4,4, kullanım kolaylığına 4,3 ve genel memnuniyete 4,3 puan vermiştir. Yapay zekâ önerilerine güven ise 3,9 puanla yararlılık değerlendirmesinin altında kalmıştır.

Bununla birlikte araştırmada kontrol grubu bulunmamaktadır. Öğrenciler normal derslerine devam etmiş, öğretmenlerden destek almış, düzenli yazma çalışması yapmış ve sözcük öğretimi görmüştür. Bu nedenle değişimlerin ne kadarının yapay zekâdan, ne kadarının öğretimden, tekrarlı yazma deneyiminden, öğrencilerin doğal gelişiminden veya ölçüm koşullarından kaynaklandığı ayrılamamaktadır.

Araştırma ayrıca yapay zekâ araçlarının kullanılmadığı bağımsız bir son test veya haftalar sonra gerçekleştirilen kalıcılık ölçümü sunmamaktadır. Son değerlendirmelerde ChatGPT ve Grammarly kullanımına izin verilip verilmediği de açıkça belirtilmemiştir. Dolayısıyla öğrencilerin kendi başlarına daha iyi yazmayı öğrenip öğrenmediği ile yapay zekâ yardımı sayesinde daha iyi metin üretmesi birbirinden ayrılamamaktadır.

Çalışmanın en güvenli sonucu şudur: Öğretmen rehberliği, düzenli yazma uygulaması, sözcük öğretimi, aralıklı tekrar ve yapay zekâ araçlarını birleştiren dönemlik program sırasında öğrencilerin incelenen metin göstergeleri önemli ölçüde iyileşmiştir. Ancak araştırma, bu gelişmelerin yalnızca veya doğrudan yapay zekâ tarafından oluşturulduğunu kanıtlamamaktadır.

Araştırmanın temel sorusu nedir?

Çalışma üç temel soruya cevap aramaktadır:

  1. Yapay zekâ destekli sözcük araçlarının öğrencilerin sözcük gelişimi ve akademik yazma performansıyla ilişkisi nedir?
  2. Öğrenciler yapay zekânın sözcük öğrenme ve akademik yazmadaki rolünü nasıl değerlendirmektedir?
  3. Yapay zekâ araçlarının yabancı dil öğretiminde kullanılmasından hangi uygulama güçlükleri ve etik sorunlar doğmaktadır?

Araştırmanın odağı yalnızca öğrencilerin daha az dilbilgisi hatası yapıp yapmadığı değildir. Çalışmada sözcük çeşitliliği, akademik sözcükler, alan terminolojisi, eşdizimler, metin içindeki bağlantılar ve genel yazı düzeni birlikte incelenmiştir.

Akademik yazmada sözcük bilgisi neden önemlidir?

Bir öğrencinin çok sayıda İngilizce kelimeyi tanıması, bu kelimeleri akademik metinde doğru kullanabildiği anlamına gelmez. Akademik yazma için kelimenin anlamı kadar hangi bağlamda, hangi kelimelerle ve hangi dil düzeyinde kullanıldığı da önemlidir.

Öğrencinin aşağıdaki becerileri birlikte geliştirmesi gerekir:

  • Farklı kelimeler kullanarak gereksiz tekrarı azaltmak
  • Genel kelimeler yerine konuya uygun akademik ve teknik terimleri seçmek
  • Kelimenin isim, fiil, sıfat veya zarf biçimini doğru kullanmak
  • Birlikte doğal kullanılan sözcükleri doğru eşleştirmek
  • Resmî akademik anlatıma uygun dil düzeyini korumak
  • Fikirler arasında açık bağlantılar kurmak
  • Paragrafları mantıklı sırayla düzenlemek

ChatGPT ve Grammarly bu alanlarda anlık öneri üretebilir. Ancak öğrencinin yalnızca öneriyi kabul etmesiyle neden doğru olduğunu anlaması aynı değildir. Kalıcı öğrenme için öğrencinin öneriyi değerlendirmesi, kendi anlamıyla karşılaştırması ve yeni kullanımını başka metinlerde bağımsız biçimde tekrarlaması gerekir.

Katılımcılar kimlerdir?

Çalışmaya Suudi Arabistan’daki tek bir üniversiteden 160 lisans öğrencisi katılmıştır. İngilizce bütün üniversite derslerinde öğretim dili olarak kullanılmaktadır.

Katılımcı özelliğiDeğer
Toplam öğrenci160
Erkek%56
Kadın%44
19–22 yaş%76
23 yaş ve üzeri%24
İşletme öğrencileri%24
Mühendislik öğrencileri%36
Bilgisayar bilimi öğrencileri%40
B1 düzeyi%18
B2 düzeyi%58
C1 düzeyi%24

Öğrencilerin yüzde 89’u daha önce en az bir yapay zekâ yazma aracından haberdardır. Ancak yalnızca yüzde 28’i bu araçları daha önce yoğun kullandığını bildirmiştir. Yüzde 17’sinin ücretli aboneliği, yüzde 81’inin gerekli teknik özellikleri karşılayan kişisel bilgisayarı ve yüzde 78’inin kampüs dışında kararlı internet erişimi bulunmaktadır.

Bu bilgiler öğrencilerin dijital olanaklarının aynı olmadığını göstermektedir. Ücretli hesapların daha gelişmiş özelliklere erişip erişmediği veya araç sürümlerinin öğrenciler arasında aynı olup olmadığı açıklanmamıştır.

Öğrenciler nasıl seçilmiştir?

Araştırmacılar farklı İngilizce yeterlik düzeylerinin temsil edilmesi için tabakalı örnekleme kullandıklarını belirtmektedir. Bununla birlikte öğrencilerin gönüllü başvuru yoluyla mı, ders şubelerinin tamamından mı veya başka bir seçim süreciyle mi alındığı ayrıntılı biçimde açıklanmamıştır.

Araştırmada şu üç ders bulunmaktadır:

  • ENGL 101 — Birinci Yıl Yazma
  • ENGL 102 — Rapor Yazımına Giriş
  • ENGL 201 — Teknik Yazma

Sonuç tablosunda B1 düzeyi ENGL 101, B2 düzeyi ENGL 102 ve C1 düzeyi ENGL 201 ile eşleştirilmiştir. Ancak yöntem bölümünde her dersin yalnızca tek bir CEFR düzeyindeki öğrencilerden oluştuğu açıkça gösterilmemiştir. Her alt grubun kesin öğrenci sayısı da sonuç tablosunda verilmemiştir.

Müdahale gerçekte neleri içermektedir?

Araştırma yalnızca öğrencilere ChatGPT veya Grammarly hesabı verip dönem sonunda yazılarını karşılaştırmamıştır. Program çok bileşenli bir öğretim yaklaşımıdır:

  • Yapay zekâ araçlarını kullanma eğitimi
  • Etik kullanım, veri koruma ve akademik dürüstlük bilgilendirmesi
  • Başlangıç yazma yeterliğine göre kişiselleştirilmiş öğrenme planı
  • ChatGPT ve Grammarly üzerinden bağlama uygun eş anlamlı önerileri
  • Tekrarlanan kelimelerin belirlenmesi
  • Alanla ilişkili sözcük çalışmaları
  • Oyunlaştırılmış görevler
  • Aralıklı tekrar etkinlikleri
  • Yönlendirilmiş yazma oturumları
  • Bağımsız çalışma
  • Öğretmen desteği ve yüz yüze dersler

Bu yapı eğitimsel açıdan güçlü olabilir; fakat araştırma açısından her bileşenin etkisini ayırmayı zorlaştırmaktadır. Öğrencilerin gelişimi yapay zekâdan, daha fazla yazma uygulamasından, öğretmen geri bildiriminden, aralıklı tekrardan veya bunların birleşiminden kaynaklanmış olabilir.

Hangi yapay zekâ sistemleri kullanılmıştır?

Yöntem bölümünde iki araç açıkça adlandırılmıştır:

  • ChatGPT
  • Grammarly

Ancak çalışmada kullanılan ChatGPT modelinin adı, sürümü, hesap türü, sistem ayarları veya öğrencilere verilen standart istemler açıklanmamıştır. Grammarly’nin hangi sürümünün ve hangi özelliklerinin kullanıldığı da belirtilmemiştir.

Öğrencilerin iki aracı birlikte mi kullandığı, birini seçip seçmediği veya kullanım miktarlarının ne olduğu belirsizdir. Araç kullanımının analitik panolarla izlendiği söylenmesine rağmen oturum sayısı, kabul edilen öneri sayısı, kullanılan süre ve araçlara göre kullanım dağılımı sonuçlarda verilmemiştir.

Bu eksiklik nedeniyle ChatGPT ile Grammarly’nin ayrı etkileri karşılaştırılamaz. Bulgular belirli bir modelin veya ürünün başarısı olarak sunulmamalıdır.

Yazma performansı nasıl ölçülmüştür?

Öğrenciler müdahale öncesinde ve sonrasında 150–300 kelimelik akademik metinler yazmıştır. Metinler otomatik derlem araçlarıyla ve insan değerlendiricilerle incelenmiştir.

Başlıca ölçüm alanları şunlardır:

  • Type–Token Ratio
  • Measure of Textual Lexical Diversity
  • Genel ve akademik kelime listelerinin payı
  • Orta ve düşük sıklıktaki kelimeler
  • Doğru akademik eşdizimler
  • Hatasız cümleciklerin oranı
  • Sözcüksel hata oranı
  • Uygunsuz dil düzeyi
  • Yanlış sözcük türü seçimi
  • Doğal olmayan eşdizimler
  • Doğru alan terimleri
  • Bağlayıcı ifadeler ve geçiş türleri
  • İnsan değerlendiricilerin tutarlılık ve düzen puanları

Type–Token Ratio neyi göstermektedir?

Type–Token Ratio, bir metindeki farklı kelime sayısının toplam kelime sayısına oranıdır:

\[ TTR = \frac{Farklı\ kelime\ sayısı}{Toplam\ kelime\ sayısı} \]

Örneğin 200 kelimelik bir metinde 100 farklı kelime bulunması durumunda TTR değeri 0,50 olur. Oranın yükselmesi, metinde daha çeşitli kelimeler kullanıldığını düşündürür.

Ancak TTR metin uzunluğuna duyarlıdır. Metin uzadıkça zorunlu tekrarlar artabileceği için oran düşebilir. Araştırmadaki yazılar 150 ile 300 kelime arasında değişmektedir. Başlangıç ve son yazılarının ortalama uzunlukları verilmediğinden TTR değişiminin ne kadarının sözcük gelişiminden, ne kadarının metin uzunluğundan kaynaklandığı tam olarak değerlendirilememektedir.

MTLD neyi ölçmektedir?

MTLD, sözcüksel çeşitliliği metin uzunluğundan TTR’ye göre daha az etkilenecek biçimde ölçmeyi amaçlayan bir göstergedir. Metin boyunca sözcük çeşitliliğinin belirli bir eşiğin üzerinde ne kadar süre korunabildiğini değerlendirir.

MTLD’nin 73’ten 92’ye çıkması, öğrencilerin son metinlerde daha geniş ve metin boyunca daha sürdürülebilir bir sözcük çeşitliliği kullandığıyla uyumludur. Bununla birlikte yazma görevlerinin konu, tür, süre ve güçlük bakımından eşdeğer olup olmadığı açıklanmadığı için değişimin tamamı öğrenci becerisine bağlanamaz.

Başlangıç ve son yazma görevleri karşılaştırılabilir mi?

Çalışmada metinlerin 150–300 kelime olduğu belirtilmekte, ancak şu bilgiler verilmemektedir:

  • Başlangıç ve son görevlerinin tam soru metinleri
  • Görevlerin aynı yazı türünde olup olmadığı
  • Konuların güçlük bakımından nasıl eşleştirildiği
  • Yazma için verilen süre
  • Öğrencilerin sözlük veya internet kullanıp kullanamadığı
  • Son değerlendirmede ChatGPT ve Grammarly kullanımına izin verilip verilmediği
  • Metin uzunluklarının başlangıç ve son aşamadaki ortalamaları

Bu bilgiler ölçümün yorumlanması için kritiktir. Son testte yapay zekâ kullanılmışsa sonuçlar bağımsız öğrenmeyle araç destekli ürün kalitesini birlikte yansıtabilir. Yapay zekâ kapalı bir test uygulanmışsa öğrencilerin aktarım becerisine ilişkin kanıt daha güçlü olurdu. Makale hangi koşulun uygulandığını açıkça belirtmemektedir.

Sözcüksel çeşitlilikte ne değişmiştir?

ÖlçütBaşlangıçSonuçEtki büyüklüğü
TTR0,430,51d = 1,23
MTLD73,092,0d = 1,52
Genel ve yüksek sıklıktaki kelimelerin payı%66,0%54,0d = −1,41
Akademik kelimelerin payı%7,5%12,2d = 1,70
Orta ve düşük sıklıktaki kelimelerin payı%27,0%33,8d = 0,90
Bin kelimede doğru akademik eşdizim22,033,0d = 1,62

Bütün karşılaştırmalar için p<0,001 bildirilmiştir. MTLD yaklaşık yüzde 26, doğru akademik eşdizim kullanımı yüzde 50 artmıştır. Akademik sözcüklerin payı 4,7 yüzde puan yükselmiştir.

Başlangıçta üç sıklık kategorisinin toplamı yüzde 100,5’tir. Bu küçük fark yuvarlamadan kaynaklanabilir. Son ölçümde toplam yüzde 100’dür.

Sözcük doğruluğunda ne değişmiştir?

ÖlçütBaşlangıçSonuçEtki büyüklüğü
Hatasız cümleciklerin oranı%74,0%83,0d = 1,16
Bin kelimede sözcüksel hata28,016,5d = −1,39
Uygunsuz dil düzeyi7,53,6d = −1,30
Yanlış sözcük türü seçimi9,25,0d = −1,16
Doğal olmayan eşdizimler11,86,4d = −1,33
Doğru alan terimleri18,028,0d = 1,53

Sözcüksel hata oranı yaklaşık yüzde 41 azalmış, doğru alan terimi kullanımı yaklaşık yüzde 56 artmıştır. Bunlar yalnızca istatistiksel bakımdan değil, büyüklük bakımından da dikkat çekici değişimlerdir.

Bununla birlikte tartışma bölümünde toplam sözcüksel hataların “yalnızca marjinal” biçimde azaldığı yazılmıştır. Bin kelimede 28’den 16,5’e düşüş ve d=−1,39 değeri marjinal bir değişim olarak nitelendirilemez. Bu ifade sonuç tablosuyla çelişmektedir.

Metin tutarlılığı ve düzeni nasıl değişmiştir?

ÖlçütBaşlangıçSonuçEtki büyüklüğü
Bin kelimede bağlayıcı ifade42,055,0d = 1,24
Benzersiz geçiş türü9,014,0d = 1,53
Değerlendirici tutarlılık puanı3,4/64,2/6d = 1,06
Değerlendirici düzen puanı3,3/64,4/6d = 1,46

Bütün değerler için p<0,001 bildirilmiştir. Bağlayıcı ifadeler yaklaşık yüzde 31, farklı geçiş türlerinin sayısı yaklaşık yüzde 56 artmıştır.

Ancak insan değerlendiricilerin sayısı, eğitim süreci, kullandığı değerlendirme rubriği, başlangıç veya son metni okuduğunu bilip bilmediği ve değerlendiriciler arası güvenilirlik katsayısı verilmemiştir. Bu eksiklik, tutarlılık ve düzen puanlarının ne kadar güvenilir olduğunu değerlendirmeyi zorlaştırmaktadır.

Tartışma bölümünde metin düzenine ilişkin hata puanının “3 yüzde puan” iyileştiği belirtilmektedir. Sonuç tablolarında bu ifadeye karşılık gelen bir yüzde ölçütü bulunmamaktadır. Tutarlılık 3,4’ten 4,2’ye, düzen ise 3,3’ten 4,4’e çıkmıştır. Bu nedenle “3 yüzde puan” ifadesinin hangi hesaplamaya dayandığı anlaşılamamaktadır.

İngilizce düzeylerine göre sonuçlar nelerdir?

DüzeyÖlçütBaşlangıçSonuçCohen d
B1 / ENGL 101TTR0,410,481,05
B1 / ENGL 101MTLD68821,20
B2 / ENGL 102TTR0,430,511,22
B2 / ENGL 102MTLD73921,50
C1 / ENGL 201TTR0,450,541,35
C1 / ENGL 201MTLD781011,70

C1 grubunda sözcüksel çeşitlilik ölçütleri bakımından en büyük artış bildirilmiştir. Ancak tabloda grup başına öğrenci sayıları, standart sapmalar veya gruplar arasındaki farkı sınayan etkileşim testi bulunmamaktadır.

Metinde B1 grubunun hata düzeltmelerinde en büyük azalmayı gösterdiği yazılmıştır. Buna karşılık ilgili Tablo 7 yalnızca TTR ve MTLD sonuçlarını içermekte, hata oranlarını göstermemektedir. Bu iddia sunulan tablodan doğrulanamamaktadır.

Öğrenciler araçları nasıl değerlendirmiştir?

Değerlendirilen özellikOrtalama puan
Algılanan yararlılık4,4/5
Kullanım kolaylığı4,3/5
Alanla ilişkililik4,3/5
Genel memnuniyet4,3/5
Geri bildirimin açıklığı4,2/5
Mobil ve bilgisayar arasında süreklilik4,2/5
Yapay zekâ önerilerine güven3,9/5
Oyunlaştırmanın yararlılığı3,8/5

Öğrencilerin araçları yararlı bulması, öğrenme etkisinin nesnel kanıtı değildir. Kullanım kolaylığı ve memnuniyet, beceri kazanımından farklı sonuçlardır. Buna karşılık güven puanının yararlılık puanından düşük olması, öğrencilerin yapay zekâ önerilerini tamamen güvenilir görmediğini düşündürebilir.

Ancak anketin kaç maddeden oluştuğu, daha önce doğrulanmış bir ölçek olup olmadığı, iç tutarlılık katsayısı ve soruların tam metni verilmemiştir. Bu nedenle anket sonuçlarının psikometrik niteliği değerlendirilememektedir.

Çalışma gerçekten karma yöntemli midir?

Yöntem bölümünde anketler, yarı yapılandırılmış görüşmeler ve odak grupları kullanıldığı belirtilmektedir. Açık uçlu cevapların tematik olarak kodlandığı ve katılımcı doğrulaması yapıldığı yazılmıştır.

Bununla birlikte sonuç bölümünde:

  • Kaç öğrenciyle görüşme yapıldığı
  • Kaç odak grubunun gerçekleştirildiği
  • Görüşmelerin süresi
  • Kodlama çerçevesi
  • Kodlayıcı sayısı ve uyumu
  • Ortaya çıkan ana temalar
  • Katılımcı alıntıları
  • Olumsuz veya karşıt vakalar

sunulmamıştır. Nitel verilerden söz edilmesine rağmen bulguların tamamına yakını sayısal ön-son karşılaştırmalar ve Likert ortalamalarından oluşmaktadır. Bu nedenle çalışmanın karma yöntemli yönü yeterince raporlanmamıştır.

Etki büyüklükleri nasıl hesaplanmıştır?

Çalışma Cohen d değerlerini başlangıç ve son ölçümlerin birleştirilmiş standart sapmasıyla hesapladığını belirtmektedir:

\[ SD_{birleşik} = \sqrt{\frac{SD_{ön}^{2}+SD_{son}^{2}}{2}} \]

\[ d = \frac{\overline{X}_{son}-\overline{X}_{ön}}{SD_{birleşik}} \]

  • X̄ön: Müdahale öncesi ortalama
  • X̄son: Müdahale sonrası ortalama
  • SDön: Başlangıç standart sapması
  • SDson: Sonuç standart sapması

Bu hesaplama tabloda verilen değerlerle uyumludur. Örneğin MTLD için:

\[ d = \frac{92-73}{\sqrt{(12^2+13^2)/2}} \approx 1{,}52 \]

Ancak veriler aynı öğrencilerden iki kez toplandığı için ölçümler bağımsız değildir. Birleştirilmiş standart sapmaya dayalı d değeri bildirilebilir; fakat öğrencilerin başlangıç ve son puanları arasındaki korelasyonu içermez. Eşleştirilmiş değişime özgü başka bir etki büyüklüğünün hesaplanabilmesi için fark puanlarının standart sapması veya ön-son korelasyonu gerekir. Bu bilgiler verilmemiştir.

İstatistiksel anlamlılık ne kadar yeniden üretilebilir?

Araştırmacılar eşleştirilmiş örneklem t testleri kullandıklarını ve bütün ana sonuçların p<0,001 olduğunu bildirmiştir. Ancak tablolar şu bilgileri içermemektedir:

  • t istatistikleri
  • Serbestlik dereceleri
  • Ortalama değişimlerin güven aralıkları
  • Fark puanlarının standart sapmaları
  • Eksik gözlem sayıları
  • Dağılım varsayımlarının kontrolleri
  • Çoklu karşılaştırma düzeltmesi

Bu nedenle ortalama ve standart sapmalardan bağımsız gruplara ilişkin yaklaşık hesaplamalar yapılabilir; fakat bildirilen eşleştirilmiş testler tam olarak yeniden üretilemez.

Kontrol grubunun bulunmaması neden önemlidir?

Bir ön-son çalışmada öğrencilerin zaman içinde geliştiği görülebilir. Ancak bu gelişmenin nedenini belirlemek için karşılaştırılabilir bir kontrol koşulu gerekir.

Mevcut çalışmada aşağıdaki olasılıklar birbirinden ayrılamamaktadır:

  • ChatGPT ve Grammarly önerilerinin etkisi
  • Öğretmen geri bildiriminin etkisi
  • Bir dönem boyunca alınan normal İngilizce dersinin etkisi
  • Düzenli akademik yazma uygulamasının etkisi
  • Aralıklı tekrar etkinliklerinin etkisi
  • Başlangıç testine aşinalığın etkisi
  • Öğrencilerin doğal gelişimi
  • Başlangıç ve son yazma görevleri arasındaki güçlük farkı
  • Son metinde yapay zekâ önerilerinin doğrudan bulunması

Yazarlar da tartışma bölümünde araştırmanın neden-sonuç ilişkisi kurmaya çalışmadığını ve kontrol grubunun bulunmadığını kabul etmiştir. Kontrol grubu kullanılmamasının, kurumun bütün öğrencilerin müdahaleden yararlanmasını istemesinden kaynaklandığı belirtilmiştir.

Bu etik kaygı anlaşılabilir; ancak bekleme listesi kontrolü, gecikmeli müdahale, normal öğretim karşılaştırması veya çapraz tasarım gibi seçenekler bütün öğrencilere daha sonra müdahale sunarken karşılaştırma yapılmasına imkân verebilirdi.

Öğrenciler yapay zekâ olmadan da gelişmiş midir?

Bu soruya mevcut çalışma cevap verememektedir. Gerçek beceri aktarımını değerlendirmek için öğrencilerin:

  • Yapay zekâ kullanmadan yeni bir konu hakkında yazması
  • Daha önce görmediği alan terimlerini bağlam içinde kullanması
  • Yapay zekâ önerilerindeki hataları belirlemesi
  • Haftalar veya aylar sonra aynı becerileri koruması

gerekirdi.

Çalışmada gecikmeli son test yapılmamıştır. Bu nedenle kazanımların dönem bittikten sonra devam edip etmediği bilinmemektedir.

Sonuç bölümündeki hangi iddialar doğrudan ölçülmemiştir?

Sonuç bölümünde teknolojinin öğretmen ve öğrencilere önemli ölçüde zaman kazandırdığı, eleştirel düşünmeyi geliştirdiği, üst dil farkındalığını artırdığı, özerkliği güçlendirdiği ve akademik dürüstlüğü desteklediği ileri sürülmektedir.

Ancak çalışmada:

  • Öğretmen veya öğrenci zamanına ilişkin süre ölçümü
  • Standartlaştırılmış eleştirel düşünme testi
  • Üst dil farkındalığı ölçeği
  • Öğrenen özerkliği ölçeği
  • İntihal veya akademik dürüstlük davranışı
  • Yapay zekâ önerisini reddetme doğruluğu

raporlanmamıştır. Bu iddialar çalışmanın doğrudan bulguları değil, uygulamaya ilişkin yorumlarıdır.

Çalışmanın içindeki önemli raporlama sorunları

KonuÇalışmada sunulan bilgiDeğerlendirme
Teslim tarihi02/215/2026Geçerli bir takvim tarihi değildir.
Ölçüm noktalarıBaşlangıç, ara ve son ölçüm yapıldığı belirtiliyor.Ara ölçüm sonuçları sunulmuyor.
Sözcük sınavlarıKelime tanıma, cümle tamamlama ve serbest yazma sınavları kullanıldığı belirtiliyor.Bu sınavların sonuçları verilmemiştir.
Nitel verilerGörüşme, odak grubu ve tematik kodlama bildiriliyor.Örneklem, tema, kod ve alıntılar sunulmuyor.
Alt grup sonuçlarıB1’in hata düzeltmelerinde en büyük gelişimi gösterdiği yazılıyor.İlgili tablo yalnızca TTR ve MTLD içermektedir.
Düşük sıklıktaki kelimelerTartışmada son metinlerde daha az düşük sıklıklı kelime bulunduğu yazılıyor.Tablo, oranın %27’den %33,8’e yükseldiğini göstermektedir.
Sözcüksel hata azalması“Yalnızca marjinal” azalma olarak niteleniyor.28’den 16,5’e düşüş ve d=−1,39 büyük değişimdir.
Düzen puanıÜç yüzde puanlık gelişimden söz ediliyor.Tablolarda buna karşılık gelen yüzde ölçütü bulunmamaktadır.

Türkiye açısından nasıl yorumlanmalıdır?

Suudi Arabistan’daki tek üniversiteden elde edilen sayısal sonuçlar Türkiye’deki öğrencilere doğrudan genellenemez. Bununla birlikte araştırma sorusu Türkiye’deki İngilizce hazırlık okulları, akademik yazma dersleri ve İngilizce öğretim yapan lisans programları için uygulanabilir niteliktedir.

Türkiye’de benzer bir uygulama, öğrencilere yapay zekâyı tamamen yasaklamak veya sınırsız biçimde serbest bırakmak yerine kullanımın hangi öğrenme aşamasında yararlı olduğunu sınayabilir.

Örneğin aşağıdaki üç grup karşılaştırılabilir:

  1. Öğretmen rehberliği ve yapay zekâ destekli yazma grubu
  2. Aynı öğretmen süresi ve sözcük çalışmasıyla, fakat yapay zekâ kullanılmayan grup
  3. Olağan akademik yazma öğretimine devam eden karşılaştırma grubu

Bütün gruplara dönem sonunda aynı, yapay zekâ kapalı yazma görevi uygulanmalıdır. Ardından dört veya sekiz hafta sonra gecikmeli test yapılarak kelime bilgisinin kalıcılığı ölçülebilir.

Türkiye’de daha güçlü bir araştırma nasıl tasarlanabilir?

  • Birden fazla üniversite ve farklı akademik alanlar çalışmaya alınmalıdır.
  • Öğrenciler mümkünse rastgele veya sınıf düzeyinde kümeli olarak gruplara atanmalıdır.
  • Yapay zekâ ve kontrol gruplarında öğretmen süresi, görev sayısı ve geri bildirim miktarı eşit tutulmalıdır.
  • ChatGPT model sürümü, Grammarly özellikleri ve kullanılan istemler kaydedilmelidir.
  • Ücretsiz ve ücretli hesapların sunduğu özellikler ayrı değerlendirilmelidir.
  • Başlangıç ve son yazma görevleri tür, konu, süre ve kelime sınırı bakımından eşleştirilmelidir.
  • Son ve gecikmeli testler yapay zekâ kapalı gerçekleştirilmelidir.
  • İnsan değerlendiriciler ölçüm zamanını ve öğrencinin grubunu bilmemelidir.
  • Değerlendiriciler arası güvenilirlik raporlanmalıdır.
  • Kelime çeşitliliğinin yanında argüman kalitesi, kaynak kullanımı ve özgünlük ölçülmelidir.
  • Öğrencilerin hatalı yapay zekâ önerilerini belirleme becerisi sınanmalıdır.
  • Gerçek araç kullanım kayıtlarıyla öğrenme sonuçları ilişkilendirilmelidir.
  • Öğretmen zamanı ve öğrenci çalışma süresi doğrudan ölçülmelidir.
  • Ham veriler, kodlama kılavuzu ve analiz kodu paylaşılmalıdır.

Çalışmanın güçlü yönleri nelerdir?

  • 160 kişilik görece geniş bir üniversite öğrencisi örneklemi kullanmıştır.
  • İşletme, mühendislik ve bilgisayar bilimi alanlarından öğrencileri kapsamıştır.
  • Sözcük çeşitliliğini tek bir ölçüte dayandırmamış; TTR ve MTLD’yi birlikte kullanmıştır.
  • Genel, akademik ve alanla ilişkili kelimeleri ayrı değerlendirmiştir.
  • Eşdizim, dil düzeyi ve sözcük türü hatalarını incelemiştir.
  • Cümle düzeyindeki doğruluğun yanında metin tutarlılığını ve düzenini değerlendirmiştir.
  • Otomatik ölçümleri insan değerlendirmeleriyle desteklemeye çalışmıştır.
  • Etki büyüklüklerini ortalamalar ve standart sapmalarla birlikte vermiştir.
  • Farklı İngilizce yeterlik düzeyleri için ayrı sonuçlar sunmuştur.
  • Öğrencilerin yararlılık, güven ve kullanım kolaylığı algılarını incelemiştir.
  • Dijital erişim eşitsizliklerini raporlamıştır.
  • Kontrol grubunun bulunmamasını ve uzun dönem kalıcılığın bilinmediğini kabul etmiştir.
  • Yapay zekâ kullanımının öğretmen rehberliğiyle yapılandırılması gerektiğini vurgulamıştır.

Çalışmanın temel sınırlılıkları nelerdir?

  • Kontrol veya karşılaştırma grubu bulunmamaktadır.
  • Öğrenciler rastgele farklı öğretim koşullarına atanmamıştır.
  • Yapay zekâ etkisi öğretmen desteği, aralıklı tekrar ve yazma uygulamasından ayrılamamaktadır.
  • Tek üniversite ve tek dönemle sınırlıdır.
  • Müdahalenin sekiz oturumunun süresi ve ayrıntılı içeriği açıklanmamıştır.
  • ChatGPT modeli, Grammarly sürümü ve araç ayarları belirtilmemiştir.
  • Öğrencilerin iki aracı ne ölçüde kullandığı raporlanmamıştır.
  • Son yazma değerlendirmesinde yapay zekâ kullanımına izin verilip verilmediği açık değildir.
  • Başlangıç ve son yazma görevlerinin karşılaştırılabilirliği gösterilmemiştir.
  • Metinlerin ortalama uzunlukları verilmemiştir.
  • TTR metin uzunluğundan etkilenebilir.
  • İnsan değerlendiricilerin sayısı, körlenmesi ve güvenilirliği belirtilmemiştir.
  • Anketin geçerliği ve güvenilirliği raporlanmamıştır.
  • Görüşme ve odak grubu sonuçları sunulmamıştır.
  • Ara ölçüm verileri raporlanmamıştır.
  • Sözcük sınavlarının sonuçları verilmemiştir.
  • Eşleştirilmiş t testlerinin t değerleri, serbestlik dereceleri ve güven aralıkları yoktur.
  • Çoklu karşılaştırma düzeltmesi raporlanmamıştır.
  • Alt grup tablolarında örneklem sayısı ve standart sapmalar bulunmamaktadır.
  • Gecikmeli kalıcılık testi yapılmamıştır.
  • Yapay zekâ kapalı bağımsız yazma yeterliği ölçülmemiştir.
  • Ham veri ve analiz kodu paylaşılmamıştır.
  • Etik kurulun adı ve onay numarası belirtilmemiştir.
  • Bazı metinsel yorumlar sonuç tablolarıyla çelişmektedir.

Çalışma neyi göstermektedir?

  • Çok bileşenli program sırasında öğrencilerin yazılarında sözcüksel çeşitlilik artmıştır.
  • Akademik kelimelerin ve doğru alan terimlerinin kullanımı yükselmiştir.
  • Sözcüksel hata, uygunsuz dil düzeyi ve doğal olmayan eşdizim oranları düşmüştür.
  • Bağlayıcı ifadelerin ve geçiş türlerinin sayısı artmıştır.
  • İnsan değerlendiricilerin tutarlılık ve düzen puanları yükselmiştir.
  • Öğrenciler araçları genel olarak yararlı ve kolay kullanılır bulmuştur.
  • Öğrencilerin yapay zekâ önerilerine güveni, algılanan yararlılıktan daha düşük kalmıştır.
  • Dijital cihaz ve internet erişiminin bütün öğrencilerde eşit olmadığı görülmüştür.

Çalışma neyi kanıtlamamaktadır?

  • Gelişmelerin yalnızca ChatGPT veya Grammarly tarafından oluşturulduğunu kanıtlamamaktadır.
  • ChatGPT ile Grammarly’den hangisinin daha etkili olduğunu göstermemektedir.
  • Yapay zekâ destekli öğretimin geleneksel öğretimden üstün olduğunu göstermemektedir.
  • Öğrencilerin yapay zekâ olmadan daha iyi yazabildiğini kesinleştirmemektedir.
  • Kazanımların dönem sonrasına taşındığını göstermemektedir.
  • Öğrencilerin eleştirel düşünmesinin geliştiğini doğrudan ölçmemektedir.
  • Akademik dürüstlük ihlallerinin azaldığını göstermemektedir.
  • Öğretmen veya öğrenci zamanından ne kadar tasarruf edildiğini ölçmemektedir.
  • Yapay zekâ araçlarının bütün İngilizce düzeylerinde aynı biçimde etkili olduğunu kanıtlamamaktadır.
  • Sonuçların Türkiye’de aynı büyüklükte ortaya çıkacağını göstermemektedir.
  • Ücretli ve ücretsiz yapay zekâ hizmetlerinin eşit eğitim fırsatı sunduğunu göstermemektedir.

Çalışmanın Yöntemi ve Bulguları

Teknik yöntem özeti

Yöntem bileşeniÇalışmada uygulanan yaklaşım
Araştırma alanıİngilizcenin yabancı dil olarak öğretimi, akademik yazma ve yapay zekâ destekli sözcük öğrenimi
Araştırma türüTek gruplu ön-son ölçümlü, karma yöntemli olarak tanımlanan uygulama araştırması
ÜlkeSuudi Arabistan
KurumUniversity of Prince Mugrin
Katılımcı sayısı160 lisans öğrencisi
Akademik alanlarİşletme, mühendislik ve bilgisayar bilimi
DerslerENGL 101, ENGL 102 ve ENGL 201
İngilizce düzeyleriB1 %18, B2 %58, C1 %24
ÖrneklemeTabakalı örnekleme olarak tanımlanmıştır.
Yapay zekâ araçlarıChatGPT ve Grammarly
Uygulama süresiBir akademik dönem
Yönlendirilmiş oturumÖzette sekiz oturum; ayrıntılı süre belirtilmemiştir.
Öğretim bileşenleriAraç eğitimi, öğretmen desteği, kişiselleştirilmiş plan, oyunlaştırma, aralıklı tekrar ve bağımsız çalışma
Yazma görevi150–300 kelimelik dönem başı ve dönem sonu akademik metinleri
Ölçüm noktalarıBaşlangıç, ara ve son; ara sonuçlar raporlanmamıştır.
Sözcük çeşitliliğiTTR ve MTLD
Sözcük doğruluğuHatasız cümlecik, sözcüksel hata, dil düzeyi, sözcük türü ve eşdizim
Alan diliAkademik kelimeler ve doğru alan terimleri
Metin düzeyiBağlayıcı ifadeler, geçiş türleri, tutarlılık ve düzen
İstatistiksel analizEşleştirilmiş örneklem t testleri ve birleştirilmiş standart sapmaya dayalı Cohen d
Nitel yöntemGörüşmeler, odak grupları, açık uçlu cevaplar ve tematik kodlama; sonuçları ayrıntılı sunulmamıştır.
Kontrol grubuBulunmamaktadır.
Rastgele atamaBulunmamaktadır.
Gecikmeli testBulunmamaktadır.
Yapay zekâ kapalı testUygulanıp uygulanmadığı belirtilmemiştir.

Ana sonuçların düzenli özeti

Ana sonuçBaşlangıçSonuçİstatistiksel değerlendirme
MTLD73,0 ± 12,092,0 ± 13,0d=1,52; p<0,001
Sözcüksel hata / 1000 kelime28,0 ± 9,016,5 ± 7,5d=−1,39; p<0,001
Değerlendirici tutarlılık puanı3,4 ± 0,74,2 ± 0,8d=1,06; p<0,001
Akademik kelime payı%7,5%12,2d=1,70; p<0,001
Doğru akademik eşdizim / 1000 kelime22,033,0d=1,62; p<0,001
Doğru alan terimi / 1000 kelime18,028,0d=1,53; p<0,001
Değerlendirici düzen puanı3,3 ± 0,84,4 ± 0,7d=1,46; p<0,001

Sonuçların kanıt düzeyine göre ayrılması

İddiaÇalışmadaki dayanakGüvenli yorum
Öğrencilerin son yazılarında sözcük çeşitliliği daha yüksektir.TTR ve MTLD ön-son karşılaştırmalarıDoğrudan ölçülen bulgudur.
Sözcüksel hata oranı azalmıştır.Bin kelime başına hata sayımlarıDoğrudan ölçülen bulgudur.
Metinlerin tutarlılık puanı yükselmiştir.İnsan değerlendirici puanlarıÖlçülmüştür; ancak değerlendirici güvenilirliği raporlanmamıştır.
Program öğrenciler tarafından yararlı bulunmuştur.Likert anketiAlgılanan yararlılığı gösterir; nesnel öğrenme etkisini tek başına göstermez.
Yapay zekâ gelişmeye neden olmuştur.Kontrolsüz ön-son tasarımNedensel olarak gösterilmemiştir.
Öğrenciler yapay zekâ olmadan daha iyi yazmaktadır.Yapay zekâ kapalı son test açıklanmamıştır.Gösterilmemiştir.
Eleştirel düşünme ve akademik dürüstlük gelişmiştir.Bu sonuçlara özgü ölçüm bulunmamaktadır.Çalışmanın doğrudan kanıtı değildir.

Bilimsel olarak en güvenli sonuç

Bir akademik dönem boyunca ChatGPT ve Grammarly’yi öğretmen yönlendirmesi, sözcük öğretimi, düzenli yazma uygulaması, oyunlaştırma ve aralıklı tekrarla birlikte kullanan 160 öğrencinin son metinlerinde sözcük çeşitliliği, doğruluk ve metin düzeni göstergeleri başlangıca göre belirgin biçimde iyileşmiştir.

Kontrol grubu ve yapay zekâ kapalı bağımsız son test bulunmadığı için bu kazanımların ne kadarının yapay zekâya ait olduğu ve öğrencilerin araç olmadan aynı gelişimi koruyup korumadığı belirlenememektedir.

Kaynak ve Yöntem Notu

Çalışmanın tam özgün adı: Academic Writing Development Among EFL College Students: Does Artificial Intelligence Make Any Difference?

Yazarlar ve sıraları:

  1. Ahmed T. M. Braima
  2. Asad F. Shafi
  3. Jamal Mohammed Hussien

Eş birinci yazarlık veya eş katkı: Belirtilmemiştir.

Sorumlu yazar: Ahmed T. M. Braima

Kurumsal bağlantılar:

  1. Ahmed T. M. Braima — English Department, University of Prince Mugrin, Medine, Suudi Arabistan
  2. Asad F. Shafi — English Department, University of Prince Mugrin, Medine, Suudi Arabistan
  3. Jamal Mohammed Hussien — ICT Department, University of Prince Mugrin, Medine, Suudi Arabistan

Yazar kimlikleri:

  • Ahmed T. M. Braima — ORCID: 0009-0008-7303-6027
  • Asad F. Shafi — ORCID: 0009-0009-9277-8330
  • Jamal Mohammed Hussien — ORCID: 0000-0002-9015-2694

Dergi: Arab World English Journal

Cilt ve sayı: 17(2)

Sayfa aralığı: 3–18

Yayın tarihi: 15 Haziran 2026

DOI:10.24093/awej/vol17no2.1

Resmî çalışma bağlantısı:Arab World English Journal makale sayfası

Özgün yayınevi: Arab World English Journal

ISSN: 2229-9327

Kaynak türü: Tek gruplu ön-son ölçümlü, karma yöntemli olarak tanımlanan eğitim araştırması

Hakemlik durumu: Hakemli dergi makalesidir. Arab World English Journal, araştırma makaleleri için editör ön incelemesi ve en az iki anonim değerlendiricinin yer aldığı çift kör hakemlik uyguladığını bildirmektedir.

Teslim tarihi: Makalede ve derginin resmî sayfasında “02/215/2026” yazmaktadır. Geçerli bir tarih olmadığı için doğru teslim günü belirlenememektedir.

Kabul tarihi: 17 Nisan 2026

Finansman: Araştırmanın özel bir finansman almadığı bildirilmiştir.

Teşekkür: University of Prince Mugrin bünyesindeki English Department, ICT Department ve Research Initiatives Program’a teşekkür edilmiştir.

Çıkar çatışması: Yazarlar çıkar çatışması bulunmadığını açıklamıştır.

Etik açıklama: Katılımcılardan bilgilendirilmiş onam alındığı, araştırmadan çekilme hakkı tanındığı ve verilerin anonim, şifreli ve güvenli biçimde saklandığı belirtilmiştir. Etik kurulun adı, onay tarihi ve karar numarası verilmemiştir.

Veri ve kod erişimi: Ham öğrenci verilerinin, değerlendirme kodlarının veya istatistiksel analiz kodunun paylaşımına ilişkin bir erişim açıklaması bulunmamaktadır.

Yapay zekâ kullanım açıklaması: Yazarlar makalenin hazırlanmasında yalnızca okunabilirlik ve dil düzenlemesi için Grammarly kullandıklarını, metni kendilerinin gözden geçirdiğini ve içerikten bütünüyle sorumlu olduklarını bildirmiştir.

Temel yöntem uyarısı: Uygulama; yapay zekâ araçlarını, öğretmen rehberliğini, kişiselleştirilmiş öğretimi, oyunlaştırmayı, aralıklı tekrarı ve düzenli yazma uygulamasını birlikte içermektedir. Kontrol grubu olmadığı için yapay zekânın bağımsız katkısı hesaplanamamaktadır.

Temel ölçüm uyarısı: Son yazma görevlerinin yapay zekâ kapalı yürütülüp yürütülmediği açıklanmamıştır. Bu nedenle araç destekli metin kalitesi ile öğrencinin bağımsız yazma yeterliği ayrılamamaktadır.

Temel istatistik uyarısı: Cohen d değerleri başlangıç ve son standart sapmalarının birleştirilmesiyle hesaplanmıştır. Eşleştirilmiş puanların korelasyonu, t istatistikleri, serbestlik dereceleri ve güven aralıkları raporlanmadığından analiz tam olarak yeniden üretilememektedir.

Temel raporlama uyarısı: Ara ölçümler, sözcük sınavları, görüşmeler ve odak grupları yöntem bölümünde bulunmasına rağmen bunların ayrıntılı sonuçları sunulmamıştır. İnsan değerlendiricilerin sayısı ve puanlama güvenilirliği de açıklanmamıştır.

Bu Türkçe değerlendirme çalışmanın başlık sayfası, özeti, kuramsal çerçevesi, katılımcı tablosu, araştırma araçları, uygulama süreci, yedi sonuç tablosu, tartışması, sınırlılıkları, sonuç bölümü, etik ve yapay zekâ açıklamaları ile kaynakçası incelenerek hazırlanmıştır. Bilimsel bulgulara dış kaynaklardan yeni sonuç eklenmemiştir. Dış kaynaklar yalnızca makalenin resmî kaydını, kurum adını, DOI bilgisini, yayın tarihini ve derginin hakemlik sürecini doğrulamak için kullanılmıştır.

Araştırmanın en değerli yönü, yapay zekâ destekli yazmayı yalnızca dilbilgisi hataları üzerinden değerlendirmemesi; sözcük çeşitliliği, akademik eşdizimler, alan terminolojisi ve metin düzeni gibi daha geniş sonuçlara bakmasıdır. En önemli sınırlılığı ise görülen büyük ön-son farkların yapay zekâya özgü bir etkiden kaynaklandığını gösterecek karşılaştırmalı tasarıma sahip olmamasıdır.


Paylaş:

Yorumlar incelendikten sonra yayımlanır.Gönderdiğiniz yorum onay sürecine alınır ve uygun bulunduğunda görünür hâle gelir.

Bir yorum bırakın

E-posta adresiniz yayınlanmayacaktır. Gerekli alanlar * ile işaretlenmiştir

Your experience on this site will be improved by allowing cookies Cookie Policy