İçeriğe geç
KelimetriK

KelimetriK Hakkında

Türkçe için bir psikodilbilim aracı

Tam olarak denetlenmiş bir sözcük uyaran kümesi için uygun sözcüklerin seçilmesi, etkili psikodilbilim çalışmalarının temel bir bileşenidir (Perea & Pollatsek, 1998; Bowers, Davis & Hanley, 2005). Görsel sözcük tanıma çalışmasının uyaranları yüksek sıklıklı sözcüklerden oluşuyorsa bu durum davranışsal puanlarda yanlılığa ve hatalı çıkarımlara yol açabilir. Bu nedenle sözel uyaranlarla çalışan araştırmacıların bu tür sözcüksel değişkenleri denetlemesi gerekir.

KelimetriK, Türkçe sözcüklerin çeşitli sözcüksel değişkenlerini ve ortografik istatistiklerini raporlayan sorgu tabanlı bir araçtır: sözcük sıklığı, komşuluk büyüklüğü, ortografik benzerlik ve ilişkililik. Diğer dillerdeki karşılıkları İngilizce için N-Watch (Davis, 2005) ve İspanyolca için BuscaPalabras'tır (Davis & Perea, 2005). Bu web sürümü ve API, 2014 tarihli masaüstü programının yerini alır; aynı sözlükçeyi ve aynı algoritmaları kullanır.

Sözcüksel değişkenler

Sözcük sıklığı

Bir sözcüğün derlemde milyon sözcük başına kaç kez geçtiği. Tepki süresi ile sıklık arasında tutarlı bir logaritmik ilişki vardır; etki düşük sıklıklı sözcüklerde daha büyüktür (Davis, 2005).

İkili ve üçlü harf dizisi sıklığı

İkili ve üçlü harf dizileri, bir sözcüğün iki ve üç komşu harften oluşan dizilere ayrıştırılmasıyla elde edilir (Manning & Schütze, 1999). Örneğin “kule” sözcüğünün ikilileri “ku”, “ul”, “le”; üçlüleri “kul”, “ule”dir. Konuma özgü sayı, aynı uzunluktaki diğer sözcüklerden aynı konumda aynı diziyi taşıyanların sayısıdır; toplam sayı, bu dizinin aynı uzunluktaki diğer sözcüklerde herhangi bir konumda geçme sayısıdır. Ortalama, sözcüğün tüm dizileri üzerinden alınır.

Ortografik komşuluk büyüklüğü (Coltheart N'si)

Sözcüğün tek bir harfi değiştirilerek sözlükçeden elde edilebilen sözcük sayısı (Coltheart vd., 1977). Örneğin “kule” sözcüğünün 9 komşusu vardır: şule, kula, kulp, fule, kale, köle, kele, kile, kuşe. Komşuluk büyüklüğü sözcüksel karar, adlandırma, algısal tanıma ve anlamsal sınıflandırma görevlerindeki performansı etkiler (Perea & Pollatsek, 1998).

Ortografik Levenshtein Uzaklığı 20 (OLD20)

Sözcüğün sözlükçedeki en yakın 20 sözcüğe olan Levenshtein uzaklıklarının ortalaması (Yarkoni, Balota & Yap, 2008). Levenshtein uzaklığı, bir harf dizisini diğerine dönüştürmek için gereken en az değiştirme, silme ya da ekleme işlemi sayısıdır (Levenshtein, 1966). İngilizcede OLD20, görsel sözcük tanımadaki varyansı komşuluk büyüklüğü ve sözcük uzunluğundan daha iyi açıklar.

Yer değiştirmiş harf benzerliği

İki sözcük yalnızca bitişik bir harf çiftinin yer değiştirmesiyle birbirinden ayrılıyorsa yer değiştirmiş harf (TL) komşusudur; “esen” ve “esne” gibi. TL benzerliği adlandırma ve sözcüksel karar performansını kolaylaştırabilir (Andrews, 1996).

Alt küme / üst küme benzerliği

Bir sözcük başka bir sözcüğün içinde geçiyorsa alt küme/üst küme benzerliği vardır; “sütun” (üst küme) içindeki “süt” (alt küme) gibi. Uyaran kümesinde gömülü sözcüklerin bulunması okuma performansını etkileyebilir ve davranışsal sonuçları karıştırabilir (Bowers, Davis & Hanley, 2005).

Sözde sözcükler

Masaüstü programından farklı olarak bu sürüm sözlükçede bulunmayan dizileri (sözde sözcükleri) de kabul eder. Bunlar için sözcük türü ve sıklık “mevcut değil” olarak raporlanır; N, OLD20, harf dizisi istatistikleri ve benzerlik listeleri sözlükçeye göre hesaplanır.

Sözlükçe

Sözlükçe, özgün KelimetriK aracı için derlenen, sözcük türü etiketli ve milyonda sıklık değerli 30008 Türkçe sözcük içerir (sözlükçe sürümü 2014.2). Kaynak veri ve derleme betikleri uygulamayla birlikte yayımlanır. Derleme kuralları için aşağıdaki sözlükçe bölümüne bakın.

Sözlükçe

Sözlükçe (sürüm 2014.2)

Güncel sözlükçe, ham BOUN kök-sayım tablosundan (383.413.544 sözcük; Sak, Güngör & Saraçlar, 2011; Bozşahin, Köprü & Şirin, 2012 kök listesi ve belirsizlik giderme) açık kurallarla yeniden derlenmiştir: eş yazımlı anlam işaretleri birleştirildi; harf dışı karakter içeren kökler ve büyük harfli kısaltmalar çıkarıldı; cümle başı büyük harfli biçimler küçük harfli biçimleriyle birleştirildi, kalan büyük harfli kökler özel ad olarak çıkarıldı; düzeltme işaretli harfler düz harflere indirgendi (kâr → kar) ve her kaynak yazımın sayısı saklandı; bir biçimin tüm sözcük türü okumaları sayıldı ve baskın olan sözcük türü olarak verildi; sıklık milyon sözcük başına toplam sayı, Zipf ise milyar başına sayının log10'udur. 30008 biçim.

â, î, û içeren sözcükler

Derlemin arkasındaki çözümleyici, şapkasız yazımları şapkalı sözlük köklerine indirgemiştir (örneğin hâl 530.544 kez sayılırken hal yalnızca 2.908 kez sayılmıştır; oysa yazarların çoğu şapkayı kullanmaz). Ortografik ölçümler okurların gerçekten gördüğü harf dizilerini yansıtmalı; bu nedenle sözlükçe â, î, û harflerini a, i, u'ya indirger, sayıları birleştirir ve kaynak yazımları sayılarıyla listeler. Sorgular da aynı biçimde indirgenir; kâr ve kar aynı sonucu verir.

2014 masaüstü listesinden farklar

Ham veriyle karşılaştırıldığında 2014 masaüstü programıyla dağıtılan liste yaklaşık 10.000 özel adı küçük harfe çevirerek listeye almış, düzeltme işaretli sözcükleri kayıt tutmadan düz biçimleriyle birleştirmiş, kısaltmaları sözcüklerle kaynaştırmış (ab, AB'nin sayısını almış), eş yazımlılarda yalnızca ilk sözcük türü okumasını tutmuş ve belgelenmemiş bir milyon-başına paydası kullanmıştır. Bu liste artık sunulmamaktadır; başvuru amacıyla kaynak depoda durmaktadır.

Veriyi indir

Her satırda bir sözcük ve önceden hesaplanmış tüm ölçümler. UTF-8, virgülle ayrılmış, ondalık nokta; çok değerli sütunlar noktalı virgülle ayrılmış anahtar:değer çiftleri kullanır. Aynı veri API üzerinden JSON olarak da sunulur.

Tüm sözlükçeyi indir (CSV, 30008 sözcük)

Sütunlar

word
Sözcük biçimi (küçük harf, Türkçe kurallar, düzeltme işareti kaldırılmış).
pos
Baskın sözcük türü: noun, adj, verb, adv, pron, det, postp, conj, interj, dup, ques.
frequency
Milyon sözcük başına geçiş (sayı ÷ 383.413.544 × 10⁶).
count
BOUN derlemindeki ham geçiş sayısı (tüm okumalar ve yazımlar).
zipf
Zipf ölçeğinde sıklık: milyar sözcük başına geçişin log10'u (1 = çok seyrek, 7 = çok sık).
posFrequencies
Sözcük türü okuması başına sayı, örn. det:4975555;pron:1511224.
spellings
Bu biçime indirgenen kaynak yazımlar ve sayıları, örn. kâr:125959;kar:4237.
length
Harf sayısı.
n
Ortografik komşuluk büyüklüğü (Coltheart N'si): tam olarak bir harfi farklı, aynı uzunluktaki sözcükler.
old20
Sözlükçedeki en yakın 20 sözcüğe ortalama Levenshtein uzaklığı.
bigramPositionalMean
Sözcüğün ikilileri üzerinden, aynı ikiliyi aynı konumda taşıyan aynı uzunluktaki sözcük sayısının ortalaması.
bigramTotalMean
Sözcüğün ikilileri üzerinden, ikilinin aynı uzunluktaki sözcüklerde herhangi bir konumda geçiş sayısının ortalaması.
trigramPositionalMean
Yukarıdaki gibi, üçlüler için (konuma özgü).
trigramTotalMean
Yukarıdaki gibi, üçlüler için (herhangi bir konum).
transposedCount
Bitişik iki harfi yer değiştirerek elde edilen sözlükçe sözcüğü sayısı.
subsetCount
Bu sözcüğün içinde geçen sözlükçe sözcüğü sayısı.
supersetCount
Bu sözcüğü içeren sözlükçe sözcüğü sayısı.

Lisans

Sözlükçe Creative Commons Atıf 4.0 Uluslararası (CC BY 4.0) lisansıyla yayımlanır. 2014 makalesine ve bu siteye atıf yaparak kaynağı belirttiğiniz sürece veriyi yayınlarda ve ek materyallerde dahil her amaçla kopyalayabilir, dağıtabilir ve uyarlayabilirsiniz.

Lisansı oku (CC BY 4.0)

Nasıl atıf yapılır

Araştırmanızda KelimetriK'i kullanıyorsanız lütfen aracı ve sözlükçesini tanımlayan makaleye atıf yapın:

Erten, B., Bozsahin, C., & Zeyrek, D. (2014). Turkish Resources for Visual Word Recognition. Proceedings of the Ninth International Conference on Language Resources and Evaluation (LREC'14), 2106–2110. Reykjavik, Iceland: European Language Resources Association (ELRA). https://aclanthology.org/L14-1279/
BibTeX
@inproceedings{erten-etal-2014-turkish,
  title     = {Turkish Resources for Visual Word Recognition},
  author    = {Erten, Beg{\"u}m and Bozsahin, Cem and Zeyrek, Deniz},
  booktitle = {Proceedings of the Ninth International Conference on Language Resources and Evaluation ({LREC}'14)},
  month     = may,
  year      = {2014},
  address   = {Reykjavik, Iceland},
  publisher = {European Language Resources Association (ELRA)},
  pages     = {2106--2110},
  url       = {https://aclanthology.org/L14-1279/}
}

Ek olarak bu web uygulamasına da atıf yapabilirsiniz:

Erten Uyumaz, B. (2026). KelimetriK (Version 2) [Web application]. https://kelimetrik.onthejourney.nl

API

Tüm ölçümlere bir JSON API aracılığıyla programatik olarak erişilebilir. Uç noktalar ile curl, Python ve R örnekleri için API belgelerine bakın.

Yazar

KelimetriK, Begüm Erten Uyumaz tarafından Orta Doğu Teknik Üniversitesi (ODTÜ) Bilişsel Bilimler yüksek lisans araştırması kapsamında, Cem Bozşahin ve Deniz Zeyrek danışmanlığında geliştirilmiştir.

Kaynaklar