Bu Sayfa Nedir? — Sayfa İçi Kılavuz
Amaç
Derlem (T-BDLD) Türkçe Bağlama Duyarlı Lematizasyon Derlemi'ndeki her sözcüğün hangi bağlamsal alana (bilim, sanat, teknoloji, hukuk, tarih vb.) ne ölçüde yakın durduğunu görmek. Roman, öykü ve şiir profilleri de cümle içeriğinden ayrı metinsel oluşumlar olarak hesaplanır.
Alanlar ve Metinsel Oluşumlar
Yerleşik 21 alan adı, sonuçların zaman içinde karşılaştırılabilmesi için sabit kalır; ancak alan profilleri ve sayıları her yenilemede güncel derlemden yeniden öğrenilir. Alan adı yalnız başlangıç erişim sorgusudur; asıl profil, bu sorguyla erişilen derlem belgelerinin bütün söz varlığından ve bağlamlarından kurulur. Önceden hazırlanmış anahtar sözcük listeleri sınıflandırma ve sayıma girmez. Roman, öykü ve şiir ise cümleden çıkarılan ayrı bir metinsel oluşum ekseninde kestirilir.
Yöntem — Özet
- Dengeli deterministik örnekleme: Cümleler derlemin tüm sırasına yayılmış biçimde seçilir. Tek bir uzun yapıtın veya yoğun kaynağın modeli ele geçirmemesi için belge ve kaynak grubu başına üst sınır uygulanır.
- İçerik gösterimi: Gürültüden arındırılmış lema tekli ve ikili dizileri alt doğrusal TF-IDF ile ağırlıklandırılır. Başlık ve yayın üstverisi, içerik ağırlığının dörtte biriyle ayrı bir görünüm oluşturur.
- Anlamsal indirgeme: Kısaltılmış SVD, seyrek içerik ve üstveri matrisini en çok 144 boyutlu, normalize edilmiş ortak anlamsal uzaya indirger.
- Derlemden öğrenilen alan profilleri: Alan adı erişimi başlatır; merkez vektör ve ayırt edici söz varlığı erişilen derlem belgelerinden öğrenilir. Hazır anahtar sözcük envanteri modele girmez.
- Dinamik kümeleme: Birden çok küme sayısı için MiniBatch K-Means çalıştırılır. Son seçim; kosinüs silueti, bağımsız başlangıçlar arasındaki Düzeltilmiş Rand İndeksi kararlılığı ve aşırı büyük/küçük küme cezalarını birleştirir.
- Atama ve belirsizlik: Cümle-profil yakınlığı, bağımsız küme kanıtı, puan marjı ve güven kapıları birlikte kullanılır. Belirsiz cümleler zorla bir alana atanmaz.
- Metinsel oluşumlar: Roman, öykü ve şiir kanıtı kaynak dosyası etiketinden kopyalanmaz; cümle içeriğinden ayrı eksende kestirilir.
- Kalite kapısı: Kanonik lema düzeltmeleri tarama sırasında uygulanır; kesinleşmiş OCR ve bölümleme gürültüsü söz varlığı sıralamalarından çıkarılır.
Metrikler
- Baskınlık (0-1): Sözcüğün görüldüğü cümlelerin ne kadarı o bağlamsal alanla etiketli.
- Temsil kapsamı: Alan kanıtı atama güven kapısını geçen cümlelerin derlemdeki tahmini oranı.
- Siluet: Kümelerin kosinüs uzayında birbirinden ne ölçüde ayrıldığını gösterir; yüksek değer daha belirgin sınır demektir.
- Kararlılık (ARI): Bağımsız iki başlangıçla üretilen küme atamalarının Düzeltilmiş Rand İndeksiyle uyuşması; siluetle birlikte değerlendirilir.
- Alan entropisi: Sözcüğün güncel bağlamsal alanlara dağılım çeşitliliği. 0, tek kategoriye yoğunlaşmayı gösterir; üst sınır kategori sayısıyla birlikte değişir.
- Güven düzeyi: yüksek orta düşük — puan eşiklerine göre.
- Alan durumu: tek alan / baskın (bir alan açıkça önde), karışık (birden fazla alanda güçlü sinyal), genel (hiçbir alana ayırt edici değil).
- Temsil gücü puanı: Cümle desteği, anlamsal güven, kaynak grubu çeşitliliği ve ayırt edici söz varlığı kanıtını 0–100 arasında birleştirir.
- Denge puanı: Bir kategorinin payının temsil edilen kategoriler arasındaki ideal paya yakınlığını gösterir. Genel derlem puanı normalize Shannon dengeliliğiyle hesaplanır.
- Yoğunlaşma ve etkili alan sayısı: Normalize alan paylarından HHI hesaplanır; bunun tersi, gözlenen yoğunluğu eşit ağırlıkla oluşturacak alan sayısını verir.
Sekmeler Ne İşe Yarar?
- Özet ve Kılavuz: Canlı derlem sayaçlarını, model puanlarını, güncelleme zamanını ve bu yöntem açıklamasını sunar.
- Alan İstatistikleri: Alfabetik alan kartlarını; her alanın temsil, güven, denge ve ayırt edici söz varlığı kanıtını gösterir.
- Sözcük Arama: Derlem sözcüklerinin güncel alan dağılımını, baskınlığını, entropisini, güvenini ve metinsel oluşum kanıtını aratır.
- Kategori Kesişimi: Alanlar ve metinsel oluşumlar arasındaki cümle düzeyindeki birlikte etkinleşme kestirimlerini gösterir.
- Bulgular ve Yorum: Kapsama, denge, yoğunlaşma, küme kalitesi, temsil ve söz varlığı kanıtından sürümlü yorum üretir.
- Cümle Benzerliği: Derlem çeşitliliğini, tam tekrar imzalarını, en yakın komşu TF-IDF kosinüsünü, cümle uzunluğunu, TTR'yi ve sözcük/POS perplexity değerlerini gösterir.
Cümle Benzerliği Algoritmaları
- Dağıtılmış örneklem: Cümleler derlemin başından alınmaz; canlı derlem sırasının tamamına deterministik biçimde yayılır.
- TF-IDF kosinüsü: Her örnek cümle seyrek sözcüksel uzaydaki en yakın komşusuyla karşılaştırılır. Bu ölçüm insan benzeri anlam eşdeğerliğini değil, sözcüksel-geometrik yakınlığı gösterir.
- Tam tekrar: Kanonik cümle hash değerleriyle toplam cümle sayısı ve benzersiz imza sayısı karşılaştırılır.
- Uzunluk ve TTR: Ayrı bir dağıtılmış örneklemde cümle uzunluğu yüzdelikleri ve lema tip/token oranı hesaplanır.
- Perplexity: Düzeltmeli lema bigram modeli sözcüksel beklenirliği; ayrı eğitilen POS bigram modeli sözcük türü dizilerinin beklenirliğini ölçer.
Sınırlılıklar
- Alan etiketleri sözlüğün ontolojik sınıfı değil, derlemdeki bağlamsal kullanım alanını gösterir. Örn. "mektup" hukuk bağlamında daha çok geçebilir; bu "mektup bir hukuk sözcüğüdür" anlamına gelmez.
- Özel ad süzgeci bilinçli olarak sert tutuldu; bazı ortak sözcükler yanlışlıkla dışlanmış olabilir.
- Alan ve metinsel oluşum toplamları deterministik, belge dengeli cümle örnekleminden kestirilir.
Bu Sayfada Kullanılan Kısaltmalar
Bağlamsal alanlar ve metinsel oluşumlar arasındaki yakınlık, cümlelerin anlamsal uzaydaki birinci ve ikinci kategori uzaklıklarından hesaplanır.
Kategori Kesişim Isı Haritası
En Yüksek Kesişimler
Derlem Cümle Benzerlik İstatistikleri
T-BDLD derlemindeki cümle çeşitliliği ve tekrar/yakın-tekrar oranlarını geometrik (TF-IDF + kosinüs) yaklaşımıyla ölçer. BERT/anlam vektörü kullanılmaz.
- Ortalama, medyan, p90 ve p99 kosinüs değerleri yakınlık dağılımının farklı kesimlerini açıklar. “Çok benzer” oranının düşük olması, örneklemde yakın tekrar kümelerinin sınırlı olduğunu gösterir.
- Yüksek “çok benzer” oranı (>%5) şablonik içerik, yinelenen web tanıtımları veya yakın kopya cümlelerle ilişkili olabilir.
- TTR örneklem büyüklüğüne duyarlıdır. Aynı örneklem büyüklüğü ve yöntemle yapılan hesapları karşılaştırmada kullanılır; tek başına mutlak söz varlığı zenginliği puanı değildir.
- Tam tekrar oranı, bütün cümle satırlarını benzersiz kanonik özet imzalarıyla karşılaştırır. Tam yinelenmeyi bu ölçü, sözcüksel yakınlığı ise kosinüs ölçer.
- Sözcüksel perplexity, lema dizisinin güncel lema ikili dizilim modeline göre ne ölçüde beklenmedik olduğunu kestirir. Yüksek uç değerler seyrek dil, özel ad, yabancı parça veya OCR gürültüsü de içerebilir.
- Sözdizimsel perplexity, sözcük türü dizisinin güncel POS ikili dizilim modeline göre ne ölçüde beklenmedik olduğunu kestirir; dil bilgisel doğruluğu ölçmez.
- Sözcüksel ve sözdizimsel perplexity farklı söz varlığı ve ölçeklere sahiptir. Birbirleriyle doğrudan değil, kendi dağılımları ve aynı modelin önceki hesaplarıyla karşılaştırılır.
Bu Derlem Bize Ne Anlatıyor?
Bu sekme, bu sayfada sunulan veriye ilişkin ayrıntılı okuma ve yorumları içerir. Sayılar çıplak hâlleriyle somuttur; asıl sözlükbilimsel değer, sayıların neyi göstermediğini de bilerek yorumlanmasında yatar. Aşağıda temsil kapsamı, alan dengesi ve yoğunlaşması, küme ayrışması ve kararlılığı, alanların temsil gücü, cümle-temelli metinsel oluşumlar, alanlar arası yakınlık, söz varlığı kanıtı ve bu bulguların GTS için çıkarımları ele alınıyor.
⟳ Bu sayfa zamanla güncellenmektedir: derlem genişledikçe veya içerik modeli yeniden kalibre edildikçe hem sayılar hem de aşağıdaki yorumlar yenilenir. Son çözümleme tarihi Özet sekmesinin altında görülebilir.