Morfobağlamsal İmza
Bir kullanımın biçimbilgisel yapısını silmeden yakın ve uzak bağlam kanıtlarını tek bir denetlenebilir kayıtta nasıl birleştirebilir; hangi ekin, komşuluğun, söylem ilişkisinin ve kaynak özelliğinin son kararı değiştirdiğini nasıl görünür tutabiliriz?
\operatorname{MBİ}(x)=\langle\mathrm{yüzey},\mathrm{lema},\mathrm{ekler},\mathrm{tür},\mathrm{rol},C_{\mathrm{yakın}},C_{\mathrm{söylem}},\mathrm{kaynak},\mathrm{güven}\rangle
MBİ(x) = ⟨yüzey, lema, ekler, tür, rol, C_yakın, C_söylem, kaynak, güven⟩
Yöntem: Her kullanım için surface format, lema adayları, doğru ek dizisi, sözcük türü, değerlik rolü, yakın lema örüntüsü, söylem işlevi, resource group ve güven aralığı ayrı alanlarda tutulur. Alanlar tek puana indirgenmeden önce uyum ve çelişki kurallarıyla karşılaştırılır.
Beklenen sonuç: Türkçede bağlamın bir bölümünün sözcük içindeki eklerde taşındığını korur. Lema doğru görünse bile ek sınırı veya gönderim rolü yanlışsa kayıt çelişki üretir ve otomatik yayın yerine inceleme kuyruğuna yönelir.
Sınır: İmzanın ayrıntılı olması doğruluğu tek başına garanti etmez. Kaynak cümle parçalıysa, OCR bozuksa veya biçimbilgisel çözümleyici yanlış aday üretmişse bütün katmanlar aynı hatalı başlangıçtan etkilenebilir.
BiçimLema ve ek sınırı
SentenceTür, değerlik ve bağıntı
SöylemGönderim ve ilişki
KararKalibre güven ve insan kapısı
02İnsan etiketli alt kümede ölçülür
Bağlamsal Ayrıştırma Kazancı
Bir sözcüğün çevresine ek, yakın komşuluk, cümle ve söylem katmanlarından yeni kanıt eklendiğinde lema, anlam veya sözcük türü belirsizliği gerçekten ne kadar azalıyor; görülen düşüş hangi bağlam ölçeğine güvenilebileceğini nasıl gösteriyor?
\operatorname{BAK}_k=H(A)-H\!\left(A\mid C_1,\ldots,C_k\right)
BAK_k = H(A) - H(A | C_1, …, C_k)
Yöntem: İnsan denetimli aday sınıflarında önce bağlamsız çözümleme entropisi, sonra ek, yakın sözcük, cümle ve söylem kanıtı sırayla eklendiğinde kalan koşullu entropi hesaplanır. Kazanç her katman için ayrı verilir; hangi bağlam ölçeğinin kararı değiştirdiği görünür kalır.
Beklenen sonuç: Yüksek kazanç, ilgili bağlam katmanının aday uzayını gerçekten daralttığını gösterir. Türkçede kişi ve durum eklerinin yakın sözcük sırasından önce güçlü ayrım sağladığı kullanımlar ile söylem öncülü gerektiren kullanımlar birbirinden ayrılır.
Sınır: Etiketsiz örüntü çeşitliliği anlam sınıfı değildir. Altın standart sınıflar eksik veya dengesizse kazanç yapay biçimde yüksek görünebilir; bu nedenle canlı sayfada yalnız etiketli deney sonuçları kesin ayrıştırma ölçüsü sayılır.
Aday uzayıBağlamsız seçenekler
Ek bağlamıBiçimbilgisel daralma
Cümle bağlamıRol ve tür daralması
Söylem bağlamıAnlam ve gönderim kararı
03Canlı hareketli pencerede etkin
Bağlam Direnç İndeksi
Bir bağlam göstergesinin oranı veri akışının ardışık parçalarında ve değişen kaynak bileşiminde korunuyor mu, yoksa tek bir kitap, tez veya makale yığınının etkisiyle geçici olarak mı yükseliyor; bu oynaklık nasıl açıklanabilir bir direnç puanına dönüşür?
\operatorname{BDİ}(f)=100\left[1-\min\!\left(1,\frac{\sigma(r_f)}{\mu(r_f)}\right)\right]
BDİ(f) = 100 × [1 - min(1, σ(r_f) / μ(r_f))]
Yöntem: En yeni 100.000 sentences dört eşit akış dilimine ayrılır. Nedensellik, karşıtlık, gönderim ve kiplik oranlarının değişim katsayısı hesaplanır; düşük değişkenlik yüksek direnç puanı üretir. Kaynak karışımı ayrıca gösterilerek puanın neden değiştiği yorumlanabilir.
Beklenen sonuç: Puan, güncel akışta örüntünün kararlılığını hızlı biçimde görünür kılar. Farklı kaynaklar arka arkaya işlendiğinde hangi işlevlerin sabit kaldığını, hangilerinin kaynak türüne duyarlı olduğunu ayırmaya yardım eder.
Sınır: Derleme eklenme sırası yayın tarihi değildir ve dört dilim tarihsel dönem oluşturmaz. Puan dil değişimini kanıtlamaz; yalnız güncel işlem akışındaki dağılım dayanıklılığını gösterir ve kaynak bileşimiyle birlikte okunmalıdır.
Dil 125.000 sentences
Dil 225.000 sentences
Dil 325.000 sentences
Dil 425.000 sentences
DirençOran değişkenliğinden puan
04Pilot ve insan denetimli
Söylem Hiper-grafı
Bir cümlede birden çok gönderim, olay, katılımcı ve söylem ilişkisi aynı anda kurulurken ikili kenarların ötesine nasıl geçebilir; önceki olay kümesini sonraki sonuç veya değerlendirmeye bağlayan çoklu ilişkiyi kaybetmeden nasıl modelleyebiliriz?
\mathcal H=(V,E,\mathbb H),\qquad \mathbb H_i\subseteq V,\quad |\mathbb H_i|\ge 2
H = (V, E, ℋ); ℋ_i ⊆ V ve |ℋ_i| ≥ 2
Yöntem: Düğümler sözlükbirimleri, olayları ve gönderim varlıklarını; ikili kenarlar yakın bağıntıları; hiper-kenarlar ise aynı önermeyi, neden kümesini veya gönderim zincirini birlikte kuran çoklu birimleri temsil eder. Eklerle işaretlenen düşürülmüş katılımcılar görünmez düğüm olarak değil, yüklem imzasına bağlı açık özellik olarak tutulur.
Beklenen sonuç: Model, “Bu yüzden” gibi bir bağın yalnız iki sözcüğü değil önceki olay kümesiyle sonraki değerlendirmeyi bağladığını gösterebilir. Aynı metindeki çoklu nedenler ve zincirleme göndermeler tek bir yanlış öncüle indirgenmez.
Sınır: Hiper-grafın yoğunluğu yorum doğruluğu değildir. Cümle sınırı hataları ve yanlış gönderim adayları çok sayıda sahte kenar üretebilir; yayımlanan hiper-kenarlar karşı örnek ve insan incelemesi olmadan kesin sayılmaz.
VarlıklarGönderim düğümleri
OlaylarYüklem ve katılımcılar
İlişkilerNeden, karşıtlık ve koşul
Hiper-kenarÇoklu söylem bağı
05Deneysel geometrik çözümleme
Bağlam Yörüngesi Eğriliği
Aynı sözlükbirimin different sentencelerdeki bağlamsal temsilleri anlam kümeleri arasında nasıl hareket ediyor; konu ve kaynak etkisini anlam değişmesinden ayırarak keskin geçiş noktalarıyla yumuşak anlam genişlemelerini hangi geometrik kanıtlarla belirleyebiliriz?
\kappa_i=\frac{\left\|v_{i+1}-2v_i+v_{i-1}\right\|}{\left(\left\|v_i-v_{i-1}\right\|+\varepsilon\right)^2}
κ_i = ||v_{i+1} - 2v_i + v_{i-1}|| / (||v_i-v_{i-1}|| + ε)²
Yöntem: Aynı lemanın insan denetimli kullanımları bağlamsal gömme uzayına yerleştirilir. Komşuluk grafı üzerinde yerel yön değişimi, yoğunluk ve kaynak yayılımı ölçülür. Keskin yön değişimi yeni anlam adayı üretir; süreklilik gösteren yumuşak geçiş ise yakın anlam genişlemesi olarak incelenir.
Beklenen sonuç: Tek merkezli küme varsayımını bırakır ve anlamların süreklilik üzerinde değişebileceğini gösterir. Türkçedeki (PHP 3, PHP 4)ler önce doğru lemaya hizalandığı için geometrik ayrım yüzey eklerinden kaynaklanan yapay uzaklığı azaltır.
Sınır: Gömme uzayındaki uzaklık doğrudan anlam uzaklığı değildir. Konu, özel ad, kaynak türü ve tokenleme parçalanması eğriliği etkileyebilir; geometrik sıçrama ancak cümleler okunup anlam karşıtlığı doğrulandığında yeni anlam kanıtına dönüşür.
Kullanımlarİnsan denetimli cümleler
Gömme uzayıBağlamsal temsiller
YörüngeYerel komşuluk yolu
EğrilikAnlam geçişi adayı
06Etkin öğrenme öncesi denetim
Karşı-olgusal Bağlam Testi
Bir modelin lema, anlam veya gönderim kararını gerçekten hangi bağlam parçası değiştiriyor; high trust dil bilgisel kanıttan mı, yoksa yalnız aynı metinlerde tekrarlanan konu sözcüklerinin ve kaynak kalıplarının ezberlenmesinden mi geliyor?
\operatorname{KBT}(t,c_i)=\left|P(a\mid C)-P\!\left(a\mid C\setminus\{c_i\}\right)\right|
KBT(t,c_i) = |P(a|C) - P(a|C\{c_i})|
Yöntem: Cümledeki hedef dışı birimler dil bilgisel uygunluğu koruyacak biçimde silinir, yer değiştirilir veya aynı türden karşı örneklerle değiştirilir. Lema, anlam veya gönderim olasılığındaki değişim kaydedilir. Eklerin rastgele koparılması yasaktır; karşı-olgusal cümle Türkçenin ses ve morfotaktik düzenine uygun kalmalıdır.
Beklenen sonuç: Kararı taşıyan asıl kanıt ile yalnız aynı konuda sık görülen sözcükleri ayırır. Bir “yüz” kullanımında sayı sözünün çıkarılması anlam kararını değiştirirken ilgisiz bir sıfatın çıkarılması değiştirmiyorsa modelin dayanağı açıklanabilir hâle gelir.
Sınır: Karşı-olgusal metin doğal değilse olasılık değişimi bağlam önemini değil bozuk cümleyi yansıtır. Bu nedenle değiştirmeler biçimbilgisel kapıdan geçer ve seçili örnekler insan tarafından doğallık bakımından denetlenir.
Asıl cümleBaşlangıç olasılığı
Denetimli değişimBir kanıt değiştirilir
Yeni olasılıkKarar farkı ölçülür
DescriptionEtkili bağlam belirlenir
07Yenilikçi birleşik model
Çok Ölçekli Bağlam Kafesi
Ek, sözcük, öbek, cümle, söylem ve kaynak kanıtlarını tek bir doğrusal puan içinde kaybetmeden nasıl karşılaştırabilir; hangi kararın en küçük yeterli bağlamda kesinleştiğini ve hangi katmanların birbiriyle çeliştiğini nasıl gösterebiliriz?
\mathcal C=\langle L,\le,\land,\lor\rangle,\qquad c_{\mathrm{ek}}\le c_{\mathrm{sözcük}}\le c_{\mathrm{cümle}}\le c_{\mathrm{söylem}}
C = ⟨L, ≤, ∧, ∨⟩; c_ek ≤ c_sözcük ≤ c_cümle ≤ c_söylem
Yöntem: Her bağlam ölçeği bir kafes düğümü olarak modellenir; daha fazla kanıt içeren düğüm üstte yer alır. İki çözümlemenin ortak kanıtı kesişim, birleşik kanıtı birleşim işlemiyle temsil edilir. Çelişen kanıtlar üst düğüme sessizce taşınmaz, ayrı uyuşmazlık etiketi üretir.
Beklenen sonuç: Bir kararın hangi asgari bağlamda kesinleştiğini gösterir. Yakın çevrede çözülebilen durum eki ile metin boyunca öncül arayan gönderim aynı hesaplama maliyetine ve aynı açıklama biçimine zorlanmaz.
Sınır: Dilsel bağlam her zaman tam sıralı değildir; iki farklı kaynak kanıtı birbirine üstün olmayabilir. Model bu kısmi sıralamayı korur, fakat kafes yapısının kendisi bir dil bilgisi kuramının yerini almaz.
EkSözcük içi kanıt
ÖbekYerel bağıntı
SentenceRol ve kapsam
SöylemGönderim ve ilişki
SourceYayılım ve dayanıklılık
08Etkin karşılaştırmalı çözümleme
N-gram ve Transformer Çift Kanallı Denetimi
Açıklanabilir yerel n-gram sıklığı ile uzun bağlamı işleyen Transformer temsili birbirinden farklı sonuç verdiğinde hangisine güvenileceğini nasıl belirleyebilir; ortak karar, çelişki ve hata kaynaklarını insan denetimine açık biçimde nasıl ayırabiliriz?
G(a)=\operatorname{cal}\!\left(\alpha P_{\mathrm{ngram}}(a)+\beta P_{\mathrm{tr}}(a)+\gamma P_{\mathrm{FSM}}(a)\right),\qquad \alpha+\beta+\gamma=1
G(a) = cal(αP_ngram(a) + βP_tr(a) + γP_fsm(a)); α+β+γ=1
Yöntem: Birinci kanal açıklanabilir ikili ve üçlü lema örüntülerini, yoğunlaşma ve entropi ölçülerini üretir. İkinci kanal cümle veya söylem boyunca Transformer temsili çıkarır. İki kanal aynı adayı destekliyorsa güven artar; ayrışıyorsa biçimbilgisel kapı, karşı-olgusal test ve insan denetimi devreye girer.
Beklenen sonuç: Sık kalıplarda basit ve izlenebilir örüntülerin hızını, seyrek veya uzak bağıntılarda uzun bağlam modelinin kapsama gücünü birlikte kullanır. Hiçbir kanal tek başına hakem yapılmadığı için konu ezberi ve kör ek silme hataları daha kolay görünür olur.
Sınır: Kanallar aynı eğitim veya derlem hatasından etkilenmişse uzlaşmaları doğruluk kanıtı değildir. Kalibrasyon insan denetimli ayrı kümede yapılmalı, canlı derlemde yeni kaynak türleri geldiğinde güven eğrisi yeniden sınanmalıdır.
N-gramYerel ve açıklanabilir örüntü
TransformerUzun bağlamsal temsil
FSMTürkçe biçimbilgisel kapı
KalibrasyonUzlaşma ve çelişki
İnsanSon yayın kararı