11Stat
11Stat, futbol veri analitiği ve olasılık modelleme platformudur — beklenen gol (xG), çok-motorlu olasılık modelleri ve gerçek sonuçlarla doğrulanmış geçmiş kalibrasyon. Bahis kabul edilmez; sonuç veya kazanç garantisi verilmez.
Ana SayfaRehber › Model Kalibrasyonu ve Güven Skoru

Model Kalibrasyonu ve Güven Skoru

Model kalibrasyonu nedir? Kalibrasyon, bir olasılık modelinin söylediği sayılara güvenilip güvenilemeyeceğinin ölçüsüdür: iyi kalibre edilmiş bir model %70 dediği olayların yaklaşık %70'ini, %40 dediklerinin yaklaşık %40'ını isabet ettirir — ne fazlasını iddia eder ne eksiğini. Bu sayfa kalibrasyonun tek bir doğruluk yüzdesinden neden daha anlamlı olduğunu, ECE (beklenen kalibrasyon hatası) ve Brier skoru gibi ölçütlerin nasıl okunduğunu ve 11Stat'in 0-10 güven skorunun bu veriden nasıl türetildiğini anlatır. İçerik futbol veri analizidir; bahis tavsiyesi değildir.

🎯 Hemen Maç Analizi Yap →← Ana Sayfa

Kalibrasyon ne demek: %70, gerçekten %70 mi?

Bir modelin "%70" demesi tek başına bir bilgi değildir; asıl soru şudur: model geçmişte %70 dediğinde ne sıklıkla haklı çıktı? Cevap yaklaşık %70 ise model kalibredir — sayıları gerçek dünyayla aynı dili konuşur. Cevap %55 ise model kendine fazla güvenmektedir; %85 ise fazla çekingendir.

Kalibrasyon bu yüzden bir dürüstlük ölçüsüdür: modelin cesur mu, doğru mu olduğunu ayırt eder. Futbol gibi yüksek varyanslı bir alanda tek maç üzerinden test edilemez; yüzlerce tahminin olasılık bantlarına ayrılıp her bandın gerçekleşme sıklığıyla karşılaştırılması gerekir. 11Stat'in bütün olasılık zinciri bu testten geçirilir; ayrıntılar metodoloji sayfasındadır.

Neden tek bir doğruluk yüzdesi yanıltır?

"Modelimiz %68 doğru" cümlesi etkileyici görünür ama neredeyse hiçbir şey söylemez. Her maçta favoriyi işaretleyen ezbere bir model de benzer bir sayıya ulaşabilir; bilgi üretmeden isabet toplar. Doğruluk yüzdesi, tahminlerin zorluğunu ve modelin her tahmine biçtiği olasılığı görmezden gelir.

Kalibrasyon tam bu iki boşluğu doldurur: %55'lik iddialarla %85'lik iddiaları ayrı ayrı sınar ve modelin güveninin her düzeyde hak edilip edilmediğini gösterir. İki model aynı doğruluk yüzdesine sahipken biri kalibre, diğeri savruk olabilir — ve uzun vadede yalnızca kalibre olan modelin sayılarıyla sağlıklı akıl yürütülebilir. Bu ayrım simüle ROI okumasında da kritiktir.

Güvenilirlik diyagramı ve ECE nasıl okunur?

Güvenilirlik diyagramı, kalibrasyonun röntgenidir: tahminler olasılık bantlarına (%50-60, %60-70…) ayrılır; her bant için modelin ortalama iddiası (x ekseni) ile gerçekleşme sıklığı (y ekseni) çizilir. Mükemmel kalibrasyon 45 derecelik köşegen üzerinde durur; köşegenin altı aşırı güveni, üstü aşırı temkini gösterir.

ECE (beklenen kalibrasyon hatası) bu resmi tek sayıya indirger: her banttaki sapmanın, banttaki tahmin sayısıyla ağırlıklandırılmış ortalamasıdır. 0'a yakın ECE sayıların güvenilir olduğunu söyler; büyüyen ECE, modelin dilinin gerçeklikten koptuğunu. Tek başına hiçbir metrik yeterli olmadığı için 11Stat, ECE'yi Brier skoru ve örneklem boyutuyla birlikte raporlar.

Brier skoru ve log-loss: uygun puanlama kuralları

Brier skoru, her tahminin olasılığı ile gerçekleşen sonucun (1 veya 0) farkının karesini alır ve ortalar: 0'a yakın değer daha iyidir. Hem kalibrasyonu hem ayrıştırma gücünü (keskinliği) aynı anda cezalandırıp ödüllendirir. Log-loss ise aşırı güvenli yanlışları çok daha sert cezalandırır: %95 deyip yanılan bir model log-loss'ta ağır bedel öder.

Bu ikisine "uygun puanlama kuralı" denir; çünkü modelin en iyi stratejisi gerçek inancını dürüstçe söylemektir — sayıyı şişirerek veya kısarak puan kazanılamaz. Bu özellik, kalibrasyon kültürünün matematiksel temelidir: dürüst olasılık, oyunun tanımı gereği en kârlı beyandır. Terimlerin tanımı sözlükte de yer alır.

11Stat'in 0-10 güven skoru nasıl türetilir?

Analiz kartlarındaki 0-10 güven skoru, tek bir motorun hissi değil, kalibre edilmiş bir zincirin özetidir: 12 bağımsız motorun uzlaşma derecesi, kalibrasyon katmanından geçmiş olasılık ve pazarın geçmiş güvenilirliği tek bir ölçekte birleşir. Kaç motorun aynı yönü işaret ettiği ("N/M model onayı") skorun yanında ayrıca gösterilir.

Yüksek skor "kesin" demek değildir; "model bu tahminde, geçmiş karnesine göre daha tutarlı" demektir. 7 üstü bir skor bile azımsanmayacak sıklıkta yanılır — kalibre bir sistemde yanılmak zorundadır; aksi hâlde sayılar şişirilmiş olurdu. Skorun bileşenleri nasıl çalışır sayfasında adım adım anlatılır.

11Stat kendini nasıl yeniden kalibre eder?

Kalibrasyon bir kez yapılıp bitirilecek bir iş değildir; ligler, sezonlar ve takımlar değiştikçe modelin dili de kayar. 11Stat bu yüzden lig ve pazar bazında yürüyen bir kalibrasyon deposu tutar: her sonuçlanan maç, ilgili pazarın eğrisini günceller; sapma büyürse düzeltme katsayıları sıkılaştırılır.

İki emniyet mekanizması daha vardır: kalibrasyonu bozulan pazarlar otomatik devre dışı bırakılır ve tüm geçmiş pencereler — kötü geçenler dahil — simüle metrik raporlarında yayınlanır. Amaç hiçbir zaman "hep haklı görünmek" değil, sayıların anlamını korumaktır: %70 yazan yerde uzun vadede gerçekten %70 civarı görülmelidir.

Sık Sorulan Sorular

İyi kalibre edilmiş bir model sonuçları garanti eder mi?

Hayır, etmez. Kalibrasyon tek tek sonuçları değil, olasılıkların dürüstlüğünü güvence altına alır: %70 dediklerinin yaklaşık %30'u yine ters sonuçlanır ve bu, sistemin doğru çalıştığının işaretidir. Hiçbir istatistiksel model bir maçın sonucunu kesinleştiremez.

10/10 güven skoru banko anlamına mı gelir?

Hayır. Banko diye bir şey yoktur ve 11Stat hiçbir çıktısını böyle sunmaz. Yüksek güven skoru yalnızca motor uzlaşmasının ve geçmiş tutarlılığın yüksek olduğunu söyler; kalibre bir sistemde en yüksek skorlar bile düzenli olarak yanılır. 11Stat bahis tavsiyesi vermez.

İyi bir ECE değeri kaçtır?

Bağlama göre değişir; futbol gibi gürültülü alanlarda 0.05'in altı genellikle sağlıklı, 0.10 üzeri incelenmesi gereken bir sapma kabul edilir. Önemli olan tek bir anlık değer değil, ECE'nin zaman içindeki seyri ve hangi örneklem boyutuyla ölçüldüğüdür.

Bir model hem isabetli hem kötü kalibre olabilir mi?

Evet, sık görülür. Hep favoriyi seçen bir model yüksek isabet toplarken olasılıklarını %90 gibi şişiriyorsa kalibrasyonu bozuktur; sayıları karar desteği olarak kullanılamaz. Tersi de mümkündür: mütevazı isabetli ama sayıları güvenilir bir model, analiz için çok daha değerlidir.

Brier skoru ile ECE arasındaki fark nedir?

ECE yalnızca kalibrasyonu — iddia edilen olasılıkla gerçekleşme sıklığının uyumunu — ölçer. Brier skoru ise kalibrasyonla birlikte keskinliği de içerir: modelin 50-50'den ne kadar cesaretle ve ne kadar haklı ayrıştığını. İkisi birlikte okunduğunda modelin hem dürüstlüğü hem bilgi gücü görünür.

11Stat modellerini ne sıklıkla yeniden kalibre eder?

Sürekli: her sonuçlanan maç lig ve pazar bazındaki kalibrasyon eğrilerini günceller, sapması büyüyen pazarlar otomatik olarak devre dışı kalır. Ayrıca dönemsel backtest'ler tüm zinciri uçtan uca yeniden sınar; sonuçlar negatif pencereler dahil raporlanır.

Bugünün model analizlerini gör →