การปรับเทียบโมเดล
การปรับเทียบโมเดลคืออะไร? การปรับเทียบ (calibration) คือมาตรวัดว่าตัวเลขที่โมเดลความน่าจะเป็นพูดออกมานั้นเชื่อถือได้หรือไม่: โมเดลที่ปรับเทียบมาดีจะถูกต้องราว 70% ของเหตุการณ์ที่มันบอกว่า 70% และราว 40% ของเหตุการณ์ที่มันบอกว่า 40% — ไม่อ้างมากหรือน้อยกว่าที่สมควรได้ หน้านี้อธิบายว่าทำไมการปรับเทียบจึงบอกอะไรได้มากกว่าเปอร์เซ็นต์ความแม่นตัวเดียว วิธีอ่าน ECE (ค่าความคลาดเคลื่อนการปรับเทียบที่คาดหวัง) และ Brier score รวมถึงวิธีที่คะแนนความเชื่อมั่น 0-10 ของ 11Stat ถูกคำนวณจากข้อมูลเหล่านี้ ทั้งหมดคือการวิเคราะห์ข้อมูลฟุตบอล ไม่ใช่คำแนะนำการพนัน
การปรับเทียบหมายความว่าอะไร: 70% คือ 70% จริงหรือ?
การที่โมเดลพูดว่า "70%" ยังไม่ใช่ข้อมูลในตัวมันเอง คำถามที่แท้จริงคือ: ในอดีตเมื่อโมเดลบอก 70% มันถูกบ่อยแค่ไหน? ถ้าคำตอบคือราว 70% โมเดลนั้นปรับเทียบแล้ว — ตัวเลขของมันพูดภาษาเดียวกับความเป็นจริง ถ้าคำตอบคือ 55% โมเดลมั่นใจเกินเหตุ ถ้า 85% โมเดลขี้กลัวเกินไป
การปรับเทียบจึงเป็นมาตรวัดความซื่อสัตย์: มันแยก "กล้า" ออกจาก "ถูก" ในกีฬาความแปรปรวนสูงอย่างฟุตบอล ทดสอบด้วยนัดเดียวไม่ได้ ต้องจัดกลุ่มการพยากรณ์หลายร้อยรายการเป็นช่วงความน่าจะเป็น แล้วเทียบแต่ละช่วงกับความถี่ที่เกิดขึ้นจริง ห่วงโซ่ความน่าจะเป็นทั้งหมดของ 11Stat ผ่านการทดสอบนี้ อ่านรายละเอียดที่หน้าระเบียบวิธี
ทำไมเปอร์เซ็นต์ความแม่นตัวเดียวจึงหลอกตา
"โมเดลของเราแม่น 68%" ฟังดูน่าประทับใจแต่แทบไม่บอกอะไร โมเดลจำเจที่กาทีมเต็งทุกนัดก็ทำตัวเลขใกล้เคียงได้ — สะสมความถูกโดยไม่ผลิตข้อมูล เปอร์เซ็นต์ความแม่นมองข้ามทั้งความยากของการพยากรณ์แต่ละครั้ง และความน่าจะเป็นที่โมเดลกำหนดให้มัน
การปรับเทียบเติมช่องว่างสองจุดนี้พอดี: มันทดสอบคำกล่าวอ้างระดับ 55% และระดับ 85% แยกจากกัน และแสดงว่าความมั่นใจของโมเดลสมเหตุสมผลในทุกระดับหรือไม่ โมเดลสองตัวอาจมีความแม่นเท่ากัน โดยตัวหนึ่งปรับเทียบดีและอีกตัวสะเปะสะปะ — และในระยะยาว มีเพียงตัวเลขของโมเดลที่ปรับเทียบแล้วเท่านั้นที่ใช้คิดวิเคราะห์ได้อย่างมั่นคง ความแตกต่างนี้สำคัญมากเช่นกันเมื่ออ่าน ROI จำลอง
วิธีอ่าน reliability diagram และ ECE
Reliability diagram คือภาพเอกซเรย์ของการปรับเทียบ: การพยากรณ์ถูกจัดกลุ่มเป็นช่วงความน่าจะเป็น (50-60%, 60-70% …) แล้วสำหรับแต่ละช่วง ค่ากล่าวอ้างเฉลี่ยของโมเดล (แกน x) ถูกพล็อตเทียบกับความถี่ที่เกิดจริง (แกน y) การปรับเทียบสมบูรณ์แบบอยู่บนเส้นทแยง 45 องศา จุดใต้เส้นเผยความมั่นใจเกิน จุดเหนือเส้นเผยความระวังเกิน
ECE (Expected Calibration Error) บีบภาพนั้นเหลือตัวเลขเดียว: ช่องว่างเฉลี่ยต่อช่วง ถ่วงน้ำหนักด้วยจำนวนการพยากรณ์ในแต่ละช่วง ECE ใกล้ 0 บอกว่าเชื่อตัวเลขได้ตามตัวอักษร ECE ที่โตขึ้นบอกว่าภาษาของโมเดลกำลังลอยห่างจากความจริง เพราะไม่มีเมตริกใดพอเพียงตามลำพัง 11Stat จึงรายงาน ECE คู่กับ Brier score และขนาดกลุ่มตัวอย่างเสมอ
Brier score และ log-loss: กติกาการให้คะแนนที่เที่ยงตรง
Brier score ยกกำลังสองช่องว่างระหว่างความน่าจะเป็นที่ประกาศกับผลที่เกิดจริง (1 หรือ 0) แล้วหาค่าเฉลี่ย: ยิ่งใกล้ 0 ยิ่งดี มันให้รางวัลและลงโทษทั้งการปรับเทียบและความคม (sharpness) พร้อมกัน ส่วน log-loss ลงโทษความผิดพลาดแบบมั่นใจเกินอย่างโหดกว่ามาก: โมเดลที่บอก 95% แล้วพลาด จ่ายแพงมหาศาล
ทั้งคู่คือ "proper scoring rules": กลยุทธ์ที่ดีที่สุดของโมเดลคือประกาศความเชื่อที่แท้จริงอย่างซื่อสัตย์ — ปั่นตัวเลขให้สูงหรือกดให้ต่ำไม่มีทางได้คะแนนเพิ่ม คุณสมบัตินี้คือรากฐานทางคณิตศาสตร์ของวัฒนธรรมการปรับเทียบ: ความน่าจะเป็นที่ซื่อสัตย์คือคำประกาศที่คุ้มค่าที่สุดโดยนิยามของเกม อ่านนิยามศัพท์เพิ่มเติมได้ที่อภิธานศัพท์
คะแนนความเชื่อมั่น 0-10 ของ 11Stat มาจากไหน
คะแนนความเชื่อมั่น 0-10 บนการ์ดวิเคราะห์ไม่ใช่ลางสังหรณ์ของเอนจินตัวเดียว แต่เป็นบทสรุปของห่วงโซ่ที่ผ่านการปรับเทียบ: ระดับความเห็นพ้องของ 12 เอนจินอิสระ ความน่าจะเป็นหลังผ่านชั้นการปรับเทียบ และความน่าเชื่อถือย้อนหลังของตลาด ถูกรวมเป็นสเกลเดียว จำนวนเอนจินที่ชี้ทิศทางเดียวกัน ("ฉันทามติ N จาก M") แสดงกำกับอยู่ข้าง ๆ
คะแนนสูงไม่ได้แปลว่า "แน่นอน" แต่แปลว่า "เทียบกับสมุดพกย้อนหลัง โมเดลมีความสม่ำเสมอมากกว่าในการประเมินประเภทนี้" แม้คะแนนเกิน 7 ก็ยังพลาดด้วยความถี่ที่ไม่น้อย — ในระบบที่ปรับเทียบแล้วมันต้องพลาดบ้าง มิฉะนั้นตัวเลขจะเฟ้อ อ่านส่วนประกอบของคะแนนได้ที่หน้าวิธีการทำงาน
11Stat ปรับเทียบตัวเองใหม่อย่างไร
การปรับเทียบไม่ใช่งานที่ทำจบครั้งเดียว เมื่อลีก ฤดูกาล และขุมกำลังเปลี่ยน ภาษาของโมเดลก็เลื่อนตาม 11Stat จึงเก็บคลังการปรับเทียบแบบต่อเนื่องรายลีกและรายตลาด: ทุกแมตช์ที่จบและตัดสินแล้วจะอัปเดตเส้นโค้งที่เกี่ยวข้อง และเมื่อช่องว่างขยาย ค่าสัมประสิทธิ์การแก้ไขจะถูกรัดให้แน่นขึ้น
ยังมีกลไกนิรภัยอีกสองชั้น: ตลาดที่การปรับเทียบเสื่อมจะถูกปิดโดยอัตโนมัติ และหน้าต่างย้อนหลังทั้งหมด — รวมทั้งช่วงที่แย่ — ถูกเผยแพร่ในรายงานเมตริกจำลอง เป้าหมายไม่ใช่การ "ดูถูกต้องตลอดเวลา" แต่คือการปกป้องความหมายของตัวเลข: ตรงที่เขียนว่า 70% ระยะยาวควรเห็นบางอย่างใกล้ 70% จริง ๆ
คำถามที่พบบ่อย
โมเดลที่ปรับเทียบดีแล้ว รับประกันการพยากรณ์ถูกต้องไหม?
ไม่รับประกัน การปรับเทียบคุ้มครองความซื่อสัตย์ของความน่าจะเป็น ไม่ใช่ผลลัพธ์รายนัด: ราว 30% ของเหตุการณ์ที่มันบอก 70% ยังออกอีกทาง — และนั่นคือสัญญาณว่าระบบทำงานถูกต้อง ไม่มีโมเดลสถิติใดทำให้ผลฟุตบอลแน่นอนได้
คะแนนความเชื่อมั่น 10/10 คือการันตีผลหรือเปล่า?
ไม่ใช่ การการันตีแบบนั้นไม่มีอยู่จริง และ 11Stat ไม่เคยนำเสนอผลลัพธ์ใดในแบบนั้น คะแนนสูงบอกเพียงว่าฉันทามติของเอนจินและความสม่ำเสมอย้อนหลังอยู่ในระดับสูง ในระบบที่ปรับเทียบแล้ว แม้คะแนนสูงสุดก็ยังพลาดเป็นประจำ 11Stat ไม่ให้คำแนะนำการพนัน
ค่า ECE ที่ดีคือเท่าไร?
ขึ้นกับบริบท ในสนามที่มีสัญญาณรบกวนสูงอย่างฟุตบอล ค่าต่ำกว่า 0.05 มักถือว่าแข็งแรง ส่วนค่าที่เกิน 0.10 ควรถูกตรวจสอบ สิ่งสำคัญไม่ใช่ภาพนิ่งครั้งเดียว แต่คือแนวโน้มของ ECE ตามเวลาและขนาดกลุ่มตัวอย่างที่ใช้วัด
โมเดลแม่นแต่ปรับเทียบแย่ เป็นไปได้ไหม?
ได้ และพบบ่อย โมเดลที่เลือกทีมเต็งเสมอสามารถสะสมอัตราถูกสูง ขณะเดียวกันก็เฟ้อความน่าจะเป็นของตัวเองเป็นคำอ้างระดับ 90% — ตัวเลขของมันจึงใช้ประกอบการคิดไม่ได้ ในทางกลับกัน โมเดลที่แม่นพอประมาณแต่ตัวเลขเชื่อถือได้ มีค่าต่อการวิเคราะห์มากกว่ามาก
Brier score กับ ECE ต่างกันอย่างไร?
ECE วัดเฉพาะการปรับเทียบ — ความสอดคล้องระหว่างความน่าจะเป็นที่ประกาศกับความถี่ที่เกิดจริง Brier score จับเพิ่มอีกมิติคือความคม: โมเดลกล้าออกห่างจาก 50-50 แค่ไหนและสมเหตุสมผลเพียงใด อ่านคู่กันจะเห็นทั้งความซื่อสัตย์และพลังข้อมูลของโมเดล
11Stat ปรับเทียบโมเดลใหม่บ่อยแค่ไหน?
ต่อเนื่องตลอดเวลา: ทุกแมตช์ที่ตัดสินแล้วอัปเดตเส้นโค้งการปรับเทียบรายลีกรายตลาด และตลาดที่ค่าเบี่ยงเบนโตขึ้นจะถูกปิดอัตโนมัติ นอกจากนี้ backtest ตามรอบเวลายังทดสอบห่วงโซ่ทั้งหมดจากต้นจรดปลาย และผลถูกรายงานรวมถึงหน้าต่างที่ติดลบด้วย