11Stat
11Stat es una plataforma de analítica de datos de fútbol y modelado de probabilidad: goles esperados (xG), modelos de probabilidad multi-motor y calibración histórica verificada con resultados reales. No acepta apuestas ni ofrece garantía de resultados o ingresos.
InicioGuía › Calibración de Modelos

Calibración de Modelos

¿Qué es la calibración de modelos? La calibración mide si los números que pronuncia un modelo probabilístico merecen confianza: un modelo bien calibrado acierta alrededor del 70% de los eventos que llama 70%, y alrededor del 40% de los que llama 40% — sin reclamar más ni menos de lo que merece. Esta página explica por qué la calibración dice más que cualquier porcentaje único de acierto, cómo se leen el ECE (error de calibración esperado) y el Brier score, y cómo se deriva de estos datos la puntuación de confianza 0-10 de 11Stat. Es analítica de datos de fútbol, no consejo de apuestas.

🎯 Analizar un partido ahora →← Inicio

Qué significa la calibración: ¿un 70% es de verdad un 70%?

Que un modelo diga "70%" no es información por sí solo; la pregunta real es: cuando el modelo dijo 70% en el pasado, ¿con qué frecuencia acertó? Si la respuesta es cerca del 70%, el modelo está calibrado — sus números hablan el mismo idioma que la realidad. Si la respuesta es 55%, el modelo peca de exceso de confianza; si es 85%, de timidez.

La calibración es, por tanto, una medida de honestidad: distingue ser audaz de tener razón. En un deporte de alta varianza como el fútbol no puede probarse con un partido; hay que agrupar cientos de predicciones en bandas de probabilidad y comparar cada banda con su frecuencia realizada. Toda la cadena probabilística de 11Stat pasa por esta prueba; los detalles están en la página de metodología.

Por qué un único porcentaje de acierto engaña

"Nuestro modelo acierta el 68%" suena impresionante y no dice casi nada. Un modelo mecánico que marca al favorito en cada partido puede alcanzar una cifra parecida, acumulando aciertos sin producir información. Un porcentaje de acierto ignora tanto la dificultad de cada predicción como la probabilidad que el modelo le asignó.

La calibración llena exactamente esos dos vacíos: examina por separado las afirmaciones del 55% y las del 85%, y muestra si la confianza del modelo está justificada en cada nivel. Dos modelos pueden compartir el mismo acierto siendo uno calibrado y el otro temerario — y a largo plazo, solo con los números del calibrado se puede razonar con solidez. La misma distinción es crítica al leer el ROI simulado.

Cómo leer un diagrama de fiabilidad y el ECE

El diagrama de fiabilidad es la radiografía de la calibración: las predicciones se agrupan en bandas de probabilidad (50-60%, 60-70%, …) y, para cada banda, se traza la afirmación media del modelo (eje x) contra la frecuencia realizada (eje y). La calibración perfecta descansa sobre la diagonal de 45 grados; los puntos por debajo delatan exceso de confianza y los puntos por encima, cautela excesiva.

El ECE (error de calibración esperado) comprime esa imagen en un solo número: la brecha media por banda, ponderada por cuántas predicciones contiene cada una. Un ECE cercano a 0 dice que los números pueden tomarse al pie de la letra; un ECE creciente, que el lenguaje del modelo se aleja de la realidad. Como ninguna métrica basta sola, 11Stat reporta el ECE junto al Brier score y al tamaño de la muestra.

Brier score y log-loss: reglas de puntuación propias

El Brier score eleva al cuadrado la brecha entre cada probabilidad declarada y el resultado realizado (1 o 0) y la promedia: cuanto más cerca de 0, mejor. Premia y castiga a la vez la calibración y la capacidad de discriminación (la nitidez). El log-loss castiga con mucha más dureza los fallos arrogantes: un modelo que dice 95% y se equivoca paga caro.

Ambas son "reglas de puntuación propias": la mejor estrategia posible del modelo es declarar honestamente su creencia real — no se ganan puntos inflando ni recortando el número. Esa propiedad es el fundamento matemático de la cultura de calibración: la probabilidad honesta es, por definición del juego, la declaración más rentable. Los términos también están definidos en el glosario.

Cómo se deriva la puntuación de confianza 0-10 de 11Stat

La puntuación de confianza 0-10 de una tarjeta de análisis no es la corazonada de un motor, sino el resumen de una cadena calibrada: el grado de acuerdo entre 12 motores independientes, la probabilidad tras la capa de calibración y la fiabilidad histórica del mercado se funden en una sola escala. Cuántos motores apuntan en la misma dirección ("consenso N de M") se muestra al lado.

Una puntuación alta no significa "seguro"; significa "según su boletín histórico, el modelo es más consistente en este tipo de llamada". Incluso las puntuaciones superiores a 7 fallan con frecuencia nada trivial — en un sistema calibrado deben fallar; de lo contrario los números estarían inflados. Los componentes de la puntuación se recorren en cómo funciona.

Cómo se recalibra 11Stat a sí mismo

La calibración no es una tarea que se termina una vez; a medida que cambian ligas, temporadas y plantillas, el lenguaje del modelo deriva. Por eso 11Stat mantiene un almacén de calibración continuo por liga y por mercado: cada partido liquidado actualiza la curva correspondiente y, cuando la brecha crece, los coeficientes de corrección se endurecen.

Se aplican además dos mecanismos de seguridad: los mercados cuya calibración se degrada se desactivan automáticamente, y todas las ventanas históricas — incluidas las malas — se publican en los informes de métricas simuladas. El objetivo nunca es "parecer siempre acertado", sino proteger el significado de los números: donde dice 70%, el largo plazo debe mostrar de verdad algo cercano al 70%.

Preguntas Frecuentes

¿Un modelo bien calibrado garantiza predicciones correctas?

No, no las garantiza. La calibración asegura la honestidad de las probabilidades, no los resultados individuales: alrededor del 30% de los eventos que llama 70% siguen saliendo al revés — y esa es la señal de que el sistema funciona. Ningún modelo estadístico puede hacer seguro el resultado de un partido.

¿Una confianza de 10/10 es una apuesta segura?

No, eso no existe, y 11Stat nunca presenta así ninguna salida. Una puntuación alta solo dice que el acuerdo entre motores y la consistencia histórica son elevados; en un sistema calibrado, hasta las puntuaciones máximas fallan con regularidad. 11Stat no ofrece consejos de apuestas.

¿Cuál es un buen valor de ECE?

Depende del contexto; en un dominio ruidoso como el fútbol, los valores por debajo de 0.05 suelen ser saludables, y cualquier cosa por encima de 0.10 merece investigación. Lo importante no es una foto puntual, sino la trayectoria del ECE en el tiempo y el tamaño de muestra con que se midió.

¿Puede un modelo acertar mucho y estar mal calibrado?

Sí, y es frecuente. Un modelo que siempre elige al favorito puede acumular un acierto alto mientras infla sus probabilidades a afirmaciones de estilo 90% — sus números quedan inutilizables como apoyo de decisión. Lo inverso también existe: un modelo de acierto modesto con números fiables vale mucho más para el análisis.

¿Qué diferencia hay entre el Brier score y el ECE?

El ECE mide solo la calibración: la correspondencia entre la probabilidad declarada y la frecuencia realizada. El Brier score captura además la nitidez: con cuánta audacia, y con cuánta justificación, el modelo se aleja del 50-50. Leídos juntos revelan la honestidad del modelo y su poder informativo.

¿Con qué frecuencia recalibra 11Stat sus modelos?

Continuamente: cada partido liquidado actualiza las curvas de calibración por liga y por mercado, y los mercados cuya deriva crece se desactivan de forma automática. Backtests periódicos reexaminan además toda la cadena de extremo a extremo, y los resultados se publican incluyendo las ventanas negativas.

Ver el análisis del modelo de hoy →