Evidencia › Cómo se valida un modelo
Cuatro puertas antes de creerle a un backtest
Tienes un año de backtest en verde y la duda de siempre: ¿es una ventaja o fue suerte? Si ya pagaste por una curva que se veía igual y en cuenta real no se repitió, sabes que la pregunta no es teórica. Casi nadie la contesta antes de arriesgar dinero. Nosotros tenemos un procedimiento fijo para contestarla, está publicado entero, y más abajo lo verás caer sobre una cifra nuestra.
Son cuatro puertas. Cada una puede matar la idea por su cuenta y ninguna la salva sola: el piso de ruido, la compuerta declarada antes de mirar, la robustez leída por mayoría de casos, y la forma antes que el nivel.
Puerta 1: ¿un año de backtest en verde prueba algo?
Por sí solo, no. Antes de creerle a un resultado anual hay que saber cuánto se mueve ese número por razones ajenas al modelo.
Lo medimos de la forma más barata que existe: el mismo modelo intradía de índices corrido sobre el contrato grande del Nasdaq y sobre su micro, de mayo de 2019 a julio de 2026, 2,103 contra 2,108 operaciones, alrededor de 300 al año. Encuentran los mismos setups: la coincidencia de días operados es del 97.3%. Y aun así, en 3 de los 8 años de esa ventana las dos versiones ni siquiera coinciden en el signo del resultado anual. Mismo modelo, mismos días, el año en rojo o en verde según el contrato. Dos de esos ocho años son parciales.
El ruido de un año tiene dos fuentes. La sustitución de instrumento vale ±0.05 R por operación (RMS 0.052; máximo anual 0.096, en 2021). El error muestral del propio año vale ±0.055 R/op con unas 300 operaciones, y ±0.075 con unas 160. Sumadas en cuadratura dan un piso de ±0.075 R/op a una desviación, alrededor de ±0.15 a dos. De ahí sale el umbral usable: un año no significa nada salvo que supere ±0.11-0.15 R por operación, con unas 300 operaciones al año. Todas esas cifras en R son brutas, antes de comisiones y deslizamiento.
Dos consecuencias incómodas. La primera: el umbral de ±0.05 que circula mide una sola de las dos fuentes y es entre 2 y 3 veces demasiado permisivo. La segunda: correr el micro y el grande no es validación independiente. Si probaste tu modelo en el grande y luego en el micro, no lo probaste dos veces. Sus deltas anuales correlacionan ρ ≈ 0.98 en la ventana solapada, así que son ~17 observaciones independientes y no 25 (auditoría de agosto de 2026, sobre otro modelo y su propia ventana: no se mezcla con la de arriba). El cálculo completo, con las dos fuentes de ruido por separado, está en el piso de ruido.
Puerta 2: ¿por qué la compuerta se escribe antes de mirar los datos?
Porque una compuerta escrita después se acomoda al resultado que ya viste. No hace falta mala fe: basta con mirar el número antes de fijar la vara. La nuestra tiene tres cláusulas simultáneas: probabilidad de mejora ≥ 0.95 bajo bootstrap pareado, llenado honesto —la orden se llena como se llenaría en real, no como conviene—, y caja absoluta en vez de ratios. Se evalúa sobre la mediana bootstrap, no sobre la corrida continua.
Escribirla antes no basta: hay que escribirla en dos direcciones. La nuestra era de una sola vía, y nos la cazamos solos. «0 de 80 candidatos pasan» no significa «gana el control»: corrido al revés, el control solo pasaba en 26 de 80, y las otras 54 son empate, no victoria. De la misma revisión salió otra regla: publicar siempre cuántas celdas mata el filtro anti-sobreajuste. Sobre 179 candidatas eliminó 8, el 4%, todas hoyos y ningún pico.
Puerta 3: ¿por qué el mejor resultado de un barrido casi nunca se repite?
Porque el mejor número de un barrido está elegido justo por ser el mejor: es un estadístico de orden, no una estimación. Dos mediciones distintas con el mismo desenlace: la celda óptima dentro de muestra de un barrido de 360 hace el 162% de la caja del control dentro de muestra y el 65% fuera —esa caja incluye el capital invertido, es la métrica del montaje y no una ganancia neta—; y en otro estudio, la celda que gana su propia ventana cae al percentil 14 del criterio maximin, con seis trimestres disjuntos. Si alguna vez te quedaste con la fila mejor de una optimización, te quedaste con el máximo del ruido tanto como con el mejor ajuste.
Por eso la robustez se lee por mayoría de casos: un tratamiento es robusto si P(Δ > 0) supera el 50% y el intervalo de confianza del delta no incluye cero. El caso negativo del mismo lente es el break-even: sobre 144 operaciones de 2026 en el embudo completo de Apex se probaron 105 formas, y 104 se quedan en 49% o menos de los remuestreos pareados ganados al control. La única que cruza el 50% lo hace con 55% y un intervalo de −16% a +25%: es un artefacto degenerado —un mini objetivo de beneficio encubierto—, y su intervalo cruza el cero. Un punto por encima del control no es una ventaja.
Lo mismo aplica a reoptimizar. El walk-forward sobre 16 años da t = +0.46 con IC95 que cruza cero, y la configuración fija que ya usábamos está en el percentil 88 de las celdas vivas. La reselección rodante mensual rinde el 10% de la configuración fija y queda en el percentil 31 del placebo: peor que elegir al azar. El barrido, con su placebo al lado, está en las clases cerradas.
Puerta 4: ¿ventaja estadística o forma que cruza el objetivo?
No son lo mismo, y esta es la puerta que más candidatos mata. Un producto de fondeo no compra esperanza matemática: compra la probabilidad de cruzar el objetivo antes que el drawdown. Es lo que explica que un modelo con ventaja pueda reprobar un desafío: gana, pero no en el orden que el objetivo exige. Por eso la forma —el orden en que llegan las ganancias y las rachas— se filtra antes que el nivel, y por eso el último filtro es aritmética de dólares por sesión y contrato, no un estadístico. El procedimiento paso a paso está en cómo calcular el riesgo.
¿Esta vara mata algo, o solo se ve rigurosa?
Hacia fuera mata. Metimos en el arnés completo diez modelos construidos desde dos autores clásicos, publicados y verificables por cualquiera: 0 de 10 baten al modelo que nos sirve de ancla —investigación interna nuestra, no uno de los cinco modelos que entregamos—. Seis nulos honestos y cuatro refutados. Tres de los diez tenían señal real y verificada. No fallaron por robustez ni por forma: fallaron por aritmética de dólares por sesión y contrato. El piso exigido es de $5.8 por sesión y contrato, el ancla produce $13.0 y el mejor de los diez candidatos $4.3: ninguno pasa del 33% de lo que produce el ancla. El $13.0 y el $4.3 son producción de motor y llevan el descuento pendiente del 17.5% frente a la plataforma de ejecución; el $5.8 no se descuenta, porque no es una medición sino aritmética del objetivo. El veredicto no cambia al descontar. Un 0 de 10 no vende nada: está publicado porque el procedimiento importa más que el marcador.
¿Y cuando la vara cae sobre una cifra nuestra?
También cae. Empezando por la cifra que más nos gustaba. Nuestro titular más vistoso era una diferencia de +10.0 puntos porcentuales en la probabilidad trimestral de retirar más de lo invertido, sobre la rama de 2024 en adelante y con n = 10 trimestres disjuntos. Todas las cifras de este bloque son de esa rama: la otra rama del mismo estudio da valores distintos y no se mezclan.
Al pasarlo por el arnés quedó en +3.3 puntos de efecto central sobre 63 rejillas, con IC95 de −24.3 a +29.5 pp y McNemar exacto p = 0.50. La potencia para ver 10 pp con esos 10 trimestres disjuntos es del 2%: el estudio no podía ver ese efecto aunque existiera. Harían falta unos 200 trimestres disjuntos, cerca de 50 años. Se voltea con cuatro convenciones arbitrarias por separado, y el candidato era el placebo de un estudio anterior, ascendido tras ver su resultado (error familiar nominal 22.6%). No se rescató con matices: se retiró.
Con el código pasa igual. Cada pieza que decide dinero pasa por una revisión a tres bandas: una lectura interna y dos modelos de proveedores externos distintos. En el motor Monte Carlo del 2 de mayo de 2026 salieron 28 hallazgos —10, 11 y 7 por pasada—, ninguno visto por las tres a la vez, 2 convergencias entre dos y 25 únicos. Se cerró con 11 correcciones, 14 aplazamientos y 2 rechazos. Lo revelador no es en qué coinciden tres lecturas: es cuánto no coinciden.
Lo que esto NO dice
- No dice que este procedimiento esté completo. La validación formal completa —validación cruzada combinatoria purgada, Deflated Sharpe, probabilidad de sobreajuste, multi-régimen— está diferida y no se ha aplicado a los cinco modelos que entregamos.
- No dice que ±0.11-0.15 R/op sea un umbral universal. Depende del número de operaciones del año y de la forma del objetivo y el stop, y se midió sobre un solo par de contratos y una sola versión de las reglas de un modelo.
- No dice que cruzar las cuatro puertas garantice nada. Un modelo que las cruza se queda por ausencia de evidencia en contra, que es lo más fuerte que tenemos, no una promesa de resultado.
- No dice que esos diez modelos refuten a sus autores. El 0 de 10 es sobre esos diez modelos, ese arnés y esa cuenta; otro montaje es una medición nueva.
- No dice que la pregunta grande esté resuelta. El tamaño de posición sigue siendo la pregunta abierta más grande, y no está auditada.
- No dice cuánto rinde ningún modelo. No publicamos rendimientos de modelos sin auditar, ni configuración ejecutable: ni valores de stop, ni horarios, ni presets, ni tamaños por fase.
- No dice que una cifra de motor sea el nivel real. Toda cifra de motor lleva el descuento pendiente del 17.5% frente a la plataforma de ejecución.
Cómo medimos esto
Eje, ventana y denominador, pegados a cada cifra. La misma medición puede dar dos cifras que no se parecen. Percentil 35 de dólares por cada mil de riesgo: $8,431 mirando desde 2024 en el eje de días con operación y 3 bloques disjuntos, y $729 sobre mayo de 2019 a julio de 2026 en eje de calendario y 14 bloques. El eje explica un factor de 1.96×; el resto es periodo. La ventana corta tiene 0% de ventanas negativas contra 26% de la larga. Las dos son producción de motor y se leen con el descuento pendiente del 17.5%. Una cifra sin eje, ventana, denominador y tamaño de muestra no se publica.
Integridad del arnés, cada control en su propio montaje. Sonda de no-anticipación: 122 sesiones, 0 discrepancias. Regresión bit-exacta contra el motor de referencia: 924 ventanas × 10 campos, 0 diferencias. Doce de doce sondas anti-fabricación en el estudio de break-even. Ninguna valida un hallazgo: prueban que la implementación hace lo que dice.
Qué queda abierto. La validación formal diferida, el tamaño de posición sin auditar, y el diferencial del 17.5% entre el motor y la plataforma. Si vas a citar una cifra de esta página, mira primero cómo se construye: cómo medimos.
En una frase
Cuatro puertas, y cada una puede matar la idea. Un año suelto no es evidencia: tiene que superar ±0.11-0.15 R por operación con unas 300 operaciones al año (2019-2026). La compuerta se declara antes de mirar los datos y la robustez se lee por mayoría de casos. Hacia fuera murieron 10 de 10 modelos de libro.
Todo esto está en la biblioteca
Los modelos, las métricas y los estudios completos, en un solo sitio.
Entrar a la biblioteca AST →