AST · Evidencia

Evidencia › Cuánto ruido tiene un backtest anual: el pis…

Cuánto ruido tiene un backtest anual: el piso lo marca el propio instrumento

En simple

Dos cámaras cuelgan sobre la misma línea de meta, separadas por un palmo. Ven el mismo partido y cantan igual casi todas las jugadas. Pero las que se deciden por un cordón de zapato se van para un lado en una cámara y para el otro en la otra. Ninguna está estropeada: la línea es así de fina.

Con un método de trading pasa igual. Se prueba sobre dos versiones del mismo mercado, la grande y la pequeña, y las dos encuentran las mismas oportunidades casi todos los días. Aun así, en 3 de los 8 años que pudimos comparar una termina ganando y la otra perdiendo. Mismo día, misma señal: lo único distinto es qué contrato compraste.

Cuando veas el resultado de un año y alguien te diga que eso prueba que el método funciona, la pregunta útil no es cuánto dio. Es si dio lo bastante como para no ser el cordón de zapato.

Qué significa para ti

Si operas, el hallazgo se traduce en decisiones.

Primero, el listón. Un año de backtest deja de ser evidencia por sí solo. Conviene medirlo en R: una R es lo que arriesgas en cada operación, así que el resultado se lee en múltiplos de ese riesgo. Para un año de unas 300 operaciones el listón está en ±0.11 a ±0.15 R por operación. Lo que quede dentro de esa banda es empate. Cambia también la frase: no "el modelo perdió en 2021", sino "2021 es indistinguible de cero". Y si tu año tiene menos operaciones, el listón sube.

Segundo, tira el umbral de ±0.05. Mide una sola de las dos fuentes de ruido y es entre 2 y 3 veces demasiado permisivo. Te hace leer como señal años de 0.06 a 0.10 R/op que no distinguen nada.

Tercero, correr el micro y el grande no son dos confirmaciones. En la ventana solapada que medimos sus resultados anuales van casi pegados (ρ ≈ 0.98): es el mismo hallazgo visto dos veces. Sigue corriendo los dos, pero por lo que sirven: lo que aparece en uno solo es ruido y se descarta.

Cuarto, si tu stop va en porcentaje sobre una serie continua retroajustada, no estás midiendo el stop, estás midiendo el retroajuste. Pásalo a puntos, a ATR o al nivel del índice al contado — y arréglalo también en la entrada, no solo en el stop.

Lo que ibas a gastar defendiendo el año malo, gástalo en juntar más historia. Y lee mayoría de casos en vez del total del periodo.

Tienes un resultado anual de backtest delante y quieres saber si significa algo. Antes de creerle hay que saber cuánto se mueve ese número por razones que no tienen nada que ver con el modelo. La forma más barata de medirlo no requiere datos nuevos ni una semana de trabajo. Se corre el mismo modelo sobre dos contratos del mismo subyacente y se mide cuánto difieren.

¿Por qué el mismo backtest da resultados distintos en NQ y en MNQ?

En julio de 2026 corrimos un modelo intradía de índices sobre el contrato grande del Nasdaq (NQ) y sobre su micro (MNQ). Los dos solo existen a la vez en un periodo: mayo de 2019 a julio de 2026. Mismo subyacente, mismo tamaño de tick, distinto multiplicador.

Los dos encuentran los mismos setups. La coincidencia de días operados es del 97.3% y el conteo de operaciones es casi idéntico: 2,103 contra 2,108. Y aun así:

Es el mismo índice, el mismo día y la misma señal. Lo único que cambia es qué contrato compraste.

¿No será que los datos de uno de los dos son peores?

Fue lo primero que descartamos:

Lo que queda es microestructura real. Los extremos exactos de cada vela difieren por un tick aquí y allá, y ese tick voltea operaciones individuales entre objetivo y stop. No es un defecto que se arregle limpiando datos. Es el suelo.

¿Cuánto ruido es normal en un año suelto?

El ruido de un año no tiene una fuente. Tiene dos, y hay que sumarlas.

FuenteQué mideMagnitud (1 desviación)
Sustitución de instrumentocuál de los dos contratos del mismo subyacente usaste±0.05 R/op (RMS 0.052; máximo anual 0.096, en 2021)
Error muestral del propio año, ~300 operacionesel azar del reparto de operaciones del año±0.055 R/op
Error muestral del propio año, ~160 operacioneslo mismo, con la mitad de operaciones±0.075 R/op
Las dos combinadas en cuadratura, ~300 operacionespiso realista de un año suelto±0.075 R/op

La segunda fila es aritmética, no opinión. En el modelo que medimos cada operación termina en aproximadamente +1 R o en −1 R. Por eso la desviación estándar por operación ronda los 0.95 R. Dividida por la raíz del número de operaciones del año, da el error estándar de la media anual.

Combinadas, el piso realista de un año suelto queda en ±0.075 R/op a una desviación, es decir alrededor de ±0.15 a dos. Y de ahí sale el umbral de decisión usable. Un resultado anual no significa nada salvo que supere ~±0.11-0.15 R por operación, con alrededor de 300 operaciones al año. Con menos operaciones, el listón sube.

¿Por qué ±0.05 es un umbral demasiado permisivo?

Porque el ±0.05 mide una sola fuente de variación —cuál de los dos contratos usaste— y no el ruido total del año. Usarlo como umbral de decisión es entre 2 y 3 veces demasiado permisivo. Habilita a leer como señal años de 0.06 a 0.10 R/op que están dentro de dos errores estándar de cero.

La diferencia es de lenguaje, y es la que separa un análisis de una anécdota. No se dice "el modelo perdió dinero en 2021". Se dice "2021 es indistinguible de cero".

De ahí se sigue algo incómodo: si un año no distingue nada, un estudio de dos años tampoco. El listón de cuánta historia hace falta sube. Y la lectura correcta deja de ser el total del periodo: pasa a ser un remuestreo pareado con mayoría de casos.

¿Correr los dos instrumentos cuenta como dos confirmaciones?

No, y este matiz viaja obligatoriamente con el hallazgo. Lo cuantificamos en una auditoría posterior, en agosto de 2026: los deltas anuales de MNQ y NQ correlacionan ρ ≈ 0.98 en la ventana solapada. Son el mismo subyacente con distinto tamaño de contrato, y la señal dispara casi los mismos días sobre casi el mismo precio.

Consecuencia al contar potencia estadística: son ~17 observaciones independientes, no las 25 que salen de contar por separado cada año de cada contrato. Un pico que aparece en los dos no son dos confirmaciones: es el mismo pico visto dos veces. En ese mismo trabajo, cuando el diseño se contó bien, el mínimo efecto detectable salió varias veces mayor que la diferencia que se pretendía medir. La respuesta honesta pasó a ser "no se puede distinguir".

Correr los dos sigue siendo obligatorio, pero por lo que sirve: detectar ruido de microestructura. Un hallazgo que aparece solo en el micro o solo en el grande es ruido, no hallazgo. Aplica a cualquier par micro/grande: MNQ-NQ, MES-ES, MGC-GC, MYM-YM, MBT-BTC.

¿Y si tu stop está en porcentaje? Entonces no estás midiendo el stop

Hallazgo de método de otro estudio nuestro, con ventana distinta a la de esta página: 2010-2026, seis instrumentos. Es probablemente el más caro de ignorar: un stop en porcentaje sobre una serie continua retroajustada no mide el stop; mide el retroajuste.

InstrumentoDesfase del continuo retroajustado contra el precio real, en el extremo más antiguo de su propia serie
NQ (2010)182% (+3,394 puntos)
ES52%
MGC43%
MNQ42%
YM21%
CL11%

Las celdas no son comparables entre sí: cada una es el extremo más antiguo de su serie, y no todas empiezan el mismo año. La de MGC arranca en 2020 y la del MNQ en 2019, mientras el 182% del NQ es de 2010. Cuanto más atrás llega la serie, mayor es el desfase.

El error decrece hacia el presente, así que está correlacionado con el tiempo. Un stop porcentual queda sistemáticamente más profundo en los años viejos que en los recientes, sin que nadie haya tocado un parámetro.

El desfase del retroajuste es aditivo, y por eso preserva las diferencias intradía exactas. Las reglas de dirección y el P&L medido en puntos siguen siendo válidos sobre la serie continua. Los porcentajes y los niveles, no.

La solución: tomar el nivel del índice al contado (^NDX, ^GSPC, ^DJI), que es causal y no se retroajusta. Nuestro control externo dio 4,174 de 4,174 días coincidiendo al dígito contra una fuente independiente, con una salvedad que declaramos nosotros mismos. La última fila de esa fuente es un snapshot intradía, no un cierre.

Dos salvedades más, pegadas al hallazgo:

Cómo medimos esto

El procedimiento es deliberadamente aburrido, y por eso se puede repetir. Exportamos las velas de los dos contratos sobre el mismo periodo desde la misma plataforma y corrimos el modelo sobre ambos sin tocar nada más. Reportamos tres cosas. La primera, la coincidencia de días operados, que valida que encuentra los mismos setups. La segunda, el delta de R por operación año a año: el piso de ruido. La tercera, cuántos años cambian de signo. Son unos veinte minutos de trabajo con datos que ya se tienen.

Muestra y ventana: un modelo intradía de índices, 2,103 y 2,108 operaciones, mayo de 2019 a julio de 2026, alrededor de 300 operaciones por año. Todas las cifras en R de esta página son brutas, antes de comisiones y deslizamiento. La correlación ρ ≈ 0.98 sale de una auditoría independiente de agosto de 2026 sobre otro modelo, en su ventana solapada. Las cifras de retroajuste vienen de un estudio distinto, sobre 2010-2026 (16.6 años) y seis instrumentos. Las tres ventanas no se mezclan.

Limitaciones declaradas:

Lo que esto NO dice

La evidencia

Lo que sí publicamos con nombre y comprobante son los retiros verificados de traders de AST. Son 58 traders, 293 retiros y $373,434 USD entre enero y agosto de 2026, cada uno con su certificado. Están en el muro de retiros.

Y si quieres ver cómo aplicamos este tipo de control antes de dar por buena una regla, la biblioteca de AST está abierta en biblioteca.ast.bar. Ábrela y léela con la misma exigencia con la que acabas de leer esta página.

En una frase

El mismo modelo, corrido sobre el contrato grande y sobre el micro del mismo índice, coincide en el 97.3% de los días operados y aun así cambia de signo en 3 de 8 años (2019-2026). El piso realista de ruido para un año suelto es de ±0.11 a ±0.15 R por operación, no ±0.05.

Cómo citar esta página. AST — Academia de Trading, «Cuánto ruido tiene un backtest anual: el piso lo marca el propio instrumento», https://certificados.ast.bar/fondeo/piso-de-ruido/. Datos al 21 de agosto de 2026. Las cifras del muro de retiros proceden de los certificados de pago publicados.

Todo esto está en la biblioteca

Los modelos, las métricas y los estudios completos, en un solo sitio.

Entrar a la biblioteca AST →

Acceso con tu correo. Sin costo.