Evidencia › Lo que medimos y matamos: el registro de hip…
Lo que medimos y matamos: el registro de hipótesis cerradas
En simple
Vas manejando y el carril de al lado avanza. Te cambias. Un rato después, el que dejaste es el que corre y tú sigues detenido. Esa sensación de que un carril es mejor sale de mirar un tramo corto. En un tramo corto siempre hay uno que va adelante, y eso pasa igual aunque los dos avancen al mismo ritmo.
Eso fue lo que probamos seis veces sobre futuros del Nasdaq. Las reglas eran del tipo "opera solo los martes", "párate cuando te va mal", "usa el mejor horario del histórico". Varias parecían el carril rápido cuando mirabas hacia atrás. Ninguna lo fue hacia adelante.
Y añadimos algo: pusimos esas reglas a competir contra una moneda al aire, con los mismos datos. En los filtros de contexto la moneda quedó justo en medio de los catorce grupos: unos por debajo, otros por encima. Ninguno se despegó de ella. En otra de las seis familias, la moneda directamente ganó. Eso es lo que publicamos: nuestras propias ideas, medidas y muertas, con la cifra que las mató. Son seis de las que hemos cerrado, las que podemos contar enteras.
Qué significa para ti
Si operas, el valor de esto es lo que te ahorra: seis calles sin salida. Están medidas sobre futuros del Nasdaq y una cuenta de fondeo.
Deja de buscar el filtro de contexto donde ya buscamos: "hoy no opero porque es fin de mes", "porque ayer cerré en rojo". Los catorce grupos que probamos no separan ganadores de perdedores mejor que un corte al azar. Eso no prueba que ningún contexto sirva —con esta muestra no había potencia para descartarlo—; sí dice que estos catorce no lo hicieron.
Deja de apagar un día de la semana: los cinco quedan por encima del punto de equilibrio. Apagar cualquiera hace fallar el piso de caja, con caídas de entre 27% y 30%. Ese piso es el mínimo que le exigimos a un cambio antes de aceptarlo. El que menos duele apagar sigue siendo un día que paga.
Deja de frenar tras dos pérdidas seguidas: las rachas malas aparecen menos, no más, de lo que traería el azar. La tercera operación no sabe nada de las dos anteriores; no te quitas una operación peor, te quitas una normal.
Deja de escalar el stop a la volatilidad esperando mejora. Con el factor de escala calibrado en los primeros años y aplicado hacia adelante, los dos brazos adaptativos cayeron entre 41% y 45% en caja. Y deja de reoptimizar buscando ventaja: hacerlo cada año no se distingue de no hacerlo. Rehacerlo cada mes rinde el 10% de dejar la configuración quieta.
Ese esfuerzo tiene mejores destinos. Uno es el tamaño de posición, la pregunta que nosotros mismos dejamos abierta y sin auditar. El otro es tu propio registro fechado de lo que ya mataste, para no pagar dos veces la misma sesión.
Un borde: casi todo se midió sobre una cuenta con drawdown trailing de $2,000, el retroceso que aguanta antes de cerrarse. Con un drawdown mayor cambia la relación entre tu stop y ese límite, y eso no lo medimos.
¿Qué es una clase cerrada y por qué la publicamos?
Una clase cerrada es una familia de hipótesis que pasó por el arnés completo y no pasó el gate. La escribimos porque una idea que no queda registrada se re-barre sola. La vuelves a probar en tres meses sin acordarte de que ya la mediste, y pagas la misma sesión dos veces.
La regla de uso: no se re-barre salvo que aparezca data nueva o un mecanismo nuevo. Data nueva es otra ventana, otro instrumento u otra época; mecanismo nuevo es el que explica por qué la medición anterior no aplica. "Probarlo otra vez con otros parámetros" no es ninguna de las dos. También registramos cuando la incumplimos: en agosto de 2026 reabrimos una familia cerrada en julio y sólo la confirmamos.
¿Qué familias publicamos aquí?
Seis, cada una con la cifra que la mató. No son todas las que hemos cerrado: son las seis que podemos contar enteras sin destapar configuración.
| Familia de hipótesis | Cifra que la cierra |
|---|---|
| Filtros de contexto (calendario, día previo, volatilidad, secuencia intradía) | 0 de 5 preregistradas, 0 de 9 descriptivas; 14 grupos entre 1.20 y 1.54, equilibrio 1.15, azar 1.31 |
| Apagar un día de la semana | ninguno de los 5 baja del equilibrio (1.20 a 1.46) y los 5 fallan el piso de caja (−27.0% a −30.1%) |
| Stop escalado a volatilidad | los brazos adaptativos caen 41% a 45% en caja y su percentil 35 se va a negativo |
| Dependencia serial de las pérdidas | autocorrelación de signo −0.0135; rachas perdedoras menos frecuentes que la geométrica |
| Superficie hora × temporalidad | Spearman 0.045 entre orden dentro y fuera de muestra, 129 celdas |
| Reoptimización de parámetros (anual y rodante) | walk-forward t +0.46, IC95 cruza cero; configuración fija en el percentil 88 |
¿Sirve filtrar por contexto antes de operar?
No, en lo que medimos: 0 de 5 pruebas primarias declaradas antes de mirar los datos y 0 de 9 descriptivas. Lo que cierra la familia es la aritmética de todas juntas. Los 14 grupos de contexto quedan con un cociente de separación entre 1.20 y 1.54. El equilibrio calibrado está en 1.15 y un corte aleatorio ya en 1.31. Un filtro sólo sirve si separa, y ese corte marca cuánto separa una moneda en esta misma muestra. Los 14 grupos se reparten alrededor de esa marca: unos por debajo, otros por encima. Ninguno se despega lo suficiente para distinguirse de ella. Ningún contexto separa ganadores de perdedores mejor que el azar.
Las tres primarias con señal medible fallan además por señal. Turno de mes: ΔEV −0.0095 (t −0.18, indistinguible de cero: ruido, no un efecto negativo medido). Racha de cierres previos: −0.0566 (t −1.12, con el signo contrario al esperado). Vetar la segunda operación del día: −0.0885 (t −1.14).
¿Y si apago el peor día de la semana?
Tampoco. Los cinco días quedan por encima del equilibrio de 1.15: el rango va de 1.20 a 1.46. Apagar cualquiera hace fallar el piso de caja, con caídas de 27.0% a 30.1%. Hay un día cuyo apagado duele menos que el de los otros cuatro. Ser el menos malo de una familia que no paga no lo vuelve bueno.
¿No sería mejor un stop que se adapte a la volatilidad?
No. El factor de escala se calibró sólo con los primeros años de la muestra y se aplicó hacia adelante. Con eso, el stop fijo aguanta (EV +0.0941, t +3.76). Los dos brazos adaptativos —uno escalado al rango del contrato, otro al ATR— caen entre 41% y 45% en caja. El percentil 35 se va a negativo en los dos: no empatan peor, fallan el piso.
La reapertura del 3 de agosto de 2026 lo confirmó a otra escala y con otra muestra. Esa muestra es el contrato grande, 2010-2026, con réplica en el micro. El marcador: diez familias, ≈67,600 configuraciones, nueve muertas. Modos de fallo: nivel disfrazado de adaptación, no-estacionariedad del proxy —la misma fórmula prescribe stops incomparables según el nivel del índice— y pico, no meseta. La superviviente, auditada a tres bandas, debía su ventaja al redondeo a contratos enteros. Con contratos fraccionarios pasa de positiva a negativa en los dos instrumentos, y a riesgo igualado pierde 4 de 5 niveles. Marcador del gate: 1 de 8. Vale registrar el coste: una sesión entera para confirmar una clase que ya estaba cerrada. Reabrirla estuvo justificado porque había data nueva; el resultado no la descubre.
¿Las pérdidas vienen agrupadas? ¿Conviene parar tras dos seguidas?
No hay agrupamiento que explotar. La autocorrelación de signo a un rezago es −0.0135, y las rachas perdedoras son menos frecuentes que la distribución geométrica, no más:
| Racha perdedora de k operaciones | Observado | Geométrico |
|---|---|---|
| k = 2 | 18.30% | 18.67% |
| k = 3 | 7.42% | 8.07% |
| k = 4 | 2.55% | 3.49% |
| k = 5 | 0.70% | 1.51% |
La racha perdedora máxima observada fue de 7 —máximo de esta muestra, no un techo: depende de cuántas operaciones mires—. Estimar la tasa de quema de una cuenta suponiendo independencia queda del lado conservador. Y la respuesta a parar tras dos seguidas cae sola: la tercera operación no sabe nada de las dos anteriores. Apagarte después de ellas no te quita una operación peor que las demás, te quita una operación como todas las demás.
¿Se puede elegir la mejor hora y temporalidad mirando el histórico?
No. Sobre 129 celdas de hora por temporalidad, la correlación de Spearman entre el orden dentro de muestra y el orden fuera de muestra es 0.045. Midiendo por EV da 0.053. Es correlación de ranking: el orden histórico no contiene información sobre el orden futuro.
El ganador dentro de muestra pasa de t +3.04 a +1.41, y otro de +2.78 a 0.00. La celda que terminó primera fuera de muestra era la quinta dentro de muestra (+2.28 → +3.46). Son estadísticos t, no dólares. Elegir la mejor casilla del histórico no es elegir la mejor hora: es elegir la que más suerte tuvo mientras mirabas.
¿Y reoptimizar los parámetros cada año?
Ni gana ni pierde: no se distingue. El walk-forward sobre 16 años da t = +0.46, con intervalo de confianza al 95% que cruza el cero. Restringido a la era viva da t = +1.40, que también lo cruza: ventana más corta, menos potencia. Sigue siendo un empate, no un resultado positivo con menos evidencia. La configuración fija que ya usábamos está sentada en el percentil 88 de las celdas vivas de ese barrido.
La reselección rodante falla peor. Re-seleccionando cada mes, con cuentas persistentes y ventana de tres meses, da el 10% de la configuración fija. Queda en el percentil 31 del placebo, peor que elegir al azar. El mecanismo está declarado: la ventana corta se enamora de la esquina de stop diminuto. El motor la premia dentro de la ventana y el drawdown trailing la mata hacia adelante. Prohibida esa esquina, el mejor de seis configuraciones empata (+0.8%). El oráculo que mira hacia adelante hace el doble: hay estructura, pero el horizonte de información es más corto que la ventana necesaria para medirla.
¿Por qué el mejor resultado de un barrido casi nunca se repite?
El máximo de un barrido es un estadístico de orden, no una estimación. Dos mediciones, el mismo desenlace:
- La celda óptima dentro de muestra de un barrido de 360 hace el 162% de la caja del control dentro de muestra. Fuera de muestra hace el 65%, y falla el gate por eso. (Esa caja incluye el capital invertido: es la métrica del montaje, no una ganancia neta.)
- En otro estudio, la celda que gana su propia ventana cae al percentil 14 del criterio maximin. Se cierra por gradiente y por mecanismo: con seis trimestres disjuntos no existe umbral que pasar.
El máximo de una ventana es el peor predictor de las otras.
La autocrítica del arco: un titular de +10.0 puntos que se da la vuelta
El resultado más vistoso fue +10.0 puntos porcentuales de diferencia en la probabilidad trimestral de retirar más de lo invertido. Es la rama 2024+, con n = 10 trimestres disjuntos. No lo publicamos, y esta es la razón.
- Se voltea con cuatro convenciones arbitrarias, cada una por separado (no acumuladas). Mover el umbral de dinero que cuenta como trimestre bueno da −10 pp; al doble, −20 pp. Invertir el desempate de marca de tiempo da −20 pp. Aplicar el ajuste de paridad simétrico da 0 pp, y cobrar un tick por lado de fricción da −10 pp. Probamos otros dos interruptores que no lo voltean, y los reportamos igual.
- El efecto central de las 63 rejillas probadas es +3.3 pp, con IC95 de −24.3 a +29.5 pp y McNemar exacto p = 0.50. El intervalo cruza el cero por los dos lados: es compatible con una diferencia grande a favor y con una en contra.
- La potencia para ver 10 pp con n = 10 trimestres disjuntos es del 2%: harían falta ~200 trimestres disjuntos, unos 50 años.
- El candidato era el placebo de un estudio anterior, ascendido tras ver su resultado: error familiar nominal 22.6%, sin deflactar.
- Marcador externo: 0 de 4 lecturas independientes concluyen superioridad; 4 de 4 confirman que no hay potencia. Es triangulación de lectura, no una réplica.
No es un resultado: es una esquina de un cubo de decisiones. Añade ausencia de evidencia, no evidencia de ausencia.
(Las cifras de este bloque son todas de la rama 2024+, n = 10. La otra rama del mismo estudio da valores distintos; no se mezclan.)
Cómo medimos esto
Motor propio de cuenta de fondeo, drawdown trailing de $2,000, comisión de $1.22 por vuelta dentro del motor. Muestras: 7.2 años de calendario sobre el micro del Nasdaq (2019-2026) y 2010-2026 (17 años) sobre el contrato grande. Métrica y gate declarados antes de mirar, placebo de señal cero como control, bloques disjuntos.
Integridad del arnés, cada control en su propio montaje. Sonda de no-anticipación sobre el bloque de filtros de contexto: 122 sesiones, 0 discrepancias. Regresión bit-exacta contra el motor de referencia en el head-to-head de julio de 2026: 924 ventanas × 10 campos, 0 diferencias. Los dos prueban que la implementación hace lo que dice; ninguno valida un hallazgo.
Limitaciones declaradas, que son parte de las cifras:
- Conviven cinco denominadores distintos de la métrica de dinero por unidad invertida, con ejes, ventanas y celdas no comparables entre sí. Por eso publicamos porcentajes, cocientes y percentiles, y no niveles de resultado en dólares.
- El motor no modela slippage por defecto: es una limitación declarada, no un supuesto oculto. Cobrado dentro del motor, un tick por lado no tumba ninguna de las familias de arriba. Sí basta para voltear el titular trimestral de la autocrítica (−10 pp).
- Casi todo está condicionado a una cuenta con drawdown trailing de $2,000. Con un drawdown mayor cambia el cociente entre stop y drawdown, y eso no está medido.
- No existe una lista canónica numerada de clases 1 a 22: el índice interno remite a un encabezado inexistente. Preferimos marcar el hueco a fabricar estructura.
- La pregunta abierta más grande no es el stop sino el tamaño de posición, y no está auditada.
Lo que esto NO dice
Los límites de todo lo anterior, puestos por nosotros y no por el lector:
- No dice que estas ideas sean malas en general: no pasaron el gate en esta ventana, este instrumento y esta cuenta.
- No dice que lo que sí usamos sea superior: se queda por ausencia de evidencia en contra.
- No dice que un filtro de contexto sea imposible. Un 0 de 5 con esta potencia es ausencia de evidencia, no evidencia de ausencia; el caso trimestral lo hace explícito con su 2%.
- No separa sesgo de estructura: correr la misma geometría sobre un instrumento sin deriva alcista clara del período está pendiente.
- No es una configuración: publicamos qué medimos, con qué método y qué salió, no valores de stop, presets ni horarios.
La evidencia
La otra mitad es el muro público de retiros verificados: 58 traders, 293 retiros, $373,434 USD. Ventana enero-2026 → agosto-2026, corte del 12 de agosto de 2026. Está en el muro de retiros.
Cómo se construye una medición capaz de matar su propia hipótesis: biblioteca.ast.bar.
En una frase
Registramos seis familias de hipótesis medidas y cerradas sobre futuros del Nasdaq, 2019-2026. En filtros de contexto: 0 de 5 pruebas preregistradas y 0 de 9 descriptivas; los 14 grupos quedan entre 1.20 y 1.54, con el equilibrio en 1.15 y el corte aleatorio en 1.31. Ningún contexto separa mejor que el azar.
Todo esto está en la biblioteca
Los modelos, las métricas y los estudios completos, en un solo sitio.
Entrar a la biblioteca AST →