Paper interactivo de investigación

Evaluación realista de claims DRL

Un paper interactivo sobre cómo cambian las conclusiones de un modelo TD3 cuando se evalúa con costes, cash explícito, benchmarks comparables y validación estadística.

Caso TD3CostesProtocolos cashBenchmarks comparablesBootstrapWhite Reality Check

Por Luigui Herrera

Publicado:

Actualizado:

Problema de evaluación

Un backtest atractivo puede crear falsa confianza

Resultado aparente

Un candidato DRL puede quedar bien posicionado tras el entrenamiento y producir un backtest atractivo.

Ilustración conceptual

tiempovalor

Fuentes de sobreestimación

La credibilidad del resultado depende del diseño de evaluación alrededor del algoritmo.

  • Benchmarks débiles o no comparables
  • Costes de transacción simplificados
  • Tratamiento ambiguo del cash
  • Sesgo por búsqueda de candidatos
  • Validación estadística limitada

Por tanto, el TFM evalúa las afirmaciones alrededor de TD3.

Jerarquía de evidencia

Tres afirmaciones, cada vez más exigentes

Pregunta de investigación

¿Puede un marco de evaluación orientado a falsación distinguir competitividad de ranking, credibilidad estadística y factibilidad práctica en asignación cross-asset basada en TD3?

Ranking

¿Rinde bien frente a benchmarks comparables?

Statistics

¿Sobrevive a la incertidumbre y al control de data snooping?

Feasibility

¿Sigue siendo plausible bajo mandatos y estrés de ejecución?

Regla interpretativa

Quedar primero en un ranking no demuestra superioridad estadística; incluso la superioridad estadística no garantizaría la desplegabilidad.

Banco de pruebas

Universo de activos

El universo es deliberadamente compacto. No busca representar todo el mercado global; busca crear un banco de pruebas interpretable.

SPY

01

Renta variable / riesgo de crecimiento

Introduce beta de crecimiento y riesgo de renta variable estadounidense.

TLT

02

Duración / riesgo de tipos

Aporta sensibilidad a tipos y duración larga del Tesoro.

GLD

03

Refugio real / exposición a activo duro

Permite probar diversificación defensiva y exposición a activo real.

BTC-USD

04

Alternativo digital / convexidad especulativa

Introduce convexidad especulativa y volatilidad extrema.

CASH / BIL

05

Liquidez defensiva / opcionalidad

Sirve como componente defensivo y control del mandato.

Mecanismo TD3

Cómo TD3 produce asignaciones de cartera

TD3 se usa como learner de control continuo; la contribución no es una nueva variante del algoritmo.

Red actor

Estado de mercado
Red actor
Pesos de cartera

Críticos gemelos Q1 / Q2

Entrada [estado, acción]
Q1
Q2
Menor estimación Q

Marco de evaluación

El candidato se somete a un protocolo exigente

La separación temporal y la comparación bajo supuestos equivalentes forman parte del test.

  1. 01Datos y familias de variables
  2. 02Entrenamiento de candidatos TD3
  3. 03Validación walk-forward y prueba fuera de muestra
  4. 04Benchmarks determinísticos comparables
  5. 05Incertidumbre bootstrap y White Reality Check
  6. 06Diagnósticos de régimen, mandato, Pareto, ejecución y presupuesto
Entrenar
Validar
Prueba OOS

La separación temporal es parte de la prueba.

Evidencia de ranking

La competitividad sobrevive bajo supuestos comparables

La tabla compara los candidatos TD3 de la capa benchmark-matched con Trend SPY/CASH, el comparador limpio usado en validación estadística.

Zero-CASH

Zero-CASH. Drawdown máximo: -0.1040; IC Bootstrap: [-0.6011, 0.9767]; P(beats): 0.629; WRC p-value: 0.7136.
MétricaTD3Trend SPY/CASH
Retorno anualizado: 8.69% 9.79%
Ratio de Sharpe: 0.923 0.880
Drawdown máximo: -10.4% -17.8%
TD3 seleccionado: V3 clean macro cap 0.70

BIL-CASH

BIL-CASH. Drawdown máximo: -0.1030; IC Bootstrap: [-0.7172, 0.9963]; P(beats): 0.588; WRC p-value: 0.6767.
MétricaTD3Trend SPY/CASH
Retorno anualizado: 10.65% 10.24%
Ratio de Sharpe: 1.141 0.917
Drawdown máximo: -10.3% -17.3%
TD3 seleccionado: V7 macro+GARCH cap 0.80

El tratamiento del cash cambia la selección del candidato y la interpretación económica.

Los candidatos se seleccionan mediante rankings diagnósticos; la interpretación económica descansa en métricas estándar y validación estadística.

Validación estadística

Los intervalos no establecen superioridad

Los intervalos bootstrap de diferencia de Sharpe cruzan cero en ambos protocolos.

Intervalos bootstrap de diferencia de Sharpe

ceroZero-CASH-0.60110.9767BIL-CASH-0.71720.9963-0.8-0.40.00.40.8Diferencia de Sharpe

TD3 sigue siendo competitivo en ranking, pero no queda establecida la superioridad estadística frente al benchmark limpio.

Los intervalos son evidencia pareada; White Reality Check es evidencia del conjunto de candidatos ajustada por búsqueda.

Factibilidad práctica

El estrés de ejecución y los mandatos cambian la lectura

La sensibilidad se aplica después del entrenamiento: no reentrena TD3, no cambia la selección y no crea nuevos ganadores.

Degradación del Sharpe bajo estrés de spreads

Zero-CASH TD3
-0.1321
BIL-CASH TD3
-0.1180
Zero-CASH Trend
-0.0132
BIL-CASH Trend
-0.0132
-0.15-0.10-0.050

Cambio de Sharpe · ≈ -0.0132 en el paper

Estrés: half-spreads adicionales de 3/5/5/50/0 bps para SPY/TLT/GLD/BTC-USD/CASH, ajustados por volatilidad con β = 0.5; sensibilidad posterior al entrenamiento, sin reentrenamiento.

Supervivencia de claims

Solo algunas afirmaciones sobreviven

La lectura final separa competitividad, inferencia estadística y factibilidad práctica.

Solo algunas afirmaciones sobreviven
AfirmaciónLecturaFrontera de evidencia
Competitividad de ranking RespaldadaLos candidatos seleccionados son competitivos frente al benchmark comparable; el liderazgo en retorno depende del cash.
Superioridad estadística No respaldadaLos intervalos incluyen cero y White Reality Check no rechaza.
El supuesto de cash importa RespaldadaZero-CASH y BIL-CASH seleccionan candidatos diferentes.
Los supuestos de ejecución importan RespaldadaLas historias TD3 se degradan más bajo estrés de spreads.
Factibilidad bajo mandato conservador No respaldadaNinguna estrategia pasa todos los filtros conservadores duros.
Competitividad Pareto CondicionalLos candidatos quedan sobre o cerca de fronteras relevantes, según perfil y trade-off.
Los benchmarks determinísticos siguen siendo creíbles RespaldadaTrend SPY/CASH continúa siendo un comparador limpio y fuerte.

Contribución metodológica

Del backtest atractivo a una afirmación defendible

TD3 es el caso de estudio; el marco de evaluación orientado a falsación es la contribución.

Backtest atractivo
Evaluación comparable
Bootstrap + WRC
Afirmación defendible
Filtros de factibilidad
Afirmación defendible
  • Tratamiento explícito del cash
  • Costes de transacción
  • Benchmarks determinísticos comparables
  • Incertidumbre bootstrap
  • Control de data snooping
  • Filtros de factibilidad práctica

La contribución es metodológica, no algorítmica: no propone una nueva variante TD3, alpha desplegable ni superioridad universal.

Respuesta final

01Respaldada

Competitividad de ranking

Los candidatos TD3 seleccionados siguen siendo competitivos frente a benchmarks determinísticos comparables en rendimiento ajustado por riesgo.

02No establecida

Superioridad estadística

Los intervalos bootstrap cruzan cero y White Reality Check no rechaza la hipótesis nula ajustada por búsqueda.

03Condicional

Factibilidad práctica

Cash, estrés de ejecución, mandatos, trade-offs Pareto y regímenes alteran materialmente la interpretación.

TD3 es un candidato de investigación competitivo para asignación dinámica, no una estrategia de trading estadísticamente dominante.

Resultado principal: Una evaluación realista cambia materialmente lo que puede afirmarse responsablemente a partir de experimentos favorables de cartera DRL.

Apéndice interactivo

Métodos, límites y trazabilidad

Estas notas amplían el protocolo sin competir con la secuencia principal de evidencia.

Los retornos netos incluyen costes específicosAbrirCerrar

SPY, TLT y GLD usan 2 bps; BTC-USD, 10 bps; CASH, 0 bps bajo Zero-CASH; BIL usa 2 bps bajo BIL-CASH. Los costes afectan al retorno realizado y a la señal de aprendizaje.

Cash no es una nota al pieAbrirCerrar

Zero-CASH es un sleeve sintético sin rendimiento ni coste. BIL-CASH usa una proxy invertible de Treasuries a corto plazo. Son entornos invertibles distintos y se evalúan por separado.

Diseño de candidatos y familias de variablesAbrirCerrar

Se evalúan familias V2 a V8, incluyendo macro limpio, volatilidad tipo GARCH, ablations sin volatilidad y combinaciones EWMA/GARCH. PCA fue auditado, pero no es la representación por defecto.

Búsqueda controlada por protocoloAbrirCerrar

La búsqueda combina familias de variables, caps, semillas, folds y cash. La selección TD3-only se separa de la selección para comparación con benchmarks.

Diagnostic selection scoreAbrirCerrar

Los scores mandate-aware y robust son resúmenes diagnósticos. No son tests de superioridad, probabilidades calibradas ni prueba de desplegabilidad.

Familias de benchmarksAbrirCerrar

El conjunto incluye buy-and-hold, equal weight, 60/40, reglas defensivas, momentum, Markowitz rolling, minimum variance, inverse volatility y Trend SPY/CASH, bajo supuestos comparables.

Evaluación walk-forwardAbrirCerrar

Los candidatos se entrenan solo en cada ventana de entrenamiento y se leen fuera de muestra. Cuatro folds temporales reducen dependencia de un único corte, pero no crean historias de mercado independientes.

Bootstrap y White Reality CheckAbrirCerrar

El bootstrap cuantifica incertidumbre pareada en la diferencia de Sharpe. WRC aporta evidencia del conjunto de candidatos ajustada por búsqueda. Ninguno reemplaza la interpretación económica.

Bucle interno TD3AbrirCerrar

El actor propone acciones continuas; dos críticos estiman valor; target networks, smoothing y actualizaciones retrasadas buscan reducir inestabilidad y sobreestimación.

Diseño de rewardAbrirCerrar

El reward parte del retorno neto e incorpora una penalización activa de drawdown. Turnover se penaliza económicamente mediante costes; concentración se evalúa fuera del reward.

Proyección de acciones factiblesAbrirCerrar

La acción cruda se proyecta al simplex: pesos no negativos que suman uno. La misma acción factible se ejecuta y se almacena para aprendizaje.

Análisis de regímenesAbrirCerrar

TD3 lidera algunos tramos Zero-CASH, mientras benchmarks y reglas momentum ganan muchos regímenes, especialmente bajo BIL-CASH. No hay dominio all-weather.

Filtros de mandatoAbrirCerrar

Los perfiles conservador, moderado y agresivo aplican límites de drawdown, volatilidad, diversificación efectiva y turnover. Ninguna estrategia pasa la capa conservadora dura.

Convergencia del presupuestoAbrirCerrar

La comprobación compara 30, 60, 100 y 150 episodios. No detecta subentrenamiento obvio a 60 episodios, pero tampoco demuestra optimalidad global del presupuesto.

Límites de alcanceAbrirCerrar

El universo es compacto y centrado en Estados Unidos. No incluye crédito, inmobiliario, commodities amplias, renta variable internacional, impuestos, impacto de mercado, liabilities ni necesidades de retirada.

Límites de ejecuciónAbrirCerrar

La ejecución es aproximada: no modela profundidad de libro, impacto de mercado, liquidez intradía, routing de broker, custodia ni fiscalidad.

ReproducibilidadAbrirCerrar

El paper documenta scripts de datos, entorno, entrenamiento, benchmarks, validación estadística y robustez. La trazabilidad respalda inspección y réplica, no sustituye evidencia live-forward.

Repositorio del proyecto

Código, scripts y evidencia reproducible del protocolo TD3.