Paper interactivo de investigación
Evaluación realista de claims DRL
Un paper interactivo sobre cómo cambian las conclusiones de un modelo TD3 cuando se evalúa con costes, cash explícito, benchmarks comparables y validación estadística.
Problema de evaluación
Un backtest atractivo puede crear falsa confianza
Resultado aparente
Un candidato DRL puede quedar bien posicionado tras el entrenamiento y producir un backtest atractivo.
Ilustración conceptual
Fuentes de sobreestimación
La credibilidad del resultado depende del diseño de evaluación alrededor del algoritmo.
- Benchmarks débiles o no comparables
- Costes de transacción simplificados
- Tratamiento ambiguo del cash
- Sesgo por búsqueda de candidatos
- Validación estadística limitada
Por tanto, el TFM evalúa las afirmaciones alrededor de TD3.
Jerarquía de evidencia
Tres afirmaciones, cada vez más exigentes
Pregunta de investigación
¿Puede un marco de evaluación orientado a falsación distinguir competitividad de ranking, credibilidad estadística y factibilidad práctica en asignación cross-asset basada en TD3?
¿Rinde bien frente a benchmarks comparables?
¿Sobrevive a la incertidumbre y al control de data snooping?
¿Sigue siendo plausible bajo mandatos y estrés de ejecución?
Regla interpretativa
Quedar primero en un ranking no demuestra superioridad estadística; incluso la superioridad estadística no garantizaría la desplegabilidad.
Banco de pruebas
Universo de activos
El universo es deliberadamente compacto. No busca representar todo el mercado global; busca crear un banco de pruebas interpretable.
SPY
01Renta variable / riesgo de crecimiento
Introduce beta de crecimiento y riesgo de renta variable estadounidense.
TLT
02Duración / riesgo de tipos
Aporta sensibilidad a tipos y duración larga del Tesoro.
GLD
03Refugio real / exposición a activo duro
Permite probar diversificación defensiva y exposición a activo real.
BTC-USD
04Alternativo digital / convexidad especulativa
Introduce convexidad especulativa y volatilidad extrema.
CASH / BIL
05Liquidez defensiva / opcionalidad
Sirve como componente defensivo y control del mandato.
Mecanismo TD3
Cómo TD3 produce asignaciones de cartera
TD3 se usa como learner de control continuo; la contribución no es una nueva variante del algoritmo.
Red actor
Críticos gemelos Q1 / Q2
Marco de evaluación
El candidato se somete a un protocolo exigente
La separación temporal y la comparación bajo supuestos equivalentes forman parte del test.
- 01Datos y familias de variables
- 02Entrenamiento de candidatos TD3
- 03Validación walk-forward y prueba fuera de muestra
- 04Benchmarks determinísticos comparables
- 05Incertidumbre bootstrap y White Reality Check
- 06Diagnósticos de régimen, mandato, Pareto, ejecución y presupuesto
La separación temporal es parte de la prueba.
Evidencia de ranking
La competitividad sobrevive bajo supuestos comparables
La tabla compara los candidatos TD3 de la capa benchmark-matched con Trend SPY/CASH, el comparador limpio usado en validación estadística.
Zero-CASH
| Métrica | TD3 | Trend SPY/CASH |
|---|---|---|
| Retorno anualizado: | 8.69% | 9.79% |
| Ratio de Sharpe: | 0.923 | 0.880 |
| Drawdown máximo: | -10.4% | -17.8% |
BIL-CASH
| Métrica | TD3 | Trend SPY/CASH |
|---|---|---|
| Retorno anualizado: | 10.65% | 10.24% |
| Ratio de Sharpe: | 1.141 | 0.917 |
| Drawdown máximo: | -10.3% | -17.3% |
El tratamiento del cash cambia la selección del candidato y la interpretación económica.
Los candidatos se seleccionan mediante rankings diagnósticos; la interpretación económica descansa en métricas estándar y validación estadística.
Validación estadística
Los intervalos no establecen superioridad
Los intervalos bootstrap de diferencia de Sharpe cruzan cero en ambos protocolos.
Intervalos bootstrap de diferencia de Sharpe
TD3 sigue siendo competitivo en ranking, pero no queda establecida la superioridad estadística frente al benchmark limpio.
Los intervalos son evidencia pareada; White Reality Check es evidencia del conjunto de candidatos ajustada por búsqueda.
Factibilidad práctica
El estrés de ejecución y los mandatos cambian la lectura
La sensibilidad se aplica después del entrenamiento: no reentrena TD3, no cambia la selección y no crea nuevos ganadores.
Degradación del Sharpe bajo estrés de spreads
Cambio de Sharpe · ≈ -0.0132 en el paper
Estrés: half-spreads adicionales de 3/5/5/50/0 bps para SPY/TLT/GLD/BTC-USD/CASH, ajustados por volatilidad con β = 0.5; sensibilidad posterior al entrenamiento, sin reentrenamiento.
Supervivencia de claims
Solo algunas afirmaciones sobreviven
La lectura final separa competitividad, inferencia estadística y factibilidad práctica.
| Afirmación | Lectura | Frontera de evidencia |
|---|---|---|
| Competitividad de ranking | Respaldada | Los candidatos seleccionados son competitivos frente al benchmark comparable; el liderazgo en retorno depende del cash. |
| Superioridad estadística | No respaldada | Los intervalos incluyen cero y White Reality Check no rechaza. |
| El supuesto de cash importa | Respaldada | Zero-CASH y BIL-CASH seleccionan candidatos diferentes. |
| Los supuestos de ejecución importan | Respaldada | Las historias TD3 se degradan más bajo estrés de spreads. |
| Factibilidad bajo mandato conservador | No respaldada | Ninguna estrategia pasa todos los filtros conservadores duros. |
| Competitividad Pareto | Condicional | Los candidatos quedan sobre o cerca de fronteras relevantes, según perfil y trade-off. |
| Los benchmarks determinísticos siguen siendo creíbles | Respaldada | Trend SPY/CASH continúa siendo un comparador limpio y fuerte. |
Contribución metodológica
Del backtest atractivo a una afirmación defendible
TD3 es el caso de estudio; el marco de evaluación orientado a falsación es la contribución.
- Tratamiento explícito del cash
- Costes de transacción
- Benchmarks determinísticos comparables
- Incertidumbre bootstrap
- Control de data snooping
- Filtros de factibilidad práctica
La contribución es metodológica, no algorítmica: no propone una nueva variante TD3, alpha desplegable ni superioridad universal.
Respuesta final
Competitividad de ranking
Los candidatos TD3 seleccionados siguen siendo competitivos frente a benchmarks determinísticos comparables en rendimiento ajustado por riesgo.
Superioridad estadística
Los intervalos bootstrap cruzan cero y White Reality Check no rechaza la hipótesis nula ajustada por búsqueda.
Factibilidad práctica
Cash, estrés de ejecución, mandatos, trade-offs Pareto y regímenes alteran materialmente la interpretación.
TD3 es un candidato de investigación competitivo para asignación dinámica, no una estrategia de trading estadísticamente dominante.
Resultado principal: Una evaluación realista cambia materialmente lo que puede afirmarse responsablemente a partir de experimentos favorables de cartera DRL.
Apéndice interactivo
Métodos, límites y trazabilidad
Estas notas amplían el protocolo sin competir con la secuencia principal de evidencia.
Los retornos netos incluyen costes específicosAbrirCerrar
SPY, TLT y GLD usan 2 bps; BTC-USD, 10 bps; CASH, 0 bps bajo Zero-CASH; BIL usa 2 bps bajo BIL-CASH. Los costes afectan al retorno realizado y a la señal de aprendizaje.
Cash no es una nota al pieAbrirCerrar
Zero-CASH es un sleeve sintético sin rendimiento ni coste. BIL-CASH usa una proxy invertible de Treasuries a corto plazo. Son entornos invertibles distintos y se evalúan por separado.
Diseño de candidatos y familias de variablesAbrirCerrar
Se evalúan familias V2 a V8, incluyendo macro limpio, volatilidad tipo GARCH, ablations sin volatilidad y combinaciones EWMA/GARCH. PCA fue auditado, pero no es la representación por defecto.
Búsqueda controlada por protocoloAbrirCerrar
La búsqueda combina familias de variables, caps, semillas, folds y cash. La selección TD3-only se separa de la selección para comparación con benchmarks.
Diagnostic selection scoreAbrirCerrar
Los scores mandate-aware y robust son resúmenes diagnósticos. No son tests de superioridad, probabilidades calibradas ni prueba de desplegabilidad.
Familias de benchmarksAbrirCerrar
El conjunto incluye buy-and-hold, equal weight, 60/40, reglas defensivas, momentum, Markowitz rolling, minimum variance, inverse volatility y Trend SPY/CASH, bajo supuestos comparables.
Evaluación walk-forwardAbrirCerrar
Los candidatos se entrenan solo en cada ventana de entrenamiento y se leen fuera de muestra. Cuatro folds temporales reducen dependencia de un único corte, pero no crean historias de mercado independientes.
Bootstrap y White Reality CheckAbrirCerrar
El bootstrap cuantifica incertidumbre pareada en la diferencia de Sharpe. WRC aporta evidencia del conjunto de candidatos ajustada por búsqueda. Ninguno reemplaza la interpretación económica.
Bucle interno TD3AbrirCerrar
El actor propone acciones continuas; dos críticos estiman valor; target networks, smoothing y actualizaciones retrasadas buscan reducir inestabilidad y sobreestimación.
Diseño de rewardAbrirCerrar
El reward parte del retorno neto e incorpora una penalización activa de drawdown. Turnover se penaliza económicamente mediante costes; concentración se evalúa fuera del reward.
Proyección de acciones factiblesAbrirCerrar
La acción cruda se proyecta al simplex: pesos no negativos que suman uno. La misma acción factible se ejecuta y se almacena para aprendizaje.
Análisis de regímenesAbrirCerrar
TD3 lidera algunos tramos Zero-CASH, mientras benchmarks y reglas momentum ganan muchos regímenes, especialmente bajo BIL-CASH. No hay dominio all-weather.
Filtros de mandatoAbrirCerrar
Los perfiles conservador, moderado y agresivo aplican límites de drawdown, volatilidad, diversificación efectiva y turnover. Ninguna estrategia pasa la capa conservadora dura.
Convergencia del presupuestoAbrirCerrar
La comprobación compara 30, 60, 100 y 150 episodios. No detecta subentrenamiento obvio a 60 episodios, pero tampoco demuestra optimalidad global del presupuesto.
Límites de alcanceAbrirCerrar
El universo es compacto y centrado en Estados Unidos. No incluye crédito, inmobiliario, commodities amplias, renta variable internacional, impuestos, impacto de mercado, liabilities ni necesidades de retirada.
Límites de ejecuciónAbrirCerrar
La ejecución es aproximada: no modela profundidad de libro, impacto de mercado, liquidez intradía, routing de broker, custodia ni fiscalidad.
ReproducibilidadAbrirCerrar
El paper documenta scripts de datos, entorno, entrenamiento, benchmarks, validación estadística y robustez. La trazabilidad respalda inspección y réplica, no sustituye evidencia live-forward.
Código, scripts y evidencia reproducible del protocolo TD3.