← All Collections
🧬 15 parts

Modern ML for Trading

The full gradient-boosting-to-neural-operator toolkit — ensembles, AutoML, probabilistic forecasting, distillation and pruning for latency, plus physics-informed architectures like Neural ODEs and Fourier operators.

  1. 01
    XGBoost for Return Direction: Class Imbalance and Decision Thresholds
    Aug 25, 2026 #machine-learning

    XGBoost for Return Direction: Class Imbalance and Decision Thresholds

    Return-direction classifiers are imbalanced problems, and 0.5 is the wrong decision threshold. Comparing scale_pos_weight, focal loss, and precision-constrained threshold optimization on crypto data — plus the engineering differences between XGBoost, LightGBM, and CatBoost.

  2. 02
    Métodos conjuntos: combinación de alumnos débiles para una alfa sólida
    Aug 3, 2026 #machine-learning

    Métodos conjuntos: combinación de alumnos débiles para una alfa sólida

    Tres cosas sobre el comercio de conjuntos que este blog no ha cubierto: por qué el término de covarianza (no el recuento de modelos) domina el error del conjunto, cómo funciona el apilamiento como una capa de combinación de señales con metacaracterísticas desplegadas y si la compensación de rotación entre muchas señales en realidad reduce el costo de ejecución.

  3. 03
    AutoML para canalizaciones de trading sistemático
    Jul 30, 2026 #AutoML

    AutoML para canalizaciones de trading sistemático

    Generación automatizada de características (tsfresh, Featuretools), búsqueda de modelos consciente del presupuesto (el optimizador frugal en costes de FLAML) y la fábrica de alfas formularios de WorldQuant: las partes del proceso de investigación que esta serie sobre búsqueda y sobreajuste nunca cubrió, y lo que sus propios resultados dicen al respecto.

  4. 04
    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction
    Aug 15, 2026 #deep-learning

    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction

    Does jointly predicting return, volume, and volatility actually help? Measuring loss-balancing schemes and diagnosing negative transfer through gradient cosine similarity — with a classical baseline and purged walk-forward folds.

  5. 05
    Detección de anomalías para proteger bots de trading: del Z-Score al Transformer
    Feb 19, 2026 #algo trading

    Detección de anomalías para proteger bots de trading: del Z-Score al Transformer

    Qué métodos de detección de anomalías funcionan realmente en el trading algorítmico de cripto, cómo construir una arquitectura de protección en cascada y por qué esta es la base sin la cual el trading algorítmico se convierte en una apuesta.

  6. 06
    Puntuación de pronósticos probabilísticos: CRPS, calibración PIT y DeepAR
    Aug 20, 2026 #forecasting

    Puntuación de pronósticos probabilísticos: CRPS, calibración PIT y DeepAR

    Cómo evaluar honestamente una distribución predictiva: CRPS como regla de puntuación adecuada, el histograma PIT como diagnóstico de calibración y muestreo DeepAR en GluonTS.

  7. 07
    Tiempo irregular en modelos de ticks: codificaciones de tiempo continuo versus incrustaciones posicionales simples
    Aug 22, 2026 #HFT

    Tiempo irregular en modelos de ticks: codificaciones de tiempo continuo versus incrustaciones posicionales simples

    Los modelos de secuencia alimentados con datos de ticks aún suponen un espaciado regular. Tres formas de decirle a un Transformer cuándo ocurrió realmente un tic (codificación continua en escala de tiempo que se puede aprender, estado latente ODE-RNN y delta_t como característica simple) y la ablación que decide entre ellas.

  8. 08
    ¿Un contexto de día completo supera a uno de diez minutos? Atención flash y la pregunta sobre la longitud de la secuencia
    Aug 4, 2026 #deep-learning

    ¿Un contexto de día completo supera a uno de diez minutos? Atención flash y la pregunta sobre la longitud de la secuencia

    Flash Attention hace que un contexto comercial de 23,400 pasos sea computacionalmente libre: mosaico, softmax en línea y un límite de IO de N^2 d^2 / M. Si ese contexto más largo mejora el modelo es una cuestión aparte, y debe medirse, no afirmarse.

  9. 09
    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment
    Aug 11, 2026 #model-compression

    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment

    The blog's standing answer to the accuracy-vs-latency tension is a two-stage fast/slow split. Distillation is a different answer: train one small model to mimic the ensemble. The KD loss, temperature, born-again nets, early exits for a variable latency budget, and the distill-to-FPGA pipeline — plus the measurements that would decide whether it beats the two-stage split.

  10. 10
    Model Pruning for Low-Latency Trading Inference
    Aug 14, 2026 #model-compression

    Model Pruning for Low-Latency Trading Inference

    Magnitude and structured pruning, the Lottery Ticket Hypothesis, movement pruning, distillation and 2:4 sparsity — the methods behind shrinking a trading model, and what still has to be measured before any of it ships.

  11. 11
    Procesos gaussianos para modelado de precios no paramétrico
    Aug 6, 2026 #bayesian

    Procesos gaussianos para modelado de precios no paramétrico

    Diseño de kernel para series de tiempo financieras (rugosidad materna, composición periódica local, mezclas espectrales) y la probabilidad marginal como regularizador que no necesita conjunto de validación. Además de la lista honesta de lo que aún debe medirse antes de que algo sea comercializable.

  12. 12
    Epistémico vs Aleatorio: Midiendo lo que un modelo de retornos no sabe
    Jul 31, 2026 #bayesian

    Epistémico vs Aleatorio: Midiendo lo que un modelo de retornos no sabe

    Cada regla de dimensionamiento en este blog trata la incertidumbre como un solo número. MC Dropout y los deep ensembles la dividen en ignorancia del modelo y ruido de mercado — y ambos merecen tamaños de posición diferentes.

  13. 13
    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?
    Aug 16, 2026 #deep-learning

    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?

    Neural ODEs, Neural SDEs and continuous normalizing flows for irregularly-sampled market data — and the one ablation that decides whether continuous dynamics are worth their solver cost.

  14. 14
    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?
    Aug 8, 2026 #deep-learning

    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?

    Hamiltonian Neural Networks are provably stable — but stability is worthless if the conserved quantity does not exist. Learning a scalar H via autograd, symplectic integration, and the falsification test that decides whether a financial (q, p) pair is canonical at all.

  15. 15
    Operador neuronal de Fourier para modelado financiero basado en PDE
    Aug 5, 2026 #deep-learning

    Operador neuronal de Fourier para modelado financiero basado en PDE

    El aprendizaje del operador mapea espacios funcionales completos, no puntos: cómo el operador neuronal de Fourier parametriza un operador de solución PDE en el espacio de frecuencia, qué compra para el precio de opciones y cuáles de sus afirmaciones aún necesitan medirse en hardware real.