← All Collections
🧬 15 parts

Modern ML for Trading

The full gradient-boosting-to-neural-operator toolkit — ensembles, AutoML, probabilistic forecasting, distillation and pruning for latency, plus physics-informed architectures like Neural ODEs and Fourier operators.

  1. 01
    XGBoost for Return Direction: Class Imbalance and Decision Thresholds
    Aug 25, 2026 #machine-learning

    XGBoost for Return Direction: Class Imbalance and Decision Thresholds

    Return-direction classifiers are imbalanced problems, and 0.5 is the wrong decision threshold. Comparing scale_pos_weight, focal loss, and precision-constrained threshold optimization on crypto data — plus the engineering differences between XGBoost, LightGBM, and CatBoost.

  2. 02
    Méthodes d'ensemble : combiner des apprenants faibles pour une alpha robuste
    Aug 3, 2026 #machine-learning

    Méthodes d'ensemble : combiner des apprenants faibles pour une alpha robuste

    Trois choses sur les ensembles commerciaux que ce blog n'a pas abordées : pourquoi le terme de covariance (et non le nombre de modèles) domine l'erreur d'ensemble, comment l'empilement fonctionne comme une couche de combinaison de signaux avec des méta-fonctionnalités hors du champ de pli, et si la compensation du chiffre d'affaires sur de nombreux signaux réduit réellement le coût d'exécution.

  3. 03
    AutoML pour les pipelines de trading systématique
    Jul 30, 2026 #AutoML

    AutoML pour les pipelines de trading systématique

    Génération automatisée de fonctionnalités (tsfresh, Featuretools), recherche de modèles tenant compte du budget (l'optimiseur économique de FLAML) et usine alpha de formules WorldQuant - les parties du pipeline de recherche que l'arc de recherche et de surajustement de ce blog n'a jamais couvertes, et ce que les propres résultats de l'arc en disent.

  4. 04
    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction
    Aug 15, 2026 #deep-learning

    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction

    Does jointly predicting return, volume, and volatility actually help? Measuring loss-balancing schemes and diagnosing negative transfer through gradient cosine similarity — with a classical baseline and purged walk-forward folds.

  5. 05
    Détection d'anomalies pour protéger les bots de trading : du Z-Score au Transformer
    Feb 19, 2026 #algo trading

    Détection d'anomalies pour protéger les bots de trading : du Z-Score au Transformer

    Quelles méthodes de détection d'anomalies fonctionnent réellement dans le trading algorithmique crypto, comment construire une architecture de protection en cascade, et pourquoi c'est le fondement sans lequel le trading algorithmique devient un jeu de hasard.

  6. 06
    Évaluation des prévisions probabilistes : CRPS, calibrage PIT et DeepAR
    Aug 20, 2026 #forecasting

    Évaluation des prévisions probabilistes : CRPS, calibrage PIT et DeepAR

    Comment évaluer honnêtement une distribution prédictive : le CRPS comme règle de notation appropriée, l'histogramme PIT comme diagnostic d'étalonnage et l'échantillonnage DeepAR dans GluonTS.

  7. 07
    Temps irrégulier dans les modèles de ticks : codages en temps continu par rapport aux intégrations positionnelles simples
    Aug 22, 2026 #HFT

    Temps irrégulier dans les modèles de ticks : codages en temps continu par rapport aux intégrations positionnelles simples

    Les modèles de séquence alimentés par les données de ticks supposent toujours un espacement régulier. Trois façons d'indiquer à un transformateur quand un tick s'est réellement produit - codage continu à échelle de temps apprenable, état latent ODE-RNN et delta_t en tant que fonctionnalité simple - et l'ablation qui décide entre elles.

  8. 08
    Un contexte d’une journée complète bat-il un contexte de dix minutes ? Attention flash et question de longueur de séquence
    Aug 4, 2026 #deep-learning

    Un contexte d’une journée complète bat-il un contexte de dix minutes ? Attention flash et question de longueur de séquence

    Flash Attention crée un contexte de trading de 23 400 étapes sans calcul : mosaïque, softmax en ligne et limite d'E/S de N^2 d^2 / M. La question de savoir si ce contexte plus long améliore le modèle est une question distincte, et elle doit être mesurée et non affirmée.

  9. 09
    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment
    Aug 11, 2026 #model-compression

    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment

    The blog's standing answer to the accuracy-vs-latency tension is a two-stage fast/slow split. Distillation is a different answer: train one small model to mimic the ensemble. The KD loss, temperature, born-again nets, early exits for a variable latency budget, and the distill-to-FPGA pipeline — plus the measurements that would decide whether it beats the two-stage split.

  10. 10
    Model Pruning for Low-Latency Trading Inference
    Aug 14, 2026 #model-compression

    Model Pruning for Low-Latency Trading Inference

    Magnitude and structured pruning, the Lottery Ticket Hypothesis, movement pruning, distillation and 2:4 sparsity — the methods behind shrinking a trading model, and what still has to be measured before any of it ships.

  11. 11
    Processus gaussiens pour la modélisation des prix non paramétriques
    Aug 6, 2026 #bayesian

    Processus gaussiens pour la modélisation des prix non paramétriques

    Conception de noyau pour les séries temporelles financières — rugosité de Matern, composition localement périodique, mélanges spectraux — et vraisemblance marginale en tant que régulariseur qui ne nécessite aucun ensemble de validation. Plus la liste honnête de ce qui doit encore être mesuré avant que tout cela soit échangeable.

  12. 12
    Épistémique vs Aléatoire : Mesurer ce qu'un modèle de rendement ne sait pas
    Jul 31, 2026 #bayesian

    Épistémique vs Aléatoire : Mesurer ce qu'un modèle de rendement ne sait pas

    Chaque règle de dimensionnement dans ce blog traite l'incertitude comme un seul nombre. MC Dropout et les deep ensembles la divisent en ignorance du modèle et bruit de marché — et les deux méritent des tailles de position différentes.

  13. 13
    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?
    Aug 16, 2026 #deep-learning

    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?

    Neural ODEs, Neural SDEs and continuous normalizing flows for irregularly-sampled market data — and the one ablation that decides whether continuous dynamics are worth their solver cost.

  14. 14
    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?
    Aug 8, 2026 #deep-learning

    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?

    Hamiltonian Neural Networks are provably stable — but stability is worthless if the conserved quantity does not exist. Learning a scalar H via autograd, symplectic integration, and the falsification test that decides whether a financial (q, p) pair is canonical at all.

  15. 15
    Opérateur neuronal de Fourier pour la modélisation financière basée sur la PDE
    Aug 5, 2026 #deep-learning

    Opérateur neuronal de Fourier pour la modélisation financière basée sur la PDE

    L'apprentissage des opérateurs cartographie des espaces de fonctions entiers, pas des points - comment l'opérateur neuronal de Fourier paramétre un opérateur de solution PDE dans l'espace de fréquence, ce qu'il achète pour la tarification des options et lesquelles de ses affirmations doivent encore être mesurées sur du matériel réel.