← All Collections
🧬 15 parts

Modern ML for Trading

The full gradient-boosting-to-neural-operator toolkit — ensembles, AutoML, probabilistic forecasting, distillation and pruning for latency, plus physics-informed architectures like Neural ODEs and Fourier operators.

  1. 01
    XGBoost for Return Direction: Class Imbalance and Decision Thresholds
    Aug 25, 2026 #machine-learning

    XGBoost for Return Direction: Class Imbalance and Decision Thresholds

    Return-direction classifiers are imbalanced problems, and 0.5 is the wrong decision threshold. Comparing scale_pos_weight, focal loss, and precision-constrained threshold optimization on crypto data — plus the engineering differences between XGBoost, LightGBM, and CatBoost.

  2. 02
    Ensemble-Methoden: Kombination schwacher Lernender für robustes Alpha
    Aug 3, 2026 #machine-learning

    Ensemble-Methoden: Kombination schwacher Lernender für robustes Alpha

    Drei Dinge über den Handel mit Ensembles wurden in diesem Blog nicht behandelt: Warum der Kovarianzterm – und nicht die Modellanzahl – den Ensemblefehler dominiert, wie Stacking als Signalkombinationsschicht mit Out-of-Fold-Metafunktionen funktioniert und ob die Umsatzverrechnung über viele Signale hinweg tatsächlich die Ausführungskosten senkt.

  3. 03
    AutoML für systematische Handelspipelines
    Jul 30, 2026 #AutoML

    AutoML für systematische Handelspipelines

    Automatisierte Feature-Generierung (tsfresh, Featuretools), budgetbewusste Modellsuche (der kostensparende Optimierer von FLAML) und die WorldQuant-Formel-Alpha-Fabrik – die Teile der Forschungspipeline, die im Such- und Overfit-Bogen dieses Blogs nie behandelt wurden, und was die eigenen Ergebnisse des Bogens über sie aussagen.

  4. 04
    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction
    Aug 15, 2026 #deep-learning

    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction

    Does jointly predicting return, volume, and volatility actually help? Measuring loss-balancing schemes and diagnosing negative transfer through gradient cosine similarity — with a classical baseline and purged walk-forward folds.

  5. 05
    Anomalieerkennung zum Schutz von Trading-Bots: Vom Z-Score zum Transformer
    Feb 19, 2026 #algo trading

    Anomalieerkennung zum Schutz von Trading-Bots: Vom Z-Score zum Transformer

    Welche Methoden zur Anomalieerkennung im Krypto-Algo-Trading tatsächlich funktionieren, wie man eine kaskadierende Schutzarchitektur aufbaut und warum dies das Fundament ist, ohne das Algo-Trading zum Glücksspiel wird.

  6. 06
    Scoring Probabilistic Forecasts: CRPS, PIT Calibration, and DeepAR
    Aug 20, 2026 #forecasting

    Scoring Probabilistic Forecasts: CRPS, PIT Calibration, and DeepAR

    How to evaluate a predictive distribution honestly — CRPS as a proper scoring rule, the PIT histogram as a calibration diagnostic, and DeepAR sampling in GluonTS.

  7. 07
    Unregelmäßige Zeit in Tick-Modellen: zeitkontinuierliche Codierungen vs. einfache Positionseinbettungen
    Aug 22, 2026 #HFT

    Unregelmäßige Zeit in Tick-Modellen: zeitkontinuierliche Codierungen vs. einfache Positionseinbettungen

    Sequenzmodelle, die mit Tick-Daten gefüttert werden, gehen immer noch von regelmäßigen Abständen aus. Drei Möglichkeiten, einem Transformer mitzuteilen, wann tatsächlich ein Tick aufgetreten ist – kontinuierliche Codierung auf erlernbarer Zeitskala, latenter ODE-RNN-Zustand und delta_t als einfaches Merkmal – und die Ablation, die zwischen ihnen entscheidet.

  8. 08
    Ist ein ganztägiger Kontext besser als ein zehnminütiger Kontext? Flash Attention und die Frage nach der Sequenzlänge
    Aug 4, 2026 #deep-learning

    Ist ein ganztägiger Kontext besser als ein zehnminütiger Kontext? Flash Attention und die Frage nach der Sequenzlänge

    Flash Attention macht einen Handelskontext mit 23.400 Schritten rechenfrei – Kacheln, Online-Softmax und eine IO-Grenze von N^2 d^2 / M. Ob dieser längere Kontext das Modell besser macht, ist eine separate Frage und muss gemessen und nicht behauptet werden.

  9. 09
    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment
    Aug 11, 2026 #model-compression

    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment

    The blog's standing answer to the accuracy-vs-latency tension is a two-stage fast/slow split. Distillation is a different answer: train one small model to mimic the ensemble. The KD loss, temperature, born-again nets, early exits for a variable latency budget, and the distill-to-FPGA pipeline — plus the measurements that would decide whether it beats the two-stage split.

  10. 10
    Model Pruning for Low-Latency Trading Inference
    Aug 14, 2026 #model-compression

    Model Pruning for Low-Latency Trading Inference

    Magnitude and structured pruning, the Lottery Ticket Hypothesis, movement pruning, distillation and 2:4 sparsity — the methods behind shrinking a trading model, and what still has to be measured before any of it ships.

  11. 11
    Gaußsche Prozesse zur nichtparametrischen Preismodellierung
    Aug 6, 2026 #bayesian

    Gaußsche Prozesse zur nichtparametrischen Preismodellierung

    Kernel-Design für Finanzzeitreihen – Matern-Rauheit, lokal periodische Zusammensetzung, Spektralmischungen – und die Grenzwahrscheinlichkeit als Regularisierer, der keinen Validierungssatz benötigt. Dazu die ehrliche Auflistung dessen, was noch gemessen werden muss, bevor etwas davon handelbar ist.

  12. 12
    Epistemisch vs Aleatorisch: Was ein Rücklaufmodell nicht weiß
    Jul 31, 2026 #bayesian

    Epistemisch vs Aleatorisch: Was ein Rücklaufmodell nicht weiß

    Jede Positionsgrößen-Regel in diesem Blog behandelt Unsicherheit als eine einzige Zahl. MC Dropout und Deep Ensembles teilen sie in Modellunwissen und Marktgeräusche auf — und beide verdienen unterschiedliche Positionsgrößen.

  13. 13
    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?
    Aug 16, 2026 #deep-learning

    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?

    Neural ODEs, Neural SDEs and continuous normalizing flows for irregularly-sampled market data — and the one ablation that decides whether continuous dynamics are worth their solver cost.

  14. 14
    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?
    Aug 8, 2026 #deep-learning

    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?

    Hamiltonian Neural Networks are provably stable — but stability is worthless if the conserved quantity does not exist. Learning a scalar H via autograd, symplectic integration, and the falsification test that decides whether a financial (q, p) pair is canonical at all.

  15. 15
    Neuronaler Fourier-Operator für PDE-basierte Finanzmodellierung
    Aug 5, 2026 #deep-learning

    Neuronaler Fourier-Operator für PDE-basierte Finanzmodellierung

    Das Lernen von Operatoren bildet ganze Funktionsräume ab, nicht Punkte – wie der neuronale Fourier-Operator einen PDE-Lösungsoperator im Frequenzraum parametrisiert, was er für die Optionspreisgestaltung kauft und welche seiner Ansprüche noch auf realer Hardware gemessen werden müssen.