← All Collections
🧬 15 parts

Modern ML for Trading

The full gradient-boosting-to-neural-operator toolkit — ensembles, AutoML, probabilistic forecasting, distillation and pruning for latency, plus physics-informed architectures like Neural ODEs and Fourier operators.

  1. 01
    XGBoost for Return Direction: Class Imbalance and Decision Thresholds
    Aug 25, 2026 #machine-learning

    XGBoost for Return Direction: Class Imbalance and Decision Thresholds

    Return-direction classifiers are imbalanced problems, and 0.5 is the wrong decision threshold. Comparing scale_pos_weight, focal loss, and precision-constrained threshold optimization on crypto data — plus the engineering differences between XGBoost, LightGBM, and CatBoost.

  2. 02
    Metodi d'insieme: combinare studenti deboli per un alfa robusto
    Aug 3, 2026 #machine-learning

    Metodi d'insieme: combinare studenti deboli per un alfa robusto

    Tre cose sugli insiemi di trading che questo blog non ha trattato: perché il termine di covarianza – e non il conteggio dei modelli – domina l'errore dell'insieme, come lo stacking funziona come uno strato di combinazione di segnali con meta-caratteristiche out-of-fold e se la compensazione del turnover tra molti segnali riduce effettivamente i costi di esecuzione.

  3. 03
    AutoML per pipeline di trading sistematico
    Jul 30, 2026 #AutoML

    AutoML per pipeline di trading sistematico

    Automated feature generation (tsfresh, Featuretools), budget-aware model search (FLAML's cost-frugal optimizer), and the WorldQuant formulaic alpha factory — the parts of the research pipeline this blog's search-and-overfit arc never covered, and what the arc's own results say about them.

  4. 04
    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction
    Aug 15, 2026 #deep-learning

    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction

    Does jointly predicting return, volume, and volatility actually help? Measuring loss-balancing schemes and diagnosing negative transfer through gradient cosine similarity — with a classical baseline and purged walk-forward folds.

  5. 05
    Rilevamento delle Anomalie per la Protezione dei Bot di Trading: da Z-Score a Transformer
    Feb 19, 2026 #algo trading

    Rilevamento delle Anomalie per la Protezione dei Bot di Trading: da Z-Score a Transformer

    Quali metodi di rilevamento delle anomalie funzionano davvero nel crypto algo trading, come costruire un'architettura di protezione a cascata e perché questa è la base senza la quale l'algo trading diventa un gioco d'azzardo.

  6. 06
    Punteggio delle previsioni probabilistiche: CRPS, calibrazione PIT e DeepAR
    Aug 20, 2026 #forecasting

    Punteggio delle previsioni probabilistiche: CRPS, calibrazione PIT e DeepAR

    Come valutare onestamente una distribuzione predittiva: CRPS come regola di punteggio adeguata, l'istogramma PIT come diagnostica di calibrazione e campionamento DeepAR in GluonTS.

  7. 07
    Irregular Time in Tick Models: Continuous-Time Encodings vs. Plain Positional Embeddings
    Aug 22, 2026 #HFT

    Irregular Time in Tick Models: Continuous-Time Encodings vs. Plain Positional Embeddings

    Sequence models fed tick data still assume regular spacing. Three ways to tell a Transformer when a tick actually happened — learnable-timescale continuous encoding, ODE-RNN latent state, and delta_t as a plain feature — and the ablation that decides between them.

  8. 08
    Un contesto di un'intera giornata batte uno di dieci minuti? Attenzione flash e domanda sulla lunghezza della sequenza
    Aug 4, 2026 #deep-learning

    Un contesto di un'intera giornata batte uno di dieci minuti? Attenzione flash e domanda sulla lunghezza della sequenza

    Flash Attention rende computazionalmente gratuito un contesto di trading di 23.400 passaggi: affiancamento, softmax online e un limite IO di N ^ 2 d ^ 2 / M. Se quel contesto più lungo renda il modello migliore è una questione separata e deve essere misurato, non affermato.

  9. 09
    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment
    Aug 11, 2026 #model-compression

    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment

    The blog's standing answer to the accuracy-vs-latency tension is a two-stage fast/slow split. Distillation is a different answer: train one small model to mimic the ensemble. The KD loss, temperature, born-again nets, early exits for a variable latency budget, and the distill-to-FPGA pipeline — plus the measurements that would decide whether it beats the two-stage split.

  10. 10
    Model Pruning for Low-Latency Trading Inference
    Aug 14, 2026 #model-compression

    Model Pruning for Low-Latency Trading Inference

    Magnitude and structured pruning, the Lottery Ticket Hypothesis, movement pruning, distillation and 2:4 sparsity — the methods behind shrinking a trading model, and what still has to be measured before any of it ships.

  11. 11
    Processi gaussiani per la modellazione dei prezzi non parametrica
    Aug 6, 2026 #bayesian

    Processi gaussiani per la modellazione dei prezzi non parametrica

    Progettazione del kernel per serie temporali finanziarie - rugosità Matern, composizione periodica locale, miscele spettrali - e verosimiglianza marginale come regolarizzatore che non necessita di un set di validazione. Inoltre, l'elenco onesto di ciò che deve ancora essere misurato prima che tutto ciò sia commerciabile.

  12. 12
    Epistemico vs Aleatorico: Misurare ciò che un modello di rendimento non sa
    Jul 31, 2026 #bayesian

    Epistemico vs Aleatorico: Misurare ciò che un modello di rendimento non sa

    Ogni regola di sizing in questo blog tratta l'incertezza come un unico numero. MC Dropout e i deep ensembles la dividono in ignoranza del modello e rumore di mercato — e entrambi meritano dimensioni di posizione diverse.

  13. 13
    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?
    Aug 16, 2026 #deep-learning

    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?

    Neural ODEs, Neural SDEs and continuous normalizing flows for irregularly-sampled market data — and the one ablation that decides whether continuous dynamics are worth their solver cost.

  14. 14
    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?
    Aug 8, 2026 #deep-learning

    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?

    Hamiltonian Neural Networks are provably stable — but stability is worthless if the conserved quantity does not exist. Learning a scalar H via autograd, symplectic integration, and the falsification test that decides whether a financial (q, p) pair is canonical at all.

  15. 15
    Operatore neurale di Fourier per la modellazione finanziaria basata su PDE
    Aug 5, 2026 #deep-learning

    Operatore neurale di Fourier per la modellazione finanziaria basata su PDE

    L'apprendimento degli operatori mappa interi spazi funzionali, non punti: come l'operatore neurale di Fourier parametrizza un operatore di soluzione PDE nello spazio delle frequenze, cosa acquista per il prezzo delle opzioni e quali delle sue affermazioni necessitano ancora di essere misurate su hardware reale.