← All Collections
🧬 15 parts

Modern ML for Trading

The full gradient-boosting-to-neural-operator toolkit — ensembles, AutoML, probabilistic forecasting, distillation and pruning for latency, plus physics-informed architectures like Neural ODEs and Fourier operators.

  1. 01
    XGBoost for Return Direction: Class Imbalance and Decision Thresholds
    Aug 25, 2026 #machine-learning

    XGBoost for Return Direction: Class Imbalance and Decision Thresholds

    Return-direction classifiers are imbalanced problems, and 0.5 is the wrong decision threshold. Comparing scale_pos_weight, focal loss, and precision-constrained threshold optimization on crypto data — plus the engineering differences between XGBoost, LightGBM, and CatBoost.

  2. 02
    Métodos Ensemble: Combinando Alunos Fracos para um Alfa Robusto
    Aug 3, 2026 #machine-learning

    Métodos Ensemble: Combinando Alunos Fracos para um Alfa Robusto

    Este blog não abordou três coisas sobre conjuntos de negociação: por que o termo de covariância - e não a contagem de modelos - domina o erro de conjunto, como o empilhamento funciona como uma camada de combinação de sinais com meta-recursos fora de dobra e se a compensação de rotatividade em muitos sinais realmente reduz o custo de execução.

  3. 03
    AutoML para pipelines de trading sistemático
    Jul 30, 2026 #AutoML

    AutoML para pipelines de trading sistemático

    Geração automatizada de atributos (tsfresh, Featuretools), busca de modelos consciente do orçamento (o otimizador econômico em custo do FLAML) e a fábrica de alfas formulaicos da WorldQuant — as partes do pipeline de pesquisa que esta série sobre busca e overfitting nunca cobriu, e o que os próprios resultados da série dizem sobre elas.

  4. 04
    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction
    Aug 15, 2026 #deep-learning

    Multi-Task Learning for Simultaneous Price, Volume, and Volatility Prediction

    Does jointly predicting return, volume, and volatility actually help? Measuring loss-balancing schemes and diagnosing negative transfer through gradient cosine similarity — with a classical baseline and purged walk-forward folds.

  5. 05
    Detecção de Anomalias para Proteção de Trading Bots: do Z-Score ao Transformer
    Feb 19, 2026 #algo trading

    Detecção de Anomalias para Proteção de Trading Bots: do Z-Score ao Transformer

    Quais métodos de detecção de anomalias realmente funcionam no algo trading de cripto, como construir uma arquitetura de proteção em cascata, e por que essa é a base sem a qual o algo trading se torna jogo de azar.

  6. 06
    Pontuação de previsões probabilísticas: CRPS, calibração PIT e DeepAR
    Aug 20, 2026 #forecasting

    Pontuação de previsões probabilísticas: CRPS, calibração PIT e DeepAR

    Como avaliar honestamente uma distribuição preditiva - CRPS como uma regra de pontuação adequada, o histograma PIT como um diagnóstico de calibração e amostragem DeepAR em GluonTS.

  7. 07
    Tempo Irregular em Modelos de Tick: Codificações de Tempo Contínuo vs. Incorporações Posicionais Simples
    Aug 22, 2026 #HFT

    Tempo Irregular em Modelos de Tick: Codificações de Tempo Contínuo vs. Incorporações Posicionais Simples

    Os modelos de sequência alimentados com dados de ticks ainda assumem espaçamento regular. Três maneiras de informar a um Transformer quando um tick realmente aconteceu - codificação contínua em escala de tempo que pode ser aprendida, estado latente ODE-RNN e delta_t como um recurso simples - e a ablação que decide entre eles.

  8. 08
    Um contexto de dia inteiro supera um contexto de dez minutos? Atenção Flash e a questão do comprimento da sequência
    Aug 4, 2026 #deep-learning

    Um contexto de dia inteiro supera um contexto de dez minutos? Atenção Flash e a questão do comprimento da sequência

    Flash Attention torna um contexto de negociação de 23.400 etapas computacionalmente livre - lado a lado, softmax online e um limite IO de N ^ 2 d ^ 2 / M. Se esse contexto mais longo torna o modelo melhor é uma questão separada e deve ser medida, não afirmada.

  9. 09
    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment
    Aug 11, 2026 #model-compression

    Knowledge Distillation: Compressing Trading Models for Low-Latency Deployment

    The blog's standing answer to the accuracy-vs-latency tension is a two-stage fast/slow split. Distillation is a different answer: train one small model to mimic the ensemble. The KD loss, temperature, born-again nets, early exits for a variable latency budget, and the distill-to-FPGA pipeline — plus the measurements that would decide whether it beats the two-stage split.

  10. 10
    Model Pruning for Low-Latency Trading Inference
    Aug 14, 2026 #model-compression

    Model Pruning for Low-Latency Trading Inference

    Magnitude and structured pruning, the Lottery Ticket Hypothesis, movement pruning, distillation and 2:4 sparsity — the methods behind shrinking a trading model, and what still has to be measured before any of it ships.

  11. 11
    Processos Gaussianos para Modelagem Não Paramétrica de Preços
    Aug 6, 2026 #bayesian

    Processos Gaussianos para Modelagem Não Paramétrica de Preços

    Projeto de kernel para séries temporais financeiras - rugosidade Matern, composição periódica local, misturas espectrais - e a probabilidade marginal como um regularizador que não precisa de conjunto de validação. Além da lista honesta do que ainda precisa ser medido antes que qualquer coisa seja negociável.

  12. 12
    Epistêmico vs Aleatório: Medindo o que um Modelo de Retorno Não Sabe
    Jul 31, 2026 #bayesian

    Epistêmico vs Aleatório: Medindo o que um Modelo de Retorno Não Sabe

    Todas as regras de dimensionamento de posição neste blog colapsam a incerteza em um escalar. MC Dropout e deep ensembles a dividem em ignorância do modelo e ruído de mercado — e esses dois merecem tamanhos de posição diferentes.

  13. 13
    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?
    Aug 16, 2026 #deep-learning

    Neural ODEs: Does Continuous Time Beat a Delta-Time Feature?

    Neural ODEs, Neural SDEs and continuous normalizing flows for irregularly-sampled market data — and the one ablation that decides whether continuous dynamics are worth their solver cost.

  14. 14
    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?
    Aug 8, 2026 #deep-learning

    Hamiltonian Neural Networks: Does a Financial System Conserve Anything?

    Hamiltonian Neural Networks are provably stable — but stability is worthless if the conserved quantity does not exist. Learning a scalar H via autograd, symplectic integration, and the falsification test that decides whether a financial (q, p) pair is canonical at all.

  15. 15
    Operador Neural de Fourier para Modelagem Financeira Baseada em PDE
    Aug 5, 2026 #deep-learning

    Operador Neural de Fourier para Modelagem Financeira Baseada em PDE

    O aprendizado do operador mapeia espaços funcionais inteiros, não pontos – como o Operador Neural de Fourier parametriza um operador de solução PDE no espaço de frequência, o que ele compra para o preço das opções e quais de suas reivindicações ainda precisam ser medidas em hardware real.