Eugen Soloviov

Eugen Soloviov

Trading-systems engineer

Trading-systems engineer building bots since 2017: cross-exchange arbitrage (connected up to 30 venues), cointegration-based pairs arbitrage across spot and futures, scalping, news and sentiment-driven strategies, trend algorithms, and portfolio management and balancing algorithms. Also builds sub-millisecond order execution, big-data warehouses, backtesting engines, AI agents, and trading interfaces (incl. open-source profitmaker.cc). Stack: JS/TS, Python, Rust/Zig/Go, DevOps, backend, frontend, architecture.

Articles

The Other Way a Regression Lies: Endogeneity, 2SLS, and the Gamma Calibration Problem

The Other Way a Regression Lies: Endogeneity, 2SLS, and the Gamma Calibration Problem

Selection bias in the search is not the only way a regression fools you. When the regressor is correlated with the error, more data makes the estimate more confidently wrong. Instrumental variables applied to the one endogeneity problem this blog has already left open: permanent impact from net taker flow.

Hawkes Processes for Order Arrival and Market Event Modeling

Hawkes Processes for Order Arrival and Market Event Modeling

Fitting a self-exciting point process to real crypto trade tape: where the three numbers (mu, alpha, beta) come from, how to estimate the branching ratio n, whether the exponential kernel survives a goodness-of-fit test, and how much n moves when you change the estimation window.

Hamiltonian Neural Networks: Does a Financial System Conserve Anything?

Hamiltonian Neural Networks: Does a Financial System Conserve Anything?

Hamiltonian Neural Networks are provably stable — but stability is worthless if the conserved quantity does not exist. Learning a scalar H via autograd, symplectic integration, and the falsification test that decides whether a financial (q, p) pair is canonical at all.

Toda-Yamamoto vs Differenced Granger: Does the BTC Lead-Lag Survive?

Toda-Yamamoto vs Differenced Granger: Does the BTC Lead-Lag Survive?

Granger causality on crypto prices done two ways — differenced returns and Toda-Yamamoto on levels — with a correct Wald implementation, an effective-N corrected causality matrix, and a rolling-stability test of whether the lag is tradeable at all.

Processus gaussiens pour la modélisation des prix non paramétriques

Processus gaussiens pour la modélisation des prix non paramétriques

Conception de noyau pour les séries temporelles financières — rugosité de Matern, composition localement périodique, mélanges spectraux — et vraisemblance marginale en tant que régulariseur qui ne nécessite aucun ensemble de validation. Plus la liste honnête de ce qui doit encore être mesuré avant que tout cela soit échangeable.

Opérateur neuronal de Fourier pour la modélisation financière basée sur la PDE

Opérateur neuronal de Fourier pour la modélisation financière basée sur la PDE

L'apprentissage des opérateurs cartographie des espaces de fonctions entiers, pas des points - comment l'opérateur neuronal de Fourier paramétre un opérateur de solution PDE dans l'espace de fréquence, ce qu'il achète pour la tarification des options et lesquelles de ses affirmations doivent encore être mesurées sur du matériel réel.

Un contexte d’une journée complète bat-il un contexte de dix minutes ? Attention flash et question de longueur de séquence

Un contexte d’une journée complète bat-il un contexte de dix minutes ? Attention flash et question de longueur de séquence

Flash Attention crée un contexte de trading de 23 400 étapes sans calcul : mosaïque, softmax en ligne et limite d'E/S de N^2 d^2 / M. La question de savoir si ce contexte plus long améliore le modèle est une question distincte, et elle doit être mesurée et non affirmée.

Méthodes d'ensemble : combiner des apprenants faibles pour une alpha robuste

Méthodes d'ensemble : combiner des apprenants faibles pour une alpha robuste

Trois choses sur les ensembles commerciaux que ce blog n'a pas abordées : pourquoi le terme de covariance (et non le nombre de modèles) domine l'erreur d'ensemble, comment l'empilement fonctionne comme une couche de combinaison de signaux avec des méta-fonctionnalités hors du champ de pli, et si la compensation du chiffre d'affaires sur de nombreux signaux réduit réellement le coût d'exécution.

Double Machine Learning : Estimer un Paramètre Causal au lieu de Prédire les Rendements

Double Machine Learning : Estimer un Paramètre Causal au lieu de Prédire les Rendements

Tous les modèles de ce blog répondent jusqu'à présent 'qu'est-ce qui prédit quoi ?'. Double ML répond 'qu'est-ce qui cause quoi ?' — avec une erreur standard que vous pouvez défendre. Le modèle partiellement linéaire, l'orthogonalité de Neyman, le cross-fitting purgé sur les données de carnet d'ordres et un compte rendu honnête de la raison pour laquelle un intervalle de confiance DML valide survit à exactement une question prédéfinie.

Forêts causales pour effets de traitement hétérogènes dans le trading

Forêts causales pour effets de traitement hétérogènes dans le trading

Chaque backtest sur ce blog estime une moyenne conditionnelle. Les forêts causales estiment un effet de traitement conditionnel à la place — tau(x) plutôt que mu(x) — avec un splitting honnête, une représentation de poids de noyau adaptatif et un test de calibration qui vous dit si l'hétérogénéité que vous avez trouvée est réelle.

Épistémique vs Aléatoire : Mesurer ce qu'un modèle de rendement ne sait pas

Épistémique vs Aléatoire : Mesurer ce qu'un modèle de rendement ne sait pas

Chaque règle de dimensionnement dans ce blog traite l'incertitude comme un seul nombre. MC Dropout et les deep ensembles la divisent en ignorance du modèle et bruit de marché — et les deux méritent des tailles de position différentes.

AutoML pour les pipelines de trading systématique

AutoML pour les pipelines de trading systématique

Génération automatisée de fonctionnalités (tsfresh, Featuretools), recherche de modèles tenant compte du budget (l'optimiseur économique de FLAML) et usine alpha de formules WorldQuant - les parties du pipeline de recherche que l'arc de recherche et de surajustement de ce blog n'a jamais couvertes, et ce que les propres résultats de l'arc en disent.