August 4, 2026
#deep-learning
一整天的内容能胜过十分钟的内容吗? Flash 注意力和序列长度问题
Flash Attention 使 23,400 步的交易上下文无需计算——平铺、在线 softmax 和 N^2 d^2 / M 的 IO 界限。更长的上下文是否使模型更好是一个单独的问题,它必须被测量,而不是断言。
#deep-learning#attention#Flash-Attention
阅读文章 →
Nothing found. Try a different query.
Flash Attention 使 23,400 步的交易上下文无需计算——平铺、在线 softmax 和 N^2 d^2 / M 的 IO 界限。更长的上下文是否使模型更好是一个单独的问题,它必须被测量,而不是断言。
本博客未涵盖有关交易集成的三件事:为什么协方差项(而不是模型计数)在集成误差中占主导地位,堆栈如何作为具有折叠元特征的信号组合层工作,以及跨多个信号的周转净额是否真正降低了执行成本。
本博客至今所有模型回答'什么预测什么'。Double ML 回答'什么导致什么'——带有可辩护的标准误。部分线性模型、Neyman 正交性、order book 数据上的清理交叉拟合,以及为何有效 DML 置信区间仅对一个预先指定的问题成立的诚实说明。
本博客每个回测估计条件平均值。因果森林估计条件处理效果 — tau(x) 而非 mu(x) — 具有诚实分裂、自适应核权重表示以及告诉您发现的异质性是否真实的校准测试。
本博客的每个 position sizing 规则都把不确定性坍缩成单一纯量。MC Dropout 和深度集成将其拆分为模型无知与市场噪声——这两者值得不同的 position size。
自动特征生成(tsfresh、Featuretools)、预算感知的模型搜索(FLAML 的节约成本优化器)以及 WorldQuant 公式化 alpha 工厂——这篇博客的搜索与过拟合系列尚未覆盖的研究流程部分,以及该系列自身结果对它们的启示。
Перевод статьи на zh