하루 종일 컨텍스트가 10분 컨텍스트보다 낫습니까? 플래시 어텐션과 시퀀스 길이 질문
Flash Attention은 타일링, 온라인 소프트맥스 및 N^2 d^2 / M의 IO 경계 등 23,400단계 거래 컨텍스트를 계산적으로 자유롭게 만듭니다. 긴 컨텍스트가 모델을 더 좋게 만드는지 여부는 별도의 질문이며 주장할 것이 아니라 측정해야 합니다.
Nothing found. Try a different query.
Flash Attention은 타일링, 온라인 소프트맥스 및 N^2 d^2 / M의 IO 경계 등 23,400단계 거래 컨텍스트를 계산적으로 자유롭게 만듭니다. 긴 컨텍스트가 모델을 더 좋게 만드는지 여부는 별도의 질문이며 주장할 것이 아니라 측정해야 합니다.
이 블로그에서 다루지 않은 앙상블 거래에 대한 세 가지 사항: 모델 개수가 아닌 공분산 항이 앙상블 오류를 지배하는 이유, 스택이 아웃 오브 폴드 메타 기능을 갖춘 신호 결합 레이어로 작동하는 방식, 여러 신호에 걸친 회전율 상쇄가 실제로 실행 비용을 줄이는지 여부입니다.
이 블로그의 모든 모델은 지금까지 '무엇이 무엇을 예측하는가?'라는 질문에 답했습니다. 더블 ML은 '무엇이 무엇을 원인하는가?'에 답합니다 — 방어할 수 있는 표준 오차와 함께. 부분 선형 모델, Neyman 직교성, 오더북 데이터에서의 제거된 교차 검증, 그리고 유효한 DML 신뢰 구간이 미리 지정된 하나의 질문에만 적용된다는 솔직한 설명.
이 블로그의 모든 백테스트는 조건부 평균을 추정합니다. 인과관계 포레스트는 대신 조건부 치료 효과를 추정합니다 — tau(x)가 mu(x) 대신 — honest splitting, 적응형 커널 가중치 표현, 그리고 당신이 발견한 이질성이 실제인지 말해주는 보정 테스트와 함께.
이 블로그의 모든 사이징 규칙은 불확실성을 단일 스칼라로 축소해왔다. MC 드롭아웃과 딥 앙상블은 이를 모델 무지와 시장 노이즈로 분할한다——그리고 그 둘은 서로 다른 포지션 크기를 필요로 한다.
자동 특성 생성(tsfresh, Featuretools), 예산을 고려한 모델 탐색(FLAML의 비용 절약 최적화기), WorldQuant 수식 알파 팩토리 — 이 블로그의 탐색 및 과적합 연재에서 다루지 않았던 연구 파이프라인의 구성 요소와 연재의 결과가 말해 주는 내용.
모든 레버리지 포지션은 반드시 매도되어야 하는 가격을 드러낸다. 온체인 청산 깊이 차트와 CEX 청산 히트맵을 구축하고, 연쇄 동역학을 재생산수로 모델링하며, 강제 흐름을 단순히 위험으로 두려워하는 대신 신호로 거래하는 방법을 살펴본다.