← All Collections
10 parts

High-Performance Backtest Engines

How to build a backtest engine that runs hundreds of times faster without changing a single PnL number — data layout, caching, adaptive resolution, and architecture, from first speedups to production internals.

  1. 01
    बैकटेस्ट स्पीड लैडर: लैपटॉप CPU पर 298x, आखिरी ट्रेड तक समान PnL
    Jun 26, 2026 #algotrading

    बैकटेस्ट स्पीड लैडर: लैपटॉप CPU पर 298x, आखिरी ट्रेड तक समान PnL

    एक ही 80-कॉम्बो पैरामीटर स्वीप के पांच इम्प्लीमेंटेशन, सभी identical PnL देने के लिए वेरिफाई किए गए: pandas rolling.apply में 69.9 सेकंड लगते हैं, numpy में 3.1, numba में 2.0, parallel numba में 0.23 — Apple M2 Max पर बिना किसी हार्डवेयर बदलाव के मापा गया 298x स्पीडअप, और एक सक्षम vectorized बेसलाइन के मुकाबले भी अब भी ~13x। हर पायदान क्या देता है, GPU गायब कड़ी क्यों नहीं है, और मास पैरामीटर सर्च में असली बॉटलनेक कहां है।

  2. 02
    फ्रेमवर्क टैक्स: जब आपकी बैकटेस्ट लाइब्रेरी एक भोले pandas लूप से भी धीमी होती है
    Jul 2, 2026 #एल्गोट्रेडिंग

    फ्रेमवर्क टैक्स: जब आपकी बैकटेस्ट लाइब्रेरी एक भोले pandas लूप से भी धीमी होती है

    हमने आठ बैकटेस्ट इंजनों को एक ही समान पैरामीटर स्वीप पर बेंचमार्क किया — 150k बार, 80 HMA-क्रॉस संयोजन, ट्रेड-गिनती की पैरिटी 2707 पर लॉक। दो सबसे लोकप्रिय इवेंट-ड्रिवन फ्रेमवर्क हाथ से लिखे pandas लूप से भी धीमे निकले, जबकि एक वेक्टराइज़्ड/कंपाइल्ड इंजन ने वही काम लगभग 13,000× तेज़ी से चलाया। उस प्रति-बार ओवरहेड का अध्ययन जिसे लोकप्रिय लाइब्रेरियाँ कभी अमॉर्टाइज़ करने के लिए बनी ही नहीं थीं।

  3. 03
    एग्रीगेटेड पार्क्वेट कैश: मल्टी-टाइमफ्रेम बैकटेस्ट को सैकड़ों गुना तेज़ कैसे करें
    Mar 16, 2026 #algotrading

    एग्रीगेटेड पार्क्वेट कैश: मल्टी-टाइमफ्रेम बैकटेस्ट को सैकड़ों गुना तेज़ कैसे करें

    मिनट कैंडल से टाइमफ्रेम और इंडिकेटर पहले से कैसे गणना करें, उन्हें parquet में सेव करें और बिना दोहराई गणनाओं के रणनीतियों के बड़े पैमाने पर परीक्षण के लिए उपयोग करें।

  4. 04
    दो-अक्षीय पैरामीटर स्पेस: आपके स्वीप का ज्यादातर हिस्सा लगभग मुफ्त क्यों होना चाहिए
    Jul 3, 2026 #एल्गो ट्रेडिंग

    दो-अक्षीय पैरामीटर स्पेस: आपके स्वीप का ज्यादातर हिस्सा लगभग मुफ्त क्यों होना चाहिए

    सभी पैरामीटर खोजने में एक जैसे महंगे नहीं होते। स्ट्रैटेजी के पैरामीटर दो अक्षों में बंट जाते हैं: महंगा अक्ष (इंडिकेटर — पूरी सीरीज पर दोबारा गणना) और सस्ता अक्ष (डिसीजन थ्रेशोल्ड — पहले से गणना किए गए सिग्नलों पर एक O(n) पास)। चूंकि इंडिकेटर थ्रेशोल्ड से अपरिवर्तित रहते हैं, आप उन्हें एक बार गणना करके हजारों थ्रेशोल्ड कॉन्फिग ~5,600 cfg/s की रफ्तार से स्वीप कर सकते हैं — हर कॉन्फिग पर दोबारा गणना करने से करीब 1,600 गुना सस्ता। यह डाइमेंशनैलिटी के अभिशाप की कीमत का पुनर्मूल्यांकन है।

  5. 05
    एडैप्टिव ड्रिल-डाउन: मिनट से लेकर रॉ ट्रेड्स तक वेरिएबल ग्रैन्युलैरिटी के साथ बैकटेस्ट
    Mar 17, 2026 #algotrading

    एडैप्टिव ड्रिल-डाउन: मिनट से लेकर रॉ ट्रेड्स तक वेरिएबल ग्रैन्युलैरिटी के साथ बैकटेस्ट

    एडैप्टिव डेटा ग्रैन्युलैरिटी बैकटेस्ट को कैसे तेज़ करती है और स्टोरेज कैसे बचाती है: 1m से 1s, 100ms, और रॉ ट्रेड्स तक ड्रिल-डाउन केवल वहीं जहाँ कीमत में उल्लेखनीय बदलाव हुआ हो या वॉल्यूम में उछाल आया हो, पूरी ऐतिहासिक सीरीज़ में नहीं।

  6. 06
    फिडेलिटी गेट: कोर्स-टू-फाइन बैकटेस्टिंग आपको और तेज़ी से बेवकूफ बनाती है, जब तक कि सस्ता प्रॉक्सी वैसे ही रैंक न करे जैसे महंगा वाला करता है
    Jul 5, 2026 #एल्गोट्रेडिंग

    फिडेलिटी गेट: कोर्स-टू-फाइन बैकटेस्टिंग आपको और तेज़ी से बेवकूफ बनाती है, जब तक कि सस्ता प्रॉक्सी वैसे ही रैंक न करे जैसे महंगा वाला करता है

    ड्रिल-डाउन / मल्टी-फिडेलिटी सर्च (ASHA, successive halving, Hyperband) हज़ारों कॉन्फ़िग्स को सस्ते में स्क्रीन करती है और केवल बचे हुए (survivors) को महंगे फुल इवैल्यूएशन के लिए आगे बढ़ाती है। यह एक असली स्पीडअप है — लेकिन अगर लो-फिडेलिटी रैंकिंग हाई-फिडेलिटी रैंकिंग से असहमत हो, तो यह चुपचाप ध्वस्त हो जाती है। हमने फोल्ड-रैंक कोरिलेशन को मापा: एक फोल्ड पर Spearman ρ 0.03 तक हो सकता है (लगभग रैंडम रैंकिंग), और जैसे-जैसे फोल्ड्स बढ़ते हैं यह 0.43, 0.67, 0.78, 0.91 तक चढ़ता जाता है। इसका समाधान एक अनिवार्य गेट है — पहले ρ(cheap, full) मापें, और न्यूनतम फिडेलिटी को ऑटोमैटिक रूप से उस पहले रंग (rung) तक बढ़ा दें जहाँ ρ ≥ 0.5 हो।

  7. 07
    रैंडम बनाम स्मार्ट सर्च: क्रॉसओवर इवैल कॉस्ट से तय होता है, एल्गोरिदम से नहीं
    Jul 4, 2026 #एल्गो ट्रेडिंग

    रैंडम बनाम स्मार्ट सर्च: क्रॉसओवर इवैल कॉस्ट से तय होता है, एल्गोरिदम से नहीं

    जब एक बैकटेस्ट सस्ता होता है, तो डम्ब स्क्रैम्बल्ड Sobol रॉ थ्रूपुट पर जीत जाता है — स्मार्ट सैंपलर (TPE, CMA-ES, ASHA) एक Python ask/tell टैक्स चुकाते हैं जो उन्हें 20x धीमा कर देता है, इसलिए बराबर वॉल-क्लॉक में वे बहुत कम पॉइंट्स इवैल्यूएट करते हैं और हार जाते हैं। हर eval को महंगा बनाइए (multi-TF + walk-forward folds) और क्रॉसओवर पलट जाता है। हमने दोनों रीजीम मापे, और क्यों fold-rank fidelity (ρ@1 का 0.03→0.43 तक बढ़ना) pruning के फायदेमंद होने की पूर्वशर्त है।

  8. 08
    GPU प्रिसिजन ट्रैप: Apple Metal पर fp32 बैकटेस्ट चुपचाप गार्बेज नतीजे कैसे देता है
    Jul 6, 2026 #एल्गोट्रेडिंग

    GPU प्रिसिजन ट्रैप: Apple Metal पर fp32 बैकटेस्ट चुपचाप गार्बेज नतीजे कैसे देता है

    Apple के Metal GPU में float64 होता ही नहीं। किसी vectorized बैकटेस्ट को उस पर भोलेपन से पोर्ट कर दीजिए, और वह लुभावना prefix-sum WMA fp32 में overflow कर जाता है — अधिकतम relative error 211× — फिर भी वह चलता रहता है और plausible दिखने वाले नंबर लौटाता है। इसका फिक्स ज्यादा precision नहीं है; यह एक अलग formulation है: एक direct windowed convolution, जो fp32 में 8×10⁻⁷ तक सुरक्षित है और single-thread numba से 55.9× तेज है। यह लेख इसी ट्रैप, उसके पीछे के arithmetic, और यह साबित करने के तरीके पर है कि आप खुद उसमें फंसे तो नहीं।

  9. 09
    GPU कब अपनी कीमत वसूलता है: पैरामीटर-स्वीप की roofline, जहाँ सुर्खियों वाला 167x असल में 27x एल्गोरिदम गुणा 6.2x हार्डवेयर है
    Jul 7, 2026 #algotrading

    GPU कब अपनी कीमत वसूलता है: पैरामीटर-स्वीप की roofline, जहाँ सुर्खियों वाला 167x असल में 27x एल्गोरिदम गुणा 6.2x हार्डवेयर है

    CPU पर GPU की बढ़त batch size के साथ बढ़ती है — हमारे मल्टी-टाइमफ्रेम इंडिकेटर precompute पर प्रति कॉल एक combo पर 54.5x से लेकर 61 पर 359.6x तक — क्योंकि छोटा स्वीप kernel-launch और transfer overhead की भरपाई नहीं कर पाता। हम सुर्खियों वाले 167x को 27x की एल्गोरिदमिक जीत (जो CPU को भी उतना ही तेज़ करती है) गुणा 6.2x की हार्डवेयर जीत में तोड़ते हैं, दिखाते हैं कि GPU बनाम सर्वश्रेष्ठ-CPU की असली बढ़त सिंगल-टाइमफ्रेम पर सिर्फ़ 3.2x और मल्टी पर 6.2x है, और एक निर्णय-गाइड देते हैं कि GPU खरीदने लायक बनने से पहले स्वीप कितना चौड़ा होना चाहिए।

  10. 10
    IPC टैक्स: बैकटेस्ट इंजन को सॉकेट के पीछे रखें और 13% गंवाएं — जिसमें से लगभग कुछ भी सॉकेट की वजह से नहीं
    Jun 30, 2026 #algotrading

    IPC टैक्स: बैकटेस्ट इंजन को सॉकेट के पीछे रखें और 13% गंवाएं — जिसमें से लगभग कुछ भी सॉकेट की वजह से नहीं

    हमने एक numba बैकटेस्ट कर्नेल को लाइन-दर-लाइन Rust में पोर्ट किया और उसे एक प्रोसेस बाउंड्री के पार चार तरीकों से कॉल किया, एक इक्विवैलेंस गेट के साथ जो अंतिम ट्रेड तक समान PnL की पुष्टि करता है। पूरी 1.2 MB प्राइस सीरीज़ को Unix सॉकेट के जरिए भेजने में ~2 ms लगते हैं — जॉब का लगभग 0.1%। उसी पेलोड को JSON-एनकोड करने में रॉ बाइट्स से 1348 गुना ज्यादा लागत आती है, प्रति-कॉम्बो chatty कॉल्स डेटा को 80 बार दोबारा भेजते हैं, और प्रति-बार कॉल पैटर्न 2.0 सेकंड के जॉब पर 2.1 सेकंड शुद्ध IPC खर्च करेगा। बाउंड्री सस्ती है; टैक्स इस बात में है कि आप उसे कैसे पार करते हैं।