Strasmore Research
सीखें Matt Connorलेखक: Matt Connor

Brier score क्या है और इसका मूल्यांकन कैसे करें

Brier score किसी probability forecast की सटीकता मापने का एक तरीका है। इसमें कम स्कोर बेहतर होता है। शून्य दशमलव दो पांच का स्कोर पचास प्रतिशत संभावना बताने पर मिलता है।

10
Brier score किसी probability forecast का वास्तविक परिणामों के आधार पर मूल्यांकन करता है।

इसकी गणना करने के लिए, आपके द्वारा बताई गई probability में से परिणाम को घटाएं (यदि घटना घटी है तो एक, यदि नहीं घटी है तो शून्य)। इसके बाद उस अंतर का वर्ग करें। अंत में, आपके द्वारा किए गए सभी पूर्वानुमानों के वर्गों का औसत निकालें।

कम स्कोर बेहतर माना जाता है। शून्य का स्कोर एक सटीक रिकॉर्ड दर्शाता है, जबकि शून्य दशमलव दो पांच (0.25) का स्कोर तब मिलता है जब आप हर चीज़ के लिए पचास प्रतिशत की संभावना बताते हैं।

Brier score क्या है?

पूर्वानुमान संभावना के बारे में एक दावा होता है, और कोई एक संभावना अपने आप में कभी सही या गलत नहीं हो सकती। आपने किसी चीज़ के होने की संभावना तीस प्रतिशत बताई और वह हो गई। क्या आप गलत थे? अभी नहीं। ग्लेन ब्रियर ने उन्नीस सौ पचास में मौसम पूर्वानुमानकर्ताओं के लिए लिखते हुए, किसी एक पूर्वानुमान को ग्रेड देने से इनकार करके इस समस्या का समाधान निकाला। यह स्कोर पूरे लॉग को एक साथ ग्रेड देता है।

यहाँ दस पूर्वानुमानों का एक काल्पनिक लॉग दिया गया है। इनमें से कोई भी संख्या बाजार से नहीं ली गई है, इन्हें केवल अंकगणित समझाने के लिए बनाया गया है।

  • नब्बे प्रतिशत बताया गया, घटना घटी। वर्ग त्रुटि शून्य दशमलव शून्य एक।
  • अस्सी प्रतिशत बताया गया, घटी। शून्य दशमलव शून्य चार।
  • सत्तर प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव चार नौ।
  • साठ प्रतिशत बताया गया, घटी। शून्य दशमलव एक छह।
  • पचास प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव दो पांच।
  • चालीस प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव एक छह।
  • तीस प्रतिशत बताया गया, घटी। शून्य दशमलव चार नौ।
  • बीस प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव शून्य चार।
  • दस प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव शून्य एक।
  • पचानवे प्रतिशत बताया गया, घटी। शून्य दशमलव शून्य शून्य दो पांच।

दस वर्ग त्रुटियों का योग एक दशमलव छह पांच दो पांच है। इसे दस से विभाजित करने पर Brier score शून्य दशमलव एक छह पांच आता है। यह पूरी गणना है, और यह python3 में चलती है जो किसी भी Mac या Linux मशीन पर पहले से उपलब्ध होता है। कुछ भी इंस्टॉल करने की आवश्यकता नहीं है, कोई लाइब्रेरी नहीं चाहिए।

  • rows = [(0.90, 1), (0.80, 1), (0.70, 0), (0.60, 1), (0.50, 0), (0.40, 0), (0.30, 1), (0.20, 0), (0.10, 0), (0.95, 1)]
  • brier = sum((p - o) * (p - o) for p, o in rows) / len(rows)
  • flat = sum((0.5 - o) * (0.5 - o) for _, o in rows) / len(rows)
  • print(round(brier, 3), round(flat, 3)) prints 0.165 0.25

0.25 वह संख्या क्यों है जिसे पीछे छोड़ना है

मान लीजिए कि हर चीज़ के बारे में पचास प्रतिशत संभावना जताई जाती है और प्रत्येक गलत अनुमान का वर्ग 0.25 है, चाहे कुछ भी हो। यह निश्चित 0.25 किसी भी हां या ना वाले प्रश्नों के सेट के लिए बिना-जानकारी वाला बेंचमार्क है, और स्किल स्कोर इसे एक आंकड़े में बदल देता है: एक में से आपके स्कोर को बेंचमार्क के स्कोर से विभाजित करने पर प्राप्त परिणाम। 0.165 पर बनाया गया लॉग 0.34 का स्किल स्कोर देता है।

एक चेतावनी खराब स्कोर-कीपिंग के कई मामलों को खत्म कर देती है। यदि आप जिन घटनाओं का मूल्यांकन कर रहे हैं, वे केवल दस प्रतिशत समय ही घटित होती हैं, तो हर बार दस प्रतिशत का अनुमान लगाने पर 0.09 का स्कोर मिलता है, जबकि आपको व्यक्तिगत प्रश्नों के बारे में कुछ भी पता नहीं होता है। 0.25 से कम का स्कोर एकतरफा प्रश्नों के सेट पर कौशल का प्रमाण नहीं है। ईमानदार बेंचमार्क उन प्रश्नों की आधार दर है जिनका आपने वास्तव में उत्तर दिया है।

कैलिब्रेशन और कॉन्फिडेंस का संयुक्त मूल्यांकन

कैलिब्रेशन का अर्थ है कि आपने जिन भी घटनाओं के लिए सत्तर प्रतिशत संभावना बताई है, उनमें से लगभग सत्तर प्रतिशत घटनाएं वास्तव में घटित हों। कॉन्फिडेंस, जिसे सांख्यिकीविद रिज़ॉल्यूशन कहते हैं, यह दर्शाता है कि किसी जानकारी के आधार पर आप बेस रेट से कितना दूर जाने को तैयार हैं। एक पूर्वानुमानकर्ता जो हर प्रश्न पर पचास प्रतिशत की संभावना बताता है, वह पूरी तरह से कैलिब्रेटेड तो है लेकिन पूरी तरह से बेकार भी है। Brier score इन दोनों गुणों का एक साथ आकलन करता है: गलत कैलिब्रेशन स्कोर को बढ़ाता है, जबकि अर्जित कॉन्फिडेंस इसे कम करता है।

तैयार किए गए लॉग को बताई गई संभावना के अनुसार बकेट में बांटने से पता चलता है कि कैलिब्रेशन जांच कैसी दिखती है। पायथन में यह प्रति बकेट एक लाइन है, hits = [o for p, o in rows if p >= 0.8], और फिर hits का औसत।

  • दस प्रतिशत से तीस प्रतिशत बताई गई, औसत बीस प्रतिशत: तीन में से एक घटना घटी, तैंतीस प्रतिशत।
  • चालीस प्रतिशत से पचास प्रतिशत बताई गई, औसत पैंतालीस प्रतिशत: दो में से शून्य घटना घटी, शून्य प्रतिशत।
  • साठ प्रतिशत से सत्तर प्रतिशत बताई गई, औसत पैंसठ प्रतिशत: दो में से एक घटना घटी, पचास प्रतिशत।
  • अस्सी प्रतिशत से पचानवे प्रतिशत बताई गई, औसत अठासी प्रतिशत: तीन में से तीन घटनाएं घटीं, सौ प्रतिशत।

दस पूर्वानुमान उन बकेट से कुछ भी निष्कर्ष निकालने के लिए पर्याप्त नहीं हैं। कैलिब्रेशन के लिए प्रति बकेट सैकड़ों हल किए गए प्रश्नों की आवश्यकता होती है। इस पृष्ठ का शेष भाग लाखों पूर्वानुमानों वाले एक लॉग का उपयोग करता है।

बाजार के अपने पूर्वानुमान का मूल्यांकन

प्रत्येक लिस्टेड option में एक ऐसी संख्या होती है जो एक निर्धारित संभावना की तरह व्यवहार करती है। Delta यह मापता है कि अंतर्निहित शेयर में एक डॉलर के उतार-चढ़ाव पर option की कीमत में कितना बदलाव आता है। ऐसे कॉन्ट्रैक्ट के लिए जो या तो in the money (एक्सपायरी पर मूल्यवान) समाप्त होता है या बेकार, delta का निरपेक्ष मान (absolute value) उस बाजार-निहित संभावना के करीब होता है कि वह in the money समाप्त होगा। यह उसी सतह से आता है जो AAPL implied volatility को निर्धारित करती है। हर कॉन्ट्रैक्ट की एक्सपायरी होती है, इसलिए उन सभी पूर्वानुमानों का मूल्यांकन किया जाता है।

नीचे दिया गया पैनल जनवरी 2025 से मई 2026 तक, एक्सपायरी से लगभग एक महीने पहले देखे गए प्रत्येक SPY option को लेता है, उन्हें निर्धारित delta के आधार पर वर्गीकृत करता है, और यह गिनता है कि कॉन्ट्रैक्ट कितनी बार in the money समाप्त हुआ।

क्वेरीSPY विकल्प डेल्टा बनाम उन अनुबंधों के इन-द-मनी समाप्त होने की आवृत्ति
हर आंकड़े के पीछे का पूरा SQL
WITH settle AS
(
    SELECT
        date                             AS settle_date,
        any(toFloat64(underlying_close)) AS settle_px
    FROM global_markets.options_greeks
    WHERE underlying_symbol = 'SPY'
      AND date >= '2025-01-01'
      AND date <  '2026-08-01'
    GROUP BY date
),
scored AS
(
    SELECT
        toUInt8(floor(abs(toFloat64(g.delta)) * 10))    AS bucket,
        abs(toFloat64(g.delta))                         AS stated,
        startsWith(lower(toString(g.option_type)), 'c') AS is_call,
        if(is_call,
           s.settle_px > toFloat64(g.strike_price),
           s.settle_px < toFloat64(g.strike_price))     AS finished_itm
    FROM global_markets.options_greeks AS g
    INNER JOIN settle AS s ON s.settle_date = g.expiration_date
    WHERE g.underlying_symbol = 'SPY'
      AND g.date >= '2025-01-01'
      AND g.date <  '2026-06-01'
      AND g.expiration_date <= '2026-07-31'
      AND g.days_to_expiry BETWEEN 28 AND 35
      AND g.iv_converged = 1
      AND g.volume > 0
      AND abs(g.delta) > 0.02
      AND abs(g.delta) < 0.98
)
SELECT
    concat(toString(bucket * 10), ' to ', toString(bucket * 10 + 10), '%') AS stated_bucket,
    round(avg(stated) * 100, 1)       AS stated_pct,
    round(avg(finished_itm) * 100, 1) AS finished_itm_pct,
    count()                           AS sample_size
FROM scored
GROUP BY bucket
ORDER BY bucket
Run this yourself

दोनों श्रेणियों की एक-दूसरे से तुलना करें। सबसे निचले बकेट में बाजार ने औसतन 5.2% की संभावना बताई थी और वे कॉन्ट्रैक्ट 3.7% बार in the money समाप्त हुए। सबसे ऊंचे बकेट में, 94% की निर्धारित संभावना के साथ 96.5% कॉन्ट्रैक्ट in the money समाप्त हुए। सभी 10 बकेट में, वास्तविक आवृत्ति निर्धारित आवृत्ति के आसपास ही रहती है। एक कैलिब्रेशन टेबल का यही मुख्य कार्य है: यह एक एकल औसत के भीतर छिपाने के बजाय, बकेट-दर-बकेट, पूर्वानुमानकर्ता के कहे और वास्तविक परिणामों के बीच के अंतर को उजागर करती है।

क्या बाजार सिक्का उछालने (coin flip) से बेहतर प्रदर्शन करता है?

अब स्कोर की बात करते हैं। समान संरचना, कई जाने-माने नाम, प्रत्येक नाम का Brier score ठीक उन्हीं कॉन्ट्रैक्ट्स पर गणना किए गए 50% के फ्लैट बेसलाइन के बगल में रखा गया है।

क्वेरीअंतर्निहित परिसंपत्ति के अनुसार बाजार की घोषित संभावना का Brier स्कोर
हर आंकड़े के पीछे का पूरा SQL
WITH settle AS
(
    SELECT
        underlying_symbol                AS sym,
        date                             AS settle_date,
        any(toFloat64(underlying_close)) AS settle_px
    FROM global_markets.options_greeks
    WHERE underlying_symbol IN ('SPY', 'AAPL', 'MSFT', 'NVDA', 'KO', 'TSLA')
      AND date >= '2025-01-01'
      AND date <  '2026-08-01'
    GROUP BY sym, settle_date
),
scored AS
(
    SELECT
        g.underlying_symbol                             AS symbol,
        abs(toFloat64(g.delta))                         AS stated,
        startsWith(lower(toString(g.option_type)), 'c') AS is_call,
        if(is_call,
           s.settle_px > toFloat64(g.strike_price),
           s.settle_px < toFloat64(g.strike_price))     AS finished_itm
    FROM global_markets.options_greeks AS g
    INNER JOIN settle AS s
        ON s.sym = g.underlying_symbol AND s.settle_date = g.expiration_date
    WHERE g.underlying_symbol IN ('SPY', 'AAPL', 'MSFT', 'NVDA', 'KO', 'TSLA')
      AND g.date >= '2025-01-01'
      AND g.date <  '2026-06-01'
      AND g.expiration_date <= '2026-07-31'
      AND g.days_to_expiry BETWEEN 28 AND 35
      AND g.iv_converged = 1
      AND g.volume > 0
      AND abs(g.delta) > 0.02
      AND abs(g.delta) < 0.98
)
SELECT
    symbol,
    round(avg((stated - finished_itm) * (stated - finished_itm)), 4) AS market_brier,
    round(avg((0.5 - finished_itm) * (0.5 - finished_itm)), 4)       AS coin_flip_brier,
    formatReadableQuantity(count())                                  AS graded_contracts
FROM scored
GROUP BY symbol
ORDER BY market_brier
Run this yourself

NVDA ने 28.54 thousand ग्रेडेड कॉन्ट्रैक्ट्स पर 0.1122 स्कोर किया, जबकि समान सेट पर फ्लैट बेसलाइन का स्कोर 0.25 रहा। 6 नामों में सबसे कमजोर, SPY, भी 0.1375 पर है। यहाँ ऑप्शंस कोई जादू नहीं हैं। Deep out of the money कॉन्ट्रैक्ट्स का डेल्टा 0.02 के करीब होता है और वे अधिकतर बेकार समाप्त हो जाते हैं, जिसका पूर्वानुमान लगाना आसान है, और यह सरलता संख्या में पहले से शामिल है। यही मुख्य कारण है कि केवल Brier score का उल्लेख करने से आपको लगभग कोई जानकारी नहीं मिलती है।

एक ही पूर्वानुमानकर्ता अलग-अलग प्रश्नों पर अलग-अलग स्कोर प्राप्त करता है

समान पद्धति को इस आधार पर विभाजित करें कि प्रश्न कितनी दूर भविष्य में हल होता है और उसके अंतर्गत स्कोर कैसे बदलता है।

क्वेरीसमाप्ति क्षितिज के आधार पर बाजार का Brier स्कोर, SPY
हर आंकड़े के पीछे का पूरा SQL
WITH settle AS
(
    SELECT
        date                             AS settle_date,
        any(toFloat64(underlying_close)) AS settle_px
    FROM global_markets.options_greeks
    WHERE underlying_symbol = 'SPY'
      AND date >= '2025-01-01'
      AND date <  '2026-08-01'
    GROUP BY date
),
scored AS
(
    SELECT
        multiIf(g.days_to_expiry <=   7, 1,
                g.days_to_expiry <=  14, 2,
                g.days_to_expiry <=  30, 3,
                g.days_to_expiry <=  60, 4,
                g.days_to_expiry <= 120, 5,
                6)                                      AS horizon_rank,
        abs(toFloat64(g.delta))                         AS stated,
        startsWith(lower(toString(g.option_type)), 'c') AS is_call,
        if(is_call,
           s.settle_px > toFloat64(g.strike_price),
           s.settle_px < toFloat64(g.strike_price))     AS finished_itm
    FROM global_markets.options_greeks AS g
    INNER JOIN settle AS s ON s.settle_date = g.expiration_date
    WHERE g.underlying_symbol = 'SPY'
      AND g.date >= '2025-01-01'
      AND g.date <  '2026-06-01'
      AND g.expiration_date <= '2026-07-31'
      AND g.days_to_expiry BETWEEN 1 AND 250
      AND g.iv_converged = 1
      AND g.volume > 0
      AND abs(g.delta) > 0.02
      AND abs(g.delta) < 0.98
)
SELECT
    multiIf(horizon_rank = 1, '1 to 7 days',
            horizon_rank = 2, '8 to 14 days',
            horizon_rank = 3, '15 to 30 days',
            horizon_rank = 4, '31 to 60 days',
            horizon_rank = 5, '61 to 120 days',
            '121 to 250 days')                                       AS horizon,
    round(avg((stated - finished_itm) * (stated - finished_itm)), 4) AS market_brier,
    round(avg((0.5 - finished_itm) * (0.5 - finished_itm)), 4)       AS coin_flip_brier,
    count()                                                          AS sample_size
FROM scored
GROUP BY horizon_rank
ORDER BY horizon_rank
Run this yourself

बाजार के डेल्टा ने 0.1084 के साथ शेष 1 to 7 days वाले अनुबंधों पर और 0.1218 के साथ शेष 121 to 250 days वाले अनुबंधों पर स्कोर किया। एक ही पूर्वानुमानकर्ता, एक ही पद्धति, प्रश्नों के दो अलग-अलग सेट। पचास प्रतिशत का सपाट आधार पहली पंक्ति में 0.25 पर और अंतिम पंक्ति में 0.25 पर स्थित है, जो इसे हर समय-सीमा पर एकमात्र निश्चित संदर्भ बनाता है। दो पूर्वानुमानकर्ताओं के बीच किसी भी तुलना को समान समय-सीमा में समान प्रश्नों पर किया जाना चाहिए, अन्यथा यह कौशल के बजाय प्रश्नों की कठिनाई की तुलना होगी।

उचित स्कोरिंग नियमों का महत्व

Mean absolute error, जो आपकी संभावना और परिणाम के बीच के साधारण अंतर का औसत है, एक उचित विकल्प लग सकता है, लेकिन यह खराब ग्रेडिंग करता है। मान लीजिए कि आप वास्तव में मानते हैं कि किसी घटना के होने की संभावना सत्तर प्रतिशत है। यदि आप सत्तर प्रतिशत बताते हैं, तो आपकी अपेक्षित absolute error 0.7 x 0.3 + 0.3 x 0.7 = 0.42 होती है। इसके बजाय यदि आप सौ प्रतिशत बताते हैं, तो यह घटकर 0.7 x 0 + 0.3 x 1 = 0.30 हो जाती है। Absolute error के तहत ईमानदार होने पर आपको नुकसान होता है, और जो मीट्रिक आपको अधिक आत्मविश्वास दिखाने के लिए पुरस्कृत करता है, वह पूर्वानुमान का सही मापन नहीं है।

Brier score में ऐसी कोई कमी नहीं है। यदि आप सत्तर प्रतिशत मानते हैं और सत्तर प्रतिशत ही बताते हैं, तो आपका अपेक्षित स्कोर 0.21 होता है। यदि आप सौ प्रतिशत बताते हैं, तो यह बढ़कर 0.30 हो जाता है। यदि आप साठ प्रतिशत बताते हैं, तो यह बढ़कर 0.22 हो जाता है। न्यूनतम स्कोर ठीक उसी संख्या पर होता है जिसे आप मानते हैं। जिस नियम में यह गुण होता है उसे proper कहा जाता है, और यही कारण है कि Brier पूर्वानुमान प्रतियोगिताओं में डिफ़ॉल्ट बन गया है।

Log score दूसरा सामान्य proper नियम है: जो परिणाम हुआ, उस पर आपने जो संभावना निर्धारित की थी उसका natural log लें, फिर उसका चिह्न बदल दें। जो घटना हुई उस पर एक प्रतिशत बताने की लागत 4.6 है, और शून्य प्रतिशत बताने की लागत अनंत है। दस पूर्वानुमानों के काल्पनिक सेट पर, log score 0.483 आता है, जबकि फ्लैट बेसलाइन के लिए यह 0.693 है। Brier शून्य और एक के बीच रहता है, जिसे स्कोरकार्ड के रूप में पढ़ना अधिक स्वाभाविक है। Log score की कोई ऊपरी सीमा नहीं होती, जो ऐसी ग्रेडिंग के लिए उपयुक्त है जहाँ जोखिम चरम स्थितियों (tails) में होता है।

इवेंट कॉन्ट्रैक्ट्स के लिए इसका क्या अर्थ है

एक इवेंट कॉन्ट्रैक्ट जो किसी घटना के होने पर एक डॉलर और न होने पर शून्य डॉलर का भुगतान करता है, वह ऐसी कीमत पर ट्रेड होता है जो पहले से ही एक संभावना दर्शाती है। बासठ सेंट का अर्थ बासठ प्रतिशत का पूर्वानुमान है, जिसमें से स्प्रेड और शुल्क अभी घटाए नहीं गए हैं। संभावनाओं के रूप में इवेंट कॉन्ट्रैक्ट की कीमतें पर हमारी गाइड उस रूपांतरण को कवर करती है, और इवेंट कॉन्ट्रैक्ट्स का निपटान कैसे होता है यह बताती है कि कॉन्ट्रैक्ट के शब्दों में "यह घटित हुआ" का क्या अर्थ है।

वह कीमत एक सार्वजनिक ट्रैक रिकॉर्ड और निपटान तिथि वाला पूर्वानुमान है, जो इसे वह बेंचमार्क बनाता है जिसे आपके अपने लॉग को पार करना होगा। समान समय-सीमा में समान प्रश्नों पर अपने पूर्वानुमानों को स्कोर करें। जिस ट्रेडर का Brier score उस कीमत से अधिक आता है, उसका उस प्रश्न सेट पर कोई मापा गया लाभ (edge) नहीं है, चाहे ट्रेड के साथ जुड़ी कहानी कितनी भी अच्छी क्यों न हो। यही परीक्षण स्पोर्ट्स ऑड्स पर भी लागू होता है, जब आप सट्टेबाजी के ऑड्स से विग (vig) हटाते हैं, और रेट मार्केट्स पर भी, जहाँ Fed rate odds आपको ज्ञात समाधान दिवस वाले प्रश्न के लिए एक दिनांकित संभावना प्रदान करते हैं।

ये पैनल बाजार को कैसे ग्रेड करते हैं

डेल्टा प्रत्येक कॉन्ट्रैक्ट के लिए दैनिक options greeks रिकॉर्ड से आता है। केवल उन्हीं कॉन्ट्रैक्ट्स को शामिल किया जाता है जिनमें अवलोकन के दिन वॉल्यूम होता है और जिनकी वोलेटिलिटी का समाधान (converged volatility) निकल आता है। परिणाम को कॉन्ट्रैक्ट की समाप्ति तिथि पर अंतर्निहित (underlying) एसेट के क्लोजिंग भाव से पढ़ा जाता है: एक कॉल तब इन-द-मनी मानी जाती है जब वह क्लोजिंग भाव स्ट्राइक प्राइस से ऊपर होता है, और पुट तब जब वह नीचे होता है। वास्तविक निपटान क्लोजिंग के बाद एक एक्सरसाइज निर्णय के माध्यम से होता है, इसलिए स्ट्राइक के बहुत करीब (पेंस के अंतर पर) स्थित कॉन्ट्रैक्ट्स इस सरलीकरण के आधार पर निपट सकते हैं। इन पैनलों में प्रत्येक कॉन्ट्रैक्ट पहले ही समाप्त हो चुका है, और लंबी अवधि की बकेट अनिवार्य रूप से विंडो में पहले की अवलोकन तिथियों से ली गई हैं। अवलोकन तिथि और समाप्ति के बीच होने वाला शेयर स्प्लिट स्ट्राइक और निपटान मूल्य को अलग-अलग पैमानों पर रख देगा, जो एक और कारण है कि प्रत्येक बकेट में उसका सैंपल काउंट शामिल होता है।

डेल्टा वास्तविक दुनिया की संभावना के बजाय जोखिम-तटस्थ (risk-neutral) संभावना का अनुमान लगाता है। दोनों में अंतर ऑप्शन की कीमतों में निहित रिस्क प्रीमियम के कारण होता है, और एक कैलिब्रेशन टेबल वह उपकरण है जो इस अंतर को मान लेने के बजाय मापता है।

अक्सर पूछे जाने वाले प्रश्न (FAQ)

क्या कम Brier score बेहतर होता है?

हाँ। Brier score एक त्रुटि मापन (error measurement) है, इसलिए 0 एक सटीक रिकॉर्ड है और 1 सबसे खराब संभव स्कोर है, जो उन सभी घटनाओं पर 100% का अनुमान लगाने से मिलता है जो घटित नहीं हुईं। 0.25 से कम का कोई भी स्कोर उस स्कोर से बेहतर है जो आपको हर प्रश्न का 50% उत्तर देने पर मिलता।

एक अच्छा Brier score क्या है?

कोई भी सार्वभौमिक रूप से अच्छा अंक नहीं है, क्योंकि स्कोर इस बात पर निर्भर करता है कि प्रश्न कितने कठिन थे। कल की बारिश पर 0.10 का स्कोर पाने वाले मौसम पूर्वानुमानकर्ता और करीबी चुनावों पर 0.18 का स्कोर पाने वाले राजनीतिक पूर्वानुमानकर्ता की तुलना एक-दूसरे से नहीं की जा सकती। स्कोर की तुलना केवल उन पूर्वानुमानकर्ताओं के बीच करें जो समान समय सीमा में समान प्रश्नों का उत्तर दे रहे हों।

0.25 के Brier score का क्या अर्थ है?

यह उस पूर्वानुमानकर्ता का स्कोर है जो हर चीज के लिए 50% कहता है, क्योंकि परिणाम चाहे जो भी हो, प्रत्येक वर्ग त्रुटि (squared miss) 0.25 होती है। यह हाँ या ना वाले प्रश्नों के सेट के लिए मानक 'नो-इन्फॉर्मेशन' बेंचमार्क है, हालांकि एकतरफा प्रश्नों के सेट के लिए आधार दर (base rate) को बेंचमार्क के रूप में उपयोग करना आवश्यक होता है।

Brier score, log score से किस प्रकार भिन्न है?

दोनों ही उचित स्कोरिंग नियम हैं, जिसका अर्थ है कि प्रत्येक को तब न्यूनतम किया जाता है जब आप वह संभावना बताते हैं जिस पर आप वास्तव में विश्वास करते हैं। Brier त्रुटि का वर्ग करता है और 0 से 1 के बीच रहता है। Log score आत्मविश्वासी गलतियों को कहीं अधिक कठोरता से दंडित करता है, और किसी ऐसी घटना पर 0% बताना जो घटित हो जाती है, उसकी लागत अनंत होती है।

क्या option delta को संभावना के रूप में पढ़ा जा सकता है?

delta का निरपेक्ष मान (absolute value) बाजार की उस निहित संभावना (implied probability) के करीब होता है कि option 'in the money' समाप्त होगा, और यह वास्तविक दुनिया की संभावना के बजाय एक जोखिम-तटस्थ (risk-neutral) संभावना है। ऊपर दिए गए पैनल इसे एक पूर्वानुमान के रूप में ग्रेड देते हैं: एक अक्ष पर बताया गया delta, और दूसरे पर उन अनुबंधों का हिस्सा जो वास्तव में 'in the money' समाप्त हुए।


यहाँ प्रत्येक पैनल उसके नीचे दिए गए सटीक SQL के साथ आता है, इसलिए ग्रेडिंग की पंक्ति-दर-पंक्ति ऑडिट की जा सकती है। समान प्रश्नों पर बाजार के मुकाबले अपने स्वयं के पूर्वानुमान लॉग को स्कोर करने के लिए, Strasmore टर्मिनल पर सादे अंग्रेजी में संख्याओं के लिए पूछें।

#prediction markets#forecasting#brier score#calibration#event contracts