Brier score क्या है और इसका मूल्यांकन कैसे करें
Brier score किसी probability forecast की सटीकता मापने का एक तरीका है। इसमें कम स्कोर बेहतर होता है। शून्य दशमलव दो पांच का स्कोर पचास प्रतिशत संभावना बताने पर मिलता है।
10
Brier score किसी probability forecast का वास्तविक परिणामों के आधार पर मूल्यांकन करता है।
इसकी गणना करने के लिए, आपके द्वारा बताई गई probability में से परिणाम को घटाएं (यदि घटना घटी है तो एक, यदि नहीं घटी है तो शून्य)। इसके बाद उस अंतर का वर्ग करें। अंत में, आपके द्वारा किए गए सभी पूर्वानुमानों के वर्गों का औसत निकालें।
कम स्कोर बेहतर माना जाता है। शून्य का स्कोर एक सटीक रिकॉर्ड दर्शाता है, जबकि शून्य दशमलव दो पांच (0.25) का स्कोर तब मिलता है जब आप हर चीज़ के लिए पचास प्रतिशत की संभावना बताते हैं।
Brier score क्या है?
पूर्वानुमान संभावना के बारे में एक दावा होता है, और कोई एक संभावना अपने आप में कभी सही या गलत नहीं हो सकती। आपने किसी चीज़ के होने की संभावना तीस प्रतिशत बताई और वह हो गई। क्या आप गलत थे? अभी नहीं। ग्लेन ब्रियर ने उन्नीस सौ पचास में मौसम पूर्वानुमानकर्ताओं के लिए लिखते हुए, किसी एक पूर्वानुमान को ग्रेड देने से इनकार करके इस समस्या का समाधान निकाला। यह स्कोर पूरे लॉग को एक साथ ग्रेड देता है।
यहाँ दस पूर्वानुमानों का एक काल्पनिक लॉग दिया गया है। इनमें से कोई भी संख्या बाजार से नहीं ली गई है, इन्हें केवल अंकगणित समझाने के लिए बनाया गया है।
- नब्बे प्रतिशत बताया गया, घटना घटी। वर्ग त्रुटि शून्य दशमलव शून्य एक।
- अस्सी प्रतिशत बताया गया, घटी। शून्य दशमलव शून्य चार।
- सत्तर प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव चार नौ।
- साठ प्रतिशत बताया गया, घटी। शून्य दशमलव एक छह।
- पचास प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव दो पांच।
- चालीस प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव एक छह।
- तीस प्रतिशत बताया गया, घटी। शून्य दशमलव चार नौ।
- बीस प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव शून्य चार।
- दस प्रतिशत बताया गया, नहीं घटी। शून्य दशमलव शून्य एक।
- पचानवे प्रतिशत बताया गया, घटी। शून्य दशमलव शून्य शून्य दो पांच।
दस वर्ग त्रुटियों का योग एक दशमलव छह पांच दो पांच है। इसे दस से विभाजित करने पर Brier score शून्य दशमलव एक छह पांच आता है। यह पूरी गणना है, और यह python3 में चलती है जो किसी भी Mac या Linux मशीन पर पहले से उपलब्ध होता है। कुछ भी इंस्टॉल करने की आवश्यकता नहीं है, कोई लाइब्रेरी नहीं चाहिए।
rows = [(0.90, 1), (0.80, 1), (0.70, 0), (0.60, 1), (0.50, 0), (0.40, 0), (0.30, 1), (0.20, 0), (0.10, 0), (0.95, 1)]brier = sum((p - o) * (p - o) for p, o in rows) / len(rows)flat = sum((0.5 - o) * (0.5 - o) for _, o in rows) / len(rows)print(round(brier, 3), round(flat, 3))prints0.165 0.25
0.25 वह संख्या क्यों है जिसे पीछे छोड़ना है
मान लीजिए कि हर चीज़ के बारे में पचास प्रतिशत संभावना जताई जाती है और प्रत्येक गलत अनुमान का वर्ग 0.25 है, चाहे कुछ भी हो। यह निश्चित 0.25 किसी भी हां या ना वाले प्रश्नों के सेट के लिए बिना-जानकारी वाला बेंचमार्क है, और स्किल स्कोर इसे एक आंकड़े में बदल देता है: एक में से आपके स्कोर को बेंचमार्क के स्कोर से विभाजित करने पर प्राप्त परिणाम। 0.165 पर बनाया गया लॉग 0.34 का स्किल स्कोर देता है।
एक चेतावनी खराब स्कोर-कीपिंग के कई मामलों को खत्म कर देती है। यदि आप जिन घटनाओं का मूल्यांकन कर रहे हैं, वे केवल दस प्रतिशत समय ही घटित होती हैं, तो हर बार दस प्रतिशत का अनुमान लगाने पर 0.09 का स्कोर मिलता है, जबकि आपको व्यक्तिगत प्रश्नों के बारे में कुछ भी पता नहीं होता है। 0.25 से कम का स्कोर एकतरफा प्रश्नों के सेट पर कौशल का प्रमाण नहीं है। ईमानदार बेंचमार्क उन प्रश्नों की आधार दर है जिनका आपने वास्तव में उत्तर दिया है।
कैलिब्रेशन और कॉन्फिडेंस का संयुक्त मूल्यांकन
कैलिब्रेशन का अर्थ है कि आपने जिन भी घटनाओं के लिए सत्तर प्रतिशत संभावना बताई है, उनमें से लगभग सत्तर प्रतिशत घटनाएं वास्तव में घटित हों। कॉन्फिडेंस, जिसे सांख्यिकीविद रिज़ॉल्यूशन कहते हैं, यह दर्शाता है कि किसी जानकारी के आधार पर आप बेस रेट से कितना दूर जाने को तैयार हैं। एक पूर्वानुमानकर्ता जो हर प्रश्न पर पचास प्रतिशत की संभावना बताता है, वह पूरी तरह से कैलिब्रेटेड तो है लेकिन पूरी तरह से बेकार भी है। Brier score इन दोनों गुणों का एक साथ आकलन करता है: गलत कैलिब्रेशन स्कोर को बढ़ाता है, जबकि अर्जित कॉन्फिडेंस इसे कम करता है।
तैयार किए गए लॉग को बताई गई संभावना के अनुसार बकेट में बांटने से पता चलता है कि कैलिब्रेशन जांच कैसी दिखती है। पायथन में यह प्रति बकेट एक लाइन है, hits = [o for p, o in rows if p >= 0.8], और फिर hits का औसत।
- दस प्रतिशत से तीस प्रतिशत बताई गई, औसत बीस प्रतिशत: तीन में से एक घटना घटी, तैंतीस प्रतिशत।
- चालीस प्रतिशत से पचास प्रतिशत बताई गई, औसत पैंतालीस प्रतिशत: दो में से शून्य घटना घटी, शून्य प्रतिशत।
- साठ प्रतिशत से सत्तर प्रतिशत बताई गई, औसत पैंसठ प्रतिशत: दो में से एक घटना घटी, पचास प्रतिशत।
- अस्सी प्रतिशत से पचानवे प्रतिशत बताई गई, औसत अठासी प्रतिशत: तीन में से तीन घटनाएं घटीं, सौ प्रतिशत।
दस पूर्वानुमान उन बकेट से कुछ भी निष्कर्ष निकालने के लिए पर्याप्त नहीं हैं। कैलिब्रेशन के लिए प्रति बकेट सैकड़ों हल किए गए प्रश्नों की आवश्यकता होती है। इस पृष्ठ का शेष भाग लाखों पूर्वानुमानों वाले एक लॉग का उपयोग करता है।
बाजार के अपने पूर्वानुमान का मूल्यांकन
प्रत्येक लिस्टेड option में एक ऐसी संख्या होती है जो एक निर्धारित संभावना की तरह व्यवहार करती है। Delta यह मापता है कि अंतर्निहित शेयर में एक डॉलर के उतार-चढ़ाव पर option की कीमत में कितना बदलाव आता है। ऐसे कॉन्ट्रैक्ट के लिए जो या तो in the money (एक्सपायरी पर मूल्यवान) समाप्त होता है या बेकार, delta का निरपेक्ष मान (absolute value) उस बाजार-निहित संभावना के करीब होता है कि वह in the money समाप्त होगा। यह उसी सतह से आता है जो AAPL implied volatility को निर्धारित करती है। हर कॉन्ट्रैक्ट की एक्सपायरी होती है, इसलिए उन सभी पूर्वानुमानों का मूल्यांकन किया जाता है।
नीचे दिया गया पैनल जनवरी 2025 से मई 2026 तक, एक्सपायरी से लगभग एक महीने पहले देखे गए प्रत्येक SPY option को लेता है, उन्हें निर्धारित delta के आधार पर वर्गीकृत करता है, और यह गिनता है कि कॉन्ट्रैक्ट कितनी बार in the money समाप्त हुआ।
हर आंकड़े के पीछे का पूरा SQL
WITH settle AS
(
SELECT
date AS settle_date,
any(toFloat64(underlying_close)) AS settle_px
FROM global_markets.options_greeks
WHERE underlying_symbol = 'SPY'
AND date >= '2025-01-01'
AND date < '2026-08-01'
GROUP BY date
),
scored AS
(
SELECT
toUInt8(floor(abs(toFloat64(g.delta)) * 10)) AS bucket,
abs(toFloat64(g.delta)) AS stated,
startsWith(lower(toString(g.option_type)), 'c') AS is_call,
if(is_call,
s.settle_px > toFloat64(g.strike_price),
s.settle_px < toFloat64(g.strike_price)) AS finished_itm
FROM global_markets.options_greeks AS g
INNER JOIN settle AS s ON s.settle_date = g.expiration_date
WHERE g.underlying_symbol = 'SPY'
AND g.date >= '2025-01-01'
AND g.date < '2026-06-01'
AND g.expiration_date <= '2026-07-31'
AND g.days_to_expiry BETWEEN 28 AND 35
AND g.iv_converged = 1
AND g.volume > 0
AND abs(g.delta) > 0.02
AND abs(g.delta) < 0.98
)
SELECT
concat(toString(bucket * 10), ' to ', toString(bucket * 10 + 10), '%') AS stated_bucket,
round(avg(stated) * 100, 1) AS stated_pct,
round(avg(finished_itm) * 100, 1) AS finished_itm_pct,
count() AS sample_size
FROM scored
GROUP BY bucket
ORDER BY bucketदोनों श्रेणियों की एक-दूसरे से तुलना करें। सबसे निचले बकेट में बाजार ने औसतन 5.2% की संभावना बताई थी और वे कॉन्ट्रैक्ट 3.7% बार in the money समाप्त हुए। सबसे ऊंचे बकेट में, 94% की निर्धारित संभावना के साथ 96.5% कॉन्ट्रैक्ट in the money समाप्त हुए। सभी 10 बकेट में, वास्तविक आवृत्ति निर्धारित आवृत्ति के आसपास ही रहती है। एक कैलिब्रेशन टेबल का यही मुख्य कार्य है: यह एक एकल औसत के भीतर छिपाने के बजाय, बकेट-दर-बकेट, पूर्वानुमानकर्ता के कहे और वास्तविक परिणामों के बीच के अंतर को उजागर करती है।
क्या बाजार सिक्का उछालने (coin flip) से बेहतर प्रदर्शन करता है?
अब स्कोर की बात करते हैं। समान संरचना, कई जाने-माने नाम, प्रत्येक नाम का Brier score ठीक उन्हीं कॉन्ट्रैक्ट्स पर गणना किए गए 50% के फ्लैट बेसलाइन के बगल में रखा गया है।
हर आंकड़े के पीछे का पूरा SQL
WITH settle AS
(
SELECT
underlying_symbol AS sym,
date AS settle_date,
any(toFloat64(underlying_close)) AS settle_px
FROM global_markets.options_greeks
WHERE underlying_symbol IN ('SPY', 'AAPL', 'MSFT', 'NVDA', 'KO', 'TSLA')
AND date >= '2025-01-01'
AND date < '2026-08-01'
GROUP BY sym, settle_date
),
scored AS
(
SELECT
g.underlying_symbol AS symbol,
abs(toFloat64(g.delta)) AS stated,
startsWith(lower(toString(g.option_type)), 'c') AS is_call,
if(is_call,
s.settle_px > toFloat64(g.strike_price),
s.settle_px < toFloat64(g.strike_price)) AS finished_itm
FROM global_markets.options_greeks AS g
INNER JOIN settle AS s
ON s.sym = g.underlying_symbol AND s.settle_date = g.expiration_date
WHERE g.underlying_symbol IN ('SPY', 'AAPL', 'MSFT', 'NVDA', 'KO', 'TSLA')
AND g.date >= '2025-01-01'
AND g.date < '2026-06-01'
AND g.expiration_date <= '2026-07-31'
AND g.days_to_expiry BETWEEN 28 AND 35
AND g.iv_converged = 1
AND g.volume > 0
AND abs(g.delta) > 0.02
AND abs(g.delta) < 0.98
)
SELECT
symbol,
round(avg((stated - finished_itm) * (stated - finished_itm)), 4) AS market_brier,
round(avg((0.5 - finished_itm) * (0.5 - finished_itm)), 4) AS coin_flip_brier,
formatReadableQuantity(count()) AS graded_contracts
FROM scored
GROUP BY symbol
ORDER BY market_brierNVDA ने 28.54 thousand ग्रेडेड कॉन्ट्रैक्ट्स पर 0.1122 स्कोर किया, जबकि समान सेट पर फ्लैट बेसलाइन का स्कोर 0.25 रहा। 6 नामों में सबसे कमजोर, SPY, भी 0.1375 पर है। यहाँ ऑप्शंस कोई जादू नहीं हैं। Deep out of the money कॉन्ट्रैक्ट्स का डेल्टा 0.02 के करीब होता है और वे अधिकतर बेकार समाप्त हो जाते हैं, जिसका पूर्वानुमान लगाना आसान है, और यह सरलता संख्या में पहले से शामिल है। यही मुख्य कारण है कि केवल Brier score का उल्लेख करने से आपको लगभग कोई जानकारी नहीं मिलती है।
एक ही पूर्वानुमानकर्ता अलग-अलग प्रश्नों पर अलग-अलग स्कोर प्राप्त करता है
समान पद्धति को इस आधार पर विभाजित करें कि प्रश्न कितनी दूर भविष्य में हल होता है और उसके अंतर्गत स्कोर कैसे बदलता है।
हर आंकड़े के पीछे का पूरा SQL
WITH settle AS
(
SELECT
date AS settle_date,
any(toFloat64(underlying_close)) AS settle_px
FROM global_markets.options_greeks
WHERE underlying_symbol = 'SPY'
AND date >= '2025-01-01'
AND date < '2026-08-01'
GROUP BY date
),
scored AS
(
SELECT
multiIf(g.days_to_expiry <= 7, 1,
g.days_to_expiry <= 14, 2,
g.days_to_expiry <= 30, 3,
g.days_to_expiry <= 60, 4,
g.days_to_expiry <= 120, 5,
6) AS horizon_rank,
abs(toFloat64(g.delta)) AS stated,
startsWith(lower(toString(g.option_type)), 'c') AS is_call,
if(is_call,
s.settle_px > toFloat64(g.strike_price),
s.settle_px < toFloat64(g.strike_price)) AS finished_itm
FROM global_markets.options_greeks AS g
INNER JOIN settle AS s ON s.settle_date = g.expiration_date
WHERE g.underlying_symbol = 'SPY'
AND g.date >= '2025-01-01'
AND g.date < '2026-06-01'
AND g.expiration_date <= '2026-07-31'
AND g.days_to_expiry BETWEEN 1 AND 250
AND g.iv_converged = 1
AND g.volume > 0
AND abs(g.delta) > 0.02
AND abs(g.delta) < 0.98
)
SELECT
multiIf(horizon_rank = 1, '1 to 7 days',
horizon_rank = 2, '8 to 14 days',
horizon_rank = 3, '15 to 30 days',
horizon_rank = 4, '31 to 60 days',
horizon_rank = 5, '61 to 120 days',
'121 to 250 days') AS horizon,
round(avg((stated - finished_itm) * (stated - finished_itm)), 4) AS market_brier,
round(avg((0.5 - finished_itm) * (0.5 - finished_itm)), 4) AS coin_flip_brier,
count() AS sample_size
FROM scored
GROUP BY horizon_rank
ORDER BY horizon_rankबाजार के डेल्टा ने 0.1084 के साथ शेष 1 to 7 days वाले अनुबंधों पर और 0.1218 के साथ शेष 121 to 250 days वाले अनुबंधों पर स्कोर किया। एक ही पूर्वानुमानकर्ता, एक ही पद्धति, प्रश्नों के दो अलग-अलग सेट। पचास प्रतिशत का सपाट आधार पहली पंक्ति में 0.25 पर और अंतिम पंक्ति में 0.25 पर स्थित है, जो इसे हर समय-सीमा पर एकमात्र निश्चित संदर्भ बनाता है। दो पूर्वानुमानकर्ताओं के बीच किसी भी तुलना को समान समय-सीमा में समान प्रश्नों पर किया जाना चाहिए, अन्यथा यह कौशल के बजाय प्रश्नों की कठिनाई की तुलना होगी।
उचित स्कोरिंग नियमों का महत्व
Mean absolute error, जो आपकी संभावना और परिणाम के बीच के साधारण अंतर का औसत है, एक उचित विकल्प लग सकता है, लेकिन यह खराब ग्रेडिंग करता है। मान लीजिए कि आप वास्तव में मानते हैं कि किसी घटना के होने की संभावना सत्तर प्रतिशत है। यदि आप सत्तर प्रतिशत बताते हैं, तो आपकी अपेक्षित absolute error 0.7 x 0.3 + 0.3 x 0.7 = 0.42 होती है। इसके बजाय यदि आप सौ प्रतिशत बताते हैं, तो यह घटकर 0.7 x 0 + 0.3 x 1 = 0.30 हो जाती है। Absolute error के तहत ईमानदार होने पर आपको नुकसान होता है, और जो मीट्रिक आपको अधिक आत्मविश्वास दिखाने के लिए पुरस्कृत करता है, वह पूर्वानुमान का सही मापन नहीं है।
Brier score में ऐसी कोई कमी नहीं है। यदि आप सत्तर प्रतिशत मानते हैं और सत्तर प्रतिशत ही बताते हैं, तो आपका अपेक्षित स्कोर 0.21 होता है। यदि आप सौ प्रतिशत बताते हैं, तो यह बढ़कर 0.30 हो जाता है। यदि आप साठ प्रतिशत बताते हैं, तो यह बढ़कर 0.22 हो जाता है। न्यूनतम स्कोर ठीक उसी संख्या पर होता है जिसे आप मानते हैं। जिस नियम में यह गुण होता है उसे proper कहा जाता है, और यही कारण है कि Brier पूर्वानुमान प्रतियोगिताओं में डिफ़ॉल्ट बन गया है।
Log score दूसरा सामान्य proper नियम है: जो परिणाम हुआ, उस पर आपने जो संभावना निर्धारित की थी उसका natural log लें, फिर उसका चिह्न बदल दें। जो घटना हुई उस पर एक प्रतिशत बताने की लागत 4.6 है, और शून्य प्रतिशत बताने की लागत अनंत है। दस पूर्वानुमानों के काल्पनिक सेट पर, log score 0.483 आता है, जबकि फ्लैट बेसलाइन के लिए यह 0.693 है। Brier शून्य और एक के बीच रहता है, जिसे स्कोरकार्ड के रूप में पढ़ना अधिक स्वाभाविक है। Log score की कोई ऊपरी सीमा नहीं होती, जो ऐसी ग्रेडिंग के लिए उपयुक्त है जहाँ जोखिम चरम स्थितियों (tails) में होता है।
इवेंट कॉन्ट्रैक्ट्स के लिए इसका क्या अर्थ है
एक इवेंट कॉन्ट्रैक्ट जो किसी घटना के होने पर एक डॉलर और न होने पर शून्य डॉलर का भुगतान करता है, वह ऐसी कीमत पर ट्रेड होता है जो पहले से ही एक संभावना दर्शाती है। बासठ सेंट का अर्थ बासठ प्रतिशत का पूर्वानुमान है, जिसमें से स्प्रेड और शुल्क अभी घटाए नहीं गए हैं। संभावनाओं के रूप में इवेंट कॉन्ट्रैक्ट की कीमतें पर हमारी गाइड उस रूपांतरण को कवर करती है, और इवेंट कॉन्ट्रैक्ट्स का निपटान कैसे होता है यह बताती है कि कॉन्ट्रैक्ट के शब्दों में "यह घटित हुआ" का क्या अर्थ है।
वह कीमत एक सार्वजनिक ट्रैक रिकॉर्ड और निपटान तिथि वाला पूर्वानुमान है, जो इसे वह बेंचमार्क बनाता है जिसे आपके अपने लॉग को पार करना होगा। समान समय-सीमा में समान प्रश्नों पर अपने पूर्वानुमानों को स्कोर करें। जिस ट्रेडर का Brier score उस कीमत से अधिक आता है, उसका उस प्रश्न सेट पर कोई मापा गया लाभ (edge) नहीं है, चाहे ट्रेड के साथ जुड़ी कहानी कितनी भी अच्छी क्यों न हो। यही परीक्षण स्पोर्ट्स ऑड्स पर भी लागू होता है, जब आप सट्टेबाजी के ऑड्स से विग (vig) हटाते हैं, और रेट मार्केट्स पर भी, जहाँ Fed rate odds आपको ज्ञात समाधान दिवस वाले प्रश्न के लिए एक दिनांकित संभावना प्रदान करते हैं।
ये पैनल बाजार को कैसे ग्रेड करते हैं
डेल्टा प्रत्येक कॉन्ट्रैक्ट के लिए दैनिक options greeks रिकॉर्ड से आता है। केवल उन्हीं कॉन्ट्रैक्ट्स को शामिल किया जाता है जिनमें अवलोकन के दिन वॉल्यूम होता है और जिनकी वोलेटिलिटी का समाधान (converged volatility) निकल आता है। परिणाम को कॉन्ट्रैक्ट की समाप्ति तिथि पर अंतर्निहित (underlying) एसेट के क्लोजिंग भाव से पढ़ा जाता है: एक कॉल तब इन-द-मनी मानी जाती है जब वह क्लोजिंग भाव स्ट्राइक प्राइस से ऊपर होता है, और पुट तब जब वह नीचे होता है। वास्तविक निपटान क्लोजिंग के बाद एक एक्सरसाइज निर्णय के माध्यम से होता है, इसलिए स्ट्राइक के बहुत करीब (पेंस के अंतर पर) स्थित कॉन्ट्रैक्ट्स इस सरलीकरण के आधार पर निपट सकते हैं। इन पैनलों में प्रत्येक कॉन्ट्रैक्ट पहले ही समाप्त हो चुका है, और लंबी अवधि की बकेट अनिवार्य रूप से विंडो में पहले की अवलोकन तिथियों से ली गई हैं। अवलोकन तिथि और समाप्ति के बीच होने वाला शेयर स्प्लिट स्ट्राइक और निपटान मूल्य को अलग-अलग पैमानों पर रख देगा, जो एक और कारण है कि प्रत्येक बकेट में उसका सैंपल काउंट शामिल होता है।
डेल्टा वास्तविक दुनिया की संभावना के बजाय जोखिम-तटस्थ (risk-neutral) संभावना का अनुमान लगाता है। दोनों में अंतर ऑप्शन की कीमतों में निहित रिस्क प्रीमियम के कारण होता है, और एक कैलिब्रेशन टेबल वह उपकरण है जो इस अंतर को मान लेने के बजाय मापता है।
अक्सर पूछे जाने वाले प्रश्न (FAQ)
क्या कम Brier score बेहतर होता है?
हाँ। Brier score एक त्रुटि मापन (error measurement) है, इसलिए 0 एक सटीक रिकॉर्ड है और 1 सबसे खराब संभव स्कोर है, जो उन सभी घटनाओं पर 100% का अनुमान लगाने से मिलता है जो घटित नहीं हुईं। 0.25 से कम का कोई भी स्कोर उस स्कोर से बेहतर है जो आपको हर प्रश्न का 50% उत्तर देने पर मिलता।
एक अच्छा Brier score क्या है?
कोई भी सार्वभौमिक रूप से अच्छा अंक नहीं है, क्योंकि स्कोर इस बात पर निर्भर करता है कि प्रश्न कितने कठिन थे। कल की बारिश पर 0.10 का स्कोर पाने वाले मौसम पूर्वानुमानकर्ता और करीबी चुनावों पर 0.18 का स्कोर पाने वाले राजनीतिक पूर्वानुमानकर्ता की तुलना एक-दूसरे से नहीं की जा सकती। स्कोर की तुलना केवल उन पूर्वानुमानकर्ताओं के बीच करें जो समान समय सीमा में समान प्रश्नों का उत्तर दे रहे हों।
0.25 के Brier score का क्या अर्थ है?
यह उस पूर्वानुमानकर्ता का स्कोर है जो हर चीज के लिए 50% कहता है, क्योंकि परिणाम चाहे जो भी हो, प्रत्येक वर्ग त्रुटि (squared miss) 0.25 होती है। यह हाँ या ना वाले प्रश्नों के सेट के लिए मानक 'नो-इन्फॉर्मेशन' बेंचमार्क है, हालांकि एकतरफा प्रश्नों के सेट के लिए आधार दर (base rate) को बेंचमार्क के रूप में उपयोग करना आवश्यक होता है।
Brier score, log score से किस प्रकार भिन्न है?
दोनों ही उचित स्कोरिंग नियम हैं, जिसका अर्थ है कि प्रत्येक को तब न्यूनतम किया जाता है जब आप वह संभावना बताते हैं जिस पर आप वास्तव में विश्वास करते हैं। Brier त्रुटि का वर्ग करता है और 0 से 1 के बीच रहता है। Log score आत्मविश्वासी गलतियों को कहीं अधिक कठोरता से दंडित करता है, और किसी ऐसी घटना पर 0% बताना जो घटित हो जाती है, उसकी लागत अनंत होती है।
क्या option delta को संभावना के रूप में पढ़ा जा सकता है?
delta का निरपेक्ष मान (absolute value) बाजार की उस निहित संभावना (implied probability) के करीब होता है कि option 'in the money' समाप्त होगा, और यह वास्तविक दुनिया की संभावना के बजाय एक जोखिम-तटस्थ (risk-neutral) संभावना है। ऊपर दिए गए पैनल इसे एक पूर्वानुमान के रूप में ग्रेड देते हैं: एक अक्ष पर बताया गया delta, और दूसरे पर उन अनुबंधों का हिस्सा जो वास्तव में 'in the money' समाप्त हुए।
यहाँ प्रत्येक पैनल उसके नीचे दिए गए सटीक SQL के साथ आता है, इसलिए ग्रेडिंग की पंक्ति-दर-पंक्ति ऑडिट की जा सकती है। समान प्रश्नों पर बाजार के मुकाबले अपने स्वयं के पूर्वानुमान लॉग को स्कोर करने के लिए, Strasmore टर्मिनल पर सादे अंग्रेजी में संख्याओं के लिए पूछें।