Strasmore Research
آموزش Matt Connorتوسط Matt Connor

امتیاز برایر چیست و چگونه پیش‌بینی‌ها را ارزیابی می‌کند؟

امتیاز برایر معیاری برای سنجش دقت پیش‌بینی‌های احتمالی است. این شاخص میانگین مجذور خطا را محاسبه می‌کند که در آن عدد کمتر نشان‌دهنده دقت بالاتر و 0.25 نتیجه حدس پنجاه درصد است.

امتیاز برایر (Brier score) معیاری برای ارزیابی دقت پیش‌بینی‌های احتمالی در مقایسه با نتایج واقعی است. برای محاسبه آن، ابتدا احتمال اعلام‌شده را از نتیجه نهایی (عدد 1 در صورت وقوع رویداد و عدد 0 در صورت عدم وقوع) کسر کنید. سپس حاصل این تفاضل را به توان دو برسانید. در نهایت، میانگین این مقادیر مجذور را برای تمامی پیش‌بینی‌های انجام‌شده محاسبه کنید. در این شاخص، عدد کمتر نشان‌دهنده دقت بالاتر است؛ امتیاز 0 نشان‌دهنده پیش‌بینی بی‌نقص است و امتیاز 0.25 نتیجه‌ای است که با اختصاص احتمال «50 درصد» به تمامی رویدادها حاصل می‌شود.

امتیاز برایر (Brier score) چیست؟

پیش‌بینی، ادعایی درباره احتمال وقوع یک رویداد است و یک احتمال به‌تنهایی هرگز نمی‌تواند درست یا غلط باشد. شما احتمال وقوع چیزی را 30 درصد اعلام کردید و آن اتفاق رخ داد. آیا پیش‌بینی شما غلط بود؟ هنوز نه. گلن برایر در سال 1950، با نگارش مقاله‌ای برای پیش‌بینی‌کنندگان وضعیت آب‌وهوا، با امتناع از نمره‌دهی به هر پیش‌بینی منفرد، این مشکل را حل کرد. این امتیاز، کل گزارش پیش‌بینی‌ها را به‌صورت یکجا ارزیابی می‌کند.

در اینجا یک گزارش فرضی از ده پیش‌بینی آورده شده است. هیچ‌یک از این اعداد از بازار استخراج نشده‌اند و صرفاً برای نمایش محاسبات ابداع شده‌اند.

  • 90 درصد اعلام شد، رویداد رخ داد. خطای مجذور 0.01.
  • 80 درصد اعلام شد، رخ داد. 0.04.
  • 70 درصد اعلام شد، رخ نداد. 0.49.
  • 60 درصد اعلام شد، رخ داد. 0.16.
  • 50 درصد اعلام شد، رخ نداد. 0.25.
  • 40 درصد اعلام شد، رخ نداد. 0.16.
  • 30 درصد اعلام شد، رخ داد. 0.49.
  • 20 درصد اعلام شد، رخ نداد. 0.04.
  • 10 درصد اعلام شد، رخ نداد. 0.01.
  • 95 درصد اعلام شد، رخ داد. 0.0025.

مجموع ده خطای مجذور برابر با 1.6525 است. با تقسیم بر ده، امتیاز برایر برابر با 0.165 به دست می‌آید. این کل محاسبات است و در پایتون 3 که به‌صورت پیش‌فرض روی هر دستگاه مک یا لینوکس نصب است، اجرا می‌شود. نیازی به نصب هیچ‌چیز نیست و هیچ کتابخانه‌ای لازم ندارد.

  • rows = [(0.90, 1), (0.80, 1), (0.70, 0), (0.60, 1), (0.50, 0), (0.40, 0), (0.30, 1), (0.20, 0), (0.10, 0), (0.95, 1)]
  • brier = sum((p - o) * (p - o) for p, o in rows) / len(rows)
  • flat = sum((0.5 - o) * (0.5 - o) for _, o in rows) / len(rows)
  • print(round(brier, 3), round(flat, 3)) prints 0.165 0.25

چرا 0.25 عددی است که باید از آن پیشی گرفت

فرض کنید برای هر پرسش، احتمال 50 درصد را در نظر بگیرید؛ در این صورت، فارغ از نتیجه، هر خطای مجذور شده برابر با 0.25 خواهد بود. این عدد ثابت 0.25، معیار «عدم‌اطلاعات» برای هر مجموعه از پرسش‌های بله/خیر است و «امتیاز مهارت» آن را به یک رقم واحد تبدیل می‌کند: یک منهای حاصل‌تقسیم امتیاز شما بر امتیاز معیار. لگاریتم فرضی در سطح 0.165، به امتیاز مهارت 0.34 منجر می‌شود.

یک نکته احتیاطی، بسیاری از روش‌های نادرست امتیازدهی را بی‌اعتبار می‌کند. اگر رویدادهایی که در حال ارزیابی آن‌ها هستید تنها در 10 درصد مواقع رخ می‌دهند، اعلام نرخ ثابت 10 درصد برای هر مورد، امتیازی معادل 0.09 به دست می‌دهد، بدون آنکه کوچک‌ترین دانشی درباره پرسش‌های فردی وجود داشته باشد. امتیازی کمتر از 0.25، گواهی بر مهارت در مجموعه‌ای از پرسش‌های نامتوازن نیست. معیار صادقانه، نرخ پایه پرسش‌هایی است که واقعاً به آن‌ها پاسخ داده‌اید.

کالیبراسیون و اطمینان با هم ارزیابی می‌شوند

کالیبراسیون به این معناست که از میان تمام مواردی که 70 درصد احتمال وقوع برای آن‌ها قائل شده‌اید، نزدیک به 70 درصد آن‌ها واقعاً رخ دهند. اطمینان، که متخصصان آمار آن را «تفکیک» (resolution) می‌نامند، میزان فاصله‌ای است که هنگام داشتن اطلاعات، مایلید از نرخ پایه (base rate) بگیرید. پیش‌بینی‌کننده‌ای که به هر پرسش پاسخ 50 درصد می‌دهد، کاملاً کالیبره است اما هیچ کاربردی ندارد. امتیاز Brier هر دو ویژگی را هم‌زمان قیمت‌گذاری می‌کند: عدم کالیبراسیون امتیاز را افزایش می‌دهد و اطمینانِ کسب‌شده (earned confidence) آن را کاهش می‌دهد.

دسته‌بندی گزارش‌های ساختگی بر اساس احتمال اعلام‌شده، نشان می‌دهد که بررسی کالیبراسیون چگونه انجام می‌شود. در پایتون، این کار برای هر دسته یک خط کد است، hits = [o for p, o in rows if p >= 0.8]، و سپس میانگین hits.

  • 10 تا 30 درصد اعلام‌شده، میانگین 20 درصد: 1 مورد از 3 مورد رخ داد، 33 درصد.
  • 40 تا 50 درصد اعلام‌شده، میانگین 45 درصد: 0 مورد از 2 مورد رخ داد، 0 درصد.
  • 60 تا 70 درصد اعلام‌شده، میانگین 65 درصد: 1 مورد از 2 مورد رخ داد، 50 درصد.
  • 80 تا 95 درصد اعلام‌شده، میانگین 88 درصد: 3 مورد از 3 مورد رخ داد، 100 درصد.

ده پیش‌بینی برای استخراج هیچ نتیجه‌ای از این دسته‌ها کافی نیست. کالیبراسیون نیازمند صدها پرسشِ تعیین‌تکلیف‌شده در هر دسته است. باقی این صفحه از گزارش پیش‌بینی‌هایی استفاده می‌کند که شامل میلیون‌ها مورد از این پرسش‌هاست.

ارزیابی پیش‌بینی بازار

هر اختیار معامله فهرست‌شده، عددی را با خود حمل می‌کند که مانند یک احتمال بیان‌شده عمل می‌کند. دلتا (Delta) نشان می‌دهد که قیمت اختیار معامله به ازای هر یک دلار تغییر در قیمت سهم پایه، چقدر تغییر می‌کند. برای قراردادی که یا در وضعیت سودده (in the money) منقضی می‌شود (و در زمان سررسید ارزشی دارد) یا بی‌ارزش می‌شود، قدر مطلق دلتا به احتمال ضمنی بازار برای سودده شدن آن قرارداد نزدیک است. این عدد از همان سطحی استخراج می‌شود که نوسان ضمنی AAPL را تعیین می‌کند. هر قرارداد سررسیدی دارد، بنابراین تمام این پیش‌بینی‌ها ارزیابی می‌شوند.

جدول زیر تمام اختیارهای معامله SPY را که تقریباً یک ماه پیش از سررسید مشاهده شده‌اند، از ژانویه 2025 تا مه 2026 در نظر می‌گیرد، آن‌ها را بر اساس دلتای اعلام‌شده دسته‌بندی می‌کند و می‌شمارد که هر قرارداد چند بار در وضعیت سودده منقضی شده است.

پرس‌وجودلتاهای اختیار معامله SPY در مقایسه با نرخ تحقق سود (In-the-money) قراردادها
کد دقیق SQL پشت هر عدد
WITH settle AS
(
    SELECT
        date                             AS settle_date,
        any(toFloat64(underlying_close)) AS settle_px
    FROM global_markets.options_greeks
    WHERE underlying_symbol = 'SPY'
      AND date >= '2025-01-01'
      AND date <  '2026-08-01'
    GROUP BY date
),
scored AS
(
    SELECT
        toUInt8(floor(abs(toFloat64(g.delta)) * 10))    AS bucket,
        abs(toFloat64(g.delta))                         AS stated,
        startsWith(lower(toString(g.option_type)), 'c') AS is_call,
        if(is_call,
           s.settle_px > toFloat64(g.strike_price),
           s.settle_px < toFloat64(g.strike_price))     AS finished_itm
    FROM global_markets.options_greeks AS g
    INNER JOIN settle AS s ON s.settle_date = g.expiration_date
    WHERE g.underlying_symbol = 'SPY'
      AND g.date >= '2025-01-01'
      AND g.date <  '2026-06-01'
      AND g.expiration_date <= '2026-07-31'
      AND g.days_to_expiry BETWEEN 28 AND 35
      AND g.iv_converged = 1
      AND g.volume > 0
      AND abs(g.delta) > 0.02
      AND abs(g.delta) < 0.98
)
SELECT
    concat(toString(bucket * 10), ' to ', toString(bucket * 10 + 10), '%') AS stated_bucket,
    round(avg(stated) * 100, 1)       AS stated_pct,
    round(avg(finished_itm) * 100, 1) AS finished_itm_pct,
    count()                           AS sample_size
FROM scored
GROUP BY bucket
ORDER BY bucket
Run this yourself

این دو سری داده را در تقابل با یکدیگر بخوانید. در پایین‌ترین دسته، بازار به‌طور میانگین احتمالی معادل 5.2% را اعلام کرد و آن قراردادها در 3.7% از موارد در وضعیت سودده منقضی شدند. در بالاترین دسته، دلتای اعلام‌شده 94% با نرخ تحقق 96.5% در وضعیت سودده همراه بود. در تمامی 10 دسته، فراوانی تحقق‌یافته در محدوده‌ای مشابه با مقدار اعلام‌شده قرار دارد. این تمام کارکرد یک جدول کالیبراسیون است: این جدول شکاف میان آنچه پیش‌بینی‌کننده می‌گوید و آنچه در واقعیت رخ می‌دهد را به تفکیک هر دسته نمایان می‌کند، به‌جای آنکه آن را در یک میانگین کلی پنهان سازد.

آیا بازار از شیر یا خط پیشی می‌گیرد؟

اکنون به سراغ امتیازها می‌رویم. با همان ساختار، چندین نام شناخته‌شده را بررسی می‌کنیم که امتیاز Brier هر کدام در کنار خط مبنای 50 درصدیِ ثابت، که دقیقاً بر اساس همان قراردادها محاسبه شده، قرار گرفته است.

پرس‌وجوامتیاز بریر (Brier score) برای احتمال اعلامی بازار، به تفکیک دارایی پایه
کد دقیق SQL پشت هر عدد
WITH settle AS
(
    SELECT
        underlying_symbol                AS sym,
        date                             AS settle_date,
        any(toFloat64(underlying_close)) AS settle_px
    FROM global_markets.options_greeks
    WHERE underlying_symbol IN ('SPY', 'AAPL', 'MSFT', 'NVDA', 'KO', 'TSLA')
      AND date >= '2025-01-01'
      AND date <  '2026-08-01'
    GROUP BY sym, settle_date
),
scored AS
(
    SELECT
        g.underlying_symbol                             AS symbol,
        abs(toFloat64(g.delta))                         AS stated,
        startsWith(lower(toString(g.option_type)), 'c') AS is_call,
        if(is_call,
           s.settle_px > toFloat64(g.strike_price),
           s.settle_px < toFloat64(g.strike_price))     AS finished_itm
    FROM global_markets.options_greeks AS g
    INNER JOIN settle AS s
        ON s.sym = g.underlying_symbol AND s.settle_date = g.expiration_date
    WHERE g.underlying_symbol IN ('SPY', 'AAPL', 'MSFT', 'NVDA', 'KO', 'TSLA')
      AND g.date >= '2025-01-01'
      AND g.date <  '2026-06-01'
      AND g.expiration_date <= '2026-07-31'
      AND g.days_to_expiry BETWEEN 28 AND 35
      AND g.iv_converged = 1
      AND g.volume > 0
      AND abs(g.delta) > 0.02
      AND abs(g.delta) < 0.98
)
SELECT
    symbol,
    round(avg((stated - finished_itm) * (stated - finished_itm)), 4) AS market_brier,
    round(avg((0.5 - finished_itm) * (0.5 - finished_itm)), 4)       AS coin_flip_brier,
    formatReadableQuantity(count())                                  AS graded_contracts
FROM scored
GROUP BY symbol
ORDER BY market_brier
Run this yourself

امتیاز NVDA برابر با 0.1122 در 28.54 thousand قرارداد ارزیابی‌شده است، در حالی که خط مبنای ثابت در همان مجموعه مشابه، امتیاز 0.25 را ثبت کرده است. ضعیف‌ترینِ این 6 نام، یعنی SPY، همچنان در سطح 0.1375 قرار می‌گیرد. در اینجا، اختیارها جادو نمی‌کنند. قراردادهای Deep out of the money دارای دلتایی نزدیک به 0.02 هستند و عمدتاً بدون ارزش منقضی می‌شوند؛ پیش‌بینی این موضوع ساده است و همین سهولت در عدد نهایی لحاظ شده است. این اصلی‌ترین دلیلی است که امتیاز Brier به‌تنهایی تقریباً هیچ اطلاعاتی به شما نمی‌دهد.

یک پیش‌بینی‌کننده واحد در پرسش‌های مختلف، امتیازات متفاوتی کسب می‌کند

روش یکسان را بر اساس فاصله زمانی تا زمان تعیین تکلیف پرسش تفکیک کنید؛ امتیازات تحت این متغیر تغییر می‌کنند.

پرس‌وجوامتیاز بریر بازار در افق‌های زمانی انقضا، SPY
کد دقیق SQL پشت هر عدد
WITH settle AS
(
    SELECT
        date                             AS settle_date,
        any(toFloat64(underlying_close)) AS settle_px
    FROM global_markets.options_greeks
    WHERE underlying_symbol = 'SPY'
      AND date >= '2025-01-01'
      AND date <  '2026-08-01'
    GROUP BY date
),
scored AS
(
    SELECT
        multiIf(g.days_to_expiry <=   7, 1,
                g.days_to_expiry <=  14, 2,
                g.days_to_expiry <=  30, 3,
                g.days_to_expiry <=  60, 4,
                g.days_to_expiry <= 120, 5,
                6)                                      AS horizon_rank,
        abs(toFloat64(g.delta))                         AS stated,
        startsWith(lower(toString(g.option_type)), 'c') AS is_call,
        if(is_call,
           s.settle_px > toFloat64(g.strike_price),
           s.settle_px < toFloat64(g.strike_price))     AS finished_itm
    FROM global_markets.options_greeks AS g
    INNER JOIN settle AS s ON s.settle_date = g.expiration_date
    WHERE g.underlying_symbol = 'SPY'
      AND g.date >= '2025-01-01'
      AND g.date <  '2026-06-01'
      AND g.expiration_date <= '2026-07-31'
      AND g.days_to_expiry BETWEEN 1 AND 250
      AND g.iv_converged = 1
      AND g.volume > 0
      AND abs(g.delta) > 0.02
      AND abs(g.delta) < 0.98
)
SELECT
    multiIf(horizon_rank = 1, '1 to 7 days',
            horizon_rank = 2, '8 to 14 days',
            horizon_rank = 3, '15 to 30 days',
            horizon_rank = 4, '31 to 60 days',
            horizon_rank = 5, '61 to 120 days',
            '121 to 250 days')                                       AS horizon,
    round(avg((stated - finished_itm) * (stated - finished_itm)), 4) AS market_brier,
    round(avg((0.5 - finished_itm) * (0.5 - finished_itm)), 4)       AS coin_flip_brier,
    count()                                                          AS sample_size
FROM scored
GROUP BY horizon_rank
ORDER BY horizon_rank
Run this yourself

دلتا (delta) بازار در قراردادهایی که 0.1084 تا سررسید آن‌ها باقی مانده بود، امتیاز 1 to 7 days و در قراردادهایی که 0.1218 تا سررسید آن‌ها باقی مانده بود، امتیاز 121 to 250 days را کسب کرد. پیش‌بینی‌کننده یکسان، روش یکسان، اما دو مجموعه پرسش متفاوت. خط مبنای ثابت 50 درصد در ردیف اول روی 0.25 و در ردیف آخر روی 0.25 قرار دارد که آن را به تنها مرجع ثابت در تمامی افق‌های زمانی تبدیل می‌کند. هرگونه مقایسه میان دو پیش‌بینی‌کننده باید بر اساس پرسش‌های یکسان و در بازه زمانی مشابه انجام شود، در غیر این صورت، به‌جای مهارت، دشواری پرسش‌ها با یکدیگر مقایسه می‌شود.

چرا قواعد امتیازدهی صحیح اهمیت دارند

خطای مطلق میانگین، که میانگین فاصله ساده بین احتمال اعلامی شما و نتیجه واقعی است، جایگزین معقولی به نظر می‌رسد اما نمره بدی می‌دهد. فرض کنید صادقانه معتقدید احتمال وقوع یک رویداد 70 درصد است. اگر 70 درصد را اعلام کنید، خطای مطلق مورد انتظار شما برابر با 0.42 = 0.7 × 0.3 + 0.3 × 0.7 خواهد بود. اگر به‌جای آن 100 درصد را اعلام کنید، این مقدار به 0.30 = 0.7 × 0 + 0.3 × 1 کاهش می‌یابد. تحت معیار خطای مطلق، اعلام عدد صادقانه برای شما هزینه دارد و معیاری که برای بیش‌اظهاری در اطمینان به شما پاداش می‌دهد، در حال اندازه‌گیری کیفیت پیش‌بینی نیست.

امتیاز Brier چنین نقصی ندارد. اگر معتقد به 70 درصد هستید و همان 70 درصد را اعلام کنید، امتیاز مورد انتظار شما 0.21 = 0.7 × 0.09 + 0.3 × 0.49 خواهد بود. اگر 100 درصد را اعلام کنید، این مقدار به 0.30 افزایش می‌یابد. اگر 60 درصد را اعلام کنید، به 0.22 می‌رسد. حداقل امتیاز دقیقاً روی عددی قرار دارد که به آن باور دارید. قاعده‌ای با این ویژگی، «صحیح» (proper) نامیده می‌شود و همین دلیل تبدیل‌شدن Brier به استاندارد پیش‌فرض در مسابقات پیش‌بینی است.

امتیاز لگاریتمی (log score) دیگر قاعده صحیح رایج است: لگاریتم طبیعی احتمالی را که به نتیجه رخ‌داده اختصاص داده‌اید بگیرید و سپس علامت آن را معکوس کنید. اعلام احتمال 1 درصد برای رویدادی که رخ می‌دهد، 4.6 هزینه دارد و اعلام 0 درصد، هزینه‌ای بی‌نهایت خواهد داشت. در یک پیش‌بینی فرضی ده‌تایی، امتیاز لگاریتمی به 0.483 در مقابل 0.693 برای خط مبنای ثابت می‌رسد. امتیاز Brier بین 0 و 1 باقی می‌ماند که به‌عنوان یک کارنامه، خوانش طبیعی‌تری دارد. امتیاز لگاریتمی فاقد کران است که برای ارزیابی‌هایی که در آن‌ها دم‌های توزیع (tails) حامل ریسک هستند، مناسب‌تر است.

این موضوع برای قراردادهای رویداد چه معنایی دارد

یک قرارداد رویداد که در صورت وقوع یک پیشامد 1 دلار و در غیر این صورت 0 دلار پرداخت می‌کند، با قیمتی معامله می‌شود که بیانگر احتمال وقوع آن است. 62 سنت به معنای پیش‌بینی 62 درصدی است، البته پیش از آنکه اسپرد و کارمزدها از آن کسر شود. راهنمای ما در قیمت قراردادهای رویداد به عنوان احتمال این تبدیل را پوشش می‌دهد و نحوه تسویه قراردادهای رویداد توضیح می‌دهد که عبارت «وقوع پیشامد» در متن خودِ قرارداد به چه معناست.

آن قیمت، پیش‌بینی‌ای است که دارای سابقه عمومی و تاریخ تسویه است و همین امر آن را به معیاری تبدیل می‌کند که گزارش عملکرد شما باید از آن پیشی بگیرد. پیش‌بینی‌های خود را بر اساس همان پرسش‌ها و در همان بازه زمانی ارزیابی کنید. معامله‌گری که امتیاز Brier او بالاتر از قیمت بازار باشد، فارغ از هر روایت جذابی که برای معامله خود داشته باشد، هیچ برتریِ اندازه‌گیری‌شده‌ای در آن مجموعه پرسش‌ها ندارد. همین آزمون در مورد ضرایب شرط‌بندی ورزشی نیز صادق است، به‌شرطی که ویگ (کارمزد) را از ضرایب شرط‌بندی حذف کنید؛ همچنین در بازارهای نرخ بهره، جایی که احتمالات نرخ بهره فدرال رزرو، احتمالی زمان‌دار برای پرسشی با تاریخ مشخصِ تعیین تکلیف به شما ارائه می‌دهند.

نحوه امتیازدهی این پنل‌ها به بازار

دلتا از سوابق روزانه یونانی‌های اختیار معامله (options greeks) برای هر قرارداد استخراج می‌شود. تنها قراردادهایی که در روز مشاهده دارای حجم معاملات بوده و به یک نرخ نوسان‌پذیری همگرا رسیده‌اند، در این محاسبات لحاظ شده‌اند. نتیجه بر اساس قیمت پایانی دارایی پایه در تاریخ انقضای قرارداد خوانده می‌شود: یک اختیار خرید (call) زمانی در وضعیت سود (in the money) قرار می‌گیرد که قیمت پایانی بالاتر از قیمت اعمال (strike) باشد، و یک اختیار فروش (put) زمانی که پایین‌تر از آن باشد. تسویه واقعی پس از تصمیم‌گیری برای اعمال (exercise) پس از بسته شدن بازار انجام می‌شود، بنابراین قراردادهایی که در محدوده‌ای بسیار نزدیک به قیمت اعمال قرار دارند، ممکن است با این ساده‌سازی تفاوت جزئی در تسویه داشته باشند. تمام قراردادهای موجود در این پنل‌ها منقضی شده‌اند و بازه‌های زمانی طولانی‌تر، لزوماً از تاریخ‌های مشاهده زودتر در آن پنجره زمانی استفاده می‌کنند. شکسته شدن سهام (share split) که بین تاریخ مشاهده و انقضا رخ دهد، قیمت اعمال و قیمت تسویه را در مقیاس‌های متفاوتی قرار می‌دهد؛ این یکی دیگر از دلایلی است که هر دسته، تعداد نمونه‌های خود را به همراه دارد.

دلتا تقریب‌زننده یک احتمال خنثی نسبت به ریسک (risk-neutral) است و نه یک احتمال واقعی. این دو به دلیل صرف ریسک (risk premium) نهفته در قیمت‌های اختیار معامله با یکدیگر تفاوت دارند و جدول کالیبراسیون ابزاری است که به‌جای نادیده گرفتن این تفاوت، آن را اندازه‌گیری می‌کند.

پرسش‌های متداول

آیا امتیاز Brier پایین‌تر بهتر است؟

بله. امتیاز Brier معیاری برای سنجش خطا است؛ بنابراین امتیاز 0 نشان‌دهنده عملکرد بی‌نقص و امتیاز 1 بدترین حالت ممکن است که با اختصاص احتمال 100 درصد به تمام رویدادهایی که رخ نداده‌اند، حاصل می‌شود. هر امتیازی زیر 0.25، عملکردی بهتر از پاسخ‌دهی 50 درصد به تمامی پرسش‌ها محسوب می‌شود.

امتیاز Brier خوب چه عددی است؟

عدد مطلقی برای «خوب» بودن وجود ندارد، زیرا این امتیاز به دشواری پرسش‌ها بستگی دارد. امتیاز 0.10 برای پیش‌بینی وضعیت هوای فردا و امتیاز 0.18 برای پیش‌بینی نتایج نزدیک انتخابات، قابل مقایسه با یکدیگر نیستند. امتیازها را تنها در صورتی با هم مقایسه کنید که پیش‌بینی‌کنندگان به پرسش‌های یکسان در بازه زمانی مشابه پاسخ داده باشند.

امتیاز Brier برابر با 0.25 به چه معناست؟

این امتیازِ پیش‌بینی‌کننده‌ای است که به همه چیز 50 درصد احتمال می‌دهد، چرا که در این صورت، مجذور هر خطا فارغ از نتیجه نهایی، برابر با 0.25 خواهد بود. این عدد، معیار استاندارد «عدم‌اطلاعات» برای مجموعه‌ای از پرسش‌های بله/خیر است؛ هرچند در مجموعه‌پرسش‌های نامتوازن، نرخ پایه (base rate) باید به‌عنوان معیار سنجش در نظر گرفته شود.

تفاوت امتیاز Brier با امتیاز لگاریتمی (log score) چیست؟

هر دو «قواعد امتیازدهی مناسب» (proper scoring rules) هستند؛ به این معنا که هر کدام زمانی به حداقل می‌رسند که شما دقیقاً همان احتمالی را بیان کنید که به آن باور دارید. Brier مجذور خطا را محاسبه می‌کند و همواره بین 0 و 1 باقی می‌ماند. امتیاز لگاریتمی، خطاهای ناشی از اطمینان کاذب را بسیار شدیدتر جریمه می‌کند و اختصاص احتمال 0 درصد به رویدادی که رخ می‌دهد، هزینه‌ای بی‌نهایت در پی دارد.

آیا دلتای اختیار (option delta) را می‌توان به‌عنوان احتمال در نظر گرفت؟

قدر مطلق دلتا به احتمال ضمنی بازار برای «در سود بودن» (in the money) اختیار نزدیک است و این یک احتمال «خنثی نسبت به ریسک» (risk-neutral) است، نه احتمال واقعی. پنل‌های بالا، دلتا را به‌عنوان یک پیش‌بینی ارزیابی می‌کنند: دلتای اعلام‌شده روی یک محور و سهم قراردادهایی که در نهایت در وضعیت «در سود» قرار گرفته‌اند، روی محور دیگر.


هر پنل در اینجا به همراه کد SQL دقیقِ زیر آن ارائه شده است، بنابراین ارزیابی آن خط‌به‌خط قابل‌حسابرسی است. برای امتیازدهی به پیش‌بینی‌های خود در مقایسه با بازار روی پرسش‌های مشابه، اعداد را به زبان ساده از پایانه Strasmore درخواست کنید.

#prediction markets#forecasting#brier score#calibration#event contracts