AI एजंटसाठी स्थानिक A-share डेटा लेक कसे तयार करावे
ashare-lake द्वारे तुमच्या डिस्कवर 39 डेटासेट आणि डीलिस्टिंग रेकॉर्ड्ससह स्थानिक A-share डेटा लेक तयार करा. हे टूल पॉइंट-इन-टाइम क्वेरी आणि AI एजंटसाठी MCP सर्व्हर सुविधा देते.
स्थानिक A-share डेटा लेक म्हणजे चिनी मुख्य भूमीच्या इक्विटी मार्केटचा इतिहास, जो तुमच्या स्वतःच्या डिस्कवर कॉलम-आधारित Parquet फाइल्सच्या स्वरूपात साठवलेला असतो. हे डेटासेट DuckDB किंवा Polars द्वारे वाचता येतात, जे एका वेळी एक पान लोड करणाऱ्या व्हेंडर एंडपॉईंटपेक्षा वेगळे आहेत. ashare-lake हा एक ओपन-सोर्स प्रकल्प आहे जो असा डेटा लेक तयार करतो. यामध्ये दररोज चालणारे जॉब्स समाविष्ट आहेत जे डेटा अद्ययावत ठेवतात, तसेच एक Model Context Protocol सर्व्हर आहे जो AI एजंटला या डेटावर क्वेरी करण्याची सुविधा देतो. या प्रकल्पातील दोन डिझाइन निवडींमुळे तो येथे चर्चेत आहे: यामध्ये डीलिस्ट (delisted) झालेल्या कंपन्यांची नावे कायम ठेवली जातात आणि मूलभूत आर्थिक माहिती (fundamentals) भूतकाळातील कोणत्याही तारखेनुसार वाचता येते.
AI एजंटला स्थानिक A-share डेटा लेकची गरज का असते
चिनी इक्विटीजवर संशोधन करणाऱ्या एजंटकडे स्थानिक प्रत नसल्यास दोन मार्ग असतात. एक म्हणजे तो फायनान्स पेजेस स्क्रॅप करतो, ज्यामध्ये त्याचा कॉन्टेक्स्ट विंडो HTML वाचण्यात खर्च होतो आणि अशी आकडेवारी मिळते जी पुढच्या महिन्यात कोणीही पुन्हा तयार करू शकत नाही. किंवा तो नोंदणी आवश्यक असलेल्या विक्रेत्याला कॉल करतो, जो निकालांच्या ओळींवर मर्यादा घालतो आणि प्रत्येक निकाल एका खात्याशी जोडतो.
स्केल (व्याप्ती) हा असा भाग आहे ज्याकडे दुर्लक्ष केले जाते. आमच्या स्वतःच्या वेअरहाऊसमध्ये US टेप मिनिट-रिझोल्यूशनवर उपलब्ध आहे आणि एका सामान्य आठवड्याचा डेटा असा दिसतो:
प्रत्येक आकड्यामागील अचूक SQL
SELECT toDate(toTimeZone(window_start, 'America/New_York')) AS session,
formatDateTime(toDate(toTimeZone(window_start, 'America/New_York')), '%b %e') AS session_label,
uniqExact(ticker) AS tickers_count,
round(count() / 1000000, 2) AS minute_bars_millions
FROM global_markets.delayed_stocks_minute_aggs
WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-07-20')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-07-24')
GROUP BY session, session_label
ORDER BY sessionJul 20 रोजी टेपने 11737 सिम्बॉल्ससाठी 1.79 दशलक्ष मिनिट बार्स तयार केले आणि पॅनेल मधील इतर चार सत्रांमध्ये हेच घडते. एक राष्ट्रीय बाजार, एक आठवडा, एक रिझोल्यूशन. दुसऱ्या बाजारासाठी दहा वर्षांचे डेली बार्स, फंडामेंटल्स, इंडेक्स मेंबरशिप आणि मनी-फ्लो रेकॉर्ड्सचा आकारही असाच असतो आणि HTTP द्वारे ते पेज करणे एजंटचा रन वाया घालवते.
स्थानिक डेटा लेक एकाच वेळी दोन गोष्टी बदलतो. वाचन हे कोट्याऐवजी फाईल स्कॅन बनते आणि आज लिहिलेली क्वेरी सहा महिन्यांनी त्याच ओळी परत करते, जे बॅकटेस्ट तपासण्यायोग्य असण्यासाठी आवश्यक असते. AI एजंटसाठी मार्केट डेटा कौशल्ये आणि मार्केट डेटावर SQL API यावरील आमच्या नोट्स US डेटासाठी असाच युक्तिवाद करतात.
इन्स्टॉल करा, एका आवृत्तीवर पिन करा
Python 3.10 किंवा त्यापेक्षा नवीन आवृत्ती वापरा. आवृत्ती पिन करा: 27 जुलै ते 2 ऑगस्ट 2026 दरम्यान सहा रिलीज झाले आहेत, आणि एजंटच्या सेटअप स्क्रिप्टमध्ये अनपिन केलेले इन्स्टॉल म्हणजे बदलत जाणारे लक्ष्य असते. हा कोड rootSunc/ashare-lake वर Apache 2.0 अंतर्गत उपलब्ध आहे.
pip install ashare-lake==0.5.0ऑगस्ट 2026 च्या सुरुवातीच्या स्थितीनुसार सध्याचे रिलीज इन्स्टॉल करते.asl --versionइन्स्टॉल केलेली बिल्ड प्रिंट करते.asl config init --data-root /path/to/ashare-lakeतुमचा डेटा रूट भरून पॅकेज केलेले उदाहरण TOML लिहिते, यासाठी रिपॉझिटरी चेकआउटची आवश्यकता नाही.--configआउटपुट पाथ सेट करते,--forceओव्हरराईट करते.asl doctorकोणताही डेटा हलवण्यापूर्वी, ऑफलाइन तपासणी करते.asl servers testअपस्ट्रीम कोट होस्ट्सची तपासणी करते.asl sourcesप्रत्येक सोर्सची तपासणी करते, ज्यामध्ये--vantageचाcn,overseas, किंवाlocalअसा पर्याय असतो.
येथेच थांबा. पुढची कमांड बॅकफिलची आहे, आणि ती वाचत असताना सुरू करण्याची गोष्ट नाही.
बॅकफिल काय करते
asl init डिरेक्टरी लेआउट तयार करते आणि ऐतिहासिक डेटा भरते. प्रकल्पाच्या दस्तऐवजानुसार, पूर्ण रन पूर्ण होण्यासाठी अनेक तासांचा वेळ आणि डिस्कवर काही GB जागा लागते. यासाठी अपस्ट्रीम Tongdaxin कोट होस्टशी थेट कनेक्शन आवश्यक असते, ज्याची पडताळणी asl servers test करते. याउलट, asl init --profile quick केवळ अलीकडील तीन वर्षांचा डेटा काही मिनिटांत कव्हर करते. या कालावधीत ज्या कंपन्यांचे शेअर्स ट्रेड झाले, त्या सर्वांची नावे यात समाविष्ट असतात, ज्या कंपन्या आता बाजारातून बाहेर पडल्या आहेत त्यांचाही यात समावेश होतो. asl run daily हे त्यानंतरचे इंक्रीमेंटल जॉब आहे, asl status --datasets प्रत्येक डेटासेटनुसार कव्हरेज आणि फ्रेशनेसचा अहवाल देते, आणि asl serve 127.0.0.1:8787 वर रीड-ओन्ली डॅशबोर्ड उपलब्ध करून देते.
या रिपॉझिटरीमध्ये कोणताही डेटा आधीपासून नसतो. प्रत्येक Parquet फाईल तुमच्या मशीनवर तयार केली जाते. प्रत्येक ओळीसाठी रो-लेव्हल लिनेज (row-level lineage) नोंदवलेले असते, ज्यामध्ये कोणता स्रोत वापरला आणि तो कधी मिळवला, याची माहिती असते.
39 डेटासेट म्हणजे काय?
हे डेटासेट संदर्भ डेटापासून बाहेरील स्तरांपर्यंत विभागलेले आहेत: 36 क्युरेटेड (curated) तक्ते आणि 3 व्युत्पन्न (derived) तक्ते.
- संदर्भ: इन्स्ट्रुमेंट्स, 2016 ते 2027 पर्यंतचे ट्रेडिंग कॅलेंडर, ट्रेडिंग स्टेटस.
- मार्केट डेटा: डेली बार्स, इंडेक्स बार्स, 1-मिनिट आणि 5-मिनिट बार्स, ट्रेड टिक्स, कमोडिटी बार्स, ॲडजस्टमेंट फॅक्टर्स, डीलिस्टिंग इव्हेंट्स.
- कॉर्पोरेट इव्हेंट्स: कॉर्पोरेट ॲक्शन्स, अनाउन्समेंट इंडेक्स, अर्निंग्ज डिस्क्लोजर शेड्युल.
- फंडामेंटल्स आणि व्हॅल्युएशन: फायनान्शिअल स्टेटमेंट आयटम्स, व्हॅल्युएशन मेट्रिक्स, ॲनालिस्ट कन्सेन्सस.
- कॅपिटल फ्लो: फंड फ्लो, मार्जिन ट्रेडिंग, नॉर्थबाउंड फ्लो आणि होल्डिंग्स, ड्रॅगन-टायगर बोर्ड ऑफ लार्ज-ऑर्डर डिस्क्लोजर्स, ब्लॉक ट्रेड्स, इन्स्टिट्यूशनल होल्डिंग्स.
- स्ट्रक्चर आणि इंडस्ट्री: सेक्टर मेंबर्स, इंडेक्स कॉन्स्टिट्युएंट्स, इंडस्ट्री मेंबर्स, इंडस्ट्री इंडेक्स.
- मॅक्रो: मॅक्रो इंडिकेटर्स, मार्केट ब्रेड्थ, इकॉनॉमिक कॅलेंडर.
- सेंटिमेंट आणि रोटेशन: सेंटिमेंट स्कोअर्स, हॉट रँक, सेक्टर बार्स, सेक्टर फंड फ्लो, न्यूज हेडलाईन्स, फ्लॅश न्यूज वायर.
- रिस्क आणि कंप्लायन्स: शेअर अनलॉक शेड्युल, रेग्युलेटरी इव्हेंट्स.
डेटासेटचे स्थान हे लेखकाला कशात रस आहे हे दर्शवते. ॲडजस्टमेंट फॅक्टर्स आणि डीलिस्टिंग इव्हेंट्स हे मार्केट-डेटा लेयरमध्ये डेली बार्सच्या शेजारी ठेवले आहेत, परिशिष्टात (appendix) नाहीत. ज्यांना ऐतिहासिक डेटावर कल्पना तपासायच्या आहेत, त्यांच्यासाठी प्रकल्पाचा हा भाग सर्वाधिक मौल्यवान आहे.
स्थानिक लेक (lake) सर्व्हायव्हरशिप बायस (survivorship bias) कसा हाताळते
जेव्हा अभ्यासासाठी निवडलेले घटक केवळ आज अस्तित्वात असलेल्या नावांवरून घेतले जातात, तेव्हा 'सर्व्हायव्हरशिप बायस' निर्माण होतो. ज्या कंपन्यांचे विलीनीकरण झाले, ज्या खाजगी झाल्या किंवा ज्यांना डीलिस्ट (delisted) करण्यात आले, त्या सर्व कंपन्या यातून मूकपणे वगळल्या जातात आणि जी नावे गायब होतात, ती क्वचितच यशस्वी असतात.
आमचे वेअरहाऊस अमेरिकन बाजारासाठी ही त्रुटी मोजू शकते; हीच गणिती प्रक्रिया वेगळ्या स्वरूपात मांडता येते. प्रत्येक वर्षासाठी, मार्चच्या दुसऱ्या आठवड्यात ज्या प्रत्येक सिम्बॉलने (symbol) मिनिट बार (minute bar) प्रिंट केला, त्यांची यादी घ्या आणि त्यानंतर जुलै 2026 च्या शेवटच्या दोन आठवड्यांत त्यापैकी किती सिम्बॉल अजूनही कार्यरत होते, हे तपासा:
प्रत्येक आकड्यामागील अचूक SQL
WITH on_tape_now AS (
SELECT ticker
FROM global_markets.delayed_stocks_minute_aggs
WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-07-20')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-07-31')
GROUP BY ticker
),
cohort AS (
SELECT toYear(toTimeZone(window_start, 'America/New_York')) AS cohort_year,
ticker
FROM global_markets.delayed_stocks_minute_aggs
WHERE toYear(toTimeZone(window_start, 'America/New_York')) BETWEEN 2016 AND 2025
AND toMonth(toTimeZone(window_start, 'America/New_York')) = 3
AND toDayOfMonth(toTimeZone(window_start, 'America/New_York')) BETWEEN 10 AND 14
GROUP BY cohort_year, ticker
)
SELECT c.cohort_year AS year,
count() AS names_on_tape_count,
countIf(n.ticker != '') AS still_trading_count,
count() - countIf(n.ticker != '') AS gone_count,
round(100 * countIf(n.ticker != '') / count(), 1) AS still_trading_pct
FROM cohort AS c
LEFT JOIN on_tape_now AS n ON c.ticker = n.ticker
GROUP BY year
ORDER BY year8101 सिम्बॉलपैकी जे त्या आठवड्यात 2016 मध्ये ट्रेड करत होते, त्यापैकी 50.1% सिम्बॉल जुलै 2026 च्या अखेरीस टेपवर होते आणि 4040 नव्हते. 2025 कोहॉर्ट (cohort) 86.7% असे दर्शवते. आजच्या लिस्टिंगवर आधारित स्क्रीन जर त्या 10 वर्षांच्या मागे नेला, तर तो जसजसा मागे जातो तसतसा बाजारातील मोठा हिस्सा वगळत जातो.
असा सोयीस्कर समज आहे की, जी नावे गायब झाली ती सर्व पेनी स्टॉक्स (penny stocks) होती. मार्च 2021 च्या कोहॉर्टला त्या महिन्यातील सरासरी दैनिक डॉलर व्हॉल्यूमच्या (average daily dollar volume) आधारावर श्रेणीबद्ध केल्यास काही वेगळेच चित्र दिसते:
प्रत्येक आकड्यामागील अचूक SQL
WITH on_tape_now AS (
SELECT ticker
FROM global_markets.delayed_stocks_minute_aggs
WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-07-20')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-07-31')
GROUP BY ticker
),
march_2021 AS (
SELECT ticker,
sum(toFloat64(close) * toFloat64(volume))
/ uniqExact(toDate(toTimeZone(window_start, 'America/New_York'))) AS avg_daily_dollar_volume
FROM global_markets.delayed_stocks_minute_aggs
WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2021-03-01')
AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2021-03-31')
GROUP BY ticker
)
SELECT multiIf(d.avg_daily_dollar_volume >= 1000000000, '$1B or more',
d.avg_daily_dollar_volume >= 100000000, '$100M to $1B',
d.avg_daily_dollar_volume >= 10000000, '$10M to $100M',
d.avg_daily_dollar_volume >= 1000000, '$1M to $10M',
'under $1M') AS liquidity_bucket,
count() AS names_count,
countIf(n.ticker = '') AS gone_count,
round(100 * countIf(n.ticker = '') / count(), 1) AS gone_pct
FROM march_2021 AS d
LEFT JOIN on_tape_now AS n ON d.ticker = n.ticker
GROUP BY liquidity_bucket
ORDER BY min(d.avg_daily_dollar_volume)under $1M श्रेणीने सर्वात मोठा हिस्सा गमावला, म्हणजेच 3968 पैकी 57.5% नावे. सर्वात जास्त व्यवहार होणारी श्रेणीही यातून सुटली नाही: मार्च 2021 मध्ये दररोज $1B or more व्यवहार करणाऱ्या 89 सिम्बॉलपैकी 3.4% सिम्बॉल जुलै 2026 च्या अखेरीस बाजारातून बाहेर पडले होते. विलीनीकरण, खाजगीकरण, दिवाळखोरी आणि इंडेक्समधून बाहेर पडणे या सर्वांचा शेवट प्राईस टेबलमध्ये एकाच प्रकारे होतो: त्या ओळी (rows) तिथेच थांबतात.
ashare-lake या समस्येकडे एक महत्त्वाची समस्या म्हणून पाहते. इन्स्ट्रुमेंट्स डेटासेटमध्ये डीलिस्ट झालेल्या सिम्बॉलना काढून टाकण्याऐवजी ते कायम ठेवले जाते, delisting_events टेबलमध्ये प्रत्येक कंपनीचा शेवट कसा झाला याची नोंद असते आणि Python API मधील universe="all_a" ऐतिहासिक स्नॅपशॉट (snapshot) तयार करते ज्यामध्ये त्यांचा समावेश असतो. प्रकल्पाच्या स्वतःच्या दस्तऐवजानुसार, 2016 ते 2021 या काळात केवळ 'सर्व्हायव्हर' (survivor-only) बॅकटेस्ट आणि 'डीलिस्टिंग-समाविष्ट' बॅकटेस्ट यांच्यात साधारणपणे दुप्पट तफावत दिसून येते. हे आमच्या बॅकटेस्टिंगमधील लूक-अहेड बायस नोट्समधील सापळ्याचे प्रतिबिंब आहे: एक असे विश्व ज्याला भविष्याची आधीच माहिती असते.
पॉइंट-इन-टाइम रीड्स
load("financial_statement_items", as_of="2018-04-30") त्या तारखेला किंवा त्यापूर्वी घोषित केलेल्या प्रत्येक लाईन आयटमची सर्वात अलीकडील आवृत्ती परत करते, नंतर सुधारित केलेली आकडेवारी नाही. बार्समध्ये adjust आर्ग्युमेंट असते: बॅकवर्ड ॲडजस्टमेंटसाठी hfq, क्वेरी विंडोमध्ये नॉर्मलाईज्ड करण्यासाठी qfq, किंवा रॉ प्राईस (raw prices). ज्या आकडेवारीची बाजाराला अजून माहितीच नाही, त्यावर आधारित फॅक्टर काहीही मोजू शकत नाही; LLM जनरेटेड अल्फा फॅक्टर पाईपलाईनमध्ये तपासण्याची ही पहिली गोष्ट आहे.
MCP सर्व्हर म्हणून नोंदणी करणे
Model Context Protocol (MCP) द्वारे एजंट टूल्स निवडतात. asl mcp हे stdio द्वारे संवाद साधते आणि क्लायंट ही प्रक्रिया सुरू करतो:
claude mcp add ashare-lake -- asl mcp --config /abs/path/to/ashare-lake.toml- इतर कोणताही MCP क्लायंट याच दोन गोष्टी वापरतो: कमांड म्हणून
aslआणि आर्ग्युमेंट्स म्हणूनmcp --configसोबत एक ॲब्सोल्युट पाथ. हा पाथ ॲब्सोल्युट असणे आवश्यक आहे, कारण क्लायंट कोणत्याही डिरेक्टरीमधून प्रक्रिया सुरू करू शकतो.
येथे सहा टूल्स उपलब्ध आहेत, जी डेटासेटऐवजी प्रश्नांनुसार वर्गीकृत केली आहेत: काय अस्तित्वात आहे आणि ते कसे वाचायचे यासाठी describe_lake, नावावरून कोड शोधण्यासाठी resolve_symbol (यात डीलिस्टेड नावांचाही समावेश आहे), query_bars, as_of आर्ग्युमेंटसह query_fundamentals, इतर सर्व गोष्टींसाठी query_dataset, आणि डेटासेटवर एकच रीड-ओन्ली DuckDB SELECT चालवण्यासाठी run_sql. एक --live फ्लॅग सर्व्हरला लेकमध्ये न लिहिता अपस्ट्रीमवरून सिम्बॉल लुकअप्स आणि अनअॅडजस्टेड डेली बार्सचे उत्तर देण्यास सक्षम करतो.
माहिती असणे आवश्यक असलेल्या मर्यादा
- फक्त A-shares. हाँगकाँग, अमेरिकन लिस्टिंग किंवा मुख्य भूमी चीनबाहेरील कोणत्याही शेअर्सचा यात समावेश नाही.
- हा एक वैयक्तिक प्रकल्प आहे. इश्यूज आणि पुल रिक्वेस्ट्सकडे सर्वोत्तम प्रयत्नांनुसार लक्ष दिले जाते, आणि दस्तऐवजात स्पष्टपणे नमूद केले आहे की उपलब्धतेची कोणतीही हमी नाही: अपस्ट्रीम साइट्समध्ये बदल झाल्यास किंवा IP ब्लॉक झाल्यास, जोपर्यंत कोणीतरी पॅच करत नाही तोपर्यंत डेटा इनजेस्ट थांबते.
- Apache 2.0 परवाना कोडला लागू होतो, डेटाला नाही. प्रत्येक अपस्ट्रीम स्त्रोताच्या स्वतःच्या अटी आहेत आणि मेंटेनर्स तुम्ही तयार केलेल्या Parquet फाइल्स पुन्हा वितरित करण्याचा किंवा विकण्याचा कोणताही अधिकार देत नाहीत. कोणत्याही व्यावसायिक वापरापूर्वी स्त्रोताच्या अटी वाचा.
- हा ज्या स्त्रोतांकडून डेटा वाचतो, त्यासाठी कोणत्याही अकाउंट किंवा टोकनची आवश्यकता नसते; हेच याचे आकर्षण आहे आणि हीच याची कमकुवत बाजू देखील आहे.
- Windows सपोर्ट 0.3.0 आवृत्तीमध्ये आला आणि 0.3.1 मध्ये Python ची किमान आवृत्ती 3.10 करण्यात आली.
या प्रकल्पाची माहिती कोठून घेतली आहे
आवृत्ती 0.5.0, सहा रिलीज तारखा आणि Python ची किमान आवृत्ती प्रकल्पाच्या PyPI रिलीज हिस्ट्री आणि CHANGELOG मधून 4 ऑगस्ट 2026 रोजी वाचली आहे. डेटासेट कॅटलॉग, डिलिस्टिंग आणि पॉइंट-इन-टाइम वर्तन, CLI फ्लॅग्स, MCP टूल लिस्ट, आणि परवाना व सपोर्ट संबंधीची माहिती रिपॉझिटरी डॉक्युमेंट्समधून घेतली आहे: docs/datasets/catalog.md, docs/reference/cli.md, docs/reference/mcp.md, आणि docs/legal-and-data-sources.md. सॉफ्टवेअर पोस्टपेक्षा वेगाने अपडेट होते, त्यामुळे तुम्ही जी आवृत्ती इन्स्टॉल करत आहात तिचे डॉक्युमेंट्स तपासा. दोन सर्व्हायव्हरशिप पॅनेल आमच्या स्वतःच्या वेअरहाऊसमधील अमेरिकन सिम्बॉल्स मोजतात, चिनी लिस्टिंग नाही, आणि ते A-share बाजाराचे मोजमाप नसून केवळ या यंत्रणेचे उदाहरण म्हणून दिले आहेत.
वारंवार विचारले जाणारे प्रश्न (FAQ)
स्थानिक A-share डेटा लेक तयार करण्यासाठी API कीची आवश्यकता आहे का?
यासाठी गरज नाही. ज्या अपस्ट्रीम स्रोतांकडून हा डेटा वाचला जातो, त्यांना कोणत्याही नोंदणीची किंवा टोकनची आवश्यकता नसते आणि हा डेटा लेक तुमच्या स्वतःच्या मशीनवर असतो. प्रत्येक स्रोताच्या वापराच्या अटी (terms of use) वेगळ्या असतात, ज्या कोणत्याही व्यावसायिक कामापूर्वी तपासणे महत्त्वाचे आहे.
ashare-lake बॅकफिलसाठी किती वेळ लागतो?
डॉक्युमेंटेशननुसार, पूर्ण इतिहासाचे बॅकफिल करण्यासाठी काही तासांचा वेळ आणि काही GB डिस्क स्पेस लागते. यासाठी संपूर्ण प्रक्रियेदरम्यान अपस्ट्रीम कोट होस्टशी कार्यरत कनेक्शन असणे आवश्यक आहे. asl init --profile quick मागील तीन वर्षांचा डेटा काही मिनिटांत कव्हर करते आणि त्यात डीलिस्ट झालेल्या कंपन्यांची नावेही समाविष्ट असतात.
स्थानिक A-share डेटा लेकमध्ये डीलिस्ट झालेले शेअर्स समाविष्ट असतात का?
हो, यात असतात. डीलिस्ट झालेले सिम्बॉल्स इन्स्ट्रुमेंट्स डेटासेटमध्ये राहतात, delisting_events टेबलमध्ये प्रत्येक कंपनीचा प्रवास कसा संपला याची नोंद असते आणि universe="all_a" एक ऐतिहासिक स्नॅपशॉट तयार करते ज्यामध्ये त्यांचा समावेश असतो. वरील आमचे US मापन हे दर्शवते की केवळ सध्या कार्यरत असलेल्या कंपन्यांचा विचार केल्यास किती डेटा वगळला जातो.
AI एजंट थेट ashare-lake ला क्वेरी करू शकतो का?
हो. asl mcp मॉडेल कॉन्टेक्स्ट प्रोटोकॉलद्वारे सहा टूल्स उपलब्ध करून देते, ज्यापैकी एक रीड-ओनली SQL टूल आहे. त्यामुळे एजंट डेटा स्क्रॅप करण्याऐवजी थेट स्थानिक Parquet फाईल्सना क्वेरी करतो. यासाठी claude mcp add ashare-lake -- asl mcp --config /abs/path/to/ashare-lake.toml वापरून नोंदणी करा.
ashare-lake हे AkShare किंवा Baostock ला पर्याय आहे का?
नाही. हे त्यांच्या वरच्या स्तरावर काम करते. त्या लायब्ररी अपस्ट्रीमवरून डेटा मिळवतात; हा प्रकल्प तो डेटा साठवतो, त्याचे व्हर्जनिंग करतो आणि रो-लेव्हल लिनिएजसह क्युरेटेड Parquet फॉरमॅटमध्ये एकत्रित करतो, जिथे प्रत्येक डेटासेटसाठी एक स्वतंत्र करार असतो.
वरील प्रत्येक आकृती ही प्रत्यक्ष बाजार डेटावर आधारित स्टोअर्ड आणि व्हर्जन केलेली क्वेरी आहे. SQL वाचण्यासाठी कोणताही पॅनेल विस्तार करा किंवा Strasmore टर्मिनलवर तुमच्या स्वतःच्या युनिव्हर्सवर तीच सर्व्हायव्हरशिप तपासणी रन करा.