Strasmore Research
Deep Dives · Matt ConnorBy Matt Connor · · Updated 2026-08-08

AI ஏஜெண்டுகளுக்கான உள்ளூர் A-share Data Lake உருவாக்கம்

ashare-lake மூலம் முப்பத்தி ஒன்பது தரவுத்தொகுப்புகளை உங்கள் கணினியில் சேமிக்கலாம். இது நீக்கப்பட்ட பங்குகள், வரலாற்று தரவுகள் மற்றும் AI ஏஜெண்டுகளுக்கான MCP சேவையகத்தை வழங்குகிறது.

உள்ளூர் A-share தரவுத்தளம் (Data Lake)

உள்ளூர் A-share தரவுத்தளம் என்பது சீன நிலப்பரப்பு பங்குச் சந்தையின் வரலாற்றுத் தரவுகளை உங்கள் கணினியில் columnar Parquet கோப்புகளாகச் சேமித்து வைப்பதாகும். இதை DuckDB அல்லது Polars மூலம் வாசிக்க முடியும்; ஒவ்வொரு பக்கமாகத் தரவுகளைப் பெறும் விற்பனையாளர் முனையங்களை (vendor endpoint) விட இது சிறந்தது. ashare-lake என்பது இத்தகைய தரவுத்தளத்தை உருவாக்கும் ஒரு திறந்தநிலைத் திட்டமாகும். இது தரவுகளைத் தற்போதைய நிலையில் வைத்திருக்க தினசரி பணிகளையும், AI முகவர்கள் தரவுகளை வினவ உதவும் Model Context Protocol சேவையகத்தையும் கொண்டுள்ளது. இரண்டு வடிவமைப்புத் தேர்வுகள் இதைப் பதிவிடத் தகுதியானதாக ஆக்குகின்றன: பட்டியலிலிருந்து நீக்கப்பட்ட (delisted) நிறுவனங்களின் பெயர்கள் தக்கவைக்கப்படுகின்றன, மேலும் அடிப்படை நிதித் தரவுகளை (fundamentals) கடந்த காலத் தேதியின் அடிப்படையில் வாசிக்க முடியும்.

AI ஏஜெண்டிற்கு ஏன் உள்ளூர் A-share தரவுத் தளம் (data lake) தேவைப்படுகிறது

சீனப் பங்குகளை ஆய்வு செய்யும் ஒரு ஏஜெண்ட், உள்ளூர் தரவு நகல் இல்லாமல் செயல்பட இரண்டு வழிகள் மட்டுமே உள்ளன. ஒன்று, நிதிச் சந்தை இணையதளங்களை ஸ்கிராப் (scrape) செய்வது; இது அதன் context window-வை HTML குறியீடுகளைப் படிக்கவே செலவழித்துவிடும், மேலும் அடுத்த மாதம் யாராலும் சரிபார்க்க முடியாத எண்களையே உருவாக்கும். அல்லது, பதிவு செய்ய வேண்டிய கட்டாயமுள்ள ஒரு விற்பனையாளரை அணுகுவது; இது தரவு வரிசைகளைக் கட்டுப்படுத்துவதோடு, ஒவ்வொரு முடிவையும் ஒரு கணக்குடன் பிணைத்துவிடுகிறது.

அளவீடு (Scale) என்பது பெரும்பாலும் குறைத்து மதிப்பிடப்படும் ஒரு காரணியாகும். எங்களது சொந்த தரவு கிடங்கில் US சந்தையின் ஒரு நிமிட கால இடைவெளி கொண்ட தரவுகள் உள்ளன. ஒரு சாதாரண வாரத்தின் தரவு அமைப்பு இதோ:

வினவவும்அமெரிக்க ஒரு நிமிட வர்த்தகத் தரவு: ஜூலை 20-24, 2026-க்கான குறியீடுகள் மற்றும் அமர்வு வாரியான தரவுகள்
ஒவ்வொரு எண்ணின் பின்னணியில் உள்ள துல்லியமான SQL
SELECT toDate(toTimeZone(window_start, 'America/New_York')) AS session,
       formatDateTime(toDate(toTimeZone(window_start, 'America/New_York')), '%b %e') AS session_label,
       uniqExact(ticker) AS tickers_count,
       round(count() / 1000000, 2) AS minute_bars_millions
FROM global_markets.delayed_stocks_minute_aggs
WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-07-20')
  AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-07-24')
GROUP BY session, session_label
ORDER BY session
Run this yourself

Jul 20 அன்று, சந்தை தரவுத் தொகுப்பு 11737 குறியீடுகளுக்கு (symbols) 1.79 மில்லியன் நிமிடப் பட்டைகளை (minute bars) உருவாக்கியது; வாரத்தின் மற்ற நான்கு அமர்வுகளும் இதே போன்ற தரவுகளைக் கொண்டுள்ளன. ஒரு தேசிய சந்தை, ஒரு வாரம், ஒரு தீர்மானம் (resolution). மற்றொரு சந்தைக்கான பத்தாண்டுகால தினசரி பட்டைகள், அடிப்படைத் தரவுகள் (fundamentals), குறியீட்டு உறுப்பினர் விவரங்கள் மற்றும் பணப்புழக்கப் பதிவுகள் அனைத்தும் இதே அளவைக் கொண்டுள்ளன. இவற்றை HTTP வழியாகப் பெறுவது ஒரு ஏஜெண்டின் செயல்பாட்டுத் திறனை வீணடிக்கும்.

உள்ளூர் தரவுத் தளம் ஒரே நேரத்தில் இரண்டு மாற்றங்களைச் செய்கிறது. தரவு வாசிப்பு என்பது ஒதுக்கீட்டு முறைக்கு (quota) பதிலாக கோப்பு ஸ்கேனிங் (file scan) ஆக மாறுகிறது. இன்று எழுதப்படும் ஒரு வினவல் (query) ஆறு மாதங்களுக்குப் பிறகும் அதே வரிசைகளைத் தரும்; இதுவே ஒரு backtest-ஐச் சரிபார்க்கக்கூடியதாக மாற்றத் தேவையான அடிப்படைத் தேவையாகும். AI ஏஜெண்டுகளுக்கான சந்தை தரவுத் திறன்கள் மற்றும் சந்தை தரவுகளுக்கான SQL API குறித்த எங்களது குறிப்புகள், US தரவுகளுக்கும் இதே வாதத்தையே முன்வைக்கின்றன.

நிறுவுதல், ஒரு குறிப்பிட்ட பதிப்பில் நிலைநிறுத்துதல்

Python 3.10 அல்லது அதற்குப் புதிய பதிப்பு தேவை. பதிப்பை நிலைநிறுத்துங்கள்: ஜூலை 27 மற்றும் ஆகஸ்ட் 2, 2026 ஆகிய தேதிகளுக்கு இடைப்பட்ட காலத்தில் ஆறு வெளியீடுகள் வந்துள்ளன. ஒரு ஏஜெண்டின் setup ஸ்கிரிப்ட்டில் பதிப்பை நிலைநிறுத்தாமல் நிறுவுவது, இலக்கை மாற்றிக்கொண்டே இருக்கும் நிலையை உருவாக்கும். இதற்கான குறியீடு rootSunc/ashare-lake தளத்தில் Apache 2.0 உரிமத்தின் கீழ் உள்ளது.

  • pip install ashare-lake==0.5.0 ஆகஸ்ட் 2026 தொடக்கத்தில் இருந்த தற்போதைய வெளியீட்டை நிறுவுகிறது.
  • asl --version நிறுவப்பட்ட build-ஐ அச்சிடுகிறது.
  • asl config init --data-root /path/to/ashare-lake உங்கள் தரவு root-ஐ உள்ளிட்டு, தொகுக்கப்பட்ட உதாரண TOML கோப்பை உருவாக்குகிறது; இதற்கு repository-ஐ checkout செய்ய வேண்டிய அவசியமில்லை. --config வெளியீட்டுப் பாதையை அமைக்கிறது, --force ஏற்கனவே உள்ளதை மேலெழுதச் செய்கிறது.
  • asl doctor தரவு நகர்த்தப்படுவதற்கு முன்பே, ஆஃப்லைனில் அதன் சோதனைகளை இயக்குகிறது.
  • asl servers test அப்ஸ்ட்ரீம் quote ஹோஸ்ட்களை ஆய்வு செய்கிறது. asl sources ஒவ்வொரு மூலத்தையும் ஆய்வு செய்கிறது, இதற்கு --vantage ஆக cn, overseas, அல்லது local பயன்படுத்தப்படுகிறது.

அத்துடன் நிறுத்துங்கள். அடுத்த கட்டளை backfill ஆகும்; இதைப் படிக்கும்போதே இயக்க வேண்டாம்.

Backfill என்ன செய்கிறது

asl init கோப்பக அமைப்பை உருவாக்கி வரலாற்றை நிரப்புகிறது. திட்டத்தின் ஆவணங்களின்படி, முழுமையான இயக்கம் (full run) பல மணிநேரங்கள் மற்றும் பல GB வட்டு இடத்தைப் பிடிக்கும். இதற்கு Tongdaxin quote host-உடன் நேரடி இணைப்பு தேவைப்படுகிறது, இதைத்தான் asl servers test உறுதிப்படுத்துகிறது. asl init --profile quick அதற்குப் பதிலாக சமீபத்திய மூன்று ஆண்டுகளை மட்டும் சில நிமிடங்களில் உள்ளடக்குகிறது; அந்த காலக்கட்டத்தில் வர்த்தகம் செய்யப்பட்ட அனைத்து நிறுவனங்களின் பெயர்களையும், சந்தையிலிருந்து வெளியேறியவை உட்பட, இது தக்கவைத்துக் கொள்கிறது. asl run daily என்பது அதன் பிறகு செய்யப்படும் கூடுதல் பணி (incremental job) ஆகும். asl status --datasets ஒவ்வொரு தரவுத்தொகுப்பிற்கும் (dataset) கவரேஜ் மற்றும் புதுப்பிப்புத் தன்மையை அறிக்கையிடுகிறது. asl serve 127.0.0.1:8787 என்ற முகவரியில் வாசிப்பு-மட்டும் (read-only) வசதி கொண்ட ஒரு dashboard-ஐ வழங்குகிறது.

இந்த களஞ்சியத்தில் (repository) எந்த தரவும் முன்கூட்டியே வழங்கப்படுவதில்லை. ஒவ்வொரு Parquet கோப்பும் உங்கள் கணினியிலேயே உருவாக்கப்படுகிறது. ஒவ்வொரு வரிசையிலும், எந்த மூலத்திலிருந்து அது பெறப்பட்டது மற்றும் எப்போது பெறப்பட்டது என்பதற்கான வரிசை-நிலை வம்சாவளி (row-level lineage) பதிவு செய்யப்படுகிறது.

39 தரவுத்தொகுப்புகள் (datasets) எவை?

இவை குறிப்புத் தரவுகளிலிருந்து (reference data) தொடங்கி வெளிப்புறமாக அடுக்கப்பட்டுள்ளன: 36 தொகுக்கப்பட்ட அட்டவணைகள் மற்றும் 3 பெறப்பட்ட (derived) தரவுத்தொகுப்புகள்.

  • குறிப்புத் தரவு: கருவிகள் (instruments), 2016 முதல் 2027 வரையிலான வர்த்தக நாட்காட்டி, வர்த்தக நிலை.
  • சந்தைத் தரவு: தினசரி bars, குறியீட்டு (index) bars, 1-நிமிடம் மற்றும் 5-நிமிடம் bars, வர்த்தக ticks, கமாடிட்டி bars, சரிசெய்தல் காரணிகள் (adjustment factors), பட்டியலிலிருந்து நீக்கப்படும் நிகழ்வுகள் (delisting events).
  • நிறுவன நிகழ்வுகள்: நிறுவன நடவடிக்கைகள் (corporate actions), அறிவிப்பு குறியீடு, வருவாய் வெளியீட்டு அட்டவணை.
  • அடிப்படை மற்றும் மதிப்பீடு: நிதிநிலை அறிக்கை உருப்படிகள், மதிப்பீட்டு அளவீடுகள் (valuation metrics), ஆய்வாளர் ஒருமித்த கருத்து (analyst consensus).
  • மூலதனப் பாய்வு: நிதிப் பாய்வு (fund flow), மார்ஜின் வர்த்தகம், வடக்கு நோக்கிய பாய்வுகள் மற்றும் பங்குகள் (northbound flows and holdings), பெரிய ஆர்டர் வெளிப்பாடுகளின் டிராகன்-டைகர் போர்டு, பிளாக் டிரேடுகள், நிறுவன முதலீடுகள்.
  • கட்டமைப்பு மற்றும் தொழில்: துறை உறுப்பினர்கள், குறியீட்டு உறுப்பினர்கள் (index constituents), தொழில் உறுப்பினர்கள், தொழில் குறியீடு.
  • மேக்ரோ: மேக்ரோ குறிகாட்டிகள், சந்தை அகலம் (market breadth), பொருளாதார நாட்காட்டி.
  • உணர்வு மற்றும் சுழற்சி: உணர்வு மதிப்பெண்கள் (sentiment scores), ஹாட் ரேங்க், துறை bars, துறை நிதிப் பாய்வு, செய்தித் தலைப்புகள், ஃபிளாஷ் செய்தி கம்பி (flash news wire).
  • இடர் மற்றும் இணக்கம்: பங்கு திறப்பு அட்டவணை (share unlock schedule), ஒழுங்குமுறை நிகழ்வுகள்.

ஒரு தரவுத்தொகுப்பு எங்கே அமைந்துள்ளது என்பது, அதன் ஆசிரியர் எதற்கு முக்கியத்துவம் அளிக்கிறார் என்பதை உணர்த்துகிறது. சரிசெய்தல் காரணிகள் மற்றும் பட்டியலிலிருந்து நீக்கப்படும் நிகழ்வுகள் ஆகியவை தினசரி bars-க்கு அருகிலேயே சந்தைத் தரவு அடுக்கில் உள்ளன; அவை பின்னிணைப்பில் வைக்கப்படவில்லை. இந்த இட அமைப்பே, வரலாற்றுத் தரவுகளைக் கொண்டு கருத்துகளைச் சோதிக்கும் எவருக்கும் இந்தத் திட்டத்தின் மிக மதிப்புமிக்க பாதியாகும்.

உள்ளூர் தரவுத்தளம் survivorship bias-ஐ எவ்வாறு கையாள்கிறது

இன்றைய தேதியில் சந்தையில் பட்டியலிடப்பட்டுள்ள நிறுவனங்களை மட்டும் வைத்து ஒரு ஆய்வை மேற்கொள்ளும்போது survivorship bias ஏற்படுகிறது. இணைக்கப்பட்ட, தனியார் மயமாக்கப்பட்ட அல்லது பட்டியலிலிருந்து நீக்கப்பட்ட நிறுவனங்கள் இந்த ஆய்வில் இடம்பெறுவதில்லை; மேலும், மறைந்துபோன நிறுவனங்கள் பெரும்பாலும் தோல்வியடைந்தவையாகவே இருக்கின்றன.

எங்களுடைய தரவுக்கிடங்கு அமெரிக்க சந்தைக்கான இந்த இடைவெளியை அளவிட உதவுகிறது. ஒவ்வொரு ஆண்டும், மார்ச் மாதத்தின் இரண்டாவது வாரத்தில் வர்த்தகமான அனைத்து குறியீடுகளையும் (symbols) எடுத்துக்கொண்டு, அவற்றில் எத்தனை ஜூலை 2026-ன் கடைசி இரண்டு வாரங்களிலும் வர்த்தகத்தில் இருந்தன என்பதைச் சரிபார்க்கிறோம்:

வினவவும்வர்த்தகத் தொடர்ச்சி: மார்ச் மாத அமெரிக்கக் குறியீடுகளில் ஜூலை 2026 இறுதி வரை வர்த்தகத்தில் உள்ளவை
ஒவ்வொரு எண்ணின் பின்னணியில் உள்ள துல்லியமான SQL
WITH on_tape_now AS (
    SELECT ticker
    FROM global_markets.delayed_stocks_minute_aggs
    WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-07-20')
      AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-07-31')
    GROUP BY ticker
),
cohort AS (
    SELECT toYear(toTimeZone(window_start, 'America/New_York')) AS cohort_year,
           ticker
    FROM global_markets.delayed_stocks_minute_aggs
    WHERE toYear(toTimeZone(window_start, 'America/New_York')) BETWEEN 2016 AND 2025
      AND toMonth(toTimeZone(window_start, 'America/New_York')) = 3
      AND toDayOfMonth(toTimeZone(window_start, 'America/New_York')) BETWEEN 10 AND 14
    GROUP BY cohort_year, ticker
)
SELECT c.cohort_year AS year,
       count() AS names_on_tape_count,
       countIf(n.ticker != '') AS still_trading_count,
       count() - countIf(n.ticker != '') AS gone_count,
       round(100 * countIf(n.ticker != '') / count(), 1) AS still_trading_pct
FROM cohort AS c
LEFT JOIN on_tape_now AS n ON c.ticker = n.ticker
GROUP BY year
ORDER BY year
Run this yourself

2016-ல் அந்த வாரத்தில் வர்த்தகமான 8101 குறியீடுகளில், 50.1% குறியீடுகள் ஜூலை 2026 இறுதியில் தொடர்ந்து வர்த்தகத்தில் இருந்தன, 4040 குறியீடுகள் இல்லை. 2025 தொகுப்பின் விவரம் 86.7% ஆகும். இன்றைய பட்டியலை அடிப்படையாகக் கொண்டு கடந்த 10 ஆண்டுகளுக்குப் பின்னோக்கிச் சென்றால், ஒவ்வொரு ஆண்டும் சந்தையின் கணிசமான பங்குகள் விடுபடுவதைக் காணலாம்.

விடுபட்ட நிறுவனங்கள் அனைத்தும் மிகக் குறைந்த விலையுள்ள (penny stocks) பங்குகள் மட்டுமே என்ற பொதுவான கருத்து நிலவுகிறது. மார்ச் 2021-ன் தரவுகளை அதன் சராசரி தினசரி டாலர் வர்த்தக அளவின் அடிப்படையில் வகைப்படுத்தினால், உண்மை வேறாக இருப்பது தெரியவருகிறது:

வினவவும்சந்தையை விட்டு வெளியேறியவை: மார்ச் 2021-ன் தினசரி டாலர் வர்த்தக அளவு மற்றும் ஜூலை 2026 நிலவரம்
ஒவ்வொரு எண்ணின் பின்னணியில் உள்ள துல்லியமான SQL
WITH on_tape_now AS (
    SELECT ticker
    FROM global_markets.delayed_stocks_minute_aggs
    WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2026-07-20')
      AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2026-07-31')
    GROUP BY ticker
),
march_2021 AS (
    SELECT ticker,
           sum(toFloat64(close) * toFloat64(volume))
             / uniqExact(toDate(toTimeZone(window_start, 'America/New_York'))) AS avg_daily_dollar_volume
    FROM global_markets.delayed_stocks_minute_aggs
    WHERE toDate(toTimeZone(window_start, 'America/New_York')) >= toDate('2021-03-01')
      AND toDate(toTimeZone(window_start, 'America/New_York')) <= toDate('2021-03-31')
    GROUP BY ticker
)
SELECT multiIf(d.avg_daily_dollar_volume >= 1000000000, '$1B or more',
               d.avg_daily_dollar_volume >= 100000000, '$100M to $1B',
               d.avg_daily_dollar_volume >= 10000000, '$10M to $100M',
               d.avg_daily_dollar_volume >= 1000000, '$1M to $10M',
               'under $1M') AS liquidity_bucket,
       count() AS names_count,
       countIf(n.ticker = '') AS gone_count,
       round(100 * countIf(n.ticker = '') / count(), 1) AS gone_pct
FROM march_2021 AS d
LEFT JOIN on_tape_now AS n ON d.ticker = n.ticker
GROUP BY liquidity_bucket
ORDER BY min(d.avg_daily_dollar_volume)
Run this yourself

under $1M பிரிவில் அதிகபட்சமாக 3968 நிறுவனங்களில் 57.5% பங்குகள் விடுபட்டுள்ளன. அதிக வர்த்தகம் நடந்த பிரிவும் இதற்கு விதிவிலக்கல்ல: மார்ச் 2021-ல் ஒரு நாளைக்கு $1B or more வர்த்தகம் செய்யப்பட்ட 89 குறியீடுகளில் 3.4% பங்குகள் ஜூலை 2026 இறுதிக்குள் வெளியேறிவிட்டன. நிறுவன இணைப்பு, தனியார் மயமாக்கல், திவால்நிலை மற்றும் குறியீட்டிலிருந்து நீக்கம் என எதுவாக இருந்தாலும், விலை அட்டவணையில் அதன் முடிவு ஒன்றுதான்: அந்த வரிசைகள் நின்றுவிடும்.

ashare-lake இதை ஒரு முக்கியமான சிக்கலாகக் கருதுகிறது. இதிலுள்ள instruments தரவுத்தொகுப்பு, தற்போது வர்த்தகத்தில் உள்ளவற்றை மட்டும் வடிகட்டாமல், பட்டியலிலிருந்து நீக்கப்பட்ட குறியீடுகளையும் தக்கவைக்கிறது. delisting_events அட்டவணை ஒவ்வொரு நிறுவனமும் எவ்வாறு வெளியேறியது என்பதைப் பதிவு செய்கிறது, மேலும் Python API-ல் உள்ள universe="all_a" அந்தந்த காலகட்டத்தின் தரவுகளை உள்ளடக்கிய வரலாற்றுத் தகவலை வழங்குகிறது. 2016 முதல் 2021 வரையிலான காலகட்டத்தில், survivorship bias-ஐ நீக்கிய backtest முடிவுகளுக்கும், அதை உள்ளடக்கிய முடிவுகளுக்கும் இடையே சுமார் இரண்டு மடங்கு வித்தியாசம் இருப்பதாகத் திட்டத்தின் ஆவணங்கள் தெரிவிக்கின்றன. இது எங்களுடைய backtesting-ல் look-ahead bias குறிப்புகளில் உள்ள சிக்கலின் மறுபக்கமாகும்: அதாவது, எதிர்காலத்தை முன்கூட்டியே அறிந்திருக்கும் ஒரு தரவுத்தொகுப்பை உருவாக்குவது.

Point-in-time தரவுகள்

load("financial_statement_items", as_of="2018-04-30") என்பது, ஒரு குறிப்பிட்ட தேதிக்கு முன்பாக அறிவிக்கப்பட்ட தரவுகளின் சமீபத்திய பதிப்பை வழங்குகிறது; பிற்காலத்தில் திருத்தப்பட்ட எண்களை இது கணக்கில் கொள்வதில்லை. விலை விளக்கப்படங்கள் (bars) adjust என்ற அளவீட்டைக் கொண்டுள்ளன: hfq என்பது பின்னோக்கிய சரிசெய்தலுக்கும் (backward adjustment), qfq என்பது வினவல் காலத்திற்குள் (query window) இயல்பாக்கப்பட்ட தரவுகளுக்கும், மற்றவை மூல விலைகளுக்கும் (raw prices) பயன்படுகின்றன. சந்தை இன்னும் வெளியிடாத எண்களைக் கொண்டு ஒரு காரணியை (factor) உருவாக்குவது எந்தப் பயனும் தராது; LLM மூலம் உருவாக்கப்பட்ட alpha factor குழாய்த்தொடர்களில் (pipeline) முதலில் சரிபார்க்க வேண்டியது இதுவே.

MCP சர்வராகப் பதிவு செய்தல்

Model Context Protocol என்பது ஒரு ஏஜென்ட் கருவிகளைத் தேர்ந்தெடுக்கும் முறையாகும். asl mcp இதை stdio வழியாகப் பேசுகிறது, மேலும் கிளையன்ட் அந்தச் செயல்முறையைத் தொடங்குகிறது:

  • claude mcp add ashare-lake -- asl mcp --config /abs/path/to/ashare-lake.toml
  • மற்ற எந்த MCP கிளையண்டும் அதே இரண்டு அம்சங்களைப் பயன்படுத்துகின்றன: asl கட்டளையாகவும், mcp --config மற்றும் ஒரு முழுமையான பாதையை (absolute path) வாதங்களாகவும் (arguments) கொள்கின்றன. கிளையன்ட் எந்தக் கோப்பகத்திலிருந்தும் (directory) செயல்முறையைத் தொடங்கக்கூடும் என்பதால், பாதை முழுமையானதாக இருக்க வேண்டும்.

தரவுத்தொகுப்புகளை விட கேள்விகளின் அடிப்படையில் வகைப்படுத்தப்பட்ட ஆறு கருவிகள் உள்ளன: என்ன இருக்கிறது மற்றும் அதை எப்படி வாசிப்பது என்பதற்கான describe_lake, ஒரு பெயரிலிருந்து குறியீட்டைக் கண்டறிய resolve_symbol (பட்டியலில் இருந்து நீக்கப்பட்ட பெயர்கள் உட்பட), query_bars, as_of வாதத்தைக் கொண்ட query_fundamentals, மற்ற அனைத்திற்கும் query_dataset, மற்றும் தரவுத்தொகுப்புகளுக்கு இடையே ஒற்றை வாசிப்பு-மட்டும் (read-only) DuckDB SELECT-ஐ இயக்க run_sql. ஒரு --live கொடி (flag), சர்வர் குறியீட்டுத் தேடல்கள் மற்றும் மாற்றப்படாத தினசரி பார்களை (unadjusted daily bars) லேக்கில் எழுதாமல் நேரடியாக அப்ஸ்ட்ரீமிலிருந்து பதிலளிக்க அனுமதிக்கிறது.

முதலில் தெரிந்துகொள்ள வேண்டிய வரம்புகள்

  • A-shares மட்டுமே. ஹாங்காங், அமெரிக்கப் பட்டியல்கள் அல்லது மெயின்லேண்ட் சீனாவுக்கு வெளியே உள்ளவை எதுவும் இதில் இல்லை.
  • இது ஒரு தனிநபர் திட்டம். சிக்கல்கள் (issues) மற்றும் pull requests-களுக்கு இயன்றவரை கவனம் செலுத்தப்படும். தரவு மூலங்கள் மாறலாம் அல்லது IP முகவரி தடுக்கப்படலாம் என்பதால், யாராவது அதைச் சரிசெய்யும் வரை தரவு சேகரிப்பு நின்றுவிடும்; எனவே, எந்தவிதமான தொடர் பயன்பாட்டு உத்தரவாதமும் இல்லை என்று ஆவணங்கள் தெளிவாகக் குறிப்பிடுகின்றன.
  • Apache 2.0 உரிமம் குறியீட்டிற்கு மட்டுமே பொருந்தும், தரவுகளுக்கு அல்ல. ஒவ்வொரு மூலமும் அதன் சொந்த விதிமுறைகளைக் கொண்டுள்ளது. நீங்கள் உருவாக்கும் Parquet கோப்புகளை மறுவிநியோகம் செய்யவோ அல்லது விற்பனை செய்யவோ இந்தத் திட்டத்தின் பராமரிப்பாளர் எந்த உரிமையையும் வழங்கவில்லை. வணிக ரீதியான பயன்பாட்டிற்கு முன் மூலத்தின் விதிமுறைகளை வாசிக்கவும்.
  • இது பயன்படுத்தும் தரவு மூலங்களுக்கு எந்த கணக்கோ அல்லது token-ஓ தேவையில்லை; இதுவே இதன் ஈர்ப்பாகவும், அதே சமயம் இதன் பலவீனமாகவும் உள்ளது.
  • Windows ஆதரவு 0.3.0 பதிப்பில் அறிமுகமானது, Python-ன் குறைந்தபட்ச பதிப்பு 0.3.1-ல் 3.10 ஆக உயர்த்தப்பட்டது.
இந்தத் திட்டத்தின் தகவல்கள் எங்கிருந்து பெறப்பட்டன

பதிப்பு 0.5.0, ஆறு வெளியீட்டுத் தேதிகள் மற்றும் Python-ன் குறைந்தபட்ச பதிப்பு ஆகியவை ஆகஸ்ட் 4, 2026 அன்று வாசிக்கப்பட்ட திட்டத்தின் PyPI வெளியீட்டு வரலாறு மற்றும் CHANGELOG-லிருந்து பெறப்பட்டவை. தரவுத்தொகுப்பு பட்டியல் (dataset catalog), delisting மற்றும் point-in-time செயல்பாடு, CLI flags, MCP கருவிப் பட்டியல், மற்றும் உரிமம் மற்றும் ஆதரவு தொடர்பான வாசகங்கள் ஆகியவை களஞ்சிய ஆவணங்களிலிருந்து (repository docs) பெறப்பட்டவை: docs/datasets/catalog.md, docs/reference/cli.md, docs/reference/mcp.md, மற்றும் docs/legal-and-data-sources.md. மென்பொருள் பதிவுகள் இடுகைகளை விட வேகமாக மாறக்கூடும் என்பதால், நீங்கள் நிறுவும் பதிப்பிற்கான ஆவணங்களைச் சரிபார்க்கவும். இரண்டு survivorship பேனல்கள் எங்களது சொந்த கிடங்கில் உள்ள அமெரிக்க குறியீடுகளை அளவிடுகின்றன, சீனப் பட்டியல்களை அல்ல. இவை A-share சந்தையின் அளவீடு அல்ல, மாறாக அந்த நுட்பத்தின் விளக்கமாக மட்டுமே கருதப்பட வேண்டும்.

அடிக்கடி கேட்கப்படும் கேள்விகள் (FAQ)

உள்ளூர் A-share தரவு ஏரியை (data lake) உருவாக்க API key தேவையா?

இதற்குத் தேவையில்லை. இது பயன்படுத்தும் மூல ஆதாரங்களுக்குப் பதிவு செய்யவோ அல்லது டோக்கன் பெறவோ தேவையில்லை, மேலும் இந்தத் தரவு ஏரி உங்கள் கணினியிலேயே சேமிக்கப்படுகிறது. ஒவ்வொரு ஆதாரத்திற்கும் அதன் சொந்த பயன்பாட்டு விதிமுறைகள் உள்ளன, வணிக ரீதியான பணிகளைத் தொடங்குவதற்கு முன் அவற்றைச் சரிபார்ப்பது அவசியம்.

ashare-lake தரவுகளைப் பின்னோக்கிப் பதிவேற்ற (backfill) எவ்வளவு காலம் ஆகும்?

முழு வரலாற்றையும் பதிவேற்ற சில மணிநேரங்கள் ஆகும் என்றும், பல GB வட்டு இடம் தேவைப்படும் என்றும் ஆவணங்கள் குறிப்பிடுகின்றன. இதற்குத் தரவுகளை வழங்கும் ஹோஸ்டுடன் நிலையான இணைய இணைப்பு தேவை. asl init --profile quick கடந்த மூன்று ஆண்டுகாலத் தரவுகளைச் சில நிமிடங்களில் பதிவேற்றுகிறது, இதில் தற்போது சந்தையிலிருந்து நீக்கப்பட்ட (delisted) நிறுவனங்களின் பெயர்களும் அடங்கும்.

உள்ளூர் A-share தரவு ஏரியில் சந்தையிலிருந்து நீக்கப்பட்ட பங்குகள் (delisted stocks) சேர்க்கப்படுமா?

ஆம், சேர்க்கப்படும். நீக்கப்பட்ட குறியீடுகள் (symbols) instruments தரவுத்தொகுப்பில் அப்படியே இருக்கும், delisting_events அட்டவணை ஒவ்வொரு நிறுவனமும் எவ்வாறு நீக்கப்பட்டது என்பதைப் பதிவு செய்யும், மேலும் universe="all_a" அவற்றை உள்ளடக்கிய வரலாற்றுத் தரவுத் தொகுப்பை உருவாக்குகிறது. மேலே உள்ள எங்களது US அளவீடு, நீக்கப்பட்ட பங்குகளைத் தவிர்ப்பதால் எவ்வளவு தரவு இழப்பு ஏற்படும் என்பதைக் காட்டுகிறது.

AI ஏஜென்ட் ashare-lake-ஐ நேரடியாக வினவ முடியுமா (query)?

ஆம். asl mcp, Model Context Protocol மூலம் ஆறு கருவிகளை வழங்குகிறது. அவற்றில் ஒன்று read-only SQL கருவி என்பதால், ஏஜென்ட் இணையதளங்களை ஸ்கிராப்பிங் (scraping) செய்வதற்குப் பதிலாக உள்ளூர் Parquet கோப்புகளை நேரடியாக வினவுகிறது. இதை claude mcp add ashare-lake -- asl mcp --config /abs/path/to/ashare-lake.toml மூலம் பதிவு செய்யவும்.

ashare-lake என்பது AkShare அல்லது Baostock-க்கு மாற்றா?

இல்லை. இது அவற்றிற்கு மேலாகச் செயல்படுகிறது. அந்த லைப்ரரிகள் தரவுகளை மூல ஆதாரங்களிலிருந்து பெறுகின்றன; இந்தத் திட்டம் அந்தத் தரவுகளைச் சேமித்து, பதிப்பு வாரியாகப் பிரித்து, வரிசை அளவிலான (row-level) ஆதாரங்களுடன் கூடிய Parquet கோப்புகளாக மாற்றுகிறது.


மேலே உள்ள ஒவ்வொரு புள்ளிவிவரமும் உண்மையான சந்தைத் தரவுகளின் அடிப்படையில் சேமிக்கப்பட்ட, பதிப்பு செய்யப்பட்ட வினவலாகும் (query). SQL-ஐப் படிக்க எந்தப் பலகத்தையும் விரிவுபடுத்தவும், அல்லது Strasmore டெர்மினலில் உங்கள் சொந்த தரவுத் தொகுப்பிற்கு இதே survivorship சோதனையை இயக்கவும்.

#market-data#mcp#a-shares#open-source#ai-agents