رفتن به محتوا
همه اسناد کتابخانه

انتخاب قیمت تعدیل‌شده یا تعدیل‌نشده ETF برای تحلیل

کد یادگیری ماشین برای معامله‌گری

خلاصه

این سند بارگذاری داده‌های بازار ETF را با فیلترهای اختیاری نماد و تاریخ و نیز محدودیتی قطعی بر تعداد نمادهای برگردانده‌شده شرح می‌دهد. نکته اصلی تحلیلی آن، تطبیق سری قیمت با کمیتی است که اندازه‌گیری می‌شود: قیمت‌های تعدیل‌شده برای محاسبه بازده مناسب‌اند، در حالی که برای محاسبات دلاری و تعداد سهم، مانند غربال گردش معاملات یا کارمزد هر سهم، به قیمت‌های تعدیل‌نشده نیاز است.

توضیح می‌دهد چرا عوامل تعدیلی که در نسبت قیمت حذف می‌شوند، می‌توانند مقادیر دلاری را مخدوش کنند. نمونه، قیمت‌های پایانی تعدیل‌شده و معامله‌شده SPY را در تاریخی قدیمی مقایسه می‌کند و نشان می‌دهد فاصله با انباشته شدن تعدیل‌ها بیشتر می‌شود. بارگذار همچنین زمان‌مهرها را به تاریخ تبدیل و نتایج تعدیل‌نشده را بر اساس نماد و زمان مرتب می‌کند. سند استراتژی معاملاتی را شرح نمی‌دهد و کیفیت داده را ارزیابی نمی‌کند؛ راهنمای عملی آن به انتخاب سری مناسب برای محاسبه و دریافت داده از مخزن محلی محدود است.

ایده‌های کلیدی

  • قیمت‌های تعدیل‌شده برای محاسبه بازده مناسب‌اند، چون عوامل تعدیلی مشترک در نسبت قیمت حذف می‌شوند.
  • برای مقادیر دلاری و تعداد سهم، از جمله محاسبه گردش معاملات و هزینه هر سهم، به قیمت‌های تعدیل‌نشده نیاز است.
  • قیمت‌های پایانی تاریخی تعدیل‌شده ممکن است با قیمت‌هایی که واقعاً معامله شده‌اند تفاوت چشمگیری داشته باشند.
  • بارگذار از فیلتر نماد و تاریخ پشتیبانی می‌کند و می‌تواند تعداد نمادها را به‌شکلی قطعی محدود کند.

برچسب‌ها

متن کامل
# loader.py


```py
"""ETF universe loader."""

import polars as pl

from data.exceptions import DataNotFoundError
from utils import ML4T_DATA_PATH
from utils.data_quality import apply_max_symbols


def list_etfs() -> list[str]:
    """List ETF symbols available in the local data store.

    Returns:
        Sorted list of ETF tickers (e.g., ``["ACWI", "AGG", ..., "XLK"]``).

    Raises:
        DataNotFoundError: If ``etfs/etf_universe.parquet`` is missing.

    Example:
        >>> list_etfs()[:3]
        ['ACWI', 'ACWX', 'AGG']
    """
    path = ML4T_DATA_PATH / "etfs" / "market" / "etf_universe.parquet"
    if not path.exists():
        raise DataNotFoundError(
            dataset_name="ETF Universe",
            path=path,
            download_script="data/etfs/market/download.py",
            readme="data/etfs/README.md",
        )
    return pl.scan_parquet(path).select("symbol").unique().collect().to_series().sort().to_list()


def load_etfs(
    symbols: list[str] | None = None,
    start_date: str | None = None,
    end_date: str | None = None,
    max_symbols: int = 0,
) -> pl.DataFrame:
    """Load ETF universe for momentum case study.

    Args:
        symbols: Optional list of symbols to filter (e.g., ["SPY", "QQQ"])
        start_date: Optional start date (YYYY-MM-DD format)
        end_date: Optional end date (YYYY-MM-DD format)
        max_symbols: Limit to N random symbols (0 = all). Seed-deterministic.

    Returns:
        DataFrame with columns: timestamp, symbol, open, high, low, close, volume
    """
    path = ML4T_DATA_PATH / "etfs" / "market" / "etf_universe.parquet"
    if not path.exists():
        raise DataNotFoundError(
            dataset_name="ETF Universe",
            path=path,
            download_script="data/etfs/market/download.py",
            readme="data/etfs/README.md",
        )

    lf = pl.scan_parquet(path)
    ts_type = lf.collect_schema()["timestamp"]

    # Apply filters lazily (parquet pushdown / row-group pruning)
    if symbols:
        lf = lf.filter(pl.col("symbol").is_in(symbols))
    if start_date:
        lit = (
            pl.lit(start_date).str.to_date()
            if ts_type == pl.Date
            else pl.lit(start_date).str.to_datetime()
        )
        lf = lf.filter(pl.col("timestamp") >= lit)
    if end_date:
        lit = (
            pl.lit(end_date).str.to_date()
            if ts_type == pl.Date
            else pl.lit(end_date).str.to_datetime()
        )
        lf = lf.filter(pl.col("timestamp") <= lit)

    # Normalize daily data to Date type (post-filter so pushdown works on raw type)
    if ts_type != pl.Date:
        lf = lf.with_columns(pl.col("timestamp").cast(pl.Date))

    return apply_max_symbols(lf.collect(), max_symbols)


def load_etfs_unadjusted(
    symbols: list[str] | None = None,
    start_date: str | None = None,
    end_date: str | None = None,
) -> pl.DataFrame:
    """Load the traded close and share count, unadjusted for splits and distributions.

    :func:`load_etfs` returns an adjusted panel, which is what a return needs: the
    adjustment divides out distributions, and dividing both ends of a ratio by the same
    factor leaves the ratio alone. A dollar amount has no such cancellation. An adjusted
    close on an early session sits well below what the fund traded at - $87.23 against
    $126.70 for SPY on 2006-01-03 - so a turnover screen or a per-share commission read
    off it is wrong by the cumulative adjustment, and wrong by more the further back it
    looks.

    Use this series for anything denominated in dollars or in shares, and
    :func:`load_etfs` for anything denominated in returns.

    Args:
        symbols: Optional list of symbols to filter (e.g., ["SPY", "QQQ"])
        start_date: Optional start date (YYYY-MM-DD format)
        end_date: Optional end date (YYYY-MM-DD format)

    Returns:
        DataFrame with columns: timestamp, symbol, close, volume

    Raises:
        DataNotFoundError: If ``etfs/etf_universe_unadjusted.parquet`` is missing.
    """
    path = ML4T_DATA_PATH / "etfs" / "market" / "etf_universe_unadjusted.parquet"
    if not path.exists():
        raise DataNotFoundError(
            dataset_name="ETF Universe (unadjusted)",
            path=path,
            download_script="data/etfs/market/download.py",
            readme="data/etfs/README.md",
        )

    lf = pl.scan_parquet(path)
    ts_type = lf.collect_schema()["timestamp"]

    if symbols:
        lf = lf.filter(pl.col("symbol").is_in(symbols))
    if start_date:
        lit = (
            pl.lit(start_date).str.to_date()
            if ts_type == pl.Date
            else pl.lit(start_date).str.to_datetime()
        )
        lf = lf.filter(pl.col("timestamp") >= lit)
    if end_date:
        lit = (
            pl.lit(end_date).str.to_date()
            if ts_type == pl.Date
            else pl.lit(end_date).str.to_datetime()
        )
        lf = lf.filter(pl.col("timestamp") <= lit)

    if ts_type != pl.Date:
        lf = lf.with_columns(pl.col("timestamp").cast(pl.Date))

    return lf.collect().sort(["symbol", "timestamp"])

```

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: MIT

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.