Перейти к содержимому
Все документы библиотеки

Использование исторических данных по акциям без смещения выживших US

Статья Machine Learning for Trading

Сводка

В документе описан ежедневный набор данных по акциям США US, охватывающий около 3,200 компаний с 1962 по март 2018. В него входят эмитенты, исключённые из листинга, поэтому он подходит для исторических исследований, в которых исключение обанкротившихся или делистингованных компаний могло бы исказить результаты. Данные содержат стандартные поля OHLCV и скорректированную цену закрытия; их можно загружать для выбранных тикеров и дат или использовать небольшую случайную выборку для прототипирования.

Набор данных зафиксирован, поскольку поставщик прекратил его обновлять в марте 2018. Поэтому исследователям следует рассматривать его как неизменяемый исторический источник, а не как текущую рыночную ленту. В документе объясняется, как скачать и загрузить данные parquet, и приводятся примеры исследовательского применения, но нет торгового анализа или свидетельств доходности. Основная исследовательская ценность — заявленный исторический охват и вселенная без смещения выживших; не объясняется, как представлены исключённые из листинга ценные бумаги, как учитываются корпоративные действия и какие ещё проверки качества данных могут потребоваться.

Ключевые идеи

  • Набор содержит ежедневную историю OHLCV примерно по 3,200 компаниям US, включая эмитентов, исключённых из листинга.
  • Исторический ряд охватывает период с 1962 по март 2018 и больше не обновляется.
  • Исследователи могут загрузить всю вселенную или отфильтровать данные по тикеру, диапазону дат либо размеру выборки.
  • В документе описаны доступ к данным и их загрузка, но нет результатов стратегий или анализа качества данных.

Теги

Полный текст
# US Equities (NASDAQ Data Link WIKI Prices)


# US Equities (NASDAQ Data Link WIKI Prices)

Historical US equity OHLCV for ~3,200 companies from 1962-01-02 to
2018-03-27. Survivorship-bias free — includes delisted issuers. The
dataset is frozen (NASDAQ Data Link stopped updating it in March 2018),
so the downloader writes once and you never re-pull.

## Dataset

- **Source**: NASDAQ Data Link (formerly Quandl) `WIKI/PRICES`
- **Coverage**: 1962-01-02 → 2018-03-27 daily OHLCV, ~3,199 US tickers
- **Size on disk**: ~650 MB parquet
- **Access**: Free with a NASDAQ Data Link API key
  (https://data.nasdaq.com/sign-up)
- **Canonical schema**: `symbol`, `timestamp` (Date), `open`, `high`,
  `low`, `close`, `volume`, `adj_close`, …

## Download

```bash
# One-off: ~several minutes, 650 MB
uv run python data/equities/market/us_equities/download.py

# Preview without hitting the API
uv run python data/equities/market/us_equities/download.py --dry-run

# Re-download even if the parquet is already on disk
uv run python data/equities/market/us_equities/download.py --force
```

API key resolution order (first match wins):

1. `--api-key <key>` CLI flag
2. `QUANDL_API_KEY` environment variable
3. `NASDAQ_DATA_LINK_API_KEY` environment variable
4. Same keys in a `.env` file at the repo root

Output: `$ML4T_DATA_PATH/equities/us_equities/us_equities.parquet`.

## Loading

```python
from data import load_us_equities

df = load_us_equities()                        # full universe
df = load_us_equities(symbols=["AAPL", "MSFT"])
df = load_us_equities(start_date="2000-01-01", end_date="2010-12-31")
df = load_us_equities(max_symbols=50)          # random 50 for prototyping
```

If the parquet is missing, the loader raises `DataNotFoundError` with
the exact download command.

## Consumers

- `case_studies/us_equities_panel/` — the dedicated case study (Ch7 →
  Ch20 pipeline) operates on this universe.
- Chapter 2 EDA notebook `01_us_equities_eda.py` — coverage survey.
- Any chapter that needs a long, survivor-free US equities history.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: MIT

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.