이 노트북은 관측된 교란변수를 조정한 뒤 내재변동성과 실현변동성의 차이가 이후 주식 수익률과 연관되는지 이중 머신러닝으로 살펴봅니다. 실현 변동성, 주식 모멘텀, 리스크 리버설 스큐를 관련 통제변수로 식별하고, 같은 교차 적합 관측치에서 조정 추정치와 순진한 일반 최소제곱 추정치를 비교합니다. 블록 순열 반증 검정과 패널을 고려한 불확실성 추정도 사용합니다. 확정된 연구 사양에 따라 추정 대상, 적격 관측치, 교차 적합 구조, 엠바고, 위약 검정 설계를…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 550개
이 노트북은 사전학습 시계열 파운데이션 모델 Chronos와 TinyTimeMixer를 LSTM 및 페널티가 적용된 선형 기준 모델과 ETF 패널에서 비교합니다. 각 모델은 단변량 과거 데이터를 입력받습니다. 사전학습 모델은 해당 시계열을 예측하고 예측 경로의 평균을 횡단면 순위 점수로 사용하며, 적합된 기준 모델은 선행 수익률을 직접 예측합니다. 제로샷 모델에는 예측 목표와 기간이 수익률 레이블과 맞지 않으므로 순위 정보계수를 사용합니다. 실험은 모델에…
이 노트북은 가격 변동성, 펀딩 비율, 평균 프리미엄 편차라는 선언된 세 가지 요인을 고정했을 때 암호화폐 무기한 계약의 프리미엄 z점수가 이후 8시간 수익률에 영향을 주는지 추정합니다. 처치가 연속형이므로 목표는 프리미엄 z점수 한 단위당 기대수익률 변화량을 나타내는 기울기입니다. 이 개입 관련 질문을 수익률 예측이나 트레이딩 전략 평가와 구분합니다. 이 방법은 이중 머신러닝을 사용합니다. 교란변수 예측 모델이 교란변수로 결과와 처치를 예측한 뒤, 잔차…
이 노트북은 내재 변동성, 스큐, 기간 구조, 분산 위험 프리미엄 같은 예측 정보를 담은 옵션 시장 특성에 그래디언트 부스팅 트리 모델을 적합합니다. 트리 용량과 회귀 손실 선택을 미래 수익률 및 방향 레이블에 따라 비교하고 워크포워드 검증을 사용합니다. 부스팅 모델은 연속된 트리 체크포인트마다 예측을 생성하므로 각 체크포인트를 평가와 이후 선택을 위한 별도 후보로 셉니다. 노트북은 이를 페널티를 적용한 선형 모델과 비교하고, 트리가 상호작용 항을 수동으로…
이 논문은 구글 검색 활동이 다음 날 지수 중앙값을 웃도는 S&P 100 종목을 예측하는 데 도움이 되는지 검증합니다. 시차를 둔 금융 변수와 검색어 검색량을 결합하고 그래디언트 부스팅 의사결정나무를 학습시켜 결과를 분류합니다. 연구 기간은 2005년부터 2017년까지이며, 평균 ROC 면적은 54.2%에서 56.7%까지로 보고되어 우연보다 높은 예측력을 나타냅니다. 보고된 포트폴리오 실험에서는 여러 데이터 출처를 결합한 모델의 순위가 가장 높습니다.…
이 노트북은 12~-2개월 모멘텀이 베타, 고유 변동성, 시가총액, 분산을 조정한 뒤 다음 달 US 기업 수익률을 예측하는지 확장 윈도우 이중 머신러닝 분석으로 살펴봅니다. 이전 달 데이터를 사용해 교란 요인 모델을 적합하고, 학습 기간과 테스트 기간 사이에 엠바고를 적용하며, 마지막 2016 홀드아웃은 제외합니다. 조정 추정치를 동일한 아웃오브폴드 관측치에서 구한 단순 OLS와 비교하고, 시간 및 기업 간 의존성을 고려해 Driscoll-Kraay 추론을…
이 노트북은 SEC 8-K 공시에서 구조화된 기업 사건 정보를 추출해 Neo4j 지식 그래프에 적재하는 파이프라인을 제시합니다. 언어 모델은 공시를 일괄 처리해 주체, 관계, 객체, 타임스탬프를 포함한 이벤트 레코드를 생성합니다. 명시적인 이벤트 및 관계 스키마를 사용하고 모델 출력을 검증하며 엔터티 형식을 정규화합니다. 지원되지 않는 관계, 날짜, 범주는 검토를 위해 미확정 상태로 둡니다. 콘텐츠 해시, 안정적인 이벤트 및 실행 식별자, 그래프 스냅샷을…
이 노트북은 기업 특성 데이터셋에서 XGBoost, LightGBM, CatBoost의 Optuna 하이퍼파라미터 탐색을 비교합니다. 각 라이브러리에서 트리 구조 Parzen 추정기, 중앙값 가지치기, 조기 종료, 영구 저장소를 사용하는 탐색 실험을 별도로 진행합니다. 평균제곱오차와 평균절대오차 중 선택을 범주형 하이퍼파라미터로 포함하고, 평균 횡단면 정보계수로 검증 성능을 측정합니다. 노트북은 이 데이터셋의 두꺼운 꼬리 수익률에서 MAE 손실 함수가 세…
이 노트북은 시간가중평균가격(TWAP) 체결 규칙의 시연을 사용해 행동 모방과 역강화학습(IRL)을 비교합니다. 행동 모방은 관측한 시장 상태를 행동에 직접 대응시키고, IRL는 체결 피처에 대한 선형 보상을 적합해 추론한 목적 함수에서 정책을 도출합니다. TWAP은 알려진 기준 목적을 제공합니다. 거래를 균등하게 분산해 단계별 시장 충격을 낮추는 동시에 시간에 따른 가격 변동 노출의 균형을 맞춥니다. 노트북은 두 가지 보상 적합 방법을 설명합니다. 고정된…
이 학습 유틸리티는 DeePM 스타일 모형의 최적화 루프를 설명합니다. 미래 수익률, 변동성 스케일링, 마스크, 거래 비용, 설정된 워밍업 및 소프트 최소화 설정을 전달하며 강건한 샤프 지향 손실을 사용해 AdamW로 모형 매개변수를 업데이트합니다. 유한하지 않은 손실은 건너뛰며, 각 최적화 단계 전에 그래디언트를 클리핑할 수 있습니다. 정해진 간격으로 모형을 여러 배치에서 통합한 검증 수익률로 평가합니다. 학습 목적 함수와 샤프 지표를 검증 샤프와 함께…
이 사례 연구는 ETF 수익률 레이블에 그래디언트 부스팅 트리를 적합하고, 강한 릿지 정규화에서 좋은 성과를 보인 선형 기준선과 비교합니다. 트리는 시장 스트레스 국면에 따라 모멘텀이 다르게 작동하는 경우처럼 상호작용을 찾을 수 있지만, 탐욕적 분할은 릿지가 결합할 수 있는 상관된 피처 중 하나를 임의로 선택할 수 있는 이유를 설명합니다. 그리드는 트리의 용량과 손실 함수를 바꾸고 학습 중 여러 체크포인트에서 각 설정을 평가합니다. 보고된 학습 곡선에 따르면…
이 문서는 사례 연구의 Parquet 데이터로 피처 스토어 개념을 직접 보여줍니다. 피처 뷰는 엔터티 키, 이벤트 시각, 사용 가능 기간, 피처 열을 지정합니다. 모델 학습에서는 과거 값을 해당 시점에 알 수 있었던 의사결정 시각에 맞춰 조인하고, 실사용에서는 의사결정 시점까지 이용 가능했던 최신 값을 조회합니다. 이 규칙을 일치시키면 학습·서빙 간 편향을 방지하는 데 도움이 됩니다. 워크플로는 사례 연구의 교차 검증 구간 경계에서 학습 및 서빙 날짜를…
이 문서는 금융 데이터 정제 방법과 전처리를 학습 데이터와 테스트 데이터 분할에 맞추는 방법을 소개합니다. 핵심은 스케일링이나 윈저화 같은 변환을 학습 데이터만으로 추정하는 것입니다. 전체 데이터셋을 사용하면 미래 관측치 정보가 모델 개발에 유입될 수 있습니다. 중복 처리, 도메인 필터, 결측 구간 표시, 반전 급등 탐지, 이상치 클리핑, 범주형 인코딩, 주기가 다른 데이터셋 정렬 등 재사용 가능한 작업을 설명합니다. 노트북은 주식, ETF 및 기타 시장…
이 노트북은 후속 텍스트 분석을 위해 10-K와 10-Q 공시의 서술형 섹션을 추출하는 방법을 설명합니다. 양식별 항목 번호를 매핑하고 문단 경계를 보존하면서 공시 HTML를 변환하며, 문서 머리말과 꼬리말을 정리합니다. 목차와 본문 상호 참조에 같은 항목이 반복되어도 섹션의 시작과 끝을 찾아냅니다. 공시를 식별하고 정보 이용 가능 시점을 정하기 위해 접수 번호와 접수 타임스탬프를 보존하는 것도 강조합니다. 비어 있거나 지나치게 짧거나 긴 섹션이 있는지 추출…
이 노트북은 오프라인 머신러닝 파이프라인과 QuantConnect의 LEAN 엔진 사이의 배포 경계를 보여줍니다. ETF 사례 레지스트리에서 예측 집합을 선택하고 학습 및 예측 출처를 검증한 뒤, 플랫폼이 사용할 수 있는 JSON 구조로 표본 외 홀드아웃 예측을 내보냅니다. 플랫폼 알고리즘은 모델 추론 파이프라인을 재현하지 않고 해당 점수에 포트폴리오 규칙을 적용합니다. 예측을 고정하면 연구자가 재학습 없이 임계값, 포지션 한도, 리밸런싱 규칙을 시험할 수도…
이 노트북은 시계열 관측값의 순서와 결합된 형태를 보존하는 고정 길이 특성인 경로 시그니처를 설명합니다. 첫 번째 시그니처 차수는 전체 변화를 기록하고, 두 번째 차수 항은 좌표 쌍 사이의 부호 있는 면적을 담습니다. 시간을 경로 좌표에 추가하면 총수익률은 같더라도 가격 경로가 다른 경우를 구별할 수 있고, 거래량을 더하면 가격과 거래량의 동반 움직임을 나타내는 특성을 만들 수 있습니다. 중복 특성을 줄이는 로그 시그니처를 권장하며, 차수가 높아질수록 특성…
이 문서는 트레이딩 사례 전반의 모델 학습, 예측, 인과 추정, 백테스트를 기록하는 실행 로그 시스템을 설명합니다. 사례 설정에서 학습 메뉴와 모델 사전 설정으로 이어진 구성이 데이터 파일, 특성 열, 폴드 날짜, 예측 행, 전처리, 추정기 매개변수, 소프트웨어 버전을 포함한 확정 명세가 되는 과정을 다룹니다. 이 명세의 표준화된 표현으로 실행 식별자를 만듭니다. 아카이브는 학습 실행, 예측 집합, 백테스트를 3단계 엔터티 모델로 연결하고 인과 실행은 별도…
이 노트북은 가우시안 혼합 모형을 사용해 주식, 채권, 통화, 원자재의 요인 및 시장 시계열 9개에서 월간 수익률을 군집화합니다. 불완전한 데이터가 있는 달을 제외한 뒤, 척도 차이가 군집화를 좌우하지 않도록 시계열을 표준화합니다. 서로 다른 특성에 가치를 두는 기준으로 후보 군집 수를 비교하고, 시간에 따른 변화와 날짜가 기록된 사건을 바탕으로 결과 그룹을 살펴봅니다. 각 군집 안의 요인 성과는 전체 평균이 조건부 수익률과 분산투자 양상을 어떻게 가릴 수…
이 장은 트레이딩 아이디어를 문서화된 특성 명세로 바꾸는 프레임워크를 제시합니다. 연구자는 특성의 시간 범위를 의도한 의사결정에 맞추고, 구동 요인 가설을 밝히며, 예측 신호와 맥락을 설명하는 상태 변수를 구분해야 합니다. 기준 관점, 표현 방식, 집계 방법은 경제적 주장에 따라 정해야 합니다. 가설을 바꾸는 변환과 주로 노이즈를 조절하는 변환도 구별해야 합니다. 이 장은 가격·거래량 특성, 시장 미시구조, 상품 간 관계, 파생상품 내재 지표, 펀더멘털,…
이 가이드는 인과 효과 추정과 인과 구조 발견을 구분하고, 일반적인 연구 질문에 적합한 파이썬 라이브러리를 안내합니다. 조정 구조를 알고 있거나 명시적으로 지정한 경우 EconML과 DoWhy로 효과를 추정할 수 있으며, Tigramite와 causal-learn은 시계열 또는 횡단면 데이터에서 구조를 제안합니다. 이산 처치에 초점을 둔 CausalML이나 베이지안 구조적 시계열 방법이 더 적합할 수 있는 경우도 설명합니다. 선택은 처치 유형, 데이터 형태,…
이 노트북은 백테스트와 실거래 파이프라인이 일관되게 작동하는지 확인하는 결정론적 프레임워크를 제시합니다. 가격 봉에서 의사결정으로 이어지는 특성 계산, 예측, 신호, 주문 규모 단계를 비교합니다. 고정된 합성 가격 테이프를 사용해 두 파이프라인에 동일한 입력을 제공하므로 시장 변동과 기술적 불일치를 더 쉽게 구분할 수 있습니다. 검사는 릴리스 게이트로 설계되었습니다. 예상하지 못한 차이가 있으면 테스트 묶음이 실패하고, 의도적인 차이는 명시적으로 정의하고…
이 노트북은 암호화폐 무기한 선물 시장의 시간봉에 걸쳐 고정된 매도 주문을 배분하는 강화학습 에이전트를 학습합니다. 상태에는 시차 수익률, 변동성, 직전 시간 거래량, 현물 대비 무기한 계약 프리미엄, 펀딩 정산까지 남은 시간이 포함됩니다. 날짜를 기준으로 학습과 평가를 나누고, 동일한 평가 구간에서 여러 체결 일정을 대응 차이와 표준오차로 비교합니다. 프리미엄과 펀딩이 매도자의 체결 조건에 어떤 영향을 줄 수 있는지 설명하면서, 이를 가격 방향 신호가 아닌…
이 사례 연구는 다른 모델 계열과 동일한 시점별 CME 선물 특성 행 및 워크포워드 폴드에서 매개변수 효율적인 신경망 앙상블 TabM을 평가합니다. 대부분의 매개변수를 공유하면서 모델 간 변동을 평균 내는 방법으로 TabM을 소개하고, 작고 노이즈가 많은 패널에서 적합과 일반화의 균형을 확인하기 위해 모델 용량을 바꿉니다. 명시된 평가는 동일가중 검증 백테스트와 샤프를 기준으로 정해진 에포크 체크포인트 중 하나를 선택합니다. 노트북은 신뢰할 수 있는 비교를…
이 노트북은 최근 6개월을 건너뛴 모멘텀이 21일 미래 수익률에 영향을 주는지, 그 효과가 시장 변동성에 따라 달라지는지 살펴보는 절차를 제시합니다. 학습 데이터에서 이중 머신러닝으로 효과를 추정하며 변동성과 수익률 곡선을 통제 변수로, 시장 변동성을 효과 조절 변수로 사용합니다. 변동성 레짐은 홀드아웃 이전 데이터로 정의하고, 추정 결과를 제한 및 축소된 포지션 규모 조정 규칙에 반영합니다. 그런 다음 홀드아웃 구간에서 거래 비용을 포함해 해당 규칙을 단순…