이 노트북은 Yahoo Finance, WikiPrices, FRED 전반에서 통합 OHLCV 인터페이스를 보여준 다음, 각 소스를 최신 ETF 데이터, 장기 이력 주식, 거시경제 시계열에 활용합니다. 수집 우선순위에 따른 대체 방법을 설명하고, 연결한 패널을 감사할 수 있도록 각 관측치의 출처를 기록하라고 강조합니다. ETF 종목군에는 주식, 채권, 원자재 익스포저가 포함되며 후속 로테이션 전략에 사용하도록 구성되어 있습니다. 공급자별 행 범위와 가격…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 1,616개
이 장은 각 의사결정 시점에 이용할 수 있는 정보를 지키면서 금융 머신러닝 모델을 평가하는 방법을 설명합니다. 학습, 검증, 최종 홀드아웃을 구분하고, 무작위로 섞은 k-겹 검증에서는 과거를 예측하면서 미래 관측치로 모델을 학습할 수 있는 이유를 설명합니다. 확장형 및 롤링 워크포워드 폴드는 시간 순서를 유지하며, 확장형 구간은 과거 데이터를 계속 보유하고 롤링 구간은 오래된 데이터를 제외합니다. 선행 수익률 레이블은 검증 기간과 겹칠 수 있으므로, 퍼징으로…
이 종합 노트북은 분산된 ETF 종목군에서 공통 신호를 사용해 동일 비중, 역변동성, 평균-분산 최적화, 계층적 리스크 패리티를 비교합니다. 롤링 Ridge 모델은 모멘텀, 이동평균 거리, 변동성 특성으로 선행 수익률을 추정하고 롱·숏 ETF를 선택합니다. 각 배분 방법에 동일한 신호를 적용해 종목 선택과 배분을 구분한 뒤 포트폴리오 성과, 안정성, 낙폭, 회전율, 국면별 특성을 평가합니다. 홀드아웃 전 선택 기간에 배분 방법을 정해 이후 홀드아웃에서…
이 노트북은 입력 구간 전체를 처리해 미래 경로를 예측하는 완전 연결 신경망 예측 구조인 N-BEATS를 구현합니다. 해석 가능한 변형에서는 다항 추세 및 푸리에 계절성 기저를 통해 블록이 성분을 표현하도록 제약합니다. 잔차 역예측을 사용하면 쌓인 블록이 입력의 각 부분을 차례로 설명할 수 있습니다. 제약을 둔 버전과 두지 않은 버전을 SPY 종가에 적합하고, 이름을 붙인 성분을 도식화해 가장 최근 가격을 반복하는 지속성 예측과 오차를 비교합니다. 이…
이 노트북은 각 사례 연구에서 선택된 신호를 고정하고 배분 단계의 백테스트를 비교해 포트폴리오 자산 배분을 분리해 살펴봅니다. 동일 비중, 역변동성, 점수 가중치, 평균-분산 최적화, 리스크 패리티, 계층적 리스크 패리티 등의 방법을 다룹니다. 각 방법에 대해 리밸런싱 및 상위 K개 변형에서 샤프가 가장 높은 설정을 유지한 다음, 사례별 최적 배분 방법과 가장 높은 샤프를 보인 배분 방법 및 가장 낮은 샤프를 보인 배분 방법 간 차이를 비교합니다. 그 차이는…
단일 종목과 거래일의 DataBento 주문별 시장 메시지로 NASDAQ 지정가 주문장을 재구성하는 방법을 설명합니다. 개별 주문 상태를 추적하고, 주문을 가격 수준별로 집계하며, 매수·매도 측을 유지하는 모듈형 엔진을 제시합니다. 추가, 변경, 취소, 체결, 초기화는 주문장을 갱신하고, 거래 기록은 두 번째 주문장 갱신에 적용하지 않고 체결 테이프 분석에 보관합니다. 최우선 호가만 제공하는 피드와 정의되지 않은 가격도 별도로 처리합니다. 정기 스냅샷마다…
이 노트북은 ETF 모멘텀 순위가 가장 높은 포트폴리오에서 리밸런싱 주기가 회전율, 비용 차감 전 성과, 비용 조정 후 결과에 미치는 영향을 살펴봅니다. 일별, 주별, 격주별, 월별 일정에 따른 과거 목표 비중 변동으로 회전율을 추정한 뒤, 예시 스프레드와 시장 충격 및 수수료 가정을 적용합니다. 손익분기 알파는 연간 편도 회전율에 왕복 거래 비용을 곱해 계산하며, 거래 비용을 충당하는 데 필요한 총수익률 기준을 제시합니다. 별도의 시나리오 분석에서는 신호…
이 노트북은 두 가지 기간의 ETF 수익률을 예측하는 LightGBM 모델과 릿지 기준 모델을 비교합니다. 시장 스트레스에서 모멘텀이 다르게 작동하는 것처럼 트리가 국면별 상호작용을 찾아낼 수 있는 이유를 설명하는 한편, 특성 간 상관관계가 높으면 탐욕적 분할이 불안정해질 수 있다고 짚습니다. 실험에서는 트리 용량과 손실 함수를 달리하고 각 학습 과정의 여러 체크포인트에서 예측을 평가합니다. 제시된 학습 곡선에서는 정보계수가 설정된 학습 길이 전에 정점에…
이 노트북은 디파이 총예치자산(TVL) 시계열을 이더리움 트레이딩의 대체 데이터로 평가합니다. 다음 네 가지 질문을 중심으로 검토합니다. 시계열이 선행 수익률과 관련이 있는지, 데이터가 신뢰할 만하고 재구성 가능한지, 사용이 법적으로 허용되는지, 통합 및 유지보수 비용을 감수할 만큼 가치가 있는지입니다. 신호 분석은 여러 수익률 기간에 대해 다양한 TVL 변환을 테스트하고, 중복 관측치에 따른 불확실성을 조정하며, 비교 횟수를 세고 관계가 시간에 따라…
이 노트북은 13F 공시의 기관 보유 종목을 대상으로 구조화된 그래프 방식 검색과 임베딩 기반 벡터 검색을 비교합니다. 고정된 기준 시점의 보유 현황 스냅샷을 만들고 주식 종목군을 제한한 뒤, 주식 보유자, 기관의 보유 종목, 공통 포지션을 가진 기관에 관한 질문을 생성합니다. 각 질문의 예상 근거 레코드를 정의해 근거 재현율을 측정하고 검색 토큰 예산을 추정합니다. 구조화 검색은 예상 답변도 정의하는 관계형 필터를 사용하므로, 완벽한 재현율은 설계상…
이 노트북은 손실 거래를 각 거래 결정에 연결된 모델 설명과 연계하는 절차를 보여줍니다. 가격 및 거시경제 데이터로 단일 자산 SPY 특성 패널을 만들고, 과거 관측치로 LightGBM 모델을 학습한 다음 이후 관측치로 거래 기록과 SHAP 설명을 구성합니다. 거래 분석기는 최악의 거래에 대한 설명을 군집화해 특성, 국면, 데이터 문제를 조사하는 데 도움이 될 패턴을 찾습니다. 예시에서는 시차를 둔 예측 변수와 시간순 분할을 사용하고, 한 세션 레이블 기간에…
15분봉 예측을 위한 NASDAQ-100 종목 백테스트 워크플로를 설명합니다. 먼저 무작위 신호의 처리 과정을 점검합니다. 무작위 매매는 비용 차감 후 손실이 나야 하므로, 지속적으로 수익이 나는 결과는 미래 데이터 참조, 데이터 정렬 오류 또는 비용 누락 같은 문제를 나타낼 수 있습니다. 그런 다음 공통 백테스트 엔진에서 예측과 진입 방식 조합을 순회하고, 등록된 결과를 수정 샤프 비율을 포함한 통계 지표로 평가합니다. 설명된 설정은 체결 가격으로 구성한…
이 노트북은 NASDAQ ITCH 체결 데이터로 시장 미시구조 지표를 만들고, 거래를 장중 구간으로 집계하며, 유동성 대용 지표와 주문 흐름 신호, 호가창 상태를 구분합니다. 집계 전에 틱 규칙으로 개별 거래를 분류해 매수·매도 거래량으로 의미 있는 주문 흐름 불균형 지표를 만들 수 있게 합니다. 이어서 카일 람다의 비율 근사치, 아미후드 비유동성, 롤 스프레드, 거래 강도를 각각의 입력값 및 해석과 함께 보여줍니다. 핵심 주의점은 구현된 카일 람다가 절대…
이 데모는 Alpaca의 USD 현물 시장에 연결된 상시 가동 가상자산 트레이딩 루프를 설명합니다. 무기한 선물 사례 연구의 종목군을 해당 거래소가 지원하는 현물 거래쌍에 대응시켜, 그중 일부만 거래할 수 있음을 명확히 합니다. 예시 신호는 무기한 선물과 현물 간 프리미엄 신호의 대용치로 사용되는 종가 간 모멘텀의 롤링 z점수입니다. 운영 환경에서는 무기한 선물 및 현물 가격으로 프리미엄을 계산하고, 운영 기록을 위해 펀딩 구간의 타임스탬프를 UTC로…
이 노트북은 동일한 ETF 수익률 패널을 사용해 PyPortfolioOpt, Riskfolio-Lib, skfolio의 포트폴리오 배분을 비교합니다. 학습 기간에 배분 방법을 적합하고, 동등한 목적 함수와 정렬된 가중치가 솔버 허용 오차 내에서 일치하는지 확인한 뒤, 이후 관측치에 고정 배분을 적용해 평가합니다. 평균-위험 방법, 계층적 리스크 패리티, 꼬리 위험 목적 함수, 회전율 또는 집중 가중치에 대한 페널티를 비교합니다. 허핀달 집중도도 사용하며,…
이 노트북은 상장 옵션 신호를 읽고 기초 주식을 거래하는 전략에 사용할 선행 수익률 레이블을 만듭니다. 일별 주가에 액면분할과 배당을 반영하고, 지속적으로 유지되는 종목 식별자를 사용하며, 예정된 진입 및 청산 시점에 체결 가능한 가격 간의 수익률을 정의합니다. 각 선행 구간이 완전한지, 하나의 종목 안에 머무르는지 확인하고, 단순히 이용 가능한 행을 이동하는 대신 거래 세션 수를 셉니다. 레이블에는 보유 기간별 수익률, 위험 조정, 방향성 변형이…
이 노트북은 생존한 US 주식의 동일 비중 포트폴리오가 데이터셋에서 제외된 기업을 포함한 포트폴리오보다 수익률을 얼마나 과대평가할 수 있는지 추정합니다. 먼저 패널에 언제부터 퇴출 기록이 있는지 살펴보고, 활용 가능한 퇴출 이력이 후반 연도에야 시작됨을 확인합니다. 패널에는 상장폐지 사유와 최종 수익률이 없으므로, 공개된 CRSP 비율에 맞춘 시나리오로 마지막 호가 이후의 결과를 모델링합니다. 포트폴리오 편향을 계산하기 전에 수정주가에 기업행동이 반영되지…
이 노트북은 서로 대비되는 시장 구간에서 ETF 모멘텀 특성과 암호화폐 무기한 선물 특성의 공변량 드리프트를 모니터링하는 방법을 보여줍니다. 개별 특성 분포의 변화를 측정하는 모집단 안정성 지수(PSI)를 바서스타인 거리 및 기준 표본과 현재 표본을 함께 구분할 수 있는지 검사하는 도메인 분류기와 비교합니다. 운영 모니터링 예시에서는 점수를 경고 단계로 바꾸고 경고를 종합해 재학습 권고를 만듭니다. 도메인 분류기는 인접한 관측값이 폴드 간에 누출되어 분리…
이 노트북은 잦은 리밸런싱이 적용되는 NASDAQ-100 전략에 거래 비용이 미치는 영향을 살펴봅니다. 먼저 비용이 들기 전의 기존 백테스트에 베이시스포인트 단위 비용 가정을 적용해 비용 상승에 따라 샤프가 어떻게 달라지는지 보여줍니다. 이어서 공통으로 사용하는 동일 가중 상위 k 전략을 전체 유니버스 버전과 비용 필터 적용 버전으로 비교해 거래 비용이 낮은 종목을 선택하는 효과를 분리합니다. 별도의 탐색에서는 리밸런싱 빈도와 주당 비용을 바꿔 거래 빈도가…
이 노트북은 각 주식에 고정 로딩을 할당하는 대신 관측 가능한 주식 특성에 따라 잠재 팩터 로딩을 조정하는 방법으로 도구변수 주성분 분석을 설명합니다. 특성에서 팩터 익스포저로 이어지는 공통 매핑을 통해 학습 패널에 없던 주식의 로딩을 계산하고, 주식 특성이 바뀔 때 로딩을 조정할 수 있습니다. 일반 PCA와 나란히 방법을 제시하며, 의도된 비교에서는 팩터 수, 패널, 워크포워드 폴드를 동일하게 유지합니다. 예측에 나중에 사용되는 수익률에서 누출이 발생하지…
이 노트북은 공매도 없이 완전 투자하는 마코위츠 체계를 구성합니다. 실행 가능한 포트폴리오, 효율적 투자선, 최대 샤프 및 최소 분산 해를 포함합니다. 포트폴리오 분산이 공분산 행렬에 따라 달라지는 방식과 자산이 함께 움직이지 않을 때 분산투자로 위험을 낮출 수 있는 이유를 설명합니다. 자산 수익률 간 중복과 그에 따른 수치적 민감도를 진단하는 데 조건수를 사용합니다. 핵심 교훈은 기대수익률이 공분산보다 추정하기 훨씬 어렵기 때문에 최적화된 가중치가 불안정할…
이 노트북은 모델 순위를 단순한 암호화폐 무기한 선물 포트폴리오로 바꿔 이후 실험에서 규모, 비용, 리스크 통제 변경의 효과를 측정할 수 있게 합니다. 롱에는 점수가 가장 높은 계약을, 숏에는 가장 낮은 계약을 선택하는 진입 규칙을 적용하고, 규모 설정에서 또 다른 변동 요인이 생기지 않도록 동일 가중을 사용합니다. 의사결정에는 예측 타임스탬프를 사용하고 포지션은 라벨 기간 동안 보유합니다. 펀딩 지급은 각 펀딩 시점까지 보유한 포지션에 반영되어 백테스트…
이 노트북은 보정 기간과 평가 기간을 시간순으로 분리하면서 모멘텀 포트폴리오의 StopLoss, TakeProfit, TrailingStop 규칙을 조정하는 방법을 보여줍니다. 보정 데이터로 개별 규칙 범위와 여러 규칙의 조합을 시험한 뒤, 이후 평가 기간을 시작하기 전에 선택한 설정을 고정합니다. 청산된 거래의 최대 불리 및 유리 변동폭은 손절 및 목표 가격 후보를 정하는 또 다른 방법입니다. 이 예시는 고정된 5개 ETF 패널, 동일 비중 상위 3개…
이 문서는 금융 데이터셋의 색인 무결성, 중복, 결측, 이상치, 달력상 누락, 도메인별 이상값을 점검하는 재사용 가능한 진단 항목을 제시합니다. 패널 데이터에서 종목별 순서를 포함해 시간 형식, 정렬, 고유성을 확인하며, 완전히 중복된 행과 값이 다른 채로 반복되는 키를 구분합니다. 커버리지 보고서는 필드, 자산, 시점별 결측값을 요약하며, 추가 검사로 잘못된 가격이나 거래량, 비정상적인 수익률 변화 등을 찾습니다. 진단은 정제 전 원시 데이터를 평가하기…