이 노트북은 이중 머신러닝(DML)을 사용해 연속형 ETF 모멘텀 지표가 이후 수익률에 미치는 조정 효과를 추정합니다. 최근 및 장기 변동성, 시장 국면, 수익률 곡선 기울기를 통제합니다. 조정하지 않은 회귀를 EconML 및 직접 구현한 DML와 비교하고, 교란 보정용 모델 선택이 추정치에 미치는 영향을 논의합니다. 인과적 해석은 충분한 처치 전 통제 변수와 다른 식별 가정에 달려 있으며, 관측되지 않은 충격과 모델 오지정은 여전히 편향의 원인이 될 수…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 322개
이 노트북은 신호와 자산 배분부터 비용 및 위험 오버레이까지 전략 파이프라인 전반에 등록된 ETF 백테스트를 평가합니다. 모델을 적합하거나 새 백테스트를 추가하지 않고 기존 예측과 백테스트를 읽어, 등록된 결과에서 집단별 및 짝비교 지표를 도출합니다. 분석에는 전략 지표의 부트스트랩 신뢰 구간, 선택 편향 측정치, 단계별 비교, 동일 가중 ETF 유니버스 벤치마크를 대상으로 한 검증 및 홀드아웃 비교가 포함됩니다. 벤치마크 대비 알파, 베타, 정보 비율도…
이 노트북은 FX 통화쌍 사례 연구의 LSTM 예측 실행을 설정합니다. 모델은 룩백 시퀀스에서 은닉 상태를 이어가며, 노트북은 공유 구성 및 연구 계획 도구를 통해 아키텍처와 학습 설정을 정합니다. 연구에서 선언한 라벨과 구성된 LSTM 아키텍처를 사용하고, 요청이 의도한 모델 모집단을 다루는지 확인하며, 적합을 실행하거나 저장된 가중치를 불러오기 전에 예상 예측 정체성과 체크포인트를 기록합니다. 시퀀스 적격성은 결측 구간을 고려합니다. 일별 관측치가 빠지면…
이 노트북은 NASDAQ ITCH에서 파생한 거래 기록으로 장중 트레이딩 활동을 살펴봅니다. 개별 거래를 시간 구간으로 재표본화하고, 활동 수준이 서로 다른 세 구간에서 각각 선택한 종목 하나의 주식 거래량, 거래 건수, 마지막 가격, 거래량 가중 가격을 비교합니다. 활동이 가장 적은 종목은 거래가 드문 구간도 보이도록 더 넓은 시간 구간을 사용합니다. 가장 활발한 종목들의 정규화된 거래량 패턴도 평균냅니다. 각 구간의 거래량을 해당 종목의 일일 거래량에서…
이 노트북은 ETF 수익률 예측에서 불확실성을 표현하는 방법을 살펴보며 몬테카를로 드롭아웃과 딥 앙상블을 비교합니다. 드롭아웃은 추론을 반복하는 동안 활성 상태로 유지되고, 앙상블은 별도로 학습한 네트워크 간의 불일치를 측정합니다. 이런 산포는 불확실성을 추정하지만 그 자체로 커버리지 속성을 가진 구간을 제공하지는 않습니다. 분할 컨포멀 보정은 예측 오차를 구간으로 변환하며, 일반 방식과 불확실성 정규화 방식을 모두 살펴봅니다. 노트북은 시간순…
이 노트북은 여러 트레이딩 사례 연구에 등록된 이중 머신러닝 추정치를 모아 불확실성과 진단 결과를 비교합니다. 각 연구 레지스트리의 최신 행을 불러와 레지스트리 무결성과 라벨 고유성을 확인하고, 커버리지를 명시하며, HAC 통계량과 신뢰 구간을 도출합니다. 추정된 효과는 각각의 고유 단위가 다르므로 포레스트 플롯은 효과 크기를 그대로 순위화하는 대신 무차원 HAC 통계량을 비교합니다. 또한 순진한 OLS 계수와 직교화 추정치를 대조하고, 교란 편향 측정값과…
이 노트북은 S&P 500 옵션 연구의 예측을 위해 명시된 LSTM 모델을 적합합니다. 네트워크는 각 종목 이력의 시간순 구간을 입력받고, 직접 설계한 특성에만 의존하는 대신 게이트 순환 상태를 사용해 여러 세션에 걸친 정보를 표현합니다. 설정된 룩백, 네트워크 크기, 드롭아웃, 배치 크기, 학습 체크포인트가 모델 요청을 정의합니다. 공통 워크플로가 폴드 구성, 검증 간격, 체크포인트, 재시작, 예측이 적격 행만 정확히 포함하는지 확인하는 절차를 처리합니다.…
이 노트북은 금융 뉴스 문장을 긍정, 중립, 부정으로 분류하는 세 가지 방법을 비교합니다. 로지스틱 회귀를 사용한 TF-IDF 단어 및 구문 특성, 분류기와 평균 정적 단어 벡터, 사전 학습된 FinBERT 감성 모델입니다. 높은 일치도를 보이는 Financial PhraseBank 하위 집합에서 동일한 층화 테스트 분할을 사용해 방법을 평가합니다. 두 어휘 기반 접근법은 학습 분할과 추정기를 공유하며, FinBERT는 별도 미세 조정된 분류기를 추가 조정…
이 노트북은 SEC XBRL 데이터로 분기별 주식 펀더멘털 패널을 구축하고 살펴보는 방법을 설명합니다. 각 관측치에는 해당 회계 기간과 정보가 공개된 신고일이 모두 포함됩니다. 과거 테스트에서는 이 구분이 중요합니다. 기간 종료일만으로 필터링하면 투자자가 아직 알 수 없었던 수치가 포함될 수 있기 때문입니다. 노트북은 개념별 커버리지와 신고 지연을 측정하고, 신고일을 고려한 시점별 조회로 얻은 최신 관측치와 기간 기준 조회 결과를 비교합니다. 예시에서는 매출…
이 노트북은 회계 및 가격 기반 특성이 다음 달 US 주식 수익률을 단독으로 예측하는지 평가합니다. 각 특성과 수익률 라벨 간 월별 횡단면 순위 상관을 계산한 다음 개발 기간의 여러 달에 걸쳐 요약합니다. 이 과정은 별도로 보류한 홀드아웃을 제외하고, 패널 무결성을 확인하며, 최소 커버리지와 횡단면 폭을 요구하고, 워크포워드 학습 및 검증 기간에도 연관성이 지속되는지 살펴봅니다. 관련된 월별 관측치와 다수 후보 테스트에서 생기는 불확실성을 반영하고, 어떤…
이 노트북은 CME 선물 사례 연구에서 후보 특성을 선별해 미래 수익률과 비교합니다. 각 특성의 값과 이후 수익률 간 횡단면 순위 상관을 계산하고, 날짜별 상관을 요약하며, 중첩된 수익률 기간에 따른 불확실성을 조정하고, 테스트한 전체 항목에 벤저미니-호크버그 거짓 발견률 제어를 적용합니다. 커버리지와 오래된 데이터 여부를 확인하고, 워크포워드 검증 연도와 대체 라벨 기간에 걸친 일관성을 살펴보며, 근거와 함께 진행·수정·중단 평가를 기록합니다. 이후 확인…
이 노트북은 주식 수익률과 별개로 시장 상황을 설명하기 위해 월별 거시경제 지표를 군집화합니다. FRED 시계열을 월말 관측값에 맞추고 실업률, 연방기금금리, 수익률 곡선 스프레드, 전년 대비 CPI 변화를 표준화한 다음 가우시안 혼합 모형을 적합합니다. 상승하는 CPI 수준 대신 인플레이션 변화량을 사용하면 군집이 주로 과거와 최근 날짜를 나누는 현상을 피할 수 있습니다. 군집 이름은 명시적인 임계값 규칙으로 사후에 붙이므로, 경제적 라벨은 모델이 자동으로…
이 노트북은 Diffusion-TS를 적용해 합성 일별 ETF 수익률 시퀀스를 생성합니다. 디노이저는 원래 시계열을 예측한 뒤, 그 예측을 다항식 추세, 선택된 푸리에 성분, 잔차로 분해합니다. 시간 영역과 주파수 영역의 목표를 결합해 수익률 값과 스펙트럼 구조를 모두 보존하려 합니다. 시퀀스를 겹치게 구성하고 시간 기준 홀드아웃을 둔 다음, 잡음이 있는 시퀀스로 학습한 분류기를 추가해 가우시안 은닉 마르코프 모델이 식별한 저변동성 또는 고변동성 레짐으로…
이 노트북은 실제 홀드아웃 산출물을 사용해 배포된 금융 모델을 모니터링하는 워크플로를 구성합니다. 드리프트를 측정하기 전에 새로 들어온 특성 데이터가 채워져 있고 구조적으로 유효한지 확인한 다음, 기준 구간과 현재 구간을 비교합니다. 특성 분포 변화는 모집단 안정성 지수와 두 표본 콜모고로프-스미르노프 검정으로 평가합니다. 안정성 임계값은 관례에 따른 기준인 반면 큰 표본에서는 통계적 유의성이 실질적으로 중요하지 않은 변화도 포착할 수 있으므로 두 측정값을…
이 노트북은 SHAP 패널의 릿지 회귀 예측을 ETF로 해석하는 방법을 설명합니다. 선형 모델에서 각 특성의 기여도는 계수에 학습 배경 평균으로부터의 특성 편차를 곱한 값이므로, 폐쇄형 계산과 대조해 확인할 수 있습니다. 전체 기여도 크기, 개별 예측에 대한 워터폴 설명, 확신도가 높았던 예측 중 정답과 오답의 비교, 워크포워드 폴드 간 중요도 안정성을 다룹니다. 또한 시간 폴드 간 중요도 변화와 한 폴드 안에서의 표본 추출 불확실성이라는 두 가지 불확실성을…
이 노트북은 이후 감성·주제·임베딩 분석에 쓸 수 있도록 SEC 연간 및 분기 공시를 구조화된 텍스트로 변환하는 워크플로를 소개합니다. 원하는 섹션을 서식별 항목 번호에 연결하며, 경영진 논의 섹션이 10-K와 10-Q에서 서로 다른 번호로 표시된다는 점을 강조합니다. 추출 과정에서는 문단 경계를 보존하며 HTML을 정리한 뒤, 목차나 상호 참조에서 처음 등장한 제목을 그대로 선택하지 않고 앞뒤 섹션 경계를 이용해 제목을 찾습니다. 워크플로는 추출 결과가…
이 노트북은 조건부 오토인코더가 계측 주성분 모델을 어떻게 확장하는지 설명합니다. 신경망이 주식 특성을 요인 노출로 매핑하며, 노출과 요인 수익률을 곱하는 구조는 그대로 유지합니다. 학습 구간별로 설정된 미래 수익률 라벨을 재구성하도록 모델을 적합한 다음, 고정된 요인 평균을 검증일의 노출에 적용해 다음 구간에서 주식 순위를 매기는지 평가합니다. 재구성에 나중에 정보계수로 점수화하는 동일 라벨을 사용하므로, 양의 점수가 독립적인 발견은 아닙니다. 그래도 검증…
이 연구는 금융 특성과 GJR-GARCH 변동성 특성을 미래 주식 수익률과 비교해 선별합니다. 각 세션에서 종목 간 특성값과 이후 수익률의 순위 상관을 계산한 뒤, 평균 연관성, 워크포워드 검증 구간 간 일관성, 여러 후보를 검정한 뒤 결과의 신뢰성을 평가합니다. 예측 연관성을 측정하기 전에 특성의 데이터 범위와 오래된 값도 점검하고 각 특성에 대한 판정을 기록합니다. 분석에는 개발 데이터를 사용하고, 홀드아웃은 나중에 선택한 설정을 위해 남겨둡니다. 미래…
이 자료는 감성 분석, 텍스트 특성 개발, 뉴스와 수익률의 연관성 실험에 쓰이는 금융 뉴스 코퍼스 두 가지를 소개합니다. FNSPID는 헤드라인과 주식 티커를 연결하며 오랜 기간을 포괄합니다. 전체 모음과 함께 더 작은 표본도 이용할 수 있습니다. Bloomberg 아카이브에는 더 짧은 기간의 뉴스 텍스트와 구조화된 금융 시계열이 있으며, 감성·주제 분석과 데이터셋 간 강건성 실험을 위한 보조 자료로 제시됩니다. 두 자료 모두 공개 데이터 허브를 통해…
이 문서는 블랙-숄즈 모형으로 유럽형 콜·풋 가격을 도출하고, 풋-콜 패리티로 둘의 관계를 확인하며, 관측된 옵션 가격에 맞는 변동성을 수치적으로 풀어 내재변동성을 계산합니다. 또한 델타, 감마, 베가, 세타, 로를 정의하고, 머니니스와 만기까지 남은 시간에 따라 민감도가 어떻게 달라지는지 차트로 설명합니다. 일정한 변동성, 연속 거래, 유럽형 권리 행사 등 모형의 가정을 시장 현실과 대조해 결과가 달라질 수 있는 지점을 설명합니다. 계산 결과를 S&P…
이 모듈은 검증 단계와 전략 라벨 전반에서 홀드아웃 선택 기준을 구성하는 방법을 정의합니다. 고정된 후보 집합과 실시간 재구성이 서로 다른 설정을 선택하거나, 후속 분석에서 우승 설정과 다른 라벨을 사용하는 불일치를 다룹니다. 공통 구성에는 명시된 라벨 전반의 신호, 배분, 리스크 오버레이 단계가 포함되며, 후속 분석에는 선택된 결과의 라벨을 사용합니다. 기록된 후보 집합이 있으면 모듈은 그 안의 백테스트 결과에서 선택합니다. 없으면 적격 집합을 다시…
이 노트북은 주성분 10개가 포착한 광범위한 움직임을 통제한 뒤, 포트폴리오 운용 전략 4개가 SPY 수익률에 설명력을 더하는지 검정하는 방법을 보여줍니다. 후보 포트폴리오는 ETF의 최근 모멘텀, 낮은 변동성 또는 단기 반전을 기준으로 순위를 매기고, 시차 수익률로 롱·숏 바스켓을 구성합니다. 각 요인의 조정 전 SPY 로딩을 두 번의 LASSO 회귀로 통제 변수를 선택한 뒤 추정한 조건부 로딩과 비교합니다. 확장 시계열 교차 검증과 폴드별 스케일링 및…
이 문서는 분기별 SEC 13F 대량 공시를 기관 보유 내역 패널로 변환하는 워크플로를 설명합니다. 운용사별로 제출일 기준 가장 최근 공시를 선택하고, 제출자가 입력한 회사명 대신 CUSIP를 사용해 증권을 식별하며, 내재 주당 가격의 중앙값이 비현실적인 공시는 걸러냅니다. 가격 검사는 보고된 보유 포지션 가치를 주식 수로 나누며, 어느 필드가 잘못됐는지 판별하지는 않지만 단위나 주식 수의 불일치를 드러낼 수 있습니다. 이어서 운용사 순위, 군집도의 대용…
이 문서는 ETF 수익률을 모델링하기 위한 계측 주성분 분석을 설명합니다. 각 펀드에 고정된 요인 노출을 부여하는 일반 PCA와 달리, IPCA는 각 펀드의 노출을 관측 가능한 특성의 공통 선형 함수로 모델링합니다. 교대 최소제곱법을 통해 특성에서 노출로 이어지는 매핑과 요인 수익률을 함께 추정합니다. 제안된 제약은 펀드와 날짜 전반의 정보를 통합하지만, 특성과 노출의 관계를 선형으로 가정한다는 한계가 있습니다. 이 노트북은 워크포워드 폴드에서 5일 및…