이 장은 각 의사결정 시점에 이용할 수 있는 정보를 지키면서 금융 머신러닝 모델을 평가하는 방법을 설명합니다. 학습, 검증, 최종 홀드아웃을 구분하고, 무작위로 섞은 k-겹 검증에서는 과거를 예측하면서 미래 관측치로 모델을 학습할 수 있는 이유를 설명합니다. 확장형 및 롤링 워크포워드 폴드는 시간 순서를 유지하며, 확장형 구간은 과거 데이터를 계속 보유하고 롤링 구간은 오래된 데이터를 제외합니다. 선행 수익률 레이블은 검증 기간과 겹칠 수 있으므로, 퍼징으로…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 550개
이 노트북은 입력 구간 전체를 처리해 미래 경로를 예측하는 완전 연결 신경망 예측 구조인 N-BEATS를 구현합니다. 해석 가능한 변형에서는 다항 추세 및 푸리에 계절성 기저를 통해 블록이 성분을 표현하도록 제약합니다. 잔차 역예측을 사용하면 쌓인 블록이 입력의 각 부분을 차례로 설명할 수 있습니다. 제약을 둔 버전과 두지 않은 버전을 SPY 종가에 적합하고, 이름을 붙인 성분을 도식화해 가장 최근 가격을 반복하는 지속성 예측과 오차를 비교합니다. 이…
이 노트북은 두 가지 기간의 ETF 수익률을 예측하는 LightGBM 모델과 릿지 기준 모델을 비교합니다. 시장 스트레스에서 모멘텀이 다르게 작동하는 것처럼 트리가 국면별 상호작용을 찾아낼 수 있는 이유를 설명하는 한편, 특성 간 상관관계가 높으면 탐욕적 분할이 불안정해질 수 있다고 짚습니다. 실험에서는 트리 용량과 손실 함수를 달리하고 각 학습 과정의 여러 체크포인트에서 예측을 평가합니다. 제시된 학습 곡선에서는 정보계수가 설정된 학습 길이 전에 정점에…
이 노트북은 13F 공시의 기관 보유 종목을 대상으로 구조화된 그래프 방식 검색과 임베딩 기반 벡터 검색을 비교합니다. 고정된 기준 시점의 보유 현황 스냅샷을 만들고 주식 종목군을 제한한 뒤, 주식 보유자, 기관의 보유 종목, 공통 포지션을 가진 기관에 관한 질문을 생성합니다. 각 질문의 예상 근거 레코드를 정의해 근거 재현율을 측정하고 검색 토큰 예산을 추정합니다. 구조화 검색은 예상 답변도 정의하는 관계형 필터를 사용하므로, 완벽한 재현율은 설계상…
이 노트북은 손실 거래를 각 거래 결정에 연결된 모델 설명과 연계하는 절차를 보여줍니다. 가격 및 거시경제 데이터로 단일 자산 SPY 특성 패널을 만들고, 과거 관측치로 LightGBM 모델을 학습한 다음 이후 관측치로 거래 기록과 SHAP 설명을 구성합니다. 거래 분석기는 최악의 거래에 대한 설명을 군집화해 특성, 국면, 데이터 문제를 조사하는 데 도움이 될 패턴을 찾습니다. 예시에서는 시차를 둔 예측 변수와 시간순 분할을 사용하고, 한 세션 레이블 기간에…
이 노트북은 상장 옵션 신호를 읽고 기초 주식을 거래하는 전략에 사용할 선행 수익률 레이블을 만듭니다. 일별 주가에 액면분할과 배당을 반영하고, 지속적으로 유지되는 종목 식별자를 사용하며, 예정된 진입 및 청산 시점에 체결 가능한 가격 간의 수익률을 정의합니다. 각 선행 구간이 완전한지, 하나의 종목 안에 머무르는지 확인하고, 단순히 이용 가능한 행을 이동하는 대신 거래 세션 수를 셉니다. 레이블에는 보유 기간별 수익률, 위험 조정, 방향성 변형이…
이 노트북은 서로 대비되는 시장 구간에서 ETF 모멘텀 특성과 암호화폐 무기한 선물 특성의 공변량 드리프트를 모니터링하는 방법을 보여줍니다. 개별 특성 분포의 변화를 측정하는 모집단 안정성 지수(PSI)를 바서스타인 거리 및 기준 표본과 현재 표본을 함께 구분할 수 있는지 검사하는 도메인 분류기와 비교합니다. 운영 모니터링 예시에서는 점수를 경고 단계로 바꾸고 경고를 종합해 재학습 권고를 만듭니다. 도메인 분류기는 인접한 관측값이 폴드 간에 누출되어 분리…
이 노트북은 각 주식에 고정 로딩을 할당하는 대신 관측 가능한 주식 특성에 따라 잠재 팩터 로딩을 조정하는 방법으로 도구변수 주성분 분석을 설명합니다. 특성에서 팩터 익스포저로 이어지는 공통 매핑을 통해 학습 패널에 없던 주식의 로딩을 계산하고, 주식 특성이 바뀔 때 로딩을 조정할 수 있습니다. 일반 PCA와 나란히 방법을 제시하며, 의도된 비교에서는 팩터 수, 패널, 워크포워드 폴드를 동일하게 유지합니다. 예측에 나중에 사용되는 수익률에서 누출이 발생하지…
이 문서는 웨이블릿 분해와 롤링 스펙트럼 추정이 여러 시간 척도에서 금융 수익률을 어떻게 설명하는지 다룹니다. 웨이블릿은 수익률을 점차 느려지는 주기의 성분으로 나눠 어떤 척도가 변동의 대부분을 설명하는지 살펴볼 수 있게 합니다. 일별 SPY 수익률에 여러 웨이블릿 계열을 적용한 예시에서는 가장 빠른 성분이 분산의 대부분을 차지하고 느린 성분은 계열별로 대체로 비슷하게 나타납니다. 표준 웨이블릿 분해는 각 시점의 이전과 이후 관측값을 사용하므로 예측 특성으로…
이 노트북은 변동성, 모멘텀, 횡단면 캐리 순위를 조정한 뒤 선물 캐리가 이후 수익률에 영향을 미치는지 이중 머신러닝으로 추정합니다. 인과적 설명과 예측 성과를 구분합니다. 수익을 낸 백테스트는 캐리가 수익률을 예측한다는 점을 보여줄 수 있지만, 캐리 자체가 수익률의 원인이라고 입증하지는 못합니다. 유연한 방해변수 모델이 교란변수로 처치와 결과를 예측하고, 표본 내 편향을 줄이기 위해 교차 적합을 사용합니다. 변동성 군집과 겹치는 수익률 라벨 때문에 잔차가…
이 문서는 자본을 배정하기 전에 현행 모델과 후보 모델을 섀도 평가로 비교하는 방법을 설명합니다. 모델의 역할과 승격 임계값을 사전에 정한 뒤, 연율화 샤프 개선도, 최소 관측 기간, 신호 상관도, 포지션 중복도, 상대 최대 드로다운의 다섯 차원에서 후보를 평가합니다. 두 모델은 순위 기반 롱숏 포트폴리오로 점수를 내며, 각 모델의 거래 회전율에 따라 거래 비용을 부과합니다. 최소 개선폭을 요구하면 짧은 기간의 샤프 추정치가 불안정한 문제에 대응할 수 있고,…
이 노트북은 Parquet 소스, 엔터티, 피처 뷰, 타임스탬프, TTL 정책으로 Feast를 설정한 뒤 학습 예시와 실시간 조회 방식의 특정 시점 쿼리에서 피처를 가져오는 방법을 보여줍니다. Feast의 출력을 직접 작성한 시점 기준 조인과 피처별로 비교하며, 엄격한 허용 오차를 적용해 일반적인 반올림 차이가 아니라 잘못된 행을 선택한 문제를 찾아낼 수 있게 합니다. 비교할 때는 서로 다른 조회 의미를 고려해야 합니다. Feast는 TTL 안에서 이전 값을…
이 노트북은 주식 팩터 모델링을 위한 지도 오토인코더를 소개합니다. 횡단면을 재구성해 병목 표현을 학습하는 비지도 오토인코더와 달리, 이 모델은 학습 목표에 미래 수익률도 포함합니다. 따라서 목표값은 예측뿐 아니라 학습된 표현에도 영향을 줍니다. 각 라벨이 손실 함수에 직접 들어가므로 미래 수익률 라벨에 따라 서로 다른 모델이 학습됩니다. 이 설정은 예측값에 더 잘 맞출 수 있지만, 목표값을 좇는 일을 제한할 수 있는 재구성 제약도 약화한다는 점을 노트북은…
이 장은 사전과 단어 수 계산부터 TF-IDF, 정적 임베딩, 순환 신경망, 트랜스포머까지 금융 텍스트 표현 방법을 살펴봅니다. 간단한 방법은 빠르고 해석하기 쉬우며 금융에 맞게 조정하기 좋지만, 맥락 기반 모델은 구절의 모호성과 관계를 더 잘 처리할 수 있다는 장단점을 설명합니다. 실무 흐름에서는 사전 학습 모델, 선택적 도메인 적응, 작업별 미세 조정을 사용해 감성, 서술상의 놀라움, 주제 노출, 구조화된 이벤트 등의 신호를 만듭니다. 모델 품질만으로…
이 노트북은 검색 범위, 답변의 근거 충실성, 적절한 답변 보류, 보안 동작을 각각 측정하는 금융 검색 증강 생성 평가 도구를 만듭니다. 실제 기업 공시에서 일부 맥락을 가져온 수작업 사례 6개로 답변 가능한 질문, 근거 누락, 프롬프트 인젝션, 근거가 뒷받침되지 않는 인용을 시험합니다. 서로 다른 문제를 하나의 정확도 점수로 합치는 대신 실패한 구성 요소를 진단하도록 설계되었습니다. 예시는 토큰 중첩 기반 근거 충실성 점수의 한계를 보여줍니다. 인용된…
이 사례 연구는 US 기업 특성으로 구성한 월간 롱숏 십분위 전략을 평가합니다. 시점별 회계 데이터 시차, 워크포워드 검증, 시대별 거래 비용을 반영해 선형 모델, 그래디언트 부스팅, 잠재 요인 접근법을 비교합니다. 검증 결과가 가장 좋은 것으로 보고된 계열은 윈저화한 선행 수익률에 그래디언트 부스팅 모델을 적용한 방식입니다. 지도 학습 오토인코더도 독립형 신호로 신뢰할 만하다고 설명합니다. 연구에서는 여러 폴드에 걸쳐 긍정적인 검증 성과를 보고했으며, 대안…
이 노트북은 횡단면 정보계수(IC)와 예측 회전율을 함께 고려하며 Optuna로 LightGBM 수익률 모델을 튜닝합니다. 비교를 위한 단일 목적 탐색은 IC를 최대화합니다. NSGA-II 다목적 탐색은 파레토 최적 설정을 찾아 신호 순위 품질과 거래 비용의 대리 지표인 회전율 사이의 절충 관계를 보여줍니다. 이 경계선은 검증 점수 하나만 목표로 삼는 대신 비용 감내 수준에 맞춰 모델을 선택하는 데 도움이 됩니다. 노트북은 ETF에서 선택한 ETF…
이 분석은 부호가 있는 모델 수익률 예측을 이진 포지션으로 바꾸는 세 가지 방법을 비교합니다. 고정된 0 기준값, 종목별 후행 백분위수, 종목 간 횡단면 백분위수입니다. 조회 기간과 백분위수 임계값을 바꾸며 ETF와 암호화폐 무기한 계약의 등록된 검증 예측에 규칙을 적용합니다. 수익률이나 거래 비용을 고려하기 전에 각 규칙이 얼마나 자주 활성화되는지, 종목 상태가 얼마나 자주 바뀌는지 측정합니다. 고정 기준값은 보정되지 않은 점수의 임의적인 척도에 따라…
이 노트북은 21일 선행 ETF 수익률을 상승 또는 하락 목표값으로 변환하고, 시간순 워크포워드 폴드에서 L1 및 L2 정규화 로지스틱 회귀를 평가합니다. 각 폴드의 학습 데이터로 특성을 스케일링한 뒤 정확도, 정밀도, 재현율, F1, ROC AUC, 로그 손실로 예측을 평가합니다. 계수 기반 특성 중요도와 확률 보정, 수익률 하위·중간·상위 그룹을 구분하는 3개 클래스 확장도 살펴봅니다. 분류 성능과 확률 보정은 서로 다른 질문에 답합니다. AUC는 여러…
이 노트북은 Feast를 금융 및 모델 기반 데이터용 특성 저장소로 설정한 뒤, Feast의 과거 및 특정 시점 조회 결과를 투명하게 직접 작성한 조인과 비교합니다. 엔터티, 타임스탬프가 있는 데이터 원본, 특성 뷰, 유효 기간을 선언하고 날짜 범위를 넓힌 임시 Parquet 사본을 준비합니다. 일치 여부 점검은 잘못된 타임스탬프, 엔터티 키, 학습된 폴드 빈티지 선택 같은 설정 오류를 찾도록 설계되었습니다. 비교할 때는 Feast가 유효 기간 안에서 이전…
이 노트북은 특성, 목표값, 워크포워드 폴드를 고정한 채 월간 US 주식 수익률 예측에 사용하는 그래디언트 부스팅 목적 함수를 비교합니다. 제곱 오차와 절대 오차, 큰 잔차의 영향을 줄이는 Huber 손실을 대조합니다. 정보계수는 횡단면 순위를 평가하는데도 개별 종목의 극단적인 수익률이 제곱 오차 학습을 좌우할 수 있다는 점이 비교의 배경입니다. 탐색 격자에서는 트리 용량도 바꾸며, 여러 부스팅 체크포인트의 예측값을 기록해 학습 곡선으로 성능이 계속…
이 모듈은 주성분, 도구변수 주성분, 신경망 오토인코더를 비롯한 여러 잠재 요인 모델의 워크포워드 학습과 평가를 조율합니다. 패널 데이터와 폴드를 준비하고 모델별 실행기를 호출하며 예측값, 폴드 수준 메타데이터, 등록된 학습 실행을 관리합니다. 모델 사전 설정은 명시된 우선순위 규칙에 따라 사용자가 제공한 설정과 병합되므로, 런타임 선택권은 사용자에게 있습니다. 오케스트레이션은 예상 학습 식별 정보와 체크포인트 집합도 구성한 뒤, 캐시된 레지스트리 항목과…
이 자료는 자연어 처리 모델의 학습이나 평가에 쓰이는 금융 뉴스 문장 라벨 데이터 모음인 Financial Phrasebank를 소개합니다. 사람 평가자가 긍정, 중립 또는 부정 감성 라벨을 붙입니다. 데이터셋은 평가자 간 합의 수준에 따라 네 가지 기준으로 제공됩니다. 가장 엄격한 하위 집합에는 모든 평가자가 동의한 문장이 포함되며, 기준이 느슨할수록 라벨 합의가 낮은 사례가 더 많이 포함됩니다. 이 자료는 데이터셋을 금융 감성 분류의 벤치마크로 소개하고,…
이 분석은 CME 선물 모델의 횡단면 정보계수(IC)를 해석하는 방법과 이후 포트폴리오 테스트와의 관계를 설명합니다. 각 날짜의 예측 수익률과 실제 수익률 간 순위 상관관계를 계산한 다음, 날짜별 상관계수의 평균을 구합니다. 이는 예측 수익률의 크기는 무시하고 순위에 따라 상품을 선택하는 동일 가중 전략에 해당합니다. 또한 폴드 간 평균과 t 통계량을 일별 시계열 추론과 구분하며, 보고된 t 통계량은 폴드 간 표준오차를 사용하고 예측값이 거의 일정해질 때는…