잠재 요인을 이름이 붙은 예측 변수로 제공하는 대신 선물 간 동조 움직임에서 추론한 공통 수익 동인으로 소개합니다. 각 훈련 폴드 안에서 적합하는 두 접근법을 비교합니다. 주성분 분석(PCA)은 수익률 분산을 가장 많이 설명하는 선형 방향을 찾고, 신경망 확률적 할인 요인(SDF) 접근법은 단면 기대 수익률을 설명하는 공통 가격 결정 객체를 찾습니다. PCA는 수익률만 사용하는 반면, SDF는 특성도 도구 변수로 사용해 특성 조건부 익스포저를 표현할 수…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 109개
이 문서는 벤치마킹, 위험 귀속, 팩터 연구에 활용할 수 있는 공개 Fama-French 및 AQR 팩터 수익률 데이터셋을 소개합니다. Fama-French 라이브러리의 시장, 규모, 가치, 수익성, 투자, 모멘텀 팩터와 품질, 저베타, 대안적 가치 개념을 다루는 AQR 시리즈를 설명합니다. 데이터는 월별로 제공되며, 로더에서 일별 Fama-French 데이터와 날짜 범위 필터링도 지원합니다. 워크플로는 데이터셋 다운로드와 캐싱, 로드 및 프로파일링, 월별…
이 노트북은 가우시안 혼합 모형을 사용해 주식, 채권, 통화, 원자재의 요인 및 시장 시계열 9개에서 월간 수익률을 군집화합니다. 불완전한 데이터가 있는 달을 제외한 뒤, 척도 차이가 군집화를 좌우하지 않도록 시계열을 표준화합니다. 서로 다른 특성에 가치를 두는 기준으로 후보 군집 수를 비교하고, 시간에 따른 변화와 날짜가 기록된 사건을 바탕으로 결과 그룹을 살펴봅니다. 각 군집 안의 요인 성과는 전체 평균이 조건부 수익률과 분산투자 양상을 어떻게 가릴 수…
이 노트북은 회계 및 가격 기반 특성 57개를 각각 다음 달 US 주식 수익률의 예측 변수로 평가합니다. 월별 횡단면 순위 상관관계를 계산해 시간에 따라 평균을 내고, 시계열 의존성과 다수 후보 검정을 고려해 불확실성을 조정합니다. 워크포워드 학습·검증 구간에서 연관성이 지속되는지도 확인하고, 효과 크기, 일관성, 유의성, 중복성을 바탕으로 특성별 결정을 내립니다. 증거의 범위는 명시적으로 개발 표본에 한정됩니다. 보류 기간은 제외하며, 결과 장부에는 후속…
이 장은 트레이딩 아이디어를 문서화된 특성 명세로 바꾸는 프레임워크를 제시합니다. 연구자는 특성의 시간 범위를 의도한 의사결정에 맞추고, 구동 요인 가설을 밝히며, 예측 신호와 맥락을 설명하는 상태 변수를 구분해야 합니다. 기준 관점, 표현 방식, 집계 방법은 경제적 주장에 따라 정해야 합니다. 가설을 바꾸는 변환과 주로 노이즈를 조절하는 변환도 구별해야 합니다. 이 장은 가격·거래량 특성, 시장 미시구조, 상품 간 관계, 파생상품 내재 지표, 펀더멘털,…
이 장은 퀀트 트레이딩 연구에서 인과 주장을 평가하는 틀을 제시합니다. 처치, 결과, 추정 대상, 반사실, 조정 집합을 명확히 정의한 다음 연구 질문에 맞는 방법을 연결합니다. 연속 노출에는 이중 머신러닝(DML), 개별 사건에는 베이지안 구조적 시계열, 관측 자료에서 후보 관계를 찾는 데는 인과 발견 방법을 사용합니다. DAG와 식별 설계를 바탕으로 조정 변수를 선택하며, 시간 교차 적합과 처치 전 시점 설정은 추정 과정의 누출 방지에 도움이 됩니다.…
이 설정은 기업 특성 순위에 따른 월간 롱숏 US 주식 포트폴리오를 설명합니다. 46개 특성의 완전 사례 유니버스, 월말 의사결정, 다음 시가 체결, 롱·숏 각각의 동일 비중, 차입 비용을 포함한 주요 거래 비용을 명시합니다. 특성 목록은 가치, 품질, 투자, 모멘텀 같은 신호를 묶고, 가정한 갱신 지연과 실패 유형을 기록합니다. 월간 수익률 레이블과 홀드아웃 2016 기간을 포함한 워크포워드 평가도 설정합니다. 중요한 설계 논점은 배분 방식의 추정입니다.…
이 노트북은 금융 및 모델 파생 특성이 후속 수익률을 기준으로 ETF 순위를 매길 수 있는지 선별합니다. 날짜별로 각 특성의 횡단면 순위와 선도 수익률 순위를 비교해 정보 계수를 계산한 뒤, 그 시계열을 살펴봅니다. 겹치는 수익률 라벨로 인한 불확실성을 조정하고, 동시에 수행한 여러 특성 검정에서 거짓 발견을 통제하며, 워크포워드 검증 구간에서 연관성의 방향이 유지되는지 확인합니다. 또한 중복된 근거를 나타내는 고상관 특성을 식별합니다. 평가는 검증 날짜로…
이 데이터 유틸리티는 주식 수익률, 기업 특성, 거시경제 시계열, 분할 전 특성 텐서를 포함하는 Chen, Pelger, and Zhu 자산 가격 데이터셋을 지원합니다. 변환 방식은 공개된 학습, 검증, 테스트 텐서로 Parquet 파일을 만듭니다. 아카이브에는 각 블록 안에서 지속되는 익명 기업 위치가 있지만 블록 간 대응 정보가 없으므로, 변환기는 블록마다 서로 겹치지 않는 식별자 범위를 할당합니다. 이를 통해 같은 식별자가 여러 블록에서 알려진 동일…
이 노트북은 주식 특성과 내재변동성, 스큐, 기간 구조 등 옵션에서 도출한 지표를 결합한 S&P 500 횡단면 연구에서 예측, 구조, 인과 모형의 근거를 비교합니다. 주간 미래 수익률 순위를 다른 레이블 기간, 잠재 요인 결과, 인과 추정치, 십분위수별 움직임, 신호 상관관계와 함께 평가합니다. 핵심 질문은 옵션 특성이 직접 또는 잠재 요인을 통해 유용한 정보를 더하는지, 어떤 결과를 후속 전략 시뮬레이션에서 살펴볼 가치가 있는지입니다. 보고된 근거는…
이 노트북은 PCA을 입력 특성 없이 잠재 요인을 사용하는 기준선으로 삼아 ETF 수익률을 예측하는 방법을 설명합니다. 각 펀드의 로딩과 추정된 요인 프리미엄을 사용해 각 레이블의 학습 구간 수익률 행렬을 분해하고 예측치를 구성합니다. 같은 펀드가 구간 내내 열로 유지되므로 이 방법은 고정된 ETF 유니버스에 적합하며, 개체의 정체성이 시간에 따라 바뀌는 경우에는 적절하지 않습니다. 노트북은 이 접근법을 입력 특성 기반 모델과 비교하고 워크포워드 학습 및…
이 노트북은 CME 선물 패널을 대상으로 신경망 확률할인요인 모형을 제시합니다. 이 모형은 상품 수익률과 캐리, 모멘텀, 변동성 같은 관측 가능한 특성을 함께 사용해 잠재 요인을 구성하고, 미리 정한 미래 수익률 기간에 대한 예측을 생성합니다. 수익률만 사용하는 PCA와 이 접근법을 비교해 특성이 수익률 공분산을 넘어 추가 가격 정보를 제공하는지 검토할 수 있는 방법을 설명합니다. 표현은 각 학습 폴드 안에서 적합하고 검증 데이터는 재적합 없이 변환하며,…
이 실험은 선택한 월간 US 주식 롱숏 신호가 소형주에 얼마나 의존하는지 살펴봅니다. 시차를 둔 시가총액 필터를 적용해 검증 예측에서 가장 작은 사분위 종목을 제거한 다음, 모델을 재학습하지 않고 동일한 포트폴리오 구성과 비용 가정으로 다시 실행합니다. 필터 적용 유니버스에는 자산이 더 적지만 회전율은 전체 유니버스 결과와 비슷하게 유지됩니다. 보고된 샤프 비율은 4.27에서 2.24로, 정보계수는 0.074에서 0.048로 하락하고 최대 드로다운은 약…
이 노트북은 특성에 따라 달라지는 팩터 로딩과 잠재 팩터의 곱으로 주식 수익률을 모델링하는 조건부 오토인코더를 설명합니다. 먼저 횡단면 공동 최소제곱 적합으로 특성 관리 포트폴리오 수익률을 추정하고, 이어 신경망을 학습시켜 같은 시점의 수익률을 재구성합니다. 별도의 워크포워드 어댑터는 다음 팩터 값을 예측하고 현재 특성에 적용해 다음 날 주식 수익률을 예측합니다. 워크플로는 가격에서 산출한 특성 다섯 가지와 학습 데이터로 정의한 유동성 주식 유니버스를…
이 분석은 9개 트레이딩 사례의 특징 선별 대장을 비교합니다. 벤자미니–호크버그 거짓 발견률 유의성과, 사례별 효과 크기 하한 및 폴드별 부호 안정성을 결합하는 두 번째 PROCEED 결정 경로를 구분합니다. 결정이 두 경로의 합집합을 따르므로 PROCEED 특징 수가 FDR 기준을 통과한 수보다 많을 수 있습니다. 이어 각 사례의 PROCEED 비중과 검증 및 홀드아웃 Sharpe를 대응시켜 특징의 생존 여부가 전략의 생존 여부를 예측하는지 탐색합니다.…
이 노트북은 캐리, 모멘텀, 변동성처럼 설계된 특징이 아니라 CME 선물 수익률 패널에서 주성분 요인을 구성합니다. PCA은 상품 간 변동을 설명하는 방향을 찾습니다. 첫 번째 요인은 공통 시장 움직임과 비슷할 수 있고, 이후 요인은 섹터 간 동조 움직임을 반영할 수 있습니다. 이러한 패턴은 섹터 레이블을 미리 반영하지 않으며, 주성분은 예측력이 아니라 설명 분산 순으로 배열됩니다. 예측에서는 수익률을 주성분에 투영하고 확장창 평균을 사용해 요인 수익률을…
이 노트북은 일별 트레이딩 의사결정을 위한 느리게 변하는 맥락 특징인 재무 비율, 거시경제 여건, 달력 효과의 표현 방식을 설명합니다. 이익수익률, 수익성, 발생액, 레버리지, 현금흐름 수익률과 같은 가치 및 품질 지표를 소개하고, 발표일과 기준 시점 조인을 사용해 분기별 재무 정보를 일별 관측치에 맞춥니다. 거시 시계열에는 발표 지연과 전방 채우기가 필요하며, 달력 패턴에는 주기 인코딩과 이벤트까지 남은 시간 변수를 사용할 수 있습니다. 핵심 우려는 시점…
이 문서는 날짜가 있는 엔터티 기록을 잠재 팩터 사례 연구용 배열로 변환하는 방법을 설명합니다. 한 방법은 적격성 데이터셋에서 학습한 커버리지 기준을 충족하는 엔터티만 남깁니다. 누락된 관측값은 NaN으로 유지해 일관된 엔터티 축을 만듭니다. 두 번째 방법은 불규칙한 횡단면을 만들고 각 날짜에 관측된 최대 크기까지 채웁니다. 슬롯 위치는 날짜별로만 유효하며 날짜가 바뀌어도 동일한 엔터티를 나타내지는 않습니다. 또한 각 날짜 안에서 특성 순위를 제한된 척도로…
이 노트북은 키워드 기반 ESG 헤드라인 파이프라인을 살펴보고 구조화된 분류기 출력과 검색 증강 생성 어시스턴트가 충족해야 할 요건을 비교합니다. 첫 번째 키워드 목록으로 헤드라인을 고르고, 두 번째 목록으로 환경·사회·지배구조 레이블을 지정합니다. 선택된 전체 집합에 분류기를 적용하면 환경 항목이 크게 치우친 것으로 나타납니다. 노트북은 환경 관련 용어를 더 쉽게 선택하는 키워드 목록과 겹치는 경우 환경 항목을 우선하는 분류 순서에서 불균형의 원인을…
이 노트북은 개별 추정치를 정확히 계산하더라도 많은 팩터나 전략을 검색하면 선택된 우승 후보의 겉보기 성과가 부풀려지는 이유를 설명합니다. 시뮬레이션한 잡음 팩터 집합은 가장 큰 정보계수가 우연히도 인상적으로 보일 수 있음을 보여줍니다. 이어 이분산성과 자기상관에 강건한 추론을 적용한 뒤 거짓 발견률을 통제하는 보정 절차를 구성하고, 더 보수적인 선별을 위한 패밀리 단위 오류 통제도 논의합니다. 상관된 팩터 변형에는 Rademacher 복잡도 보정을…
위험 프리미엄 PCA는 학습 평균 수익률 벡터의 가중 외적을 더해 공분산 행렬을 수정합니다. 가장 큰 고유값에 대응하는 고유벡터가 정적 팩터 포트폴리오를 정의합니다. 가중치가 0이면 일반 PCA를 얻고, 양의 가중치는 평균 수익률과 관련된 방향으로 팩터를 기울입니다. 노트북은 여러 가중치에서 가격결정 적합도, 수익률 재구성, 로딩 공간의 변화를 비교한 뒤, 사전에 정한 가중치를 사용해 하루 앞의 팩터 프리미엄을 예측합니다. 학습 데이터로 로딩을 적합하고,…
이 노트북은 9개의 요인 및 자산군 수익률 시계열의 공동 움직임을 기준으로 월을 그룹화하는 가우시안 혼합 모델을 사용합니다. 월별 관측치를 표준화하고 결측 월을 제거한 뒤 BIC, AIC, 실루엣 점수로 후보 군집 수를 비교합니다. 이후 날짜가 확인된 시장 이벤트에 비춰 군집을 해석하고 각 그룹 내 요인 성과를 살펴봅니다. 이를 통해 환경별 차이가 통합 평균에 가려질 수 있음을 보여줍니다. 증거는 1927년에 시작되는 AQR의 월별 요인 수익률 기록에서…
이 특성 엔지니어링 노트북은 펀더멘털, 거시경제 데이터, 달력 맥락을 통해 느린 정보가 빠른 트레이딩 신호에 맥락을 제공하는 방법을 설명합니다. 장부가 대비 시가 비율과 이익수익률 같은 가치 비율, 자기자본이익률과 발생액 같은 품질 지표, 거시 지표와 리스크 국면, 계절성 또는 이벤트 시점을 나타내는 주기 인코딩을 소개합니다. 분기별 재무 데이터의 정렬에는 종목과 발표 날짜를 기준으로 과거 시점에 맞춘 조인을 사용합니다. 따라서 일별 관측치에는 이미 발표된…
이 장에서는 근거 없는 주장과 환각의 비용이 클 수 있는 개방형 금융 리서치에서 언어 모델의 유용성을 높이는 방법으로 검색 증강 생성을 소개합니다. 문서 수집과 구조를 고려한 분할부터 메타데이터, 도메인별 임베딩, 어휘 및 의미 기반 하이브리드 검색, 재순위화, 증거에 근거한 생성까지 시스템을 설명합니다. 추적성과 수치 신뢰성을 높이기 위해 인용 제약과 도구로 검증된 계산도 포함합니다. 이 장은 평가를 진단 과정으로 다룹니다. 팀은 검색 실패를 맥락, 종합,…