본문으로 건너뛰기

지식 라이브러리

Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.

라이브러리 검색

문서 151개

Machine Learning for Trading

이 노트북은 생존한 US 주식의 동일 비중 포트폴리오가 데이터셋에서 제외된 기업을 포함한 포트폴리오보다 수익률을 얼마나 과대평가할 수 있는지 추정합니다. 먼저 패널에 언제부터 퇴출 기록이 있는지 살펴보고, 활용 가능한 퇴출 이력이 후반 연도에야 시작됨을 확인합니다. 패널에는 상장폐지 사유와 최종 수익률이 없으므로, 공개된 CRSP 비율에 맞춘 시나리오로 마지막 호가 이후의 결과를 모델링합니다. 포트폴리오 편향을 계산하기 전에 수정주가에 기업행동이 반영되지…

주식미국 시장백테스트통계
Machine Learning for Trading

이 문서는 금융 데이터셋의 색인 무결성, 중복, 결측, 이상치, 달력상 누락, 도메인별 이상값을 점검하는 재사용 가능한 진단 항목을 제시합니다. 패널 데이터에서 종목별 순서를 포함해 시간 형식, 정렬, 고유성을 확인하며, 완전히 중복된 행과 값이 다른 채로 반복되는 키를 구분합니다. 커버리지 보고서는 필드, 자산, 시점별 결측값을 요약하며, 추가 검사로 잘못된 가격이나 거래량, 비정상적인 수익률 변화 등을 찾습니다. 진단은 정제 전 원시 데이터를 평가하기…

멀티에셋통계리스크 관리미국 시장
Machine Learning for Trading

이 노트북은 모델 예측 집합을 비교 가능한 S&P 500 옵션 백테스트로 변환합니다. 매주 의사결정일에 예측 수익률을 순위화하고 유동성 유니버스에서 순위가 가장 높은 종목을 골라 동일 가중 등가격 스트래들을 매도합니다. 포지션은 만기까지 보유하고 내재가치로 현금 결제합니다. 기초자산 델타를 관찰하다 임계값을 넘으면 헤지합니다. 모델 계열을 더 잘 비교할 수 있도록 보유 종목 수를 바꾸고 나머지 전략 설정은 고정합니다. 이름을 붙인 고정 예측 집합 및 백테스트…

옵션주식백테스트주문 집행
Machine Learning for Trading

이 문서는 자본을 배정하기 전에 현행 모델과 후보 모델을 섀도 평가로 비교하는 방법을 설명합니다. 모델의 역할과 승격 임계값을 사전에 정한 뒤, 연율화 샤프 개선도, 최소 관측 기간, 신호 상관도, 포지션 중복도, 상대 최대 드로다운의 다섯 차원에서 후보를 평가합니다. 두 모델은 순위 기반 롱숏 포트폴리오로 점수를 내며, 각 모델의 거래 회전율에 따라 거래 비용을 부과합니다. 최소 개선폭을 요구하면 짧은 기간의 샤프 추정치가 불안정한 문제에 대응할 수 있고,…

머신러닝통계리스크 관리백테스트
Machine Learning for Trading

이 탐색용 노트북은 AlgoSeek NASDAQ-100 분봉 데이터의 구조와 해석을 설명합니다. 데이터셋의 사전 계산 필드를 호가 가격과 수량, 체결 가격, 스프레드, 거래량, 체결 위치 구간, 틱 방향, 압력, VWAP, 호가 수로 나눠 정리합니다. 분봉은 장전, 정규장, 장후 세션에 걸쳐 있으며, 세션마다 거래 활동과 유동성 조건이 다르므로 세션을 고려한 분석이 중요합니다. 핵심 데이터 품질 교훈은 체결 필드가 null이면 대개 해당 분에 체결이 없었다는…

주식시장 미시구조주문 집행미국 시장
Machine Learning for Trading

이 사례 연구는 US 기업 특성으로 구성한 월간 롱숏 십분위 전략을 평가합니다. 시점별 회계 데이터 시차, 워크포워드 검증, 시대별 거래 비용을 반영해 선형 모델, 그래디언트 부스팅, 잠재 요인 접근법을 비교합니다. 검증 결과가 가장 좋은 것으로 보고된 계열은 윈저화한 선행 수익률에 그래디언트 부스팅 모델을 적용한 방식입니다. 지도 학습 오토인코더도 독립형 신호로 신뢰할 만하다고 설명합니다. 연구에서는 여러 폴드에 걸쳐 긍정적인 검증 성과를 보고했으며, 대안…

주식미국 시장팩터 투자머신러닝
Machine Learning for Trading

이 노트북은 US 주식 패널에서 세 가지 수익률 기간에 걸쳐 LightGBM 모델을 비교합니다. 그리드에서 트리 리프 수와 손실 함수를 바꾸고, 트리 수별 여러 체크포인트에서 각 설정을 채점합니다. 얕은 트리가 특성 간 상호작용을 학습하는 방식, 제곱·절대·Huber 손실이 두꺼운 꼬리 수익률에 서로 다르게 반응하는 방식, 선택을 평가할 때 각 체크포인트를 별도의 후보로 세어야 하는 이유를 설명합니다. 모델이 계속 개선되는지 과적합을 시작하는지 평가하기 위해…

주식머신러닝통계백테스트
Machine Learning for Trading

이 노트북은 기관의 보유 현황, 운용자 순위, 공동 보유 네트워크를 연구하기 위해 SEC의 분기별 대량 13F 보유 데이터를 처리합니다. 제출 날짜로 운용자별 최신 공시를 선택하고, 발행사 텍스트가 아니라 CUSIP 기준으로 증권을 집계하며, 주당 보고 가치의 중앙값이 타당한 범위를 벗어난 공시를 걸러냅니다. 가격 일관성 점검에서는 어느 필드의 단위가 잘못됐는지 가정하지 않고 보고 가치와 주식 수의 관계를 활용합니다. 보유 종목 수와 보고된 포지션 규모를…

주식미국 시장통계시장 미시구조
Machine Learning for Trading

이 US 주식 사례 연구는 미래 수익률을 예측하는 것과 모멘텀이 미래 수익률을 유발한다고 주장하는 것을 구분합니다. 최근 한 달을 제외한 주식의 직전 1년 수익률을 처치 변수, 미래 수익률을 결과 변수로 두고, 최근 변동성, 비유동성 순위, 거래량 비율을 교란 변수로 취급합니다. 더블 머신러닝은 먼저 이 교란 변수로 처치와 결과를 모델링한 다음 두 모형의 잔차 간 관계를 이용해 효과를 추정합니다. 워크포워드 적합에 엠바고를 적용해 미래 데이터로 보조 모형의…

주식모멘텀머신러닝통계
Machine Learning for Trading

이 노트북은 NASDAQ ITCH에서 파생한 거래 기록으로 장중 트레이딩 활동을 살펴봅니다. 개별 거래를 시간 구간으로 재표본화하고, 활동 수준이 서로 다른 세 구간에서 각각 선택한 종목 하나의 주식 거래량, 거래 건수, 마지막 가격, 거래량 가중 가격을 비교합니다. 활동이 가장 적은 종목은 거래가 드문 구간도 보이도록 더 넓은 시간 구간을 사용합니다. 가장 활발한 종목들의 정규화된 거래량 패턴도 평균냅니다. 각 구간의 거래량을 해당 종목의 일일 거래량에서…

주식시장 미시구조주문 집행통계
Machine Learning for Trading

이 가이드는 미시구조 연구에 필요한 US 주식 호가창 틱 데이터의 두 가지 출처를 소개합니다. Databento의 주문별 이벤트와 NASDAQ TotalView-ITCH 메시지입니다. 형식, 커버리지 특성, 대략적인 데이터 크기와 장단점을 설명합니다. MBO는 추가, 변경, 취소, 체결과 같은 처리된 주문 이벤트를 제공하고, ITCH는 파싱과 정규화가 필요한 무료 원시 바이너리 피드입니다. 워크플로는 MBO 데이터를 받기 전에 다운로드 비용을 추정하고,…

주식시장 미시구조주문 집행미국 시장
Machine Learning for Trading

이 노트북은 SEC XBRL 데이터로 분기별 주식 펀더멘털 패널을 구축하고 살펴보는 방법을 설명합니다. 각 관측치에는 해당 회계 기간과 정보가 공개된 신고일이 모두 포함됩니다. 과거 테스트에서는 이 구분이 중요합니다. 기간 종료일만으로 필터링하면 투자자가 아직 알 수 없었던 수치가 포함될 수 있기 때문입니다. 노트북은 개념별 커버리지와 신고 지연을 측정하고, 신고일을 고려한 시점별 조회로 얻은 최신 관측치와 기간 기준 조회 결과를 비교합니다. 예시에서는 매출…

주식미국 시장팩터 투자백테스트
Machine Learning for Trading

이 노트북은 주식 수익률과 별개로 시장 상황을 설명하기 위해 월별 거시경제 지표를 군집화합니다. FRED 시계열을 월말 관측값에 맞추고 실업률, 연방기금금리, 수익률 곡선 스프레드, 전년 대비 CPI 변화를 표준화한 다음 가우시안 혼합 모형을 적합합니다. 상승하는 CPI 수준 대신 인플레이션 변화량을 사용하면 군집이 주로 과거와 최근 날짜를 나누는 현상을 피할 수 있습니다. 군집 이름은 명시적인 임계값 규칙으로 사후에 붙이므로, 경제적 라벨은 모델이 자동으로…

머신러닝통계변동성미국 시장
Machine Learning for Trading

이 문서는 분기별 SEC 13F 대량 공시를 기관 보유 내역 패널로 변환하는 워크플로를 설명합니다. 운용사별로 제출일 기준 가장 최근 공시를 선택하고, 제출자가 입력한 회사명 대신 CUSIP를 사용해 증권을 식별하며, 내재 주당 가격의 중앙값이 비현실적인 공시는 걸러냅니다. 가격 검사는 보고된 보유 포지션 가치를 주식 수로 나누며, 어느 필드가 잘못됐는지 판별하지는 않지만 단위나 주식 수의 불일치를 드러낼 수 있습니다. 이어서 운용사 순위, 군집도의 대용…

주식미국 시장통계시장 심리
Machine Learning for Trading

이 모듈은 티커 기호가 시간에 따라 서로 다른 증권을 가리킬 수 있을 때 과거 S&P 500 가격을 준비하는 방법을 설명합니다. 기업 활동 조정 계수를 적용하고 증권 식별자를 추적하며 정체성 경계를 표시합니다. 수익률 계산은 정체성이 유지되는 증권 구간 안에서만 수행합니다. 따라서 티커가 재배정된 시점에는 잘못된 시장 움직임을 기록하지 않고 수익률을 정의하지 않습니다. 연속된 가격 수준이 필요한 백테스트 패널에는 후속 구간을 별도로 재조정해 이전 수준과…

주식미국 시장백테스트주문 집행
Machine Learning for Trading

이 노트북은 기업 공시 텍스트 말뭉치에서 구절을 검색하는 네 가지 방법, 즉 BM25, 밀집 임베딩, 역순위 융합(RRF), 교차 인코더 재순위화를 비교합니다. RRF는 원점수가 아니라 순위 목록을 결합하므로 점수 척도를 서로 보정하지 않고도 어휘 기반 시스템과 의미 기반 시스템을 결합할 수 있습니다. 이어서 재순위화 모델이 후보 집합의 순서를 바꿉니다. 노트북은 검색 단계의 구현 방법과 동일한 검색 깊이에서 평가하는 방법도 설명합니다. 핵심 평가상의 교훈은…

머신러닝통계주식미국 시장
Machine Learning for Trading

이 노트북은 생존한 US 주식으로 구성한 동일가중 포트폴리오가 전체 초기 종목군에 비해 수익률을 얼마나 과대평가할 수 있는지 추정합니다. 먼저 패널에 종목 이탈이 기록되기 시작한 시점을 살펴보며, 기록된 이탈은 데이터셋의 마지막 몇 년에 들어서야 나타납니다. 그 이전에 누락된 기업은 원천 데이터에 없으므로, 분석 결론은 이탈이 관측되는 기간으로 제한됩니다. 패널에는 상장폐지 사유와 최종 지급 내역도 없어 마지막 호가 이후 결과를 모델링해야 한다고 설명합니다.…

주식미국 시장백테스트
Machine Learning for Trading

이 노트북은 과거 US 주식 수익률로 상관 네트워크를 만들고 포트폴리오 구성을 살펴봅니다. 추정 구간 데이터를 사용해 유동성 있는 종목군을 선택하고 쌍별 상관관계를 거리로 바꾼 다음, 촘촘한 의존 구조를 더 쉽게 살펴보도록 최소 신장 트리(MST)를 추출합니다. 차수 중심성, 매개 중심성, 근접 중심성으로 각 자산의 트리 내 위치를 설명하고, 역중심성 가중 규칙으로 구조적 허브의 비중을 낮추되 포지션 한도를 적용합니다. 이 노트북은 배분을 포트폴리오…

주식미국 시장포트폴리오 구성리스크 관리
Machine Learning for Trading

이 문서는 주간 S&P 500 옵션 전략의 특수 백테스트를 설명합니다. 각 코호트는 순위가 높은 구성 종목을 선택해 만기가 대략 한 달 남은 등가격 부근 콜옵션과 풋옵션을 매도하고, 순델타가 임계값을 넘으면 주식으로 델타 헤지를 합니다. 만기에는 포지션을 내재가치로 결제합니다. 호가가 일찍 끊기거나 보유 한도에 도달한 계약은 정해진 청산 규칙에 따라 마지막으로 이용 가능한 마크 가격이나 매도 호가로 다시 매수합니다. 포트폴리오 회계에는 겹치는 코호트, 고정…

옵션주식미국 시장백테스트
Machine Learning for Trading

이 노트북은 넓은 US 주식 종목 패널의 공통 움직임을 주성분 분석으로 나타냅니다. PCA은 수익률의 공통 변동을 설명하는 방향을 추출하며 각 주식의 로딩은 해당 방향에 대한 노출도를 나타냅니다. 제한된 요인 집합으로 재구성한 예측은 종목 고유 정보를 버리는 대신 패널과 공유하는 주식 움직임을 포착합니다. 미래 수익률을 요인 추정에 사용하지 않도록 각 워크포워드 학습 폴드 안에서 요인을 적합한 뒤 검증 행에 적용합니다. 요인 개수는 탐색이 아닌 사전 설정으로…

주식미국 시장머신러닝통계
Machine Learning for Trading

이 노트북은 광범위한 ETF 동조화를 통제한 뒤 운용 포트폴리오 전략 4개가 SPY 수익률을 설명하는지 검정합니다. 전략은 시차 모멘텀, 변동성 또는 최근 수익률로 ETF 순위를 매깁니다. 장기 이력이 있는 균형 잡힌 ETF 집합에서 주성분 10개를 통제 변수로 쓰며, 요인 구성 유니버스에서는 SPY를 제외합니다. 각 전략의 단변량 SPY 로딩과 통제 변수를 선택한 뒤 추정한 조건부 로딩을 비교합니다. 이중 선택 후 LASSO는 결과와 각 핵심 전략을 모두…

팩터 투자머신러닝통계모멘텀
Machine Learning for Trading

이 노트북은 Word2Vec 스킵그램을 기관 주식 보유 자료에 적용합니다. 기관별 포트폴리오를 문장으로, 주식 식별자를 토큰으로, 보고된 보유 가치 순으로 정렬한 포지션을 단어 순서로 다룹니다. 비슷한 포트폴리오 맥락에 반복해서 등장하는 주식은 가까운 임베딩을 얻을 수 있습니다. 이를 통해 기관 포트폴리오 행동을 표현하고 경제적으로 유사한 자산을 식별할 수 있습니다. 예시는 분기별 13F 보유 자료를 사용합니다. 포트폴리오 폭에 따라 기관을 선택하고,…

주식머신러닝포트폴리오 구성통계
Machine Learning for Trading

이 노트북은 주식 분할이나 현금 배당일을 가로지를 때 원시 주가로 수익률을 계산하면 왜 오해를 부를 수 있는지 설명합니다. 후방 조정은 이후 기업 행사를 반영해 과거 가격을 조정하는 방법입니다. 체결 시뮬레이션에는 원시 가격을, 일부 단기 구간에는 분할 조정 가격을, 장기 연구와 백테스트에는 총수익 조정 가격을 사용하는 방식을 구분합니다. Apple의 과거 자료로 분할 및 배당 조정이 누적 수익률에 미치는 영향을 보여줍니다. 노트북은 OHLCV 데이터에 조정…

주식통계백테스트미국 시장
Machine Learning for Trading

이 문서는 자산 가격결정 모델의 벤치마크로 쓰이는 Chen, Pelger, Zhu의 월별 US 주식 패널을 소개합니다. 경제적 주제별로 분류한 기업 특성 46개, 다음 달 초과수익률, 시간순으로 나눈 훈련·검증·테스트 구간을 설명합니다. 매월 각 특성을 횡단면 순위로 매긴 뒤 공통된 제한 범위에 매핑합니다. 이를 통해 극단적인 원시 값의 영향을 줄이고 단위를 비교할 수 있지만 수준 정보는 버립니다. 분석은 각 특성과 이후 수익률 사이의 월별 순위 상관을…

주식미국 시장팩터 투자통계