이 노트북은 금융 뉴스 문장을 긍정, 중립, 부정으로 분류하는 세 가지 방법을 비교합니다. 로지스틱 회귀를 사용한 TF-IDF 단어 및 구문 특성, 분류기와 평균 정적 단어 벡터, 사전 학습된 FinBERT 감성 모델입니다. 높은 일치도를 보이는 Financial PhraseBank 하위 집합에서 동일한 층화 테스트 분할을 사용해 방법을 평가합니다. 두 어휘 기반 접근법은 학습 분할과 추정기를 공유하며, FinBERT는 별도 미세 조정된 분류기를 추가 조정…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 571개
이 노트북은 SEC XBRL 데이터로 분기별 주식 펀더멘털 패널을 구축하고 살펴보는 방법을 설명합니다. 각 관측치에는 해당 회계 기간과 정보가 공개된 신고일이 모두 포함됩니다. 과거 테스트에서는 이 구분이 중요합니다. 기간 종료일만으로 필터링하면 투자자가 아직 알 수 없었던 수치가 포함될 수 있기 때문입니다. 노트북은 개념별 커버리지와 신고 지연을 측정하고, 신고일을 고려한 시점별 조회로 얻은 최신 관측치와 기간 기준 조회 결과를 비교합니다. 예시에서는 매출…
이 노트북은 회계 및 가격 기반 특성이 다음 달 US 주식 수익률을 단독으로 예측하는지 평가합니다. 각 특성과 수익률 라벨 간 월별 횡단면 순위 상관을 계산한 다음 개발 기간의 여러 달에 걸쳐 요약합니다. 이 과정은 별도로 보류한 홀드아웃을 제외하고, 패널 무결성을 확인하며, 최소 커버리지와 횡단면 폭을 요구하고, 워크포워드 학습 및 검증 기간에도 연관성이 지속되는지 살펴봅니다. 관련된 월별 관측치와 다수 후보 테스트에서 생기는 불확실성을 반영하고, 어떤…
이 노트북은 실제 홀드아웃 산출물을 사용해 배포된 금융 모델을 모니터링하는 워크플로를 구성합니다. 드리프트를 측정하기 전에 새로 들어온 특성 데이터가 채워져 있고 구조적으로 유효한지 확인한 다음, 기준 구간과 현재 구간을 비교합니다. 특성 분포 변화는 모집단 안정성 지수와 두 표본 콜모고로프-스미르노프 검정으로 평가합니다. 안정성 임계값은 관례에 따른 기준인 반면 큰 표본에서는 통계적 유의성이 실질적으로 중요하지 않은 변화도 포착할 수 있으므로 두 측정값을…
이 노트북은 포지션 규모 조정을 최대 불리·유리 익스커션 분석과 연결합니다. 고정 비율 포지션 규모 조정에서는 거래별 위험 예산과 진입가부터 손절가까지의 거리에 따라 주식 수를 정하며, 여기에 집중도 상한을 적용합니다. 또한 시차를 둔 개별 변동성으로 롱 전용 역변동성 배분을 구성합니다. 이 휴리스틱은 상관관계를 무시하므로 공분산을 고려하는 리스크 패리티가 아니라는 점을 강조합니다. 거래 진단을 위해 익스커션 분포를 살펴 손절 및 목표가 선택에 참고하고,…
이 노트북은 SHAP 패널의 릿지 회귀 예측을 ETF로 해석하는 방법을 설명합니다. 선형 모델에서 각 특성의 기여도는 계수에 학습 배경 평균으로부터의 특성 편차를 곱한 값이므로, 폐쇄형 계산과 대조해 확인할 수 있습니다. 전체 기여도 크기, 개별 예측에 대한 워터폴 설명, 확신도가 높았던 예측 중 정답과 오답의 비교, 워크포워드 폴드 간 중요도 안정성을 다룹니다. 또한 시간 폴드 간 중요도 변화와 한 폴드 안에서의 표본 추출 불확실성이라는 두 가지 불확실성을…
이 노트북은 이후 감성·주제·임베딩 분석에 쓸 수 있도록 SEC 연간 및 분기 공시를 구조화된 텍스트로 변환하는 워크플로를 소개합니다. 원하는 섹션을 서식별 항목 번호에 연결하며, 경영진 논의 섹션이 10-K와 10-Q에서 서로 다른 번호로 표시된다는 점을 강조합니다. 추출 과정에서는 문단 경계를 보존하며 HTML을 정리한 뒤, 목차나 상호 참조에서 처음 등장한 제목을 그대로 선택하지 않고 앞뒤 섹션 경계를 이용해 제목을 찾습니다. 워크플로는 추출 결과가…
이 노트북은 조건부 오토인코더가 계측 주성분 모델을 어떻게 확장하는지 설명합니다. 신경망이 주식 특성을 요인 노출로 매핑하며, 노출과 요인 수익률을 곱하는 구조는 그대로 유지합니다. 학습 구간별로 설정된 미래 수익률 라벨을 재구성하도록 모델을 적합한 다음, 고정된 요인 평균을 검증일의 노출에 적용해 다음 구간에서 주식 순위를 매기는지 평가합니다. 재구성에 나중에 정보계수로 점수화하는 동일 라벨을 사용하므로, 양의 점수가 독립적인 발견은 아닙니다. 그래도 검증…
이 연구는 금융 특성과 GJR-GARCH 변동성 특성을 미래 주식 수익률과 비교해 선별합니다. 각 세션에서 종목 간 특성값과 이후 수익률의 순위 상관을 계산한 뒤, 평균 연관성, 워크포워드 검증 구간 간 일관성, 여러 후보를 검정한 뒤 결과의 신뢰성을 평가합니다. 예측 연관성을 측정하기 전에 특성의 데이터 범위와 오래된 값도 점검하고 각 특성에 대한 판정을 기록합니다. 분석에는 개발 데이터를 사용하고, 홀드아웃은 나중에 선택한 설정을 위해 남겨둡니다. 미래…
이 자료는 감성 분석, 텍스트 특성 개발, 뉴스와 수익률의 연관성 실험에 쓰이는 금융 뉴스 코퍼스 두 가지를 소개합니다. FNSPID는 헤드라인과 주식 티커를 연결하며 오랜 기간을 포괄합니다. 전체 모음과 함께 더 작은 표본도 이용할 수 있습니다. Bloomberg 아카이브에는 더 짧은 기간의 뉴스 텍스트와 구조화된 금융 시계열이 있으며, 감성·주제 분석과 데이터셋 간 강건성 실험을 위한 보조 자료로 제시됩니다. 두 자료 모두 공개 데이터 허브를 통해…
이 노트북은 주성분 10개가 포착한 광범위한 움직임을 통제한 뒤, 포트폴리오 운용 전략 4개가 SPY 수익률에 설명력을 더하는지 검정하는 방법을 보여줍니다. 후보 포트폴리오는 ETF의 최근 모멘텀, 낮은 변동성 또는 단기 반전을 기준으로 순위를 매기고, 시차 수익률로 롱·숏 바스켓을 구성합니다. 각 요인의 조정 전 SPY 로딩을 두 번의 LASSO 회귀로 통제 변수를 선택한 뒤 추정한 조건부 로딩과 비교합니다. 확장 시계열 교차 검증과 폴드별 스케일링 및…
이 문서는 분기별 SEC 13F 대량 공시를 기관 보유 내역 패널로 변환하는 워크플로를 설명합니다. 운용사별로 제출일 기준 가장 최근 공시를 선택하고, 제출자가 입력한 회사명 대신 CUSIP를 사용해 증권을 식별하며, 내재 주당 가격의 중앙값이 비현실적인 공시는 걸러냅니다. 가격 검사는 보고된 보유 포지션 가치를 주식 수로 나누며, 어느 필드가 잘못됐는지 판별하지는 않지만 단위나 주식 수의 불일치를 드러낼 수 있습니다. 이어서 운용사 순위, 군집도의 대용…
이 문서는 ETF 수익률을 모델링하기 위한 계측 주성분 분석을 설명합니다. 각 펀드에 고정된 요인 노출을 부여하는 일반 PCA와 달리, IPCA는 각 펀드의 노출을 관측 가능한 특성의 공통 선형 함수로 모델링합니다. 교대 최소제곱법을 통해 특성에서 노출로 이어지는 매핑과 요인 수익률을 함께 추정합니다. 제안된 제약은 펀드와 날짜 전반의 정보를 통합하지만, 특성과 노출의 관계를 선형으로 가정한다는 한계가 있습니다. 이 노트북은 워크포워드 폴드에서 5일 및…
이 노트북은 NASDAQ ITCH 체결 기록을 사용해 정규장 동안 거래량과 거래 활동이 어떻게 달라지는지 살펴봅니다. 체결을 시간 단위 봉으로 재표본화하고, 거래 활동이 높은·중간·낮은 대표 종목의 가격과 거래량을 비교한 다음, 거래가 가장 활발한 각 종목의 일일 거래량을 기준으로 정규화해 프로필의 평균을 냅니다. 그 결과 장 시작과 마감 무렵에는 거래가 늘고 한낮에는 둔화되는 패턴이 드러납니다. 또한 장 시작 및 마감 봉의 거래량을 한낮과 비교하고, 시간대…
이 노트북은 스프레드, 호가 잔량 불균형, 부호가 있는 거래량, 가격 충격 같은 장중 미시구조 정보를 사용해 다음 15분 수익률 기준으로 NASDAQ-100 종목의 순위를 매기는 예측 모델을 비교합니다. 데이터 범위가 완전한 경우에만 모델 계열별 대표 예측 세트를 하나 선택하고, 모델 체크포인트는 서로 구분해 둡니다. 순위 상관관계와 불확실성 구간을 비교하고, 워크포워드 폴드별 성과를 확인하며, 예측 구간별 단조성과 국면 의존성을 검정합니다. 컨포멀 예측…
이 모듈은 티커 기호가 시간에 따라 서로 다른 증권을 가리킬 수 있을 때 과거 S&P 500 가격을 준비하는 방법을 설명합니다. 기업 활동 조정 계수를 적용하고 증권 식별자를 추적하며 정체성 경계를 표시합니다. 수익률 계산은 정체성이 유지되는 증권 구간 안에서만 수행합니다. 따라서 티커가 재배정된 시점에는 잘못된 시장 움직임을 기록하지 않고 수익률을 정의하지 않습니다. 연속된 가격 수준이 필요한 백테스트 패널에는 후속 구간을 별도로 재조정해 이전 수준과…
이 노트북은 옵션 표면 특성을 포함한 주식 패널에 도구변수 주성분 분석(IPCA)을 적용하는 방법을 설명합니다. 각 종목의 수익률 이력에서 익스포저를 추정하는 일반 PCA과 달리, IPCA는 내재 변동성, 스큐, 기간 구조, 내재 분산과 실현 분산의 차이 등 종목별 날짜 특성의 공통 선형 함수로 익스포저를 모델링합니다. 교대 최소제곱법은 공통 팩터 수익률과 함께 이 매핑을 추정합니다. 특성으로 익스포저를 계산하므로 연속적인 수익률 이력이 없는 종목을 포함한…
이 노트북은 기업의 10-K 공시에서 공급업체, 고객, 경쟁사 관계를 추출해 Neo4j 지식 그래프에 저장하는 파이프라인을 소개합니다. 로컬 언어 모델이 주어·술어·목적어로 구성된 구조화 트리플을 제안한 다음, 문자열 기반 개체 연결로 이름을 표준화하고 공시에서 언급된 기업명을 표준 기업에 연결합니다. 확인된 관계를 그래프에 묶음 단위로 기록하고, 그래프 질의로 여러 기업이 공유하는 공급업체를 요약해 공급망 집중도를 살펴봅니다. 이 노트북은 단계적으로 구성한…
이 데이터셋 안내서는 호가창 및 시장 미시구조 연구를 위한 US 주식 틱 데이터 두 출처를 비교합니다. Databento 시장별 주문 기록은 추가, 수정, 취소, 체결 이벤트를 전처리해 제공하고, NASDAQ ITCH는 파싱과 정규화가 필요한 원시 거래소 피드를 제공합니다. 유료 데이터 비용을 추산하고, 선택한 날짜를 내려받아 파일을 불러온 뒤 메시지 유형을 살펴보는 과정을 다룹니다. 특정 종목 연구에는 더 표적화된 시장별 주문 데이터를, 더 넓은 시장…
이 노트북은 금융 개체명 인식을 위해 트랜스포머를 미세 조정하고, 텍스트 구간을 조직, 인물, 금액, 날짜, 비율 필드로 구조화하는 방법을 보여줍니다. BIO 경계 레이블을 소개하고 단어 단위 주석을 서브워드 토큰에 정렬하는 방법을 설명합니다. 첫 번째 서브워드에는 단어 레이블을 부여하고, 뒤따르는 조각은 손실 계산에서 제외합니다. 또한 정확한 개체 구간 점수와 토큰 단위 점수를 구분하고, 추출한 개체 수를 문서 특성으로 활용하는 방법을 보여줍니다. 학습…
이 노트북은 분 단위 NASDAQ-100 데이터에서 모델 기반 특성을 만드는 세 가지 방법을 설명합니다. 분산 예측과 예측 오차를 위한 롤링 HAR 회귀, 최근 거래량 패턴을 위한 푸리에 변환, 가격과 주문 흐름의 변화 순서를 나타내는 깊이 2 경로 시그니처입니다. 적합된 매개변수에는 추정 구간의 정보가 담기므로 재적합 시점과 특성 시점에서 미래 정보를 피해야 한다고 강조합니다. 특성은 타임스탬프와 종목별로 저장하며, 설정된 예측 기간마다 필요한 서로 다른…
이 노트북은 기업 공시 텍스트 말뭉치에서 구절을 검색하는 네 가지 방법, 즉 BM25, 밀집 임베딩, 역순위 융합(RRF), 교차 인코더 재순위화를 비교합니다. RRF는 원점수가 아니라 순위 목록을 결합하므로 점수 척도를 서로 보정하지 않고도 어휘 기반 시스템과 의미 기반 시스템을 결합할 수 있습니다. 이어서 재순위화 모델이 후보 집합의 순서를 바꿉니다. 노트북은 검색 단계의 구현 방법과 동일한 검색 깊이에서 평가하는 방법도 설명합니다. 핵심 평가상의 교훈은…
이 사례 연구는 광범위한 US 주식 종목군에서 일별 횡단면 신호를 평가하고, 특정 시점 기준 데이터와 특성 설계에서 모델 비교, 포트폴리오 구성, 비용, 홀드아웃 평가에 이르는 연구 과정을 설명합니다. 워크포워드 검증, 여러 선행 수익률 기간, 선형 및 트리 기반 모델, 표 형식 및 시계열 신경망 모델, 잠재 요인 방법을 사용합니다. 트레이딩 전략은 시대별 거래 비용과 차입 관련 요소를 반영해 주식 순위에 따라 달러 중립 롱숏 포트폴리오를 구성합니다. 보고된…
이 노트북은 표 형식 특성으로 ETF 선행 수익률을 예측할 때 LightGBM을 MLP, TabM 및 사용 가능한 경우 TabPFN과 비교합니다. 모델은 동일한 시간순 워크포워드 폴드에서 평가하며, 순위 정보계수와 학습 시간을 주요 비교 기준으로 삼습니다. 신경망 접근법에는 단순 다층 퍼셉트론과 여러 어댑터 헤드가 하나의 백본을 공유하고 예측값을 평균하는 TabM이 포함됩니다. 학습에는 L1 손실을 사용하고 각 학습 구간 안의 홀드아웃 데이터로 조기 종료…