이 노트북은 회사 10-K 공시 문서에서 BM25 키워드 검색, 밀집 임베딩, 상호 순위 융합(RRF), 교차 인코더 재순위를 비교합니다. 각 검색 방식을 구현하고 정확한 질의, 개념 질의, 혼합 질의에 대한 순위 결과를 평가합니다. RRF는 원시 관련성 점수 대신 순위를 결합합니다. 따라서 점수 척도가 달라도 점수 보정 없이 시스템을 결합할 수 있습니다. 재순위 모델은 검색된 후보군을 더 짧은 최종 목록에 맞게 다시 정렬합니다. 사람의 판단 자료가 없으므로…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 550개
이 노트북은 US 주식 패널에서 세 가지 수익률 기간에 걸쳐 LightGBM 모델을 비교합니다. 그리드에서 트리 리프 수와 손실 함수를 바꾸고, 트리 수별 여러 체크포인트에서 각 설정을 채점합니다. 얕은 트리가 특성 간 상호작용을 학습하는 방식, 제곱·절대·Huber 손실이 두꺼운 꼬리 수익률에 서로 다르게 반응하는 방식, 선택을 평가할 때 각 체크포인트를 별도의 후보로 세어야 하는 이유를 설명합니다. 모델이 계속 개선되는지 과적합을 시작하는지 평가하기 위해…
이 노트북은 동일한 ETF 유니버스, 예측치, 리밸런싱 일정, 백테스트 절차를 사용해 동일 가중, 역변동성, 최소 분산, 계층적 리스크 패리티를 비교합니다. 롤링 Ridge 모델은 모멘텀, 이동평균 거리, 변동성 특성으로 ETF 순위를 매깁니다. 각 배분 방식은 공통으로 선택된 자산에 자체 가중 규칙을 적용합니다. 결과는 홀드아웃 전 선택 기간과 그 이후 홀드아웃 기간으로 나누며 위험 조정 수익률, 드로다운, 회전율, 안정성을 진단합니다. 신호와 선택 자산이…
이 US 주식 사례 연구는 미래 수익률을 예측하는 것과 모멘텀이 미래 수익률을 유발한다고 주장하는 것을 구분합니다. 최근 한 달을 제외한 주식의 직전 1년 수익률을 처치 변수, 미래 수익률을 결과 변수로 두고, 최근 변동성, 비유동성 순위, 거래량 비율을 교란 변수로 취급합니다. 더블 머신러닝은 먼저 이 교란 변수로 처치와 결과를 모델링한 다음 두 모형의 잔차 간 관계를 이용해 효과를 추정합니다. 워크포워드 적합에 엠바고를 적용해 미래 데이터로 보조 모형의…
이 노트북은 PPO 에이전트가 호가 기울기와 스프레드 폭을 선택하는 시뮬레이션 마켓 메이킹 과제를 구성합니다. 호가가 중간 가격에서 멀어질수록 체결 확률이 낮아지고, 주문 불균형은 체결과 이후 가격 변동 모두에 영향을 줍니다. 예약 가격은 보유 재고에 불리한 방향으로 호가를 이동시킵니다. 보상은 평가된 자산 가치와 재고 페널티를 합산하며, 에피소드 종료 시 남은 포지션에는 청산 비용이 발생합니다. 에이전트는 예약 가격 조정을 이미 적용하는 고정 규칙과…
이 노트북은 예측에 시장 국면을 활용하는 세 가지 방법을 비교합니다. 국면 입력이 없는 기준 모델, 변동성 국면의 필터링 확률을 입력받는 단일 모델, 확정된 국면 할당 안에서 각각 학습하는 별도 모델입니다. 룩어헤드를 피하기 위해 워크포워드 학습 블록마다 은닉 마르코프 모델을 다시 적합하고, 적합된 분산에 따라 상태 순서를 정한 뒤 테스트 블록을 순방향 재귀해 확률을 계산합니다. 폴드별 스케일링과 학습 데이터와 테스트 데이터 사이의 간격은 미래 관측치와…
이 노트북은 매수자 주도 부호 거래량 비중이 이후 15분 수익률과 연관되는지 추정하고, 상대 스프레드, 최근 실현 변동성, 직전 월 수익률을 고려합니다. 이중 머신러닝은 교차 적합을 사용해 이 교란 변수들로 결과와 처치를 예측한 다음, 통제 변수로 설명되지 않는 처치 변동을 분리하도록 잔차를 회귀합니다. 분석은 1분 단위 NASDAQ-100 관측치를 사용하고, 적격 모집단, 폴드 경계, 엠바고, 플라시보 설계를 정한 뒤 적합을 수행합니다. 블록 순열 반박은…
이 노트북은 이중 머신러닝(DML)을 사용해 연속형 ETF 모멘텀 지표가 이후 수익률에 미치는 조정 효과를 추정합니다. 최근 및 장기 변동성, 시장 국면, 수익률 곡선 기울기를 통제합니다. 조정하지 않은 회귀를 EconML 및 직접 구현한 DML와 비교하고, 교란 보정용 모델 선택이 추정치에 미치는 영향을 논의합니다. 인과적 해석은 충분한 처치 전 통제 변수와 다른 식별 가정에 달려 있으며, 관측되지 않은 충격과 모델 오지정은 여전히 편향의 원인이 될 수…
이 노트북은 FX 통화쌍 사례 연구의 LSTM 예측 실행을 설정합니다. 모델은 룩백 시퀀스에서 은닉 상태를 이어가며, 노트북은 공유 구성 및 연구 계획 도구를 통해 아키텍처와 학습 설정을 정합니다. 연구에서 선언한 라벨과 구성된 LSTM 아키텍처를 사용하고, 요청이 의도한 모델 모집단을 다루는지 확인하며, 적합을 실행하거나 저장된 가중치를 불러오기 전에 예상 예측 정체성과 체크포인트를 기록합니다. 시퀀스 적격성은 결측 구간을 고려합니다. 일별 관측치가 빠지면…
이 노트북은 ETF 수익률 예측에서 불확실성을 표현하는 방법을 살펴보며 몬테카를로 드롭아웃과 딥 앙상블을 비교합니다. 드롭아웃은 추론을 반복하는 동안 활성 상태로 유지되고, 앙상블은 별도로 학습한 네트워크 간의 불일치를 측정합니다. 이런 산포는 불확실성을 추정하지만 그 자체로 커버리지 속성을 가진 구간을 제공하지는 않습니다. 분할 컨포멀 보정은 예측 오차를 구간으로 변환하며, 일반 방식과 불확실성 정규화 방식을 모두 살펴봅니다. 노트북은 시간순…
이 노트북은 여러 트레이딩 사례 연구에 등록된 이중 머신러닝 추정치를 모아 불확실성과 진단 결과를 비교합니다. 각 연구 레지스트리의 최신 행을 불러와 레지스트리 무결성과 라벨 고유성을 확인하고, 커버리지를 명시하며, HAC 통계량과 신뢰 구간을 도출합니다. 추정된 효과는 각각의 고유 단위가 다르므로 포레스트 플롯은 효과 크기를 그대로 순위화하는 대신 무차원 HAC 통계량을 비교합니다. 또한 순진한 OLS 계수와 직교화 추정치를 대조하고, 교란 편향 측정값과…
이 노트북은 S&P 500 옵션 연구의 예측을 위해 명시된 LSTM 모델을 적합합니다. 네트워크는 각 종목 이력의 시간순 구간을 입력받고, 직접 설계한 특성에만 의존하는 대신 게이트 순환 상태를 사용해 여러 세션에 걸친 정보를 표현합니다. 설정된 룩백, 네트워크 크기, 드롭아웃, 배치 크기, 학습 체크포인트가 모델 요청을 정의합니다. 공통 워크플로가 폴드 구성, 검증 간격, 체크포인트, 재시작, 예측이 적격 행만 정확히 포함하는지 확인하는 절차를 처리합니다.…
이 노트북은 금융 뉴스 문장을 긍정, 중립, 부정으로 분류하는 세 가지 방법을 비교합니다. 로지스틱 회귀를 사용한 TF-IDF 단어 및 구문 특성, 분류기와 평균 정적 단어 벡터, 사전 학습된 FinBERT 감성 모델입니다. 높은 일치도를 보이는 Financial PhraseBank 하위 집합에서 동일한 층화 테스트 분할을 사용해 방법을 평가합니다. 두 어휘 기반 접근법은 학습 분할과 추정기를 공유하며, FinBERT는 별도 미세 조정된 분류기를 추가 조정…
이 노트북은 회계 및 가격 기반 특성이 다음 달 US 주식 수익률을 단독으로 예측하는지 평가합니다. 각 특성과 수익률 라벨 간 월별 횡단면 순위 상관을 계산한 다음 개발 기간의 여러 달에 걸쳐 요약합니다. 이 과정은 별도로 보류한 홀드아웃을 제외하고, 패널 무결성을 확인하며, 최소 커버리지와 횡단면 폭을 요구하고, 워크포워드 학습 및 검증 기간에도 연관성이 지속되는지 살펴봅니다. 관련된 월별 관측치와 다수 후보 테스트에서 생기는 불확실성을 반영하고, 어떤…
이 노트북은 CME 선물 사례 연구에서 후보 특성을 선별해 미래 수익률과 비교합니다. 각 특성의 값과 이후 수익률 간 횡단면 순위 상관을 계산하고, 날짜별 상관을 요약하며, 중첩된 수익률 기간에 따른 불확실성을 조정하고, 테스트한 전체 항목에 벤저미니-호크버그 거짓 발견률 제어를 적용합니다. 커버리지와 오래된 데이터 여부를 확인하고, 워크포워드 검증 연도와 대체 라벨 기간에 걸친 일관성을 살펴보며, 근거와 함께 진행·수정·중단 평가를 기록합니다. 이후 확인…
이 노트북은 주식 수익률과 별개로 시장 상황을 설명하기 위해 월별 거시경제 지표를 군집화합니다. FRED 시계열을 월말 관측값에 맞추고 실업률, 연방기금금리, 수익률 곡선 스프레드, 전년 대비 CPI 변화를 표준화한 다음 가우시안 혼합 모형을 적합합니다. 상승하는 CPI 수준 대신 인플레이션 변화량을 사용하면 군집이 주로 과거와 최근 날짜를 나누는 현상을 피할 수 있습니다. 군집 이름은 명시적인 임계값 규칙으로 사후에 붙이므로, 경제적 라벨은 모델이 자동으로…
이 노트북은 Diffusion-TS를 적용해 합성 일별 ETF 수익률 시퀀스를 생성합니다. 디노이저는 원래 시계열을 예측한 뒤, 그 예측을 다항식 추세, 선택된 푸리에 성분, 잔차로 분해합니다. 시간 영역과 주파수 영역의 목표를 결합해 수익률 값과 스펙트럼 구조를 모두 보존하려 합니다. 시퀀스를 겹치게 구성하고 시간 기준 홀드아웃을 둔 다음, 잡음이 있는 시퀀스로 학습한 분류기를 추가해 가우시안 은닉 마르코프 모델이 식별한 저변동성 또는 고변동성 레짐으로…
이 노트북은 실제 홀드아웃 산출물을 사용해 배포된 금융 모델을 모니터링하는 워크플로를 구성합니다. 드리프트를 측정하기 전에 새로 들어온 특성 데이터가 채워져 있고 구조적으로 유효한지 확인한 다음, 기준 구간과 현재 구간을 비교합니다. 특성 분포 변화는 모집단 안정성 지수와 두 표본 콜모고로프-스미르노프 검정으로 평가합니다. 안정성 임계값은 관례에 따른 기준인 반면 큰 표본에서는 통계적 유의성이 실질적으로 중요하지 않은 변화도 포착할 수 있으므로 두 측정값을…
이 노트북은 SHAP 패널의 릿지 회귀 예측을 ETF로 해석하는 방법을 설명합니다. 선형 모델에서 각 특성의 기여도는 계수에 학습 배경 평균으로부터의 특성 편차를 곱한 값이므로, 폐쇄형 계산과 대조해 확인할 수 있습니다. 전체 기여도 크기, 개별 예측에 대한 워터폴 설명, 확신도가 높았던 예측 중 정답과 오답의 비교, 워크포워드 폴드 간 중요도 안정성을 다룹니다. 또한 시간 폴드 간 중요도 변화와 한 폴드 안에서의 표본 추출 불확실성이라는 두 가지 불확실성을…
이 노트북은 조건부 오토인코더가 계측 주성분 모델을 어떻게 확장하는지 설명합니다. 신경망이 주식 특성을 요인 노출로 매핑하며, 노출과 요인 수익률을 곱하는 구조는 그대로 유지합니다. 학습 구간별로 설정된 미래 수익률 라벨을 재구성하도록 모델을 적합한 다음, 고정된 요인 평균을 검증일의 노출에 적용해 다음 구간에서 주식 순위를 매기는지 평가합니다. 재구성에 나중에 정보계수로 점수화하는 동일 라벨을 사용하므로, 양의 점수가 독립적인 발견은 아닙니다. 그래도 검증…
이 연구는 금융 특성과 GJR-GARCH 변동성 특성을 미래 주식 수익률과 비교해 선별합니다. 각 세션에서 종목 간 특성값과 이후 수익률의 순위 상관을 계산한 뒤, 평균 연관성, 워크포워드 검증 구간 간 일관성, 여러 후보를 검정한 뒤 결과의 신뢰성을 평가합니다. 예측 연관성을 측정하기 전에 특성의 데이터 범위와 오래된 값도 점검하고 각 특성에 대한 판정을 기록합니다. 분석에는 개발 데이터를 사용하고, 홀드아웃은 나중에 선택한 설정을 위해 남겨둡니다. 미래…
이 자료는 감성 분석, 텍스트 특성 개발, 뉴스와 수익률의 연관성 실험에 쓰이는 금융 뉴스 코퍼스 두 가지를 소개합니다. FNSPID는 헤드라인과 주식 티커를 연결하며 오랜 기간을 포괄합니다. 전체 모음과 함께 더 작은 표본도 이용할 수 있습니다. Bloomberg 아카이브에는 더 짧은 기간의 뉴스 텍스트와 구조화된 금융 시계열이 있으며, 감성·주제 분석과 데이터셋 간 강건성 실험을 위한 보조 자료로 제시됩니다. 두 자료 모두 공개 데이터 허브를 통해…
이 노트북은 유럽형 콜옵션 매도 포지션의 딥 헤징을 보여줍니다. 기하 브라운 운동으로 기초자산 가격 경로를 시뮬레이션하고, 벤치마크로 블랙-숄즈 델타를 계산하며, 헤지 포지션을 선택하는 준순환 신경망을 학습합니다. 학습 목표는 만기 손실의 조건부 위험가치를 최소화하는 것입니다. 손익 계산에는 헤지 개시, 각 리밸런싱, 만기 청산에 비례 비용을 부과해 동일한 가정 아래 이산 델타 헤징과 비교할 수 있습니다. 학습된 트레이딩이 델타 벤치마크에 가까워질수록 덜…
이 노트북은 주성분 10개가 포착한 광범위한 움직임을 통제한 뒤, 포트폴리오 운용 전략 4개가 SPY 수익률에 설명력을 더하는지 검정하는 방법을 보여줍니다. 후보 포트폴리오는 ETF의 최근 모멘텀, 낮은 변동성 또는 단기 반전을 기준으로 순위를 매기고, 시차 수익률로 롱·숏 바스켓을 구성합니다. 각 요인의 조정 전 SPY 로딩을 두 번의 LASSO 회귀로 통제 변수를 선택한 뒤 추정한 조건부 로딩과 비교합니다. 확장 시계열 교차 검증과 폴드별 스케일링 및…