이 문서는 ETF 수익률을 모델링하기 위한 계측 주성분 분석을 설명합니다. 각 펀드에 고정된 요인 노출을 부여하는 일반 PCA와 달리, IPCA는 각 펀드의 노출을 관측 가능한 특성의 공통 선형 함수로 모델링합니다. 교대 최소제곱법을 통해 특성에서 노출로 이어지는 매핑과 요인 수익률을 함께 추정합니다. 제안된 제약은 펀드와 날짜 전반의 정보를 통합하지만, 특성과 노출의 관계를 선형으로 가정한다는 한계가 있습니다. 이 노트북은 워크포워드 폴드에서 5일 및…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 550개
이 노트북은 스프레드, 호가 잔량 불균형, 부호가 있는 거래량, 가격 충격 같은 장중 미시구조 정보를 사용해 다음 15분 수익률 기준으로 NASDAQ-100 종목의 순위를 매기는 예측 모델을 비교합니다. 데이터 범위가 완전한 경우에만 모델 계열별 대표 예측 세트를 하나 선택하고, 모델 체크포인트는 서로 구분해 둡니다. 순위 상관관계와 불확실성 구간을 비교하고, 워크포워드 폴드별 성과를 확인하며, 예측 구간별 단조성과 국면 의존성을 검정합니다. 컨포멀 예측…
이 분석은 여러 트레이딩 사례 연구에서 선택한 신호가 후속 활용에 충분히 믿을 만한지 평가합니다. 검증 정보계수(IC)와 홀드아웃 근거를 비교하고 안정성과 재현성을 살펴보며, 예측 품질과 모델 예측으로 구성한 포트폴리오의 샤프 비율을 대조합니다. 히트맵과 계열별 요약은 자산군과 모델 계열에 따라 결과가 어떻게 달라지는지 보여줍니다. 평균 IC와 신호 샤프의 중앙값은 서로 다른 특성을 나타내므로 모델 순위를 다르게 매길 수 있다는 점도 드러냅니다. 검증 결과는…
이 튜토리얼은 자산 가격 및 거래량 이력으로 만드는 특성을 살펴봅니다. 여러 기간의 수익률, 추세 및 반전 지표, 다양한 변동성 추정치, 변동성 국면, 유동성, 꼬리 위험, 횡단면 정규화가 포함됩니다. 모멘텀 신호에서 가장 최근 관측치를 건너뛰고, 이동평균선과의 거리를 변동성으로 조정하며, 원시 거래량 대신 상대 거래량을 사용하는 등 실무적 선택을 설명합니다. 또한 정상성과 장기 정보 보존 사이의 균형을 맞추는 방법으로 분수 차분을 다룹니다. 구현 안내는…
이 노트북은 옵션 표면 특성을 포함한 주식 패널에 도구변수 주성분 분석(IPCA)을 적용하는 방법을 설명합니다. 각 종목의 수익률 이력에서 익스포저를 추정하는 일반 PCA과 달리, IPCA는 내재 변동성, 스큐, 기간 구조, 내재 분산과 실현 분산의 차이 등 종목별 날짜 특성의 공통 선형 함수로 익스포저를 모델링합니다. 교대 최소제곱법은 공통 팩터 수익률과 함께 이 매핑을 추정합니다. 특성으로 익스포저를 계산하므로 연속적인 수익률 이력이 없는 종목을 포함한…
이 노트북은 기업의 10-K 공시에서 공급업체, 고객, 경쟁사 관계를 추출해 Neo4j 지식 그래프에 저장하는 파이프라인을 소개합니다. 로컬 언어 모델이 주어·술어·목적어로 구성된 구조화 트리플을 제안한 다음, 문자열 기반 개체 연결로 이름을 표준화하고 공시에서 언급된 기업명을 표준 기업에 연결합니다. 확인된 관계를 그래프에 묶음 단위로 기록하고, 그래프 질의로 여러 기업이 공유하는 공급업체를 요약해 공급망 집중도를 살펴봅니다. 이 노트북은 단계적으로 구성한…
이 문서는 모델 학습과 백테스트를 다시 실행할지, 기존 결과를 재사용할지 결정하기 위한 레지스트리 점검을 설명합니다. 실행은 명세에서 도출한 해시로 식별하며, 예상 산출물이 모두 있을 때만 재사용할 수 있습니다. 빠진 항목이 있으면 실행을 부분 완료 상태로 표시해 재학습 또는 재실행을 시작하고, 명시적 강제 플래그는 디버깅을 지원합니다. 또한 예측 키를 표준화하고 요약하는 방법을 설명합니다. 버전이 관리되는 시간값 출력 규칙을 적용해 서로 다른 유형으로…
이 노트북은 금융 개체명 인식을 위해 트랜스포머를 미세 조정하고, 텍스트 구간을 조직, 인물, 금액, 날짜, 비율 필드로 구조화하는 방법을 보여줍니다. BIO 경계 레이블을 소개하고 단어 단위 주석을 서브워드 토큰에 정렬하는 방법을 설명합니다. 첫 번째 서브워드에는 단어 레이블을 부여하고, 뒤따르는 조각은 손실 계산에서 제외합니다. 또한 정확한 개체 구간 점수와 토큰 단위 점수를 구분하고, 추출한 개체 수를 문서 특성으로 활용하는 방법을 보여줍니다. 학습…
이 노트북은 CME 선물 수익률의 횡단면 예측에 그래디언트 부스팅을 적용합니다. 리프 수 구성으로 트리 용량을 바꾸고, 극단적 잔차가 학습에 미치는 영향이 서로 다른 제곱 오차, 절대 오차, 후버 목적 함수를 비교합니다. 각 모델을 여러 부스팅 체크포인트에서 평가하므로 선언된 모델 설정뿐 아니라 트리 수도 선택 기준이 됩니다. 고정된 모델 계열 안에서 기간별 효과를 비교할 수 있도록 동일한 그리드를 두 가지 수익률 기간에 적합합니다. 검증 결과를 살펴본 뒤…
이 노트북은 암호화폐 무기한 계약 펀딩 프리미엄을 예측하는 시퀀스 모델 비교에 시간 합성곱 신경망(TCN)을 추가합니다. 인과적 패딩은 각 위치가 현재와 이전 관측치만 사용하도록 하며, 팽창 합성곱은 수용 영역을 효율적으로 넓힙니다. 선택한 스택은 선언된 입력 구간 전체에 걸칩니다. 마지막 순환 상태를 바탕으로 예측하는 LSTM과 달리, TCN은 위치별 표현을 평균해 유용한 정보가 시간에 따라 어디에 나타나는지에 관한 다른 가설을 검증합니다. 이 모델은 앞선…
이 노트북은 기업 공시 텍스트 말뭉치에서 구절을 검색하는 네 가지 방법, 즉 BM25, 밀집 임베딩, 역순위 융합(RRF), 교차 인코더 재순위화를 비교합니다. RRF는 원점수가 아니라 순위 목록을 결합하므로 점수 척도를 서로 보정하지 않고도 어휘 기반 시스템과 의미 기반 시스템을 결합할 수 있습니다. 이어서 재순위화 모델이 후보 집합의 순서를 바꿉니다. 노트북은 검색 단계의 구현 방법과 동일한 검색 깊이에서 평가하는 방법도 설명합니다. 핵심 평가상의 교훈은…
이 문서는 리서치 패널, 집계 예측, 반대 토론, 감독자를 결합한 종단 간 예측 구조를 소개합니다. 감독자는 의견 차이를 찾아 이를 설명할 근거를 검색하고 신뢰도 표기와 함께 확률을 제안합니다. 신뢰도 기반 규칙은 해당 확률로 앙상블을 대체할지, 결합할지, 그대로 둘지 결정합니다. 노트북은 출력에 영향을 주는 설정을 한곳에 모으고 나중에 검토할 수 있도록 단계별 확률과 실행 세부사항을 기록합니다. 예제에서는 아직 결론이 나지 않은 경제 문제에 대한 기록된…
이 사례 연구는 광범위한 US 주식 종목군에서 일별 횡단면 신호를 평가하고, 특정 시점 기준 데이터와 특성 설계에서 모델 비교, 포트폴리오 구성, 비용, 홀드아웃 평가에 이르는 연구 과정을 설명합니다. 워크포워드 검증, 여러 선행 수익률 기간, 선형 및 트리 기반 모델, 표 형식 및 시계열 신경망 모델, 잠재 요인 방법을 사용합니다. 트레이딩 전략은 시대별 거래 비용과 차입 관련 요소를 반영해 주식 순위에 따라 달러 중립 롱숏 포트폴리오를 구성합니다. 보고된…
이 노트북은 사례 연구 간 LightGBM 모델 비교를 구성하고, 가능한 경우 선형 모델과 TabM을 기준 모델 계열로 사용합니다. 트리 크기, 회귀 손실 함수, 체크포인트, 분류 목적 함수에 따라 설정을 평가합니다. 주요 신호 지표는 일별 횡단면 Spearman 정보 계수의 평균이며, HAC 신뢰구간과 함께 보고합니다. 모델들이 동일한 폴드와 기간에 걸쳐 평가되었는지를 고려해 비교합니다. 분석은 상위 설정을 선택하고 손실 함수와 트리 깊이를 비교하며…
이 문서는 고정 기간에 걸쳐 포지션을 청산하도록 에이전트를 학습시키는 Gymnasium 환경을 설명합니다. 관측값은 남은 재고와 시간에 스프레드, 시장 깊이, 변동성, 정상 또는 스트레스 국면을 결합합니다. 연속형 행동은 기준 일정에 대한 실행 속도를 설정하고, 참여율과 일정 한도가 거래를 제한합니다. 완료를 보장하기 위해 마지막 단계에서 남은 주식을 모두 매도합니다. 시장 경로에는 GARCH 변동성, 국면별 유동성, 방향성 기대 드리프트가 없는 가격 변동이…
이 노트북은 표 형식 특성으로 ETF 선행 수익률을 예측할 때 LightGBM을 MLP, TabM 및 사용 가능한 경우 TabPFN과 비교합니다. 모델은 동일한 시간순 워크포워드 폴드에서 평가하며, 순위 정보계수와 학습 시간을 주요 비교 기준으로 삼습니다. 신경망 접근법에는 단순 다층 퍼셉트론과 여러 어댑터 헤드가 하나의 백본을 공유하고 예측값을 평균하는 TabM이 포함됩니다. 학습에는 L1 손실을 사용하고 각 학습 구간 안의 홀드아웃 데이터로 조기 종료…
이 노트북은 기준 주문을 유한 기간 제어 문제로 설정합니다. 각 구간에서 표 형식 Q-러닝은 VWAP 기반 거래 분할량에 곱할 계수를 선택하며, 시간과 남은 재고, 가장 최근에 관측한 스프레드 및 변동성 국면을 고려합니다. 보상은 스프레드와 시나리오 기반 시장 충격을 포함한 실행 비용과 변동성이 큰 구간 동안 재고를 보유하는 데 따른 선형 페널티 사이의 균형을 맞춥니다. 참여율 상한은 체결량을 제한하고 종료 페널티는 미체결 재고에 비용을 부과합니다. 가격과…
이 노트북은 20개 통화쌍에서 후보 신호를 하나씩 검사하는 방법을 설명합니다. 워크포워드 검증 구간만 사용해 각 특성의 일별 횡단면 순위와 다음 거래일 수익률 간의 일치도를 계산합니다. 레이블 결과가 홀드아웃 안에서 확정되지 않도록 평가 패널을 홀드아웃보다 충분히 앞에서 끊습니다. 커버리지 및 최신성 필터로 평가하기에 너무 희소하거나 정적인 열을 제거하고, Newey–West 방식의 불확실성 추정으로 인접 거래일 간 의존성을 고려합니다. 폴드 방향 확인,…
이 연구는 미래 수익률을 기준으로 통화쌍 순위를 매길 때 그래디언트 부스팅 트리와 페널티를 적용한 선형 모델을 비교합니다. 트리는 한 시장 국면에서 모멘텀을, 다른 국면에서 캐리를 사용하는 것처럼 조건부 관계를 나타낼 수 있다는 점이 분석의 동기입니다. 다만 통화쌍은 통화를 공유하므로 통계적으로 서로 의존합니다. 미리 정한 격자는 리프 수에 따라 트리 용량을 달리하고 제곱오차, 절대오차, Huber 목적 함수를 비교합니다. 각 구성은 여러 학습 단계…
이 노트북은 기업 특성으로 수익률을 예측하는 잠재 요인 접근법인 도구화 주성분 분석(IPCA)을 소개합니다. 각 특성에 직접 수익률 가중치를 부여하는 대신, IPCA는 각 기업의 요인 노출을 해당 기업 특성의 선형 함수로 모델링합니다. 공통 매핑은 패널 전체에서 추정하고, 요인 수익률은 월별로 달라집니다. 교대 최소제곱법은 Ridge 페널티를 적용해 매핑과 요인 수익률을 함께 추정하며, 적합된 노출과 수익률로 검증 월의 예측값을 생성합니다. 이 노트북은…
이 문서는 알려진 합성 데이터 생성 과정의 계열 안에서 지도 추론을 수행하는 ADIA Lab의 인과 발견 과제를 살펴봅니다. 이 과제는 다수의 레이블이 있는 데이터셋과 그래프 쌍을 사용해 처치와 결과를 둘러싼 변수에 8가지 역할을 부여합니다. 시뮬레이터가 생성한 예시에서 안정적인 통계 패턴을 학습하고, 일부 접근법은 PC나 NOTEARS 같은 방법의 출력을 모델 특성으로 사용하기 때문에 이 환경에서는 지도 모델이 고전적인 발견 방법보다 나은 성능을 낼 수…
이 모듈은 재현성을 유지하고 선택 편향을 피하는 데 중점을 두고 등록된 예측 집합으로 평균 예측 앙상블을 만듭니다. 직접 작성한 구성원 목록을 관리하는 대신 레지스트리에서 조건에 맞는 모델 구성을 확인합니다. 불완전하거나 폐기된 예측은 제외하고 검증 결과가 가장 좋은 체크포인트를 고르는 대신 구성별로 허용되는 마지막 체크포인트를 선택합니다. 또한 하나의 구성이 여러 활성 학습 실행에 연결되는 모호한 경우는 거부합니다. 평균을 내기 전에 예측 스키마를…
이 노트북은 기본 Python 오케스트레이션, CrewAI, LangGraph로 네 단계 예측 워크플로를 구현합니다. 상태 저장 위치, 오류 확인 및 복구 방식, 각 접근법이 추가하는 의존성, 추적 방식을 비교합니다. 기본 Python과 LangGraph 버전은 동일한 전문가 클래스를 조합하지만 CrewAI 버전은 역할 프롬프트를 사용한 작업과 다른 모델 호출 경로를 사용합니다. 따라서 세 버전의 예측 확률값은 프레임워크 품질을 통제된 방식으로 비교하는…
이 장에서는 적합된 통계 절차를 트레이딩 모델의 특성으로 바꾸는 방법을 살펴봅니다. 진단 및 정상성, 구조적 변화, 분수 차분, 칼만 필터, 스펙트럼 및 경로 서명 기법, ARIMA 및 GARCH 변동성, HAR 및 거친 변동성 측정치, 불확실성 추정치, 국면 모델, 횡단면 또는 패널 변환을 다룹니다. 출력에는 필터링된 수준과 추세, 혁신, 예측값, 조건부 변동성, 국면 확률, 사후 또는 예측 불확실성이 포함됩니다. 핵심 워크플로는 학습 데이터를 사용해…