이 노트북은 NASDAQ ITCH 체결 기록을 사용해 정규장 동안 거래량과 거래 활동이 어떻게 달라지는지 살펴봅니다. 체결을 시간 단위 봉으로 재표본화하고, 거래 활동이 높은·중간·낮은 대표 종목의 가격과 거래량을 비교한 다음, 거래가 가장 활발한 각 종목의 일일 거래량을 기준으로 정규화해 프로필의 평균을 냅니다. 그 결과 장 시작과 마감 무렵에는 거래가 늘고 한낮에는 둔화되는 패턴이 드러납니다. 또한 장 시작 및 마감 봉의 거래량을 한낮과 비교하고, 시간대…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 966개
이 노트북은 스프레드, 호가 잔량 불균형, 부호가 있는 거래량, 가격 충격 같은 장중 미시구조 정보를 사용해 다음 15분 수익률 기준으로 NASDAQ-100 종목의 순위를 매기는 예측 모델을 비교합니다. 데이터 범위가 완전한 경우에만 모델 계열별 대표 예측 세트를 하나 선택하고, 모델 체크포인트는 서로 구분해 둡니다. 순위 상관관계와 불확실성 구간을 비교하고, 워크포워드 폴드별 성과를 확인하며, 예측 구간별 단조성과 국면 의존성을 검정합니다. 컨포멀 예측…
이 노트북은 기대 로그 자산을 극대화해 이진 베팅의 켈리 투자 규모를 도출한 뒤, 베팅액이 시뮬레이션 자산 경로의 분포를 어떻게 바꾸는지 보여줍니다. 이 프레임워크를 연속 수익률과 다중 자산 포트폴리오로 확장합니다. 이때 익숙한 평균 대비 분산 식은 로그 함수의 절단 전개에 의존합니다. 포트폴리오 해법에서 내재 레버리지와 자본을 소진시킬 수 있는 불리한 움직임도 살펴봅니다. 롤링 추정은 시장 데이터로 기대수익률과 공분산을 추정할 때 포지션 규모가 얼마나…
이 유틸리티는 기반 계산을 다시 실행하지 않고 백테스트 식별자를 변경하는 마이그레이션의 유효성을 확인하는 방법을 설명합니다. 데이터베이스 스키마를 살펴 등록 주소가 들어 있는 열을 찾습니다. 여기에는 텍스트 문서 안에 포함된 참조도 들어갑니다. 그런 다음 마이그레이션 전후의 끊어진 참조 개수를 비교합니다. 과거 참조 중에는 의도적으로 이미 해결되지 않은 것도 있을 수 있으므로, 중요한 점검은 마이그레이션으로 어느 위치에서든 끊어진 참조가 늘었는지 확인하는…
이 분석은 여러 트레이딩 사례 연구에서 선택한 신호가 후속 활용에 충분히 믿을 만한지 평가합니다. 검증 정보계수(IC)와 홀드아웃 근거를 비교하고 안정성과 재현성을 살펴보며, 예측 품질과 모델 예측으로 구성한 포트폴리오의 샤프 비율을 대조합니다. 히트맵과 계열별 요약은 자산군과 모델 계열에 따라 결과가 어떻게 달라지는지 보여줍니다. 평균 IC와 신호 샤프의 중앙값은 서로 다른 특성을 나타내므로 모델 순위를 다르게 매길 수 있다는 점도 드러냅니다. 검증 결과는…
이 노트북은 옵션 표면 특성을 포함한 주식 패널에 도구변수 주성분 분석(IPCA)을 적용하는 방법을 설명합니다. 각 종목의 수익률 이력에서 익스포저를 추정하는 일반 PCA과 달리, IPCA는 내재 변동성, 스큐, 기간 구조, 내재 분산과 실현 분산의 차이 등 종목별 날짜 특성의 공통 선형 함수로 익스포저를 모델링합니다. 교대 최소제곱법은 공통 팩터 수익률과 함께 이 매핑을 추정합니다. 특성으로 익스포저를 계산하므로 연속적인 수익률 이력이 없는 종목을 포함한…
이 노트북은 검증 데이터에서 선택한 설정을 사용해 이전까지 살펴보지 않은 ETF 홀드아웃 구간의 예측을 생성합니다. 학습 명세가 구간 시작보다 레이블 예측 기간 하나만큼 앞서 끝나도록 다시 구성하고, 모델을 재적합한 뒤 선택된 체크포인트를 유지하며, 결과 학습 식별자가 검증 적합 결과와 다른지 확인합니다. 레지스트리 점검으로 표본 외 예측임을 입증할 수 없는 기존 예측 세트를 찾아내고, 같은 구간에 다른 설정을 평가하지 못하게 합니다. 이 노트북은 이러한…
이 노트북은 기업의 10-K 공시에서 공급업체, 고객, 경쟁사 관계를 추출해 Neo4j 지식 그래프에 저장하는 파이프라인을 소개합니다. 로컬 언어 모델이 주어·술어·목적어로 구성된 구조화 트리플을 제안한 다음, 문자열 기반 개체 연결로 이름을 표준화하고 공시에서 언급된 기업명을 표준 기업에 연결합니다. 확인된 관계를 그래프에 묶음 단위로 기록하고, 그래프 질의로 여러 기업이 공유하는 공급업체를 요약해 공급망 집중도를 살펴봅니다. 이 노트북은 단계적으로 구성한…
이 문서는 모델 학습과 백테스트를 다시 실행할지, 기존 결과를 재사용할지 결정하기 위한 레지스트리 점검을 설명합니다. 실행은 명세에서 도출한 해시로 식별하며, 예상 산출물이 모두 있을 때만 재사용할 수 있습니다. 빠진 항목이 있으면 실행을 부분 완료 상태로 표시해 재학습 또는 재실행을 시작하고, 명시적 강제 플래그는 디버깅을 지원합니다. 또한 예측 키를 표준화하고 요약하는 방법을 설명합니다. 버전이 관리되는 시간값 출력 규칙을 적용해 서로 다른 유형으로…
이 노트북은 금융 개체명 인식을 위해 트랜스포머를 미세 조정하고, 텍스트 구간을 조직, 인물, 금액, 날짜, 비율 필드로 구조화하는 방법을 보여줍니다. BIO 경계 레이블을 소개하고 단어 단위 주석을 서브워드 토큰에 정렬하는 방법을 설명합니다. 첫 번째 서브워드에는 단어 레이블을 부여하고, 뒤따르는 조각은 손실 계산에서 제외합니다. 또한 정확한 개체 구간 점수와 토큰 단위 점수를 구분하고, 추출한 개체 수를 문서 특성으로 활용하는 방법을 보여줍니다. 학습…
이 노트북은 CME 선물 수익률의 횡단면 예측에 그래디언트 부스팅을 적용합니다. 리프 수 구성으로 트리 용량을 바꾸고, 극단적 잔차가 학습에 미치는 영향이 서로 다른 제곱 오차, 절대 오차, 후버 목적 함수를 비교합니다. 각 모델을 여러 부스팅 체크포인트에서 평가하므로 선언된 모델 설정뿐 아니라 트리 수도 선택 기준이 됩니다. 고정된 모델 계열 안에서 기간별 효과를 비교할 수 있도록 동일한 그리드를 두 가지 수익률 기간에 적합합니다. 검증 결과를 살펴본 뒤…
이 노트북은 분 단위 NASDAQ-100 데이터에서 모델 기반 특성을 만드는 세 가지 방법을 설명합니다. 분산 예측과 예측 오차를 위한 롤링 HAR 회귀, 최근 거래량 패턴을 위한 푸리에 변환, 가격과 주문 흐름의 변화 순서를 나타내는 깊이 2 경로 시그니처입니다. 적합된 매개변수에는 추정 구간의 정보가 담기므로 재적합 시점과 특성 시점에서 미래 정보를 피해야 한다고 강조합니다. 특성은 타임스탬프와 종목별로 저장하며, 설정된 예측 기간마다 필요한 서로 다른…
이 노트북은 기업 공시 텍스트 말뭉치에서 구절을 검색하는 네 가지 방법, 즉 BM25, 밀집 임베딩, 역순위 융합(RRF), 교차 인코더 재순위화를 비교합니다. RRF는 원점수가 아니라 순위 목록을 결합하므로 점수 척도를 서로 보정하지 않고도 어휘 기반 시스템과 의미 기반 시스템을 결합할 수 있습니다. 이어서 재순위화 모델이 후보 집합의 순서를 바꿉니다. 노트북은 검색 단계의 구현 방법과 동일한 검색 깊이에서 평가하는 방법도 설명합니다. 핵심 평가상의 교훈은…
이 문서는 리서치 패널, 집계 예측, 반대 토론, 감독자를 결합한 종단 간 예측 구조를 소개합니다. 감독자는 의견 차이를 찾아 이를 설명할 근거를 검색하고 신뢰도 표기와 함께 확률을 제안합니다. 신뢰도 기반 규칙은 해당 확률로 앙상블을 대체할지, 결합할지, 그대로 둘지 결정합니다. 노트북은 출력에 영향을 주는 설정을 한곳에 모으고 나중에 검토할 수 있도록 단계별 확률과 실행 세부사항을 기록합니다. 예제에서는 아직 결론이 나지 않은 경제 문제에 대한 기록된…
이 노트북은 사례 연구 간 LightGBM 모델 비교를 구성하고, 가능한 경우 선형 모델과 TabM을 기준 모델 계열로 사용합니다. 트리 크기, 회귀 손실 함수, 체크포인트, 분류 목적 함수에 따라 설정을 평가합니다. 주요 신호 지표는 일별 횡단면 Spearman 정보 계수의 평균이며, HAC 신뢰구간과 함께 보고합니다. 모델들이 동일한 폴드와 기간에 걸쳐 평가되었는지를 고려해 비교합니다. 분석은 상위 설정을 선택하고 손실 함수와 트리 깊이를 비교하며…
이 노트북은 표 형식 특성으로 ETF 선행 수익률을 예측할 때 LightGBM을 MLP, TabM 및 사용 가능한 경우 TabPFN과 비교합니다. 모델은 동일한 시간순 워크포워드 폴드에서 평가하며, 순위 정보계수와 학습 시간을 주요 비교 기준으로 삼습니다. 신경망 접근법에는 단순 다층 퍼셉트론과 여러 어댑터 헤드가 하나의 백본을 공유하고 예측값을 평균하는 TabM이 포함됩니다. 학습에는 L1 손실을 사용하고 각 학습 구간 안의 홀드아웃 데이터로 조기 종료…
이 노트북은 20개 통화쌍에서 후보 신호를 하나씩 검사하는 방법을 설명합니다. 워크포워드 검증 구간만 사용해 각 특성의 일별 횡단면 순위와 다음 거래일 수익률 간의 일치도를 계산합니다. 레이블 결과가 홀드아웃 안에서 확정되지 않도록 평가 패널을 홀드아웃보다 충분히 앞에서 끊습니다. 커버리지 및 최신성 필터로 평가하기에 너무 희소하거나 정적인 열을 제거하고, Newey–West 방식의 불확실성 추정으로 인접 거래일 간 의존성을 고려합니다. 폴드 방향 확인,…
이 노트북은 비트코인 무기한 선물의 극단적 프리미엄에 관한 두 가지 인과 질문을 비교합니다. 프리미엄 상태가 미래 수익률을 예측하는지, 그리고 이후 프리미엄 평균회귀를 예측하는지 살펴봅니다. 처치는 정해진 임계값을 넘는 프리미엄 z점수의 이진 지표입니다. 설계에서는 과거 수익률과 변동성을 통제 변수로 사용하고 결과는 미래에 측정하며, 두 결과 모두 같은 조정 변수 집합과 검증 점검으로 효과를 추정합니다. 비교의 핵심은 인과 메커니즘입니다. 펀딩 압력은 무기한…
이 연구는 미래 수익률을 기준으로 통화쌍 순위를 매길 때 그래디언트 부스팅 트리와 페널티를 적용한 선형 모델을 비교합니다. 트리는 한 시장 국면에서 모멘텀을, 다른 국면에서 캐리를 사용하는 것처럼 조건부 관계를 나타낼 수 있다는 점이 분석의 동기입니다. 다만 통화쌍은 통화를 공유하므로 통계적으로 서로 의존합니다. 미리 정한 격자는 리프 수에 따라 트리 용량을 달리하고 제곱오차, 절대오차, Huber 목적 함수를 비교합니다. 각 구성은 여러 학습 단계…
이 노트북은 기업 특성으로 수익률을 예측하는 잠재 요인 접근법인 도구화 주성분 분석(IPCA)을 소개합니다. 각 특성에 직접 수익률 가중치를 부여하는 대신, IPCA는 각 기업의 요인 노출을 해당 기업 특성의 선형 함수로 모델링합니다. 공통 매핑은 패널 전체에서 추정하고, 요인 수익률은 월별로 달라집니다. 교대 최소제곱법은 Ridge 페널티를 적용해 매핑과 요인 수익률을 함께 추정하며, 적합된 노출과 수익률로 검증 월의 예측값을 생성합니다. 이 노트북은…
이 문서는 알려진 합성 데이터 생성 과정의 계열 안에서 지도 추론을 수행하는 ADIA Lab의 인과 발견 과제를 살펴봅니다. 이 과제는 다수의 레이블이 있는 데이터셋과 그래프 쌍을 사용해 처치와 결과를 둘러싼 변수에 8가지 역할을 부여합니다. 시뮬레이터가 생성한 예시에서 안정적인 통계 패턴을 학습하고, 일부 접근법은 PC나 NOTEARS 같은 방법의 출력을 모델 특성으로 사용하기 때문에 이 환경에서는 지도 모델이 고전적인 발견 방법보다 나은 성능을 낼 수…
이 모듈은 재현성을 유지하고 선택 편향을 피하는 데 중점을 두고 등록된 예측 집합으로 평균 예측 앙상블을 만듭니다. 직접 작성한 구성원 목록을 관리하는 대신 레지스트리에서 조건에 맞는 모델 구성을 확인합니다. 불완전하거나 폐기된 예측은 제외하고 검증 결과가 가장 좋은 체크포인트를 고르는 대신 구성별로 허용되는 마지막 체크포인트를 선택합니다. 또한 하나의 구성이 여러 활성 학습 실행에 연결되는 모호한 경우는 거부합니다. 평균을 내기 전에 예측 스키마를…
이 노트북은 가격 수준에서 금융 특성을 추출하는 국소 선형 추세 상태 공간 모델을 설명합니다. 숨겨진 상태에는 가격 수준과 기울기가 포함되고 관측값은 잡음이 있는 종가입니다. 필터는 매 단계 상태를 예측하고 관측값의 혁신을 측정한 뒤 칼만 이득에 따라 추정치를 업데이트합니다. 이렇게 얻은 수준, 기울기, 혁신, 불확실성으로 추세와 예상 밖의 움직임, 신뢰도를 설명할 수 있습니다. 잡음 설정은 추정치의 반응 속도를 좌우하며 최대우도 적합은 임의로 정한 값 대신…
이 노트북은 기본 Python 오케스트레이션, CrewAI, LangGraph로 네 단계 예측 워크플로를 구현합니다. 상태 저장 위치, 오류 확인 및 복구 방식, 각 접근법이 추가하는 의존성, 추적 방식을 비교합니다. 기본 Python과 LangGraph 버전은 동일한 전문가 클래스를 조합하지만 CrewAI 버전은 역할 프롬프트를 사용한 작업과 다른 모델 호출 경로를 사용합니다. 따라서 세 버전의 예측 확률값은 프레임워크 품질을 통제된 방식으로 비교하는…