이 노트북은 통합 관리 도구, 미리 정의했거나 직접 만든 심볼 종목군, 분할된 Parquet 저장소를 사용해 금융 시계열을 수집하고 관리하는 절차를 소개합니다. 단일 또는 여러 심볼의 병렬 수집, 저장소에 데이터 로딩, 특정 기간 데이터 읽기, 증분 업데이트, 연구나 백테스트 전 결측 구간 탐지를 다룹니다. 주식, 채권, 금을 아우르는 기준 재조정된 ETF 시계열은 일괄 로딩으로 여러 자산을 한 데이터셋에서 비교하는 방법을 보여줍니다. 이 절차는 반복 가능한…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 571개
이 노트북은 ETF 횡단면의 가격결정을 위한 확률적 할인 요인 모델을 소개합니다. 펀드 익스포저와 요인 수익률을 따로 추정하는 대신, 펀드 수익률과의 공분산이 평균 수익률을 설명하는 공통 할인 요인 시계열을 신경망으로 학습합니다. 학습 목표는 가격결정 오차를 최소화하는 것이며, 예측 수익률과 정보계수는 후속 진단 지표로 보고합니다. 모델을 해석할 때 최적화 대상과 보고된 예측 점수를 구분하는 것이 핵심입니다. 학습 전에 구현부는 설정을 적격 펀드·날짜 행,…
이 사례 연구는 NASDAQ-100 미시구조 특성에 그래디언트 부스팅 트리를 적용해 여러 장중 기간의 수익률과 방향을 예측합니다. 선형 모델과 트리를 비교합니다. 트리는 스프레드에 따라 주문흐름 불균형의 효과가 달라지는 등의 조건부 관계를 찾아낼 수 있지만, 선형 모델은 이런 상호작용을 명시적으로 입력해야 합니다. 탐색에서는 트리 규모, 손실 함수, 부스팅 반복 횟수를 바꾸고 여러 체크포인트에서 예측을 저장합니다. 노트북은 각 체크포인트가 평가를 위한 별도의…
이 노트북은 가상의 장중 전략 수익률을 실행 비용이 얼마나 잠식할 수 있는지 추정합니다. 먼저 분봉 호가를 사용해 NASDAQ-100 구성 종목의 거래량 가중 호가 스프레드를 측정한 뒤, 구성 종목 스프레드의 중앙값을 호가를 넘어 시장가로 체결할 때 드는 비용의 실증적 기준으로 삼습니다. 시장 충격, 슬리피지, 수수료 등 다른 비용 요소는 시나리오 가정입니다. 호가를 넘어 시장가로 체결하는 방식, 주문을 나눠 집행하는 방식, 패시브 방식의 실행 비용 구조를…
이 노트북은 설계된 ETF 특성에 차등 프라이버시를 적용해 생성적 적대 신경망을 학습하는 방법을 보여줍니다. 프라이버시 매개변수 엡실론과 델타를 소개하고, DP-SGD가 각 레코드의 그래디언트를 집계 전에 자르고 보정된 노이즈를 추가하는 이유를 설명하며, Opacus로 샘플별 그래디언트와 누적 프라이버시를 관리합니다. 배치 전체에 적용하는 정규화는 레코드 간 정보를 노출할 수 있으므로 판별자에는 호환되는 레이어가 필요합니다. 생성자는 실제 관측값을 직접…
이 노트북은 ETF 특성과 미래 수익률에 고전적인 최소제곱 추론을 적용합니다. 계수 추정치, 표준오차, t 통계량, p값과 이분산성, 잔차 자기상관, 비정규성, 다중공선성 검정을 살펴봅니다. 표본은 자산과 날짜로 구성된 불균형 패널입니다. 워크포워드 학습 폴드를 사용하고 학습 데이터로 특성을 표준화하며, 강건 공분산을 추정하기 전에 선형 종속성이 있는 수익률 합성 변수 여러 개를 제거합니다. 논의에서는 진단 결과가 패널 관측값의 정렬 및 그룹화 방식에 따라…
이 문서는 파싱된 NASDAQ ITCH 메시지를 로드하고 주문 추가, 삭제, 취소, 체결, 대체를 바탕으로 지정가 주문장을 재구성하는 유틸리티를 설명합니다. 주문별 잔여 주식 수를 추적해 이후 주문장 갱신에 현재 수량을 사용하고, 주문 참조를 따라 대체 메시지 연결을 처리합니다. 스냅샷은 여러 매수·매도 호가 단계와 함께 최우선 호가, 스프레드, 중간값을 보여줍니다. 이 문서는 Lee–Ready 방식의 거래 분류도 설명합니다. 각 거래 가격을 현재 중간…
이 노트북은 ETF 순위 신호를 포트폴리오 구성부터 단순화한 백테스트까지 추적합니다. 릿지 회귀와 로지스틱 분류를 워크포워드 분할로 학습한 뒤 모멘텀 및 동일 가중 포트폴리오와 비교합니다. 매월 리밸런싱할 때 활성 신호는 공매도 없이 동일 비중으로 상위 10개 종목 바스켓을 구성합니다. 비교에서는 총수익 및 순수익 성과 지표, 회전율, 횡단면 정보계수를 보고해 신호의 순위 선정 능력과 해당 포트폴리오 거래 결과가 어떻게 다를 수 있는지 보여줍니다. 거래…
이 노트북은 AAPL 거래소의 하루 거래 데이터로 만든 시간 바, 틱 바, 거래량 바, 달러 바, 불균형 바, 런 바를 비교합니다. 앞의 네 가지 표본 추출 방식은 경과 시간, 거래 건수, 거래 주식 수, 거래 명목 금액에 따라 관측값을 묶습니다. 불균형 바와 런 바는 추정된 거래 방향을 사용해 부호가 있는 주문흐름도 포착합니다. 노트북은 거래량 또는 달러 기준 표본 추출이 시간 바보다 정규성을 높이는지 등을 포함해 바 유형별 수익률 분포와 자기상관을 비교할…
추정 구간의 상관관계 네트워크로 주식 유니버스를 설명하고 네트워크 분산 포트폴리오를 구성하는 방법을 보여줍니다. 평가 전에 이용할 수 있는 데이터만으로 유동성 있는 종목을 선택하고, 수익률 상관관계를 거리로 변환해 최소 신장 트리(MST)를 추출합니다. 차수, 매개 중심성, 근접 중심성으로 트리의 허브와 연결 고리를 요약한 뒤 역중심성을 사용해 구조적으로 중심에 있는 자산의 가중치를 낮춥니다. 동시 충격 전파 민감도 분석을 설명하고 이후 평가 구간에서…
기존 Quandl WIKI US 주식 패널을 탐색하며 가격 기준, 데이터 범위, 이력으로 백테스트에서 무엇을 확인할 수 있는지 살펴봅니다. 거래 가격 수준을 나타내는 원시 가격과 액면분할 및 배당을 반영한 수익률 계산용 조정 가격을 구분합니다. 행 단위 결측값과 OHLC 일관성 검사에 더해 연도별 종목 수와 최초·최종 관측값으로 시간에 따른 커버리지를 확인하는 방법도 제안합니다. 핵심 발견은 기업들이 더 일찍 상장 폐지되었는데도 패널에 2014년 이전의 퇴출…
분 단위 NASDAQ-100 데이터에서 세 가지 절차로 특성을 구성합니다. 단기 분산 예측을 위한 롤링 이질적 자기회귀 회귀, 최근 활동의 주기 구조를 설명하는 푸리에 변환, 가격·주문 흐름·거래 강도 변화의 순서를 포착하는 깊이 2의 경로 시그니처입니다. 회귀 특성은 매개변수를 적합하는 데이터 구간에 따라 달라지지만, 변환과 시그니처는 최근 구간에 적용하는 고정 계산입니다. 특성은 봉마다 생성하며 단면 순위화 능력을 평가합니다. 방법론은 인과적 워크포워드…
NASDAQ TotalView-ITCH 메시지로 거래소 활동을 살펴보고 티커, 매수·매도 방향, 주문 속성을 연결한 체결 데이터 테이블을 구성합니다. 메시지 유형을 세고 훨씬 많은 호가 및 취소 이벤트와 거래를 비교하며, 거래대금으로 티커 순위를 매겨 거래소 내 활동 집중도를 살펴봅니다. 이렇게 속성을 보강한 체결 데이터는 이후 장중 패턴과 경험적 규칙성 연구에 활용할 수 있습니다. 체결 메시지는 모든 속성을 직접 제공하는 대신 주식 위치와 주문 참조 번호를…
공개된 US 기업 패널로 기업 특성 기반 월간 롱숏 전략을 연구할 수 있는지 평가합니다. 데이터 인코딩, 시간에 따른 가용 유니버스 변화, 리밸런싱마다 양쪽 포지션을 채울 만큼 기업이 충분한지, 특성 스프레드가 가정한 거래 비용을 넘어설 수 있는지 점검합니다. 홀드아웃을 열어보지 않은 채 개발 이력으로 워크포워드 평가를 할 수 있는지도 살펴봅니다. 기업 순위를 매겨 상위 그룹을 매수하고 하위 그룹을 매도하며 월간 수익률을 결과로 삼는 전략을 설명합니다.…
장중 봉으로 집계한 NASDAQ 거래 데이터에서 거래 기반 미시구조 특성을 구성하는 방법을 설명합니다. Kyle 람다, Amihud 비유동성, Roll 스프레드 추정량, 거래 강도, 주문 흐름 불균형(OFI)을 다룹니다. 집계하기 전에 OFI 개별 거래를 매수자 또는 매도자 주도로 분류해야 한다고 강조합니다. 봉 종가에만 부호를 부여하면 측정값이 봉 수익률의 방향으로 축소됩니다. 거래 활동을 설명하는 흐름 특성과 스프레드 및 잔량 같은 호가 장부 상태 특성도…
S&P 500 옵션을 대상으로 선형 모델, 그래디언트 부스팅, 표 형식 딥러닝, 시퀀스 모델의 검증 예측을 비교하는 방법을 설명합니다. 진단 결과를 제시하기 전에 등록된 각 예측 모집단이 적격성 조건을 충족하며 완전한지, 모든 모집단이 동일한 교차 검증 식별자를 공유하는지 확인합니다. 시퀀스 모델은 과거 이력이 필요하므로 적격 행이 다릅니다. 비교는 적격 그룹이 일치할 때 의미가 있으며, 모델 계열 간에 자동으로 비교할 수 있는 것은 아닙니다. 폴드별 정보…
이 노트북은 모델을 학습하거나 백테스트를 다시 실행하지 않고, 등록된 NASDAQ-100 미시구조 백테스트를 전략 평가로 정리합니다. 레지스트리에서 지표와 계보를 읽고, 필요한 경우 파생 코호트 및 대응 비교 표를 만들며, 공통 날짜의 전략을 동일 가중 벤치마크와 비교합니다. 핵심 방법은 독립적인 요약 통계를 빼는 대신 일별 수익률 차이를 분석해 대응 관측치가 공유하는 정보를 보존하는 것입니다. 연속된 일별 수익률 간 의존성을 고려하기 위해 블록 부트스트랩…
이 노트북은 바이너리 형식의 NASDAQ TotalView-ITCH 주문별 메시지 데이터를 구조화된 레코드로 디코딩하는 방법을 설명합니다. 메시지 프레이밍과 유형별 구조를 살펴보고 필드를 언패킹하는 방법을 보여줍니다. 자정부터 나노초 단위로 표현된 타임스탬프와 소수점 위치가 암묵적으로 정해진 정수 형식의 가격도 변환합니다. 주요 워크플로는 메시지를 순차적으로 읽고 지원되는 유형을 디코딩해 버퍼에 담은 뒤 메시지 유형별로 분할된 Parquet 파일에…
이 노트북은 피처 스토어가 학습 데이터와 실시간 모델 입력을 일치시키는 방법을 설명합니다. 엔터티 키, 이벤트 타임스탬프, 피처 값의 TTL(생존 시간), 피처 열을 기준으로 피처 뷰를 설명하고, 과거 학습을 위한 시점 기준 조인과 서빙을 위한 최신 값 조회를 비교합니다. 예시에서는 Parquet 파일에 저장된 일별 US 주식 재무 특성과 모델 산출 특성을 사용하며, 학습 데이터가 홀드아웃 경계를 넘지 않도록 하는 검사를 포함합니다. 또한 타임스탬프 규칙을…
이 노트북은 월별 ETF 모멘텀 및 수익률 곡선 국면 전략 하나를 벡터화 수익률 계산과 순차 계좌 시뮬레이션, 두 방식으로 적용합니다. 두 방식은 동일한 목표 비중, 자산, 날짜, 총 거래 비용을 사용하므로 목표 반영 시점, 체결 가격, 정수 단위 주식 제약, 현금 추적 등 실행 방식의 차이에 초점을 맞출 수 있습니다. 신호는 실현 변동성 대비 룩백 수익률의 비율로 ETF 순위를 매기고, 위험 선호 국면에는 선정 펀드를 보유하며 그 외에는 채권 ETF를…
이 노트북은 여러 기간의 선행 수익률을 예측하기 위해 1분 단위 NASDAQ-100 미시구조 특성에 장단기 기억 네트워크를 적합하는 과정을 설명합니다. 모델은 과거 관측값으로 구성한 시퀀스를 한 단계씩 처리하며 어떤 이전 관측치를 유지할지 학습합니다. 학습에는 워크포워드 폴드를 사용하고, 학습 데이터만으로 특성을 표준화하며, 종목과 폴드가 바뀔 때 상태를 초기화하고, 지정된 체크포인트에서 검증 예측치를 저장합니다. 학습 대상 간 중첩을 줄이기 위해 각 레이블…
이 노트북은 계측 주성분 분석에서 주식 특성을 요인 노출로 변환하는 선형 매핑을 신경망으로 대체한 조건부 오토인코더를 소개합니다. 노출과 요인 수익률의 곱으로 이루어진 구조는 유지하면서, 특성과 적재량 간 비선형 관계를 허용합니다. 각 학습 구간에서 설정된 선행 수익률 레이블을 재구성하도록 모델을 학습한 뒤, 검증 정보계수로 표현이 이후 날짜에도 적용되는지 측정합니다. 이 노트북은 한 번의 확률적 학습에서 여러 체크포인트의 예측값을 공개하고, 모델 선택은…
이 문서는 자산별 시계열과 맥락 정보를 상한과 하한이 있는 포트폴리오 리스크 비중으로 변환하는 신경망 정책 네트워크의 구조를 설명합니다. 자산별 기본 구조는 맥락 임베딩, 특성별 조절, 변수 선택, LSTM, 인과적 시간 어텐션을 결합합니다. 이후 지연된 횡단면 어텐션으로 자산 간 관계를 처리하며, 선택적으로 거시경제 인접 그래프로 범위를 제한한 어텐션을 적용할 수 있습니다. 정적 맥락에는 자산 정체성, 그룹 소속, 거래 비용을 담을 수 있고, 마스크는 이용…
이 노트북은 주요 S&P 500 주식 신호 구성에 적용할 포트폴리오 비중 산정 방식을 비교합니다. 먼저 검증 샤프를 기준으로 각 구성에서 전체 구간을 포괄하는 가장 우수한 체크포인트를 선택한 뒤, 점수 가중, 컨포멀 가중, 역변동성, 리스크 패리티, 평균-분산 최적화, 계층적 리스크 패리티 등 대체 배분 방식을 같은 예측치에 적용합니다. 리밸런싱마다 보유하는 종목 수도 바꾸고, 신호 단계의 동일 가중 기준선과 결과를 비교합니다. 이 설계는 예측 품질과 배분의…