이 장은 사전과 단어 수 계산부터 TF-IDF, 정적 임베딩, 순환 신경망, 트랜스포머까지 금융 텍스트 표현 방법을 살펴봅니다. 간단한 방법은 빠르고 해석하기 쉬우며 금융에 맞게 조정하기 좋지만, 맥락 기반 모델은 구절의 모호성과 관계를 더 잘 처리할 수 있다는 장단점을 설명합니다. 실무 흐름에서는 사전 학습 모델, 선택적 도메인 적응, 작업별 미세 조정을 사용해 감성, 서술상의 놀라움, 주제 노출, 구조화된 이벤트 등의 신호를 만듭니다. 모델 품질만으로…
지식 라이브러리
Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.
라이브러리 검색
문서 322개
이 노트북은 검색 범위, 답변의 근거 충실성, 적절한 답변 보류, 보안 동작을 각각 측정하는 금융 검색 증강 생성 평가 도구를 만듭니다. 실제 기업 공시에서 일부 맥락을 가져온 수작업 사례 6개로 답변 가능한 질문, 근거 누락, 프롬프트 인젝션, 근거가 뒷받침되지 않는 인용을 시험합니다. 서로 다른 문제를 하나의 정확도 점수로 합치는 대신 실패한 구성 요소를 진단하도록 설계되었습니다. 예시는 토큰 중첩 기반 근거 충실성 점수의 한계를 보여줍니다. 인용된…
이 노트북은 횡단면 정보계수(IC)와 예측 회전율을 함께 고려하며 Optuna로 LightGBM 수익률 모델을 튜닝합니다. 비교를 위한 단일 목적 탐색은 IC를 최대화합니다. NSGA-II 다목적 탐색은 파레토 최적 설정을 찾아 신호 순위 품질과 거래 비용의 대리 지표인 회전율 사이의 절충 관계를 보여줍니다. 이 경계선은 검증 점수 하나만 목표로 삼는 대신 비용 감내 수준에 맞춰 모델을 선택하는 데 도움이 됩니다. 노트북은 ETF에서 선택한 ETF…
이 노트북은 임베디드, 서버 기반, 범용, 트레이딩 특화 데이터베이스를 금융 시계열 작업에서 비교합니다. 대량 쓰기, 전체 스캔, 시간 구간 조회, OHLCV 집계, 체결 및 호가 정렬을 다룹니다. 저장 구조와 조회 유형에 따라 성능이 달라지는 것이 핵심입니다. 열 지향 엔진은 패널 스캔을 효율적으로 처리할 수 있고, 특정 백테스트 구간을 조회할 때는 시간순 인덱스나 파티션이 중요합니다. 측정 정책은 각 Python 클라이언트에서 새로 대량 기록을 수행해…
이 노트북은 21일 선행 ETF 수익률을 상승 또는 하락 목표값으로 변환하고, 시간순 워크포워드 폴드에서 L1 및 L2 정규화 로지스틱 회귀를 평가합니다. 각 폴드의 학습 데이터로 특성을 스케일링한 뒤 정확도, 정밀도, 재현율, F1, ROC AUC, 로그 손실로 예측을 평가합니다. 계수 기반 특성 중요도와 확률 보정, 수익률 하위·중간·상위 그룹을 구분하는 3개 클래스 확장도 살펴봅니다. 분류 성능과 확률 보정은 서로 다른 질문에 답합니다. AUC는 여러…
이 노트북은 Feast를 금융 및 모델 기반 데이터용 특성 저장소로 설정한 뒤, Feast의 과거 및 특정 시점 조회 결과를 투명하게 직접 작성한 조인과 비교합니다. 엔터티, 타임스탬프가 있는 데이터 원본, 특성 뷰, 유효 기간을 선언하고 날짜 범위를 넓힌 임시 Parquet 사본을 준비합니다. 일치 여부 점검은 잘못된 타임스탬프, 엔터티 키, 학습된 폴드 빈티지 선택 같은 설정 오류를 찾도록 설계되었습니다. 비교할 때는 Feast가 유효 기간 안에서 이전…
이 노트북은 특성, 목표값, 워크포워드 폴드를 고정한 채 월간 US 주식 수익률 예측에 사용하는 그래디언트 부스팅 목적 함수를 비교합니다. 제곱 오차와 절대 오차, 큰 잔차의 영향을 줄이는 Huber 손실을 대조합니다. 정보계수는 횡단면 순위를 평가하는데도 개별 종목의 극단적인 수익률이 제곱 오차 학습을 좌우할 수 있다는 점이 비교의 배경입니다. 탐색 격자에서는 트리 용량도 바꾸며, 여러 부스팅 체크포인트의 예측값을 기록해 학습 곡선으로 성능이 계속…
이 분석은 CME 선물 모델의 횡단면 정보계수(IC)를 해석하는 방법과 이후 포트폴리오 테스트와의 관계를 설명합니다. 각 날짜의 예측 수익률과 실제 수익률 간 순위 상관관계를 계산한 다음, 날짜별 상관계수의 평균을 구합니다. 이는 예측 수익률의 크기는 무시하고 순위에 따라 상품을 선택하는 동일 가중 전략에 해당합니다. 또한 폴드 간 평균과 t 통계량을 일별 시계열 추론과 구분하며, 보고된 t 통계량은 폴드 간 표준오차를 사용하고 예측값이 거의 일정해질 때는…
이 노트북은 모델이나 예측을 만들기 전에 과거 ETF 데이터로 월간 순위 전략을 뒷받침할 수 있는지 평가합니다. 전년도 유동성 정보를 사용해 특정 시점의 편입 자격을 확인하고, 리밸런싱 날짜의 가용 펀드 수를 세며, 주당 수수료와 추정 호가 스프레드의 절반을 가격 대비 비용으로 환산합니다. 수익률 변동으로 해당 비용을 감당할 수 있는지 살펴보고 펀드별 수익률 자기상관도 측정합니다. 또한 홀드아웃을 확인하지 않은 채 개발 표본에 워크포워드 분할을 적용할 수…
이 문서는 디플레이티드 샤프 비율(DSR)이 선택된 전략의 샤프 비율을 테스트한 전략 수, 샤프 추정치 간 변동, 비정규 수익률 분포에 맞춰 조정하는 방법을 설명합니다. 조정하지 않은 확률적 샤프 계산과 비교하고, 상보적 조합 대칭 교차 검증 분할을 사용하는 관련 백테스트 과적합 확률 분석도 개괄합니다. 무효 전략 및 동일 기대값 변형을 시뮬레이션해 최고 결과를 선택하면 실제보다 성과가 좋아 보일 수 있음을 보여줍니다. 실무 지침은 테스트한 모든 변형을…
이 노트북은 같은 종목, 같은 만기의 등가격 콜옵션과 풋옵션을 매도하고 만기까지 보유하는 전략의 후보 특성을 선별합니다. 각 특성에 대해 이용 가능한 종목을 향후 스트래들 결과와 같은 순서로 순위를 매기는지 측정합니다. 분석은 일별 횡단면 순위 일치도를 계산해 시간에 따라 평균하고, 포지션 중첩을 반영해 불확실성 추정치를 넓힙니다. 여러 후보를 테스트하는 유의성 선별도 조정하고 검증 기간 사이에 연관성이 유지되는지 확인합니다. 결과 기록표는 후속 연구 간…
이 노트북은 회사 10-K 공시 문서에서 BM25 키워드 검색, 밀집 임베딩, 상호 순위 융합(RRF), 교차 인코더 재순위를 비교합니다. 각 검색 방식을 구현하고 정확한 질의, 개념 질의, 혼합 질의에 대한 순위 결과를 평가합니다. RRF는 원시 관련성 점수 대신 순위를 결합합니다. 따라서 점수 척도가 달라도 점수 보정 없이 시스템을 결합할 수 있습니다. 재순위 모델은 검색된 후보군을 더 짧은 최종 목록에 맞게 다시 정렬합니다. 사람의 판단 자료가 없으므로…
이 노트북은 US 주식 패널에서 세 가지 수익률 기간에 걸쳐 LightGBM 모델을 비교합니다. 그리드에서 트리 리프 수와 손실 함수를 바꾸고, 트리 수별 여러 체크포인트에서 각 설정을 채점합니다. 얕은 트리가 특성 간 상호작용을 학습하는 방식, 제곱·절대·Huber 손실이 두꺼운 꼬리 수익률에 서로 다르게 반응하는 방식, 선택을 평가할 때 각 체크포인트를 별도의 후보로 세어야 하는 이유를 설명합니다. 모델이 계속 개선되는지 과적합을 시작하는지 평가하기 위해…
이 노트북은 기관의 보유 현황, 운용자 순위, 공동 보유 네트워크를 연구하기 위해 SEC의 분기별 대량 13F 보유 데이터를 처리합니다. 제출 날짜로 운용자별 최신 공시를 선택하고, 발행사 텍스트가 아니라 CUSIP 기준으로 증권을 집계하며, 주당 보고 가치의 중앙값이 타당한 범위를 벗어난 공시를 걸러냅니다. 가격 일관성 점검에서는 어느 필드의 단위가 잘못됐는지 가정하지 않고 보고 가치와 주식 수의 관계를 활용합니다. 보유 종목 수와 보고된 포지션 규모를…
이 노트북은 주식 및 옵션 연구에서 나온 검증 예측을 롱 온리 주식 포트폴리오로 바꿔 평가합니다. 동일 가중 상위 K개 기준 전략을 사용하고 여러 포트폴리오 집중도를 비교하며 레이블별 의사결정 주기를 따릅니다. 종가에 만든 신호는 다음으로 이용 가능한 시가에 실행하며, 시드가 고정된 무작위 신호 실행은 시스템 연결을 점검하는 데 사용합니다. 검증 날짜의 커버리지가 서로 비슷한지 확인한 뒤 후보 결과 순위를 매깁니다. 불확실성 분석에는 블록 부트스트랩 구간과…
이 노트북은 S&P 500 종목의 단기 등가격 스트래들을 위한 미래 수익률 레이블을 만듭니다. 일별 30일 스트래들 패널은 매 세션 행사가나 만기가 바뀌므로 가격 시계열을 단순히 이동하면 서로 다른 계약을 비교하게 됩니다. 대신 원시 옵션 체인에서 기호, 행사가, 만기로 각 진입 계약을 추적해 진입 시점과 청산 또는 결제 시점에 동일한 포지션의 가격을 산정합니다. 고정 기간 및 델타 헤지 변형도 만들고, 누락 레이블의 원인을 확인하며, 각 계약의 결제일을…
이 노트북은 NASDAQ ITCH 기반 체결 및 주문 메시지로 시장 미시구조 패턴을 보여줍니다. 틱 단위 거래 가격 수익률의 음의 1차 자기상관을 살펴보며, 기초 가치가 변하지 않아도 매수호가와 매도호가에서 체결이 번갈아 발생하면서 가격 반전처럼 보이는 현상이 생길 수 있다고 설명합니다. 수익률 분석에서 매수·매도 호가를 오가며 발생하는 가격 반전 현상을 줄이려면 중간 가격 수익률을 사용하는 것이 유용할 수 있습니다. 이 노트북은 활동 수준이 다른 종목들의…
이 유틸리티 모듈은 트레이딩 데이터 패널을 진단하는 통계 도구를 제공합니다. 자기상관 함수는 각 개체 안에서 곡선을 계산한 뒤 개체 간 결과를 통합해, 한 시계열 끝부분과 다른 시계열 시작 부분 사이의 허위 의존성을 피합니다. 기간 인덱스를 제공하면 결측 기간을 보존해 관측치가 의도된 시차에 맞춰 짝을 이루게 합니다. 통합 추정치, 개체 간 백분위수, 불확실성 참고값, 시차에 따라 달라질 수 있는 개수도 보고합니다. 다른 도구는 퍼지 간격과 홀드아웃 기간을…
이 US 주식 사례 연구는 미래 수익률을 예측하는 것과 모멘텀이 미래 수익률을 유발한다고 주장하는 것을 구분합니다. 최근 한 달을 제외한 주식의 직전 1년 수익률을 처치 변수, 미래 수익률을 결과 변수로 두고, 최근 변동성, 비유동성 순위, 거래량 비율을 교란 변수로 취급합니다. 더블 머신러닝은 먼저 이 교란 변수로 처치와 결과를 모델링한 다음 두 모형의 잔차 간 관계를 이용해 효과를 추정합니다. 워크포워드 적합에 엠바고를 적용해 미래 데이터로 보조 모형의…
이 노트북은 ETF 가격과 거시경제 시계열로 룩어헤드 편향을 점검하는 방법을 보여줍니다. 중앙 이동평균은 미래 관측치를 포함해 가격 전환점을 지나치게 잘 따라갈 수 있으며, 미래 입력값이 아직 들어오지 않아 최신 구간이 비어 있습니다. 수준값과 다음 수익률의 상관관계 검정은 명백히 미래 가격을 사용하는 특성도 찾아내지 못합니다. 노트북은 특성 자체의 수익률과 다음 가격 수익률을 비교하는 척도 정렬 검사를 제안하면서, 이 휴리스틱이 타당한 특성 구성의 대안은…
이 탐색적 분석은 4시간 단위 OANDA 패널의 20개 통화쌍을 살펴보고 데이터를 해석하는 방법을 설명합니다. 달러의 위치에 따라 직접, 간접, 교차 통화쌍을 구분하고, 달러 강세 지표를 만들기 전에 직접 호가를 역수로 바꿔야 하는 이유를 보여줍니다. 거래량 필드는 체결 규모가 아니라 거래소의 호가 업데이트 횟수를 세므로, 통화쌍 순위나 값만으로 시장 전체의 유동성이나 통화 회전율을 판단할 수 없습니다. 이 노트북은 OHLC 불변 조건을 위반 건수와 비율로…
이 노트북은 예측에 시장 국면을 활용하는 세 가지 방법을 비교합니다. 국면 입력이 없는 기준 모델, 변동성 국면의 필터링 확률을 입력받는 단일 모델, 확정된 국면 할당 안에서 각각 학습하는 별도 모델입니다. 룩어헤드를 피하기 위해 워크포워드 학습 블록마다 은닉 마르코프 모델을 다시 적합하고, 적합된 분산에 따라 상태 순서를 정한 뒤 테스트 블록을 순방향 재귀해 확률을 계산합니다. 폴드별 스케일링과 학습 데이터와 테스트 데이터 사이의 간격은 미래 관측치와…
이 노트북은 ETF 특성 평가를 수익률 기간 하나에서 특성 10개와 기간 3개의 스캔으로 확장하고 다중검정을 보정합니다. 그런 다음 장기 룩백 12-1 모멘텀과 단기 반전에 작동 원리 기반 진단을 적용합니다. 시점 이동과 IC 지속성, 국채 수익률을 사용한 공통 요인 통제, VIX 국면별 비교를 살펴봅니다. 보고된 스캔에서 장기 모멘텀은 5일 기간의 보정된 발견 항목에 포함됐지만, 더 긴 기간에서 가장 높은 정보계수는 보정 임계값을 통과하지 못했습니다.…
이 노트북은 매수자 주도 부호 거래량 비중이 이후 15분 수익률과 연관되는지 추정하고, 상대 스프레드, 최근 실현 변동성, 직전 월 수익률을 고려합니다. 이중 머신러닝은 교차 적합을 사용해 이 교란 변수들로 결과와 처치를 예측한 다음, 통제 변수로 설명되지 않는 처치 변동을 분리하도록 잔차를 회귀합니다. 분석은 1분 단위 NASDAQ-100 관측치를 사용하고, 적격 모집단, 폴드 경계, 엠바고, 플라시보 설계를 정한 뒤 적합을 수행합니다. 블록 순열 반박은…