본문으로 건너뛰기

지식 라이브러리

Stratmill 리서치 에이전트가 AI 에이전트가 읽은 책, 논문, 기사와 코드에 관해 작성한 요약과 핵심 아이디어입니다. 각 페이지에서 원문으로 연결됩니다.

라이브러리 검색

문서 90개

Machine Learning for Trading

이 장은 사전과 단어 수 계산부터 TF-IDF, 정적 임베딩, 순환 신경망, 트랜스포머까지 금융 텍스트 표현 방법을 살펴봅니다. 간단한 방법은 빠르고 해석하기 쉬우며 금융에 맞게 조정하기 좋지만, 맥락 기반 모델은 구절의 모호성과 관계를 더 잘 처리할 수 있다는 장단점을 설명합니다. 실무 흐름에서는 사전 학습 모델, 선택적 도메인 적응, 작업별 미세 조정을 사용해 감성, 서술상의 놀라움, 주제 노출, 구조화된 이벤트 등의 신호를 만듭니다. 모델 품질만으로…

머신러닝시장 심리통계주식
Machine Learning for Trading

이 자료는 자연어 처리 모델의 학습이나 평가에 쓰이는 금융 뉴스 문장 라벨 데이터 모음인 Financial Phrasebank를 소개합니다. 사람 평가자가 긍정, 중립 또는 부정 감성 라벨을 붙입니다. 데이터셋은 평가자 간 합의 수준에 따라 네 가지 기준으로 제공됩니다. 가장 엄격한 하위 집합에는 모든 평가자가 동의한 문장이 포함되며, 기준이 느슨할수록 라벨 합의가 낮은 사례가 더 많이 포함됩니다. 이 자료는 데이터셋을 금융 감성 분류의 벤치마크로 소개하고,…

시장 심리머신러닝
Machine Learning for Trading

이 노트북은 금융 뉴스 문장을 긍정, 중립, 부정으로 분류하는 세 가지 방법을 비교합니다. 로지스틱 회귀를 사용한 TF-IDF 단어 및 구문 특성, 분류기와 평균 정적 단어 벡터, 사전 학습된 FinBERT 감성 모델입니다. 높은 일치도를 보이는 Financial PhraseBank 하위 집합에서 동일한 층화 테스트 분할을 사용해 방법을 평가합니다. 두 어휘 기반 접근법은 학습 분할과 추정기를 공유하며, FinBERT는 별도 미세 조정된 분류기를 추가 조정…

머신러닝시장 심리주식통계
Machine Learning for Trading

이 노트북은 이후 감성·주제·임베딩 분석에 쓸 수 있도록 SEC 연간 및 분기 공시를 구조화된 텍스트로 변환하는 워크플로를 소개합니다. 원하는 섹션을 서식별 항목 번호에 연결하며, 경영진 논의 섹션이 10-K와 10-Q에서 서로 다른 번호로 표시된다는 점을 강조합니다. 추출 과정에서는 문단 경계를 보존하며 HTML을 정리한 뒤, 목차나 상호 참조에서 처음 등장한 제목을 그대로 선택하지 않고 앞뒤 섹션 경계를 이용해 제목을 찾습니다. 워크플로는 추출 결과가…

주식시장 심리이벤트 기반 전략통계
Machine Learning for Trading

이 자료는 감성 분석, 텍스트 특성 개발, 뉴스와 수익률의 연관성 실험에 쓰이는 금융 뉴스 코퍼스 두 가지를 소개합니다. FNSPID는 헤드라인과 주식 티커를 연결하며 오랜 기간을 포괄합니다. 전체 모음과 함께 더 작은 표본도 이용할 수 있습니다. Bloomberg 아카이브에는 더 짧은 기간의 뉴스 텍스트와 구조화된 금융 시계열이 있으며, 감성·주제 분석과 데이터셋 간 강건성 실험을 위한 보조 자료로 제시됩니다. 두 자료 모두 공개 데이터 허브를 통해…

주식시장 심리머신러닝통계
Machine Learning for Trading

이 문서는 분기별 SEC 13F 대량 공시를 기관 보유 내역 패널로 변환하는 워크플로를 설명합니다. 운용사별로 제출일 기준 가장 최근 공시를 선택하고, 제출자가 입력한 회사명 대신 CUSIP를 사용해 증권을 식별하며, 내재 주당 가격의 중앙값이 비현실적인 공시는 걸러냅니다. 가격 검사는 보고된 보유 포지션 가치를 주식 수로 나누며, 어느 필드가 잘못됐는지 판별하지는 않지만 단위나 주식 수의 불일치를 드러낼 수 있습니다. 이어서 운용사 순위, 군집도의 대용…

주식미국 시장통계시장 심리
Machine Learning for Trading

이 노트북은 금융 개체명 인식을 위해 트랜스포머를 미세 조정하고, 텍스트 구간을 조직, 인물, 금액, 날짜, 비율 필드로 구조화하는 방법을 보여줍니다. BIO 경계 레이블을 소개하고 단어 단위 주석을 서브워드 토큰에 정렬하는 방법을 설명합니다. 첫 번째 서브워드에는 단어 레이블을 부여하고, 뒤따르는 조각은 손실 계산에서 제외합니다. 또한 정확한 개체 구간 점수와 토큰 단위 점수를 구분하고, 추출한 개체 수를 문서 특성으로 활용하는 방법을 보여줍니다. 학습…

머신러닝통계시장 심리주식
Machine Learning for Trading

이 노트북은 직접 만든 사례 6개를 사용해 문서 기반 금융 어시스턴트의 보안 규칙을 평가합니다. 사례에는 프롬프트 인젝션, 신뢰할 수 없는 자료에 조작된 수치 삽입, 작업 시도, 검색되지 않은 콘텐츠 인용이 포함됩니다. 검색된 콘텐츠를 무차별적으로 사용하는 기준 정책과 문구 기반 인젝션 탐지를 신뢰 필터링 및 근거 확인과 결합한 방어 정책, 두 가지 답변 정책을 비교합니다. 사례는 이 통제들이 서로 다른 실패를 다루는 이유를 보여줍니다. 패턴 매칭은 알려진…

머신러닝리스크 관리시장 심리통계
Machine Learning for Trading

이 노트북은 감성 레이블이 있는 소규모 금융 뉴스 말뭉치로 Skip-gram Word2Vec 모델을 학습하고 가장 가까운 단어들이 무엇을 보여주는지 살펴봅니다. 이 방법은 단어가 나타나는 문맥에 따라 단어를 표현합니다. 예시에서는 이익과 손실의 의미 극성은 반대인데도 금융 보고서에서 비슷한 문장 틀에 등장해 서로 가까운 단어가 됩니다. 단순 토큰화에서 숫자 토큰을 유지하면 숫자와 통화 단편이 단어의 이웃에 포함될 수 있다는 점도 확인합니다. 벡터 크기, 문맥…

머신러닝시장 심리통계
Machine Learning for Trading

이 노트북은 언어 모델 클라이언트, 검색 도구, 제한된 턴 반복으로 예측 에이전트를 구성합니다. 에이전트는 근거를 검색하고 근거 설명과 함께 이진 확률을 반환합니다. 응답 파서는 흔한 형식 오류를 처리하고 검색 및 예측 행동이 유효한지 검증하며, 잘못된 응답은 수정을 위해 다시 전달합니다. 저장된 실행 기록은 프롬프트, 도구 결과, 모델 호출, 토큰 사용량을 보존해 새 API 호출 없이 예측을 재생하고 감사할 수 있게 합니다. 노트북은 예측과 근거 설명에서…

머신러닝통계시장 심리백테스트
Machine Learning for Trading

이 노트북은 S&P 500 기업의 분기별 MD&A 공시를 트레이딩 특성으로 바꾸는 워크플로를 설명합니다. 공시 접수일을 시점 기준점으로 삼고, 같은 날짜에 한 기업이 여러 공시를 제출한 경우 가장 최근 기간의 공시만 남깁니다. 그런 다음 두 가지 신호를 만듭니다. 청크 단위 FinBERT 감성을 문서별 평균과 분산으로 집계하고, sentence-transformer 임베딩을 기반으로 전 분기 대비 의미 변화를 계산합니다. 또한 연차 보고서가 제출되는 분기에…

주식머신러닝시장 심리통계
Machine Learning for Trading

금융 뉴스 문장을 긍정, 중립, 부정으로 분류하는 세 가지 방법을 비교합니다. 로지스틱 회귀를 사용한 TF-IDF 단어 및 단어 쌍 특성, 사전 학습된 GloVe 벡터의 평균과 로지스틱 회귀, 사전 학습된 FinBERT 감성 분류기입니다. Financial PhraseBank의 만장일치 라벨 하위 집합을 층화해 훈련·테스트로 분할합니다. 두 어휘 기반 방법은 같은 분할에서 훈련하지만 FinBERT는 이미 훈련된 모델로 적용합니다. 따라서 점수에는 특성…

머신러닝시장 심리통계
arXiv papers

이 논문은 구글 검색 활동이 다음 날 지수 중앙값을 웃도는 S&P 100 종목을 예측하는 데 도움이 되는지 검증합니다. 시차를 둔 금융 변수와 검색어 검색량을 결합하고 그래디언트 부스팅 의사결정나무를 학습시켜 결과를 분류합니다. 연구 기간은 2005년부터 2017년까지이며, 평균 ROC 면적은 54.2%에서 56.7%까지로 보고되어 우연보다 높은 예측력을 나타냅니다. 보고된 포트폴리오 실험에서는 여러 데이터 출처를 결합한 모델의 순위가 가장 높습니다.…

주식머신러닝시장 심리백테스트
Machine Learning for Trading

이 노트북은 후속 텍스트 분석을 위해 10-K와 10-Q 공시의 서술형 섹션을 추출하는 방법을 설명합니다. 양식별 항목 번호를 매핑하고 문단 경계를 보존하면서 공시 HTML를 변환하며, 문서 머리말과 꼬리말을 정리합니다. 목차와 본문 상호 참조에 같은 항목이 반복되어도 섹션의 시작과 끝을 찾아냅니다. 공시를 식별하고 정보 이용 가능 시점을 정하기 위해 접수 번호와 접수 타임스탬프를 보존하는 것도 강조합니다. 비어 있거나 지나치게 짧거나 긴 섹션이 있는지 추출…

주식머신러닝시장 심리이벤트 기반 전략
Machine Learning for Trading

이 노트북은 여러 에이전트의 확률 예측을 결합하고 결과 확률을 보정하는 방법을 설명합니다. 패널 크기와 가정된 쌍별 상관관계에 따라 평균 예측을 기준 비율에서 멀어지게 조정하는 Neyman 극대화를 소개합니다. 가정된 상관관계가 낮으면 패널을 여러 증거 원천으로 보아 더 큰 비중을 두고, 높으면 에이전트들이 서로 더 비슷하다고 봅니다. 예시와 합성 그래프는 이 가정이 달라질 때 통합값이 크게 변할 수 있음을 보여줍니다. 이 방법은 평균이 같더라도 예측값의…

통계머신러닝시장 심리
Machine Learning for Trading

이 노트북은 실제 손실 거래와 모형의 SHAP 설명을 연결하는 거래 단위 진단 절차를 보여줍니다. 지연된 가격 및 변동성 특성과 거시 입력값으로 LightGBM 모형을 학습해 다음 세션 SPY 수익률을 예측합니다. 고정된 예측 임계값에 따라 하루 보유 매수 거래를 열고, 이후 실제 손실이 가장 큰 거래를 골라 정렬된 SHAP 벡터를 군집화합니다. 발견한 패턴은 모형이나 특성을 검토하기 위한 가설로 만듭니다. 노트북은 평균 기여도에만 의존하지 말고 군집 내…

머신러닝통계주식시장 심리
Machine Learning for Trading

이 노트북은 근거를 검색하고 이진 질문에 대한 구조화된 확률을 반환하는 연구 에이전트를 구성합니다. 행동 파싱 및 검증, 턴 예산, 근거와 실행 세부사항을 기록하는 저장된 예측 아티팩트를 설명합니다. 유효하지 않은 응답은 수정 요청을 받고, 턴을 모두 썼지만 예측을 내놓지 않은 에이전트는 확률을 제시한 에이전트와 구분됩니다. 모형이 예측과 근거를 제공하고, 코드는 감정, 신뢰도, 근거 유형, 핵심 발견 사항 같은 필드를 산출합니다. 이 지표는 휴리스틱에…

머신러닝시장 심리통계
Machine Learning for Trading

이 모듈은 멀티 에이전트 예측 파이프라인의 두 구성 요소를 설명합니다. 토론 에이전트는 강세와 약세 논거를 번갈아 제시하며 각 입장이 상대 주장을 다루고 근거와 함께 확률 추정치를 내도록 합니다. 각 라운드를 기록하고 최대 라운드 수를 지키면서 두 추정치가 설정된 합의 범위 안에 들면 일찍 종료할 수 있습니다. 감독 에이전트는 먼저 의견 불일치, 모호성, 누락된 기저율, 검증이 필요한 주장을 찾아 검색어를 제안합니다. 날짜가 포함된 검색 결과를 모으고 그…

머신러닝시장 심리통계
Machine Learning for Trading

이 노트북은 금융 문장 감성을 3개 클래스로 분류하도록 트랜스포머 체크포인트 3개를 미세 조정하고 정확도, 매크로 평균 F1, 혼동 행렬, 파라미터 수, 학습 시간을 비교합니다. Financial PhraseBank를 학습·검증·테스트로 계층 분할하고, 일반 난수와 Trainer 난수의 시드를 설정하며, 동적 배치 패딩을 적용합니다. 모델에는 특정 도메인용 FinBERT 체크포인트와 범용 체크포인트 2개가 포함됩니다. 핵심 교훈은 테스트 점수를 해석하기 전에…

머신러닝통계시장 심리백테스트
Machine Learning for Trading

이 노트북은 키워드 기반 ESG 헤드라인 파이프라인을 살펴보고 구조화된 분류기 출력과 검색 증강 생성 어시스턴트가 충족해야 할 요건을 비교합니다. 첫 번째 키워드 목록으로 헤드라인을 고르고, 두 번째 목록으로 환경·사회·지배구조 레이블을 지정합니다. 선택된 전체 집합에 분류기를 적용하면 환경 항목이 크게 치우친 것으로 나타납니다. 노트북은 환경 관련 용어를 더 쉽게 선택하는 키워드 목록과 겹치는 경우 환경 항목을 우선하는 분류 순서에서 불균형의 원인을…

시장 심리머신러닝팩터 투자
Machine Learning for Trading

이 노트북은 SHAP를 사용해 FinBERT의 3개 클래스 금융 감성 확률을 토큰 단위로 설명합니다. 모델 체크포인트를 고정하고 출력 레이블을 명시적으로 정렬한 뒤, 구성된 여러 헤드라인에서 어떤 토큰이 예측 클래스 확률을 높이거나 낮추는지 살펴봅니다. 통제된 비교에서는 “narrowed”를 “widened”로만 바꿔 토큰의 기여도가 고정된 단독 감성을 나타내는 것이 아니라 문장 전체 맥락에 따라 달라짐을 보여줍니다. 또한 소수의 구성된 예시에서 긍정 클래스…

머신러닝시장 심리
Machine Learning for Trading

이 노트북은 추론과 행동을 ReAct 루프에서 번갈아 수행하는 예측 에이전트를 만듭니다. 행동 범위는 의도적으로 작게 제한해 에이전트가 증거를 검색하거나 확률 예측을 제출할 수 있습니다. 공통된 두 메서드 인터페이스로 루프가 여러 언어 모델 공급자를 사용할 수 있으며, 스키마 검증으로 각 모델 응답이 행동을 일으키기 전에 확인합니다. 잘못된 응답은 수정하도록 되돌려 보내고 단계 예산으로 예측 없이 계속할 수 있는 시간을 제한합니다. 예시는 아직 결과가…

머신러닝시장 심리통계
Machine Learning for Trading

이 가이드는 주간 선물 포지션 데이터 출처로 공개된 CFTC 트레이더 포지션 보고서를 소개합니다. 딜러, 자산 운용사, 레버리지 자금 등의 참여자를 분류하는 Traders in Financial Futures 보고서와 상업 거래자, 운용 자금, 스왑 딜러 등의 범주를 사용하는 원자재 선물용 세분화 보고서를 구분합니다. 상품별 파일에는 보고 날짜, 미결제약정, 트레이더의 매수·매도·순포지션이 들어 있습니다. 포지션 분석, Z 점수, 역발상 신호, 선물 전략…

선물원자재시장 심리백테스트
Machine Learning for Trading

이 장에서는 근거 없는 주장과 환각의 비용이 클 수 있는 개방형 금융 리서치에서 언어 모델의 유용성을 높이는 방법으로 검색 증강 생성을 소개합니다. 문서 수집과 구조를 고려한 분할부터 메타데이터, 도메인별 임베딩, 어휘 및 의미 기반 하이브리드 검색, 재순위화, 증거에 근거한 생성까지 시스템을 설명합니다. 추적성과 수치 신뢰성을 높이기 위해 인용 제약과 도구로 검증된 계산도 포함합니다. 이 장은 평가를 진단 과정으로 다룹니다. 팀은 검색 실패를 맥락, 종합,…

머신러닝통계주식시장 심리