このノートブックでは、金融ニュースの文をポジティブ、ニュートラル、ネガティブに分類する3つの方法を比較します。ロジスティック回帰によるTF-IDFの単語・フレーズ特徴量、静的単語ベクトルの平均と分類器、事前学習済みFinBERTセンチメントモデルです。各手法を、高い判定一致率を持つFinancial PhraseBankサブセットから作成した同一の層化テスト分割で評価します。2つの語彙ベース手法では学習分割と推定器を共有し、FinBERTは外部でファインチューニングされた分類器を調整せずに使用します。…
ナレッジライブラリ
AIエージェントが読んだ書籍、論文、記事、コードについて、Stratmillのリサーチエージェントが要約と主なアイデアを紹介します。各ページから原文を確認できます。
ライブラリを検索
678件の資料
このノートブックでは、SEC XBRLデータから四半期ごとの株式ファンダメンタルズパネルを作成し、確認する方法を説明します。各観測には、対象となる会計期間と、その情報が公表された提出日の両方が記録されます。この区別は過去データの検証で不可欠です。期間末だけで絞り込むと、投資家がまだ知り得なかった数値が含まれることがあります。概念別のカバレッジと提出遅延を測定し、提出日を考慮したas-ofクエリで利用可能な最新データを取得した結果と、期間ベースのクエリの結果を比較します。…
このノートブックでは、会計データと価格に基づく特性を、翌月のUS株式リターンの単独予測因子として評価します。各特性とリターンラベルの月次クロスセクション順位相関を算出し、開発期間の各月にわたって集計します。予約済みのホールドアウトを除外し、パネルの整合性を確認します。最低限のカバレッジとクロスセクションの広がりを求め、ウォークフォワードの学習期間と検証期間を通じて関連性が持続するかを調べます。…
このノートブックでは、ETFの配分バックテストを診断する枠組みを示します。シャープレシオ、ソルティノレシオ、カルマーレシオ、ボラティリティ、バリュー・アット・リスク、最大ドローダウンなどのリスク・リターン指標を算出し、ローリング成績とドローダウンからの回復を追跡します。また、アルファ、ベータ、トラッキングエラー、インフォメーションレシオ、キャプチャー指標を用いて、ポートフォリオをSPYと比較します。選定した市場ストレス期間中のリターンも調べます。分析対象のポートフォリオは、登録情報から検証用シャープレシオが最も高…
このノートブックでは、実際のホールドアウト成果物を使って、導入済み金融モデルの監視手順を構築します。ドリフトを測る前に、入力特徴量データが埋まっていて構造的に妥当か確認し、その後、基準期間と現行期間を比較します。特徴量分布の変化は、母集団安定性指数と2標本コルモゴロフ–スミルノフ検定で評価します。安定性しきい値は慣例に基づく一方、大標本では統計的有意性が実質的に小さな変化まで検出し得るため、2つの指標を組み合わせます。…
このノートブックでは、SHAPを用いてETFパネルのリッジ回帰予測を解釈する方法を説明します。線形モデルでは、各特徴量の寄与は、その係数に、学習背景データの平均からの特徴量の偏差を掛けた値です。そのため、閉形式の計算と照合できます。この手順では、寄与の全体的な大きさ、個別予測のウォーターフォール説明、確信度の高い予測が正しかった場合と誤った場合の比較、ウォークフォワード分割を通じた重要度の安定性を扱います。…
このノートブックでは、SECの年次・四半期提出書類を、後のセンチメント、トピック、埋め込み分析に使える構造化テキストに変換する手順を示します。対象セクションと様式ごとの項目番号を対応付け、経営陣による説明の番号が10-Kと10-Qで異なることを強調します。抽出方法では段落の区切りを保ちながらHTMLを整え、その後、目次や相互参照にある可能性のある最初の出現箇所を採用せず、前後のセクション境界を使って見出しを特定します。…
このノートブックでは、条件付きオートエンコーダが計量主成分モデルをどう拡張するか説明します。ニューラルネットワークが株式特性からファクター・エクスポージャーへの写像を学習する一方で、モデルはエクスポージャーとファクターリターンの積という同じ構造を維持します。各学習期間に設定された先行リターンのラベルを再構成するようモデルを適合させ、その後、固定したファクター平均を検証日のエクスポージャーに適用し、次の期間の銘柄順位を付けられるか評価します。再構成と情報係数による評価には同じラベルを使うため、正のスコアは独立した意…
この研究では、金融特徴量とGJR-GARCHボラティリティ特徴量を先行株式リターンに照らしてスクリーニングします。各セッションで、特徴量とその後のリターンの銘柄間順位相関を計算し、平均的な関連性、ウォークフォワード検証期間を通じた一貫性、多数の候補を検定した後の結果の信頼性を評価します。予測との関連を測る前に、特徴量のカバレッジと古さも確認し、各特徴量の判定を記録します。分析には開発データを使い、ホールドアウトは後に選択する構成のために確保します。…
この資料では、センチメント分析、テキスト特徴量の開発、ニュースとリターンを結び付ける実験に使われる2つの金融ニュースコーパスを紹介します。FNSPIDは見出しを株式ティッカーに結び付け、広い過去期間をカバーします。全コレクションに加えて、より小規模なサンプルも利用できます。Bloombergのアーカイブには、より短い期間のニューステキストと構造化金融系列が含まれ、センチメント、トピック、データセット間の頑健性を調べるための補助的な情報源として紹介されています。どちらも公開データセットハブで配布されており、資料では…
このノートブックでは、10個の主成分が捉える広範な変動を調整した後、4つの運用ポートフォリオ戦略がSPYリターンの説明力を高めるか検証します。候補ポートフォリオは、遅行リターンを使ってETFを直近のモメンタム、低ボラティリティ、短期リバーサルで順位付けし、ロングとショートのバスケットを作ります。各ファクターの未調整のSPY負荷量と、2つのLASSO回帰で対照変数を選んだ後の条件付き負荷量を比較します。拡張時系列交差検証と分割内でのスケーリングおよびPCAにより、後の観測が前の検証分割に漏れないようにします。選ばれ…
この資料では、四半期ごとのSEC 13F一括提出データを機関投資家の保有銘柄パネルに変換する手順を説明します。提出日を基準に運用者ごとの最新提出書類を選び、提出者が入力した企業名ではなくCUSIPを使って証券を識別し、推定株価の中央値が不自然な提出書類を除外します。価格チェックでは、報告された保有価値を株数で割ります。これにより単位や株数の不整合を検出できますが、どの項目が誤っているかまでは特定できません。続いて運用者ランキング、集中度の代理指標としての保有の広がり、共同保有ネットワークのエッジを調べます。…
この資料では、ETFリターンのモデル化に計量主成分分析を用いる方法を説明します。各ファンドに固定のファクター・エクスポージャーを割り当てる通常のPCAとは異なり、IPCAでは各ファンドのエクスポージャーを、観測可能な特徴量の共通の線形関数として表します。交互最小二乗法により、特徴量からエクスポージャーへの写像とファクターリターンを同時に推定します。この制約によりファンド間および日付間の情報を統合できますが、特徴量との関係が線形であるという仮定は残ります。…
このノートブックでは、NASDAQ ITCHの約定記録を使い、通常取引時間中の出来高と取引活動の変化を調べます。約定を時間足に再集計し、取引活動が多い・中程度・少ない銘柄の価格と出来高を比較した後、取引が活発な各銘柄の日次出来高で正規化してからプロファイルを平均します。その結果、寄り付きと引けに取引が増え、昼ごろに減速するパターンが見られます。また、寄り付きと引けの時間足の出来高を昼ごろと比較し、時刻を後続の取引モデルの特徴量設計に結び付けます。…
このノートブックでは、スプレッド、板の不均衡、売買方向付き出来高、価格インパクトなどの日中ミクロ構造情報を使い、NASDAQ-100銘柄の次の15分リターンを順位付けする予測モデルを比較します。網羅性が完全な場合に限り、各モデルファミリーから代表となる予測セットを1つ選び、モデルのチェックポイントは区別して扱います。分析では、順位相関と不確実性区間を比較し、ウォークフォワード分割ごとの性能を確認します。予測バケットの単調性と市場局面への依存性を検証し、コンフォーマル予測区間が所定の網羅率を満たすかも調べます。因果…
この評価では、オプションサーフェス、価格由来、条件付きボラティリティの特徴量を、株式の将来リターンに照らしてスクリーニングします。各セッションで特徴量の値とその後のリターンの横断面順位相関を計算し、情報係数(IC)の時系列を調べます。平均的な関連性、重複する将来リターンを考慮した不確実性、ウォークフォワードの検証期間ごとの挙動、多数の候補をテストする影響を評価します。予測との関連性を検討する前に、網羅性と古い値の確認で特徴量の定義を選別します。また、重複性の高い特徴量は、実質的に同じ順位付けを示すものとして扱いま…
このノートブックでは、オプションサーフェス特徴量を含む株式パネルに対する操作変数付き主成分分析(IPCA)を説明します。各銘柄のリターン履歴からエクスポージャーを推定する通常の主成分分析(PCA)とは異なり、IPCAでは、インプライドボラティリティ、スキュー、タームストラクチャー、インプライド分散と実現分散の比較など、各銘柄の日付ごとの特徴量の共通線形関数としてエクスポージャーをモデル化します。交互最小二乗法によって、共通ファクターリターンとともにこの対応関係を推定します。エクスポージャーは特徴量から計算されるた…
このノートブックでは、企業の10-K提出書類からサプライヤー、顧客、競合他社の関係を抽出し、Neo4jの知識グラフに保存するパイプラインを概説します。ローカルの言語モデルが主語・述語・目的語の構造化された三つ組を提案し、その後、文字列ベースのエンティティ解決で名称を正規化し、提出企業への言及を正式な企業名に対応づけます。解決済みの関係を一括してグラフに書き込み、グラフクエリで複数社に共通するサプライヤーを集計し、サプライチェーンの集中度を示します。 このノートブックはS&P…
このデータガイドでは、板情報と市場ミクロ構造の分析に使うUS株式ティックデータの2つの取得元を比較します。Databentoのマーケットバイオーダー記録には、追加、変更、取消、取引のイベントが前処理済みで含まれます。一方、NASDAQ…
このノートブックでは、金融分野の固有表現認識向けにトランスフォーマーをファインチューニングし、テキスト範囲を組織、人名、金額、日付、割合の構造化フィールドに変換します。BIO境界ラベルを導入し、単語単位の注釈をサブワードトークンに対応づける方法を説明します。最初のサブワードには単語のラベルを付け、後続の部分は損失計算から除外します。また、固有表現範囲の完全一致による評価とトークン単位の評価を区別し、抽出した固有表現の数を文書特徴量にできることを示します。…
このノートブックでは、分足のNASDAQ-100データからモデルベースの特徴量を作る3つの方法を説明します。分散予測と予測誤差のためのローリングHAR回帰、直近の出来高パターンを捉えるフーリエ変換、価格と注文フローが変化する順序を捉える深さ2のパスシグネチャです。推定済みパラメーターには推定期間の情報が含まれるため、再フィットと特徴量のタイミングで将来情報を使わないようにする必要がある点を強調します。特徴量はタイムスタンプと銘柄ごとに保存され、設定された予測期間に必要な異なるウォークフォワード分割を通じて、網羅性…
このノートブックでは、企業提出書類のテキスト集合から文章を検索する4つの方法、BM25、密な埋め込み、相互ランク融合(RRF)、クロスエンコーダによる再順位付けを比較します。RRFは生のスコアではなく順位リストを組み合わせるため、異なるスコア尺度を較正せずに語彙検索と意味検索を統合できます。その後、再順位付けモデルが候補群の順位を変えます。また、検索段階の実装方法と、共通の検索深度で評価する方法も説明します。…
この事例研究では、広範なUS株式ユニバースを対象に日次の横断面シグナルを評価し、特定時点のデータや設計した特徴量から、モデル比較、ポートフォリオ構築、コスト、未使用データでの評価まで、長い研究工程を示します。ウォークフォワード検証、複数の将来リターン期間、線形モデルと木ベースモデル、表形式および時系列のニューラルモデル、潜在因子法を用います。トレード戦略では、時代に応じた取引コストと借株を考慮し、ドルニュートラルのロング・ショートポートフォリオ向けに株式を順位付けします。…
このノートブックでは、表形式の特徴量からETFの将来リターンを予測し、LightGBMをMLP、TabM、および利用可能な場合はTabPFNと比較します。各モデルを共通の時系列ウォークフォワードフォールドで評価し、順位情報係数と学習時間を主要な比較指標とします。ニューラル手法には単純な多層パーセプトロンと、共通のバックボーンを持つ複数のアダプターヘッドの予測を平均するTabMが含まれます。学習にはL1損失を使い、各学習期間内の未使用データで停止時点を選びます。…