このノートブックでは、操作変数付き主成分分析をクロスセクション・リターンのモデルとして紹介します。各企業の特性にリターンへの直接的な重みを割り当てる代わりに、IPCAは特性から因子エクスポージャーへの共通の線形写像と、月次因子リターンを推定します。この写像とリターンを交互最小二乗法とリッジペナルティで同時に適合させ、学習期間の推定値を検証期間の特性に適用してリターンを予測します。…
ナレッジライブラリ
AIエージェントが読んだ書籍、論文、記事、コードについて、Stratmillのリサーチエージェントが要約と主なアイデアを紹介します。各ページから原文を確認できます。
ライブラリを検索
654件の資料
このノートブックでは、8つの上場投資信託にわたって過去リターンのウィンドウから翌日の日次リターンを予測する、4種類のニューラルネットワーク設計を比較します。全結合ネットワーク、1次元畳み込み、LSTM、GRUが入力をどのように処理するかを説明し、検証誤差と学習ステップにかかる時間を比較します。入力ウィンドウを長くする探索から、再帰モデルでは逐次計算が増える一方、全結合モデルでは最初の層が広くなることを示します。…
このノートブックでは、オプションサーフェスと株価の履歴ウィンドウを使い、S&P 500構成銘柄を順位付けする系列モデルを評価します。再帰的な記憶を持たない正規化線形モデルと、ゲートを通して時間情報を保持するLSTMを比較します。線形モデルは有意義なベースラインです。LSTMがこれを上回らなければ、このデータで追加の記憶機能の価値は示されていません。モデルはウォークフォワード分割を使って将来の株式リターンまたはリスク調整後リターンを予測します。…
このノートブックでは、NASDAQ-100のマイクロストラクチャ特徴量を使い、数分単位の複数の期間で将来リターンを予測する長短期記憶ネットワークを学習させます。平坦化した線形モデルと異なり、LSTMは各観測値を順に処理し、過去の情報をどれだけ保持するかを学習します。モデルは1分データの過去ウィンドウを使い、銘柄やフォールドが変わると隠れ状態をリセットします。各ウィンドウは同一銘柄内に収まり、予測時点で利用可能な情報だけを使う必要があります。…
この章では、各判断時点で利用可能な情報を守りながら、金融機械学習モデルを評価する方法を説明します。学習、検証、最終ホールドアウトを区別し、データをランダムにシャッフルするk分割交差検証では、過去を予測するときに未来の観測値で学習してしまう理由を解説します。拡大型とローリング型のウォークフォワード分割は時系列順を保ち、拡大型は履歴を保持し、ローリング型は古いデータを除きます。…
このノートブックでは、入力ウィンドウ全体を処理して将来の推移を予測する全結合型のニューラル予測アーキテクチャ、N-BEATSを構築します。解釈可能な型では、ブロックが多項式トレンド基底とフーリエ季節性基底によって構成要素を表すよう制約します。残差バックキャストによって、積み重ねたブロックが入力の一部を順に捉えます。制約ありと制約なしのモデルをSPY終値に適合させ、名前の付いた構成要素を描画し、直近価格を繰り返す持続予測と予測誤差を比較します。…
このノートブックでは、ETFリターンを2つの期間で予測するLightGBMモデルとRidgeのベースラインを比較します。木モデルは、モメンタムが市場ストレス下で異なる動きをするようなレジーム依存の相互作用を発見できます。一方、特徴量間の相関が非常に高いと、貪欲な分割は不安定になることがあります。実験では木の複雑さと損失関数を変え、各学習実行の複数のチェックポイントで予測を評価します。報告された学習曲線では、情報係数が設定した学習期間の終了前にピークを迎えることが多く、候補間のばらつきのかなりの部分をチェックポイン…
このノートブックでは、13F提出書類の機関投資家保有データを使い、構造化されたグラフ型検索と埋め込みベースのベクトル検索を比較します。固定した基準日時点の保有状況スナップショットを作成し、対象株式を絞り、株式の保有者、機関投資家の保有銘柄、共通のポジションを持つ機関投資家について質問を作成します。各質問について期待される根拠レコードを定義し、根拠再現率を測定して検索トークンの予算を見積もります。…
このノートブックでは、損失トレードと、その判断に関連するモデルの説明を結び付ける手順を示します。価格データとマクロ経済データから単一資産のSPY特徴量パネルを作成し、過去の観測値でLightGBMモデルを学習させ、後の観測値を使ってトレード記録とSHAPの説明を作成します。トレード分析器は、最も損失の大きいトレードの説明をクラスタリングし、特徴量、レジーム、データの問題を調査する手掛かりとなるパターンを探します。…
このノートブックでは、上場オプションのシグナルを読み取り、原株を取引する戦略向けに先行リターンのラベルを作成します。日次の株価を株式分割と配当で調整し、継続的な証券識別子を使用します。想定するエントリーと決済で執行可能な価格の間のリターンを定義します。各先行期間が完全で、単一証券内に収まり、単に利用可能な行をずらすのではなく市場の取引セッション数を数えているか確認します。ラベルには、異なる保有期間に対するリターン、リスク調整済み、方向性の各バリエーションが含まれます。…
このノートブックでは、異なる市場期間におけるETFのモメンタム特徴量と暗号資産無期限先物の特徴量を対象に、共変量ドリフトを監視する方法を示します。個々の特徴量分布の変化を測る母集団安定性指数(PSI)と、参照標本と現在の標本を組み合わせて区別できるかを検証するワッサースタイン距離およびドメイン分類器を比較します。本番監視の例では、スコアをアラート水準に対応させ、アラートをまとめて再学習の推奨につなげます。…
このノートブックでは、計量主成分分析を使い、各銘柄に固定の負荷量を割り当てるのではなく、観測可能な株式特性に応じて潜在因子の負荷量を変える方法を説明します。特性から因子エクスポージャーへの共通の写像により、訓練パネルに含まれない銘柄の負荷量を算出でき、銘柄の特性が変われば負荷量も調整できます。通常のPCAと並べて手法を示し、因子数、パネル、ウォークフォワードの分割を一定にして比較する想定です。…
この文書では、少数の観測されない共通因子が横断面の変動の大部分を説明すると仮定する、企業リターンモデルの一群を紹介します。企業特性からリターンを直接予測するのではなく、企業特性から各社の因子エクスポージャーを推定し、そのエクスポージャーと推定した因子リターンを組み合わせます。この制約により統計的に扱いやすくなる一方、横断面を少数の因子で十分に説明できない場合は残差リターンが支配的になり、直接予測するモデルの方が優れる可能性があります。…
この文書では、ウェーブレット分解とローリング・スペクトル推定が、金融リターンを異なる時間スケールでどう表現するかを説明します。ウェーブレットはリターンを徐々に長い期間にわたる成分へ分け、どの時間スケールが変動の大部分を占めるかを把握できるようにします。例では日次のSPYリターンを用いて複数のウェーブレット族を比較します。最も短期の成分が分散の大半を占める一方、長期成分は各族でおおむね似ていることが分かります。…
このノートブックでは、ボラティリティ、モメンタム、横断面でのキャリー順位を調整したうえで、先物のキャリーがその後のリターンに影響するかを二重機械学習で推定します。因果関係の説明と予測性能を区別します。バックテストで利益が出ればキャリーがリターンを予測することは示せますが、キャリー自体がリターンを生む原因だとは立証できません。柔軟な補助モデルで交絡因子から処置と結果を予測し、クロスフィッティングで標本内バイアスを抑えます。ボラティリティのクラスター化と重複するリターンラベルによって残差が依存するため、不均一分散・自…
この文書では、資金を配分する前に、現行モデルと候補モデルをシャドー評価で比較する方法を説明します。両者の役割と昇格基準を事前に定めたうえで、年率換算シャープレシオの改善幅、最低観測期間、シグナル相関、ポジションの重複度、最大ドローダウンの相対値という5つの観点から候補を評価します。両モデルは、順位付けしたロング・ショートポートフォリオでスコアを算出し、それぞれの売買回転率に応じて取引コストを課します。最低改善幅を求めることで短期間のノイズの多いシャープレシオ推定に対処し、類似性の確認によって、異なる戦略やエクスポ…
このノートブックでは、Parquetソース、エンティティ、特徴量ビュー、タイムスタンプ、有効期間ポリシーを使ってFeastを設定し、学習用の例と実運用に近い時点指定クエリの特徴量を取得する方法を示します。Feastの出力と手書きのポイントインタイム結合を特徴量ごとに比較します。許容誤差を小さく設定することで、通常の丸め誤差ではなく、誤った行の選択が不一致の原因となる場合を検出できます。…
このノートブックでは、株式ファクターモデリングに使う教師ありオートエンコーダを紹介します。横断面を再構成してボトルネック表現を学ぶ教師なしオートエンコーダとは異なり、このモデルは学習目的関数に将来リターンも含めます。そのため、目的変数は予測だけでなく学習された表現も形作ります。それぞれのラベルが損失に直接含まれるため、将来リターンのラベルが異なれば、学習済みモデルも異なります。…
このノートブックでは、CME先物にニューラル確率的割引ファクターモデルを適用します。資産価格理論における確率的割引ファクターとは、各資産のリターンとの積が無裁定のもとで同じ期待値を持つ確率変数です。このモデルでは、キャリー、モメンタム、ボラティリティなどの商品リターンと観測可能な特性の両方を使って、この潜在変数を推定します。リターンのみを使うと説明されているPCAとの比較とは異なり、SDFでは特性を横断面の操作変数のウェイトに反映できます。…
この文書では、既知の合成データ生成ファミリー内での教師あり推論として、ADIA Labの因果発見チャレンジを検討します。この課題では、多数のラベル付きデータセットとグラフのペアを使い、処置と結果を中心とする8つの役割に変数を割り当てます。教師ありモデルがそこで古典的な発見手法を上回る場合がある理由として、シミュレーターが生成した例から安定した統計パターンを学習できることを説明します。また、一部の手法ではPCやNOTEARSなどの手法の出力をモデル特徴量として使います。…
この研究では、日中のビットコインリターン関数を予測するために、関数主成分分析(FPCA)を適用しています。関数観測と離散時間ダイナミクスを結び付けるものとしてKarhunen–Loève動的因子モデルを導入し、連続稼働市場向けに設計されたローリングFPCA手順を提案しています。予測には、時間単位および15分間隔でサンプリングしたリターンを使用しています。また、条件付き異分散性も検討し、分散の変化を考慮すると将来のリターン関数の区間予測が改善するとしています。…
この章では、辞書や単語数から、TF-IDF、静的埋め込み、再帰型ネットワーク、Transformerに至るまで、金融テキストの表現方法を概観します。各手法のトレードオフも説明します。単純な手法は高速で解釈しやすく、金融分野に適応させやすい一方、文脈を扱うモデルは文章内の曖昧さや関係をより適切に捉えられます。実務的なワークフローでは、事前学習済みモデル、必要に応じたドメイン適応、タスク別のファインチューニングを用い、センチメント、ナラティブ・サプライズ、トピックへのエクスポージャー、構造化イベントなどのシグナルを作…
このノートブックでは、検索網羅性、回答の忠実性、適切な回答保留、安全性を個別に測る、金融分野の検索拡張生成(RAG)評価用ハーネスを構築します。実在企業の提出書類から一部のコンテキストを取り入れた6つの手作りのテストケースを使い、回答可能な質問、根拠の欠落、プロンプトインジェクション、裏付けのない引用を検証します。異なる問題を1つの正解率にまとめず、どの構成要素に問題があったか診断することを目指します。…
このケーススタディでは、US企業の特性から構築した月次ロング・ショートのデシル戦略を評価し、時点情報に基づく会計データのラグ、ウォークフォワード検証、時期に応じた取引コストを考慮して、線形モデル、勾配ブースティング、潜在ファクターの手法を比較します。報告された検証系列のうち最も強いものは、ウィンザー化した将来リターンに勾配ブースティングモデルを適用したものです。教師ありオートエンコーダも、単独で有力なシグナルになりうると説明されています。検証では複数のフォールドでプラスの成績が報告されましたが、レジストリの結果で…