このノートブックでは、クロスセクション情報係数(IC)と予測の売買回転の両方を考慮しながら、OptunaでLightGBMリターンモデルを調整します。比較用の単一目的探索ではICを最大化し、多目的のNSGA-II探索ではパレート最適な設定を特定します。これにより、シグナルの順位品質と取引コストの代理指標である売買回転とのトレードオフを可視化できます。このフロンティアを使えば、検証スコア1つだけを目的とせず、コスト許容度に応じてモデルを選べます。…
ナレッジライブラリ
AIエージェントが読んだ書籍、論文、記事、コードについて、Stratmillのリサーチエージェントが要約と主なアイデアを紹介します。各ページから原文を確認できます。
ライブラリを検索
654件の資料
この分析では、符号付きのモデルリターン予測を二値ポジションに変換する3つの方法、固定ゼロしきい値、銘柄ごとの後方パーセンタイル、銘柄間のクロスセクション・パーセンタイルを比較します。ETFと暗号資産の無期限先物について登録済みの検証予測に適用し、ルックバック期間とパーセンタイルしきい値を変化させます。リターンや取引コストを考慮する前に、各ルールが有効になる頻度と、銘柄の状態が変化する頻度を測定します。…
このノートブックでは、21日先のETFリターンを上昇・下落の目的変数に変換し、時系列順のウォークフォワード分割でL1正則化およびL2正則化ロジスティック回帰を評価します。各分割の訓練データを使って特徴量をスケーリングし、正解率、適合率、再現率、F1、ROC AUC、対数損失で予測を評価します。また、係数に基づく特徴量重要度、確率の較正、リターン群を下位・中位・上位に分ける3クラス拡張も検討します。…
このノートブックでは、Feastを金融データとモデル由来データの特徴量ストアとして設定し、過去時点および指定時点での取得結果を、透明性のある手作業の結合方法と比較します。エンティティ、タイムスタンプ付きデータソース、特徴量ビュー、有効期間を宣言し、日付範囲に余裕を持たせた一時的なParquetコピーを準備します。この比較検証は、誤ったタイムスタンプやエンティティキー、学習済みフォールドのビンテージを選ぶといった設定ミスの検出を目的とします。…
このノートブックでは、特徴量、目的変数、ウォークフォワードのフォールドを固定し、月次のUS株式リターンを対象に勾配ブースティングの目的関数を比較します。二乗誤差を絶対誤差および、大きな残差の影響を抑えるHuber損失と比較します。情報係数がクロスセクションの順位を評価する一方で、個別の極端なリターンが二乗誤差の学習を支配しうることが、比較の動機です。グリッドでは木の複雑さも変え、複数のブースティング・チェックポイントで予測を記録します。これにより学習曲線から、成績が改善中か頭打ちかを確認できます。…
このモジュールは、主成分分析、操作変数を用いた主成分分析、ニューラルオートエンコーダなど複数の潜在ファクターモデルについて、ウォークフォワードの学習と評価を調整します。パネルデータとフォールドを準備し、モデル別の実行処理を呼び出して、予測、フォールド単位のメタデータ、登録済み学習実行を管理します。明示的な優先順位に従ってモデルのプリセットと呼び出し側の設定を統合するため、選択される実行時の設定は呼び出し側が制御できます。…
この実装では、資産価格評価のための条件付きオートエンコーダを説明します。ベータネットワークは各株式の特性を潜在ファクターの負荷量に変換し、線形ファクターネットワークは運用ポートフォリオのリターンをファクターリターンに変換します。モデルは対応する負荷量とファクター値を合計して株式リターンを予測するため、企業特性に応じてエクスポージャーが変化し、ファクターはポートフォリオの運用商品から導出されます。…
この資料では、自然言語処理モデルの学習や評価に使われる、金融ニュース文にラベルを付けたコレクションであるFinancial…
この分析では、CME先物モデルのクロスセクション情報係数(IC)の読み方と、その後のポートフォリオ検証との関係を説明します。各日の予測リターンと実現リターンの順位相関を計算し、日ごとの相関を平均します。これは、商品を順位で選び、予測リターンの大きさを考慮しない等ウェイト戦略に対応します。また、フォールド間の平均とt統計量を日次系列に基づく推論と区別し、報告されたt統計量がフォールド間の標準誤差を用いていること、予測値がほぼ一定になる場合にはICが定義される日数も重要であることを指摘します。…
このノートブックでは、企業の10-K提出書類から抽出した文章を使い、BM25キーワード検索、密な埋め込み表現、相互ランク融合(RRF)、クロスエンコーダーによる再順位付けを比較します。各検索手法を構築し、完全一致、概念検索、複合的な検索クエリで順位付け結果を評価します。RRFは生の関連度スコアではなく順位を組み合わせるため、スコアの尺度を調整せずに、異なる尺度を使うシステムを統合できます。次に再順位付けモデルが検索候補を並べ替え、最終結果を絞り込みます。…
このノートブックでは、US株式のパネルデータを使い、3つのリターン期間にわたってLightGBMモデルを比較します。グリッドでは木の葉の数と損失関数を変え、木の数が異なる複数のチェックポイントで各設定を評価します。浅い木で特徴量間の相互作用を学習できる仕組み、二乗損失・絶対損失・Huber損失が裾の重いリターンにそれぞれ異なる反応を示すこと、選択を評価する際に各チェックポイントを別々の候補として数える必要性を解説します。…
このノートブックでは、同じETFユニバース、予測、リバランス日程、バックテスト手順を用い、均等配分、逆ボラティリティ、最小分散、階層的リスクパリティを比較します。ローリングRidgeモデルがモメンタム、移動平均からの乖離、ボラティリティの特徴量からETFを順位付けし、各配分手法が共通の銘柄選択に独自の重み付けルールを適用します。結果はホールドアウト前の選択期間と、その後のホールドアウト期間に分け、リスク調整後リターン、ドローダウン、売買回転率、安定性を診断します。…
このUS株式事例では、将来リターンの予測と、モメンタムがリターンを引き起こすという主張を区別します。直近月を除く過去1年間の株式リターンを処置、将来リターンを結果とし、直近のボラティリティ、流動性の低さの順位、出来高比率を交絡因子として扱います。二重機械学習では、まず交絡因子から処置と結果をそれぞれモデル化し、次に両モデルの残差を関連付けて効果を推定します。将来データから交絡要因の関係を学習しないよう、エンバーゴを設けたウォークフォワード適合を使います。…
このノートブックでは、PPOエージェントが気配値の傾きとスプレッド幅を選ぶ、シミュレーション上のマーケットメイク課題を作成します。気配値が仲値から離れるほど約定確率は低下し、注文不均衡は約定とその後の価格変動の両方に影響します。在庫に対して気配値を調整する予約価格を設け、評価報酬には時価評価した資産と在庫ペナルティを組み合わせます。エピソード終了時に残るポジションには清算コストがかかります。エージェントは、すでに予約価格調整を適用する固定ルールと比較されます。…
この解説用ノートブックでは、ETFデータを使い、教師ありトレードモデルの目的ラベル手法を比較します。固定期間リターンと方向ラベル、時系列のローリング・パーセンタイル、横断面パーセンタイル、固定またはボラティリティ連動の閾値を使うトリプルバリアラベル、トレンドスキャンを扱います。また、重複する観測値に対する一意性の重み付けと逐次ブートストラップについても解説します。…
この共有モデリングモジュールは、特徴量、ラベル、時系列データ、設定を読み込み、ウォークフォワード交差検証のフォールドを準備して、クオンツリサーチのワークフローを支援します。再現性とデータの来歴を重視し、ソースファイル、配列、モデル設定、ノートブックのコードのハッシュを記録します。入力が変わればキャッシュ済みの結果を無効化できます。また、乱数シードを設定し、データセットのスキーマ、特徴量選択、フォールド準備のユーティリティも備えています。…
このノートブックでは、四半期ごとのSEC 10-Q経営者による討議と分析の文章から、2つの株式シグナル候補を作る方法を示します。FinBERTで文章の一部を肯定・中立・否定のトーンに分類し、そのスコアを集約して、平均センチメントと提出書類内のばらつきを算出します。Sentence-transformerの埋め込みは、連続する四半期の記述間の意味的距離という別の指標を提供します。提出書類の受理日を各シグナルの利用可能時点として、市場データと結合し、将来リターンを評価します。…
このノートブックでは、市場レジームを予測に使う3つの方法を比較します。レジーム入力なしのベースラインモデル、ボラティリティ状態のフィルター確率を入力する単一モデル、明確なレジーム割り当てごとに学習する個別モデルです。先読みを避けるため、ウォークフォワードの各学習ブロックで隠れマルコフモデルを再推定し、推定分散で状態を並べ替え、テストブロック内で前向き再帰により確率を計算します。フォールドごとのスケーリングと学習データ・テストデータ間のギャップは、将来の観測値や重複する予測対象からの情報漏洩を防ぐのに役立ちます。フ…
このノートブックでは、買い手主導の符号付き出来高比率が、その後の15分リターンと関連するかを推定します。相対スプレッド、直近の実現ボラティリティ、過去1か月のリターンを調整します。クロスフィッティングを用いた二重機械学習で、これらの交絡要因から結果変数と処置変数を予測し、その残差を回帰して統制変数では説明されない処置の変動を分離します。分析対象は1分足のNASDAQ-100観測です。適格な母集団、フォールド境界、エンバーゴ、プラセボ設計を決めてから学習します。ブロック置換による反証では、処置のタイミングを崩した後…
このノートブックでは、FX通貨ペアの事例研究でLSTM予測モデルを実行する設定を行います。モデルはルックバック系列に沿って隠れ状態を保持し、共通の設定・研究計画ツールからアーキテクチャと学習設定を取得します。研究で定義されたラベルと設定済みのLSTMアーキテクチャを用い、対象とするモデル母集団がリクエストに含まれているかを確認します。学習を実行するか保存済みの重みを読み込む前に、予測の識別情報とチェックポイントの想定値を記録します。…
このノートブックでは、ETFのリターン予測で不確実性をどう表すかを調べ、モンテカルロ・ドロップアウトとディープアンサンブルを比較します。ドロップアウトは推論を繰り返す間も有効にし、アンサンブルでは別々に学習したネットワーク間の不一致を測ります。これらのばらつきは不確実性を推定するものですが、それだけで所定のカバレッジ特性を持つ区間が得られるわけではありません。分割コンフォーマル較正では予測誤差を区間に変換し、標準的な方法と不確実性で正規化する方法の両方を検討します。…
このノートブックでは、複数のトレード事例研究で登録された二重機械学習の推定値を集め、不確実性と診断結果を比較します。各研究の登録情報から最新の行を読み込み、登録情報の整合性とラベルの一意性を確認し、カバレッジを明示してHAC統計量と信頼区間を算出します。推定効果の単位はそれぞれ異なるため、フォレストプロットでは生の効果量を順位付けせず、無次元のHAC統計量を比較します。また、単純なOLS係数と直交化推定値を対比し、交絡バイアス指標とブロック置換による反証結果をまとめ、複数のラベルと実際に異なる予測期間を区別します…
このノートブックでは、S&P 500オプションの予測研究で、事前に定めたLSTMモデルを学習します。ネットワークには各銘柄の時系列ウィンドウを入力し、手作業で設計した特徴量だけに頼るのではなく、ゲート付きの再帰状態でセッションをまたぐ情報を表現します。設定されたルックバック期間、ネットワーク規模、ドロップアウト、バッチサイズ、学習チェックポイントによってモデルの実行内容を定義します。共通のワークフローでフォールド構成、検証ギャップ、チェックポイント、再起動を扱い、予測対象が適格な行と正確に一致するか確認します。…
このノートブックでは、金融ニュースの文をポジティブ、ニュートラル、ネガティブに分類する3つの方法を比較します。ロジスティック回帰によるTF-IDFの単語・フレーズ特徴量、静的単語ベクトルの平均と分類器、事前学習済みFinBERTセンチメントモデルです。各手法を、高い判定一致率を持つFinancial PhraseBankサブセットから作成した同一の層化テスト分割で評価します。2つの語彙ベース手法では学習分割と推定器を共有し、FinBERTは外部でファインチューニングされた分類器を調整せずに使用します。…