このノートブックでは、会計データと価格に基づく特性を、翌月のUS株式リターンの単独予測因子として評価します。各特性とリターンラベルの月次クロスセクション順位相関を算出し、開発期間の各月にわたって集計します。予約済みのホールドアウトを除外し、パネルの整合性を確認します。最低限のカバレッジとクロスセクションの広がりを求め、ウォークフォワードの学習期間と検証期間を通じて関連性が持続するかを調べます。…
ナレッジライブラリ
AIエージェントが読んだ書籍、論文、記事、コードについて、Stratmillのリサーチエージェントが要約と主なアイデアを紹介します。各ページから原文を確認できます。
ライブラリを検索
654件の資料
このノートブックでは、CME先物のケーススタディで、候補特徴量を将来リターンに照らしてスクリーニングします。各特徴量について、特徴量の値とその後のリターンのクロスセクション順位相関を計算し、日付間で相関を集計します。リターン期間の重複を考慮して不確実性を調整し、検定対象全体にBenjamini-Hochberg法による偽発見率制御を適用します。カバレッジとデータの古さを確認し、ウォークフォワード検証の各年や異なるラベル期間での一貫性を調べ、根拠とともに続行・修正・中止の評価を記録します。後の確認段階を保つため、ホ…
このノートブックでは、株式リターンとは独立に市場環境を記述するため、月次マクロ経済指標をクラスタリングします。FRED系列を月末観測にそろえ、失業率、フェデラルファンド金利、イールドカーブのスプレッド、前年比CPI変化率を標準化してから、ガウス混合モデルを適合させます。上昇を続けるCPI水準ではなくインフレ変化率を使うことで、クラスタリングが主に前半と後半の日付を分けるのを避けます。クラスター名は明示的なしきい値ルールで後から割り当てるため、経済的なラベルはモデルから自動的に生まれるのではなく、これらの選択に依存…
このノートブックでは、Diffusion-TSを応用して、合成の日次ETFリターン系列を生成します。デノイザーが元の系列を予測し、その予測を多項式トレンド、選択したフーリエ成分、残差に分解します。時間領域と周波数領域を組み合わせた目的関数は、リターン値とスペクトル構造の両方を保つことを意図しています。重複する系列と時間軸上のホールドアウトを使い、ガウス隠れマルコフモデルが識別した低・高ボラティリティのレジームへサンプリングを誘導するため、ノイズ系列で学習した分類器を加えます。…
このノートブックでは、実際のホールドアウト成果物を使って、導入済み金融モデルの監視手順を構築します。ドリフトを測る前に、入力特徴量データが埋まっていて構造的に妥当か確認し、その後、基準期間と現行期間を比較します。特徴量分布の変化は、母集団安定性指数と2標本コルモゴロフ–スミルノフ検定で評価します。安定性しきい値は慣例に基づく一方、大標本では統計的有意性が実質的に小さな変化まで検出し得るため、2つの指標を組み合わせます。…
このノートブックでは、SHAPを用いてETFパネルのリッジ回帰予測を解釈する方法を説明します。線形モデルでは、各特徴量の寄与は、その係数に、学習背景データの平均からの特徴量の偏差を掛けた値です。そのため、閉形式の計算と照合できます。この手順では、寄与の全体的な大きさ、個別予測のウォーターフォール説明、確信度の高い予測が正しかった場合と誤った場合の比較、ウォークフォワード分割を通じた重要度の安定性を扱います。…
このノートブックでは、条件付きオートエンコーダが計量主成分モデルをどう拡張するか説明します。ニューラルネットワークが株式特性からファクター・エクスポージャーへの写像を学習する一方で、モデルはエクスポージャーとファクターリターンの積という同じ構造を維持します。各学習期間に設定された先行リターンのラベルを再構成するようモデルを適合させ、その後、固定したファクター平均を検証日のエクスポージャーに適用し、次の期間の銘柄順位を付けられるか評価します。再構成と情報係数による評価には同じラベルを使うため、正のスコアは独立した意…
この研究では、金融特徴量とGJR-GARCHボラティリティ特徴量を先行株式リターンに照らしてスクリーニングします。各セッションで、特徴量とその後のリターンの銘柄間順位相関を計算し、平均的な関連性、ウォークフォワード検証期間を通じた一貫性、多数の候補を検定した後の結果の信頼性を評価します。予測との関連を測る前に、特徴量のカバレッジと古さも確認し、各特徴量の判定を記録します。分析には開発データを使い、ホールドアウトは後に選択する構成のために確保します。…
この資料では、センチメント分析、テキスト特徴量の開発、ニュースとリターンを結び付ける実験に使われる2つの金融ニュースコーパスを紹介します。FNSPIDは見出しを株式ティッカーに結び付け、広い過去期間をカバーします。全コレクションに加えて、より小規模なサンプルも利用できます。Bloombergのアーカイブには、より短い期間のニューステキストと構造化金融系列が含まれ、センチメント、トピック、データセット間の頑健性を調べるための補助的な情報源として紹介されています。どちらも公開データセットハブで配布されており、資料では…
このノートブックでは、ショートのヨーロピアン・コールを対象にディープヘッジを実演します。幾何ブラウン運動で原資産価格の経路をシミュレーションし、ベンチマークとしてブラック–ショールズのデルタを計算し、半再帰型ニューラルネットワークでヘッジポジションを決めます。学習目的は、満期時損失の条件付きバリュー・アット・リスクを最小化することです。損益計算では、ヘッジ開始、各リバランス、満期時の決済に比例コストを課し、同じ仮定のもとで離散的なデルタヘッジと比較できるようにします。また、学習された取引がデルタ・ベンチマークに近…
このノートブックでは、10個の主成分が捉える広範な変動を調整した後、4つの運用ポートフォリオ戦略がSPYリターンの説明力を高めるか検証します。候補ポートフォリオは、遅行リターンを使ってETFを直近のモメンタム、低ボラティリティ、短期リバーサルで順位付けし、ロングとショートのバスケットを作ります。各ファクターの未調整のSPY負荷量と、2つのLASSO回帰で対照変数を選んだ後の条件付き負荷量を比較します。拡張時系列交差検証と分割内でのスケーリングおよびPCAにより、後の観測が前の検証分割に漏れないようにします。選ばれ…
この資料では、ETFリターンのモデル化に計量主成分分析を用いる方法を説明します。各ファンドに固定のファクター・エクスポージャーを割り当てる通常のPCAとは異なり、IPCAでは各ファンドのエクスポージャーを、観測可能な特徴量の共通の線形関数として表します。交互最小二乗法により、特徴量からエクスポージャーへの写像とファクターリターンを同時に推定します。この制約によりファンド間および日付間の情報を統合できますが、特徴量との関係が線形であるという仮定は残ります。…
このノートブックでは、スプレッド、板の不均衡、売買方向付き出来高、価格インパクトなどの日中ミクロ構造情報を使い、NASDAQ-100銘柄の次の15分リターンを順位付けする予測モデルを比較します。網羅性が完全な場合に限り、各モデルファミリーから代表となる予測セットを1つ選び、モデルのチェックポイントは区別して扱います。分析では、順位相関と不確実性区間を比較し、ウォークフォワード分割ごとの性能を確認します。予測バケットの単調性と市場局面への依存性を検証し、コンフォーマル予測区間が所定の網羅率を満たすかも調べます。因果…
この評価では、オプションサーフェス、価格由来、条件付きボラティリティの特徴量を、株式の将来リターンに照らしてスクリーニングします。各セッションで特徴量の値とその後のリターンの横断面順位相関を計算し、情報係数(IC)の時系列を調べます。平均的な関連性、重複する将来リターンを考慮した不確実性、ウォークフォワードの検証期間ごとの挙動、多数の候補をテストする影響を評価します。予測との関連性を検討する前に、網羅性と古い値の確認で特徴量の定義を選別します。また、重複性の高い特徴量は、実質的に同じ順位付けを示すものとして扱いま…
この分析では、複数の売買ケーススタディで選ばれたシグナルが、その後も使えるほど信頼できそうかを評価します。検証用情報係数(IC)とホールドアウトの根拠を比較し、安定性と再現性を調べ、予測の品質とモデル予測から構成したポートフォリオのシャープレシオを対比します。ヒートマップとファミリー別の要約で、資産クラスやモデルファミリーによる結果の違いを示します。また、平均ICとシグナルのシャープレシオ中央値は異なる性質を捉えるため、モデルの順位が異なる場合があることを明らかにします。…
このチュートリアルでは、資産の価格と出来高の履歴から作る特徴量を概観します。複数期間のリターン、トレンドと反転の指標、複数のボラティリティ推定値、ボラティリティ局面、流動性、テールリスク、横断面の正規化などを扱います。モメンタムシグナルでは直近の観測値を除外する、移動平均からの乖離をボラティリティで尺度調整する、生の出来高ではなく相対出来高を使う、といった実践的な選択肢も説明します。また、定常性と長期情報の保持を両立させる方法として、分数階差分も取り上げます。…
このノートブックでは、オプションサーフェス特徴量を含む株式パネルに対する操作変数付き主成分分析(IPCA)を説明します。各銘柄のリターン履歴からエクスポージャーを推定する通常の主成分分析(PCA)とは異なり、IPCAでは、インプライドボラティリティ、スキュー、タームストラクチャー、インプライド分散と実現分散の比較など、各銘柄の日付ごとの特徴量の共通線形関数としてエクスポージャーをモデル化します。交互最小二乗法によって、共通ファクターリターンとともにこの対応関係を推定します。エクスポージャーは特徴量から計算されるた…
このノートブックでは、企業の10-K提出書類からサプライヤー、顧客、競合他社の関係を抽出し、Neo4jの知識グラフに保存するパイプラインを概説します。ローカルの言語モデルが主語・述語・目的語の構造化された三つ組を提案し、その後、文字列ベースのエンティティ解決で名称を正規化し、提出企業への言及を正式な企業名に対応づけます。解決済みの関係を一括してグラフに書き込み、グラフクエリで複数社に共通するサプライヤーを集計し、サプライチェーンの集中度を示します。 このノートブックはS&P…
この文書では、モデル学習やバックテストを再利用するか再実行するかを判断するための、登録情報の確認方法を説明します。実行は仕様から導いたハッシュで識別され、期待される成果物がそろっている場合にのみ再利用できます。不足があれば実行は部分完了として扱われ、再学習または再実行が行われます。デバッグには明示的な強制フラグを使えます。また、予測キーの正規化とダイジェスト化も説明します。時間値にはバージョン管理された表現規則を適用するため、異なる型で読み込んだ同等の日付を一貫して比較できます。…
このノートブックでは、金融分野の固有表現認識向けにトランスフォーマーをファインチューニングし、テキスト範囲を組織、人名、金額、日付、割合の構造化フィールドに変換します。BIO境界ラベルを導入し、単語単位の注釈をサブワードトークンに対応づける方法を説明します。最初のサブワードには単語のラベルを付け、後続の部分は損失計算から除外します。また、固有表現範囲の完全一致による評価とトークン単位の評価を区別し、抽出した固有表現の数を文書特徴量にできることを示します。…
このノートブックでは、CME先物リターンの横断面予測に勾配ブースティングを適用します。葉数の構成を変えて木の容量を調整し、極端な残差が学習に与える影響の強さが異なる二乗誤差、絶対誤差、Huber目的関数を比較します。各モデルを複数のブースティングチェックポイントで評価するため、宣言されたモデル構成に加え、木の本数も選定要素になります。固定したモデル群の中で予測期間の影響を比較できるよう、同じグリッドを2つのリターン期間で学習します。…
このノートブックでは、暗号資産の無期限先物の資金調達プレミアムを予測する系列モデルの比較に、時間畳み込みネットワーク(TCN)を追加します。因果パディングにより、各位置では現在および過去の観測値のみを使用し、拡張畳み込みによって受容野を効率的に広げます。選択した層構成は、宣言された入力ウィンドウ全体をカバーします。予測に最後の再帰状態を使うLSTMとは異なり、TCNは各位置の表現を平均し、有用な情報が時間とともにどこに現れるかについて別の仮説を検証します。…
このノートブックでは、企業提出書類のテキスト集合から文章を検索する4つの方法、BM25、密な埋め込み、相互ランク融合(RRF)、クロスエンコーダによる再順位付けを比較します。RRFは生のスコアではなく順位リストを組み合わせるため、異なるスコア尺度を較正せずに語彙検索と意味検索を統合できます。その後、再順位付けモデルが候補群の順位を変えます。また、検索段階の実装方法と、共通の検索深度で評価する方法も説明します。…
この文書では、リサーチパネル、集約予測、対立的な議論、監督役を組み合わせた予測アーキテクチャ全体を示します。監督役は意見の不一致を特定し、明確化に役立つ証拠を探し、確信度ラベル付きの確率を提案します。確信度に基づくルールによって、その確率でアンサンブルを上書きするか、混合するか、変更しないかを決めます。ノートブックでは出力に影響する設定を一元化し、後から確認できるよう段階ごとの確率と実行情報を記録します。…