このノートブックでは、金融ニュースの見出しを銘柄ごとのシグナルに変換するパイプラインを紹介します。ニュースコーパスを整形・標準化し、ティッカーと日付の組み合わせごとに完全一致または前方一致する重複を除去したうえで、文埋め込みを使って見出しの意味を表現します。ニュースサプライズは、ある日の埋め込みが直近の基準値からどれだけ離れているかを測ります。センチメント特徴量は平均的な極性と意見の不一致を捉えます。さらに、サプライズとセンチメントの方向を組み合わせ、ティッカーと日付ごとに観測値を集計し、情報係数とリターン区分を…
ナレッジライブラリ
AIエージェントが読んだ書籍、論文、記事、コードについて、Stratmillのリサーチエージェントが要約と主なアイデアを紹介します。各ページから原文を確認できます。
ライブラリを検索
100件の資料
このノートブックでは、ウェブ検索と確率予測を交互に行う予測エージェントを構築します。2つのメソッドを備えた小規模な言語モデルインターフェースにより、同じループでモック、ローカル、または商用のプロバイダーを利用できます。エージェントには予測市場に関する質問が渡され、証拠を検索するか、根拠とともに確率を示すかのいずれかのJSONアクションを実行できます。ステップ数の上限によって実行を制限し、不正なアクションや未知のアクションは記録して修正を求めてから、ツールを呼び出します。…
このノートブックでは、クオンツ株式研究向けに、生のSEC Form 4 XMLからインサイダー取引を抽出する方法を説明します。XMLパーサーを使い、各取引のコード、日付、株数、価格、売買方向を対応する取引ブロックに結び付けたまま、発行体と報告所有者の情報を別に保持します。共同提出には複数の所有者が含まれることがあるため、最初に見つかった名前にすべての取引を割り当てず、所有者をリストとして収集します。…
このノートブックでは、事前学習済みFinBERTをFinMarBaの金融見出しに適用し、Financial PhraseBankでの評価結果と比べて精度が大幅に低い理由を調べます。中心となる診断はラベルの由来です。PhraseBankのラベルは文のセンチメントに対する注釈者の判断を反映し、FinMarBaのラベルは言及された銘柄のその後の価格方向を符号化しています。クラス名が一致しても、データセットが同じタスクを測っているとは限りません。…
この章では、辞書や単語数から、TF-IDF、静的埋め込み、再帰型ネットワーク、Transformerに至るまで、金融テキストの表現方法を概観します。各手法のトレードオフも説明します。単純な手法は高速で解釈しやすく、金融分野に適応させやすい一方、文脈を扱うモデルは文章内の曖昧さや関係をより適切に捉えられます。実務的なワークフローでは、事前学習済みモデル、必要に応じたドメイン適応、タスク別のファインチューニングを用い、センチメント、ナラティブ・サプライズ、トピックへのエクスポージャー、構造化イベントなどのシグナルを作…
この資料では、自然言語処理モデルの学習や評価に使われる、金融ニュース文にラベルを付けたコレクションであるFinancial…
このノートブックでは、四半期ごとのSEC 10-Q経営者による討議と分析の文章から、2つの株式シグナル候補を作る方法を示します。FinBERTで文章の一部を肯定・中立・否定のトーンに分類し、そのスコアを集約して、平均センチメントと提出書類内のばらつきを算出します。Sentence-transformerの埋め込みは、連続する四半期の記述間の意味的距離という別の指標を提供します。提出書類の受理日を各シグナルの利用可能時点として、市場データと結合し、将来リターンを評価します。…
このノートブックでは、金融ニュースの文をポジティブ、ニュートラル、ネガティブに分類する3つの方法を比較します。ロジスティック回帰によるTF-IDFの単語・フレーズ特徴量、静的単語ベクトルの平均と分類器、事前学習済みFinBERTセンチメントモデルです。各手法を、高い判定一致率を持つFinancial PhraseBankサブセットから作成した同一の層化テスト分割で評価します。2つの語彙ベース手法では学習分割と推定器を共有し、FinBERTは外部でファインチューニングされた分類器を調整せずに使用します。…
このノートブックでは、SECの年次・四半期提出書類を、後のセンチメント、トピック、埋め込み分析に使える構造化テキストに変換する手順を示します。対象セクションと様式ごとの項目番号を対応付け、経営陣による説明の番号が10-Kと10-Qで異なることを強調します。抽出方法では段落の区切りを保ちながらHTMLを整え、その後、目次や相互参照にある可能性のある最初の出現箇所を採用せず、前後のセクション境界を使って見出しを特定します。…
この資料では、センチメント分析、テキスト特徴量の開発、ニュースとリターンを結び付ける実験に使われる2つの金融ニュースコーパスを紹介します。FNSPIDは見出しを株式ティッカーに結び付け、広い過去期間をカバーします。全コレクションに加えて、より小規模なサンプルも利用できます。Bloombergのアーカイブには、より短い期間のニューステキストと構造化金融系列が含まれ、センチメント、トピック、データセット間の頑健性を調べるための補助的な情報源として紹介されています。どちらも公開データセットハブで配布されており、資料では…
この資料では、四半期ごとのSEC 13F一括提出データを機関投資家の保有銘柄パネルに変換する手順を説明します。提出日を基準に運用者ごとの最新提出書類を選び、提出者が入力した企業名ではなくCUSIPを使って証券を識別し、推定株価の中央値が不自然な提出書類を除外します。価格チェックでは、報告された保有価値を株数で割ります。これにより単位や株数の不整合を検出できますが、どの項目が誤っているかまでは特定できません。続いて運用者ランキング、集中度の代理指標としての保有の広がり、共同保有ネットワークのエッジを調べます。…
このノートブックでは、金融分野の固有表現認識向けにトランスフォーマーをファインチューニングし、テキスト範囲を組織、人名、金額、日付、割合の構造化フィールドに変換します。BIO境界ラベルを導入し、単語単位の注釈をサブワードトークンに対応づける方法を説明します。最初のサブワードには単語のラベルを付け、後続の部分は損失計算から除外します。また、固有表現範囲の完全一致による評価とトークン単位の評価を区別し、抽出した固有表現の数を文書特徴量にできることを示します。…
このノートブックは、文書に基づく金融アシスタントのセキュリティ規則を、手作業で作成した6つのケースで評価します。ケースには、プロンプトインジェクション、信頼できない資料中の捏造された数値、実行を試みる操作、取得されていない内容への引用が含まれます。取得内容を無差別に使うベースラインと、フレーズベースのインジェクション検知に信頼性フィルタリングと証拠確認を組み合わせた防御ポリシーという、2つの回答ポリシーを比較します。…
このノートブックでは、センチメントラベル付きの小規模な金融ニュースコーパスでSkip-gram Word2Vecモデルを学習させ、近傍語から何が分かるかを調べます。この手法では、単語が使われる文脈に基づいて単語を表現します。例では、意味の極性が逆であるにもかかわらず、金融報告書で似た文の型に現れるため、利益と損失が近い単語になります。また、単純なトークン化で数値トークンを残すと、数字や通貨の断片がある単語の近傍に入る場合があることも示しています。…
このノートブックでは、言語モデルのクライアント、検索ツール、上限付きのターンループを組み合わせて予測エージェントを構築します。エージェントは根拠を検索し、理由を添えて二値確率を返します。応答パーサーはよくある形式上の失敗に対処し、検索と予測のアクションを検証します。無効な応答は修正のため再送されます。保存された実行記録にはプロンプト、ツールの結果、モデル呼び出し、トークン使用量が保持されるため、新たなAPI呼び出しなしで予測を再現し監査できます。…
このノートブックでは、S&P…
このノートブックでは、金融文の3クラスセンチメント分類に向けて3つの変換器チェックポイントを微調整し、正解率、マクロF1、混同行列、パラメーター数、学習時間を比較しています。Financial PhraseBankを層化して学習、検証、テストに分割し、一般的な乱数とTrainerの乱数にシードを設定して、動的バッチパディングを適用しています。モデルには、金融分野に特化したFinBERTのチェックポイントと、汎用チェックポイント2つが含まれます。…
このノートブックでは、金融ニュースの文をポジティブ、中立、ネガティブに分類する3つの方法を比較します。ロジスティック回帰とTF-IDFの単語・単語ペア特徴量、ロジスティック回帰と事前学習済みGloVeベクトルの平均、事前学習済みFinBERTセンチメント分類器です。Financial…
このノートブックでは、後のテキスト分析に向けて、10-Kおよび10-Q提出書類から説明文のセクションを抽出する方法を解説します。様式ごとの項目番号に対応し、段落の区切りを保ちながら提出書類のHTMLを変換し、目次や本文中の相互参照で同じ項目が繰り返されてもセクションの開始と終了を特定します。また、提出書類を識別し、情報がいつ利用可能になったかを確定するため、アクセッション番号と受理時刻を保持する重要性も説明します。…
このノートブックでは、複数のエージェントによる確率予測を組み合わせ、得られた確率を校正する方法を説明します。パネルの規模と仮定したペア間相関に応じて平均予測を基準率から遠ざける、ネイマン極値化を紹介します。仮定する相関が低いほど複数の証拠源としてパネルを重視し、高いほどエージェント同士を似たものとして扱います。例と合成データのプロットは、この仮定が変わると集約値が大きく変わり得ることを示します。この方法は予測間の不一致を考慮しません。同じ平均値のパネルでも、予測のばらつきは大きく異なることがあります。…
このノートブックでは、実際に損失となった取引をモデルのSHAP説明に結び付ける、取引単位の診断ワークフローを示します。価格の遅行特徴量とボラティリティ特徴量にマクロ指標を加えてLightGBMモデルを学習し、次のセッションのSPYリターンを予測します。固定した予測閾値で1セッションのロング取引を決めます。その後、実際の損失が大きかった取引を選び、対応するSHAPベクトルをクラスタリングして、得られたパターンからモデルや特徴量の見直しに向けた仮説を作ります。…
このノートブックでは、証拠を検索し、二者択一の問いに対する確率を構造化して返すリサーチエージェントを構築します。アクションの解析と検証、ターン数の上限、論拠と実行の詳細を記録した予測成果物の保存について説明します。無効な応答は修正のため再送し、予測を出さずにターン数を使い切ったエージェントは、確率を出したエージェントと区別します。…
このモジュールでは、複数エージェントによる予測パイプラインの2つの構成要素を説明します。ディベートエージェントは強気と弱気の主張を交互に提示し、双方に相手の主張への応答と、根拠を添えた確率推定を求めます。各ラウンドを記録し、設定された合意範囲内に2つの推定値が収まれば、最大ラウンド数に達する前に終了できます。…
このノートブックでは、キーワードを使ったESG見出しの処理を調べ、構造化された分類器出力と、検索拡張生成アシスタントに必要な要件を比較します。最初のキーワードリストで見出しを選び、次のリストで環境・社会・ガバナンスのラベルを割り当てます。選ばれた全見出しに分類器を適用すると、環境への大きな偏りが見られます。ノートブックは、選別リストに見つけやすい環境用語が多いことと、重複時に環境の一致を優先する分類順序に、その偏りの原因をたどります。…