跳至正文

知识库

这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。

搜索知识库

40 份文档

《交易机器学习》

本笔记本介绍如何为预测智能体设计搜索工具,使证据具有一致的结构、可追溯的来源,以及可审计的进入模型路径。共享客户端协议会返回类型化结果,并包含截止日期。排除日期在截止日当天或之后的结果;未标日期的页面会单独记录,因为过滤器无法确定其何时可用。确定性模拟工具支持可重复的离线示例,笔记本也介绍实时搜索。…

机器学习回测市场情绪
《交易机器学习》

本笔记本评估四种源自新闻的信号——加权意外值、平均情绪、情绪变化和文章覆盖度——与股票未来收益的关系。它计算每日横截面斯皮尔曼信息系数,汇总其均值、变异性、信息比率和t统计量,然后比较按信号排名的五分位组收益及其多空价差。每个日期计算一个系数,使日期成为分析单位,而不是将所有资产与日期的观测合并。笔记本还检查重复的信号值是否会影响分组比较。…

股票市场情绪统计学因子投资
《交易机器学习》

该笔记评估从新闻文本中提取的四种信号:加权意外度、平均情绪、情绪动量和文章覆盖度。笔记使用先前特征构建步骤准备的远期收益,然后为每种信号和收益期限计算每日横截面 Spearman 信息系数。评估汇总这些系数的均值与变异、信息比率和 t 统计量,并计算按信号将资产分为五组后最高组与最低组的收益。 文档给出的结论是,这些信号在本次评估中没有显示出可测量的优势。文档解释了为何推断应以每日系数而非合并后的资产观测为单位,以及为何重复的信号值可能扭曲分组规模和比较结果。t…

股票市场情绪统计学因子投资
《交易机器学习》

本笔记比较Polymarket以加密货币结算的事件合约与受监管的Kalshi平台,将其作为另类数据来源。笔记说明,准入规则、结算资产、持仓限额和上市政策会影响哪些参与者左右价格,以及数据中会出现哪些问题。在构建特征之前,笔记检查已提供快照的规模和覆盖范围,并强调极短的历史数据可用于横截面观察,但无法支持可靠的时间序列分析。…

加密资产市场情绪统计学事件驱动
《交易机器学习》

本笔记介绍由看多和看空角色参与的多轮预测辩论。双方分别主张某事件发生概率更高或更低,在后续轮次中会看到对方先前的论点,并给出概率及支持证据。主要诊断指标是双方概率随时间变化的差距:差距缩小可能表明一方回应了此前未考虑的证据,持续存在的差距则记录了尚未解决的分歧。差距低于选定阈值或达到轮数上限时,流程可以停止。…

机器学习统计学市场情绪风险管理
《交易机器学习》

本笔记实现一套 ESG 新闻标题处理流程:通过关键词筛选新闻,将选中的标题归入环境、社会或治理类别,并对抽样标题使用 FinBERT 情感模型评分。笔记在抽样前衡量所选样本的类别构成,并采用分层抽样,确保每个类别都进入分类器。笔记还将模型加载时间与推理时间分开,并说明要公平比较,检索增强生成系统需要提供哪些内容:带引用的证据以及拒绝作答的能力。…

机器学习市场情绪统计学
《交易机器学习》

本笔记对版本已锁定的 FinBERT 模型应用词元级 SHAP,该模型将金融文本分类为负面、中性或正面。笔记封装模型推理以保留检查点的标签顺序,然后通过衡量被遮蔽的词元组相对于基准如何改变类别概率,解释类别概率。示例展示了几个句子中贡献最大的词元,并比较固定句式中将“narrowed”替换为“widened”的效果。 笔记还用少量构造的句子汇总对正面类别的贡献,以演示聚合流程。这些演示并不能证明模型准确,也不能代表通用金融词汇:示例经过筛选,样本太小,无法支持广泛结论。SHAP…

机器学习市场情绪统计学
《交易机器学习》

这份记录描述了一个多智能体流程,用于估计美国是否会在 2026 年底前陷入衰退。智能体搜索经济指标和预测结果,分别给出概率,通过辩论比较理由,再将证据交给监督智能体以更新概率。判定标准包括:所述期间内连续两个季度的 GDP 收缩,或出现日期落在该期间内的 NBER 衰退。…

美国市场统计学市场情绪
《交易机器学习》

此笔记本将财经标题转化为个股信号,并根据未来收益进行评估。它对标题进行嵌入,以语义距离衡量新闻相对于滚动嵌入基线的意外程度,并将意外程度与情绪方向结合,区分异常利好和异常利空新闻。它还计算平均情绪、分歧、情绪动量和文章覆盖度。标题按股票代码和日期去重,股票代码与日期经过标准化,并对信号进行滞后处理,避免过早使用发布当日的信息。…

股票因子投资市场情绪机器学习
《交易机器学习》

本笔记运行或重放一组相同的研究智能体,让它们回答同一个预测问题,然后检查其预测、搜索活动和对话轨迹。分别记录每个智能体的轨迹,可在并行调用期间保留来源归属。示例表明,即使提示和工具相同,智能体仍可能给出不同预测;但采样和检索到的文档都可能解释这种差异,而该设计无法区分两者的影响。…

机器学习统计学市场情绪回测
《交易机器学习》

本笔记在 FinMarBa 标题上评估预训练金融情绪模型,并说明为何这并非对情绪迁移能力的纯粹测试。FinBERT 根据人类对文本情绪的判断进行训练,而 FinMarBa 的负面、中性和正面标签则根据标题中提及的股票代码之后的价格走势生成。类别名称相同,却掩盖了所测任务的差异。 分析将准确率与多数类基线比较,报告宏平均…

机器学习市场情绪股票统计学
《交易机器学习》

本笔记本将预训练 FinBERT 应用于 FinMarBa 的财经标题,并分析其准确率为何远低于其在 Financial PhraseBank 评估中报告的数值。核心诊断在于标签来源:PhraseBank 标签反映标注者对句子情绪的判断,而 FinMarBa 标签编码了文中提及的股票随后价格走势。因此,类别名称相同并不意味着两个数据集测量的是同一任务。 笔记本将准确率与多数类基准进行比较,报告宏平均…

机器学习市场情绪统计学
《交易机器学习》

本笔记介绍将财经标题转化为个股信号的流程。它会清理并规范新闻语料,在股票代码与日期分组内去除完全重复及前缀匹配的重复项,并使用句子嵌入表示标题含义。新闻意外度衡量某日嵌入与近期基准的偏离程度;情绪特征则反映平均情绪极性及分歧程度。笔记还将意外度与情绪方向结合,按股票代码和日期汇总观测,并通过信息系数和收益分组评估信号与未来收益的关系。…

股票机器学习市场情绪因子投资
《交易机器学习》

本笔记构建了一个在网页搜索和概率预测之间交替工作的预测智能体。一个精简的双方法语言模型接口,让同一循环可以使用模拟、本地或商业服务商。智能体接收一个预测市场问题,并可发出两种 JSON 操作之一:搜索证据,或说明一个概率并给出理由。步骤预算会限制运行过程;在调用任何工具之前,格式错误或未知的操作都会被记录并送回以便修正。…

机器学习市场情绪统计学
《交易机器学习》

本笔记介绍如何从原始 SEC Form 4 XML 中提取内幕交易记录,用于量化股票研究。它使用 XML 解析器,将每笔交易的代码、日期、股数、价格和方向保留在对应的交易区块中,同时单独保留发行人和申报所有者信息。联合申报可能包含多个所有者,因此会将所有者收集为列表,而不是把每笔交易都归给找到的第一个姓名。…

股票事件驱动市场情绪统计学
《交易机器学习》

本章综述金融文本表示方法,从词典和词频统计到 TF-IDF、静态词向量、循环网络和 Transformer。文中解释了各种方法的权衡:简单方法速度快、易于解释且适合金融领域;上下文模型则更善于处理歧义和段落内的关系。实际流程使用预训练模型、可选的领域适配和面向任务的微调,以生成情绪、叙事意外、主题敞口和结构化事件等信号。…

机器学习市场情绪统计学股票
《交易机器学习》

本笔记使用语言模型客户端、搜索工具和有限轮次循环构建预测智能体。智能体搜索证据,并给出二元概率及理由。其响应解析器处理常见格式错误并验证搜索和预测操作;无效回复会被要求修正。保存的运行记录保留提示词、工具结果、模型调用和令牌用量,因此无需新的 API 调用也能重放并审计预测。…

机器学习统计学市场情绪回测
《交易机器学习》

本资料介绍 Financial Phrasebank,这是一个带标签的金融新闻句子集合,可用于训练或评估自然语言处理模型。人工标注者将情绪标记为正面、中性或负面。语料库提供四种标注一致性门槛:最严格的子集仅保留所有标注者意见一致的句子,较宽松的门槛则包含更多示例,但标签共识程度较低。本文将该数据集定位为金融情绪分类基准,并列举词向量训练、情绪追踪和 Transformer 微调等用途。 资料说明数据集在磁盘上的不同版本、加载器行为,以及获取源文件并将其转换为 Parquet…

市场情绪机器学习
《交易机器学习》

本笔记展示如何将季度 SEC 10-Q 管理层讨论与分析文本转换为两个候选股票信号。FinBERT 对文本片段的正面、中性或负面语气进行评分;片段得分汇总为平均情绪和文件内离散度。句子嵌入模型提供第二种度量:连续季度叙事之间的语义距离。文件受理日期确定每个信号的可用时间,工作流再将信号与市场数据连接,以评估前向收益。 笔记通过 Spearman 信息系数、五分位分析和聚类自助法置信区间筛查信号质量。笔记还处理同一天提交多个季度文件的情况,以避免连接键重复,并指出由于年度报告取代第四季度…

股票机器学习市场情绪统计学
《交易机器学习》

本笔记比较三种将金融新闻句子分类为正面、中性或负面的方法:使用 TF-IDF 词语和短语特征的逻辑回归、使用平均静态词向量的分类器,以及预训练 FinBERT 情绪模型。所有方法都在 Financial PhraseBank 高一致性子集的同一个分层测试拆分上评估。两种词汇方法共用训练拆分和估计器;FinBERT 则是外部微调的分类器,未经适配直接使用。 比较说明了不同表征保留的信息:TF-IDF…

机器学习市场情绪股票统计学
《交易机器学习》

本笔记介绍一种工作流程,将 SEC 年报和季报转换为结构化文本,以供后续情绪、主题和嵌入分析。它将所需章节映射到不同表格对应的项目编号,并指出管理层讨论在 10-K 和 10-Q 中使用不同的编号。提取方法会清理 HTML,同时保留段落边界;随后根据前后章节边界定位标题,而不是接受首次出现的位置,因为首次出现可能来自目录页或交叉引用。 工作流程会检查提取结果是否为空、短得不合常理或过长,并使用词汇重合度和段落的精确变化来比较相邻文件。章节以 accession…

股票市场情绪事件驱动统计学
《交易机器学习》

本资料介绍两个用于情绪分析、文本特征开发及新闻与收益关联实验的财经新闻语料。FNSPID将新闻标题与股票代码关联,覆盖较长历史时期;除完整数据集外,还提供较小样本。彭博档案包含新闻文本和结构化金融序列,但覆盖时期较短,作为情绪、主题和跨数据集稳健性研究的补充来源。两者均通过公共数据集平台分发,本文概述了其基本内容和加载选项。…

股票市场情绪机器学习统计学
《交易机器学习》

本文介绍如何将季度SEC 13F批量申报数据整理为机构持仓面板。它按申报日期为每位管理人选取最新申报,使用CUSIP而非申报人填写的公司名称来识别证券,并筛除隐含股价中位数不合理的申报。价格检查以申报持仓价值除以股数计算,可发现单位或股数不一致,但无法确定哪个字段有误。随后,分析会考察管理人排名、作为拥挤度代理指标的持股广度,以及共同持股关系图中的边。…

股票美国市场统计学市场情绪
《交易机器学习》

本笔记演示如何微调Transformer进行金融命名实体识别,将文本片段转换为结构化的机构、人物、金额、日期和百分比字段。笔记介绍BIO实体边界标签,并说明如何将词级标注对齐到子词元:首个子词元接收该词的标签,后续部分不计入损失。笔记还区分精确实体跨度评分与词元级评分,并说明提取出的实体数量如何转化为文档特征。…

机器学习统计学市场情绪股票