本文介绍公开的 Fama-French 和 AQR 因子收益数据集,说明其在基准比较、风险归因和因子研究中的用途。文中介绍 Fama-French 数据库中的市场、规模、价值、盈利能力、投资和动量因子,以及涵盖质量、低贝塔和替代价值概念的 AQR 序列。数据支持月度频率;加载工具也支持日度 Fama-French 数据和日期范围筛选。 工作流程涵盖下载和缓存数据集、加载与分析数据概况,以及根据月度收益计算年化均值、波动率和夏普率。文中所述 Fama-French 数据覆盖始于 1926,而 AQR…
知识库
这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。
搜索知识库
205 份文档
本笔记本使用高斯混合模型,对九组股票、债券、货币和大宗商品因子及市场序列的月度收益进行聚类。剔除数据不完整的月份后,它对各序列进行标准化,避免不同尺度主导聚类。它使用侧重不同特性的准则比较候选聚类数量,并按时间和已知事件检查所得分组。各状态中的因子表现说明,合并平均值可能掩盖条件收益和分散化行为。…
本笔记本评估 57 个会计和价格类特征,检验它们各自对下个月 US 股票收益的预测作用。它计算每月截面秩相关,取其时间平均值,并针对序列依赖和多候选项检验调整不确定性。它还检查关联是否在滚动训练和验证期内持续存在,并依据效应大小、一致性、显著性和冗余,为每个特征作出单独判断。…
本章提出一套框架,将交易想法转化为有文档记录的特征规格。它要求研究人员使特征周期与目标决策相匹配,说明驱动因素假设,并区分预测信号和描述情境的状态变量。参照系、表示方法和聚合方式应服从经济逻辑;改变假设的变换,应与主要用于控制噪声的变换区别开来。本章概述价格和成交量特征、市场微观结构、跨品种关系、衍生品隐含指标、基本面、宏观经济数据及日历变量。…
这份笔记本汇总九项案例研究中的线性模型结果,包括 OLS、Ridge、Lasso 和 ElasticNet。它比较各研究在主要标签上的最佳完整配置,然后考察正则化、逐折信息系数、稳定性、替代期限、分类与回归指标以及系数表现。结果取自登记库,已排除已退役的预测;只有指标有效且标签覆盖范围达到最大值的完整结果才会纳入比较。 分析使用 HAC 区间评估不确定性,并通过区分重复生成、相同测量值和真正不同结果来处理并列情况。报告的结论经过审慎限定:只有部分选定结果的区间不包含零;Ridge 往往与 OLS…
本章提出一套评估量化交易研究中因果主张的框架。首先明确定义处理、结果、估计目标、反事实和调整集,再根据研究问题选择方法:对连续暴露使用双重机器学习(DML),对离散事件使用贝叶斯结构时间序列,对观测数据中的候选关系使用因果发现方法。有向无环图和识别设计可指导调整选择,而时间交叉拟合和处理前时序有助于防止估计发生数据泄漏。示例涵盖 ETF 动量、加密货币资金费率溢价、FOMC 公告和多变量资产面板。本章介绍安慰剂与负向对照检验、遗漏混杂因素敏感性、样本和设定稳定性、HAC…
此笔记本对一组流动性较高的 US 股票使用主成分分析,构建总敞口标准化的特征组合,并研究其作为潜在风险因子的作用。笔记本考察解释方差,通过行业 ETF 相关性解读成分,比较标准 PCA 与层次 PCA,并分析残差、组合风险贡献及因子在滚动窗口中的稳定性。笔记本强调,PCA…
此配置描述按公司特征排名的月度多空 US 股票组合。它规定了一个包含 46 项特征的完整案例样本空间、月末决策、次日开盘执行、多头和空头部分别等权,以及包括借券费用在内的显著交易成本。特征登记表将信号归为价值、质量、投资和动量等类别,并记录其假定的更新滞后和失效模式。该设置还定义了月度收益标签和滚动评估,并留出 2016 期间作为测试集。 核心设计讨论之一是配置器估计。使用 12…
本笔记介绍用于ETF横截面定价的随机贴现因子模型。该模型不是分别估计基金敞口和因子收益,而是训练神经网络寻找一个共同的贴现因子序列,使其与基金收益的协变关系能够解释平均收益。训练目标是最小化定价误差,预测收益和信息系数则作为后续诊断指标进行报告。区分优化目标与报告的预测评分,对于解读模型至关重要。…
该数据工具支持使用Chen、Pelger和Zhu资产定价数据集,其中包含股票收益、公司特征、宏观经济序列和拆分前的特征张量。其转换方法根据已发布的训练、验证和测试张量生成Parquet文件。由于存档数据在每个区块中提供了持续匿名的公司位置,却没有跨区块映射,转换器会为各区块分配互不重叠的标识符范围。这能保留区块内的公司身份,但不意味着相同标识符跨区块对应同一家已知公司。…
本笔记本比较某横截面 S&P 500 研究中的预测性、结构性和因果模型证据。研究将股票特征与期权衍生指标结合,包括隐含波动率、偏斜和期限结构,并评估每周远期收益排序,同时考察其他标签期限、潜在因子结果、因果估计、十分位表现和信号相关性。核心问题是期权特征能否直接或通过潜在因子提供有用信息,以及哪些发现值得进一步进行策略模拟。…
本笔记本根据 CME 期货收益面板构建主成分因子,而不是从套息、动量或波动率等工程化特征构建。PCA 用于寻找能够解释不同产品间变异的方向;第一主成分可能类似于共同市场走势,后续成分则可能反映板块间联动。这些模式并非由板块标签强加,成分按解释方差而非预测价值排序。 预测会将收益投影到各成分上,并用扩展均值推算因子收益。因子数量预先指定,拟合得到的 PCA…
本审计考察如何从状态门控预测中移除预测变量。删除某个变量的滞后输入,并不等同于在完整的拟合、滤波和调参过程中排除该变量,因为它也可能影响估计得到的状态门。研究人员重建了从 HML 到 SMB 的预测关系,并将分析扩展至四个区域面板中的 30 个因子方向,采用合并预测和隐马尔可夫模型预测。他们还比较了共享状态门下的消融与完整排除来源变量,并通过模拟区分底层预测信息与模型拟合带来的成本。 报告的证据有好有坏,总体上无法得出定论:重建的关系呈现负的均方误差增量收益;而消融与完整排除在 240…
本笔记介绍 PCA,将其作为不使用特征的潜在因子基准,用于预测 ETF 收益。笔记分解每个标签在训练窗口内的收益矩阵,使用各基金的载荷和估计出的因子溢价构建预测。由于整个窗口内同一基金始终占据同一列,该方法适用于固定的 ETF 标的范围;若实体身份随时间变化,则不适用。笔记将此方法与基于特征的模型进行比较,并介绍其滚动训练和预测记录。…
本文介绍如何将带日期的实体记录转换为潜在因子案例研究所需的数组。一种方法只保留覆盖率达到基于资格数据集学习所得阈值的实体,从而生成一致的实体轴,并将缺失观测保留为 NaN。另一种方法构建不规则横截面,将每个日期填充至其观测到的最大值,并将槽位视为日期内的位置,而非跨日期持续不变的身份。 本文还介绍如何将每日特征值转换为有界尺度上的排名、通过分别对各特征进行收益回归来构建对角特征管理型投资组合,以及如何使用向后 as-of…
本笔记介绍一个针对 CME 期货面板的神经随机贴现因子模型。该模型使用产品收益以及持有收益、动量和波动率等可观测特征,构建潜在因子,并针对预先声明的未来收益期限生成预测。笔记将该方法与仅使用收益的 PCA 进行比较,并说明如何通过比较检验特征是否在收益协方差之外增加了定价信息。…
本实验考察一个选定的月度 US 股票多空信号在多大程度上依赖小盘股。它对验证预测应用滞后的市值筛选,剔除市值最小的四分位股票,然后在不重新训练模型的情况下,按相同的投资组合构建方法和成本假设重新运行。筛选后的股票池资产更少,而换手率仍接近完整股票池的结果。 报告的夏普比率从 4.27 降至 2.24,信息系数从 0.074 降至 0.048,最大回撤则从约 15% 加深至…
本笔记介绍一种条件自编码器,将股票收益建模为特征相关的因子载荷与潜在因子的乘积。它先通过联合截面最小二乘拟合估计特征管理组合收益,然后训练神经网络重构同期收益。另一个滚动适配器预测下一个因子实现值,并通过当前特征将其映射为下一日股票收益预测。…
本分析比较九个交易案例中的特征筛查记录。它区分 Benjamini–Hochberg 错误发现率显著性与另一种得出 PROCEED 决策的路径;后者结合案例特定的效应量下限和各折符号稳定性。由于决策可由任一路径满足,PROCEED特征数量可能超过通过 FDR 阈值的数量。随后,笔记将各案例的 PROCEED 占比与验证集和留出集夏普比率配对,探讨特征存活是否能预测策略存活。 证据明确有限:记录是重新生成的,候选特征彼此相关,且仅少数案例登记了回测。不同案例的 PROCEED…
本笔记介绍用于日常交易决策的缓慢变化背景特征:会计比率、宏观经济状况和日历编码。它概述收益率、盈利能力、应计项目、杠杆和现金流收益率等价值与质量指标,并使用公告日期和时点连接,将季度基本面数据与每日观测对齐。宏观序列需要考虑发布时间延迟并向前填充;日历模式可使用周期编码和距事件时间变量。…
本笔记研究基于关键词的 ESG 标题处理流程,并将结构化分类器输出与检索增强生成助手需要满足的要求进行对比。第一组关键词用于筛选标题,第二组用于标注环境、社会或治理类别。对整个筛选池应用分类器后,结果显示环境类别占比明显偏高。笔记将这种不均衡追溯至筛选词表中更容易使用的环境术语,以及分类顺序优先将重叠匹配归为环境类别。 随后,笔记使用分层抽样进行 FinBERT 情绪分类,区分模型加载时间和推理时间,并介绍要求引用原文片段且在无法回答时弃答的 RAG 证据约定。笔记没有生成任何 RAG…
本笔记解释了为何在许多因子或策略中搜索会抬高最终选中者的表面表现,即使每项估计本身计算正确。模拟的一组噪声因子说明,最高的信息系数可能只是偶然看起来很高。随后,笔记构建了先进行异方差和自相关稳健推断、再控制错误发现率的校正流程,并讨论了适用于更保守筛选的族错误率控制。…
风险溢价 PCA 通过加入训练集平均收益向量的加权外积来修改协方差矩阵。其主要特征向量定义静态因子投资组合:权重为零时得到普通 PCA;权重为正时,因子会向与平均收益相关的方向倾斜。笔记比较了多个权重下的定价拟合、收益重构和载荷空间变化,随后使用预先指定的权重预测下一日因子溢价。…
本笔记使用高斯混合模型,根据九个因子和资产类别收益序列的联合表现对月份进行分组。它对月度观测值进行标准化,剔除缺失值月份,并使用 BIC、AIC 和轮廓系数比较候选聚类数量。随后,笔记结合有日期的市场事件解读聚类结果,并考察各组内的因子表现,展示合并平均值如何掩盖不同市场环境之间的差异。 证据来自 AQR 自 1927…