本研究检验线性模型拟合月度 US 股票收益较差,是否源于其平方误差目标函数。研究固定未缩尾的前向收益目标、特征和滚动折,并比较使用平方误差、绝对误差和 Huber 损失训练的提升树模型。平方误差会让极端残差产生不成比例的影响;绝对误差会减小这种影响,而 Huber 损失则在二次惩罚和线性惩罚之间转换。网格还会改变树的容量,并记录多个训练检查点的预测,将每个检查点视为独立候选项。…
知识库
这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。
搜索知识库
205 份文档
本文档演示了工具变量 PCA,其中资产因子载荷被建模为收益发生前观测到的特征的线性函数。该方法使用交替最小二乘法估计特征到载荷的映射和实现因子,再通过旋转不变的子空间诊断评估载荷恢复效果。由于旋转和符号变化不会改变拟合收益,单个因子标签无法识别;比较时应关注恢复出的子空间。 合成面板将时间 t 的特征与时间 t+1…
本文档介绍一个可复现的 US 股票基准数据集,取自 Chen、Pelger 和 Zhu 的资产定价复现档案。数据集包含约 1.2 百万条月度股票观测,覆盖 1967 至 2016,包括 46 项公司特征、宏观经济指标、前向收益,以及预先定义的训练、验证和测试分区。公司标识符在各自发布的张量中匿名且保持一致,但不同标识符命名空间使研究者无法跨张量关联公司。 该数据集支持资产定价机器学习研究,适用于一致的基准数据比解释个别证券更重要的场景。其公开的时间分区将 1967–1986 用于训练,1987–1991…
本笔记将一种对抗式随机贴现因子设计改编为美国股票的日度分析。一个投资组合权重网络根据次日超额收益构建因子,另一个竞争性矩网络则协助训练定价核;独立的贝塔网络预测资产层面的收益—因子乘积。尾随股票特征和延迟的宏观经济状态,依据决策收盘时可获得的信息决定权重。笔记区分了 SDF 权重和贝塔预测,也将因子定价诊断与横截面排序表现分开。…
本笔记使用匿名化的公司特征和收益面板,将随机森林与XGBoost、LightGBM和CatBoost进行比较。数据集按时间划分为训练集、验证集和测试集。模型主要使用Spearman秩信息系数评估,并以R²和均方误差作为补充指标。提升模型采用正则化和抽样控制;XGBoost还根据验证结果提前停止,以选择迭代次数。…
本笔记基于已发布面板,为US公司特征研究构建月度模型矩阵;该面板中的特征已在公司间完成排名。它利用同一公司—月份行中的数值添加合成特征和交互项,不拟合变换,也不计算滚动窗口。特征族登记表记录各特征组的输入、时间约定、研究依据和可能的失效模式。本笔记不将已实现收益纳入特征矩阵,并检查公司标识是否与独立的标签面板一致。…
本笔记研究线性模型正则化在预测货币对收益时的作用。它区分了输入特征之间的多重共线性与资产之间的依赖性:货币对共享基础货币,因此其收益和排名并不独立。岭回归会缩小系数但保留特征;Lasso 可以将系数设为零;ElasticNet 则结合两者。Lasso 和 ElasticNet 的惩罚项按各折特定的阈值进行缩放,使其设置在不同折中具有可比含义。…
本笔记研究一种监督式自编码器,根据公司特征预测未来收益。它保留了狭窄的神经网络瓶颈,但去除了相关模型采用的条件因子解释和定价约束。网络将特征直接映射到收益,先通过指定数量的单元压缩输入,再生成预测。 本笔记在滚动前向交叉验证折上拟合指定的收益和收益分类标签。在每个训练检查点生成验证集预测,随后报告信息系数诊断,以比较不同检查点和标签。它将该模型作为具有相同瓶颈的条件自编码器的对照,因此比较可以显示加入因子结构的作用。本笔记不选择模型:后续回测阶段会使用验证集夏普值进行选择。…
这项可行性分析检查能否使用现有面板数据评估基于 US 公司特征的月度多空策略。分析验证指标是否以排名形式编码,描述公司可观测时长,按再平衡日期统计公司数量并与多空两侧所需持仓数比较,将月度价差与假定的交易成本区间进行比较,并检查历史数据是否足以支持多轮滚动验证且不触及留出集。分析没有拟合模型,也没有进行预测。…
本文介绍一类公司收益模型,它们假设少数未观测到的共同因子可以解释大部分横截面差异。这些模型不直接根据特征预测收益,而是根据特征推断各公司的因子敞口,再将这些敞口与估算的因子收益结合起来。核心约束有助于提高统计处理的可行性;但如果少数因子无法充分描述横截面,残差收益可能占主导,直接预测器的表现也可能更好。 这一模型族包括线性和神经网络敞口映射、直接为横截面定价的模型,以及保留瓶颈层并预测收益的监督式自编码器。笔记说明了哪些比较最有信息量,以及为什么当公司标识符无法贯穿整个样本时,普通 PCA…
本笔记介绍将财经标题转化为个股信号的流程。它会清理并规范新闻语料,在股票代码与日期分组内去除完全重复及前缀匹配的重复项,并使用句子嵌入表示标题含义。新闻意外度衡量某日嵌入与近期基准的偏离程度;情绪特征则反映平均情绪极性及分歧程度。笔记还将意外度与情绪方向结合,按股票代码和日期汇总观测,并通过信息系数和收益分组评估信号与未来收益的关系。…
本笔记将先前选定的公司特征预测和固定投资组合配置应用于一年期留出集。它不再对预测、资金分配、集中度、再平衡或交易成本作出新选择,以保留留出集用于样本外评估。投资组合的保形分配器使用验证残差估计预测可靠性;残差过少的公司使用汇总后的备用区间宽度。权重依据投资组合各部分内相对区间宽度的倒数确定,因此分配器侧重可靠性,而非单纯偏向预测收益最高的公司。…
本笔记介绍用于动态 US 股票面板的工具变量主成分分析(IPCA)。传统 PCA 为每只股票分配拟合载荷,无法自然覆盖训练样本中缺失的股票,而且公司特征发生变化时,载荷仍保持固定。IPCA 则估计从可观测特征到因子载荷的共享映射,因此可以为未见过的股票计算载荷,并在特征变化时更新载荷。 本笔记在滚动各折的训练行上拟合模型,并使用相同的面板和因子数量与 PCA…
本笔记汇总了九个案例研究中五种潜在因子估计器的已登记验证结果:PCA、IPCA、CAE、SDF 和 SAE。它首先报告每个面板中哪些估计器有结果,然后使用 HAC 置信区间,找出每个案例研究中平均日度 Spearman 秩信息系数最高的估计器。它还比较了 US Firms 面板上的估计器,并通过按日期配对比较控制共同日期,评估其相对于监督模型的排名表现。 分析发现,没有任何估计器在所有面板中都领先,部分领先估计值的区间跨越零。在 US Firms…
本笔记对 US 股票收益面板应用主成分分析,用较少的因子表示广泛的共同变动。每个因子代表共同变化的一个方向,每只股票的载荷则描述其对该方向的暴露。根据因子和载荷重建的预测只捕捉面板中的共同变动,并有意省略个股特有信息。…
本文档介绍一项滚动研究,利用 TabM 神经网络根据公司特征预测月度收益。由于共享训练运行器将回归目标固定为平方误差、分类目标固定为交叉熵,实验改变模型容量、训练检查点和预测目标,而非损失函数。文档比较三种容量预设,分别用于原始收益、横截面缩尾后的收益和方向类别标签。每个训练折内拟合预处理,并将所有已声明检查点的预测保存在可审计的数据集中。 笔记使用月度信息系数和相关诊断来考察非线性模型捕捉到的内容,但不选择优胜模型。模型选择留待验证集回测夏普比率阶段,因为预测排名本身不能证明扣除成本后能够盈利。报告的 IC…
本笔记从模型系列角度考察五种潜在因子方法在股票期权分析案例中的应用。PCA 直接从收益面板估计共同变动;IPCA 以线性方式将特征映射到暴露;条件自编码器则使用非线性映射。随机贴现因子模型改为估计定价核,而有监督自编码器在条件模型的训练目标中加入未来收益。笔记读取配套笔记发布的模型集合,并检查是否涵盖声明的模型菜单。…
本笔记介绍将工具变量主成分分析作为横截面收益模型。它不直接为各公司的特征分配收益权重,而是由 IPCA 估计特征到因子暴露的共享线性映射,同时估计月度因子收益。笔记使用交替最小二乘法和岭惩罚联合拟合映射与收益,然后将训练集估计值应用于验证期特征以预测收益。…
这本笔记介绍工具变量主成分分析,它根据可观察的股票特征决定潜在因子载荷,而不是为每只股票指定固定载荷。根据特征到因子敞口的共享映射,可以为训练面板中未出现的股票生成载荷,也可以在股票特征变化时调整载荷。该方法与普通 PCA 并列介绍,比较时计划固定因子数量、面板和滚动折。…
这本笔记介绍一种用于股票因子建模的监督自编码器。无监督自编码器通过重建横截面来学习瓶颈表示,而该模型还将未来收益纳入训练目标。因此,目标变量不仅影响预测结果,也会塑造学到的表示。由于不同的未来收益标签会直接进入损失函数,因此会产生不同的拟合模型。…
这本笔记将神经随机贴现因子模型应用于 CME 期货。在资产定价中,随机贴现因子是一个随机变量;在无套利条件下,它与每项资产收益率的乘积具有相同的期望值。模型利用各产品收益率以及可观察特征(如展期收益、动量和波动率)来估计这一潜在对象。与所述仅使用收益率的 PCA 对比不同,SDF 可以让特征影响其横截面工具权重。…
本笔记汇总九个资产类别中多个案例研究的工程化金融特征。它统计各可用特征面板中的特征数量和按名称划分的特征系列,比较特征空间规模,并汇总各案例研究模型登记库中记录的最强信息系数。动量、波动率和收益等重复前缀可用于比较不同市场;而专用指标和不一致的命名方式意味着,按系列统计的数量只能粗略参考。…
本案例研究评估根据 US 公司特征构建的月度多空十分位策略,在时点会计数据滞后、滚动验证和随时期变化的交易成本条件下,比较线性模型、梯度提升和潜在因子方法。报告的验证模型谱系中表现最强的一支使用梯度提升模型预测经过缩尾处理的远期收益;文中还将有监督自编码器描述为可信的独立信号。研究报告各验证折均取得正表现,而在登记结果中,其他投资组合配置方法并未优于等权。…
本笔记对 US 股票中流动性较好的子集进行主成分分析,以提取潜在因子并构建多空特征向量投资组合。文中说明如何将标准化的 PCA 向量转换为原始收益权重,并按总敞口进行归一化;随后考察方差解释度、行业关联、层次 PCA、残差行为和投资组合风险分解。行业 ETF 相关性为原本没有名称的成分提供描述性标签。 分析还区分了特征向量符号的任意变化与因子子空间的真实变化,并展示了如何对滚动估计进行 Procrustes…