跳至正文

知识库

这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。

搜索知识库

205 份文档

《交易机器学习》

此笔记本使用TreeSHAP解释LightGBM收益预测,包括全局特征重要性、单项预测解释、依赖图和成对交互值。它将SHAP排序与置换重要性和基于树的不纯度重要性进行比较,以展示特征排序在哪些方面一致,或依赖于测量方法。工作流还跟踪前向滚动折中的平均绝对SHAP值,作为特征漂移指标,并探索基于SHAP排序的特征子集重新训练。…

股票机器学习统计学因子投资
《交易机器学习》

此笔记本将财经标题转化为个股信号,并根据未来收益进行评估。它对标题进行嵌入,以语义距离衡量新闻相对于滚动嵌入基线的意外程度,并将意外程度与情绪方向结合,区分异常利好和异常利空新闻。它还计算平均情绪、分歧、情绪动量和文章覆盖度。标题按股票代码和日期去重,股票代码与日期经过标准化,并对信号进行滞后处理,避免过早使用发布当日的信息。…

股票因子投资市场情绪机器学习
《交易机器学习》

本实现介绍了一种神经随机贴现因子模型和一个用于检验资产定价关系的对抗矩网络。SDF网络将资产特征(可选择与来自LSTM的宏观经济状态表征相结合)映射为资产权重。这些权重与收益共同构成时点层面的贴现因子。启用宏观输入时,LSTM状态会在每个时间步由所有资产共享;否则,模型仅使用资产特征。…

机器学习因子投资统计学投资组合构建
《交易机器学习》

本笔记本介绍了一种条件自编码器,在保留工具变量潜在因子模型结构的同时,用神经网络取代公司特征到因子暴露的线性映射。月度收益表示为特征驱动的暴露乘以月度因子收益。该方法保留两阶段因子结构,同时允许公司属性与因子暴露之间存在非线性关系。…

股票机器学习因子投资统计学
《交易机器学习》

本章综述从收益和特征面板中提取共同结构的方法,包括从 PCA 和特征投资组合到 IPCA、风险溢价 PCA、条件自编码器、随机贴现因子估计和监督式自编码器。核心区别在于:有些因子解释收益协方差,有些因子则有助于给收益定价或预测收益。这些方法估计因子和载荷的方式各不相同;有些方法绕过共同的重建与预测框架,直接估计定价或预测结果。…

因子投资机器学习统计学投资组合构建
《交易机器学习》

本笔记本介绍用于 ETF 研究的特征筛选流程,旨在从大量候选变换和回看期中筛出较小集合,供后续建模使用。它计算特征与未来收益之间的横截面 Spearman 信息系数,对各日期的关系取平均,而非汇总所有观测。Newey-West 调整统计量考虑每日 IC 序列的序列相关性;Benjamini-Hochberg 假发现控制则用于处理筛选大量特征涉及的多重检验。 该流程还会剔除高度相关的候选项、聚类近似重复项、按最低预测强度筛选,并使用自助法重采样评估 IC 符号是否稳定。它将基于 IC 的排名与 LightGBM…

机器学习统计学因子投资回测
《交易机器学习》

本笔记介绍工具变量主成分分析(IPCA),该方法将每只 ETF 的因子暴露建模为该基金观测特征的共享线性函数。交替最小二乘法根据基金与日期的观测值,同时估算特征到暴露的映射和因子收益。与按日期分别拟合特征系数相比,该方法限制了自由参数数量,同时要求横截面足够广,以识别所需因子。笔记还介绍岭惩罚、收敛设置、滚动前向折,以及为何不能发布未收敛拟合的预测。…

股票因子投资机器学习统计学
《交易机器学习》

本笔记对股票收益面板拟合 PCA 潜在因子模型,不使用期权曲面特征、公司特征或目标信息。PCA提取历史横截面共同变动的主要方向,估算各股票的暴露,并根据训练窗口内的因子均值进行预测。该模型有意作为无条件对照,用于比较将期权特征映射为暴露或以其他方式依赖期权特征的模型。…

股票期权机器学习统计学
《交易机器学习》

本概述介绍一类利用公司特征预测收益的模型。这些模型不将每个特征视为直接收益预测因子,而是假设收益由少量不可观测的共同因子驱动,并估计每家公司对这些因子的暴露。这个低维假设可能使大规模面板数据上的估计更易处理,但也可能不成立;如果因子未能捕捉收益结构,直接预测因子可能表现更好。 本文区分四种方法:工具变量 PCA…

股票因子投资机器学习统计学
《交易机器学习》

本文介绍一种条件自编码器,将公司对潜在收益因子的暴露建模为公司特征的非线性函数。与 IPCA 类似,它估计因子结构,其中预测收益由公司特定暴露与因子收益共同构成;主要变化是用神经网络取代 IPCA 从特征到暴露的线性映射。因此,在大体保持设置不变的情况下,可以借此考察函数形式的影响。模型按设定的轮数训练,每个已保存的检查点都会生成单独的验证预测集。笔记本会规划并登记所有检查点,而不是选择验证 IC 最高的那个。它评估滚动验证折上的月均排名相关性,并将检查点表现与线性 IPCA…

机器学习因子投资股票统计学
《交易机器学习》

本章概述介绍梯度提升树如何在决策树和随机森林的基础上,用于金融表格数据预测。提升法依次添加学习器以修正先前误差,有助于捕捉线性模型可能遗漏的非线性关系和阈值效应。章节比较 XGBoost、LightGBM 和 CatBoost,并介绍预测目标、排序、单调约束和部署权衡等选择。 章节还介绍使用 Optuna 进行适用于时间序列的超参数调优,包括剪枝和多目标搜索,并使用 TreeSHAP…

机器学习股票统计学回测
《交易机器学习》

本文介绍一个按月构建的 US 股票数据集,专为资产定价机器学习研究设计。数据集包含 94 个经过横截面排名变换的公司特征,包括会计指标和技术特征,以及收益数据。公司身份经过匿名化处理,数据也包含已退市公司。数据集划分为训练期和测试期,中间设置了间隔,以减少评估中的前视偏差问题。 本文说明,已发布的特征张量在每个数据块中保留匿名公司身份,而收益—特征 CSV 文件缺少加载器所需的身份结构。文中概述了受支持的下载和转换流程、如何加载完整数据集或预定义的数据划分,以及如何检查覆盖范围和数据概况。该数据集是静态的,止于…

股票机器学习因子投资美国市场
《交易机器学习》

该笔记介绍一个已发布的面板数据集,用于US股票机器学习研究。数据包含数十年间的月度观测值,其中包括46个公司特征和次月超额收益。特征按经济含义分组,并在每个月内进行秩归一化,使其处于共同的有界尺度。笔记介绍如何检查覆盖范围、按日期排序的训练集、验证集和测试集划分,以及仅在各自数据划分内有意义的匿名公司标识符。为分析信号,笔记计算各特征与后续收益之间的月度截面信息系数,并对训练数据求平均;显著性估计则使用 Newey-West…

股票因子投资统计学机器学习
《交易机器学习》

该笔记使用CAPM和 Fama-French 因子回归分析股票 ETF 投资组合,并进一步考察滚动敞口、收益归因和残差依赖。它使用对齐的日度收益和因子数据,通过异方差与自相关稳健标准误估计回归不确定性,并在进行收益归因时延后滚动贝塔,以避免前视。模型比较显示,加入风格因子可能改变估计的阿尔法。笔记还考察因子控制后资产是否仍然相关,并使用 Ledoit-Wolf 收缩法稳定因子协方差估计。…

股票因子投资投资组合构建统计学
《交易机器学习》

该笔记介绍了一种随机贴现因子(SDF)模型,用于对US公司收益的截面进行定价。模型学习权重,使贴现后的资产收益满足无套利矩条件,而非优化收益预测损失。训练依次经过无条件阶段、权重取决于公司特征和市场状态的条件阶段,以及一个对抗矩网络;后者会寻找当前SDF定价效果不佳的测试资产。隐含收益是定价拟合的副产品。…

股票因子投资机器学习统计学
《交易机器学习》

该笔记以匿名公司特征预测股票收益,对比随机森林装袋法与 XGBoost、LightGBM 和 CatBoost。研究使用预先设定的时间序列训练、验证和测试划分,以 Spearman 秩信息系数为主要指标,并补充报告 R 平方和均方误差。比较还考察不同库中的特征重要性,并在 XGBoost 中使用验证数据进行早停。…

机器学习股票统计学因子投资
《交易机器学习》

本笔记说明如何基于 US 股票的 SEC XBRL 数据构建并检查季度基本面面板,同时保留每项事实所描述的期间及其公开日期。要进行历史上有效的回测,数值可用的时间取决于申报或公告日期;选择最新可用季度时,则应按财季结束日期排序。仅按期间结束日期筛选,可能会纳入尚未申报的信息,从而造成前视偏差。…

股票因子投资回测美国市场
《交易机器学习》

本笔记对行业 ETF收益进行基于相关性的主成分分析,以描述共同风险因子和行业轮动。标准化收益后,每个行业的方差均为一,从而降低波动性更高的行业主导主成分的可能性。方差占比和碎石图有助于评估收益变化的集中程度,载荷则显示不同行业如何组合成市场整体方向以及防御型与周期型方向。 移动区块自助法会重采样连续时段,以保留短期依赖关系并估计载荷的不确定性。在不同重采样结果间匹配成分并对齐符号,因为 PCA 符号具有任意性且成分顺序可能变化。滚动 PCA…

股票因子投资统计学投资组合构建
《交易机器学习》

本笔记介绍一种用于预测 CME 期货收益的主成分基线模型。PCA 在训练折的品种收益面板上拟合,因此其成分代表合约之间的共同变动方向,而非压缩后的展期收益、动量或波动率特征。每个折次拟合的变换都会原样用于验证数据,避免评分收益影响主成分。 预测会将收益投影到预先声明数量的成分上,并使用扩展窗口均值延续因子收益。成分数量固定,不会单独根据验证集表现调优;保存拟合状态和运行身份标识有助于复现。笔记强调,成分按解释方差排序并不意味着具有预测价值,且该分解没有纳入行业划分。笔记将 PCA…

期货因子投资统计学回测
《交易机器学习》

本笔记介绍一种监督式自编码器,将 ETF 特征行压缩为低维表示,并直接根据该表示预测远期收益。与条件自编码器不同,它不假设收益来自少量共同因子变动。编码器同时通过重构目标和收益预测目标进行训练,因此不同预测期限会产生分别拟合的模型。…

多资产机器学习因子投资统计学
《交易机器学习》

本笔记将岭回归、Lasso 和弹性网模型应用于一组广泛且成熟的 US 股票特征,包括价值、盈利能力、投资、动量、规模、风险和流动性指标。分析使用滚动折评估原始月度收益、经横截面缩尾处理的收益目标以及收益分类标签。惩罚系数网格用于检验,在输入特征存在大量冗余时,系数收缩或特征筛选如何影响排名准确度。…

股票因子投资动量机器学习
《交易机器学习》

本分析对行业交易所交易基金的收益进行基于相关系数的主成分分析。分解前将收益标准化,使每个行业的方差均为一,因此领先主成分描述共同变动,而不会被波动率最高的行业主导。笔记考察方差解释比例、碎石图和载荷;其中第一主成分被解读为广泛的市场走势,另一个主成分则可能反映防御型与周期型之间的轮动维度。 移动区块自助法在保留短期依赖性的同时估计载荷置信区间;由于 PCA…

股票因子投资统计学投资组合构建
《交易机器学习》

本文介绍一种监督式自编码器,作为条件潜在因子模型的对照模型。它将公司特征直接映射为远期收益,同时通过狭窄瓶颈压缩 57 个输入。将其与使用相同瓶颈的条件自编码器进行比较,旨在检验因子结构是否能在降维之外带来额外价值。目标变量包括原始收益、按月缩尾处理的收益和收益类别,因此改变目标变量也会改变网络所学习的内容。…

股票机器学习因子投资统计学
《交易机器学习》

本指南介绍 Ken French 数据库和 AQR 的公开因子收益数据集,包括市场、规模、价值、盈利能力、投资、动量、质量和低贝塔因子。指南说明如何下载和载入月度或日度观测值、按日期筛选、查看数据概况,以及根据月度收益计算年化均值、波动率和夏普比率。这些序列可用于因子投资研究、风险归因,以及将策略收益与既定风险敞口进行基准比较。 本文说明了由数据提供方定义的因子覆盖范围,并指出这些来源无需 API 密钥。文中没有给出因子的实证结果或提供方之间的比较,也没有评估任何因子是否能持续获得溢价。AQR…

因子投资统计学风险管理