本笔记本梳理一系列ETF收益模型,它们在面板数据中推断共同的潜在方向,并用特征估计基金的风险暴露。文中区分五种方法:无条件主成分;使用线性特征到风险暴露映射的工具变量PCA;使用网络映射的条件自编码器;直接对横截面定价的随机贴现因子模型;以及通过瓶颈预测收益、但不保留因子解释的监督式自编码器。第一种方法作为非条件基线,其余方法则体现不同的建模假设。…
知识库
这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。
搜索知识库
671 份文档
本笔记本说明为何在多个信号或策略中进行搜索,会使观察到的最佳结果看起来比其实际预测能力更强。模拟使用没有真实信息的因子,展示选择最大信息系数如何偶然产生表面上吸引人的结果。随后,文档介绍因子检验的校正流程:计算经HAC调整的p值,应用Benjamini-Hochberg错误发现率控制;若重点是控制任何错误拒绝的概率,则考虑使用Holm-Bonferroni方法。…
本笔记本介绍如何将已发布且经过横截面排名的US公司特征面板转换为因子研究所用的带键特征矩阵。它将输入归入已声明的类别,在不拟合转换的情况下组合特征及其交互项,并将实际收益排除在特征产物之外。笔记本从源数据的固定公司轴重建持久公司身份,再与单独的标签面板核对,以防使用不断变化的横截面位置合并行。…
这项US股票特征研究介绍如何从估计模型生成特征,同时避免将未来数据带入更早的观测值。估计安排先进行历史预热,只使用每个输出区块之前的数据拟合参数,然后在下一个区块前更新估计。这一点至关重要,因为若只在完整样本上拟合一次模型,未来信息就会进入后续评估所用的特征。该安排与交叉验证折叠相互独立;折叠用于选择评分行,但不会约束特征估计。…
本笔记本将TSMixer用于ETF序列,并在各基金之间共享一个全局函数。每个样本包含单只基金的历史和协变量;模型在面板数据中学习时间交互和特征交互,但不会将一只基金的观测值直接混入另一只基金的预测。模型在滚动前向验证数据上与线性模型和梯度提升基线进行比较。…
本笔记本介绍一种随机贴现因子(SDF)模型,用于为US公司收益横截面定价。它不先估计因子再加以应用,而是在无套利条件下直接学习公司月份权重:贴现后的收益预期值应为零。训练分为无条件阶段、纳入公司特征和市场状况的条件阶段,以及寻找当前SDF定价效果较差测试资产的对抗矩网络。…
本笔记本分析重建的NASDAQ限价订单簿,描述日内价差和最优档深度,并考察订单流失衡是否与随后时间桶的收益相关。它以基点表示价差,以便比较价格水平不同的股票,并绘制价差及显示流动性在交易时段内的变化。它还根据订单新增和撤单构建失衡指标,将订单流汇总到时间桶中,再比较单只股票和横截面的指标与后续收益之间的相关性。除原始订单流外,还使用带符号的对数变换,以减小极端值的影响。…
本笔记本查询九个案例研究的回测注册表,并汇总成可供后续分析的可比表格。它按资产类别和数据频率整理结果,记录信号、配置、成本和风险阶段的表现,以及模型系列信息和验证集至留出集的结果。其选择流程比较完整的策略规格——信号、配置方法和风险覆盖规则——并将选定配置用于重新训练后的留出集运行;若该候选项无法产生可用的留出集回测,则改用另一项符合资格且按验证排名的候选项。…
本笔记本评估四种源自新闻的信号——加权意外值、平均情绪、情绪变化和文章覆盖度——与股票未来收益的关系。它计算每日横截面斯皮尔曼信息系数,汇总其均值、变异性、信息比率和t统计量,然后比较按信号排名的五分位组收益及其多空价差。每个日期计算一个系数,使日期成为分析单位,而不是将所有资产与日期的观测合并。笔记本还检查重复的信号值是否会影响分组比较。…
本文介绍如何为NASDAQ的100分钟级微观结构特征拟合时序卷积网络。因果卷积可防止预测使用之后的观测值,而扩张卷积使连续层能够捕捉多个时间尺度的模式。模型使用观测值的尾随窗口预测未来收益,并为多个期限分别设置标签。由于相邻分钟窗口高度重叠,训练过程按各标签期限间隔抽取样本,使其收益区间互不重叠。窗口保持在单只股票内;特征缩放参数在训练数据上拟合后,再应用于验证数据。…
本分析比较多个模型类别对下月收益的预测,这些模型以每月 US 股票特征进行训练。分析重点是截面信息系数,它衡量模型在每个月对股票排序的能力。工作流程从运行登记系统读取验证结果和代表性预测,使用置信区间和各折表现比较不同类别,并考察信号在不同验证窗口中是否依然可信。分析还将预测性预测与潜在因子结构拟合、因果处理效应估计区分开来;虽然报告的统计量相关,但它们回答的问题不同。…
本案例研究对持有至到期的平值短跨式期权收益拟合正则化线性模型。该交易收取看涨期权和看跌期权权利金,因此最大收益有上限,但标的大幅波动时可能出现非常大的亏损。特征描述期权头寸和波动率环境,包括希腊字母、隐含与已实现波动率、方差风险溢价、价差和行权价距离。模型配置在滚动验证折中测试岭回归、套索回归和 ElasticNet 的惩罚强度。…
本文档介绍实验登记系统如何跟踪模型从训练配置、预测到回测结果的全过程。每个阶段都会根据规范化后的规格生成标识符,使重复的相同运行对应同一条记录,而配置变更则生成不同标识。通过连接登记表,可以重建可搜索目录,其中包括验证信息系数和基准回测指标。文中区分预测排序与策略选择:信息系数描述预测对结果排序的能力,而策略选择使用验证回测夏普比率,并考虑换手和成本等交易影响。 随后,文中追踪目录条目对应的清单和产物文件,并将本地登记系统的查询与由选定运行填充的 MLflow…
本笔记比较用于发现一组 ETF 收益序列之间关系的方法:NOTEARS 用于分析同期线性有向无环图,VAR-LiNGAM 用于分析滞后和即时结构,PCMCI 用于发现条件独立关系,Granger 检验则作为两两预测筛查方法。NOTEARS 通过结合稀疏回归目标与可微的无环约束,使图学习过程连续化。其他方法基于不同假设,针对不同类型的关系,因此其输出不能互换。…
本笔记展示如何使用 Optuna 的 TPE 采样器调整 LightGBM 超参数,以截面信息系数为优化目标。它结合早停来选择提升轮数,并使用自定义剪枝回调检查中间验证 IC。搜索范围涵盖树的复杂度、学习率、采样和正则化,并特别关注低信噪比环境下的正则化。 工作流程比较单个验证折和平均滚动评估,并将已声明的测试留出集排除在搜索之外,同时针对未来收益标签期限设置隔离期。讨论指出,单折搜索可能偏好近乎平坦的模型,有些折会产生未定义的…
本笔记研究当加密货币永续合约特征矩阵以多种方式衡量同一经济量——溢价时,岭回归、套索回归和弹性网络的表现。输入特征以溢价水平、变化、波动率、标准化位置、排名及相关资金费指标为主,描述其他情况的特征较少。岭回归会收缩相关系数但保留特征集;套索回归可以将系数置零,并在近似重复特征中进行选择;弹性网络结合了两者的作用。套索惩罚按各折中可使所有系数归零的阈值进行缩放,从而使不同配置在各折中形成可比较的惩罚路径。…
本笔记汇集五种潜在因子方法,用于建模标普 500 期权案例研究中的股票收益截面。PCA 仅根据收益估计共同变动;IPCA 线性地将特征映射为暴露;条件自编码器采用非线性映射;随机贴现因子通过截面定价拟合;监督自编码器则将未来收益加入条件模型的目标函数。本笔记检查五项相关研究是否共同发布了训练菜单中声明的所有模型,然后读取已登记的验证预测,并按标签比较峰值信息系数。 该比较用于描述,而非模型选择。IC…
本笔记展示拉德马赫反血清协议如何校正从一组已测试策略中选出胜者所带来的影响。它根据候选策略的表现路径估计经验复杂度,并说明候选策略间的相关性如何改变校正结果。该协议从观测结果中减去复杂度惩罚和估计误差,得出较低的表现界限。本笔记将其与膨胀夏普比率进行比较;后者在不同假设下估计经过选择偏差调整的概率。…
本笔记汇总九个市场案例研究的结果,构建逐步累积的策略筛选漏斗。它依次检验模型的信息系数是否为正、选定配置的验证夏普比率是否为正、表现是否经受住适用的交易成本机制、留出集夏普比率是否为正,以及风险和不确定性证据是否足以支持采取行动。若某一阶段不适用于某案例研究,则标为不适用,而非失败。 另设排除分类体系,用以区分信号问题、实施不可行和证据质量不足。本笔记呈现淘汰数量和各案例结果,并将每项判断关联到流程数据。讨论强调,仅凭预测指标并不足够:成本取决于交易工具,报告中醒目的夏普比率必须结合风险控制和留出集证据来解读。…
本笔记评估总锁仓价值是否可作为以太币收益的另类数据信号。TVL 汇总存入去中心化金融协议的加密资产美元价值。由于它是按价格计值的存量,而非流入资金的直接衡量指标,即使存款不变,资产价格变动也可能改变其数值。因此,分析考察 TVL 增长和标准化水平,并将链上构成与全市场总量进行比较。 分析通过考察信号值与未来收益的关系来检验所提出的关联。由于多日收益的每日观测共享大部分相同期间,本笔记使用 Newey–West…
本笔记介绍一种监督自编码器,用于预测未来多个期限的 US 股票收益方向。编码器连接重构解码器、辅助分类器和主分类器。联合训练将重构误差与二元分类损失结合起来,使预测任务影响瓶颈表示。工作流程构建按日期排序的价格和成交量特征,在确切的未来市场日期标记收益,并使用扩展式验证折,清除期与最长标签期限相匹配。另设隔离期保护最终测试期,并在该留出集上仅评估一次选定检查点。 本笔记报告了按期限划分的测试…
本笔记比较 pandas 和 Polars 在金融数据流程常用操作中的表现,包括滚动计算、分组 OHLCV 汇总、窗口统计、筛选、连接、惰性文件扫描、内存使用和字符串处理。它会按可配置规模生成合成价格和逐笔数据,报告库版本及选定运行时特性,并对成对实现进行计时。 为使比较有意义,每对实现都会检查行数和数值摘要是否匹配,之后才接受其计时结果。笔记的建议取决于具体情形:pandas 在较小的数据面板上仍可能具有竞争力,而随着数据量和操作复杂度增长,Polars…
本笔记介绍外汇货币对模型的 TabM 工作流。TabM 对每个决策行应用一个小型神经网络,而不是将观测作为序列处理。笔记从配置中读取架构和检查点计划,在拟合前规划预期的训练与预测标识,并运行每项已声明的模型请求。预处理在训练折内拟合,每个轮次检查点都会保留一套完整的验证预测。…
本笔记为跨资产 ETF 动量假设构建金融特征矩阵:相对表现较强的资产可能在接下来的一个月继续跑赢。矩阵结合多个期限的滚动收益、风险调整收益、波动率、回撤、趋势指标、跨资产相关性和收益率曲线背景。部分特征还表示为逐日百分位数,使其相对排名能在不同市场环境下进行比较。…