本笔记本梳理一系列ETF收益模型,它们在面板数据中推断共同的潜在方向,并用特征估计基金的风险暴露。文中区分五种方法:无条件主成分;使用线性特征到风险暴露映射的工具变量PCA;使用网络映射的条件自编码器;直接对横截面定价的随机贴现因子模型;以及通过瓶颈预测收益、但不保留因子解释的监督式自编码器。第一种方法作为非条件基线,其余方法则体现不同的建模假设。…
知识库
这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。
搜索知识库
857 份文档
本笔记本介绍如何为预测智能体设计搜索工具,使证据具有一致的结构、可追溯的来源,以及可审计的进入模型路径。共享客户端协议会返回类型化结果,并包含截止日期。排除日期在截止日当天或之后的结果;未标日期的页面会单独记录,因为过滤器无法确定其何时可用。确定性模拟工具支持可重复的离线示例,笔记本也介绍实时搜索。…
本笔记本说明为何在多个信号或策略中进行搜索,会使观察到的最佳结果看起来比其实际预测能力更强。模拟使用没有真实信息的因子,展示选择最大信息系数如何偶然产生表面上吸引人的结果。随后,文档介绍因子检验的校正流程:计算经HAC调整的p值,应用Benjamini-Hochberg错误发现率控制;若重点是控制任何错误拒绝的概率,则考虑使用Holm-Bonferroni方法。…
本文介绍交易研究流程如何评估潜在因子模型拟合是否以可用状态完成。对于通过梯度下降训练的模型,流程会检查最后记录的训练目标是否为有限值;对于随机贴现因子模型,还要求终端夏普比率为有限值。最后两次观测之间的目标值变化会作为诊断信息记录,但不会决定是否成功,因为最后一步较大可能源于训练安排,而非拟合失败。…
本笔记本将TSMixer用于ETF序列,并在各基金之间共享一个全局函数。每个样本包含单只基金的历史和协变量;模型在面板数据中学习时间交互和特征交互,但不会将一只基金的观测值直接混入另一只基金的预测。模型在滚动前向验证数据上与线性模型和梯度提升基线进行比较。…
本笔记本介绍一种随机贴现因子(SDF)模型,用于为US公司收益横截面定价。它不先估计因子再加以应用,而是在无套利条件下直接学习公司月份权重:贴现后的收益预期值应为零。训练分为无条件阶段、纳入公司特征和市场状况的条件阶段,以及寻找当前SDF定价效果较差测试资产的对抗矩网络。…
本笔记本介绍离线机器学习流程与QuantConnect的LEAN交易引擎之间的部署桥梁。它从注册表中可重复地选定一次模型运行,将其留出集预测导出为按日期索引的JSON,再使用一个小型平台算法应用投资组合规则,无需执行推理。来源溯源检查将导出文件与选定的训练配置和预测文件关联起来。由于评分已固定,可以通过回测探索阈值、持仓限额和再平衡规则,而无需重新训练模型。…
本文介绍如何为NASDAQ的100分钟级微观结构特征拟合时序卷积网络。因果卷积可防止预测使用之后的观测值,而扩张卷积使连续层能够捕捉多个时间尺度的模式。模型使用观测值的尾随窗口预测未来收益,并为多个期限分别设置标签。由于相邻分钟窗口高度重叠,训练过程按各标签期限间隔抽取样本,使其收益区间互不重叠。窗口保持在单只股票内;特征缩放参数在训练数据上拟合后,再应用于验证数据。…
本分析比较多个模型类别对下月收益的预测,这些模型以每月 US 股票特征进行训练。分析重点是截面信息系数,它衡量模型在每个月对股票排序的能力。工作流程从运行登记系统读取验证结果和代表性预测,使用置信区间和各折表现比较不同类别,并考察信号在不同验证窗口中是否依然可信。分析还将预测性预测与潜在因子结构拟合、因果处理效应估计区分开来;虽然报告的统计量相关,但它们回答的问题不同。…
本案例研究对持有至到期的平值短跨式期权收益拟合正则化线性模型。该交易收取看涨期权和看跌期权权利金,因此最大收益有上限,但标的大幅波动时可能出现非常大的亏损。特征描述期权头寸和波动率环境,包括希腊字母、隐含与已实现波动率、方差风险溢价、价差和行权价距离。模型配置在滚动验证折中测试岭回归、套索回归和 ElasticNet 的惩罚强度。…
本文档介绍实验登记系统如何跟踪模型从训练配置、预测到回测结果的全过程。每个阶段都会根据规范化后的规格生成标识符,使重复的相同运行对应同一条记录,而配置变更则生成不同标识。通过连接登记表,可以重建可搜索目录,其中包括验证信息系数和基准回测指标。文中区分预测排序与策略选择:信息系数描述预测对结果排序的能力,而策略选择使用验证回测夏普比率,并考虑换手和成本等交易影响。 随后,文中追踪目录条目对应的清单和产物文件,并将本地登记系统的查询与由选定运行填充的 MLflow…
本笔记比较用于发现一组 ETF 收益序列之间关系的方法:NOTEARS 用于分析同期线性有向无环图,VAR-LiNGAM 用于分析滞后和即时结构,PCMCI 用于发现条件独立关系,Granger 检验则作为两两预测筛查方法。NOTEARS 通过结合稀疏回归目标与可微的无环约束,使图学习过程连续化。其他方法基于不同假设,针对不同类型的关系,因此其输出不能互换。…
本笔记展示如何使用 Optuna 的 TPE 采样器调整 LightGBM 超参数,以截面信息系数为优化目标。它结合早停来选择提升轮数,并使用自定义剪枝回调检查中间验证 IC。搜索范围涵盖树的复杂度、学习率、采样和正则化,并特别关注低信噪比环境下的正则化。 工作流程比较单个验证折和平均滚动评估,并将已声明的测试留出集排除在搜索之外,同时针对未来收益标签期限设置隔离期。讨论指出,单折搜索可能偏好近乎平坦的模型,有些折会产生未定义的…
本章将投资组合构建介绍为把收益预测、风险估计和约束条件转化为权重、杠杆及再平衡决策的过程。章节提出一套研究流程,用于记录配置器选择、避免信息泄漏,并将预测与仓位规模确定分开。评估除常规风险和收益指标外,还应包括相对基准表现、集中度、多元化、风险贡献和实施稳定性。 本章将等权和波动率倒数等简单基准与凯利仓位、均值方差优化、收缩、风险平价、层次风险平价及深度学习方法进行比较。核心实践启示是,应使用相同输入和回测流程,将复杂配置器与公平基准比较,同时考虑其额外的估计选择。本章概述介绍了使用 ETF…
本笔记研究当加密货币永续合约特征矩阵以多种方式衡量同一经济量——溢价时,岭回归、套索回归和弹性网络的表现。输入特征以溢价水平、变化、波动率、标准化位置、排名及相关资金费指标为主,描述其他情况的特征较少。岭回归会收缩相关系数但保留特征集;套索回归可以将系数置零,并在近似重复特征中进行选择;弹性网络结合了两者的作用。套索惩罚按各折中可使所有系数归零的阈值进行缩放,从而使不同配置在各折中形成可比较的惩罚路径。…
本笔记汇集五种潜在因子方法,用于建模标普 500 期权案例研究中的股票收益截面。PCA 仅根据收益估计共同变动;IPCA 线性地将特征映射为暴露;条件自编码器采用非线性映射;随机贴现因子通过截面定价拟合;监督自编码器则将未来收益加入条件模型的目标函数。本笔记检查五项相关研究是否共同发布了训练菜单中声明的所有模型,然后读取已登记的验证预测,并按标签比较峰值信息系数。 该比较用于描述,而非模型选择。IC…
本笔记为小时级加密货币永续合约开发双模型离场策略。入场分类器识别异常强劲的未来收益,离场分类器则预测下一段未来收益是否为负。离场模型将入场模型的概率作为额外特征,其训练值通过扩展窗口折外预测生成,因此每个值都来自未用该观测训练的模型。为限制信息泄漏,采用按时间顺序划分,并在标签期限边界进行清除。 比较将分类 AUC…
本笔记介绍一种监督自编码器,用于预测未来多个期限的 US 股票收益方向。编码器连接重构解码器、辅助分类器和主分类器。联合训练将重构误差与二元分类损失结合起来,使预测任务影响瓶颈表示。工作流程构建按日期排序的价格和成交量特征,在确切的未来市场日期标记收益,并使用扩展式验证折,清除期与最长标签期限相匹配。另设隔离期保护最终测试期,并在该留出集上仅评估一次选定检查点。 本笔记报告了按期限划分的测试…
本笔记构建一个投资组合配置器,在 LSTM 编码器之前加入类似 Temporal Fusion Transformer 的变量选择网络。选择网络分别嵌入每项输入特征并分配 softmax 权重,使模型能够随资产和时间变化调整所侧重的信号。LSTM 处理选定的表示,生成有界标量信号;投资组合层再将信号转换为目标波动率的多空权重。…
本笔记介绍外汇货币对模型的 TabM 工作流。TabM 对每个决策行应用一个小型神经网络,而不是将观测作为序列处理。笔记从配置中读取架构和检查点计划,在拟合前规划预期的训练与预测标识,并运行每项已声明的模型请求。预处理在训练折内拟合,每个轮次检查点都会保留一套完整的验证预测。…
本文盘点九个案例研究中的跨市场模型特征产物。它读取 parquet 架构而不加载数据行,排除标识符列,统计特征列,并根据与 GARCH、隐马尔可夫状态、市场状态指标、卡尔曼滤波器、ARIMA 和分数差分等方法相关的词元对名称分组。列名样本有助于读者检查未匹配字段并理解词元计数。…
本文通过在每周五对日频数据采样,重新构建五个交易日股票收益预测问题。标签仍是五个交易日收益,但在周频网格上约等于一个模型步长。笔记比较直接回归与 N-BEATS 预测模型:前者使用固定回看窗口预测一个收益,后者配置为预测下一个周频数值。两者使用相同的周频观测和预测期限;本文也介绍了在有已登记结果时与日频模型系列的比较。…
本文介绍如何在所有符合条件的 -2021 之前历史数据上重新拟合早期验证阶段选出的配置,然后为 2021 留出集生成预测。训练区间根据声明的评估窗口、标签缓冲区、验证折和特征覆盖范围推导。若存在冻结的候选集,就从中读取选定配置,因此留出集用于评估一个沿用的配置,而非给备选配置排序。…
本笔记使用股票期权分析数据评估梯度提升树,其中隐含波动率、偏斜、期限结构和方差风险溢价等特征体现了市场预期。它探讨非线性模型能否有条件地组合这些预测,例如根据期限结构的不同而对偏斜作不同解读,以及这种方式能否改善相对于线性模型的横截面排序。网格调整树容量和回归损失,并记录多个提升检查点的预测。模型系列比较采用匹配的目标和滚动折,包括原始未来收益、风险调整收益和收益方向。…