此笔记本使用月度公司特征研究适用于表格数据的神经网络设计TabM。它比较三个预设配置:逐步增加隐藏层宽度和集成成员数量,同时保持其他训练设置不变。共享运行器固定了学习目标:收益目标使用平方误差,分类目标使用交叉熵。因此,笔记本考察模型容量、训练检查点和目标构造,而非比较损失函数。…
知识库
这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。
搜索知识库
857 份文档
本章概述机器学习交易系统部署后的治理。它区分技术故障和统计衰减:前者指相同输入产生不同输出,后者指输出不再能预测收益。其框架结合了通过滚动表现指标和漂移诊断进行检测、通过影子评估和设门槛的分阶段发布进行受控响应,以及通过断路器保障自动安全。本章还讨论特征存储、数据血缘、模型注册表、实验跟踪和CI/CD等基础设施,说明如何根据团队的运维成熟度扩展系统。…
此索引介绍潜在因子,即从股票收益共同变动中提取的共享模式;每只股票的因子载荷表示其对某种模式的暴露。它对比主成分分析与工具变量主成分分析:前者仅根据收益估计因子和股票载荷,后者将载荷建模为可观测股票特征的函数。根据特征进行条件化有助于纳入新股票和不断变化的公司属性,但也假设特征与载荷之间的关系在股票和时间维度上保持稳定。…
此分析说明如何解读CME期货预测模型目录中的信息系数。它将每个日期的IC定义为各产品预测收益与实际收益之间的秩相关,然后跨折对这些每日数值取平均。这与基于产品排序的等权策略相符,因为策略使用的是排序,而非预测收益的大小。汇总产品与日期的观测值会混合共同市场走势和横截面排序能力,可能造成误导。…
此笔记本使用TreeSHAP解释LightGBM收益预测,包括全局特征重要性、单项预测解释、依赖图和成对交互值。它将SHAP排序与置换重要性和基于树的不纯度重要性进行比较,以展示特征排序在哪些方面一致,或依赖于测量方法。工作流还跟踪前向滚动折中的平均绝对SHAP值,作为特征漂移指标,并探索基于SHAP排序的特征子集重新训练。…
此笔记本为多元化的ETF资产集合实现端到端的组合策略。模型结合时间特征、资产元数据、横截面注意力,以及允许在资产类别内和特定经济关联之间进行注意力计算的宏观图先验。SoftMin目标侧重于表现最弱的滚动训练窗口中的夏普表现,成本感知惩罚项则考虑各资产特有的换手成本。笔记本按时间顺序划分训练、验证和测试窗口,然后将完整模型与不含SoftMin的消融版本及更简单的组合基准进行比较。…
此笔记本将财经标题转化为个股信号,并根据未来收益进行评估。它对标题进行嵌入,以语义距离衡量新闻相对于滚动嵌入基线的意外程度,并将意外程度与情绪方向结合,区分异常利好和异常利空新闻。它还计算平均情绪、分歧、情绪动量和文章覆盖度。标题按股票代码和日期去重,股票代码与日期经过标准化,并对信号进行滞后处理,避免过早使用发布当日的信息。…
本笔记探讨序列模型能否改进对永续资金费率溢价历史的人工摘要。它比较了读取有序窗口的简单线性模型 NLinear 与两层 LSTM。两者使用相同的特征顺序、滚动验证折、缺失数据策略和检查点计划,因此差异可以更直接地归因于架构。比较旨在检验,与现有溢价变化、波动率、z 分数和分位数特征相比,学习得到的表示是否能增加价值。 窗口使用最近 60 个预期的八小时结算点,约 20 天。跨越预期但缺失结算点的窗口会被丢弃,而非填补。每种配置训练 100…
本文档介绍一种分阶段方法,将另类数据、申报文件、新闻和价格数据源中的公司名称与证券匹配。首先按既定的可信度顺序使用可用标识符进行关联,保留未匹配记录,并检查参考键是否唯一。缺少标识符时,会对名称进行规范化并使用模糊字符串相似度;通过在带标签的示例上测量精确率和召回率来选择接受阈值,其中也包括没有有效匹配项的名称。句子嵌入为语义变体提供了另一种评分方法。…
本笔记运行或重放一组相同的研究智能体,让它们回答同一个预测问题,然后检查其预测、搜索活动和对话轨迹。分别记录每个智能体的轨迹,可在并行调用期间保留来源归属。示例表明,即使提示和工具相同,智能体仍可能给出不同预测;但采样和检索到的文档都可能解释这种差异,而该设计无法区分两者的影响。…
本笔记为横截面 US 公司特征研究定义月度总收益标签,并检查这些结果与数据提供方的行记录如何对齐。面板将前一个月的特征与每行对应月份的收益配对,因此再次将收益向前移位会意外多出一个月。不同标签方案会对收益进行缩尾处理,并根据当月横截面划分公司;阈值按月确定。…
本笔记说明时间卷积网络(TCN)如何根据有序金融数据预测收益。因果卷积确保某个时点的输出只依赖当前和之前的输入。膨胀率在不同层间按几何级数扩展感受野,使网络无需使用过宽的滤波器就能覆盖较长的输入窗口。残差连接、权重归一化和通道随机失活支持这种堆叠架构,最终状态预测头则生成预测结果。 示例使用某个 ETF 面板中的滞后收益特征预测远期收益,并通过日均 Spearman 信息系数评估横截面排名,同时计算相对于零预测的平方误差。它将 TCN…
本笔记研究 Ridge 正则化选择如何影响 ETF 面板上的信息系数,以及超参数搜索如何抬高报告的表现。首先在滚动验证折上评估宽范围的 alpha 网格,并在每个训练折内缩放特征;随后比较单层选择与嵌套验证。在嵌套验证中,内层划分选择 alpha,未参与选择的外层折则评估完整的选择流程。清除和隔离处理了远期收益标签重叠的问题。 笔记还检查了不同验证折和 alpha 值下的稳定性,并对搜索进行三西格玛诊断。核心结论是:如果评分所用数据与选择超参数所用数据相同,那么评分既反映模型拟合,也反映搜索本身。选出的…
本实现介绍了一种神经随机贴现因子模型和一个用于检验资产定价关系的对抗矩网络。SDF网络将资产特征(可选择与来自LSTM的宏观经济状态表征相结合)映射为资产权重。这些权重与收益共同构成时点层面的贴现因子。启用宏观输入时,LSTM状态会在每个时间步由所有资产共享;否则,模型仅使用资产特征。…
本笔记本构建了N-BEATS模型,用于预测SPY收盘价。全连接模块处理完整回看窗口,每个模块都会生成一个反向预测结果,并在进入下一模块前将其扣除,同时预测未来期限内的价格。受约束模块使用多项式和傅里叶基,因此其输出可以绘制为趋势和周期成分;无约束版本则用于对照。预测误差还与一种将最新价格延续至未来的持续性规则进行比较。…
本笔记本介绍了PCMCI,用于在不预先指定因果图的情况下发现多变量金融时间序列中的滞后关系。它将该方法应用于ETF和波动率指数收益,与成对Granger检验进行条件分析对比,并说明如何解读滞后联系。该流程预先声明搜索期限,对最终检验采用Benjamini-Hochberg校正,并通过分块自助法重采样评估发现的边是否反复出现。…
本笔记本估计,在干预条件下,加密货币永续合约溢价z分数是否与随后八小时收益相关,同时调整价格波动率、资金费率及溢价偏离近期均值的程度。双重机器学习分别根据这些混杂因素预测结果和处理变量,再分析二者的残差。交叉拟合会将每个观测排除在生成其残差的模型之外,而按时间顺序划分的折和隔离期则防止干扰模型使用未来数据。…
本笔记本汇总了多个案例研究中构建的金融特征,并列出各市场研究在注册表中的最高信息系数。它统计特征数量及特征名称类别、比较特征空间规模,并总结跨资产模式。类别仅通过名称前缀机械划分,因此只能作为粗略参考:专业指标和不一致的命名可能会拆分相关概念,或使不同概念的数量显得偏多。本笔记本还分析信息系数与投资范围广度及估算信息比率之间的关系。…
本笔记本介绍了一种条件自编码器,在保留工具变量潜在因子模型结构的同时,用神经网络取代公司特征到因子暴露的线性映射。月度收益表示为特征驱动的暴露乘以月度因子收益。该方法保留两阶段因子结构,同时允许公司属性与因子暴露之间存在非线性关系。…
本文将共享权重的神经集成模型TabM应用于期权衍生特征,以预测未来股票收益和风险调整后收益。各成员共用一个两层网络,分别使用激活缩放和输出头,再对预测结果取平均。采用这种方法的原因是期权曲面上的特征彼此相关:与通过连续分裂选择特征的树模型不同,神经网络在加权层中组合这些特征。预先声明的训练检查点使每个已保存的训练轮次都成为可单独评分的模型,而滚动折提供样本外验证预测。…
本笔记本使用机构的13F申报持仓数据,对比结构化图检索与基于嵌入的向量检索。它在固定截止时间构建时点持仓快照,限制股票范围,并围绕股票持有人、机构持仓和持仓相同的机构生成问题。每个问题都预先定义了预期的支持记录,以便衡量支持记录召回率并估算检索令牌预算。…
本案例研究将已存储的模型预测转化为 US 股票的多空等权投资组合。它遍历多种入场方案,每种方案都选择排名最高的股票做多、排名最低的股票做空,以考察投资组合集中度如何与模型排名相互作用。在评估模型分数前,先将带随机种子的随机排名送入同一回测引擎,并将所得夏普比率与规定的容差进行比较。这样做旨在检测回测流程本身而非预测信息带来的收益。…
本文介绍将预测分数转换为交易信号的几种方法:固定阈值、按资产分别计算的滚动百分位数,以及横截面百分位数。固定阈值使用选定的分数水平;滚动阈值根据某项资产近期的分数分布进行调整;横截面阈值则在每个时间点相对于同类资产选择标的。每种方法都可以生成仅做多或多空信号,并可使用对称的较低阈值建立空头仓位。…
本笔记本使用美联储月度经济数据构建描述性市场状态:失业率、联邦基金利率、美国国债收益率曲线和通胀。它说明如何对齐发布频率不同的序列,将趋势水平值转换为变化率,并为原本没有名称的聚类赋予经济含义标签。随后,将所得分组与未参与聚类的股票波动率和回撤进行比较,并在不同随机初始值和较短样本下检查结果。…