本笔记展示在平静与承压时期检查ETF动量和技术特征的漂移,以及利用跨市场环境的溢价指数数据检查加密货币永续合约的漂移。笔记比较总体稳定性指数(PSI)及其分箱贡献与瓦瑟斯坦距离,并使用领域分类器检验参考样本和当前样本能否被联合区分。生产监控器将PSI和分类器分数映射为警报级别,并展示警报数量如何用于提出重新训练建议。…
知识库
这里汇集了 Stratmill 研究智能体对 AI 智能体阅读过的书籍、论文、文章和代码所作的摘要与核心观点。每个页面都附有原文链接。
搜索知识库
857 份文档
本笔记将TSMixer作为适用于ETF面板的全局序列模型进行评估。模型在各基金间共享参数,同时使用每只基金自身的历史数据和协变量;其混合层学习时间关系和序列内关系,但不会把一只基金的观测值并入另一只基金的预测。本笔记将声明的模型样本与可用数据进行核对,检查训练配置和设备身份,并使用验证折选择训练轮次检查点,同时保持留出集不受触碰。…
本笔记介绍如何使用 TSMixer,根据每只股票按时间排序的特征窗口预测收益。每个样本包含 60 个连续交易时段;若窗口跨越股票历史数据中的缺口,则予以排除,因此各折可用样本数不同。模型交替在时间轴和特征轴上进行非线性混合,使信息能够在堆叠模块之间重新组合,而无需循环结构。 文中提出的动机是并行处理整个窗口,而不是像 LSTM 那样逐步处理,同时在相同面板和数据折上,将反复显式混合特征与循环模型和线性模型进行比较。配置采用两个模块、32 的隐藏维度和 100…
本指南将 US 股票数据集划分为市场数据、公司基本面、投资者持仓和公司特征。它列出日线与盘中柱、期权和市场微观结构记录的加载器,以及 SEC 申报文件文本、XBRL 事实数据、机构持仓、内部人交易和打包的公司特征面板。指南还列出了部分数据集所说明的大致覆盖范围或时间跨度。…
本笔记将多个模型族的验证预测转化为等权多空组合。它按预测收益为股票排序,买入排名靠前的股票并做空排名靠后的股票,再通过统一回测流程测试多种组合集中度。使用固定随机种子的随机排序也会通过相同流程,作为流程检查;同时依据考虑有限样本波动的容忍范围评估其夏普率。…
本文介绍分阶段流程,将申报文件、新闻和另类数据中的公司名称关联至证券。它区分 CIK 和 LEI 等实体标识符与 FIGI、CUSIP 和 ISIN 等证券标识符,并解释为什么股票代码需要结合交易所和日期信息。若有可用标识符,优先采用确定性连接;否则,先对名称进行规范化,再用模糊字符串评分或句子嵌入进行匹配,并通过带标签样本的精确率和召回率评估接受阈值。…
本文介绍一种用于股票期权分析研究、预测股票收益的监督式自编码器因子模型。与 PCA、IPCA 和无监督条件自编码器不同,该模型的训练目标将横截面重建与远期收益预测结合起来。因此,目标变量会影响瓶颈表示,可能改善预测,但也会削弱解释共同变动的约束。…
本笔记研究用于预测 CME 期货产品横截面的线性模型,特征列按相关类别分组,包括持有收益、动量、波动率和滚动风险指标。由于同一类别内的特征列往往相关,文中比较岭回归、套索和弹性网络惩罚:岭回归收缩系数,而套索可以将系数设为零,从而筛选特征。套索和弹性网络的惩罚会根据各折特有的阈值缩放,使其强度在不同折之间更具可比性。…
这项教学分析比较四种神经网络设计在同一任务上的表现:根据近期收益窗口预测下一日收益。汇集的八只交易所交易基金提供了多样的市场敞口。模型处理窗口的方式各不相同:全连接网络将其视为向量,卷积网络扫描局部模式,循环网络则逐步更新隐藏状态摘要。分析同时考察预测误差和训练成本,并研究这些成本如何随历史窗口长度变化。…
本笔记审计一项 FX 货币对研究中的完整规范验证预测集。它检查模型身份、产物可用性、完整性、已配置标签的覆盖情况,以及汇总后的配置是否符合声明的菜单。通过沿用数据谱系移除已被取代的预测集,使分析与下游回测使用相同的模型总体。因果估计单独报告,因为它回答的是处理效应问题,而非预测评分问题。…
本笔记审计一项 FX 货币对研究中已登记的验证预测。它检查目录是否包含已配置的模型总体、完整的预测集、可用的产物和当前模型身份。随后,它汇总不同标签、模型族、配置和检查点的预测诊断指标,包括每日横截面秩相关、折间稳定性、预测一致性和按时间顺序计算的保形覆盖率。绘图使用有代表性的样本,但不会因此从总体中移除模型,也不会决定哪些模型可以进入下一阶段。 本笔记将预测证据与因果估计区分开来:因果 DML…
本笔记评估 NLinear,这是一种简单的序列模型:它从回看窗口中减去最新观测水平,再通过线性变换将所得序列映射为预测值。在滚动折上拟合由 ETF 个模型组成的总体,并与线性模型和梯度提升模型中的领先者比较。拟合前,先确定数据、符合条件的基金日期观测、折边界和序列窗口要求,使比较使用明确共享的预测行。 根据验证集信息系数选择训练轮次检查点,同时设置完整覆盖约束,排除预测只覆盖部分验证日期的检查点。最终比较仅使用各模型相同的基金日期键,并在这些键上重新计算每日…
本案例使用线性模型预测加密货币永续合约的收益和方向。其特征矩阵主要由永续溢价的各种变化构成,即合约价格与现货价格之间、决定资金费支付的价差。文中对比岭回归和套索、弹性网络:岭回归会收缩相关系数但保留特征,而套索和弹性网络可以剔除特征。惩罚参数针对每个训练折单独确定,并使用共同的滚动折和预测行评估各项配置。 分析使用验证集信息系数展示正则化在冗余测量下的表现:岭回归会在相关特征间分配权重,而较强的 L1 惩罚可能只保留一列。稳定的负 IC…
本笔记介绍一种用于股票收益的条件自编码器:一个神经网络将股票特征映射为非线性因子载荷,另一个网络则从特征管理组合收益中提取同期潜在因子。管理组合通过联合横截面最小二乘法估计,以考虑特征之间的相关性。随后,独立的滚动适配器预测下一个因子值,并利用当前特征预测次日股票收益,从而区分重建任务与预测任务。…
本笔记比较在离散调仓且交易产生比例成本时,对卖出的欧式看涨期权进行对冲的方法。它定义自融资终端盈亏,然后在 Heston 模拟价格下训练神经对冲模型,以最小化预期损失。替代方法包括 Black-Scholes delta、考虑摩擦的 Whalley-Wilmott 规则、基于表格价值的方法,以及从零实现的神经网络。训练、验证和评估路径彼此分开;先用验证集在不同训练随机种子中选择,再报告评估路径上的结果。…
本笔记比较 LightGBM 预测模型的单目标超参数调优与多目标搜索。基准方案最大化验证信息系数(IC)。NSGA-II 搜索则最大化 IC,同时最小化标准化预测换手率,从而形成帕累托前沿;改善一个目标可能使另一个目标变差。该方法将信号质量与交易成本代理指标一并呈现,但换手率并非直接的交易成本估计。 本笔记还测试在 ETF 上调优的参数能否迁移到加密货币永续合约和期货,并将迁移后的表现与针对特定资产调优的结果进行比较。报告结果显示,迁移后的 ETF 参数在 CME 期货上的验证 IC…
本章综合九个案例,追踪机器学习信号如何经过投资组合构建、交易成本、风险覆盖层和冻结的留出集评估。本章以每个案例的演进过程为分析单位,而不是只按夏普比率给策略排名。所述框架将信号质量、投资组合转化、成本下的存续能力和时间稳定性分开,再利用这些阶段识别限制因素所在,以及后续研究可能发挥作用之处。…
本笔记比较三种线性时间序列模型、一个 Transformer 编码器,以及用于日频 SPY 收益的无参数预测方法。线性方法将历史窗口映射为多日预测,其中不同变体会分离平滑成分及其余部分,或根据最新观测进行调整。零值和最近值预测提供了重要参照。另一个诊断会打乱每个输入窗口中的观测顺序,以检验模型预测是否依赖时间序列顺序。…
本笔记介绍由看多和看空角色参与的多轮预测辩论。双方分别主张某事件发生概率更高或更低,在后续轮次中会看到对方先前的论点,并给出概率及支持证据。主要诊断指标是双方概率随时间变化的差距:差距缩小可能表明一方回应了此前未考虑的证据,持续存在的差距则记录了尚未解决的分歧。差距低于选定阈值或达到轮数上限时,流程可以停止。…
本笔记考察梯度提升树能否在 NASDAQ-100 微观结构特征中发现线性模型可能遗漏的非线性关系。重点是订单流失衡的收益预测作用是否会因价差而异:树可以按价差分支,再分析每个区域内的失衡情况。预设网格改变树的容量和损失函数,并在多个收益期限及一个分类标签上评估不同提升检查点的预测。…
本笔记介绍一种操作员式研究智能体,用于迭代量化案例研究。它不把模型限制在预定义的预测操作中,而是提供文件、Shell 命令、注册表查询和数据检查等通用工具。智能体可按需读取任务专属方法,分析工作则由支持库执行。一项已记录的 ETF 运行测试了由梯度提升、表格深度学习和卷积自编码器组成的集成模型,并用第二个案例进行比较。 笔记展示如何重放运行、检查智能体的推理和证据,以及审阅包含命令、输出和决策的轨迹。笔记强调应准确报告负面发现,读者还必须将结论与底层指标进行核对:一项 ETF…
本笔记使用-2021之前的历史数据,重新拟合此前验证阶段选定的配置,然后发布2021留出期的预测。它从记录的候选集提取选定配置;若该候选集不可用,则应用相同的排序规则。重新训练区间根据研究声明、验证折、标签缓冲区和特征覆盖范围确定,因此训练边界遵循数据和预测约定。后续只保留选定配置,并将留出期预测视为对该配置的测量,而不是与其他方案的竞赛。…
本笔记实现一套 ESG 新闻标题处理流程:通过关键词筛选新闻,将选中的标题归入环境、社会或治理类别,并对抽样标题使用 FinBERT 情感模型评分。笔记在抽样前衡量所选样本的类别构成,并采用分层抽样,确保每个类别都进入分类器。笔记还将模型加载时间与推理时间分开,并说明要公平比较,检索增强生成系统需要提供哪些内容:带引用的证据以及拒绝作答的能力。…
本笔记在年度报告语料库编入金融研究索引前对其进行审计。它衡量财务期间结束日与公开申报日期之间的延迟,说明时点应用为何必须使用发布日期。笔记还识别以多个股票代码表示的申报文件,解释为何 accession number 是文档级主键,检查股票代码与年份的覆盖缺口,并确定下载过程保留了哪些文本摘录。…