Skip to content

Repository files navigation

QuantStrategyAtlas

中文 · English

面向大规模量化策略群体的实证分析图谱,研究自然语言规则、结构特征、选股行为、持有期与历史回测表现之间的关系。

表现空间中的结构现象

为什么大量策略回测结果会在 Sharpe–Alpha 空间中呈现明显的结构化分布?这些结构与策略规则、持有周期和实验条件存在怎样的关系,其中又有多少可以由指标定义、回测窗口与执行设置解释?

旧版 Sharpe–Alpha 聚合散点几何

封面图展示旧版研究档案中经过支持量筛选的匿名聚合单元,用于研究大量回测结果中的结构化几何,而非呈现单个策略定义的排名或 Alpha 类别。线状结构在不同随机种子设置下可以重复观察,但现有证据表明,其相当一部分与累计尺度和回测窗口长度有关。由于冻结规范队列未复现多条稳定轨道,本项目将其视为待解释的诊断性现象,而非定义有效性、规范家族或语义聚类的证据。

**证据边界:**封面图展示旧版非规范队列的匿名聚合几何,仅用于结构诊断;其中的 Sharpe 与 Alpha 指标不参与冻结规范队列的正式推断。

首图把同一批聚合散点依次按拟合条带、回测窗口长度、最大回撤幅度和阶段胜率着色。后两者属于回测后的结果诊断,不能作为形成条带的事前原因。达到公开支持门槛的散点主要来自 20 日回测,因此持有期着色接近单色,当前旧档案不足以检验六个持有期是否形成自然分层。

QuantStrategyAtlas 基于真实历史 A 股日频市场数据,把自然语言描述的量化策略群体作为研究对象:从规则与参数结构出发,分析规范家族、时点选股特征、匿名贡献集中度与历史结果如何随持有期和市场状态共同变化。原始市场数据、策略文本与逐行回测不随仓库分发。

项目定位是量化策略群体的研究与审计图谱,公开层提供经过披露门槛筛选的聚合证据、合成复现夹具和图表重建流程。

术语约定

本文不把不同层次的分组统称为“策略簇”。后文固定使用以下术语:

术语 本项目中的固定含义
策略定义 一条经过规范化的自然语言规则;1,669 的计数单位
回测记录 一个策略定义在一个持有期下的实验结果;10,014 的计数单位
规范家族 根据规则语义覆盖全部定义的描述性分类,如动量突破、统计过滤和价值质量;不是聚类结果
结构单元 完全相同子句集、无参数模板或替换关系连通分量,用于表示规则重复与统计依赖
局部结构岛 从子句矩阵无监督识别的语言邻域;不等于规范家族,也不构成唯一全局分类
路径原型 按已经实现的重复选择率分组的匿名历史路径;属于事后诊断,不是事前分类
几何条带 旧版匿名聚合表现空间中的线状分布;属于几何诊断,不是定义、家族或成员簇

旧版图中的“策略组”仅是旧档案用于披露门槛的去标识支持量单位,不能与冻结规范队列中的策略定义或规范家族一一映射。

为什么值得研究

当研究规模扩大到 1,669 个策略定义时,持有期选择、规则重复、解析差异、极端收益和多重检验都会影响表面排名。单看策略收益无法回答三个更重要的问题:

  • 规则标签不同的策略定义,是否真的选择了不同的股票?
  • 较好的回测结果来自可重复的选择行为,还是一两只历史标的?
  • Sharpe–Alpha 散点中的条带,是自然语言定义的语义聚类,还是数学定义与实验设置形成的几何结构?

本仓库把这些问题放在同一个冻结队列中研究,并且只发布无法反推单个策略定义的聚合证据。

研究概况

研究设计 冻结规范队列
自然语言策略定义 1,669
固定持有期 2 / 3 / 4 / 5 / 7 / 20 个交易日
配对固定持有期回测 10,014
在私有层分析的规范成交记录 1,028,649
历史窗口 2024-01-01 — 2025-12-31
规范化规则子句标签 691
完全相同的子句集合 / 无参数模板 1,134 / 922
替换关系连通分量 866
主队列 / 次队列 / 排除定义 575 / 866 / 228
市场数据 真实历史 A 股日频数据;仅公开聚合结果
执行方式 T+1、单标的轮动、计入交易费用
实际退出路径 止盈 9% / 止损 5%

本项目要回答什么

  1. 同一策略定义改变持有期后,胜率、总收益、交易强度和排序如何变化?
  2. 691 个规范化规则子句如何组成可重复的策略基因组、模板与结构分量?
  3. 动量突破、统计过滤、价值质量等规范家族是否具有不同的选股行为?
  4. 规范家族差异来自不同资产集合,还是同一股票池中的不同选择频率?
  5. 历史表现的贡献是否集中于少数匿名标的、交易或日期?
  6. 哪些规范家族在上涨、下跌、震荡和高波动状态下表现不同?
  7. 旧版研究档案中的 Sharpe–Alpha 条带能否由窗口、执行设置、规范家族或规则结构解释?
  8. 规则子句和参数结论经过解析质量、前视风险、重尾、零交易、依赖结构与多重检验后,还能保留多少?

研究路径

从自然语言策略到实证证据

研究从可见几何反向追踪到语言基因组、规范家族构成、时点一致的股票风格、选股路径、匿名贡献集中度与稳健性筛选。所有正式结论都回到统一的冻结规范队列,而不是从旧图中寻找事后解释。

主要实证结果

1. 规范家族的选股行为和历史结果都存在差异

主分析队列中,动量突破(169 个)、统计过滤(251 个)和价值质量(135 个)三个规范家族达到每类至少 30 个定义的公开比较门槛。趋势跟随(17 个)及其他更小的规范家族仅保留为样本支持说明,不纳入主要比较。

在冻结窗口内,价值质量家族的策略胜率中位数在六个持有期均高于另外两类。3 日持有期下,三类依次为 46.48% / 43.71% / 43.10%。价值质量的总收益中位数为 −5.87%,另外两类为 −27.48% / −42.52%。这是队列层面的描述性差异,不能证明该家族未来表现更好。

选股行为提供了更多解释:价值质量家族 3 日持有期的重复选择率为 34.97%,高于统计过滤的 16.11% 和动量突破的 19.46%,入选股票的换手率中位数也更低。加入次分析队列后,绝对水平明显变化,但三个家族的主要相对顺序仍然保留。因此,该结论在解析敏感性检验中方向较稳健、幅度较敏感

规范家族行为概况

2. 较好的规范家族中位结果可以与更高的贡献集中度同时出现

价值质量家族较好的历史中位结果与更高的贡献集中同时出现。3 日持有期下,最大匿名资产占绝对损益的中位份额为 6.97%,高于统计过滤的 4.62% 和动量突破的 4.94%;20 日持有期下,三类分别升至 13.86% / 11.37% / 11.58%

20 日持有期下,历史路径中前五个匿名资产的绝对损益占比达到 41%–49%。移除最大绝对损益贡献资产后,约 22%–24% 定义的历史损益符号发生翻转。这里的“前五个”是整个回测路径上的匿名贡献者,不是同时持有五只股票,也不公开任何股票标识。

匿名贡献者集中与脆弱性

这使规范家族层面的结论更完整:当前队列中,价值质量家族的中位结果较好,但它同时表现出更高的重复选择与贡献集中,不能只看收益排序。

3. 三个规范家族共享较大的股票范围,但赋予股票的选择权重不同

3 日持有期下,动量突破与统计过滤的入选资产集合 Jaccard 相似度为 0.65,选择频率余弦相似度为 0.66;动量突破与价值质量则只有 0.490.31。到 20 日持有期,因成交资产减少,集合重叠下降,但两组的频率余弦相似度仍大致保持在 0.65 和 0.30。

规范家族选股重叠

因此,规范家族差异主要表现为共享市场范围内的选择权重差异:前两类的选择频率更相似,价值质量则形成了更不同的历史选择分布。

行业层只能作为描述性特征。以 3 日持有期为例,价值质量相对主队列基线对水运和煤炭开采的选择提升倍数约为 2.39×2.05×;但行业标签来自当前静态元数据,不是历史时点分类,不能解释为历史行业暴露的因果证据。

4. 主要规范家族共享小市值、高活跃度选股倾向

把所有成交标的放回各自买入日的全市场横截面后,三个主要规范家族选中的股票都明显偏小:3 日持有期的市值分位数中位值只有 0.20–0.23,20 日持有期也只有 0.19–0.23。它们还普遍偏向当期动量与换手率较高的股票。

规范家族差异因此是共享市场范围内的相对特征

  • 3 日动量分位数:动量突破 0.65、统计过滤 0.69、价值质量 0.59
  • 3 日换手率分位数:三者分别为 0.66 / 0.64 / 0.54
  • 20 日波动率分位数:三者分别为 0.62 / 0.58 / 0.43
  • 价值质量在 PE/PB 估值取向与 ROE/利润率上相对更高,但多数中位值仍接近全市场中位水平,而不是落在极端价值或质量尾部。

选股风格指纹

这些分位数使用交易进入日当时可知的因子值计算。它们说明规范家族标签如何映射到实际选股风格,但不能单独证明某种风格导致了较高收益。

5. 策略语言存在局部结构岛,但不存在唯一稳定的全局聚类

在 1,669 × 691 的规则子句出现矩阵上,TF-IDF → SVD50 → HDBSCAN 找到 15 个局部结构岛,已分配样本的轮廓系数为 0.27;约 36.2% 的策略定义没有被分配。局部特征可以识别价值、短期收益、均线、涨停、KDJ、MACD 等语义区域,表明自然语言策略空间存在可观察的局部结构。

但全局分类并不稳定:随机删除 20% 的规则子句特征后,调整兰德指数中位数只有 0.34;保留 80% 策略定义进行行抽样时,ARI 为 0.72。局部结构岛与规范家族之间的标准化互信息只有 0.11。也就是说,局部邻域相对可重复,但“把全部定义切成唯一若干大类”的结果高度依赖所选的规则子句特征。

策略相似性图

公开图只发布至少 15 个定义、10 个结构分量的密度格;不发布任何定义坐标或聚类成员关系。因此,本项目把它们称为诊断性局部结构岛,不把 LC01–LC15 包装成真实市场因子或稳定经济类别。

6. 重复选择型路径的历史结果较好,但也更集中、更脆弱

按照每个持有期的重复选择率四分位数,主队列中的“定义 × 持有期”路径被划分为广泛轮动、中等轮动与重复选择三种路径原型。这些原型并非预先定义的规范家族,而是对已经发生的历史选股路径进行匿名聚合剖析。

3 日持有期下,重复选择组的策略胜率中位数为 51.61%,总收益中位数为 +14.09%;广泛轮动组分别为 41.51%−71.79%。然而,前者的前五个匿名资产已占绝对损益的 66.32%,后者只有 15.12%。20 日持有期下,重复选择组的前五个资产占比进一步达到 71.99%

选股路径原型的表现与集中度权衡

这些事后路径分组同时受到规范家族构成、可交易机会和历史结果的影响,不能识别重复选择的因果效应。结果显示:较好的历史中位表现与更强的贡献集中可以同时出现。

7. 旧版 Sharpe–Alpha 几何具有可重复性,但尚不能解释为语义聚类

旧版研究档案中的多条斜带在不同随机种子设置下保持较高一致性,迭代 RANSAC 的调整兰德指数约为 0.86。这表明几何划分在当前分析设置下具有较高可重复性,但不意味着语义类别或经济机制同样稳定。

现有证据需要分层解读:

  • 对旧版累计 Alpha,按策略分组的样本外 R² 从仅使用 Sharpe 时的 0.336 升至加入回测窗口长度后的 0.696,表明累计尺度与窗口定义解释了大量结构;
  • 改用年化 Alpha 后,仅使用 Sharpe 的 R² 为 0.316;加入窗口与已记录的事前元数据后升至 0.342,其中旧因子类别等元数据的额外增量约为 0.007,解释能力有限;
  • 加入最大回撤、阶段胜率与观察期数等事后诊断后,年化 Alpha 的 R² 升至 0.574。这表明几何与已经实现的回测路径高度耦合,但这些变量来自同一次回测,不能倒置为条带成因;
  • 旧版条带基本来自 20 日持有期回测,并且属于独立的旧版研究队列,不能并入规范推断;
  • 在冻结规范主队列中,以策略胜率 × 总收益进行对应诊断,只得到一个覆盖 97.3% 记录的宽带和 2.7% 残差,没有复现多条稳定轨道;
  • 规范总收益的几何模型对重尾极其敏感:原始分组样本外 R² 仅约 0.00–0.01,经 1%/99% 缩尾后为 0.21–0.43,说明模型解释力对极端值处理高度敏感。

表现几何审计

封面图已从拟合条带、回测窗口、最大回撤和阶段胜率四个维度呈现同一批聚合散点,本节不再重复展示。

综合来看,旧版几何在当前分析设置下具有较高可重复性,其中累计尺度与窗口长度解释了重要部分;规范队列未复现多条轨道。 已记录的事前元数据对剩余结构的解释增量有限,事后变量虽与几何高度相关,却不能作为生成原因。因此,条带更适合作为结构诊断和候选区域,而非规范家族、语义聚类或完整机制。进一步归因仍需要同一规范生产流程中的基准、时点一致因子暴露、退出规则、交易强度与完整实验元数据。

8. 持有期改变了历史表现指标之间的权衡

在 575 个主队列定义中,3 日持有期的策略胜率中位数为 44.37%,20 日为 40.91%;同一策略定义 3 日减 20 日的中位配对差为 +4.22 个百分点,描述性自助法 95% 置信区间为 [+3.12, +5.03]

总收益方向相反:3 日减 20 日的中位配对差为 −23.73 个百分点,95% 置信区间为 [−26.42, −18.21]。主队列所有持有期的总收益中位数都为负,因此“20 日更常成为总收益相对最优档”通常表示损失较小,而不是普遍盈利。

配对持有期权衡

不存在普遍最优持有期。按策略胜率定义的逐定义最佳档分散在全部六档;短周期之间的排名相关性较高,3 日与 20 日的 Spearman 相关系数则降至 0.58(策略胜率)和 0.44(总收益)。

持有期排序稳定性

9. 规则关联在严格证据门槛下大幅收缩

68 个可做出现性比较的规则子句中,46 个满足主队列公开样本格门槛。加入规范家族分类、连通分量聚类协方差、解析敏感性、前视敏感性、缩尾、零交易与多重检验筛选后,只剩 total_mv>=1000000000 在两个持有期保留为 B 级条件性观察关联;它没有严格的单子句增删配对支持。原来的 board=main 主要结论在规范家族调整后的 BH-FDR 下被降为 C 级。

规则子句证据筛选漏斗

现有 7,366 个精确基础配对是单原子替换对比,不是增加或删除一个规则子句。严格单子句增删证据为 0。81 组参数扫描中有 5 组强支持、5 组准备就绪,但真实参数值样本格过小,公开层不绘制响应曲线,也不声称存在稳定最优值。

策略基因组与有效样本量

1,669 个定义并不等于 1,669 个独立实验:

结构视角 数量 含义
策略定义 1,669 完整覆盖六个持有期
规范化规则子句标签 691 可公开的规则词汇表
完全相同的子句集合 1,134 合并原子集合相同的语言结构
无参数模板 922 仅忽略数值的结构模板
替换关系连通分量 866 单原子替换图中的连通单元
最大替换关系分量 138 高依赖区域,不能按独立定义计数
孤立分量 729 当前没有单原子替换边

规范家族分类与 1,669 个定义一一匹配,但主队列支持量高度不均衡:

规范家族 全部定义 主队列 公开表现状态
统计过滤 / 风险约束 808 251 达到门槛
价值与质量 426 135 达到门槛
动量突破 265 169 达到门槛
趋势跟随 165 17 样本不足,不公开比较
均值回归 2 1 样本不足,不公开比较
其他 3 2 样本不足,不公开比较

旧看板的动量、价值、质量、风险与流动性五类来自“绝对值最大的因子权重”,并使用旧版回测引擎、不同窗口和 Sharpe/Alpha 指标。它们不属于这里的规范家族分类,只作为旧版假设来源保留。

自然语言结构图谱

私有只读层将原始语言转换成不会泄露原文的结构统计:字符长度、数字记号、比较符、逻辑连接词、规范化规则子句数与规则子句类别数。任何词语、片段、原句或可逆指纹都不写入公开 CSV。

自然语言结构概况

语句长度与解析保真度的 Spearman 相关系数为 0.29,比较符数量与解析保真度的相关系数为 0.38,但关系并非越长越好。81–100 字符组的保真度中位数为 1.00、主队列占比为 49.5%;131 字符以上组分别回落到 0.8818.0%。这更像“适量明确阈值有助于解析,超长复合描述又增加歧义”,而不是较长的规则定义本身质量更高。

这些关联高度依赖当前语料格式与解析器版本。解析保真度、前视标记和未匹配片段本来就是主队列筛选条件,因此不再对它们报告由筛选机制造成的伪相关。

规则词汇与重复组合

规则子句图谱区分三个问题:

  1. 词汇:哪些规范化标签经常出现;
  2. 组合:哪些标签经常共同出现;
  3. 证据:这些标签或组合是否与回测结果或选股行为稳健关联。

前两者描述策略语言生态,第三个才涉及统计推断。主队列中共有 67 对规则子句同时出现于至少 30 个定义。共现提升倍数最高的组合包括:

重复出现的规则组合 同时包含两者的定义数 提升倍数 含义
float_mv>=3000000000 + total_mv>=3000000000 43 9.43× 市值下限的近重复表达
float_mv<=30000000000 + total_mv<=30000000000 38 8.71× 市值上限的近重复表达
is_new_high_5=False + ret_1d<=0.03 33 6.74× 避免短期极端上涨的组合语言
ret_20d<=0.1 + turnover_rate<=10 36 4.83× 中期涨幅与换手共同约束

重复规则组合图

高共现不等于互补收益。现有正式交互检验没有得到 A 级或 B 级的表现协同证据;个别 q 值较低的交互项仍然只有 C 级探索状态。规则组合图回答“人们如何反复描述策略”,不是“组合必然有效”。

相似性图谱:局部邻域与全局分类

规则空间相似性分析使用全部规范标签,而不是预先指定的规范家族标签。公开层只保留:

  • 一个全局稳定性摘要;
  • 15 个各含至少 32 个定义的局部结构岛汇总;
  • 各含至少 15 个定义、10 个结构分量的二维密度格;
  • 每个局部结构岛中至少出现 20 次的规范规则特征。

结果支持“存在局部语言邻域”,不支持“存在唯一、稳定、与规范家族一一对应的全局聚类”。因此,README 同时保留规范家族、替换关系连通分量与局部结构岛三个视角,而不把它们混成一个标签。

选股行为与行业特征

每个“策略定义 × 持有期”在私有内存层计算:

  • 完成交易数与入选资产去重数;
  • 重复选择率与选择熵;
  • 当前静态宽口径行业分布;
  • 入选日市值、换手率、动量与波动率描述;
  • 规范家族之间的入选集合 Jaccard 相似度、加权重叠率与选择频率余弦相似度。

公开层只保留“规范家族 × 持有期”聚合。行业结果至少要求 30 个策略定义与 20 笔成交;任何证券代码、单定义资产集合或日期均不落盘。

完整结果:

入选时点的股票风格指纹

对每个真实入选事件,私有层先在同一交易日的全市场横截面中计算入选股票的分位数,再聚合到策略定义,最后聚合为“规范家族 × 持有期”。公开的八个维度是:

  • 市值;
  • 20 日动量;
  • 20 日波动率;
  • 换手率;
  • PE / PB 的价值取向;
  • ROE / 利润率的质量取向。

这一设计避免用 2026 年静态公司属性解释 2024 年入选时的估值、动量与波动。结果也显示了规范家族标签的边界:价值质量只是相对于另外两个规范家族更偏价值、质量、低波动与低换手,三个规范家族都处于相似的小市值、高活跃度选股范围。

规则子句关联选股行为,不等于规则子句贡献收益

5 个规范化标签在调整规范家族、复杂度、解析保真度、主要规则子句类别和替换分量内相关性后,仍与重复选择率保持跨持有期关联:

规范标签 稳定持有期 调整后关联中位数 方向
is_new_high_5=False 6 / 6 −29.35 pp 较少重复选择
ret_1d>=0 6 / 6 −11.02 pp 较少重复选择
ret_5d<=0.08 5 / 6 −6.42 pp 较少重复选择
board=main 4 / 6 −8.81 pp 较少重复选择
gap_open_pct<=5 4 / 6 +7.65 pp 较多重复选择

规则子句与选股行为关联

这些结果在缩尾、加入次解析队列、重新加入带前视标记定义的方向检查中保留,且通过本检验族的 BH-FDR。它们仍然只是观察性的行为关联:规则可能与未完全观测的策略结构共同出现,不能称为“规则造成的选股贡献”。

收益归因与失效模式

由于回测采用单标的轮动,本项目不把它伪装成传统多资产组合风险分析。贡献层回答的是:整个历史路径中,哪些匿名资产、交易或日期占据了绝对损益,以及移除最大贡献者后,损益符号是否发生描述性变化。

公开失效分类包括:

  • 贡献者集中:正贡献或绝对贡献过度集中;
  • 正损益依赖最大正贡献资产:移除该匿名资产后,历史损益不再为正;
  • 损益符号依赖最大绝对贡献资产:移除该匿名资产后,历史损益符号翻转;
  • 低活跃度:历史成交过少;
  • 高费用负担:费用相对于绝对毛损益较高;
  • 持有期敏感结果、结构重复与参数模板重复。

这些是历史脆弱性诊断,不是未来破产概率或组合风险价值(VaR)。详见持有期失效模式

聚合路径剖析

为避免规则组合、路径与结果共同指向某个真实策略定义,公开剖析使用每个持有期内至少包含 30 个定义的路径原型作为分析单位:

路径原型 构造方法 3 日历史概况 主要脆弱性
广泛轮动 重复选择率最低四分位 胜率 41.51%,总收益 −71.79% 交易覆盖广,但路径中位结果弱
中等轮动 重复选择率四分位区间 胜率 44.07%,总收益 −28.97% 介于两端
重复选择 重复选择率最高四分位 胜率 51.61%,总收益 +14.09% 前五个资产占绝对损益 66.32%

这一聚合剖析保留三种相互竞争的解释:

  1. 重复选择可能捕捉了持续性更强的历史标的;
  2. 较好的历史路径本身可能提高重复选择率,存在反向关系;
  3. 少数持续上涨标的同时抬高收益与集中度,使“机制稳定”与“事件集中”难以仅靠这一窗口区分。

因此,本仓库只把这些路径原型作为观察脆弱性的窗口,不把“重复选择”当成可交易规则。

市场状态条件分析

规范日度记录的基准收益全部为空,分析保持该字段缺失,并将旧引擎 Alpha/Beta 与规范结果隔离。市场状态直接由同一只读历史市场库构造:

  • 当日全市场横截面收益中位数;
  • 按窗口内 20 日复合市场收益三等分:下跌、震荡、上涨;
  • 20 日市场收益波动位于窗口内最高四分位:高波动;
  • 其余状态:常规波动。

市场状态概况

三个规范家族在上涨状态下的日度净收益绝对值为正,在常规波动的下跌状态下为负,说明结果明显与市场方向共变。图中数值不是基准调整后的 Alpha,也不足以识别“某个规范家族在某种市场状态下有效”。公开表见市场状态概况

日度路径覆盖审计

规范指标网格完整覆盖 10,014 次回测,但可用日度路径没有覆盖完整队列。按三个公开“规范家族 × 持有期”分组计算,日度路径覆盖率只有 22.2%–31.9%;而且部分样本格中,有路径与无路径定义的总收益中位数差异明显。例如,统计过滤家族 3 日持有期下分别为 −6.62%−40.62%

日度路径覆盖率

因此,2024 / 2025 日历年度拆分与市场状态图只描述已有路径子集,不能代表完整主队列或支持跨市场周期稳定性结论。路径覆盖审计作为公开结果与这些图表同时呈现。

规则子句、参数与复杂度证据

不同规则子句分析不能混称为“效果”:

证据层 设计 当前公开决定
出现性比较 主队列中“含有”与“不含有” 46 个标签;仅观察性关联
调整后关联 控制规范家族分类、复杂度、解析保真度与主要结构 1 个 B 级表现关联
精确替换 原子 A 被原子 B 替换 7,366 个基础配对;公开结果为 C 级
精确参数配对 同一模板、仅一个数值改变 783 个配对;公开结果为 C 级
参数扫描 同一模板中的真实观测值 响应曲线因证据不足而不发布

规则子句数与交易次数在六个持有期的 Spearman 相关系数约为 −0.49 至 −0.53;它与策略胜率或总收益的关联较小且不一致。更多条件主要对应更严格筛选和更少交易,不能解释为更好的策略。

参数行为仍缺少足够独立样本

在“同一模板、仅单个参数改变”的精确配对中,只有两个参数系列拥有相对较多、可用于选股行为比较的配对:

参数系列 配对数 独立模板数 公开决定
float_mv:le 61 8 独立模板不足
week_vol_ratio:gt 54 7 独立模板不足

虽然某些持有期的“较高参数值减较低参数值”比较,在重复选择率、选择熵、最大资产占比或费用负担上方向一致,但聚类自助法仍主要由 7–8 个模板决定。入选资产集合的 Jaccard 相似度也随持有期改变,说明参数值可能与选择集合变化相关;但当前证据不足以判断是否存在单调响应、内部最优值或随持有期变化的最优值。

参数最优曲线暂不发布,因为公开推断缺少足够的独立模板支持。完整的保守决策表见参数行为摘要

详细方法与完整表:

稳健性与科学边界

  • 结构依赖:替换结果按连通分量进行聚类自助法;参数比较按模板聚类。
  • 分组验证:表现几何模型按策略定义或结构分量执行 GroupKFold,避免同一结构同时进入训练集与验证集。
  • 多重检验:A–G 检验族分别执行 BH-FDR;q 值不单独决定公开等级。
  • 重尾分布:并列比较原始值、中位数/分位数、1%/99% 缩尾和非零交易分支;428 个零交易回测不被静默删除。
  • 解析器敏感性:主队列结论加入 866 个次队列定义后重新计算;方向改变即降级。
  • 前视敏感性:主队列排除 197 个带前视标记的定义;候选结论重新加入后检查方向与量级。
  • 选择胜率与策略胜率:两者的差异混合交易费用、止盈止损和实际执行路径,不称为纯成本侵蚀。
  • 不作因果声明:规范家族、出现性、替换、参数、选股与贡献者结果都是冻结队列中的描述性证据。
  • 指标隔离:旧版 Sharpe/Alpha 只用于明确标注的几何审计,从不进入规范结果比较。

公开数据与可复现性

数据层 内容 外部可复现性
真实研究公开聚合层 真实历史回测的持有期、基因组、规范家族、选股、脆弱性、市场状态、几何与规则子句聚合 所有公开图片均可由 CSV 完整重建
合成复现夹具 300 条固定随机种子的完全合成记录 生成器、模式、分析与测试可完整重跑
私有原始研究数据 原始策略文本、逐行回测、股票、持仓、成交、日收益与数据库 不公开;外部无法独立重跑“私有原始数据到聚合推断”流程

公开聚合禁止包含原始查询文本、策略/登记表/配对/模板成员标识、网址、平台名、股票代码、持仓、成交、日期级收益、私有路径或可逆哈希。公开散点图不使用单定义点;表现几何只发布满足最低支持量的聚合散点或密度格、模型摘要与条带诊断。

重建全部公开图片

要求 Python 3.11 或更高版本:

python3 -m venv .venv
source .venv/bin/activate
python3 -m pip install -e '.[test,figures,notebook]'
python3 scripts/generate_empirical_figures.py

笔记本 05_empirical_aggregate_overview.ipynb06_strategy_intelligence_public_analysis.ipynb07_strategy_mechanism_atlas.ipynb 只读取 results/empirical/,不访问私有数据库、其他仓库或网络。

复现合成测试流程

backtest-analysis-generate --output-dir data
backtest-analysis-analyze \
  --input data/synthetic_backtest_results.csv \
  --output reports/descriptive_summary.json

验证公开版本

PYTHONPATH=src python3 -m pytest -q
PYTHONPATH=src python3 -m backtest_analysis.release_check .
PYTHONPATH=src python3 -m backtest_analysis.release_check . --public-release

仓库结构

README.md / README_EN.md # 中文首页 / 英文研究展示页
results/empirical/
├── clause/             # 可公开的规则子句与参数聚合
└── intelligence/       # 基因组、规范家族、选股、脆弱性与几何聚合
figures/empirical/      # 只由公开聚合 CSV 重新生成
data/                   # 300 条确定性合成测试记录
notebooks/              # 合成数据笔记本与公开实证概览
docs/                   # 方法、实证结果、数据卡、限制与证据边界
└── research/           # 七篇公开策略智能研究章节
scripts/                # 仅使用公开数据的确定性图片生成脚本
src/backtest_analysis/  # 合成生成器、分析代码与发布门禁
tests/                  # 模式、隐私、来源与可复现性防护

局限

  • 历史回测不代表未来表现,本仓库不提供投资建议。
  • 策略定义、规则集合与模板彼此相关;名义定义数不等于独立样本量。
  • 单标的轮动不是分散化组合;贡献集中度是路径诊断,不是组合风险估计。
  • 当前静态行业元数据只具描述意义,可能错置历史行业分类。
  • 候选排序事件没有随规范回测成员关系一同冻结,因此项目可以解释实际入选结果,但无法完整解释每个落选候选。
  • 规则空间的局部结构岛在定义抽样下尚可复现,但对特征选择敏感,不构成唯一的全局分类。
  • 规范队列缺少基准收益;本项目不声称拥有规范口径的 Sharpe、最大回撤、Alpha、Beta、IC 或 IR。
  • 日度路径只覆盖公开“规范家族 × 持有期”样本格的约 22%–32%;市场状态与日历年度拆分不是完整主队列的全周期状态研究。
  • 规范家族构成不是随机的;解析器敏感性会改变家族层结论的幅度。
  • 收益分布具有重尾;原始几何和聚合均值并不稳定。
  • 原始研究数据不公开,因此外部无法逐行审计私有提取过程。

更多细节见策略智能研究章节方法实证结果数据卡局限策略智能分析

许可证与联系

代码、合成复现夹具与公开聚合采用 MIT 许可证,见 LICENSE。联系、问题与撤下请求统一使用 GitHub Issues。

About

A large-scale empirical atlas of quantitative strategies, exploring how strategy structures, holding horizons, and decision rules shape historical performance patterns.一个大规模量化策略实证研究,研究策略结构、持有周期与决策规则如何影响历史表现模式。

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages