← Multi-Agent Research · index · RECIPE · MODES

📊 Pipeline Flowchart — math-deep-dive v1.7

完整 agent loop 可视化。覆盖 v1.5 (Phase 1+2+3) + v1.6 (Loop A 自动 / Loop C opt-in) + v1.7 (Innovation Scanner ⭐ 历史范式 schema 类比) 所有更新。每个框可点击进入对应模板的详细文档。

图例

Stage 0:准备 / 模式检测
Stage 1:Template 1 头脑风暴
Stage 3:Template 2 v2 命题深挖
Stage 4:Template 3 论文 + 审稿
Stage 5:发布
⭐ v1.5 新增
↻ feedback / loop
💀 kill 分支
Opus 4.7 默认
Sonnet 4.6(IO / 体力活)

研究模式 + 档位(在 Stage 0 决定)

维度Mode A:实质研究(默认)Mode B:综述(触发短语)
触发默认"综述 / 总结当今 / 学习 X / 什么是 X / 最新进展"
L3.numerical多 log 尺度 + OEIS/LMFDB + failure search5-10 sanity 点
L3.conjecture-gen必做跳过
L3.formal-verifier关键定理建议跳过
§"实质贡献声明"(a)(b)(c) ≥ 1,否则 down-grade-to-B可全 (d)
§Predictions≥ 2 条可证伪可选
Reviewer 独立复现必做可选
Editor Persona v1.5必做(target tier + 上一级)可选
档位完整 topic 规模时间典型 paper tier 上限
standard~150 agent / \$60-150半天Tier B(JNT / Math.Comp / Acta Arith)
deep~260 agent / \$130-2801-2 天Tier A(Compositio / Crelle / FoM Pi)
marathon~420+ agent / \$250-700数天-数周Tier A(限函数域 / 显式不等式类 topic)

诚实声明:本 pipeline 在 v1.5 后仍不可能产 Tier S(Annals / JAMS / Inventiones)级 paper。详见 audit 报告SKILL.md 版本记录

📋 阶段总览(点击跳转)
  1. Stage 0 — 确认 + 模式检测
  2. Stage 1 — L0 Novelty Sentinel ⭐ + L0.75 Innovation Scanner ⭐ + Template 1(18 agent 头脑风暴)
  3. Stage 2 — 选 1-3 候选命题(用户)
  4. Stage 3 — Template 2 v2(5 层 / ~14 角色 / 命题)
  5. Stage 4 — Template 3(writer + reviewer + Stage 3.5 harmonize ⭐ + Stage 5 PDF + Stage 6 audit ⭐)
  6. Stage 5 — 发布到 public/research/explore/
  7. Stage 6 — agent_talks 记录(可选)
  8. 跨阶段共享状态文件
  9. 完整文档导航

Stage 0 — 确认 + 模式检测

0main thread 对话

0 sub-agent · 仅 main thread · 时间 ~5 分钟
  1. RECIPE.md 确认流程
  2. 检测研究模式(详见 MODES.md):默认 Mode A;触发短语切 Mode B
  3. 跟用户确认 topic / Path(2 或 3)/ 档位(standard / deep / marathon)
  4. 共同写"问题陈述 + 背景包"(200-300 字)
  5. decision_log.md 第一行:[mode] <date> ok mode=A|B reason=<>
  6. research_diary.jsonl 末 50 行,对每条 status=open 询问用户 continue / 重测 / 归档
背景包 + mode + tier 写入 decision_log

Stage 1 — L0 Novelty Sentinel ⭐ + L0.75 Innovation Scanner ⭐ + Template 1 头脑风暴

1.0L0 Novelty Sentinel ⭐ NEW v1.5 Phase 2

1 agent · ~30 秒 / ~\$0.5 · 必跑

用 arxiv MCP + OEIS + LMFDB 查命题最近 5 年是否已被实质覆盖。

L0.novelty-sentinel
arxiv 5 关键词组 × 10 篇 + OEIS(涉序列)+ LMFDB(涉 L 函数 / 椭圆曲线)
Sonnet 4.6

4 verdict 分流

fully-covered:≥ 1 篇近 5 年论文已证此命题或加强版 → 强烈建议 KILL,省 ~18 agent

substantially-novel → 正常进 Phase 1

⚠️ completely-novel → 红旗(可能问题不重要 / 错命题),继续但 ranker 提高门槛

verdict ≠ fully-covered 才继续

1.0.75L0.75 Innovation Scanner ⭐ NEW v1.7

1 agent · Opus 4.7 · ~3-5 分钟 / ~\$1 · 必跑(L0 通过后)

historical_innovations.md(15 个范式转换 case + 10 元 schema),挑 3-5 个最 promising schema 应用到本命题上。这是把"发明新对象"从抽象指令变成可机械迁移的类比规则

L0.75 Innovation Scanner
扫描 15 case(Bombelli i / Dedekind ideals / Galois / Cantor / Riemann surfaces & ζ / Fourier / Hilbert ∞-dim / Lebesgue / Schwartz / Grothendieck schemes / Connes NCG / Erdős / Furstenberg / Langlands),挑 Top 3 + 1 wild card + ≤ 2 元 schema
Opus 4.7

输出L0.75_innovation_scanner.md 喂给 Phase 1 各角度 agent。每个角度若 match 某 schema,必须显式调用其抽象规则(不只是 mention,而是机械应用)。

为什么必要:LLM 默认产"平均数学"(搜索现有 vs 发明新)。Tier A/S 级原创理论历史上几乎全来自范式转换。给 LLM 显式 schema 库比抽象"想想新对象"指令有意义地有效。

L0.75_innovation_scanner.md 喂给 Phase 1

1Template 1 — 4 阶段头脑风暴

18 agent(Path 3)· ~15-25 分钟 · \$3-6(Opus 4.7)· 仅 Path 3 才跑(Path 2 跳过)
Phase 1:10 个角度 agent 并行

10 个 general-purpose agent 同一条 main message 里发 10 次 invoke。每个 agent 1 个角度(Q1-Q10),不联网,纯思考。

Q1 历史方法重用
5 大手法哪些可改造?
Opus 4.7
Q2 跨学科类比
物理/生物/CS 同形对应物
Opus 4.7
Q3 算法迁移
ML / 量子 / SAT
Opus 4.7
Q4 经典启示
Euler / Dirichlet 变形
Opus 4.7
Q5 等价重述
动力 / 几何 / 范畴语言
Opus 4.7
Q6 拆分逼近
阶梯式拆分
Opus 4.7
Q7 新框架
需发明什么对象
Opus 4.7
Q8 信息论
Kolmogorov / PRF
Opus 4.7
Q9 跨猜想杠杆
哪个大猜想可蕴含
Opus 4.7
Q10 反证
假设否定推矛盾
Opus 4.7
Phase 2:5 个题对 agent 并行

(Q1+Q4) (Q2+Q3) (Q5+Q6) (Q7+Q8) (Q9+Q10) 各启 1 agent,找协同 + 张力。

Phase 3:2 个跨主题大综合 agent 并行

(Q1,Q3,Q4,Q5,Q9 体系内) + (Q2,Q6,Q7,Q8,Q10 跨界) 各 1 agent,找跨题大主题 + 5-10 年新结果路径。

Phase 4:1 个最终综合 agent

读全部 17 份产出,写 HTML §13 章节:§13.1 角度速览 / §13.2 题对 / §13.3 大综合 / §13.4 重定义 / §13.5 高优先级可攻命题(3-5 个)/ §13.6 局限性。

§13.5 命题清单

Stage 2 — 选 1-3 候选命题

2main thread 跟用户讨论

0 agent · ~5 分钟

选择标准:

典型 N = 1-3。N = 1 适合 smoke test 或单点深挖;N = 3 标准多角度攻坚。

N 个命题进入 Template 2 v2

Stage 3 — Template 2 v2(每个命题独立跑)

每个命题:~40 agent(standard)/ ~70(deep)/ ~120+(marathon)。下面以 standard 单命题为例。

3Coordinator 中央调度(贯穿所有 5 层)

1 agent · 持续运行 · 读 decision_log + research_diary,路由所有事件
Coordinator
事件 × 动作矩阵:ok / warn / FAIL / kill / [REQUEST_NUMERICAL] / [L3.conjecture] / [L3.formal] / [stage5.escalate] / [downgrade]
Opus 4.7

3.1L1 Brainstorm — 命题级思路探索

7 agent · L1.angle ×5 并行 → L1.ranker → L1.sentinel · ~15 分钟
L1.angle ×5
5 个角度并行单题深探
Opus 4.7
L1.ranker
读 5 份 → 4 项打分排名 → HTML §1
Opus 4.7
L1.sentinel ⭐
数值哨兵:5-10 行 Python 验证量级断言
Opus 4.7
L1 ranker 最高分 < 14 → kill;写"无可攻候选"备忘

3.2L2 Literature — 文献调研

2 agent · search → reader 串行 · ~30-60 分钟(含 arxiv 限速 sleep)
L2.search
arxiv API 5-7 关键查询,下载 5-8 篇 PDF(UA + 5s 间隔)
Sonnet 4.6
L2.reader
深读 4-6 篇关键 PDF,提取主定理 + 假设 + 引用
Sonnet 4.6
L2.reader 找到"已证此命题"或"已被反驳"的论文 → kill;写备忘

3.3L3 Research — 主体(14 agent 全并行 + reactive loop)

14 base agent + ~10 reactive · 全并行 · ~30 分钟(含双向循环)
基础 12 个并行 agent(v1.0 起)
L3.numerical ×3 ⭐
多 log 尺度 + OEIS/LMFDB + failure search + 工具升级链 sympy→PARI→GAP→mathlib→PySR
Sonnet 4.6
L3.prover ×3 ⭐
写证明草稿 + [REQUEST_NUMERICAL] hooks(≥ 3 round 双向循环)
Opus 4.7
L3.advocate ×3 ⭐
反方:找循环论证 / 反例 / 隐含假设
Opus 4.7
L3.lit-integrator ×3
每条引理回查 PDF 核实精确陈述
Sonnet 4.6
v1.3 新增 2 个(仅 Mode A)
L3.conjecture-generator
数据 → 可证伪推测:sympy.nsimplify + scipy.optimize + PySR;hold-out R² 门槛
Opus 4.7
L3.formal-verifier
Lean 4 statement type-check(proof 用 sorry);杜绝 vacuous lemma
Opus 4.7
L3.numerical FAIL(实测 vs 理论偏离 > 1 OOM) → feedback → L1 重排
L3.advocate 找到反例 → kill
长任务模式(> 5 min 计算):agent 写脚本到 code/long_jobs/<job_id>.py,不直接跑;main thread 用 Bash run_in_background=true 启动;后续 agent 等 <job_id>.out 末行 [done] 后读取。

3.4L4 Review — 4 类专家投票

4 agent · 全并行 · ~20 分钟
L4.analyst
解析数论:积分估计 / L 函数 / 解析延拓
Opus 4.7
L4.algebraist
代数数论:结构论证 / 引理代数严格性
Opus 4.7
L4.numerist
数值实验:程序正确性 / 统计样本代表性
Opus 4.7
L4.advocate
对手专家:找剩余漏洞 / 隐藏假设
Opus 4.7
≥ 3 票 reject(重大缺陷不可修复)→ kill

3.5L5 Summary — 决策 + §"实质贡献声明" + §Predictions

2 agent · summary → decision 串行 · ~10 分钟
L5.summary ⭐
读 L1-L4 全部 ~25 份产出,回答 4 问 + §"实质贡献声明" (a)/(b)/(c)/(d) + §Predictions ≥ 2
Opus 4.7
L5.decision
GO / GO-revision / GO-strong / NO-GO 4 选 1
Opus 4.7
(a)(b)(c) 全空(Mode A) → 触发 [downgrade],提示用户切 Mode B 或重做
每个命题独立产出 verdict

Stage 4 — Template 3(GO 命题转 paper;可选)

仅在 L5.decision = GO / GO-revision / GO-strong 时询问用户是否启动。N = GO 命题数。

4.0Stage 0-1 — 方向 + 哨兵

0 agent(main thread)· ~5 分钟

4.2Stage 2 — N 个 writer 并行(含 R1-R4 + SOTA gap)

N agent · 同条 message N 次 invoke · ~30 分钟
Writer ×N
写 main.tex:§1 含 §"精确 SOTA gap 声明" + §"实质贡献声明" + §Predictions + §Reproducibility
Opus 4.7
v1.5 Phase 1 反 bloat 4 规则(writer 自查)

R1 demote-conditional:≥ 2 不可证 hypothesis → 主结果必须 \begin{conjecture}

R2 forthcoming-flag:含 "forthcoming / sketch / defer to Appendix A / details elsewhere" → abort,标 [unfinished_paper],回 prover

R3 length-by-content:(a)=0 → ≤ 12pp;(a)≥1 → ≤ 25pp;unconditional (a) → ≤ 35pp

R4 cite-and-Note:主定理是 ≤ 2 引文 corollary → 改 6pp Note 投 LMS Bull / Mathematika short-note

(a)(b)(c) 全空(Mode A) → 标 down-grade-to-B,main thread 决定切 Mode B 或重做
writer K 一完成 → reviewer K 立即起(流式)

4.3Stage 3 — N 个 reviewer 流式(含独立复现 + R1-R4 审视 + Editor Persona ⭐)

N agent · 流式启动(与剩余 writer 并行)· ~30 分钟
Reviewer ×N(流式)
10 步审稿:找 hand-wave / Edit 修 / 独立复现(不同实现)/ §Predictions 审视 / R1-R4 / SOTA gap / Editor Persona ⭐ / referee report
Opus 4.7
v1.5 Reviewer 第 6-8 步硬约束(mode=A 必做)

第 6 步:R1-R4 合规审视 — 数依赖的不可证假设 / 搜全文 forthcoming 字眼 / 数 (a) 类定理 + 长度 / 判断是否单引文 corollary

第 7 步:§"精确 SOTA gap 声明"审视 — 三行模板存在吗?引文真实吗?gap 数值化诚实吗?

第 8 步:Editor Persona ⭐ NEW v1.5 Phase 3 — 模拟 target tier + 上一级 tier 主编 desk-review,写"desk-reject 信"暴露 weak spots,verdict 取更严苛者

R2 forthcoming 触发[R2-unfinished]禁止编译,回 prover
if reviewer Edit ≥ 5 处 OR demote theorem OR R1-R4 触发

4.3.5Stage 3.5 — Writer-harmonize ⭐ NEW v1.6 Loop A(自动触发)

≤ N agent · 自动触发;无 reviewer 修改时不起 · ~5 分钟 / 篇
Writer-harmonize
读 main.tex + reviewer report + reproduction note;同步 abstract / §1 intro / SOTA gap / 实质贡献 / Discussion 与新版正文。不动数学,仅 narrative
Opus 4.7

这是 hygiene 不是 polish:abstract 与正文不一致在任何 tier 都会 desk-reject。real author 拿到 referee report 后会自己修 narrative;pipeline 之前没人代替作者做这个 sync。

触发条件(任一):reviewer Edit ≥ 5 处 / demote 任意 \begin{theorem} / R1-R4 任一旗标。硬上限:1 round。

4.4Stage 4 — main thread 五色汇总

0 agent · 仅 main thread

五色状态表(🟢 绿 / 🟡 黄 / 🔴 红)+ 每篇 verdict + 推荐期刊(含 Editor Persona 输出的 target tier 调整)+ 实操建议(立即投 / 修一轮 / 弃)。

4.5Stage 5 — 编译 PDF(main thread 调脚本)+ fixup loop

0 base agent + ≤ 2N 可能的 fixup agent · 编译 ~2 min/篇

编译前预检(v1.5):reviewer report 含 [R2-unfinished]跳过该 paper 编译,写 [stage5.skip.r2][R3-overlength] → 警告;[R4-corollary-note] → 改 target venue。

tools/latex_compile_papers.sh:两遍 pdflatex(让 \ref/\cite 收敛),每篇报 size + 页数。

paper_/main.{tex,pdf} + reproduction_note.md(含 Editor Persona)

4.6Stage 6 — Deep Audit Loop C ⭐ NEW v1.6(用户 opt-in,默认跳过)

0–N agent · 用户主动选 light / full / skip · ~5–20 分钟 / 篇

自动触发。Stage 5 PDF 编译 + Stage 4 五色汇总打出后,main thread 主动询问用户:

✅ Template 3 已完成。Stage 4 五色:
  paper1_<slug>: 🟢 (target=JNT, accept-weak)
  paper2_<slug>: 🟡 (target=Math.Comp, major-revision)

要不要跑 Loop C deep audit?让 prover 重读自己的证明、找 [handwave] / [GAP]、必要时自修。

  1. skip 全部(推荐 C tier paper / 急投稿 / 探索性命题)
  2. light:所有 GO paper 跑自审标注(不改 main.tex)   ~每篇 +$1 / +5 分钟
  3. full:选定 paper 跑自审 + 自修 + 重新编译         ~每篇 +$3 / +20 分钟
          强烈推荐给 target = Compositio / Crelle / FoM Pi 的 paper

格式:[1 / 2 / 3:paper1,paper3 / mix:1=light,3=full]
Stage 6.1 — audit-light
读 main.tex,对每条 step 标 [solid] / [handwave] / [GAP] / [redundant];写 audit_light.md;不修 .tex
Opus 4.7
Stage 6.2 — audit-full(4 round)
round 1 自审 → round 2 外审模拟 → round 3 自修(Edit main.tex)→ round 4 终审 + harmonize;写 audit_full_report.md
Opus 4.7
4 round 仍未收敛 → 标 [audit-stuck],停 loop,转人工

为什么 opt-in:边际价值随 paper tier 变化大(C tier ~0;B tier 中;A tier 不可替代;S tier 必跑但 pipeline 达不到)。强制全跑浪费 C/B tier 预算;强制不跑让 A tier 不及格。让用户根据 Editor Persona verdict 决定。

用户选 1 / 2 / 3 → 跳到 Stage 5 publish

Stage 5 — 发布到 public/research/explore/

5publish_topic.sh 一键

0 agent · ~30 秒
  1. 归到 work/<topic>/
  2. multi-agent-research/ 内部链接(→ ../multi-agent-research/
  3. templates/topic_index.html 创建 work/<topic>/index.html landing page
  4. scripts/publish_topic.sh <topic> public/research/<area>.html
  5. 手动编辑 public/research/<area>.html,照 templates/explore_paper_link.html 加 2 处链接
  6. git commit

Stage 6 — agent_talks 记录(可选)

6/agent-talks:update

slash command · 自动归档对话历史到 ./agent_talks/

跨阶段共享状态文件

📁 5 个核心 state file

文件位置由谁写由谁读
decision_log.md reference_<topic>_research/prop<N>/ 所有 agent 完成时追加一行 Coordinator 实时读,事件路由
research_diary.jsonl reference_<topic>_research/(topic 级,跨 prop) Coordinator 在每层完成后追加 JSON Coordinator 启动时必读末 50 行(跨 session resume)
L0_novelty_report.md /tmp/<project>_brainstorm/ L0.novelty-sentinel main thread + 下游 tier-ceiling 决策
L3_prover_requests_*.md /tmp/<project>_brainstorm/prop<N>/ L3.prover 写 [REQUEST_NUMERICAL] 行 Coordinator 触发 reactive numerical 验证
reproduction_note.md paper<K>_<slug>/(每篇 paper 一份) Reviewer agent(独立复现 + Editor Persona) Stage 4 汇总 + 投稿时人工参考

研究日记示例

{"date":"2026-05-27","session":"goldbach_hl_smoke_v1.3","prop":1,"layer":"L3.numerical","mode":"A",
 "hypothesis":"r(n) HL 主项","data_range":"n in [10^2,10^6]",
 "result":"R²=0.9997 fit a·log log p+b","status":"open","next":"extend to 10^9 with PARI",
 "artifact":"data/L3num_07.csv","run_time_s":1843}

🎯 完整 decision_log.md 事件类型

[mode]               2026-MM-DD ok      mode=A reason=default          ← Coordinator 第一行必写
[diary.resume]       2026-MM-DD ok      open_count=N                   ← Coordinator 启动检查
[L0.novelty]         2026-MM-DD ok      verdict=substantially-novel tier_ceiling=B   ← v1.5 Phase 2
[L0.75.innovation]   2026-MM-DD ok      n_high_match=3 top_schema=Dedekind_ideals     ← v1.7 范式 schema 类比
[L1.angle.A] / .B / .C / .D / .E
[L1.ranker]          2026-MM-DD ok|kill best=<> top_score=<>
[L1.sentinel]        2026-MM-DD ok|warn|FAIL ratio=<>                  ← 量级哨兵
[L2.search]          2026-MM-DD ok      n_papers=<>
[L2.reader]          2026-MM-DD ok|kill verdict=<a|b|c|d>
[L3.numerical.<id>]  2026-MM-DD ok|FAIL ratio_at_10^6=<> oeis=<>
[L3.prover.<id>]     2026-MM-DD ok|gap rounds=<> verified_lemmas=<>
[L3.prover→numerical]2026-MM-DD ok      lemma=<id> range=<> result=ok    ← v1.3 双向循环 hook
[L3.advocate.<id>]   2026-MM-DD accept|challenge|reject
[L3.lit.<paper>]     2026-MM-DD ok|misquote|insufficient
[L3.conjecture]      2026-MM-DD ok      n_generated=<> top_R2=<>        ← v1.3 仅 Mode A
[L3.formal]          2026-MM-DD ok|skip build=<>                       ← v1.3 仅 Mode A
[L4.<expert>]        2026-MM-DD pass|fixable|reject
[L5.summary]         2026-MM-DD ok      mode=A contributions={a:n,b:n,c:n,d:n} predictions=N
[L5.decision]        2026-MM-DD GO|GO-revision|GO-strong|NO-GO rec=<>
[downgrade]          2026-MM-DD warn    mode_was=A reason=no_substantive_contribution   ← Mode A → B
[stage2.writer.<K>]  2026-MM-DD ok      paper<K>_<slug> pages=<>       ← T3
[stage3.reviewer.<K>]2026-MM-DD accept|reject|reproduction-fail        ← T3
[stage3.harmonize.<K>]2026-MM-DD ok|noop n_edits=<>                    ← v1.6 Loop A 自动
[stage5.skip.r2]     2026-MM-DD warn    paper<K> reason=unfinished_paper ← v1.5 R2
[stage5.escalate]    2026-MM-DD warn    paper<K> fixup_rounds=2 reason=<>
[stage6.audit-light.<K>]2026-MM-DD ok n_handwave=<> n_gap=<>            ← v1.6 Loop C opt-in
[stage6.audit-full.<K>] 2026-MM-DD ok|stuck rounds_used=<>             ← v1.6 Loop C opt-in

完整文档导航

用途文档
🎯 触发 skill / 机制定义SKILL.md
🎨 模式 A/B 切换定义MODES.md
🏛️ 历史范式 schema 库(v1.7)historical_innovations.md(15 case + 10 元 schema)
📘 9 步 Recipe + 实施细节RECIPE.md · HTML
🧠 Template 1(头脑风暴 + L0 sentinel).md · .html
🔬 Template 2 v2(命题深挖 + 双向循环).md · .html
📝 Template 3(writer + reviewer + R1-R4 + Editor Persona).md · .html
📋 17+ Verbatim agent prompts(copy-paste ready)agent_prompts_verbatim.md
🎬 实战样本输出(Mersenne v1)examples/README.md
🚀 一键 publish 脚本publish_topic.sh
📐 LaTeX 编译工具latex_compile_papers.sh · setup.md
📦 完整 v1 备份(27 文件 zip)skill-math-deep-dive-v1.zip

已验证 topics(实战记录)

Topic版本命题数Agent 数Paper 数Tier 分布
Mersenne 素数无穷性v1.0(Sonnet 4.6)5~75research notes only
Legendre 函数域 P4v1.1(Opus 4.7)1(多 paper)~1051 B / 2 C / 1 D / 1 C
Riemann deep-divev1.140 B / 3 C / 1 D
Weil analogyv1.11150 B / 2 C / 3 D
Goldbach H-Lv1.3 smoke test1~2611 C/D(GO-revision)
de Polignacv1.411 C

v1.5 后预期分布(基于 audit 反推):Tier D 数量 → 0(R2 在编译前拦掉),Tier C 保持,Tier B 从 1 → 4-5,Tier A 0 → 1-2(限函数域类)。