← Multi-Agent Research · index · RECIPE · MODES
完整 agent loop 可视化。覆盖 v1.5 (Phase 1+2+3) + v1.6 (Loop A 自动 / Loop C opt-in) + v1.7 (Innovation Scanner ⭐ 历史范式 schema 类比) 所有更新。每个框可点击进入对应模板的详细文档。
| 维度 | Mode A:实质研究(默认) | Mode B:综述(触发短语) |
|---|---|---|
| 触发 | 默认 | "综述 / 总结当今 / 学习 X / 什么是 X / 最新进展" |
| L3.numerical | 多 log 尺度 + OEIS/LMFDB + failure search | 5-10 sanity 点 |
| L3.conjecture-gen | 必做 | 跳过 |
| L3.formal-verifier | 关键定理建议 | 跳过 |
| §"实质贡献声明" | (a)(b)(c) ≥ 1,否则 down-grade-to-B | 可全 (d) |
| §Predictions | ≥ 2 条可证伪 | 可选 |
| Reviewer 独立复现 | 必做 | 可选 |
| Editor Persona v1.5 | 必做(target tier + 上一级) | 可选 |
| 档位 | 完整 topic 规模 | 时间 | 典型 paper tier 上限 |
|---|---|---|---|
| standard | ~150 agent / \$60-150 | 半天 | Tier B(JNT / Math.Comp / Acta Arith) |
| deep | ~260 agent / \$130-280 | 1-2 天 | Tier A(Compositio / Crelle / FoM Pi) |
| marathon | ~420+ agent / \$250-700 | 数天-数周 | Tier A(限函数域 / 显式不等式类 topic) |
诚实声明:本 pipeline 在 v1.5 后仍不可能产 Tier S(Annals / JAMS / Inventiones)级 paper。详见 audit 报告 与 SKILL.md 版本记录。
RECIPE.md 确认流程decision_log.md 第一行:[mode] <date> ok mode=A|B reason=<>research_diary.jsonl 末 50 行,对每条 status=open 询问用户 continue / 重测 / 归档用 arxiv MCP + OEIS + LMFDB 查命题最近 5 年是否已被实质覆盖。
4 verdict 分流:
[tier-ceiling=C],继续但下游 agent 自我调节期刊期望✅ substantially-novel → 正常进 Phase 1
⚠️ completely-novel → 红旗(可能问题不重要 / 错命题),继续但 ranker 提高门槛
读 historical_innovations.md(15 个范式转换 case + 10 元 schema),挑 3-5 个最 promising schema 应用到本命题上。这是把"发明新对象"从抽象指令变成可机械迁移的类比规则。
输出:L0.75_innovation_scanner.md 喂给 Phase 1 各角度 agent。每个角度若 match 某 schema,必须显式调用其抽象规则(不只是 mention,而是机械应用)。
为什么必要:LLM 默认产"平均数学"(搜索现有 vs 发明新)。Tier A/S 级原创理论历史上几乎全来自范式转换。给 LLM 显式 schema 库比抽象"想想新对象"指令有意义地有效。
10 个 general-purpose agent 同一条 main message 里发 10 次 invoke。每个 agent 1 个角度(Q1-Q10),不联网,纯思考。
(Q1+Q4) (Q2+Q3) (Q5+Q6) (Q7+Q8) (Q9+Q10) 各启 1 agent,找协同 + 张力。
(Q1,Q3,Q4,Q5,Q9 体系内) + (Q2,Q6,Q7,Q8,Q10 跨界) 各 1 agent,找跨题大主题 + 5-10 年新结果路径。
读全部 17 份产出,写 HTML §13 章节:§13.1 角度速览 / §13.2 题对 / §13.3 大综合 / §13.4 重定义 / §13.5 高优先级可攻命题(3-5 个)/ §13.6 局限性。
选择标准:
典型 N = 1-3。N = 1 适合 smoke test 或单点深挖;N = 3 标准多角度攻坚。
每个命题:~40 agent(standard)/ ~70(deep)/ ~120+(marathon)。下面以 standard 单命题为例。
[REQUEST_NUMERICAL] lemma=<id> range=<> → Coordinator 调一次 numerical 验证(≤ 5 min)→ 通过则加注脚 "verified up to n",失败则 prover 改引理 / 标 [GAP]。每条命题 ≥ 3 round。
code/long_jobs/<job_id>.py,不直接跑;main thread 用 Bash run_in_background=true 启动;后续 agent 等 <job_id>.out 末行 [done] 后读取。
[downgrade],提示用户切 Mode B 或重做仅在 L5.decision = GO / GO-revision / GO-strong 时询问用户是否启动。N = GO 命题数。
R1 demote-conditional:≥ 2 不可证 hypothesis → 主结果必须 \begin{conjecture}
R2 forthcoming-flag:含 "forthcoming / sketch / defer to Appendix A / details elsewhere" → abort,标 [unfinished_paper],回 prover
R3 length-by-content:(a)=0 → ≤ 12pp;(a)≥1 → ≤ 25pp;unconditional (a) → ≤ 35pp
R4 cite-and-Note:主定理是 ≤ 2 引文 corollary → 改 6pp Note 投 LMS Bull / Mathematika short-note
down-grade-to-B,main thread 决定切 Mode B 或重做第 6 步:R1-R4 合规审视 — 数依赖的不可证假设 / 搜全文 forthcoming 字眼 / 数 (a) 类定理 + 长度 / 判断是否单引文 corollary
第 7 步:§"精确 SOTA gap 声明"审视 — 三行模板存在吗?引文真实吗?gap 数值化诚实吗?
第 8 步:Editor Persona ⭐ NEW v1.5 Phase 3 — 模拟 target tier + 上一级 tier 主编 desk-review,写"desk-reject 信"暴露 weak spots,verdict 取更严苛者
[reproducibility-fail],verdict 降到 "major revision"[R2-unfinished],禁止编译,回 prover这是 hygiene 不是 polish:abstract 与正文不一致在任何 tier 都会 desk-reject。real author 拿到 referee report 后会自己修 narrative;pipeline 之前没人代替作者做这个 sync。
触发条件(任一):reviewer Edit ≥ 5 处 / demote 任意 \begin{theorem} / R1-R4 任一旗标。硬上限:1 round。
五色状态表(🟢 绿 / 🟡 黄 / 🔴 红)+ 每篇 verdict + 推荐期刊(含 Editor Persona 输出的 target tier 调整)+ 实操建议(立即投 / 修一轮 / 弃)。
编译前预检(v1.5):reviewer report 含 [R2-unfinished] → 跳过该 paper 编译,写 [stage5.skip.r2];[R3-overlength] → 警告;[R4-corollary-note] → 改 target venue。
跑 tools/latex_compile_papers.sh:两遍 pdflatex(让 \ref/\cite 收敛),每篇报 size + 页数。
[stage5.escalate],停 loop,转人工。
不自动触发。Stage 5 PDF 编译 + Stage 4 五色汇总打出后,main thread 主动询问用户:
✅ Template 3 已完成。Stage 4 五色:
paper1_<slug>: 🟢 (target=JNT, accept-weak)
paper2_<slug>: 🟡 (target=Math.Comp, major-revision)
要不要跑 Loop C deep audit?让 prover 重读自己的证明、找 [handwave] / [GAP]、必要时自修。
1. skip 全部(推荐 C tier paper / 急投稿 / 探索性命题)
2. light:所有 GO paper 跑自审标注(不改 main.tex) ~每篇 +$1 / +5 分钟
3. full:选定 paper 跑自审 + 自修 + 重新编译 ~每篇 +$3 / +20 分钟
强烈推荐给 target = Compositio / Crelle / FoM Pi 的 paper
格式:[1 / 2 / 3:paper1,paper3 / mix:1=light,3=full]
latex_compile_papers.sh 验证;失败走 Stage 5 reviewer-fixup loop[audit-stuck],停 loop,转人工为什么 opt-in:边际价值随 paper tier 变化大(C tier ~0;B tier 中;A tier 不可替代;S tier 必跑但 pipeline 达不到)。强制全跑浪费 C/B tier 预算;强制不跑让 A tier 不及格。让用户根据 Editor Persona verdict 决定。
work/<topic>/multi-agent-research/ 内部链接(→ ../multi-agent-research/)templates/topic_index.html 创建 work/<topic>/index.html landing pagescripts/publish_topic.sh <topic> public/research/<area>.htmlpublic/research/<area>.html,照 templates/explore_paper_link.html 加 2 处链接| 文件 | 位置 | 由谁写 | 由谁读 |
|---|---|---|---|
decision_log.md |
reference_<topic>_research/prop<N>/ |
所有 agent 完成时追加一行 | Coordinator 实时读,事件路由 |
research_diary.jsonl ⭐ |
reference_<topic>_research/(topic 级,跨 prop) |
Coordinator 在每层完成后追加 JSON | Coordinator 启动时必读末 50 行(跨 session resume) |
L0_novelty_report.md ⭐ |
/tmp/<project>_brainstorm/ |
L0.novelty-sentinel | main thread + 下游 tier-ceiling 决策 |
L3_prover_requests_*.md ⭐ |
/tmp/<project>_brainstorm/prop<N>/ |
L3.prover 写 [REQUEST_NUMERICAL] 行 | Coordinator 触发 reactive numerical 验证 |
reproduction_note.md |
paper<K>_<slug>/(每篇 paper 一份) |
Reviewer agent(独立复现 + Editor Persona) | Stage 4 汇总 + 投稿时人工参考 |
研究日记示例:
{"date":"2026-05-27","session":"goldbach_hl_smoke_v1.3","prop":1,"layer":"L3.numerical","mode":"A",
"hypothesis":"r(n) HL 主项","data_range":"n in [10^2,10^6]",
"result":"R²=0.9997 fit a·log log p+b","status":"open","next":"extend to 10^9 with PARI",
"artifact":"data/L3num_07.csv","run_time_s":1843}
[mode] 2026-MM-DD ok mode=A reason=default ← Coordinator 第一行必写
[diary.resume] 2026-MM-DD ok open_count=N ← Coordinator 启动检查
[L0.novelty] 2026-MM-DD ok verdict=substantially-novel tier_ceiling=B ← v1.5 Phase 2
[L0.75.innovation] 2026-MM-DD ok n_high_match=3 top_schema=Dedekind_ideals ← v1.7 范式 schema 类比
[L1.angle.A] / .B / .C / .D / .E
[L1.ranker] 2026-MM-DD ok|kill best=<> top_score=<>
[L1.sentinel] 2026-MM-DD ok|warn|FAIL ratio=<> ← 量级哨兵
[L2.search] 2026-MM-DD ok n_papers=<>
[L2.reader] 2026-MM-DD ok|kill verdict=<a|b|c|d>
[L3.numerical.<id>] 2026-MM-DD ok|FAIL ratio_at_10^6=<> oeis=<>
[L3.prover.<id>] 2026-MM-DD ok|gap rounds=<> verified_lemmas=<>
[L3.prover→numerical]2026-MM-DD ok lemma=<id> range=<> result=ok ← v1.3 双向循环 hook
[L3.advocate.<id>] 2026-MM-DD accept|challenge|reject
[L3.lit.<paper>] 2026-MM-DD ok|misquote|insufficient
[L3.conjecture] 2026-MM-DD ok n_generated=<> top_R2=<> ← v1.3 仅 Mode A
[L3.formal] 2026-MM-DD ok|skip build=<> ← v1.3 仅 Mode A
[L4.<expert>] 2026-MM-DD pass|fixable|reject
[L5.summary] 2026-MM-DD ok mode=A contributions={a:n,b:n,c:n,d:n} predictions=N
[L5.decision] 2026-MM-DD GO|GO-revision|GO-strong|NO-GO rec=<>
[downgrade] 2026-MM-DD warn mode_was=A reason=no_substantive_contribution ← Mode A → B
[stage2.writer.<K>] 2026-MM-DD ok paper<K>_<slug> pages=<> ← T3
[stage3.reviewer.<K>]2026-MM-DD accept|reject|reproduction-fail ← T3
[stage3.harmonize.<K>]2026-MM-DD ok|noop n_edits=<> ← v1.6 Loop A 自动
[stage5.skip.r2] 2026-MM-DD warn paper<K> reason=unfinished_paper ← v1.5 R2
[stage5.escalate] 2026-MM-DD warn paper<K> fixup_rounds=2 reason=<>
[stage6.audit-light.<K>]2026-MM-DD ok n_handwave=<> n_gap=<> ← v1.6 Loop C opt-in
[stage6.audit-full.<K>] 2026-MM-DD ok|stuck rounds_used=<> ← v1.6 Loop C opt-in
| 用途 | 文档 |
|---|---|
| 🎯 触发 skill / 机制定义 | SKILL.md |
| 🎨 模式 A/B 切换定义 | MODES.md |
| 🏛️ 历史范式 schema 库(v1.7) | historical_innovations.md(15 case + 10 元 schema) |
| 📘 9 步 Recipe + 实施细节 | RECIPE.md · HTML |
| 🧠 Template 1(头脑风暴 + L0 sentinel) | .md · .html |
| 🔬 Template 2 v2(命题深挖 + 双向循环) | .md · .html |
| 📝 Template 3(writer + reviewer + R1-R4 + Editor Persona) | .md · .html |
| 📋 17+ Verbatim agent prompts(copy-paste ready) | agent_prompts_verbatim.md |
| 🎬 实战样本输出(Mersenne v1) | examples/README.md |
| 🚀 一键 publish 脚本 | publish_topic.sh |
| 📐 LaTeX 编译工具 | latex_compile_papers.sh · setup.md |
| 📦 完整 v1 备份(27 文件 zip) | skill-math-deep-dive-v1.zip |
| Topic | 版本 | 命题数 | Agent 数 | Paper 数 | Tier 分布 |
|---|---|---|---|---|---|
| Mersenne 素数无穷性 | v1.0(Sonnet 4.6) | 5 | ~75 | — | research notes only |
| Legendre 函数域 P4 | v1.1(Opus 4.7) | 1(多 paper) | ~10 | 5 | 1 B / 2 C / 1 D / 1 C |
| Riemann deep-dive | v1.1 | 多 | — | 4 | 0 B / 3 C / 1 D |
| Weil analogy | v1.1 | 11 | — | 5 | 0 B / 2 C / 3 D |
| Goldbach H-L | v1.3 smoke test | 1 | ~26 | 1 | 1 C/D(GO-revision) |
| de Polignac | v1.4 | 多 | — | 1 | 1 C |
v1.5 后预期分布(基于 audit 反推):Tier D 数量 → 0(R2 在编译前拦掉),Tier C 保持,Tier B 从 1 → 4-5,Tier A 0 → 1-2(限函数域类)。