ARIS 自动审稿循环实战:/auto-review-loop 如何让论文一夜从 5/10 涨到 7.5/10
【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep
ARIS(Auto-Research-In-Sleep)自动科研是一套轻量的 Markdown 技能系统,它的核心技能/auto-review-loop自动审稿循环,能让 AI 审稿评分在一夜之间从5/10(borderline reject)爬升到 7.5/10(submission ready)——审稿模型打分、执行模型自动修改、再评,最多循环 4 轮,全程无需人工干预。
对新手来说,这个工作流的价值可以一句话概括:你睡觉时,AI 在替你改论文。本文带你从零跑通这条自动审稿循环,并用一次真实运行逐轮复盘评分是如何涨上去的。
一、ARIS 是什么:睡觉时自动审稿改稿的科研工作流
ARIS 的整个技能层只是纯 Markdown 文件——没有框架、没有数据库、没有 Docker。每个技能就是一个SKILL.md,任何 LLM Agent 都能读懂并执行。
自动审稿循环的工作方式是一个"跨模型"分工:
| 角色 | 默认模型 | 职责 |
|---|---|---|
| 🛠️ 执行模型(Executor) | Claude Code | 读评审意见 → 改代码/跑实验 → 重写叙述 |
| 🧐 审稿模型(Reviewer) | Codex(GPT-6-Astra xhigh) | 以 NeurIPS/ICML 级别审稿人身份打分、挑刺 |
为什么必须用两个不同模型?因为同一模型自我评审容易掉进"局部最优"——它看不见自己的盲区。跨模型评审是"对抗式"的:审稿人会主动去戳执行者没预料到的弱点,这正是分数能持续上涨的关键。
核心技能定义:skills/auto-review-loop/SKILL.md
二、一键安装:3 步跑通自动审稿循环
步骤 1:克隆仓库并安装技能
git clone https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep.git bash Auto-claude-code-research-in-sleep/tools/install_aris.sh ~/your-project安装脚本 tools/install_aris.sh 会把技能以软链接方式装进项目的.claude/skills/,并记录安装清单,可重复执行来同步新增技能。
步骤 2:注册 Codex 审稿桥接
审稿模型通过项目自带的 MCP 桥接调用,无需额外 API Key(用 ChatGPT 订阅即可):
claude mcp add codex -s user -- python3 "$(pwd)/Auto-claude-code-research-in-sleep/mcp-servers/codex-exec/server.py"桥接实现见 mcp-servers/codex-exec/server.py。
步骤 3:重启并验证
重启 Claude Code 后执行claude mcp list,确认codex: ... server.py - ✔ Connected即可开工。
三、启动命令与参数速查
在项目目录里打开 Claude Code,一条命令启动:
/auto-review-loop "你的论文主题或范围"通过—后缀可以覆盖默认参数,最常用的三个:
| 参数 | 默认值 | 说明 |
|---|---|---|
difficulty | medium | 审稿强度:medium/hard/nightmare |
human checkpoint | false | 每轮评审后暂停,等你确认再继续 |
render html | true | 循环结束后把评审日志渲染成 HTML |
示例——开启人工检查点 + 加难度:
/auto-review-loop "my paper topic" — difficulty: hard, human checkpoint: true两条内置"铁律"决定了循环如何结束:
- MAX_ROUNDS = 4:最多 4 轮,防止无限烧 token;
- 停止条件:评分 ≥ 6/10且结论 ∈ {ready, almost},两者必须同时满足才停(分数再高但结论是 "not ready" 也会继续)。停止判定由 tools/review_gate.py 严格执行。
四、真实一夜运行复盘:评分如何从 5.0 涨到 7.5
这是 README 中记录的一次真实 4 轮过夜运行:循环自主执行了20+ 个 GPU 实验、重写了叙述框架、并砍掉了一条经不起验证的结论。评分曲线如下:
逐轮拆解每一分是怎么涨上来的:
| 轮次 | 评分 | 发生了什么 |
|---|---|---|
| 初始 | 5.0/10 | borderline reject |
| Round 1 | 6.5/10 | 补上标准评测指标,发现了指标解耦问题 |
| Round 2 | 6.8/10 | 关键结论复现失败,主动调整了叙述角度 |
| Round 3 | 7.0/10 | 大规模随机种子实验"杀死"了主改进结论 |
| Round 4 | 7.5/10✅ | 诊断性证据坐实,达到可投稿状态 |
注意 Round 2 和 Round 3:审稿人不是只说"这里不好",而是逼着执行模型去验证——复现失败就换叙述,种子实验不显著就砍掉结论。这种"对抗式打磨"让最终分数是真实可信的,而不是靠话术哄出来的。
每轮产出都会追加写入review-stage/AUTO_REVIEW.md(累计日志),状态持久化在review-stage/REVIEW_STATE.json,会话被压缩或中断后都能从断点恢复。
五、三档审稿难度:medium / hard / nightmare
difficulty: hard不同强度对应不同的"审稿人人格":
| 难度 | 审稿行为 | 适合场景 |
|---|---|---|
🟢medium(默认) | MCP 评审,执行模型控制审稿人可见上下文 | 日常迭代 |
🟠hard | 审稿人记忆+辩论协议:审稿人跨轮跟踪自己的怀疑,执行模型可以申诉(Rebuttal),审稿人裁定 SUSTAINED / OVERRULED | 重要稿件 |
🔴nightmare | 审稿人通过codex exec直接读仓库,执行模型无法过滤它看到的内容,并独立核验"代码与结论是否一致" | 投稿前压力测试 |
审稿人记忆存放在review-stage/REVIEWER_MEMORY.md,只追加、不修改——审稿人每轮都会检查上一轮的怀疑是否被真正解决,还是只是"绕过去了"。
六、飞书推送 + 人工检查点:跑过夜也不失控
自动循环跑一整夜,最怕的是"它挂了不知道"或"它改歪了不知道"。ARIS 给了三层保障:
1. 飞书实时推送📱
配置飞书后,每轮评审结束即推送Round N: X/10 — 结论 + Top 3 弱点;interactive模式下结论为 "almost" 时会在飞书上等你回复"继续 or 停止"。技能见 skills/feishu-notify/SKILL.md。
2. 人工检查点
human checkpoint: true时每轮评审后暂停,展示评分与弱点,你可以回复go(全采纳)、skip 2(跳过第 2 条修复)、或stop(提前终止)。
3. 看门狗
tools/watchdog.py 监控无人值守循环的状态文件更新,一旦长时间无动静就发出告警——它只报警,不擅自重启。
七、社区实战:8/10 与 AAAI 2026 的 7/10
社区已经有多篇论文完整走完 ARIS 流程(注意:以下均为AI 评审信号,用于展示自动审稿循环的打磨效果,不等于顶会录用):
| 论文 | AI 评审信号 | 执行方式 |
|---|---|---|
| CS 会议投稿 | 8/10— "Top 50% of accepted papers, clear accept" | 全流程:想法 → 实验 → 自动审稿 → 写作 |
| AAAI 2026 主会投稿 | 7/10— "Good paper, accept" | 纯 Codex CLI 驱动 |
README 还记录了/auto-paper-improvement-loop(写作侧的同款循环)在 ICLR 2026 理论论文上的实测:4/10 → 8.5/10,3 轮内修掉假设矛盾、软化过度声明、补齐合成验证。
八、新手避坑:5 条实用经验
- ⛔ 不要用
/loop、/schedule或 Cron 包裹它。/auto-review-loop内部自带循环,且审稿人通过 threadId 携带跨轮记忆;外部定时器每次都是全新会话,记忆清零,只按墙钟时间触发——零新信息,全量 token 成本。 - 分数 ≥ 6 但不 stop?检查结论词。"not ready" 的高分不满足停止条件,属于正常行为。
- 别试图藏弱点骗分。技能的关键规则明确:诚实记录负面结果与失败实验;修完再重评,而不是"承诺下次改"。
- 长实验并行等。实验超过 30 分钟就先挂到 GPU 服务器,同时继续做其他修复,回来收结果。
- 上游更新要手动拉。定期执行
git pull && bash tools/smart_update.sh --apply(见 tools/smart_update.sh)保持技能最新。
九、相关文件导航
| 内容 | 路径 |
|---|---|
| 自动审稿循环技能定义 | skills/auto-review-loop/SKILL.md |
| 审稿路由与跨模型身份规则 | skills/shared-references/reviewer-routing.md |
| 停止条件判定器 | tools/review_gate.py |
| Codex 审稿 MCP 桥接 | mcp-servers/codex-exec/server.py |
| 安装 / 更新脚本 | tools/install_aris.sh · tools/smart_update.sh |
| 写作侧改进循环 | skills/auto-paper-improvement-loop/SKILL.md |
| LLM 审稿备选后端 | skills/auto-review-loop-llm/SKILL.md |
| 项目主文档 | README.md |
一句话总结:把/auto-review-loop交给夜里运行,第二天早上你收获的不只是一个更高的分数,而是一篇被"对手模型"反复锤过、砍掉假结论、证据链扎实的论文——这正是它从 5/10 到 7.5/10 的完整秘密。
【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考