ARIS 自动审稿循环实战:/auto-review-loop 如何让论文一夜从 5/10 涨到 7.5/10
2026/9/21 19:04:28 网站建设 项目流程

ARIS 自动审稿循环实战:/auto-review-loop 如何让论文一夜从 5/10 涨到 7.5/10

【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep

ARIS(Auto-Research-In-Sleep)自动科研是一套轻量的 Markdown 技能系统,它的核心技能/auto-review-loop自动审稿循环,能让 AI 审稿评分在一夜之间从5/10(borderline reject)爬升到 7.5/10(submission ready)——审稿模型打分、执行模型自动修改、再评,最多循环 4 轮,全程无需人工干预。

对新手来说,这个工作流的价值可以一句话概括:你睡觉时,AI 在替你改论文。本文带你从零跑通这条自动审稿循环,并用一次真实运行逐轮复盘评分是如何涨上去的。


一、ARIS 是什么:睡觉时自动审稿改稿的科研工作流

ARIS 的整个技能层只是纯 Markdown 文件——没有框架、没有数据库、没有 Docker。每个技能就是一个SKILL.md,任何 LLM Agent 都能读懂并执行。

自动审稿循环的工作方式是一个"跨模型"分工:

角色默认模型职责
🛠️ 执行模型(Executor)Claude Code读评审意见 → 改代码/跑实验 → 重写叙述
🧐 审稿模型(Reviewer)Codex(GPT-6-Astra xhigh)以 NeurIPS/ICML 级别审稿人身份打分、挑刺

为什么必须用两个不同模型?因为同一模型自我评审容易掉进"局部最优"——它看不见自己的盲区。跨模型评审是"对抗式"的:审稿人会主动去戳执行者没预料到的弱点,这正是分数能持续上涨的关键。

核心技能定义:skills/auto-review-loop/SKILL.md


二、一键安装:3 步跑通自动审稿循环

步骤 1:克隆仓库并安装技能

git clone https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep.git bash Auto-claude-code-research-in-sleep/tools/install_aris.sh ~/your-project

安装脚本 tools/install_aris.sh 会把技能以软链接方式装进项目的.claude/skills/,并记录安装清单,可重复执行来同步新增技能。

步骤 2:注册 Codex 审稿桥接

审稿模型通过项目自带的 MCP 桥接调用,无需额外 API Key(用 ChatGPT 订阅即可):

claude mcp add codex -s user -- python3 "$(pwd)/Auto-claude-code-research-in-sleep/mcp-servers/codex-exec/server.py"

桥接实现见 mcp-servers/codex-exec/server.py。

步骤 3:重启并验证

重启 Claude Code 后执行claude mcp list,确认codex: ... server.py - ✔ Connected即可开工。


三、启动命令与参数速查

在项目目录里打开 Claude Code,一条命令启动:

/auto-review-loop "你的论文主题或范围"

通过后缀可以覆盖默认参数,最常用的三个:

参数默认值说明
difficultymedium审稿强度:medium/hard/nightmare
human checkpointfalse每轮评审后暂停,等你确认再继续
render htmltrue循环结束后把评审日志渲染成 HTML

示例——开启人工检查点 + 加难度:

/auto-review-loop "my paper topic" — difficulty: hard, human checkpoint: true

两条内置"铁律"决定了循环如何结束:

  • MAX_ROUNDS = 4:最多 4 轮,防止无限烧 token;
  • 停止条件:评分 ≥ 6/10结论 ∈ {ready, almost},两者必须同时满足才停(分数再高但结论是 "not ready" 也会继续)。停止判定由 tools/review_gate.py 严格执行。

四、真实一夜运行复盘:评分如何从 5.0 涨到 7.5

这是 README 中记录的一次真实 4 轮过夜运行:循环自主执行了20+ 个 GPU 实验、重写了叙述框架、并砍掉了一条经不起验证的结论。评分曲线如下:

逐轮拆解每一分是怎么涨上来的:

轮次评分发生了什么
初始5.0/10borderline reject
Round 16.5/10补上标准评测指标,发现了指标解耦问题
Round 26.8/10关键结论复现失败,主动调整了叙述角度
Round 37.0/10大规模随机种子实验"杀死"了主改进结论
Round 47.5/10诊断性证据坐实,达到可投稿状态

注意 Round 2 和 Round 3:审稿人不是只说"这里不好",而是逼着执行模型去验证——复现失败就换叙述,种子实验不显著就砍掉结论。这种"对抗式打磨"让最终分数是真实可信的,而不是靠话术哄出来的。

每轮产出都会追加写入review-stage/AUTO_REVIEW.md(累计日志),状态持久化在review-stage/REVIEW_STATE.json,会话被压缩或中断后都能从断点恢复。


五、三档审稿难度:medium / hard / nightmare

difficulty: hard

不同强度对应不同的"审稿人人格":

难度审稿行为适合场景
🟢medium(默认)MCP 评审,执行模型控制审稿人可见上下文日常迭代
🟠hard审稿人记忆+辩论协议:审稿人跨轮跟踪自己的怀疑,执行模型可以申诉(Rebuttal),审稿人裁定 SUSTAINED / OVERRULED重要稿件
🔴nightmare审稿人通过codex exec直接读仓库,执行模型无法过滤它看到的内容,并独立核验"代码与结论是否一致"投稿前压力测试

审稿人记忆存放在review-stage/REVIEWER_MEMORY.md,只追加、不修改——审稿人每轮都会检查上一轮的怀疑是否被真正解决,还是只是"绕过去了"。


六、飞书推送 + 人工检查点:跑过夜也不失控

自动循环跑一整夜,最怕的是"它挂了不知道"或"它改歪了不知道"。ARIS 给了三层保障:

1. 飞书实时推送📱

配置飞书后,每轮评审结束即推送Round N: X/10 — 结论 + Top 3 弱点interactive模式下结论为 "almost" 时会在飞书上等你回复"继续 or 停止"。技能见 skills/feishu-notify/SKILL.md。

2. 人工检查点

human checkpoint: true时每轮评审后暂停,展示评分与弱点,你可以回复go(全采纳)、skip 2(跳过第 2 条修复)、或stop(提前终止)。

3. 看门狗

tools/watchdog.py 监控无人值守循环的状态文件更新,一旦长时间无动静就发出告警——它只报警,不擅自重启。


七、社区实战:8/10 与 AAAI 2026 的 7/10

社区已经有多篇论文完整走完 ARIS 流程(注意:以下均为AI 评审信号,用于展示自动审稿循环的打磨效果,不等于顶会录用):

论文AI 评审信号执行方式
CS 会议投稿8/10— "Top 50% of accepted papers, clear accept"全流程:想法 → 实验 → 自动审稿 → 写作
AAAI 2026 主会投稿7/10— "Good paper, accept"纯 Codex CLI 驱动

README 还记录了/auto-paper-improvement-loop(写作侧的同款循环)在 ICLR 2026 理论论文上的实测:4/10 → 8.5/10,3 轮内修掉假设矛盾、软化过度声明、补齐合成验证。


八、新手避坑:5 条实用经验

  1. ⛔ 不要用/loop/schedule或 Cron 包裹它。/auto-review-loop内部自带循环,且审稿人通过 threadId 携带跨轮记忆;外部定时器每次都是全新会话,记忆清零,只按墙钟时间触发——零新信息,全量 token 成本。
  2. 分数 ≥ 6 但不 stop?检查结论词。"not ready" 的高分不满足停止条件,属于正常行为。
  3. 别试图藏弱点骗分。技能的关键规则明确:诚实记录负面结果与失败实验;修完再重评,而不是"承诺下次改"。
  4. 长实验并行等。实验超过 30 分钟就先挂到 GPU 服务器,同时继续做其他修复,回来收结果。
  5. 上游更新要手动拉。定期执行git pull && bash tools/smart_update.sh --apply(见 tools/smart_update.sh)保持技能最新。

九、相关文件导航

内容路径
自动审稿循环技能定义skills/auto-review-loop/SKILL.md
审稿路由与跨模型身份规则skills/shared-references/reviewer-routing.md
停止条件判定器tools/review_gate.py
Codex 审稿 MCP 桥接mcp-servers/codex-exec/server.py
安装 / 更新脚本tools/install_aris.sh · tools/smart_update.sh
写作侧改进循环skills/auto-paper-improvement-loop/SKILL.md
LLM 审稿备选后端skills/auto-review-loop-llm/SKILL.md
项目主文档README.md

一句话总结:/auto-review-loop交给夜里运行,第二天早上你收获的不只是一个更高的分数,而是一篇被"对手模型"反复锤过、砍掉假结论、证据链扎实的论文——这正是它从 5/10 到 7.5/10 的完整秘密。

【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询