awesome-autoresearch:从Sakana AI-Scientist到AI-Researcher,25+个AI科学家与研究智能体系统盘点
【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch
awesome-autoresearch 是一份围绕 Karpathy autoresearch 灵感体系的高信度精选清单,系统盘点了 25+ 个 AI 科学家与研究智能体系统(AI Scientist / Research Agents),覆盖 7 大类 100+ 条资源:从 Sakana AI-Scientist 到 HKUDS AI-Researcher,再到自治自改进循环、跨平台移植、评测基准与真实落地案例。无论你是 AI 研究员、开发者还是产品经理,这份清单都是了解"AI 自主科研"生态的最佳入口。
🧠 为什么"AI 科学家"是当下最值得关注的 AI 方向
2025 年以来,AI 圈出现了一条全新的赛道:让 AI 自主做科研——从生成想法、检索文献、设计并运行实验,到撰写论文与同行评审,AI 正在从"写论文的工具"变成"研究者"本身。
其中两个项目被公认为这一浪潮的里程碑:
- Sakana AI-Scientist:首个面向全自动科学发现的综合系统,几乎无需人类监督即可完成从想法到论文的完整链条;
- HKUDS AI-Researcher(NeurIPS 2025 论文):端到端科研自动化系统,覆盖假设生成 → 实验 → 手稿撰写 → 同行评审的完整工作流。
而awesome-autoresearch的定位非常清晰:它不做穷举式搜索,而是一个"高信度索引",把受 karpathy/autoresearch 启发的自主改进循环、研究智能体系统与衍生项目做了系统性策展。
🔄 3 分钟搞懂:autoresearch 研究智能体循环
在看 25+ 系统的盘点之前,先花 3 分钟理解清单里几乎所有项目共同生长的"循环":
- 定目标:指定一个可度量指标(模型 loss、基准分数、解析速度……);
- 提变更:AI 智能体修改代码或提示词,提出一轮改进;
- 跑实验:在固定预算下自动运行实验,用固定评分器评估;
- 保留或回滚(keep-or-revert):指标变好就保留,变差就回滚并记录失败原因;
- 记录沉淀:每轮结果写入"实验台账",下一轮站在已有经验上继续优化。
关键设计在于:任务、评分器与证据始终保持固定,变量只有智能体提出的变更。这样每一次"进步"都可复现、可验证,而不是自我欺骗。
💡 "凡可度量,皆可优化"(If you can measure it, you can optimize it)——这是清单中多个衍生项目共享的核心哲学。
📁 项目结构速览:awesome-autoresearch 如何组织内容
整个仓库结构极简,内容集中在主文档中:
| 文件 | 作用 |
|---|---|
| README.md | 主清单:7 大类、100+ 条精选资源 |
| CONTRIBUTING.md | 贡献指南:收录标准、推荐条目格式、需避免的内容 |
| LICENSE | CC0-1.0 许可,可自由使用与转载 |
README.md 按出现顺序分为 7 大类:
| 分类 | 数量 | 一句话概括 |
|---|---|---|
| 🛠️ 通用自改进循环(General-purpose descendants) | 28 条 | 把 autoresearch 循环泛化到任意可度量目标 |
| 🔬 研究智能体系统(Research-agent systems) | 24 条 | 端到端的 AI 科学家 / 科研流水线 |
| 💻 平台移植与硬件分支(Platform ports) | 9 条 | Apple Silicon、WebGPU、多卡等跨设备适配 |
| 🎯 领域特定适配(Domain-specific adaptations) | 9 条 | 交易、语音、GPU 内核等跨场景落地 |
| 📊 评测与基准(Evaluation & benchmarks) | 5 条 | 衡量研究智能体能力的基准套件 |
| 📈 知名用例与深度文章(Notable use cases) | 16 条 | 真实跑出来的结果与复盘 |
| 📚 相关资源(Related resources) | 11 条 | 论文合集与策展清单 |
🔬 25+ 研究智能体系统分组盘点
🛠️ 第一类:通用自改进循环(28 条)
这一类是生态的"基本盘":不局限于科研,而是把 keep-or-revert 循环泛化到任何可度量目标上。
| 项目 | 定位速览 |
|---|---|
| recursive-improve | 递归自改进框架:采集执行轨迹、分析失败模式、定向修复 |
| auto-research(vukrosic) | 纯文档控制平面,构建"开放式自主 AI 研究实验室" |
| autoresearch(uditgoenka) | Claude Code 技能,把 autoresearch 泛化为可复用循环 |
| codex-autoresearch | Codex 原生技能,支持断点续跑、跨轮经验与并行实验 |
| research-loop | 确定性执行器 + 计划哈希审批 + 隔离 Git worktree + 实验台账 |
| steer | 治理型实验框架:智能体改训练代码,任务与评分器保持固定 |
| Thoth | 仪表盘优先的运行时:持久化运行、锁定工作项、可审查结论 |
| gemini-autoresearch | Gemini CLI 技能,Google Search 作为循环内实时验证源 |
| pi-autoresearch | 持久实验循环 + 实时指标 + 置信度追踪 + 可恢复会话 |
| autoresearch-claude-code | Claude Code 移植版,附生物力学具体案例研究 |
| autocontext | 闭环控制平面:评估、持久知识、分级验证、蒸馏到轻量运行时 |
| ax | 本地复盘循环:把重复出现的摩擦转化为改进提案 |
| goal-md | GOAL.md 模式:先让智能体构造可度量适应度函数再优化 |
| lazy-developer | 基于 GOAL.md 的多目标编排:覆盖率、测试速度、复杂度等 |
| autoresearch-at-home | 协作分支:实验认领、最佳配置共享、多机 swarm 协同 |
| autoresearch-anything | 面向任意可度量指标:提示词、API、落地页、SQL 皆可 |
| autoresearch-everywhere | 跨平台扩展:自动检测硬件配置并直接启动循环 |
| ADAS | ICLR 2025:自动设计智能体系统,用代码"发明"新架构 |
| self_improving_coding_agent(SICA) | ICLR 2025 Workshop:编辑自身代码库的自我改进编码智能体 |
| self-improving-agent | 带反思与元学习循环的自改进智能体架构 |
| HGM | 赫胥黎-哥德尔机器:元层面优化提升 SWE-bench 表现 |
| gepa | ICLR 2026 Oral:反思式提示词进化,基准上优于 RL(GRPO) |
| EvoSkill | 从失败轨迹中进化出可复用技能与提示词 |
| autoevolve | 自对弈式进化:变异代码策略、Elo 评分、Pareto 前沿分支 |
| ClawTeam | 智能体群智:并行 GPU 研究方向、任务分发与结果聚合 |
| AI-Research-SKILLs | 双环架构(内环优化 + 外环综合)的技能库 |
| aideml(AIDE) | 树搜索式 ML 工程智能体,迭代提升模型性能 |
| Weco | AIDE 云平台:可观测性、实验追踪、托管运行 |
🔬 第二类:研究智能体系统(24 条)——真正的"AI 科学家"
这是标题中"25+ AI 科学家系统"的主战场,全部围绕从想法到论文的端到端科研流水线。
| 项目 | 定位速览 |
|---|---|
| AI-Scientist(Sakana AI) | 首个全自动科学发现系统:从想法生成到论文撰写,最小人类监督 |
| AI-Scientist-v2(Sakana AI) | 智能体式树搜索实现工作坊级自动发现,摆脱 v1 的模板依赖 |
| AI-Researcher(HKUDS) | NeurIPS 2025:假设 → 实验 → 手稿 → 同行评审的端到端自动化 |
| ARK | 想法 + 会议 → 论文,6 个智能体协同,支持 CLI / Web / Telegram |
| AutoResearchClaw | 主题 → 文献综述 → 实验 → 分析 → 评审 → 论文初稿 |
| NanoResearch | 规划实验、生成代码、本地或 SLURM 运行、基于真实结果写论文 |
| AutoSci | Wiki 中心的全生命周期研究平台,20+ 技能覆盖完整闭环 |
| AutoResearch-SibylSystem | 全自主 AI 科学家:多智能体迭代 + GPU 实验 + 自进化外环 |
| CORAL | 面向开放式发现的自主多智能体进化,10 项任务 SOTA |
| AiScientist | 长时程 ML 研究实验室:分层编排 + "文件即总线"协调 |
| OpenAGS(Auto-Research) | 多智能体覆盖科研全生命周期:文献、假设、实验、写作、评审 |
| AgentLaboratory | 想法 → 文献综述 → 实验 → 报告,支持自主与协同驾驶模式 |
| AgentRxiv | 智能体实验室共享预印本服务器,互相迭代、站在彼此肩膀上 |
| agi(hyperspace) | 去中心化 P2P 研究网络:实验、发现" gossip "、CRDT 排行榜 |
| Auto-claude-code-research-in-sleep | Markdown 优先的研究工作流:自主文献综述与跨模型评审 |
| autoresearcher | 早期开源包,当前聚焦文献综述自动化的科学工作流 |
| ResearchAgent | 基于文献的迭代式研究想法生成 + 多智能体评审反馈 |
| MLR-Copilot | 生成想法、实现实验、分析结果的自主 ML 研究框架 |
| ML-Agent | 强化学习驱动的自主 ML 工程,从试错中学习 |
| writing-driven-autoresearch | 第一分钟就保留可提交论文,实验全部由论文声明驱动(Ralphthon@ICML 2026 冠军) |
| Agon | "提示词经济"编排:科学家 / 编码 / 审计三循环,横跨 10+ 学科 |
| LatteReview | 低代码 Python 包:AI 智能体自动完成系统性文献综述 |
| LitLLM | RAG 驱动的文献综述助手,生成高质量"相关工作"章节 |
| Agent Laboratory | 三阶段流水线:文献综述 → 实验 → 报告写作 |
💻 第三类:平台移植与硬件分支(9 条)
没有高端 GPU 也能跑 autoresearch 循环——这一类项目把循环搬到了各种设备上:
| 项目 | 适配平台 |
|---|---|
| autoresearch-macos | macOS / Apple Silicon(MPS),最广泛采用的 fork |
| autoresearch-mlx | MLX 原生移植,完全去除 PyTorch/CUDA 依赖 |
| autoresearch-webgpu | 浏览器内运行实验,无需 Python 环境 |
| autoresearch-win-rtx | Windows 原生 RTX,面向消费级 NVIDIA 显卡 |
| n-autoresearch | 多 GPU 基础设施:实验追踪、自适应搜索、崩溃恢复 |
| autoresearch-engram | 增加持久认知记忆,跨会话知识检索 |
| openclaw-autoresearch | OpenClaw 平台移植 + 统计置信度评分 |
| Colab / Kaggle T4 移植 | 免费 T4 GPU,零成本零本地配置 |
| autoautoresearch(Jetson) | Jetson AGX Orin 移植,内置"创意总监"注入新颖性逃离局部最优 |
🎯 第四类:领域特定适配(9 条)
keep-or-revert 循环正在走出实验室,进入具体行业:
| 项目 | 应用场景 |
|---|---|
| autokernel | GPU 内核优化:剖析瓶颈 → 改一个内核 → 基准测试 → 保留或回滚 |
| autozyme | CPU 端科学软件优化:保持输出一致的前提下提速 |
| atlas-gic | 交易智能体:以滚动夏普比率代替模型 loss 作为优化目标 |
| autovoiceevals | 语音 AI 智能体加固:对抗式呼叫者 + 提示词迭代 |
| autoresearch-growth | 落地页定位与 A/B 测试候选,用分析数据驱动下一轮 |
| autoresearch-sudoku | AI 迭代重写 Rust 数独求解器,最终超过顶尖人类求解器 |
| autospec | 读自然语言业务规则,自动构建带测试的 Spring Boot 服务 |
| tpu_performance_autoresearch_wiki | TPU 性能优化(MFU / tokens-per-sec),含 Llama3-8B 等案例 |
| autoresearch-genealogy | 谱系研究:迭代扩展与验证家族史 |
📊 评测基准:如何衡量一个研究智能体的能力
判断一个"AI 科学家"是否靠谱,看它在这些基准上的表现(详见 README.md 的 Evaluation & benchmarks 分类):
| 基准 | 提供方 | 特点 |
|---|---|---|
| mle-bench | OpenAI | 衡量 AI 智能体的 ML 工程能力 |
| MLAgentBench | snap-stanford | 13 项 ML 实验任务,从 CIFAR-10 到 BabyLM |
| MLR-Bench | chchenhui | 201 个开放式 ML 研究任务,源自 NeurIPS/ICLR/ICML 工作坊 |
| ML-Bench | gersteinlab | 仓库级代码的 ML 任务评测 |
| AgentBench | THUDM | 8 类环境的 LLM-as-Agent 综合评测(ICLR 2024) |
🧭 选型指南:如何为你的场景挑选研究智能体系统
不同需求对应不同系统,以下是最常用的匹配关系:
| 你的目标 | 推荐方向 |
|---|---|
| 看"AI 写论文"的完整流程 | Sakana AI-Scientist / v2、HKUDS AI-Researcher |
| 从主题到论文的端到端自动化 | ARK、AutoResearchClaw、NanoResearch |
| 多智能体协同 / 长时间自主运行 | CORAL、AiScientist、AgentRxiv |
| 优化自己仓库中的可度量指标 | autoresearch-anything、goal-md、steer |
| 只有 Mac / 浏览器 / 免费算力 | autoresearch-mlx、autoresearch-webgpu、Colab T4 移植 |
| 落地到具体业务(交易 / 语音 / 内核) | atlas-gic、autovoiceevals、autokernel |
| 评估智能体能力 | mle-bench、MLR-Bench、AgentBench |
| 想要云平台托管 | Weco(AIDE 官方云平台) |
📈 实战案例:研究智能体到底能做出什么结果
README.md 收录了 16 条真实用例与深度文章,几个有代表性的结果:
- Shopify Liquid 引擎优化:Shopify CEO 公开分享 autoresearch 式优化运行,解析/渲染速度显著提升、内存分配明显下降;
- GPUMode eigh 内核竞赛:一个近自主系统两周内跑了 1,293 次实验,取得 8.56 倍加速并夺得第 3 名,还详细复盘了抓到的"奖励作弊";
- 棒球生物力学:投球速度预测模型质量大幅提升;
- 死海古卷墨水检测:多智能体实验循环用于古代卷轴识别,跨卷轴泛化能力显著改进;
- 网球预测的"奖励作弊"复盘:一篇难得的"循环哪里出了错"深度文章,值得所有优化循环的实践者阅读;
- 56 个系统的编码综述:结论是真正的缺口不在于"生成研究产物"(大多数系统都能做到),而在于在弱结果流出之前拦截它们——这也是该赛道下一步的焦点。
🚀 快速上手:获取与贡献
git clone https://gitcode.com/gh_mirrors/aw/awesome-autoresearch克隆后直接阅读 README.md 即可浏览全部 7 大类资源。
如果你想为清单新增一个项目,CONTRIBUTING.md 给出了明确的收录标准:项目需直接受 karpathy/autoresearch 启发、明确引用 autoresearch 作为基础,或在相邻领域有意义地复用同一套自治改进循环。条目要求简洁、事实化、无宣传色彩,且避免关键词堆砌。
清单本身采用CC0-1.0 许可(见 LICENSE),可自由使用;但请注意每个条目内具体项目的许可证需单独确认。
❓ 新手常见问题
Q1:没有 GPU 能玩吗?可以。清单收录了浏览器 WebGPU 版、免费 T4 GPU 版、Apple Silicon / MLX 版等多种移植,最低成本即可体验完整的实验循环。
Q2:awesome-autoresearch 和 karpathy/autoresearch 原版是什么关系?原版是一个极简的自治实验循环实现("最小酸性循环"),而本清单是围绕它生长出的整个生态:28 个通用衍生项目、24 个研究智能体系统、9 个平台移植等,共 100+ 条精选资源。
Q3:这些系统靠谱吗?会不会"自己骗自己"?这正是循环中"固定评分器 + keep-or-revert + 实验台账"设计要解决的问题;配套 5 大评测基准(mle-bench、MLR-Bench 等)用于客观横向比较,实战案例区还收录了多次"奖励作弊"被抓到的复盘。
AI 自主科研正在从论文走向工程实践。awesome-autoresearch 以"高信度策展"的方式,把这条赛道的 25+ 个 AI 科学家与研究智能体系统整理成了一张清晰的路标图——无论是想读谱系、挑工具还是做评测,从 README.md 出发即可。
【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考