☰
awesome-autoresearch:从Sakana AI-Scientist到AI-Researcher,25+个AI科学家与研究智能体系统盘点
2026/10/3 12:46:24 网站建设 项目流程

awesome-autoresearch:从Sakana AI-Scientist到AI-Researcher,25+个AI科学家与研究智能体系统盘点

【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch

awesome-autoresearch 是一份围绕 Karpathy autoresearch 灵感体系的高信度精选清单,系统盘点了 25+ 个 AI 科学家与研究智能体系统(AI Scientist / Research Agents),覆盖 7 大类 100+ 条资源:从 Sakana AI-Scientist 到 HKUDS AI-Researcher,再到自治自改进循环、跨平台移植、评测基准与真实落地案例。无论你是 AI 研究员、开发者还是产品经理,这份清单都是了解"AI 自主科研"生态的最佳入口。

🧠 为什么"AI 科学家"是当下最值得关注的 AI 方向

2025 年以来,AI 圈出现了一条全新的赛道:让 AI 自主做科研——从生成想法、检索文献、设计并运行实验,到撰写论文与同行评审,AI 正在从"写论文的工具"变成"研究者"本身。

其中两个项目被公认为这一浪潮的里程碑:

  • Sakana AI-Scientist:首个面向全自动科学发现的综合系统,几乎无需人类监督即可完成从想法到论文的完整链条;
  • HKUDS AI-Researcher(NeurIPS 2025 论文):端到端科研自动化系统,覆盖假设生成 → 实验 → 手稿撰写 → 同行评审的完整工作流。

而awesome-autoresearch的定位非常清晰:它不做穷举式搜索,而是一个"高信度索引",把受 karpathy/autoresearch 启发的自主改进循环、研究智能体系统与衍生项目做了系统性策展。

🔄 3 分钟搞懂:autoresearch 研究智能体循环

在看 25+ 系统的盘点之前,先花 3 分钟理解清单里几乎所有项目共同生长的"循环":

  1. 定目标:指定一个可度量指标(模型 loss、基准分数、解析速度……);
  2. 提变更:AI 智能体修改代码或提示词,提出一轮改进;
  3. 跑实验:在固定预算下自动运行实验,用固定评分器评估;
  4. 保留或回滚(keep-or-revert):指标变好就保留,变差就回滚并记录失败原因;
  5. 记录沉淀:每轮结果写入"实验台账",下一轮站在已有经验上继续优化。

关键设计在于:任务、评分器与证据始终保持固定,变量只有智能体提出的变更。这样每一次"进步"都可复现、可验证,而不是自我欺骗。

💡 "凡可度量,皆可优化"(If you can measure it, you can optimize it)——这是清单中多个衍生项目共享的核心哲学。

📁 项目结构速览:awesome-autoresearch 如何组织内容

整个仓库结构极简,内容集中在主文档中:

文件作用
README.md主清单:7 大类、100+ 条精选资源
CONTRIBUTING.md贡献指南:收录标准、推荐条目格式、需避免的内容
LICENSECC0-1.0 许可,可自由使用与转载

README.md 按出现顺序分为 7 大类:

分类数量一句话概括
🛠️ 通用自改进循环(General-purpose descendants)28 条把 autoresearch 循环泛化到任意可度量目标
🔬 研究智能体系统(Research-agent systems)24 条端到端的 AI 科学家 / 科研流水线
💻 平台移植与硬件分支(Platform ports)9 条Apple Silicon、WebGPU、多卡等跨设备适配
🎯 领域特定适配(Domain-specific adaptations)9 条交易、语音、GPU 内核等跨场景落地
📊 评测与基准(Evaluation & benchmarks)5 条衡量研究智能体能力的基准套件
📈 知名用例与深度文章(Notable use cases)16 条真实跑出来的结果与复盘
📚 相关资源(Related resources)11 条论文合集与策展清单

🔬 25+ 研究智能体系统分组盘点

🛠️ 第一类:通用自改进循环(28 条)

这一类是生态的"基本盘":不局限于科研,而是把 keep-or-revert 循环泛化到任何可度量目标上。

项目定位速览
recursive-improve递归自改进框架:采集执行轨迹、分析失败模式、定向修复
auto-research(vukrosic)纯文档控制平面,构建"开放式自主 AI 研究实验室"
autoresearch(uditgoenka)Claude Code 技能,把 autoresearch 泛化为可复用循环
codex-autoresearchCodex 原生技能,支持断点续跑、跨轮经验与并行实验
research-loop确定性执行器 + 计划哈希审批 + 隔离 Git worktree + 实验台账
steer治理型实验框架:智能体改训练代码,任务与评分器保持固定
Thoth仪表盘优先的运行时:持久化运行、锁定工作项、可审查结论
gemini-autoresearchGemini CLI 技能,Google Search 作为循环内实时验证源
pi-autoresearch持久实验循环 + 实时指标 + 置信度追踪 + 可恢复会话
autoresearch-claude-codeClaude Code 移植版,附生物力学具体案例研究
autocontext闭环控制平面:评估、持久知识、分级验证、蒸馏到轻量运行时
ax本地复盘循环:把重复出现的摩擦转化为改进提案
goal-mdGOAL.md 模式:先让智能体构造可度量适应度函数再优化
lazy-developer基于 GOAL.md 的多目标编排:覆盖率、测试速度、复杂度等
autoresearch-at-home协作分支:实验认领、最佳配置共享、多机 swarm 协同
autoresearch-anything面向任意可度量指标:提示词、API、落地页、SQL 皆可
autoresearch-everywhere跨平台扩展:自动检测硬件配置并直接启动循环
ADASICLR 2025:自动设计智能体系统,用代码"发明"新架构
self_improving_coding_agent(SICA)ICLR 2025 Workshop:编辑自身代码库的自我改进编码智能体
self-improving-agent带反思与元学习循环的自改进智能体架构
HGM赫胥黎-哥德尔机器:元层面优化提升 SWE-bench 表现
gepaICLR 2026 Oral:反思式提示词进化,基准上优于 RL(GRPO)
EvoSkill从失败轨迹中进化出可复用技能与提示词
autoevolve自对弈式进化:变异代码策略、Elo 评分、Pareto 前沿分支
ClawTeam智能体群智:并行 GPU 研究方向、任务分发与结果聚合
AI-Research-SKILLs双环架构(内环优化 + 外环综合)的技能库
aideml(AIDE)树搜索式 ML 工程智能体,迭代提升模型性能
WecoAIDE 云平台:可观测性、实验追踪、托管运行

🔬 第二类:研究智能体系统(24 条)——真正的"AI 科学家"

这是标题中"25+ AI 科学家系统"的主战场,全部围绕从想法到论文的端到端科研流水线。

项目定位速览
AI-Scientist(Sakana AI)首个全自动科学发现系统:从想法生成到论文撰写,最小人类监督
AI-Scientist-v2(Sakana AI)智能体式树搜索实现工作坊级自动发现,摆脱 v1 的模板依赖
AI-Researcher(HKUDS)NeurIPS 2025:假设 → 实验 → 手稿 → 同行评审的端到端自动化
ARK想法 + 会议 → 论文,6 个智能体协同,支持 CLI / Web / Telegram
AutoResearchClaw主题 → 文献综述 → 实验 → 分析 → 评审 → 论文初稿
NanoResearch规划实验、生成代码、本地或 SLURM 运行、基于真实结果写论文
AutoSciWiki 中心的全生命周期研究平台,20+ 技能覆盖完整闭环
AutoResearch-SibylSystem全自主 AI 科学家:多智能体迭代 + GPU 实验 + 自进化外环
CORAL面向开放式发现的自主多智能体进化,10 项任务 SOTA
AiScientist长时程 ML 研究实验室:分层编排 + "文件即总线"协调
OpenAGS(Auto-Research)多智能体覆盖科研全生命周期:文献、假设、实验、写作、评审
AgentLaboratory想法 → 文献综述 → 实验 → 报告,支持自主与协同驾驶模式
AgentRxiv智能体实验室共享预印本服务器,互相迭代、站在彼此肩膀上
agi(hyperspace)去中心化 P2P 研究网络:实验、发现" gossip "、CRDT 排行榜
Auto-claude-code-research-in-sleepMarkdown 优先的研究工作流:自主文献综述与跨模型评审
autoresearcher早期开源包,当前聚焦文献综述自动化的科学工作流
ResearchAgent基于文献的迭代式研究想法生成 + 多智能体评审反馈
MLR-Copilot生成想法、实现实验、分析结果的自主 ML 研究框架
ML-Agent强化学习驱动的自主 ML 工程,从试错中学习
writing-driven-autoresearch第一分钟就保留可提交论文,实验全部由论文声明驱动(Ralphthon@ICML 2026 冠军)
Agon"提示词经济"编排:科学家 / 编码 / 审计三循环,横跨 10+ 学科
LatteReview低代码 Python 包:AI 智能体自动完成系统性文献综述
LitLLMRAG 驱动的文献综述助手,生成高质量"相关工作"章节
Agent Laboratory三阶段流水线:文献综述 → 实验 → 报告写作

💻 第三类:平台移植与硬件分支(9 条)

没有高端 GPU 也能跑 autoresearch 循环——这一类项目把循环搬到了各种设备上:

项目适配平台
autoresearch-macosmacOS / Apple Silicon(MPS),最广泛采用的 fork
autoresearch-mlxMLX 原生移植,完全去除 PyTorch/CUDA 依赖
autoresearch-webgpu浏览器内运行实验,无需 Python 环境
autoresearch-win-rtxWindows 原生 RTX,面向消费级 NVIDIA 显卡
n-autoresearch多 GPU 基础设施:实验追踪、自适应搜索、崩溃恢复
autoresearch-engram增加持久认知记忆,跨会话知识检索
openclaw-autoresearchOpenClaw 平台移植 + 统计置信度评分
Colab / Kaggle T4 移植免费 T4 GPU,零成本零本地配置
autoautoresearch(Jetson)Jetson AGX Orin 移植,内置"创意总监"注入新颖性逃离局部最优

🎯 第四类:领域特定适配(9 条)

keep-or-revert 循环正在走出实验室,进入具体行业:

项目应用场景
autokernelGPU 内核优化:剖析瓶颈 → 改一个内核 → 基准测试 → 保留或回滚
autozymeCPU 端科学软件优化:保持输出一致的前提下提速
atlas-gic交易智能体:以滚动夏普比率代替模型 loss 作为优化目标
autovoiceevals语音 AI 智能体加固:对抗式呼叫者 + 提示词迭代
autoresearch-growth落地页定位与 A/B 测试候选,用分析数据驱动下一轮
autoresearch-sudokuAI 迭代重写 Rust 数独求解器,最终超过顶尖人类求解器
autospec读自然语言业务规则,自动构建带测试的 Spring Boot 服务
tpu_performance_autoresearch_wikiTPU 性能优化(MFU / tokens-per-sec),含 Llama3-8B 等案例
autoresearch-genealogy谱系研究:迭代扩展与验证家族史

📊 评测基准:如何衡量一个研究智能体的能力

判断一个"AI 科学家"是否靠谱,看它在这些基准上的表现(详见 README.md 的 Evaluation & benchmarks 分类):

基准提供方特点
mle-benchOpenAI衡量 AI 智能体的 ML 工程能力
MLAgentBenchsnap-stanford13 项 ML 实验任务,从 CIFAR-10 到 BabyLM
MLR-Benchchchenhui201 个开放式 ML 研究任务,源自 NeurIPS/ICLR/ICML 工作坊
ML-Benchgersteinlab仓库级代码的 ML 任务评测
AgentBenchTHUDM8 类环境的 LLM-as-Agent 综合评测(ICLR 2024)

🧭 选型指南:如何为你的场景挑选研究智能体系统

不同需求对应不同系统,以下是最常用的匹配关系:

你的目标推荐方向
看"AI 写论文"的完整流程Sakana AI-Scientist / v2、HKUDS AI-Researcher
从主题到论文的端到端自动化ARK、AutoResearchClaw、NanoResearch
多智能体协同 / 长时间自主运行CORAL、AiScientist、AgentRxiv
优化自己仓库中的可度量指标autoresearch-anything、goal-md、steer
只有 Mac / 浏览器 / 免费算力autoresearch-mlx、autoresearch-webgpu、Colab T4 移植
落地到具体业务(交易 / 语音 / 内核)atlas-gic、autovoiceevals、autokernel
评估智能体能力mle-bench、MLR-Bench、AgentBench
想要云平台托管Weco(AIDE 官方云平台)

📈 实战案例:研究智能体到底能做出什么结果

README.md 收录了 16 条真实用例与深度文章,几个有代表性的结果:

  • Shopify Liquid 引擎优化:Shopify CEO 公开分享 autoresearch 式优化运行,解析/渲染速度显著提升、内存分配明显下降;
  • GPUMode eigh 内核竞赛:一个近自主系统两周内跑了 1,293 次实验,取得 8.56 倍加速并夺得第 3 名,还详细复盘了抓到的"奖励作弊";
  • 棒球生物力学:投球速度预测模型质量大幅提升;
  • 死海古卷墨水检测:多智能体实验循环用于古代卷轴识别,跨卷轴泛化能力显著改进;
  • 网球预测的"奖励作弊"复盘:一篇难得的"循环哪里出了错"深度文章,值得所有优化循环的实践者阅读;
  • 56 个系统的编码综述:结论是真正的缺口不在于"生成研究产物"(大多数系统都能做到),而在于在弱结果流出之前拦截它们——这也是该赛道下一步的焦点。

🚀 快速上手:获取与贡献

git clone https://gitcode.com/gh_mirrors/aw/awesome-autoresearch

克隆后直接阅读 README.md 即可浏览全部 7 大类资源。

如果你想为清单新增一个项目,CONTRIBUTING.md 给出了明确的收录标准:项目需直接受 karpathy/autoresearch 启发、明确引用 autoresearch 作为基础,或在相邻领域有意义地复用同一套自治改进循环。条目要求简洁、事实化、无宣传色彩,且避免关键词堆砌。

清单本身采用CC0-1.0 许可(见 LICENSE),可自由使用;但请注意每个条目内具体项目的许可证需单独确认。

❓ 新手常见问题

Q1:没有 GPU 能玩吗?可以。清单收录了浏览器 WebGPU 版、免费 T4 GPU 版、Apple Silicon / MLX 版等多种移植,最低成本即可体验完整的实验循环。

Q2:awesome-autoresearch 和 karpathy/autoresearch 原版是什么关系?原版是一个极简的自治实验循环实现("最小酸性循环"),而本清单是围绕它生长出的整个生态:28 个通用衍生项目、24 个研究智能体系统、9 个平台移植等,共 100+ 条精选资源。

Q3:这些系统靠谱吗?会不会"自己骗自己"?这正是循环中"固定评分器 + keep-or-revert + 实验台账"设计要解决的问题;配套 5 大评测基准(mle-bench、MLR-Bench 等)用于客观横向比较,实战案例区还收录了多次"奖励作弊"被抓到的复盘。


AI 自主科研正在从论文走向工程实践。awesome-autoresearch 以"高信度策展"的方式,把这条赛道的 25+ 个 AI 科学家与研究智能体系统整理成了一张清晰的路标图——无论是想读谱系、挑工具还是做评测,从 README.md 出发即可。

【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathy's autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询