用 SIA 做研究的第一周计划:从安装到第一个可复现实验的完整清单
2026/9/18 23:50:43 网站建设 项目流程

用 SIA 做研究的第一周计划:从安装到第一个可复现实验的完整清单

【免费下载链接】siaSIA is a Self Improving AI framework to autonomously improve the performance of any AI system (Model / Agent) on a benchmark task.项目地址: https://gitcode.com/GitHub_Trending/sia4/sia

SIA(Self-Improving AI)是一个开源的自我改进 AI 框架,它通过"元 Agent 生成 → 目标 Agent 执行 → 反馈 Agent 改进"的循环,让任意 AI 系统(模型 / Agent)在基准任务上的表现逐代自主提升。本清单带你用 7 天时间,从零安装 SIA,跑通第一个实验,并产出一份可复现的研究记录。

第一周日程总览

天数目标核心动作
Day 1理解原理读懂三 Agent 自改进循环
Day 2环境就绪安装sia-agent并配置 API Key
Day 3首次运行跑通gpqa内置任务的自改进循环
Day 4复现与可视化sia web仪表盘复现并对比结果
Day 5自定义任务按目录规范搭建自己的基准任务
Day 6排障对照故障排查文档解决常见问题
Day 7沉淀整理实验产物,规划下一周

Day 1:看懂 SIA 自我改进循环的工作原理

SIA 的核心是三个协同工作的 Agent(定义见 docs/architecture.md):

  1. Meta-Agent(元 Agent):读取任务描述,生成初始的目标 Agent;
  2. Target Agent(目标 Agent):尝试完成任务,并把动作与结果记录到日志;
  3. Feedback Agent(反馈 Agent):分析执行日志,找出改进点,重写目标 Agent 进入下一代。

整个循环由编排器驱动,主逻辑在 sia/orchestrator.py。理解这张图后,你后面每天的操作都能对号入座。

Day 2:SIA 安装步骤——环境准备与 API Key 配置

前提:Python 3.11+。如果要从源码开始研究,先克隆仓库:

git clone https://gitcode.com/GitHub_Trending/sia4/sia

两种安装路径,按需选择(完整说明见 README.md):

  • 只用 Claude 模型pip install 'sia-agent[claude]',然后导出ANTHROPIC_API_KEY
  • 多模型混用(推荐新手)pip install 'sia-agent[openhands]',支持 Gemini、OpenAI、Anthropic 等;也可用打包好的openrouter-meta/openrouter-target档案,一个OPENROUTER_API_KEY就能覆盖 400+ 模型,省去逐个申请账号。

💡 档案(Profile)与提供商(Provider)都是声明式 JSON,内置默认值在 sia/defaults/profiles/ 与 sia/defaults/providers/,改配置不需要改代码。字段规范参考 docs/configuration.md。

今日交付:在终端执行sia --help能看到runweb两个子命令。

Day 3:跑通第一个自改进循环

SIA 内置 4 个任务:gpqalawbenchlongcot-chessspaceship-titanic(任务文件在 sia/tasks/)。新手首选 GPQA(研究生级科学推理),一条命令启动:

sia run --task gpqa --max_gen 5 --run_id 1

运行期间会自动在http://127.0.0.1:8000启动实时仪表盘(可用--no-web关闭)。每一代的产物都落在runs/run_1/gen_{n}/下:

  • target_agent.py— 该代的目标 Agent 代码;
  • agent_execution.json— 执行日志;
  • improvement.md— 从第 2 代起,记录"这代改了什么、为什么改";
  • results.json— 自动评测分数。

上图正是这类实验的典型形态:准确率随进化代数整体爬升。你第一周的目标不是刷出 SOTA,而是亲手复现一条"逐代变强"的曲线

Day 4:可复现实验与结果可视化

复现性由三样东西保证:固定的运行参数 + 档案 JSON + 完整保存的产物目录

# 用相同参数与档案重跑,得到可对比的实验 sia run --task gpqa --max_gen 5 --run_id 2 # 任意时刻可视化 ./runs 下所有实验 sia web

仪表盘会展示每代 Agent 代码(高亮)、meta/feedback 提示词、改进计划、跨代准确率曲线与分域拆解。分析结果时的三个惯用动作(出自 docs/walkthrough.md):

cat runs/run_1/gen_1/agent_execution.json # 查看执行日志 cat runs/run_1/gen_2/improvement.md # 查看改进提案 diff runs/run_1/gen_1/target_agent.py runs/run_1/gen_2/target_agent.py # 对比两代代码

今日交付:一份记录"参数、档案名、各代分数、结论"的实验笔记——这就是可复现实验的最小单元。

Day 5:搭建你自己的基准任务

研究的第一步往往是把自己的问题变成 SIA 任务。目录规范只需记住"公开/私有分离"这一条(Agent 永远看不到private/,杜绝作弊):

my-task/ ├── data/ │ ├── public/ │ │ ├── task.md # 任务描述(Meta-Agent 读这个) │ │ └── ... # Agent 可见的输入数据 │ └── private/ # 留出评测数据,不暴露给 Agent └── reference/ └── reference_target_agent.py

然后写一个evaluate.py暴露evaluate()函数来打分(完整契约见 EVALUATION_GUIDE.md),最后:

sia run --task_dir ./my-task --max_gen 5 --run_id 1

如果任务是 Kaggle 风格的机器学习竞赛,还可以用 sia/prepare_mlebench_dataset.py 从 MLE-Bench 一键引导任务目录,省去手工切分数据的功夫。

Day 6:对照清单排查常见问题

新手第一周最常踩的坑(详见 docs/troubleshooting.md):

现象解法
"Run directory already exists"换一个--run_id,SIA 拒绝覆盖已有实验
启动时警告缺少ANTHROPIC_API_KEY检查当前档案 provider 要求的api_key_env
运行中ImportErrorSIA 每次运行会创建独立 venv,把缺失的包装进runs/run_1/venv/
运行不可信任务的代码不放心--sandbox docker,在无网络的容器里隔离执行

另外两篇值得留到下一周细读:docs/evaluator_design.md(评测指标如何设计才防作弊)和 docs/troubleshooting.md 全文。

Day 7:沉淀产物,规划下一周

收尾三件事:

  1. 检查实验完整性:确认runs/run_*/gen_*里每代都有target_agent.pyagent_execution.jsonresults.json,缺任何一代都不可复现;
  2. 尝试改写提示词:驱动自改进循环的两个提示词在 sia/prompts.py(build_meta_prompt/build_feedback_prompt),这是最轻量的定制入口;
  3. 设定进阶目标--focus weights会切换到基于 RL 的权重调优模式(配合--training_sandbox),或把你的自定义任务跑满 5 代。

论文在 LawBench、去噪、GPU 内核等任务上的收益可以参考 README.md 中的基准结果,例如单细胞 RNA 去噪任务:

第一周成果验收清单

  • ✅ 能口述 Meta / Target / Feedback 三个 Agent 的职责
  • sia-agent安装成功,API Key 配置完毕
  • ✅ 至少完成 2 次sia run(不同run_id,参数可复现)
  • ✅ 用sia web看到过跨代准确率曲线
  • ✅ 拥有一个符合目录规范的自定义任务目录
  • ✅ 实验笔记包含:运行参数、档案名、各代分数、改进结论

照着这份清单走完 7 天,你就有了 SIA 研究的地基:一套参数可复现、产物完整、结果可视的自我改进实验流程。下一周,把自定义任务的评测跑稳,再考虑权重调优与提示词定制。

【免费下载链接】siaSIA is a Self Improving AI framework to autonomously improve the performance of any AI system (Model / Agent) on a benchmark task.项目地址: https://gitcode.com/GitHub_Trending/sia4/sia

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询