用 SIA 做研究的第一周计划:从安装到第一个可复现实验的完整清单
【免费下载链接】siaSIA is a Self Improving AI framework to autonomously improve the performance of any AI system (Model / Agent) on a benchmark task.项目地址: https://gitcode.com/GitHub_Trending/sia4/sia
SIA(Self-Improving AI)是一个开源的自我改进 AI 框架,它通过"元 Agent 生成 → 目标 Agent 执行 → 反馈 Agent 改进"的循环,让任意 AI 系统(模型 / Agent)在基准任务上的表现逐代自主提升。本清单带你用 7 天时间,从零安装 SIA,跑通第一个实验,并产出一份可复现的研究记录。
第一周日程总览
| 天数 | 目标 | 核心动作 |
|---|---|---|
| Day 1 | 理解原理 | 读懂三 Agent 自改进循环 |
| Day 2 | 环境就绪 | 安装sia-agent并配置 API Key |
| Day 3 | 首次运行 | 跑通gpqa内置任务的自改进循环 |
| Day 4 | 复现与可视化 | 用sia web仪表盘复现并对比结果 |
| Day 5 | 自定义任务 | 按目录规范搭建自己的基准任务 |
| Day 6 | 排障 | 对照故障排查文档解决常见问题 |
| Day 7 | 沉淀 | 整理实验产物,规划下一周 |
Day 1:看懂 SIA 自我改进循环的工作原理
SIA 的核心是三个协同工作的 Agent(定义见 docs/architecture.md):
- Meta-Agent(元 Agent):读取任务描述,生成初始的目标 Agent;
- Target Agent(目标 Agent):尝试完成任务,并把动作与结果记录到日志;
- Feedback Agent(反馈 Agent):分析执行日志,找出改进点,重写目标 Agent 进入下一代。
整个循环由编排器驱动,主逻辑在 sia/orchestrator.py。理解这张图后,你后面每天的操作都能对号入座。
Day 2:SIA 安装步骤——环境准备与 API Key 配置
前提:Python 3.11+。如果要从源码开始研究,先克隆仓库:
git clone https://gitcode.com/GitHub_Trending/sia4/sia
两种安装路径,按需选择(完整说明见 README.md):
- 只用 Claude 模型:
pip install 'sia-agent[claude]',然后导出ANTHROPIC_API_KEY; - 多模型混用(推荐新手):
pip install 'sia-agent[openhands]',支持 Gemini、OpenAI、Anthropic 等;也可用打包好的openrouter-meta/openrouter-target档案,一个OPENROUTER_API_KEY就能覆盖 400+ 模型,省去逐个申请账号。
💡 档案(Profile)与提供商(Provider)都是声明式 JSON,内置默认值在 sia/defaults/profiles/ 与 sia/defaults/providers/,改配置不需要改代码。字段规范参考 docs/configuration.md。
今日交付:在终端执行sia --help能看到run和web两个子命令。
Day 3:跑通第一个自改进循环
SIA 内置 4 个任务:gpqa、lawbench、longcot-chess、spaceship-titanic(任务文件在 sia/tasks/)。新手首选 GPQA(研究生级科学推理),一条命令启动:
sia run --task gpqa --max_gen 5 --run_id 1运行期间会自动在http://127.0.0.1:8000启动实时仪表盘(可用--no-web关闭)。每一代的产物都落在runs/run_1/gen_{n}/下:
target_agent.py— 该代的目标 Agent 代码;agent_execution.json— 执行日志;improvement.md— 从第 2 代起,记录"这代改了什么、为什么改";results.json— 自动评测分数。
上图正是这类实验的典型形态:准确率随进化代数整体爬升。你第一周的目标不是刷出 SOTA,而是亲手复现一条"逐代变强"的曲线。
Day 4:可复现实验与结果可视化
复现性由三样东西保证:固定的运行参数 + 档案 JSON + 完整保存的产物目录。
# 用相同参数与档案重跑,得到可对比的实验 sia run --task gpqa --max_gen 5 --run_id 2 # 任意时刻可视化 ./runs 下所有实验 sia web仪表盘会展示每代 Agent 代码(高亮)、meta/feedback 提示词、改进计划、跨代准确率曲线与分域拆解。分析结果时的三个惯用动作(出自 docs/walkthrough.md):
cat runs/run_1/gen_1/agent_execution.json # 查看执行日志 cat runs/run_1/gen_2/improvement.md # 查看改进提案 diff runs/run_1/gen_1/target_agent.py runs/run_1/gen_2/target_agent.py # 对比两代代码今日交付:一份记录"参数、档案名、各代分数、结论"的实验笔记——这就是可复现实验的最小单元。
Day 5:搭建你自己的基准任务
研究的第一步往往是把自己的问题变成 SIA 任务。目录规范只需记住"公开/私有分离"这一条(Agent 永远看不到private/,杜绝作弊):
my-task/ ├── data/ │ ├── public/ │ │ ├── task.md # 任务描述(Meta-Agent 读这个) │ │ └── ... # Agent 可见的输入数据 │ └── private/ # 留出评测数据,不暴露给 Agent └── reference/ └── reference_target_agent.py然后写一个evaluate.py暴露evaluate()函数来打分(完整契约见 EVALUATION_GUIDE.md),最后:
sia run --task_dir ./my-task --max_gen 5 --run_id 1如果任务是 Kaggle 风格的机器学习竞赛,还可以用 sia/prepare_mlebench_dataset.py 从 MLE-Bench 一键引导任务目录,省去手工切分数据的功夫。
Day 6:对照清单排查常见问题
新手第一周最常踩的坑(详见 docs/troubleshooting.md):
| 现象 | 解法 |
|---|---|
| "Run directory already exists" | 换一个--run_id,SIA 拒绝覆盖已有实验 |
启动时警告缺少ANTHROPIC_API_KEY等 | 检查当前档案 provider 要求的api_key_env |
运行中ImportError | SIA 每次运行会创建独立 venv,把缺失的包装进runs/run_1/venv/ |
| 运行不可信任务的代码不放心 | 加--sandbox docker,在无网络的容器里隔离执行 |
另外两篇值得留到下一周细读:docs/evaluator_design.md(评测指标如何设计才防作弊)和 docs/troubleshooting.md 全文。
Day 7:沉淀产物,规划下一周
收尾三件事:
- 检查实验完整性:确认
runs/run_*/gen_*里每代都有target_agent.py、agent_execution.json、results.json,缺任何一代都不可复现; - 尝试改写提示词:驱动自改进循环的两个提示词在 sia/prompts.py(
build_meta_prompt/build_feedback_prompt),这是最轻量的定制入口; - 设定进阶目标:
--focus weights会切换到基于 RL 的权重调优模式(配合--training_sandbox),或把你的自定义任务跑满 5 代。
论文在 LawBench、去噪、GPU 内核等任务上的收益可以参考 README.md 中的基准结果,例如单细胞 RNA 去噪任务:
第一周成果验收清单
- ✅ 能口述 Meta / Target / Feedback 三个 Agent 的职责
- ✅
sia-agent安装成功,API Key 配置完毕 - ✅ 至少完成 2 次
sia run(不同run_id,参数可复现) - ✅ 用
sia web看到过跨代准确率曲线 - ✅ 拥有一个符合目录规范的自定义任务目录
- ✅ 实验笔记包含:运行参数、档案名、各代分数、改进结论
照着这份清单走完 7 天,你就有了 SIA 研究的地基:一套参数可复现、产物完整、结果可视的自我改进实验流程。下一周,把自定义任务的评测跑稳,再考虑权重调优与提示词定制。
【免费下载链接】siaSIA is a Self Improving AI framework to autonomously improve the performance of any AI system (Model / Agent) on a benchmark task.项目地址: https://gitcode.com/GitHub_Trending/sia4/sia
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考