资讯动态

用 SIA 做研究的第一周计划:从安装到第一个可复现实验的完整清单

发布时间:2026/9/18 23:51:02 来源:尧图企业网站定制
用 SIA 做研究的第一周计划从安装到第一个可复现实验的完整清单【免费下载链接】siaSIA is a Self Improving AI framework to autonomously improve the performance of any AI system (Model / Agent) on a benchmark task.项目地址: https://gitcode.com/GitHub_Trending/sia4/siaSIASelf-Improving AI是一个开源的自我改进 AI 框架它通过元 Agent 生成 → 目标 Agent 执行 → 反馈 Agent 改进的循环让任意 AI 系统模型 / Agent在基准任务上的表现逐代自主提升。本清单带你用 7 天时间从零安装 SIA跑通第一个实验并产出一份可复现的研究记录。第一周日程总览天数目标核心动作Day 1理解原理读懂三 Agent 自改进循环Day 2环境就绪安装sia-agent并配置 API KeyDay 3首次运行跑通gpqa内置任务的自改进循环Day 4复现与可视化用sia web仪表盘复现并对比结果Day 5自定义任务按目录规范搭建自己的基准任务Day 6排障对照故障排查文档解决常见问题Day 7沉淀整理实验产物规划下一周Day 1看懂 SIA 自我改进循环的工作原理SIA 的核心是三个协同工作的 Agent定义见 docs/architecture.mdMeta-Agent元 Agent读取任务描述生成初始的目标 AgentTarget Agent目标 Agent尝试完成任务并把动作与结果记录到日志Feedback Agent反馈 Agent分析执行日志找出改进点重写目标 Agent 进入下一代。整个循环由编排器驱动主逻辑在 sia/orchestrator.py。理解这张图后你后面每天的操作都能对号入座。Day 2SIA 安装步骤——环境准备与 API Key 配置前提Python 3.11。如果要从源码开始研究先克隆仓库git clone https://gitcode.com/GitHub_Trending/sia4/sia两种安装路径按需选择完整说明见 README.md只用 Claude 模型pip install sia-agent[claude]然后导出ANTHROPIC_API_KEY多模型混用推荐新手pip install sia-agent[openhands]支持 Gemini、OpenAI、Anthropic 等也可用打包好的openrouter-meta/openrouter-target档案一个OPENROUTER_API_KEY就能覆盖 400 模型省去逐个申请账号。 档案Profile与提供商Provider都是声明式 JSON内置默认值在 sia/defaults/profiles/ 与 sia/defaults/providers/改配置不需要改代码。字段规范参考 docs/configuration.md。今日交付在终端执行sia --help能看到run和web两个子命令。Day 3跑通第一个自改进循环SIA 内置 4 个任务gpqa、lawbench、longcot-chess、spaceship-titanic任务文件在 sia/tasks/。新手首选 GPQA研究生级科学推理一条命令启动sia run --task gpqa --max_gen 5 --run_id 1运行期间会自动在http://127.0.0.1:8000启动实时仪表盘可用--no-web关闭。每一代的产物都落在runs/run_1/gen_{n}/下target_agent.py— 该代的目标 Agent 代码agent_execution.json— 执行日志improvement.md— 从第 2 代起记录这代改了什么、为什么改results.json— 自动评测分数。上图正是这类实验的典型形态准确率随进化代数整体爬升。你第一周的目标不是刷出 SOTA而是亲手复现一条逐代变强的曲线。Day 4可复现实验与结果可视化复现性由三样东西保证固定的运行参数 档案 JSON 完整保存的产物目录。# 用相同参数与档案重跑得到可对比的实验 sia run --task gpqa --max_gen 5 --run_id 2 # 任意时刻可视化 ./runs 下所有实验 sia web仪表盘会展示每代 Agent 代码高亮、meta/feedback 提示词、改进计划、跨代准确率曲线与分域拆解。分析结果时的三个惯用动作出自 docs/walkthrough.mdcat runs/run_1/gen_1/agent_execution.json # 查看执行日志 cat runs/run_1/gen_2/improvement.md # 查看改进提案 diff runs/run_1/gen_1/target_agent.py runs/run_1/gen_2/target_agent.py # 对比两代代码今日交付一份记录参数、档案名、各代分数、结论的实验笔记——这就是可复现实验的最小单元。Day 5搭建你自己的基准任务研究的第一步往往是把自己的问题变成 SIA 任务。目录规范只需记住公开/私有分离这一条Agent 永远看不到private/杜绝作弊my-task/ ├── data/ │ ├── public/ │ │ ├── task.md # 任务描述Meta-Agent 读这个 │ │ └── ... # Agent 可见的输入数据 │ └── private/ # 留出评测数据不暴露给 Agent └── reference/ └── reference_target_agent.py然后写一个evaluate.py暴露evaluate()函数来打分完整契约见 EVALUATION_GUIDE.md最后sia run --task_dir ./my-task --max_gen 5 --run_id 1如果任务是 Kaggle 风格的机器学习竞赛还可以用 sia/prepare_mlebench_dataset.py 从 MLE-Bench 一键引导任务目录省去手工切分数据的功夫。Day 6对照清单排查常见问题新手第一周最常踩的坑详见 docs/troubleshooting.md现象解法Run directory already exists换一个--run_idSIA 拒绝覆盖已有实验启动时警告缺少ANTHROPIC_API_KEY等检查当前档案 provider 要求的api_key_env运行中ImportErrorSIA 每次运行会创建独立 venv把缺失的包装进runs/run_1/venv/运行不可信任务的代码不放心加--sandbox docker在无网络的容器里隔离执行另外两篇值得留到下一周细读docs/evaluator_design.md评测指标如何设计才防作弊和 docs/troubleshooting.md 全文。Day 7沉淀产物规划下一周收尾三件事检查实验完整性确认runs/run_*/gen_*里每代都有target_agent.py、agent_execution.json、results.json缺任何一代都不可复现尝试改写提示词驱动自改进循环的两个提示词在 sia/prompts.pybuild_meta_prompt/build_feedback_prompt这是最轻量的定制入口设定进阶目标--focus weights会切换到基于 RL 的权重调优模式配合--training_sandbox或把你的自定义任务跑满 5 代。论文在 LawBench、去噪、GPU 内核等任务上的收益可以参考 README.md 中的基准结果例如单细胞 RNA 去噪任务第一周成果验收清单✅ 能口述 Meta / Target / Feedback 三个 Agent 的职责✅sia-agent安装成功API Key 配置完毕✅ 至少完成 2 次sia run不同run_id参数可复现✅ 用sia web看到过跨代准确率曲线✅ 拥有一个符合目录规范的自定义任务目录✅ 实验笔记包含运行参数、档案名、各代分数、改进结论照着这份清单走完 7 天你就有了 SIA 研究的地基一套参数可复现、产物完整、结果可视的自我改进实验流程。下一周把自定义任务的评测跑稳再考虑权重调优与提示词定制。【免费下载链接】siaSIA is a Self Improving AI framework to autonomously improve the performance of any AI system (Model / Agent) on a benchmark task.项目地址: https://gitcode.com/GitHub_Trending/sia4/sia创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价