Agent Skills for Context Engineering:以 17 个 Agent Skill 与研究者操作系统构建生产级 Agent 系统
2026/9/13 18:31:13 网站建设 项目流程

Agent Skills for Context Engineering:以 17 个 Agent Skill 与研究者操作系统构建生产级 Agent 系统

【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering

本文基于仓库根目录的 README.md 展开,系统讲解这个上下文工程(Context Engineering)技能集合解决什么问题、包含哪些技能、如何安装到 Claude Code / Cursor / Codex 等平台,以及仓库内建的研究者操作系统(Researcher OS)如何用确定性门禁和可复现的路由基准来持续演进整个技能库。读完后,你应能独立完成技能插件安装、单技能目录级部署,并理解技能激活路由的评测方法与数据含义。

什么是上下文工程:一个受限的注意力预算

README 开篇给出的定义是:上下文工程(Context Engineering)是管理语言模型上下文窗口的学科。它不同于提示词工程(Prompt Engineering)只关注"如何写好指令",而是面向进入模型有限注意力预算的全部信息做整体策展:系统提示词、工具定义、检索文档、消息历史、工具输出。

其核心挑战在于:上下文窗口的约束不是原始 token 容量,而是注意力机制。随着上下文长度增加,模型会呈现可预测的退化模式——"lost-in-the-middle"(中间信息被忽略)、U 形注意力曲线、注意力稀缺。有效的上下文工程,就是找到"能最大化期望结果概率的最小高信号 token 集合"。

这个概念在基础技能 context-fundamentals 中被进一步形式化:对 n 个 token,注意力机制需要计算 n 平方量级的两两关系;模型主要用较短序列训练,导致有效容量远低于标称窗口大小。该技能还给出了四条组装配上下文的原则:

  1. 信息性优于穷尽性——只包含对当前决策重要的内容,并设计可按需检索的系统;
  2. 位置感知放置——把关键约束放在上下文的开头和结尾(注意力最强的位置);
  3. 渐进式披露——启动时只加载技能名和摘要,激活时才加载全文;
  4. 迭代策展——上下文工程不是一次性写提示词的练习,而是每次向模型传递内容时都要应用的持续纪律。

该仓库已被两篇学术工作引用为静态技能架构(static skill architecture)的基础性参考,相关论述指出:静态技能已被广泛认可,而动态演化技能则开始桥接"人工技能工程"与"自主自我改进"。

17 个技能的分层地图

仓库根目录下 skills/ 包含 17 个技能目录,按五个层次组织。这个分层本身就是 README 的"核心骨架":从概念认知,到架构模式,到运行优化,再到开发方法论与认知架构。

基础技能(Foundational Skills)

为所有后续工作建立概念基础:

技能说明
context-fundamentals理解什么是上下文、为什么重要,以及 Agent 系统中上下文的解剖结构
context-degradation识别上下文失效模式:lost-in-middle、投毒、注意力分散与冲突
context-compression为长时运行会话设计并评估压缩策略

架构技能(Architectural Skills)

覆盖构建有效 Agent 系统的模式与结构:

技能说明
multi-agent-patterns掌握编排者(orchestrator)、对等(peer-to-peer)与层级式多智能体架构
long-horizon-prompting为长时自主 Agent 与并行编排编写"拟形式化"任务简报:精确的成功谓词、非计数型结果、审计门控的返回条件、努力下限与多样性策略
memory-systems设计短期、长期与图结构记忆架构
tool-design构建 Agent 能够有效使用的工具
filesystem-context用文件系统实现动态上下文发现、工具输出卸载与计划持久化
hosted-agents用沙箱 VM、预构建镜像、多玩家支持与多客户端接口构建后台编码 Agent

运维技能(Operational Skills)

面向 Agent 系统的持续运行与优化:

技能说明
context-optimization应用压缩(compaction)、掩码(masking)与缓存(caching)策略
latent-briefing当 Worker 运行时可控时,通过任务引导的 KV 缓存压缩向 Worker 共享任务相关的编排者状态
evaluation为 Agent 系统构建评估框架
advanced-evaluation掌握 LLM-as-a-Judge 技术:直接评分、成对比较、评分表生成与偏差缓解
harness-engineering设计自主 Agent 的 harness:锁定指标、持久日志、新颖性门、回滚与人工审批边界
self-improvement-loops以 harness 本身为优化目标的循环:RSI、元 harness 搜索、失败驱动自编辑、演化式脚手架搜索与自修改系统的接受门

开发方法论(Development Methodology)

技能说明
project-development从构思到部署设计并构建 LLM 项目:任务-模型适配分析、流水线架构、结构化输出设计

认知架构(Cognitive Architecture Skills)

技能说明
bdi-mental-states用形式化 BDI(信念-欲望-意图)本体模式,把外部 RDF 上下文转化为 Agent 心智状态,用于审议式推理与可解释性

根目录的 SKILL.md 是整个集合的入口元数据文件:它声明了集合的name: context-engineering-collection、激活时机(从零构建 Agent 系统、优化性能、调试上下文失败、设计多智能体架构等六类场景),并以一段话为每个技能给出"一句话心智模型",供 Agent 在做技能发现时快速判断路由。

设计哲学:三条原则如何落到文件结构

README 给出三条设计原则,每一条都能在仓库中找到对应的实体约束。

1. 渐进式披露(Progressive Disclosure)。启动时 Agent 只加载技能名称和描述;只有当某个技能被相关任务激活时才加载全文。从源码结构看,这一原则由SKILL.md的 frontmatter 承载:每个技能的文件头都含namedescription两个字段(例如 skills/context-fundamentals/SKILL.md 的 description 不仅说明"做什么",还显式写明"哪些邻近技能拥有相邻工作"),路由信号仅靠这些描述完成——这一点被路由基准实验直接验证(见后文)。

2. 平台无关(Platform Agnosticism)。技能聚焦可迁移的原则而非厂商特定实现,模式适用于 Claude Code、Cursor 以及任何支持技能或自定义指令的 Agent 平台。

3. 概念基础 + 实用示例。示例脚本使用跨环境可用的 Python 伪代码,不依赖特定依赖安装。

与"渐进式披露"配套的硬约束是:SKILL.md正文保持在 500 行以内(贡献规范与技能模板 template/SKILL.md 都明确要求),超出部分必须移入references/目录。此外,模板还要求每个技能显式声明"所有权边界"——描述与When to Activate小节必须说明该技能拥有什么、哪些邻近技能拥有相邻工作,以防止宽泛技能"抢走"狭窄技能的激活。这正是后文路由基准要度量的问题:技能边界混淆。

安装与使用

方式一:Claude Code 插件市场

本仓库是一个Claude Code Plugin Marketplace。市场清单位于 .claude-plugin/marketplace.json,其中定义了市场名context-engineering-marketplace与插件context-engineering,并逐一列出了 17 个技能目录的相对路径;插件本体清单 .plugin/plugin.json 声明"skills": "./skills/",即宿主从仓库根的skills/目录发现全部技能,当前版本为 2.5.0。

第 1 步:注册市场。在 Claude Code 中执行:

/plugin marketplace add muratcankoylan/Agent-Skills-for-Context-Engineering

第 2 步:安装插件。两种方式任选:

  • 方式 A(浏览安装):选择Browse and install pluginscontext-engineering-marketplacecontext-engineeringInstall now
  • 方式 B(命令直装):
/plugin install context-engineering@context-engineering-marketplace

安装后,17 个技能作为单个插件装入,并按任务上下文自动激活。

方式二:Cursor / Codex / 其他 Open Plugins 宿主

仓库同时以 Open Plugins 插件形式发布:宿主读取.plugin/plugin.json,发现仓库根skills/目录(每个子目录含一个SKILL.md)。

  • Cursor(推荐):从插件目录安装,或克隆仓库后指向插件根;Cursor 通过 Open Plugins 清单发现skills/目录。项目级手动安装时,把技能目录复制进.cursor/skills/。README 特别提醒:不要依赖仓库符号链接,它们在 Windows 和插件打包场景下很脆弱。
  • Codex / GitHub Copilot CLI / 其他 Open Plugins 宿主:克隆仓库或将其作为插件目录添加,宿主读取.plugin/plugin.json后自动发现全部 17 个技能;项目级手动安装时复制到.codex/skills/或宿主文档指定的 Agent Skills 目录。

方式三:单独安装某个技能(目录布局是关键)

Agent Skills 要求的是目录布局而非单个 markdown 文件。以context-fundamentals为例:

# Cursor 项目 mkdir -p .cursor/skills cp -R skills/context-fundamentals .cursor/skills/ # Claude Code 项目级安装(同样的目录布局) mkdir -p .claude/skills cp -R skills/context-fundamentals .claude/skills/ # Codex 项目级安装 mkdir -p .codex/skills cp -R skills/context-fundamentals .codex/skills/ # 通用 Agent Skills 仓库级安装(Codex/OpenAI、Copilot CLI、Open Plugins 宿主) mkdir -p .agents/skills cp -R skills/context-fundamentals .agents/skills/

这里有一个明确的反模式:不要把SKILL.md拍平成.claude/skills/context-fundamentals.md单文件。那会破坏相对references/路径的解析,并违反 Cursor、Claude Code、Codex 共同使用的 Agent Skills 目录规范。

方式四:自研实现

从任意技能中提取原则与模式,在自己的 Agent 框架中重新实现——技能被刻意设计为平台无关,这正是其可移植性的来源。

技能激活场景:何时该激活哪个技能

README 用一张完整的激活表约束了每个技能的路由语义。这张表与路由基准的"expected_primary_skill"标签直接对应,是整个评测体系的地面真值来源:

技能激活时机
context-fundamentals建立上下文窗口心智模型、规划 Agent 架构,或解释上下文组件如何影响模型行为
context-degradation诊断注意力失效、上下文投毒、lost-in-middle 行为,或长会话中的性能退化
context-compression在上下文压力下,保留有用状态的同时压缩对话、工具输出或轨迹
context-optimization改进 token 效率、检索精度、前缀复用、掩码、分区或预算分配
latent-briefingWorker 运行时可控且模型兼容时,通过任务引导的 KV 缓存压缩向 Worker 共享编排者轨迹
multi-agent-patterns选择协调模式、隔离 Agent 间上下文、设计交接,或评估并行 Agent 是否值得
long-horizon-prompting撰写或评估长时自主 Agent / 并行编排的启动提示词:成功谓词、非计数结果、持久与停止规则、对抗性审计门、组合多样性策略
memory-systems跨会话持久化知识、追踪实体演化、选择记忆框架,或设计检索与更新语义
tool-design定义 Agent-工具契约、合并工具面、改进描述、让工具错误可操作
filesystem-context把大体积或需持久化的上下文移入文件、创建草稿本、支持即时发现、通过共享工件协调 Agent
hosted-agents在远程沙箱、后台环境、热池或多玩家 Agent 基础设施中运行编码 Agent
evaluation为 Agent 行为创建确定性检查、评分表、回归套件、生产监控或质量门
advanced-evaluation使用 LLM 评审、成对比较、校准、偏差缓解或人类对齐的质量评估
harness-engineering设计带锁定评估器、可编辑面、持久日志、新颖性门、回滚与审批边界的自主循环
self-improvement-loops构建自我修改的循环:失败驱动的 harness 自编辑、元 harness 搜索、演化式脚手架搜索、上下文机制演化与自修改接受门
project-development判断 LLM 是否合适、塑形批处理流水线、创建分阶段工件、估算运营成本
bdi-mental-states对 Agent 建模信念、欲望、意图、理性行动轨迹或神经符号状态转换

值得注意的细节:context-fundamentals的 SKILL.md 中用"Do not activate"块显式把操作性工作路由给其他技能(调试注意力失败 →context-degradation,token 效率 →context-optimization,会话摘要 →context-compression,文件卸载 →filesystem-context,项目形态 →project-development)。这种"边界声明式描述"不是文档装饰,而是路由模型实际消费的路由信号。

完整系统示例:多技能协同的落地案例

examples/ 目录包含 6 个完整系统设计,展示多个技能如何协同工作。每个示例都带完整 PRD(含架构决策)、技能映射(哪些概念影响了每个决策)与实现指导:

示例说明应用技能
digital-brain-skill面向创始人/创作者的个人操作系统:完整 Claude Code 技能,含 6 个模块、4 个自动化脚本context-fundamentals, context-optimization, memory-systems, tool-design, multi-agent-patterns, evaluation, project-development
x-to-book-system监控 X 账号并生成每日综合"书"的多智能体系统multi-agent-patterns, memory-systems, context-optimization, tool-design, evaluation
llm-as-judge-skills生产级 LLM 评估工具,TypeScript 实现,19 个通过的测试advanced-evaluation, tool-design, context-fundamentals, evaluation
book-sft-pipeline训练模型模仿任意作者风格写作,含 Gertrude Stein 案例(Pangram 人类评分 70%,总成本 2 美元)project-development, context-compression, multi-agent-patterns, evaluation
interleaved-thinking推理轨迹优化器:捕获、分析 Agent 失败模式并转化为生成的技能evaluation, advanced-evaluation, context-degradation, harness-engineering
long-horizon-prompt-lab生产级教学网站:方法指南、可复制任务简报模板、4 组完整提示词重写、结构化审计与带限定条件的研究/厂商参考目录long-horizon-prompting, harness-engineering, multi-agent-patterns, advanced-evaluation

其中 digital-brain-skill 是"技能原则 → 系统架构"的可追溯范例:3 级渐进披露加载(SKILL.md → 模块文件 → 数据文件)、6 个独立模块、以 schema 优先行的 JSONL 追加式记忆、4 个整合自动化工具;其 HOW-SKILLS-BUILT-THIS.md 把每个架构决策逐条映射回具体技能原则。llm-as-judge-skills 则提供带测试的 TypeScript 参考实现(直接评分、带位置偏差缓解的成对比较、评分表生成、组合全部能力的 EvaluatorAgent),核心实现位于 examples/llm-as-judge-skills/src。book-sft-pipeline 展示两级重叠切块、15+ 提示词模板防止记忆化,以及用现代场景测试区分"风格迁移 vs 内容背诵"的验证方法。

Researcher Operating System:把研究转化为可审计的技能变更

如果只是静态的技能合集,这个仓库只是"文集"。researcher/ 目录定义了一套基于文件的操作系统,让仓库成为"复利式真相源"(compounding source of truth):持续发现可信来源 → 按评分表评估 → 提取可落地的机制(而非泛泛结论)→ 映射到新技能/技能更新/仅参考笔记 → 门禁通过后准备可审查的 PR。该目录刻意保持文件化,Agent 无需托管调度器即可检查、续跑、审计工作。

生命周期与核心组件

运行生命周期为:discover -> triage -> evaluate -> extract -> map -> draft -> validate -> prepare-pr -> human-merge。README 列出的组件清单:

  • 来源注册表(researcher/source-registry.md):优先级来源、排除规则、监控查询;
  • 评分表(researcher/rubrics/):内容策展、技能变更、harness 变更、成对技能修订四份门禁评分表;
  • 机制注册表(researcher/mechanisms/registry.jsonl 加ledgers/):16 个已接受的行为变更作为首要新颖性信号,配以追加式(append-only)的接受/拒绝台账作为机构记忆;
  • 声明溯源(researcher/claims/index.jsonl):12 条带来源 URL、证据强度、易变性与最近审阅日期的溯源声明——这也解释了技能正文中(claim-*)内联 ID 的用途:数值、基准或厂商性能声明必须有溯源记录支撑,否则应弱化措辞或移入带日期的参考材料;
  • 语料索引(researcher/corpus/index.json):技能、激活场景、机制 ID、声明 ID 的规范机器可读映射;
  • 运行状态机researcher/runs/<run-id>/run-state.json):initialized -> retrieved -> evaluated -> proposed -> novelty_checked -> validated -> pr_ready -> closed
  • 激活回归测试(researcher/fixtures/activation-cases.jsonl):19 条确定性提示词,专门捕捉技能边界混淆;
  • 对抗基准(researcher/benchmarks/):试图"钻循环空子"的场景——重复机制、未检索证据、错误的评分表计算、自我批准的评分表修改、弱证据新颖性;
  • 连续循环(researcher/scripts/ 中loop_*.py加 researcher/orchestration/launchd/):收件箱、来源发现、一次一状态推进、每日运维、停放审查队列与 launchd 服务定义;
  • 技能健康门(researcher/scripts/skill_health.py):确定性的正文质量评分,当前严格语料得分为 0.9117,0 个被标记技能。

运行参数集中在 researcher/orchestration/config.json:loop_step_minutes: 10(每 10 分钟推进一步)、loop_discover_hours: 12(每 12 小时发现一轮)、loop_daily_hour_utc: 6(每日 6 点 UTC 运维),并设置了max_active_runs: 3max_runs_per_day: 6max_parked: 12max_failures_per_day: 5等预算上限。从配置文件结构看,mode目前为dry-run,付费 LLM 通道被保留给未来的评审/综合用途。

操作者命令

先一次性安装校验依赖:

python3 -m pip install -r requirements-dev.txt

requirements-dev.txt 目前只含pyyaml,因此本地门禁的额外负担很轻。随后是全部确定性命令:

# 确定性门禁(也在 CI 中对每个 PR 执行) python3 -m unittest researcher.scripts.tests.test_skill_frontmatter python3 researcher/scripts/validate_platform_compat.py --require-reference-validator python3 researcher/scripts/validate_repo.py --strict python3 researcher/scripts/skill_health.py --strict --no-history python3 researcher/scripts/run_benchmarks.py python3 researcher/scripts/check_activation_cases.py # 单运行就绪检查(仅活跃运行) python3 researcher/scripts/validate_run.py --run-dir researcher/runs/<run-id> # 连续循环,手动触发 python3 researcher/scripts/loop_discover.py python3 researcher/scripts/loop_step.py --allow-fetch python3 researcher/scripts/loop_daily.py python3 researcher/scripts/loop_status.py # 连续循环,守护进程(macOS) researcher/orchestration/launchd/install.sh # 安装 launchd 任务(10 分钟步进、12 小时发现、每日运维) researcher/orchestration/launchd/uninstall.sh # 移除 launchd 任务

守护进程的详细预算与人工审查面见 researcher/runbooks/continuous-operation.md。

四条硬保证

  • 循环从不调用付费 LLM、不做出站写入;HTTP 检索仅用标准库,1.5 MB 上限、30 秒超时;
  • 机制晋升要求记录在案的人工审阅者 + 通过运行就绪检查;
  • 所有队列变更都是原子的(临时文件 +os.replace),并经fcntl锁串行化;
  • Agent 可以在门禁通过后准备 PR,但合并与推送始终由人控制——该目录中不存在任何授权自动合并的流程。

路由基准:描述就是路由信号

技能路由(决定"给定任务是否加载了正确的技能")被端到端基准化:通过 Cursor SDK(researcher/benchmarks/sdk-runner/,要求 Node >= 20)对 4 个前沿模型执行三轮完整扫描——50 条提示词 × 4 模型 × 3 次重复 = 每轮 600 次调用。三轮发布的完整报告在 researcher/benchmarks/router/results-published/:

  • 基线:2026-05-15.md
  • 定向描述重写后:2026-05-15-v2.md(含相对基线的增量)
  • 全语料硬化后:2026-05-19.md(600/600 可用记录,0 格式失败)

方法论上有两个关键细节(见 2026-05-19 报告):每次提示词与 15 个技能激活描述以确定性打乱顺序呈现,且不加载任何技能全文settingSources: []),唯一的 routing 信号就是提示词内的描述——这直接验证了"描述即路由信号"的设计;置信区间为 2000 次重采样的 95% bootstrap。

数据标记出的三个技能的描述重写增益:

技能基线 Top-1重写后增量
context-fundamentals0.2550.489+23.4pp
project-development0.7501.000+25pp(达到满分)
tool-design0.7290.807+7.8pp

全语料硬化后的分模型 Top-1 / Top-3 准确率:

模型Top-1Top-3
gemini-3.1-pro0.9200.933
composer-20.9130.947
gpt-5.50.9130.973
claude-opus-4-70.8400.933

2026-05-19 报告的混淆矩阵显示:context-optimizationfilesystem-contextharness-engineeringhosted-agentslatent-briefingmemory-systemsmulti-agent-patternsproject-development在该轮扫描中全部满分,剩余失败集中在已知的模糊边界——无匹配技能负控提示词、一条真正歧义的评估类提示词,以及context-fundamentals作为"兜底"技能的天然宽边界。要精确复现这些数字,运行器提供的命令是(详见报告"Reproducibility"一节):

cd researcher/benchmarks/sdk-runner npm install export CURSOR_API_KEY=<your-key> node --experimental-strip-types src/runRouter.ts --models claude-opus-4-7,composer-2,gemini-3.1-pro,gpt-5.5 --reps 3 --seed 1 --max-budget-usd 15 python3 ../../scripts/render_router_report.py \ --results ../router/results/<date>-<seed> \ --fixture ../router/prompts.jsonl \ --output ../router/results-published/<date>.md

这套"描述 → 基准 → 重写 → 再基准"的闭环,把 README 中"渐进式披露"从设计口号变成了可测量、可回归的工程指标。

仓库结构与技能目录规范

每个技能遵循 Agent Skills 规范,目录结构为:

skill-name/ ├── SKILL.md # 必需:指令 + 元数据 ├── scripts/ # 可选:演示概念的可用代码 └── references/ # 可选:附加文档与资源

规范模板在 template/ 目录。对照模板可以看到,一个合格技能正文的标准小节是:When to Activate(含"不激活"边界块)、Core ConceptsDetailed TopicsPractical GuidanceExamplesGuidelinesGotchas(经验型失败模式,模板称之为"任何技能中信号最高的内容")、Integration(用纯文本而非链接引用相关技能,避免跨目录引用问题)与References(技能内部引用使用相对于技能自身的./references/...路径),文件尾附创建/更新日期、作者与版本号元数据。仓库级辅助文件包括:AGENTS.md 与 CLAUDE.md(给 Agent 的工作约定)、docs/ 目录下的背景研究笔记(agentskills、compression、gemini/claude research 等)、CHANGELOG.md(版本演进记录)。

贡献约定与许可

仓库遵循 Agent Skills 开放开发模式,贡献要求:遵循技能模板结构;提供清晰可执行的指令;在合适处给出可运行的示例;记录权衡与潜在问题;SKILL.md保持在 500 行以内以保证性能。仓库使用 MIT 许可(见 LICENSE),技能中的原则源自头部 AI 实验室与框架开发者的研究与生产经验,每个技能都附带支撑其建议的研究与案例参考。

小结

这个仓库的价值密度体现在三层:17 个技能目录(skills/)提供了从上下文解剖到自改进 harness 的可直接安装的知识体系;examples/提供了 6 个多技能协同的完整系统设计作为"技能 → 架构"的映射证明;researcher/则用确定性门禁、机制/声明注册表、连续循环与可复现的路由基准,让整个语料库的每次变更都有据可查、可回归验证。对构建生产级 Agent 系统的开发者而言,既可以按激活场景表把技能装入自己的 Agent 平台,也可以直接参照 Researcher OS 的门禁设计,为自己的提示词/技能语料库建立同样的演进质量保障。

【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询