跳转到内容

小白也能懂的 Agent、Tool 与 Skill

这篇教程不要求你懂编程。我们的目标不是背术语,而是让你能用自己的话解释它们、判断什么时候该用,并安全地完成一次实际任务。

假设公司来了一位聪明、阅读很快,但不了解内部流程的新同事。

AI 概念 生活中的类比 它解决什么问题
LLM / 模型 新同事的大脑 理解文字、生成回答、做初步推理
Prompt 你交代的一次任务 告诉它现在要做什么
Context / 上下文 你放在桌上的资料 提供完成当前任务需要的信息
Agent / 代理 能持续推进任务的新同事 观察结果、选择下一步,直到完成或需要确认
Tool / 工具 电话、浏览器、计算器、文件柜 让它查询信息、计算或执行具体操作
Skill / 技能 标准作业指导书和模板包 教它用统一流程重复做好某类工作
MCP 通用插座标准 让不同 AI 应用用相似方式接入外部工具和资料
Permission / 权限 门禁和审批 限制它可以读取、修改或发送什么

一句话记忆:

模型负责想,Prompt 负责交代,资料负责提供依据,Agent 负责推进,Tool 负责动手,Skill 负责教方法,权限负责划边界。

模型不是资料库,也不是行动者

Section titled “模型不是资料库,也不是行动者”

LLM 擅长理解和生成语言,但可能记错、算错或编造。单独的模型通常只能根据收到的内容返回答案;它不会天然知道公司最新数据,也不会自动访问你的文件。

例如你问“今天库存还有多少”,如果没有连接库存系统,模型只能说不知道或猜测。正确做法是给它经过授权的数据,或使用能查询库存系统的工具。

Prompt 就是你现在对 AI 说的话。它适合一次性或当前对话中的要求,例如:

请把下面的会议记录整理成纪要,分为结论、待办、负责人和截止日期。
没有明确负责人或日期的项目写“待确认”,不要猜测。

Prompt 不等于 Skill。你每次复制同一套长说明,说明这项工作可能值得沉淀成 Skill。

Agent 是会循环推进任务的工作方式

Section titled “Agent 是会循环推进任务的工作方式”

普通网页对话通常是“你问一次,它答一次”。Agent 会经历一个循环:

  1. 理解目标;
  2. 判断当前缺少什么;
  3. 选择是否调用工具;
  4. 查看工具结果;
  5. 继续下一步,或向你请求确认;
  6. 输出结果并说明完成情况。

Microsoft 的初学者课程将 Agent 概括为:让 LLM 获得工具和知识,从而不只回复 Prompt,还能对外部世界采取行动。行动能力带来效率,也带来误操作风险。

Tool 可以是计算器、网页搜索、读取文件、运行命令、查询数据库或调用业务 API。它通常有明确输入和输出。

例如:

  • “帮我算 19 × 27”可以调用计算器;
  • “查看这个项目有哪些文件”可以调用文件读取工具;
  • “查今天的政策”需要联网检索并打开来源;
  • “发送邮件”属于会影响外部世界的工具,应在发送前确认对象和内容。

MCP 官方规范强调,工具由模型根据上下文发现和调用,但具体产品仍可以设置确认界面和权限规则。也就是说,“模型建议调用”不代表“必须无条件允许”。

Skill 是可重复使用的工作说明包

Section titled “Skill 是可重复使用的工作说明包”

Skill 可以理解成给 AI 使用的 SOP。OpenAI 和 Anthropic 的公开 Skills 仓库都把它描述为包含说明、脚本和资源的文件夹,AI 在任务相关时按需加载。

一个 Skill 通常可能包含:

meeting-minutes/
├── SKILL.md # 何时使用、执行步骤、质量要求
├── scripts/ # 可选:稳定执行重复操作的脚本
├── references/ # 可选:规范、字段定义、业务知识
└── assets/ # 可选:模板、图片、字体等素材

Skill 本身首先是“教法”,不是无限权限。它能告诉 Agent 应该使用哪个 Tool、按什么步骤做、如何检查结果,但真正读取文件、运行脚本或发送信息,仍由 Tool 和权限系统完成。

MCP 是连接方式,不是某个具体工具

Section titled “MCP 是连接方式,不是某个具体工具”

不同 AI 应用如果各自用一套接口连接 GitLab、数据库或文件系统,维护会很麻烦。MCP 提供一种通用协议,让服务端暴露 Tools、Resources 等能力,客户端按统一方式发现和使用。

可以这样类比:Tool 是电器,MCP 是插头和插座标准。拥有插座不等于自动拥有所有电器,也不等于任何电器都可以不经授权运行。

权限决定“能看到什么、能改变什么”

Section titled “权限决定“能看到什么、能改变什么””

常见权限可以分为三档:

  1. 只读:搜索、查看文件、查询数据;
  2. 本地修改:编辑文件、生成文档、运行测试;
  3. 外部写入:发送邮件、推送代码、发布内容、修改数据库或删除资源。

初次使用 Agent 时,从只读开始。只有确认任务、对象和影响范围后,才逐步开放修改或外部写入权限。

第三遍:用一个完整例子串起来

Section titled “第三遍:用一个完整例子串起来”

假设你的任务是:“把会议记录整理成公司标准纪要,并保存为 Word。”

  • 模型理解会议内容和语言;
  • Prompt说明受众、篇幅和本次要求;
  • Context是会议原始记录和参会人名单;
  • Agent规划整理、核对、生成和检查步骤;
  • Skill提供公司纪要格式、字段和质检规则;
  • Tool读取记录、创建 Word 文件并渲染检查;
  • 权限允许读取指定记录并在指定目录创建文件,但不允许自动发送给全公司。

如果缺少负责人,Agent 应标记“待确认”,而不是自行补上。这就是 Skill 中的质量规则与权限边界共同发挥作用。

打开材科源图 LLM 平台,直接用网页对话。适合解释概念、改写文字、总结脱敏资料和生成草稿。

我是第一次接触这个主题。请先用不超过 150 字的生活类比解释,
再给一个工作中的例子,最后问我 3 个问题检查理解。

选择 Pi、Hermes、Claude Code 等 Agent 工具前,先阅读网页对话与 AI 工具怎么选。第一次实践建议:

  1. 创建一个不含敏感信息的测试文件夹;
  2. 让 Agent 先只读并总结文件;
  3. 要求它说明计划和将要调用的 Tool;
  4. 只批准范围明确、可以恢复的操作;
  5. 查看修改前后差异,再决定是否保留。

不同产品的 Skill 安装方式不同,但使用思路相同:

  1. 确认 Skill 来源可信,并阅读它的说明和权限需求;
  2. 安装后重新启动对应工具(如果产品要求);
  3. 直接描述任务,或明确说“使用某某 Skill”;
  4. 检查 Agent 是否选对 Skill、输入文件和输出位置;
  5. 对生成结果进行人工验收。

示例:

请使用 PDF Skill 阅读《产品说明.pdf》,输出 10 条面向销售同事的要点。
只读取这一个文件;不要联网;无法从文件确认的内容标记为“未提及”。

不要回看上文,尝试用自己的话回答:

  1. 为什么说 Skill 更像 SOP,而 Tool 更像实际使用的设备?
  2. 网页对话和 Agent 的最大区别是什么?
  3. 为什么 Agent 有 Skill 仍然需要 Tool?
  4. MCP 是工具本身,还是连接工具的标准?
  5. 哪些操作应该在执行前由人确认?

如果你无法用一句简单的话回答,就回到对应小节重新阅读,再换一个你熟悉的工作场景进行类比。

误区 正确理解
安装 Skill 就等于安装了一个模型 Skill 通常给已有 Agent 增加专门流程和资料,不是新模型
Tool 越多越好 工具越多,选择成本和权限风险越高;只启用任务需要的能力
Agent 说“完成了”就代表真的完成 应查看文件、测试结果、发送记录或系统状态等客观证据
MCP 可以绕过系统权限 MCP 只是连接协议,服务端、客户端和操作系统权限仍然生效
API Key 可以放进 Prompt 让 AI 帮忙配置 Key 是凭据,应使用环境变量或安全凭据存储,不应出现在聊天记录中

本文于 2026-08-12 参考并重新组织了以下 GitHub 初学者与官方资料: