使用 Agent Builder 构建社交媒体内容智能体

本章将介绍如何使用 Foundry Toolkit 中的 Agent Builder 构建一个实用的社交媒体内容智能体。其目标不仅仅是生成文本,而是创建一个能够提出恰当的后续问题、使用可信上下文并返回可供团队实际审核和发布的输出的助手。

学完本章后,你将拥有一个可重复的工作流程,用于在 Visual Studio Code 中实现从创意到经过测试的提示词智能体行为的转变。

问题定性:有据可依的智能体即决策系统

一个有用的视角是将此智能体视为决策系统,而不仅仅是文本生成器。输出质量取决于三个环环相扣的决策

  • 何时提出澄清问题:例如,如果提示词缺少受众或语气信息,智能体应在起草文案之前先进行提问。
  • 何时调用工具:如果提示词引用了 Microsoft 技术,智能体应在起草文案之前检索官方文档。
  • 如何塑造最终的审核内容:智能体应根据团队的风格指南格式化草稿,并包含对支持材料的引用。

当这些决策明确时,你的团队将获得更具可预测性和更值得信赖的行为表现。

这就是“听起来聪明”与“可以安全发布”之间的区别。

当你在有据可依和无据可依的情况下运行相同的提示词时,你会在实践中看到这一点。有据可依的版本通常会产生更少模糊的断言和更好的可追溯性,这正是内容团队在发布技术消息时所需要的。

前提条件

在我们开始构建之前,让我们确认你的设置已准备就绪。本章节结合了智能体创作、工具依据连接和评估,因此缺少任何先决条件都可能导致流程在进行到一半时中断。

如果下面的所有内容都已就绪,你应该能够顺利完成本章的所有内容而无需绕路。

  • Visual Studio Code 设置:安装了 Foundry Toolkit 的 Visual Studio Code。
  • 项目访问权限:在 Foundry Toolkit 中连接的 Microsoft Foundry 项目。
  • 模型就绪情况:至少有一个可用于驱动智能体的已部署模型。
  • GitHub Copilot 支持:在 Visual Studio Code 中启用了 GitHub Copilot,用于进行引导式评估设置。
  • 评估数据:JSONL 数据集(或准备生成合成数据集)。

确认设置后,我们可以明确定义我们要构建的内容以及为什么这些设计选择至关重要。

现在我们从设置模式进入构建模式。

你将学到什么

目标成果是用于面向开发者的营销工作流的社交内容助手。它将粗略的营销活动输入转换为结构化的草稿内容,同时在缺少必要细节时提出澄清问题。

你将学习如何

  • 生成内容草稿:产出 LinkedIn 文案、简短说明和营销活动切入点。
  • 处理多样化输入:处理简短文本、功能说明、屏幕截图和目标。
  • 应用质量护栏:遵循系统指令中的语气和结构约束。
  • 返回可用于审核的输出:格式化响应,以便营销人员和开发者倡导者能够快速进行验证。

在接触配置界面之前,让我们明确为什么这种低代码模式如此有价值。

第一步:在 Agent Builder 中创建智能体

在 Foundry Toolkit 的“开发者工具”下开始操作,并打开用于创建智能体的构建路径。在本章中,我们刻意首先使用低代码路径,因为它让我们能够在编写任何自定义代码之前快速测试行为。

提示:为了实现的一致性,请使用特定于角色的名称,并选择已部署在项目中的模型。

按照以下步骤创建智能体

  1. 导航到 Developer Tools -> Build -> Create an agent -> Open Agent Builder。
  2. 分配一个明确的以角色为中心的名称,例如 Dev Social Content Assistant
  3. 选择一个适合简洁写作、指令遵循和多模态输入的模型。

以下是在 Agent Builder 中启动创建智能体流程后应该看到的内容。

Placeholder image: Agent creation in Agent Builder

图 01:在 Agent Builder 中创建新智能体。

接下来,我们需要设置定义智能体角色、受众和输出期望的指令。

第二步:定义明确的指令

一个强有力的系统提示词会以具体条款定义角色、受众、边界和输出形态。这一点很重要,因为模糊的指令通常会产生模糊的文案和不一致的后续行为。

为社交内容智能体制定指令时需要考虑以下几点

  • 角色清晰度:支持制作面向开发者内容的社交媒体团队。
  • 行为规则:在缺少必要细节时提出后续问题。
  • 语气约束:避免夸大的断言,并包含清晰的技术价值。
  • 输出结构:将最终文案与理由和假设区分开来。

以下是满足这些要求的系统提示词示例。你可以根据自己的风格和团队需求进行调整。

System prompt configuration

图 02:为社交内容智能体定义系统提示词指令。

在指令看起来完善之后,保存智能体,使其成为可重用的项目资产。

第三步:保存并注册提示词智能体

定义完指令后,将智能体保存到你的 Foundry 项目中,使其显示在项目资源中。这会将临时的编辑会话转化为团队可以重新访问的可追踪工件。

它还在添加工具之前为你提供了一个干净的基础版本。

点击“保存”按钮。它应该会提供两个选项:保存到 Foundry 或保存到本地文件。选择 Save to Foundry

Save to Microsoft Foundry

图 03:将智能体保存到项目资源中以便重用和版本控制。

保存智能体后,我们可以添加工具将其连接到权威的 Microsoft 文档。

第四步:添加用于提供依据上下文的 MCP 工具

可靠的内容智能体不应仅依赖基础模型的记忆。在此工作流中,MCP 通过 Microsoft Learn MCP 服务器将智能体连接到权威的 Microsoft 文档。

对于此场景,每当营销文案引用产品功能、发布详情或平台行为时,依据基础就非常重要。

  1. 在工具部分,点击“+”并选择 MCP 服务器

    Add MCP Server

    图 04:在工具中选择 MCP 服务器

    接下来,我们需要选择哪个 MCP 服务器。

  2. 从可用服务器列表中选择 Microsoft Learn MCP 服务器。

    MCP tool setup

    图 05:将 MCP 服务器工具添加到智能体中以获得有据可依的响应。

仅添加工具是不够的,因此下一步是教导智能体何时使用它们。

第五步:在指令中添加工具使用指南

添加工具只完成了一半工作。你还需要指令级别的指导,告诉智能体何时需要调用工具以及如何对它们进行排序。

如果没有这一点,智能体可能会跳过检索或不一致地调用工具。

在实践中,你需要明确的触发逻辑,例如:如果提示词询问有关 Microsoft 技术的问题,请在起草输出之前检索官方文档。

  • 决策逻辑:检测用户何时询问有关 Microsoft 技术的问题。
  • 规划行为:确定在生成文案之前需要哪些信息。
  • 工具选择:路由到适当的 Microsoft Learn MCP 工具。
  • 有据可依的输出:将响应建立在经过验证的来源之上,而不是先前的假设之上。

以下是如何在系统提示词中表述这一点的示例,以便智能体知道何时调用工具以及如何使用检索到的上下文。你要求智能体分步骤思考、分析意图,然后决定调用什么工具以及可能需要的额外工具调用。最后,添加指导以约束智能体能用和不能用检索到的上下文做什么。

Tool instructions

图 06:向智能体指令中添加工具使用指导。

在此阶段,在演练场中运行真实的测试。

这正是智能体向你展示其真正实力的地方。

第六步:在智能体演练场中进行测试

配置好指令和工具后,直接在 Agent Builder 演练场中运行真实的提示词。使用反映你的团队收到的实际营销请求的提示词,而不是合成的单行语句。

在这一步中,行为质量很快就会显现出来。

例如,要求撰写一篇关于面向开发者受众的 GitHub Copilot 应用的 LinkedIn 帖子,并检查助手是否既检索了可信上下文又提出了有用的后续问题。

测试时需要注意以下几点

  • 工具验证:确认文档搜索是针对 Microsoft Learn 调用的。
  • 响应质量:检查草稿的实用性、结构和号召性用语的位置。
  • 后续行为:确保智能体在需要时提出澄清问题。
  • 透明度:验证在被要求时是否显示了理由。

请参阅下面的图片,其中显示了键入的提示词、调用的工具以及智能体的最终输出。

Testing in Playground

图 07:使用真实提示词在演练场中测试智能体。

手动测试很有用,但下一步是让质量变得可衡量的阶段。

第七步:通过评估扩展验证

评估是一种跨多个测试行衡量行为质量的可重复方法。它们允许你根据明确的指标对智能体进行评分,并确定需要改进的地方。

手动演练场测试很有用,但它不适合进行可重复的质量控制扩展。这一步引入了内置的评估工作流,因此你可以跨多个测试行根据明确的指标对行为进行评分。

在继续之前,我们需要了解两个主要概念

  • 评估:一个结构化过程,根据测试行数据集对智能体行为进行评分。每一行都有一个输入提示词和预期的输出,评估会将实际响应与预期响应进行比较。
  • 评估器:应用指标来判断智能体响应质量的评分机制。评估器指标的示例包括任务遵循度、流利度、相关性和依据充分度。

Foundry Toolkit 对评估提供了出色的内置支持,因此让我们逐步了解如何进行设置。

当你创建一个智能体时,还有一个评估区域可帮助你设置评估。其思路是创建一个测试提示词和预期输出的数据集,然后运行评估以查看智能体的性能表现。

假设你有一个这样的智能体,以下是如何设置评估的方法。

  1. 选择评估区域并选择生成数据集(左上角按钮)

    请参见下图中的“Evaluation”标签。选择该标签。

    Evaluation area from Agent creation

  2. 点击左上角的按钮选择生成数据集。

    你首先应该会看到一个模型界面,其中向你展示了用于生成数据集的提示词模板。确认提示词并选择生成数据集。这将创建一个包含可用于评估的测试行的 JSONL 文件。

    以下是一组生成的提示词的外观示例,你可以针对你的模型运行它们。

    Generate dataset modal

  3. 通过运行评估来测试你的智能体(选择播放图标)

    你应该能够看到每个提示词是如何针对你的智能体运行的,并且你可以对结果进行点赞/点踩。

    Evaluation result

    图 08:为智能体配置评估设置。

这是快速了解你的智能体针对生成的数据集表现如何的好方法。你可以调整智能体的指令、工具或其他设置,然后重新运行评估以查看性能是否有所改善。

快速提问

如果一个智能体给出了润色精美的输出,却无法解释关键产品事实的来源,你会信任它用于外部发布吗?

回答

在大多数生产团队中,答案是否定的。没有可追溯依据的精美措辞会带来审核风险,特别是对于技术主张而言。可靠的发布工作流既需要高质量的语言,也需要可验证的来源使用。

下一步计划

在验证了基于提示词的社交内容助手之后,下一步是进行更深入的智能体工程。你可以扩展到更丰富的工具编排、更强大的数据集以及以生产为中心的部署和监控工作流。

下一章将在此基础之上构建,以便随着复杂性的增加,行为质量依然保持强劲。

你现在正在构建可靠性,而不是事后去打补丁。

了解更多

如果你想在动手实践流程结束后深入学习本章,请使用以下资源作为引导式扩展路径。从智能体基础知识开始,然后转到实现和部署参考,以便每个链接都建立在前一个链接的基础之上。这种顺序反映了团队通常如何从提示词智能体原型发展为生产就绪的智能体工作流。

English 한국어 中文(简体) 中文(繁體)
© . This website operates independently and is not affiliated with or endorsed by Microsoft. All brand names, logos, and trademarks are the property of their respective owners.