在我们的系列报道中, 初创公司如何使用 Claude 进行构建,我们探讨AI产品背后的决策。在这里,我们研究如何 Cresta 将其打造AI原生客户体验的专业知识带入了 指挥家,这是一个帮助开发者构建和改进其他 agent 的 agent。
| 快速简介 | |
|---|---|
| 姓名 | Cresta |
| 成立 | 2017 |
| 首席执行官 | 吴萍 |
| 增长 | 270M+美元融资。100M+美元年度经常性收入。帮助联合航空、CVS Health和万豪等组织提供卓越的客户体验 |
构建面向客户体验场景的企业级AI代理,需要理解嵌入在大量客户互动中的上下文。例如,客户可能:
- 要求退款却未说明是哪笔购买,
- 在同一条消息中同时报告账单问题和登录问题,或者
- 在退货期限已过后请求退款。
为了正确回应,代理可能需要查核客户购买了什么、退款政策、账户历史或付款状态。
Cresta大规模地观察这些互动。其平台驱动客户体验,AI代理可独立处理对话,为与之一同工作的人工客服提供实时指导,并呈现会话智能,让企业知道该在何处改进。
构建和维护客户体验代理要求组织就运营要求做出关键决策:代理需要知道什么、必须访问哪些系统,以及其行为在何处应灵活或在何处应确定性。Cresta希望让更多团队无需各自从零开始就能获得这种判断。
Conductor就是这一成果:一个自然语言代理构建器,帮助团队将复杂的业务上下文转化为可用于生产环境的代理。用户描述他们想构建什么,Conductor便会引导整个流程,从有据可依的蓝图一直到实现、评估和优化。
Cresta最初使用Claude Sonnet和Claude Opus构建了Conductor的早期版本,以帮助内部团队支持客户部署。悬而未决的问题是,Cresta能否将这套系统转变为客户可以用来直接在平台内构建代理的产品。 内 部。
为执行开放式的开发工作,Conductor使用Claude Agent SDK作为通用型执行框架,用于收集上下文、使用工具、编写和运行代码,并根据结果进行调整。
“我们在内部把Claude Code当作开发工具,因为它在构建代理的软件开发环节非常高效,”Cresta Conductor工程负责人Renjie Li说。“Claude Agent SDK让我们能够以编程方式使用同样的代理式开发框架。通过Conductor,我们将其与Cresta深度的会话智能、CX专业经验、评估和运行时相连接,为用户提供我们从第一天起就希望拥有的代理构建体验。”
Cresta报告称,在Cresta及其合作伙伴的早期用例中,Conductor将初始部署时间大约缩短了一半。
一个帮助构建下一个代理的元代理
Conductor 是一个基于 CX 智能体开发既有最佳实践构建的自我改进元智能体。当团队使用它构建和优化更多智能体时,他们会沉淀下自己经过验证的模式、工作流和专家判断。这形成了一个知识飞轮,使未来的开发更快、更一致。
上线后,生产环境中的交互、工作流结果和反馈会成为下一轮改进的新信号。
Conductor 帮助构建者将他们从智能体构建中学到的经验转化为可复用的记忆工件,捕获模式、业务规则和评估方法。然后他们可以将其作为技能分享给团队其他成员,让其他人能够基于相同的成熟实践进行构建。
让重要决策变得更容易
编写第一个提示词只是构建一个有用智能体的一部分。更难的判断之一是确定对话中哪些地方应保持灵活,哪些地方需要明确的业务规则和受控的工具行为。
"你不想走得太确定性,否则你就会创建一个巨大的决策树,试图映射出每一个可能的分支……但有些企业关键工作流你必须确保始终正常运行,尤其是对于风险容忍度低的高度监管行业," Renjie 说。"Conductor 帮助发现并强化那些确定性需求及其实现,同时保留提升整体体验所需的灵活性。"
Conductor 借助历史对话帮助团队识别哪些环节应该让人类保持在回路中,哪些环节可以给模型留出适应空间。一旦设定了这些边界,开发人员仍需要根据这些确定性部分本应满足的要求对其进行测试,并随着底层业务规则的变化修订这些测试。
Cresta 如何评估 Conductor
Conductor 的衡量标准是它构建智能体的能力。为此,Cresta 让 Conductor 完成一组构建任务:
- 构建一个新的智能体
- 为其中一个编写测试用例
- 修改一个已经存在的智能体
- 执行根本原因分析
完成任务并不是唯一的标准。团队还会考察结果、Conductor 是如何达成目标的,以及在此过程中使用了什么。
| 评估 | 它回答的问题 |
|---|---|
| 结果 | Conductor 是否产出了所要求的、可用的成果? |
| 执行路径 | 它是否使用了合适的工具和所需的上下文? |
| 质量 | 结果与精心策划的参考标准相比如何? |
| 资源使用 | 该任务需要多少时间和模型用量? |
这些相同的任务还充当安全网。当新的 Claude 模型发布或 Conductor 框架更新时,Cresta 会重新运行其评估。它使用相同的任务和相同的评分来识别哪些方面有所改进、哪些方面仍需完善,然后才会有人提交该变更。
同样的评估纪律也内置于 Conductor 中,使其用户能够检查他们的智能体是否按预期运行。Conductor 将构建阶段捕获的需求和边界情况转化为其评估模块中的测试。
随着政策、互联系统和对话模式的变化,团队随后可以监控那些每次都必须正常运行的 workflow。这为他们提供了一种实用的方式,可以在业务变化时更新智能体,而不会丢失他们已经过加固的 workflow 的可靠性。
基于 Claude Agent SDK 构建 Conductor
Cresta 将 Conductor 设计为面向 CX 的智能体开发专用控制平面。它汇集了对话数据、领域专业知识和开发实践,然后通过政策、可观测性、验证和反馈驱动的改进来治理每一次智能体运行。
Claude Agent SDK 位于 Conductor 之下,作为通用的执行框架。它负责收集上下文、调用工具以及编写和运行代码的工作;Conductor 则在其上叠加了 Cresta 的 CX workflow、工具和领域上下文。
团队根据 Conductor 需要执行的工作对 SDK 进行了评估:多步骤、大量上下文和反复使用工具的任务。其审查覆盖了数据隐私、租户架构、组织级密钥分发、控制以及整个实现过程中的可观测性。
"Anthropic 为我们提供了一个强大的、通用的智能体软件开发基础。这让我们能够把工程投入放在 Cresta 能创造最持久客户价值的地方," Cresta 工程副总裁 Xiangru Chen 说。
将 Cresta 的工程专业知识直接交到客户手中
Conductor 最初在 Cresta 内部运行,帮助其自己的前置部署团队了解哪些开发任务可以变得可重复、上下文在何处最为关键,以及构建者在此过程中需要检查什么。它在这项内部工作中的成功让团队有信心将相同的能力带给客户和合作伙伴。
对于任何产品部署定制智能体的速度超过工程师手工构建速度的团队来说,Cresta 的方法是一个有用的参考点:使用智能体或元智能体时,初始构建之后的工作往往是最难的部分。
了解 Conductor 如何将业务上下文转化为更好的智能体设计、实现和持续改进。
| 来自 Cresta 团队的最佳实践 | |
|---|---|
| 内部使用你的产品 | Conductor 最初作为内部工具运行,只有当其输出达到具有深厚 AI 专业知识的工程师所能构建的水平时,才成为产品。 |
| 专注于你的独特优势 | Cresta 在只有他们能带来的专长(他们的对话数据和对客户体验的理解)与可以从 Agent SDK 直接获取的现成能力之间划出了一条清晰的界限,并拒绝在任何越界的东西上进行开发。 |
| 你的智能体中哪些部分需要是确定性的 | 加固那些绝不能出错的企业关键工作流,其余部分保持灵活,否则你无法得到你想要的交互式智能体体验。 |
| 进入生产环境是最容易的部分 | 初始构建只占大约20%的工作量,另外80%是随之而来的测试、优化和持续改进,所以要围绕迭代循环而非发布来设计你的工具。 |