Claude Blog更新日

CrestaがCXの専門知識をClaude Agent SDK上のエージェントビルダーへと転換させた方法

私たちのシリーズ「 How startups build with Claude」では、AI製品の背後にある意思決定を掘り下げます。今回は、 Cresta がAIネイティブなカスタマーエクスペリエンス(CX)構築の専門知識をどのように Conductorに反映させたかを探ります。Conductorは、開発者が他のエージェントの構築と改善を行うのを支援するエージェントです。

私たちのシリーズ「 How startups build with Claude」では、AI製品の背後にある意思決定を掘り下げます。今回は、 Cresta がAIネイティブなカスタマーエクスペリエンス(CX)構築の専門知識をどのように Conductorに反映させたかを探ります。Conductorは、開発者が他のエージェントの構築と改善を行うのを支援するエージェントです。

クイック概要
社名 Cresta
設立 2017
CEO Ping Wu
成長 $270M+ の資金調達を実現。ARRは$100M+。United Airlines、CVS Health、Marriottなどの組織が優れた顧客体験を提供できるよう支援しています

カスタマーエクスペリエンスのユースケース向けにエンタープライズAIエージェントを構築するには、多様な顧客対応に埋め込まれた文脈を理解する必要があります。たとえば、顧客は次のような対応をすることがあります:

  • どの購入を指しているのかを言わずに返金を依頼する、
  • 1つのメッセージで請求の問題とログインの問題を両方報告する、または
  • 返品期間終了後に返金を依頼する。

正しく対応するためには、エージェントは顧客が何を購入したか、返金ポリシー、アカウント履歴、支払い状況などを確認する必要があるかもしれません。

Crestaはこれらのやり取りを大量に扱っています。同社のプラットフォームは、カスタマーエクスペリエンス向けのAIエージェントを支えており、これらのエージェントは会話を自律的に処理し、併せて働く人間のエージェントにリアルタイムのガイダンスを提供し、ビジネスがどこを改善すべきかを示す会話インテリジェンスを明らかにします。

カスタマーエクスペリエンスのエージェントを構築・維持するには、組織が運用要件に関する重要な意思決定を行う必要があります。すなわち、エージェントが何を知っている必要があるか、どのシステムにアクセスしなければならないか、そしてエージェントの挙動をどこで柔軟にし、どこで決定論的にすべきかです。Crestaは、その判断力を、各チームがゼロから始めることなく、より多くのチームに提供したいと考えました。

その成果がConductorです。自然言語によるエージェントビルダーで、チームが複雑なビジネスコンテキストを本番環境で使用できるエージェントへと変換できるよう支援します。ユーザーは構築したいものを記述するだけで、Conductorが根拠のあるブループリントから実装、評価、最適化に至るまでの作業をガイドします。

Crestaは当初、Claude SonnetとClaude Opusを使ってConductorの初期バージョンを構築し、社内チームが顧客のデプロイを支援できるようにしました。課題となったのは、そのシステムを、顧客がプラットフォーム 内で 直接エージェントを構築できる製品に転換できるかどうかでした。

オープンエンドな開発作業を実行するために、ConductorはClaude Agent SDKを汎用ハーネスとして使用し、コンテキストの収集、ツールの利用、コードの作成と実行、そして結果に基づく適応を行います。

「当社は内部的にClaude Codeを開発ツールとして使用していました。エージェント構築におけるソフトウェア開発の側面で非常に効果的だったからです」と、Cresta Conductorのエンジニアリングリードを務めるRenjie Li氏は述べています。「Claude Agent SDKによって、その同じエージェント開発ハーネスをプログラムから利用できるようになりました。Conductorでは、これをCrestaの深い会話インテリジェンス、CXの専門知識、評価、ランタイムと接続し、ユーザーに最初の日のから望んでいたエージェント構築体験を提供しています。」

Crestaによると、同社およびパートナーでの初期のユースケースにおいて、Conductorは初期デプロイ時間を約半分に短縮しました。

次のエージェントの構築を支援するメタエージェント

Conductorは、CXエージェント開発のための確立されたベストプラクティスに基づいて構築された、自己改善型のメタエージェントです。チームがConductorを使ってより多くのエージェントを構築し改良していくことで、実証済みのパターン、ワークフロー、専門家の判断を自ら蓄積していきます。これにより、今後の開発をより速く、より一貫性のあるものにするナレッジのフライホイールが生まれます。

ローンチ後は、本番環境でのインタラクション、ワークフローの結果、フィードバックが次の改善のための新たなシグナルとなります。

Conductorは、ビルダーがエージェント構築から学んだことを再利用可能なメモリーアーティファクトに変換し、パターン、ビジネスルール、評価手法を記録するのを支援します。その後、それをスキルとしてチームの他のメンバーと共有することで、他のメンバーも同じ実証済みのプラクティスをもとに構築できるようになります。

重要な意思決定を容易にする

最初のプロンプトを書くことは、有用なエージェントを構築する作業の一部にすぎません。より難しい判断のひとつは、会話を柔軟に保つべき箇所と、明示的なビジネスルールと制御されたツールの動作が必要な箇所を見極めることです。

「あまりに決定論的にしすぎるのは得策ではありません。そうすると、あらゆる分岐をマッピングしようとする巨大なディシジョンツリーを作ることになってしまいます。しかし、常時確実に動作させる必要がある、企業にとって重要なワークフローも存在します。特にリスク許容度の低い高度に規制された業界ではなおさらです」とRenjieは述べています。「Conductorは、そうした決定論的な要件とその実装を発見して強化しつつ、全体のエクスペリエンスを改善できる柔軟性を提供します。」

Conductorは過去の会話を活用して、人間がループに留まるべき箇所と、モデルに適応の余地を与えられる箇所をチームが特定できるよう支援します。それらの境界が設定された後も、開発者は決定論的な部分を、それが担保すべき要件に対してテストし、根底にあるビジネスルールの変化に応じてテストを見直す必要があります。

CrestaによるConductorの評価方法

Conductorは、エージェントをどれだけうまく構築できるかで評価されます。そのため、Crestaは一連の構築タスクを通じてConductorを実行します。

  • 新しいエージェントを構築する
  • そのテストケースを書く
  • 既存のエージェントを変更する
  • 根本原因分析を行う

タスクを完了させることだけが基準ではありません。チームは、成果、Conductor がそこに至った経緯、そして途中で何を使用したのかも確認します。

評価 答える質問
成果 Conductor は要求された、使用可能な成果物を生成したか?
実行パス 適切なツールと必要なコンテキストを使用したか?
品質 結果は厳選された参照と比べてどうか?
リソース使用量 タスクにはどれほどの時間とモデル使用量が必要だったか?

これらと同じタスクは安全網としても機能します。新しい Claude モデルがリリースされたり、Conductor フレームワークが更新されたりした際、Cresta は評価を再実行します。同じタスクと同じスコアリングを用いて、変更を確定する前に何が改善され、何がまだ作業を要するのかを特定します。

同じ評価の規律は Conductor にも組み込まれており、ユーザーはエージェントが意図どおりに動作しているかを確認できます。Conductor は、構築フェーズで把握された要件やエッジケースを、評価モジュール内のテストに変換します。

これにより、チームはポリシー、接続されたシステム、会話パターンが変化しても、毎回機能しなければならないワークフローを監視できます。そのため、すでに強化済みのワークフローの信頼性を損なうことなく、ビジネスの変化に合わせてエージェントを更新する実用的な手段を得られます。

Claude Agent SDK 上に Conductor を構築

Cresta は Conductor を、エージェント開発のための CX 特化型コントロールプレーンとして設計しました。会話データ、ドメインの専門知識、開発プラクティスを一つにまとめ、ポリシー、オブザーバビリティ、検証、フィードバック主導の改善を通じて各エージェントの実行を統制します。

Claude Agent SDK は Conductor の下層に位置し、汎用の実行ハーネスとして機能します。SDK はコンテキストの収集、ツールの呼び出し、コードの作成と実行といった作業を管理し、Conductor はその上に Cresta の CX ワークフロー、ツール、ドメインコンテキストを重ねています。

チームは、Conductor が実行すべき作業、すなわち複数のステップ、大量のコンテキスト、繰り返しのツール使用を伴うタスクを基準に SDK を評価しました。その検討では、データプライバシー、テナントアーキテクチャ、組織レベルのキー配布、コントロール、実装全体のオブザーバビリティが対象となりました。

「Anthropic は、エージェントによるソフトウェア開発のための強力で汎用的な基盤を提供してくれます。それにより、私たちは Cresta が最も持続的な顧客価値を生み出せる部分にエンジニアリング投資を集中できます」と、Cresta のエンジニアリング担当 VP である Xiangru Chen 氏は述べています。

Cresta のエンジニアリング専門知識を顧客の手に直接届ける

Conductor は Cresta の社内で始まり、自社のフォワードデプロイ担当チームが、どの開発タスクが再現可能にできるか、どこでコンテキストが最も重要になるか、そして構築者が途中で何を確認すべきかを学ぶ助けとなりました。この社内での成功により、チームは同じ機能を顧客やパートナーに提供する自信を得ました。

エンジニアが手作業で構築できるよりも速くカスタムエージェントをデプロイする製品を持つあらゆるチームにとって、Cresta のアプローチは有用な参考例です。エージェントやメタエージェントでは、初期構築の後の作業こそが最も難しい部分であることが多いのです。

ご覧ください。 Conductor がビジネスコンテキストを、より優れたエージェントの設計、実装、継続的な改善へと変換する様子を。

Cresta チームからのベストプラクティス
自社製品を自分で使う(Dogfooding) Conductor はまず内部ツールとして稼働し、その出力が AI に精通したエンジニアが構築するものと一致して初めて製品になりました。
あなたの独自の強みに焦点を当てる Crestaは、自分たちだけがもたらせる専門知識(彼らの会話データとカスタマーエクスペリエンスの理解)と、Agent SDKから既製品として入手できるものとの間に明確な一線を引き、その線の誤った側にあたるものは何も構築しないことを拒みました。
エージェントのどの部分を決定論的にするべきか 決して失敗してはならない企業の重要なワークフローを堅牢化し、それ以外は柔軟にしておきましょう。そうしないと、望んでいたインタラクティブなエージェント体験は実現できません。
本番環境への到達は簡単な部分 初期構築は作業全体の約20%にすぎず、残りの80%はその後のテスト、最適化、継続的な改善に費やされます。そのため、ローンチではなくイテレーションのループを中心にツール類を設計しましょう。
原文の出典

Claude Blog

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください