AIエージェントは単一のモデルではありません。推論するモデル、使えるツール、信頼できる知識、守るべきルール、そして正しく動くことを証明する仕組みから成るシステムです。2026年の私たちのエージェント開発で必ず設計する6つのレイヤーを紹介します。
1. モデルの使い分け
Claude Opus 5.5、GPT-6 Astra、Gemini 3.8 Flash などのフロンティアモデルは、多段階の推論、コーディング、コンピューター操作をこなせるようになりました。しかし本番設計で一つのモデルにすべてを任せることはほとんどありません。分類・抽出・ルーティングは入力100万トークンあたり0.10ドルの GPT-6 Luna のような小型モデルで十分で、高価なモデルが必要なのは計画立案と難しい判断だけです。
プロンプトキャッシュも同じくらい重要です。2026年9月、Anthropic は Claude Opus 5.5 のキャッシュ読み取り料金を60%引き下げ、OpenAI も GPT-6 のプロンプトキャッシュ改善を発表しました。長い指示や文書を繰り返し使うエージェントの運用コストは大きく下がります。
2. ツールとコンテキスト:MCP と A2A
Model Context Protocol(MCP)は、CRM、ERP、データベース、ファイルストレージ、メールなどの社内システムにエージェントを接続する標準的な方法です。モデルごとに接続コードを書く代わりに、ツールを一度公開すれば MCP 対応のどのエージェントからも使えます。
Agent2Agent(A2A)は別の課題を解決します。異なるベンダーのエージェントが互いを見つけ、タスクを受け渡す仕組みです。2026年8月以降、両プロトコルは Linux Foundation の Agentic AI Foundation の下にあり、ベンダーロックインのリスクが下がりました。
3. 信頼できる知識:RAG
検索拡張生成(RAG)は、回答を自社の文書に基づかせる技術です。優れた RAG レイヤーは、内容を分割してベクトルデータベースに索引化し、適切な箇所を検索・再順位付けし、エージェントに出典を示させます。私たちの求人と履歴書のマッチングシステムでは、この方法で90%のマッチング精度と選考時間40%短縮を実現しました。
4. アクション:まずAPI、次にコンピューター操作
コンピューター操作により、エージェントは人と同じように画面を操作できます。API のない旧来のツールには非常に有効ですが、速度と予測可能性では劣ります。私たちの原則はシンプルで、API や MCP ツールがあればそれを使い、画面操作は本当に必要な工程だけに限定します。
5. オーケストレーション:マネージャーと専門エージェント
複雑な仕事は、計画担当のエージェントが依頼をタスクに分解し、指示とツールを絞った専門エージェントに割り当てるとうまく進みます。BeeStaff.ai もこの方式で、Max が計画し、8つの専門エージェントが調査・執筆・デザイン・フォローアップを行います。LangGraph、CrewAI、Pydantic AI などのフレームワークや、各モデル提供元のエージェント SDK も同じ設計を支えています。
6. ガードレールと評価
- 社外に出るもの(メール、投稿、支払い、契約変更)はすべて人が承認する。
- 利用上限とレート制限を設け、エージェントのループが想定外の請求を生まないようにする。
- すべてのツール呼び出しを記録し、各アクションを監査・再実行できるようにする。
- 実例と期待結果からなる評価セットを用意し、モデルやプロンプトを変更するたびに実行する。
- データ管理:専用環境での運用、EU またはオンプレミスでの保存、必要に応じて顧客データを学習に使わない。
開発前のチェックリスト
タスクを入力・手順・期待する出力として説明できますか。データは準備でき、利用が許可されていますか。エージェントはどのシステムを読み書きする必要がありますか。成功を数字でどう測りますか。この4つに答えられれば、残りのスタックはそれに沿って設計でき、通常は2週間のパイロットで検証できます。


