AI agent không phải là một mô hình đơn lẻ. Đó là một hệ thống: mô hình biết suy luận, công cụ nó được dùng, tri thức đáng tin cậy, quy tắc phải tuân theo và cách chứng minh nó hoạt động đúng. Đây là sáu lớp chúng tôi thiết kế cho mọi dự án agent năm 2026.
1. Bậc thang mô hình
Các mô hình frontier như Claude Opus 5.5, GPT-6 Astra và Gemini 3.8 Flash đã xử lý tốt suy luận nhiều bước, lập trình và sử dụng máy tính. Nhưng thiết kế tốt hiếm khi dùng một mô hình cho mọi việc. Phân loại, trích xuất và điều phối chạy tốt trên mô hình nhỏ như GPT-6 Luna với giá 0,10 USD cho một triệu token đầu vào; chỉ khâu lập kế hoạch và phán đoán khó mới cần tầng đắt tiền.
Prompt caching cũng quan trọng không kém. Tháng 9/2026, Anthropic giảm 60% giá đọc cache cho Claude Opus 5.5 và OpenAI công bố cải tiến prompt caching cho GPT-6, nên agent dùng lại hướng dẫn hoặc tài liệu dài sẽ rẻ hơn nhiều.
2. Công cụ và ngữ cảnh: MCP và A2A
Model Context Protocol (MCP) là cách chuẩn để nối agent với hệ thống của bạn: CRM, ERP, cơ sở dữ liệu, kho file, email. Thay vì viết code kết nối riêng cho từng mô hình, bạn mở một công cụ một lần và mọi agent tương thích MCP đều dùng được.
Agent2Agent (A2A) giải quyết bài toán khác: agent của các nhà cung cấp khác nhau tìm thấy nhau và chuyển giao việc. Từ tháng 8/2026, cả hai giao thức cùng nằm trong Agentic AI Foundation của Linux Foundation, giúp giảm rủi ro phụ thuộc một nhà cung cấp.
3. Tri thức đáng tin cậy: RAG
Retrieval-augmented generation giúp câu trả lời dựa trên chính tài liệu của bạn. Một lớp RAG tốt sẽ chia nhỏ và đánh chỉ mục nội dung trong cơ sở dữ liệu vector, truy xuất đúng đoạn, xếp hạng lại và buộc agent trích dẫn nguồn. Trong hệ thống ghép CV với vị trí tuyển dụng của chúng tôi, cách làm này đạt độ chính xác 90% và giảm 40% thời gian sàng lọc.
4. Hành động: ưu tiên API, sau đó mới đến sử dụng máy tính
Sử dụng máy tính cho phép agent thao tác trên màn hình như con người. Tính năng này rất hữu ích với công cụ cũ không có API, nhưng chậm hơn và khó đoán hơn. Nguyên tắc của chúng tôi: dùng API hoặc công cụ MCP khi có, chỉ dùng thao tác màn hình cho những bước thật sự cần.
5. Điều phối: một quản lý và các chuyên gia
Việc phức tạp sẽ trơn tru hơn khi một agent lập kế hoạch chia yêu cầu thành các việc và giao cho agent chuyên trách, mỗi agent có hướng dẫn và công cụ hẹp. BeeStaff.ai hoạt động đúng như vậy: Max lập kế hoạch, tám agent chuyên trách nghiên cứu, viết, thiết kế và follow-up. Các framework như LangGraph, CrewAI, Pydantic AI và SDK agent của chính các nhà cung cấp mô hình đều hỗ trợ mô hình này.
6. Guardrail và đánh giá
- Con người duyệt mọi thứ ra khỏi công ty: email, bài đăng, thanh toán và thay đổi hợp đồng.
- Hạn mức chi phí và giới hạn tần suất để vòng lặp agent không bao giờ tạo hóa đơn bất ngờ.
- Nhật ký đầy đủ mọi lần gọi công cụ để kiểm tra và chạy lại từng hành động.
- Bộ đánh giá gồm ví dụ thật và kết quả mong đợi, chạy trước mỗi lần đổi mô hình hoặc prompt.
- Kiểm soát dữ liệu: triển khai riêng, lưu tại EU hoặc on-premise, không dùng dữ liệu khách hàng để huấn luyện khi cần.
Checklist trước khi xây dựng
Bạn có mô tả được tác vụ thành đầu vào, các bước và kết quả mong đợi không? Dữ liệu đã sẵn sàng và được phép sử dụng chưa? Agent cần đọc và ghi vào những hệ thống nào? Thành công được đo bằng con số nào? Trả lời được bốn câu hỏi này, phần còn lại của kiến trúc có thể thiết kế xoay quanh chúng, thường trong một pilot hai tuần.


