Khung đa tác tử
Các framework đa tác nhân dựa trên LLM — là các nền tảng phần mềm cho phép nhiều AI-tác nhân tự trị, được xây dựng trên nền tảng các mô hình ngôn ngữ lớn (LLM), tương tác với nhau để cùng giải quyết các nhiệm vụ phức tạp[1]. Trong các hệ thống như vậy, trọng tâm được đặt vào sự đa dạng về hồ sơ của các tác nhân, giao tiếp giữa chúng và ra quyết định tập thể. Cách tiếp cận này sử dụng «trí tuệ tập thể» của nhóm, trong đó mỗi tác nhân thực hiện một vai trò chuyên biệt, còn việc trao đổi thông điệp giữa chúng mô phỏng sự cộng tác của con người.
Điều này cho phép mô phỏng các tình huống phức tạp trong thế giới thực và giải quyết các nhiệm vụ vượt ra ngoài khả năng của một tác nhân thông minh đơn lẻ. Các hệ thống LLM đa tác nhân đã cho thấy kết quả thành công trong các lĩnh vực như phát triển phần mềm, mô phỏng xã hội, trò chơi kinh tế và mô hình hóa các cuộc thảo luận chính sách[1].
Các framework và phương pháp tiếp cận chính
Sự phát triển của các hệ thống đa tác nhân đã dẫn đến sự xuất hiện của một số framework mã nguồn mở, giúp đơn giản hóa việc tạo và nghiên cứu chúng.
MetaGPT (2023)
Một trong những framework mã nguồn mở đầu tiên, tập trung vào sự cộng tác theo nguyên tắc «dây chuyền lắp ráp» (assembly line). MetaGPT tích hợp vào hệ thống các quy trình vận hành chuẩn (SOPs) và giao cho mỗi tác nhân một vai trò nhất định (ví dụ: quản lý sản phẩm, kỹ sư, kiểm thử viên). Cách tiếp cận này cho phép phân rã nhiệm vụ phức tạp thành các nhiệm vụ con, phân phối chúng giữa các tác nhân chuyên biệt, từ đó giảm thiểu sự hỗn loạn và nguy cơ ảo giác[2].
CAMEL (2023)
Framework CAMEL (Communicative Agents for "Mind" Exploration) tập trung vào tương tác tự trị giữa các tác nhân thông qua đối thoại. Nó đề xuất phương pháp inception prompting để phối hợp cuộc trò chuyện giữa các LLM-tác nhân, hướng dẫn chúng đến mục tiêu chung. Mỗi tác nhân được trao vai trò và ngữ cảnh, sau đó các tác nhân giao tiếp bằng ngôn ngữ tự nhiên, dần dần xây dựng giải pháp chung. CAMEL đã thể hiện hiệu quả trong các tình huống đòi hỏi sự hợp tác mà không cần sự can thiệp trực tiếp của con người[1].
AutoGen (2023)
Một framework linh hoạt và có thể tùy chỉnh từ các nhà nghiên cứu Microsoft, được thiết kế để tạo ra các ứng dụng phức tạp dựa trên giao tiếp của nhiều LLM. AutoGen cho phép lập trình logic tương tác của các tác nhân cả bằng mã lẫn bằng ngôn ngữ tự nhiên. Nó hỗ trợ tích hợp với các công cụ bên ngoài và API, giúp nó phù hợp với nhiều nhiệm vụ khác nhau — từ phát triển phần mềm đến tạo ra các hệ thống đối thoại[1].
AgentVerse (2023)
Nền tảng mã nguồn mở được cộng đồng OpenBMB phát triển để nghiên cứu sự cộng tác động và hành vi nổi trội của các tác nhân. AgentVerse cung cấp hai chế độ hoạt động:
- Giải quyết nhiệm vụ (task-solving): Nhiều LLM-tác nhân kết hợp thành một nhóm để thực hiện nhiệm vụ phức tạp (ví dụ: phát triển phần mềm cộng tác).
- Mô phỏng môi trường (simulation): Cho phép người dùng thiết lập môi trường ảo và quan sát sự tương tác của các tác nhân (ví dụ: mô phỏng lớp học hoặc thế lưỡng nan của người tù).
Nền tảng này nhấn mạnh tầm quan trọng của môi trường được chuẩn hóa và các giao thức giao tiếp để quản lý giao tiếp có kiểm soát[3].
CrewAI (2024)
Framework tập trung vào việc tích hợp LLM-tác nhân vào các quy trình kinh doanh và phân tích dữ liệu. CrewAI triển khai khái niệm AI-Based Agents Workflow (AgWf), trong đó các tác nhân thực hiện các bước được mô tả dưới dạng hướng dẫn văn bản và có thể sử dụng các công cụ bên ngoài (các lớp/hàm Python). Điều này cho phép tự động hóa các tình huống phân tích phức tạp, kết hợp sự linh hoạt của LLM với mã xác định[2].
LangGraph (2024)
Một framework thử nghiệm sử dụng cấu trúc đồ thị để biểu diễn trạng thái và ngữ cảnh trong các cuộc đối thoại với LLM. Đặc điểm chính của LangGraph — hỗ trợ quy trình làm việc theo chu kỳ. Điều này cho phép các tác nhân trao đổi dữ liệu thông qua đồ thị tri thức chung, tìm kiếm thông tin theo phương pháp lặp, đánh giá độ tin cậy của nó và điều chỉnh câu trả lời, điều này đặc biệt hữu ích trong các nhiệm vụ tìm kiếm thông tin (QA) với cơ sở tri thức được bổ sung[2].
Các dự án khác
Các dự án thử nghiệm AutoGPT và AgentGPT cũng thu hút sự chú ý rộng rãi, chúng đã chứng minh tiềm năng của các AI-tác nhân hoàn toàn tự trị, có khả năng tự đặt mục tiêu, thực hiện tìm kiếm web, chạy mã và quản lý tệp. Mặc dù các dự án này chưa được phản biện khoa học, chúng đã nhấn mạnh tầm quan trọng của các thành phần lập kế hoạch, bộ nhớ và công cụ để xây dựng các tác nhân thực sự tự lập[4].
Ứng dụng của các hệ thống đa tác nhân
- Tự động hóa phát triển phần mềm: Các nhóm LLM-tác nhân đảm nhận vai trò quản lý, lập trình viên và kiểm thử viên, cùng nhau lập kế hoạch và triển khai các dự án phần mềm. Nghiên cứu ChatDev cho thấy một nhóm bốn tác nhân có thể tạo ra một ứng dụng đơn giản trong vài phút, tiến hành đối thoại ở tất cả các giai đoạn từ xác định nhiệm vụ đến kiểm thử[2].
- Trợ lý thông minh: Các sản phẩm doanh nghiệp như Microsoft 365 Copilot và IBM Watsonx Orchestrate sử dụng nhiều tác nhân để thực hiện các nhiệm vụ phức tạp, trong đó một tác nhân xử lý yêu cầu, tác nhân khác trích xuất dữ kiện từ cơ sở dữ liệu, tác nhân thứ ba soạn thảo báo cáo.
- Nghiên cứu khoa học: Các tác nhân được sử dụng để tạo ra và phê bình các giả thuyết. Trong các phương pháp tiếp cận như Guided Debate hay Self-Refine, một tác nhân đề xuất giải pháp, còn tác nhân kia đánh giá và điều chỉnh nó, giúp giảm số lượng lỗi[4].
- Mô phỏng xã hội và thế giới ảo: Trong dự án tiêu biểu Generative Agents, hàng chục LLM-tác nhân được trang bị tính cách và bộ nhớ đã mô phỏng cuộc sống của một thị trấn ảo nhỏ, thể hiện sự tương tác xã hội đáng tin cậy. Những mô phỏng như vậy có thể được ứng dụng trong trò chơi (để tạo NPC thực tế), trong giáo dục và khoa học xã hội[4].
Thách thức và triển vọng
Mặc dù có những thành công, các hệ thống đa tác nhân vẫn đối mặt với một số vấn đề nghiêm trọng:
- Ảo giác và lỗi lan truyền: Lỗi mà một tác nhân mắc phải có thể được truyền theo chuỗi đến các tác nhân khác, những tác nhân này lấy nó làm cơ sở cho lý luận của mình, dẫn đến sự méo mó trong hoạt động của toàn bộ nhóm[1].
- Khả năng mở rộng và mức tiêu thụ tài nguyên: Mỗi tác nhân dựa trên LLM đòi hỏi tài nguyên tính toán đáng kể. Đảm bảo hoạt động đồng thời của hàng chục tác nhân là một nhiệm vụ kỹ thuật phức tạp[1].
- Phối hợp và quản lý: Khi số lượng tác nhân tăng lên, nguy cơ hỗn loạn cũng tăng theo. Cần có các cơ chế «điều phối» được cân nhắc kỹ lưỡng để quản lý sự tương tác của chúng.
- Đánh giá và kiểm thử: Thiếu các benchmark được chấp nhận rộng rãi để so sánh khách quan các framework đa tác nhân khác nhau.
Trong tương lai, dự kiến sẽ xuất hiện các hệ thống đa phương thức hiệu quả và an toàn hơn, trong đó các tác nhân có thể trao đổi không chỉ văn bản mà còn cả hình ảnh và các dữ liệu khác. Việc tích hợp Reinforcement Learning có thể dạy các nhóm tác nhân phối hợp tốt hơn theo thời gian, đạt được hiệu ứng «trí tuệ tập thể». Cuối cùng, các framework đa tác nhân là một bước hướng tới việc tạo ra các AI-hệ thống linh hoạt và mạnh mẽ hơn, nơi nhiều «trí tuệ» chuyên biệt cùng làm việc.
Tham khảo
- Bài tổng quan: Large Language Model based Multi-Agents (2024)
- Bài tổng quan: LLMs Working in Harmony (2025)
Tài liệu
- Yao, S. et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629.
- Hong, S. et al. (2023). MetaGPT: Meta Programming for a Multi-Agent Collaborative Framework. arXiv:2308.00352.
- Li, G. et al. (2023). CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society. arXiv:2303.17760.
- Wu, Q. et al. (2023). AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155.
- Liu, X. et al. (2023). AgentBench: Evaluating LLMs as Agents. arXiv:2308.03688.
- Yao, S. et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601.
- Shinn, N. et al. (2023). Reflexion: Language Agents with Verbal Reinforcement Learning. arXiv:2303.11366.
- Chen, W. et al. (2023). AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors. arXiv:2308.10848.
- Park, J. S. et al. (2023). Generative Agents: Interactive Simulacra of Human Behavior. arXiv:2304.03442.
- Guo, T. et al. (2024). Large Language Model Based Multi-Agents: A Survey of Progress and Challenges. arXiv:2402.01680.
- Chen, Q. et al. (2024). ChatDev: Communicative Agents for Software Development. arXiv:2307.07924.
- Duan, Z.; Wang, J. (2024). Exploration of LLM Multi-Agent Application Implementation Based on LangGraph + CrewAI. arXiv:2411.18241.
- Aratchige, R. M.; Ilmini, W. M. K. S. (2025). LLMs Working in Harmony: A Survey on the Technological Aspects of Building Effective LLM-Based Multi-Agent Systems. arXiv:2504.01963.
Chú thích
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Wang, L., et al. «Large Language Model based Multi-Agents: A Survey of Progress and Challenges». arXiv:2402.01680 [cs.AI], 1 февр. 2024 г. [1]
- ↑ 2.0 2.1 2.2 2.3 Yu, H., et al. «LLMs Working in Harmony: A Survey on the Technological Aspects of Building Effective LLM-Based Multi Agent Systems». arXiv:2504.01963 [cs.CL], 2 апр. 2025 г. [2]
- ↑ «GitHub - OpenBMB/AgentVerse». GitHub. [3]
- ↑ 4.0 4.1 4.2 «Building Your First LLM Agent Application». NVIDIA Technical Blog. [4]