Dự án này triển khai các hệ thống multi-agent thông minh sử dụng LangGraph và LangChain, cho phép nhiều AI agent chuyên biệt cộng tác với nhau để giải quyết các tác vụ phức tạp.
- Python >= 3.12
- UV package manager
Bước 1: Clone repository
git clone <repository-url>
cd Multi-agentBước 2: Cài đặt dependencies
uv syncBước 3: Cấu hình biến môi trường
Tạo file .env trong thư mục gốc:
OPENAI_API_KEY=your_openai_api_key
TAVILY_API_KEY=your_tavily_api_keyFile: Multi-agent.ipynb
Hệ thống multi-agent đơn giản với supervisor quản lý hai agent chuyên biệt để xử lý các tác vụ tìm kiếm thông tin và tính toán.
- ✅ Tìm kiếm web real-time với Tavily Search
- ✅ Tính toán toán học (cộng, nhân, chia)
- ✅ Supervisor thông minh tự động phân bổ công việc
- ✅ Hỗ trợ tiếng Việt đầy đủ
Supervisor (GPT-4o)
│
┌─────────┴─────────┐
▼ ▼
Research Agent Math Agent
(Web Search) (Calculator)
- Tools:
TavilySearch(tìm kiếm web real-time) - Chức năng: Tìm kiếm và tổng hợp thông tin từ internet
- Model: GPT-4o-mini
- Tools:
add(),multiply(),divide() - Chức năng: Thực hiện các phép tính toán học
- Model: GPT-4o-mini
- Model: GPT-4o
- Chức năng:
- Phân tích yêu cầu người dùng
- Giao việc cho agent phù hợp
- Tổng hợp kết quả cuối cùng
- Mở file Multi-agent.ipynb
- Chạy lần lượt từng cell bằng cách nhấn nút
▶️ Run
Example 1: Tìm kiếm thông tin
"Ai là thị trưởng của thành phố New York?"→ Research Agent tìm kiếm trên web
Example 2: Tính toán
"Kết quả của phép tính (3 + 5) x 7 là bao nhiêu?"→ Math Agent thực hiện tính toán
Example 3: Kết hợp cả hai
"Hãy tìm GDP của Việt Nam năm 2023 và 2024,
sau đó tính toán tỷ lệ tăng/giảm phần trăm giữa hai năm này?"→ Research Agent tìm GDP → Math Agent tính tỷ lệ
File: Visual-Agentic-AI.ipynb
Hệ thống multi-agent nâng cao kết hợp khả năng nghiên cứu học thuật và xử lý hình ảnh với computer vision.
- 🔍 Tìm kiếm bài báo khoa học trên Arxiv
- 📚 Tra cứu thông tin trên Wikipedia
- 🖼️ Mô tả chi tiết hình ảnh với GPT-4o-mini
- 🎯 Phát hiện và đếm đối tượng với YOLOv11x
- 🤝 Kết hợp nhiều agent để xử lý tác vụ phức tạp
- 🌐 Hỗ trợ ảnh local và URL
Supervisor (GPT-4o)
│
┌─────────┴─────────┐
▼ ▼
Research Agent Visual Agent
(Arxiv, Wiki) (Vision AI)
│
┌────┴────┐
▼ ▼
Image Object
Describer Detection
(GPT-4o) (YOLOv11)
- Tools:
ArxivQueryRun: Tìm bài báo khoa họcWikipediaQueryRun: Tra cứu Wikipedia
- Chức năng: Tìm kiếm và tổng hợp thông tin học thuật
- Model: GPT-4o-mini
- Đặc biệt: Tự động dịch kết quả sang tiếng Việt
- Tools:
image_describer: Mô tả nội dung ảnh chi tiếtdetect_and_count_objects: Phát hiện đối tượng với YOLO
- Chức năng:
- Phân tích và mô tả hình ảnh
- Phát hiện, đếm và định vị đối tượng
- Trích xuất văn bản trong ảnh (OCR)
- Model: GPT-4o-mini + YOLOv11x
- Output: Mô tả chi tiết, số lượng đối tượng, tọa độ bounding box, confidence score
- Model: GPT-4o
- Chức năng:
- Điều phối Research Agent và Visual Agent
- Kết hợp kết quả từ nhiều agent
- Trả lời cuối cùng cho người dùng
- Mở file Visual-Agentic-AI.ipynb
- Chạy lần lượt từng cell bằng cách nhấn nút
▶️ Run
Example 1: Nghiên cứu đơn giản
"Nghiên cứu mới nhất về positional embeddings là gì?"→ Research Agent tìm trên Arxiv và Wikipedia
Example 2: Phân tích ảnh
"Có bao nhiêu con chó trong bức ảnh này?
Bức ảnh: https://example.com/dog.jpg"→ Visual Agent phát hiện và đếm đối tượng
Example 3: Kết hợp Visual + Research
"Khái niệm được thể hiện trong bức ảnh này là gì?
Bức ảnh: https://huggingface.co/datasets/tmnam20/Storage/resolve/main/rope.png
Hãy cung cấp thông tin chi tiết và các bài nghiên cứu liên quan."→ Visual Agent mô tả ảnh → Research Agent tìm thông tin chi tiết
Example 4: Phân tích chi tiết
"Con chó trong hình có bộ lông màu gì?
Và hãy cung cấp cho tôi thêm thông tin về giống chó này.
Bức ảnh: https://example.com/terrier.jpg"→ Visual Agent mô tả → Research Agent tìm thông tin về giống chó
langchain==0.3.24- Framework chính cho LLM applicationslangchain-openai==0.3.14- Integration với OpenAI modelslanggraph>=0.6.11- State machine và workflow cho multi-agentlanggraph-supervisor>=0.0.29- Supervisor pattern implementation
langchain-tavily==0.1.6- Web search real-timelangchain-community>=0.3.23- Community tools (Arxiv, Wikipedia, DuckDuckGo)arxiv>=2.4.0- Arxiv API clientwikipedia>=1.4.0- Wikipedia API clientduckduckgo-search>=8.1.1- DuckDuckGo search engine
ultralytics>=8.3.252- YOLOv11 object detection frameworktorch>=2.9.1- PyTorch deep learning backendtorchvision>=0.24.1- Computer vision utilitiesopencv-python>=4.11.0.86- Image processing library
python-dotenv>=1.2.1- Environment variables managementpython-magic>=0.4.27- File type detectionipykernel>=7.1.0- Jupyter notebook kernel support
📄 Xem pyproject.toml để biết danh sách đầy đủ các dependencies.
- ✅ Nhẹ, không yêu cầu GPU
- ✅ Chỉ cần ~500MB RAM
- ✅ Chạy nhanh trên mọi máy
⚠️ YOLO Model: Lần đầu chạy sẽ tự động tảiyolo11x.pt(~200MB)⚠️ RAM: Yêu cầu tối thiểu ~2GB RAM⚠️ GPU: Tự động sử dụng CUDA nếu có GPU NVIDIA (tăng tốc 10-20x)⚠️ CPU: Vẫn chạy được nhưng chậm hơn (~2-3s/ảnh)
OPENAI_API_KEY- Bắt buộc cho cả hai hệ thốngTAVILY_API_KEY- Chỉ cần cho Simple Multi-Agent