
Mục đích thiết kế dự án : Trong bài viết này, tôi sẽ chia sẻ về thiết kế và triển khai một cụm trợ lý AI OpenClaw phân tán, kết nối với một hoặc hai Large Language Models (LLMs) được lưu trữ cục bộ, chạy trên một máy chủ hỗ trợ GPU hoặc laptop chơi game. Thay vì phụ thuộc vào việc sử dụng các API AI dựa trên đám mây. Tôi đã sử dụng các mô hình mã nguồn mở như `Qwen 3.5` hoặc `DeepSeek-R1` để cung cấp dịch vụ suy luận cho nhiều tác nhân OpenClaw, nhờ đó chúng ta có thể giảm chi phí token AI đám mây và so sánh hiệu suất của các mô hình LLM khác nhau.
Trong hệ thống cụm trợ lý AI này, máy chủ GPU đóng vai trò là công cụ suy luận AI tập trung, và các tác nhân phân tán (máy tính chạy OpenClaw giao tiếp với máy chủ LLM qua mạng) thực hiện các tác vụ, thu thập thông tin hệ thống và tương tác với mô hình để đưa ra quyết định. Bài viết này bao gồm ba phần sau:
- Thiết lập mô hình LLM mã nguồn mở trên máy chủ GPU hoặc laptop/máy tính chơi game.
- Cấu hình và công khai dịch vụ suy luận LLM để các nút OpenClaw từ xa có thể truy cập.
- Triển khai các tác nhân OpenClaw trên máy tính hoặc laptop mục tiêu và kết nối chúng với dịch vụ LLM tập trung.
# Tác giả: Yuancheng Liu
# Ngày tạo: 2026/03/10
# Phiên bản: v_0.0.2
# Bản quyền: Copyright (c) 2026 LiuYuancheng
# Giấy phép: MIT License
1. Giới thiệu
Trong dự án này, thiết kế của "OpenClaw-cluster" tách biệt các dịch vụ suy luận LLM khỏi các nút thực thi tác nhân. Một máy chủ hỗ trợ GPU hoặc laptop chơi game trong mạng nội bộ lưu trữ các mô hình LLM thông qua framework `Ollama`, cung cấp một dịch vụ API cục bộ nhẹ để chạy các mô hình mã nguồn mở. Do đó, nhiều máy tính hoặc laptop chạy tác nhân OpenClaw kết nối với dịch vụ LLM tập trung này để thực hiện suy luận và thực thi tác vụ.
1.1 Tóm tắt và Bối cảnh
Trong tháng qua, trợ lý AI cá nhân [OpenClaw](https://openclaw.ai/) đã nhanh chóng trở thành một trong những dự án AI mã nguồn mở được thảo luận nhiều nhất. Sự phổ biến nhanh chóng của nó đã dẫn đến một làn sóng dịch vụ và doanh nghiệp mới xung quanh hệ sinh thái. Ví dụ, ở Trung Quốc, nhiều cá nhân và tổ chức hiện đang cung cấp dịch vụ cài đặt/gỡ cài đặt, hỗ trợ triển khai từ xa và các khóa đào tạo trẻ em về cách sử dụng OpenClaw hiệu quả. Một số công ty thậm chí còn tiếp thị "máy tính/laptop OpenClaw tất cả trong một" được cài đặt sẵn OpenClaw và các mô hình ngôn ngữ lớn cục bộ. Và các công ty công nghệ lớn như Tencent cũng đã bắt đầu cung cấp các dịch vụ triển khai OpenClaw liên quan:

Một trong những lý do chính đằng sau sự chấp nhận nhanh chóng của OpenClaw là kiến trúc dựa trên "kỹ năng" của nó, cho phép tác nhân gọi nhiều công cụ và các bước suy luận một cách linh hoạt khi thực hiện các tác vụ. Mặc dù thiết kế này tăng cường đáng kể khả năng thông minh và tự động hóa của trợ lý AI, nhưng nó cũng làm tăng đáng kể số lượng cuộc gọi API LLM. Kết quả là, mức tiêu thụ token có thể cao hơn hàng chục hoặc thậm chí hàng trăm lần so với các tác nhân AI truyền thống chỉ sử dụng một lời nhắc. Nếu bạn không cần thực hiện các tác vụ phức tạp và có một máy chủ GPU hoặc trạm làm việc như Nvidia GB10 Spark hoặc một laptop chơi game với card đồ họa RTX-series 40-50XX, bạn có thể liên kết OpenClaw của mình với LLM mã nguồn mở như Qwen 3.5 hoặc DeepSeek‑R1 chạy trên các máy cục bộ này để tiết kiệm chi phí, đặc biệt khi bạn có nhiều tác nhân OpenClaw chạy trên các thiết bị khác nhau.
1.2 Kiến trúc hệ thống
Hệ thống tổng thể tuân theo kiến trúc tác nhân phân tán + suy luận tập trung như sơ đồ dưới đây. do đó, nó cho phép một máy chủ GPU duy nhất hỗ trợ nhiều tác nhân OpenClaw cùng lúc, hình thành một cụm tác nhân AI nhẹ trong khi vẫn giữ chi phí phần cứng và đám mây thấp.

Kiến trúc bao gồm bốn lớp:
-
Lớp Máy chủ LLM : Một máy chủ GPU hoặc laptop AI/chơi game lưu trữ các mô hình LLM mã nguồn mở thông qua Ollama.
-
Lớp Truy cập Mạng : Truy cập an toàn được cung cấp thông qua chuyển tiếp cổng SSH qua bộ định tuyến, cổng hoặc máy chủ trung gian.
-
Lớp Tác nhân : Nhiều tác nhân OpenClaw chạy trên laptop hoặc máy tính của người dùng và gửi yêu cầu LLM thông qua cổng được chuyển tiếp.
-
Lớp Tương tác Người dùng : Người dùng tương tác với các tác nhân thông qua hệ thống cục bộ của họ hoặc các nền tảng nhắn tin như ứng dụng di động.
Để cải thiện bảo mật và tránh trực tiếp công khai dịch vụ LLM ra mạng công cộng, kiến trúc sử dụng chuyển tiếp cổng SSH. Dịch vụ suy luận Ollama chạy cục bộ trên cổng 11434, và cổng này được chuyển tiếp an toàn đến các nút OpenClaw được ủy quyền thông qua SSH (cổng 22). Với cách tiếp cận này:
-
API LLM không được công khai trực tiếp ra mạng.
-
Chỉ những người dùng đã xác thực với tài khoản SSH hợp lệ mới có thể truy cập dịch vụ mô hình
-
Người dùng bên ngoài có thể kết nối thông qua một cổng, bộ định tuyến hoặc máy chủ trung gian.
-
Kiểm soát truy cập có thể dễ dàng quản lý bằng cách bật hoặc tắt tài khoản người dùng trên máy chủ GPU
2. Thiết lập LLM mã nguồn mở tương thích OpenClaw trên GPU
Tất cả các cấu hình trong phần này nên được thực hiện trên máy chủ GPU sẽ lưu trữ Large Language Model (LLM).
Để chạy OpenClaw cục bộ mà không phụ thuộc vào các API đám mây, trước tiên chúng ta cần triển khai một LLM mã nguồn mở tương thích. Một trong những cách dễ nhất để quản lý và chạy LLM cục bộ là sử dụng Ollama, cung cấp một runtime nhẹ để tải xuống, quản lý và phục vụ các LLM mã nguồn mở với giao diện dòng lệnh đơn giản.
2.1 Cài đặt Ollama trên Máy chủ GPU
Để cài đặt Ollama trên máy chủ GPU của bạn. Bạn có thể tải xuống từ trang chính thức:https://ollama.com/download/linux
Đối với hầu hết các hệ thống Linux, việc cài đặt có thể được hoàn tất bằng cách sử dụng:
curl -fsSL https://ollama.com/install.sh | sh
Sau khi cài đặt, hãy xác minh rằng dịch vụ đang hoạt động và khởi động dịch vụ:
ollama --version
ollama serve
Ollama sẽ công khai một điểm cuối API cục bộ (cổng mặc định localhost 11434) mà các tác nhân OpenClaw có thể kết nối sau này.
2.2 Tải các Mô hình Mã nguồn mở tương thích OpenClaw
OpenClaw hỗ trợ nhiều LLM mã nguồn mở miễn là chúng cung cấp khả năng gọi công cụ và suy luận. Thông qua Ollama, người dùng có thể dễ dàng triển khai nhiều mô hình khác nhau tùy thuộc vào tài nguyên GPU có sẵn của họ.
Dưới đây là bảng tham khảo các mô hình thường được sử dụng tương thích với OpenClaw:
| Tên mô hình | Kích thước tham số | Trường hợp sử dụng tốt nhất | Cửa sổ ngữ cảnh | Phần cứng đề xuất |
|---|---|---|---|---|
| GLM-5 | 744B (MoE) | Gỡ lỗi phức tạp & lập trình đa bước | 200K | Enterprise (A100/H100) hoặc Cloud API |
| GPT-OSS-120B | 120B | Suy luận quan trọng & quyền riêng tư dữ liệu | 128K | Dual RTX 6000 / Mac Studio (Ultra) |
| DeepSeek-V3.2 | 671B (MoE) | Các tác vụ tác nhân tốc độ cao đa năng | 128K | Cloud API / Multi-GPU Server |
| Kimi-K2.5 | 1T (MoE) | Thị giác + Văn bản (tác vụ tác nhân đa phương thức) | 1M | Cloud API / 8x H100 |
| Qwen 3.5 (32B) | 32B | Cân bằng tốt nhất cho GPU tiêu dùng cao cấp | 128K | RTX 4090 (24GB VRAM) |
| Llama 4 Maverick | 70B | Trợ lý hàng ngày đáng tin cậy & gọi công cụ | 128K | Mac Studio / Multi-RTX 3090 |
| Qwen 3.5 (14B) | 14B | Các tác vụ tác nhân cục bộ cấp độ đầu vào | 64K | RTX 3060/4070 (12GB+ VRAM) |
| MiMo-V2-Flash | ~30B (Active) | "Suy nghĩ" cực nhanh & nghiên cứu dài hạn | 256K | RTX 4080/4090 |
Bạn cũng có thể duyệt các mô hình tương thích trực tiếp từ kho mô hình Ollama. Trên trang web Ollama, hãy kiểm tra thẻ Application để xác minh xem một mô hình có hỗ trợ chức năng gọi công cụ của OpenClaw hay không như hình dưới đây:

2.3 Tải xuống Mô hình LLM
Trong thử nghiệm này, máy chủ GPU được trang bị GPU RTX 3060 và A5000. Do đó, hai mô hình đã được chọn:
-
Qwen3.5-35B-A3B-FP8 để suy luận chất lượng cao
-
DeepSeek-R1-Tool-Calling-14B cho các tác vụ gọi công cụ nhẹ
Tải và chạy Qwen3.5-35B-A3B-FP8 bằng các lệnh dưới đây:
ollama pull qwen3.5:35b
ollama run qwen3.5:35b
Tải và chạy mô hình deepseek-r1-tool-calling:14b bằng các lệnh dưới đây:
ollama pull MFDoom/deepseek-r1-tool-calling:14b
ollama run deepseek-r1-tool-calling:14b
Sau khi các mô hình được tải xuống, Ollama sẽ tự động tải chúng khi chúng được gọi lần đầu tiên thông qua API.
2.4 Chạy Mô hình dưới dạng Dịch vụ Nền (tùy chọn)
Sau khi cài đặt, dịch vụ Ollama thường chạy ngầm. Khi một yêu cầu API được gửi đến điểm cuối Ollama, mô hình cần thiết sẽ tự động được tải vào bộ nhớ GPU. Yêu cầu API đầu tiên có thể mất nhiều thời gian hơn vì mô hình phải được khởi tạo. Để giảm độ trễ này, bạn có thể cấu hình mô hình chạy như một dịch vụ liên tục.
Trên các hệ thống Linux, một dịch vụ systemd đơn giản có thể được tạo để giữ mô hình được tải, như ví dụ dưới đây:
[Unit]
Description=ollamaQwen35B_service
After=network.target
[Service]
ExecStart=ollama run qwen3.5:35b
WorkingDirectory=/home//ollama
User=root
Restart=always
RestartSec=5
StandardOutput=null
StandardError=null
[Install]
WantedBy=multi-user.target
Sau đó sao chép tệp ollamaQwen35B_service.service vào thư mục /etc/systemd/system và khởi động dịch vụ:
sudo systemctl start ollamaQwen35B_service
Sau khi hoàn thành bước này, máy chủ GPU sẽ lưu trữ một dịch vụ suy luận LLM chạy cục bộ.
3. Chuyển tiếp Dịch vụ LLM Ollama đến Máy tính của Người dùng
Tất cả các cấu hình trong phần này nên được thực hiện trên máy tính hoặc laptop nơi tác nhân OpenClaw sẽ được cài đặt.
Thay vì công khai trực tiếp API Ollama ra mạng (có thể gây ra rủi ro bảo mật), chúng ta có thể sử dụng chuyển tiếp cổng SSH để tạo đường hầm an toàn cho dịch vụ đến máy cục bộ, nhờ đó tác nhân OpenClaw chạy trên laptop hoặc máy trạm của người dùng có thể tương tác với dịch vụ LLM như thể nó đang chạy cục bộ.
Để bảo mật và kiểm soát truy cập, nên tạo một tài khoản người dùng chuyên dụng trên máy chủ GPU chỉ được sử dụng để chuyển tiếp lưu lượng dịch vụ LLM, ví dụ tôi tạo một người dùng thông thường llmService trên GPU.
3.1 Tạo Đường hầm Chuyển tiếp Cổng SSH
Trên máy tính hoặc laptop mục tiêu nơi OpenClaw sẽ chạy, thực hiện lệnh SSH sau để tạo đường hầm giữa máy cục bộ và máy chủ GPU.
Nếu cả hai máy đều nằm trong cùng một mạng con hoặc mạng nội bộ, hãy chạy:
ssh -L localhost:11434:localhost:11434 llmService@
Lệnh này tạo một đường hầm an toàn ánh xạ:
Máy tính cục bộ: localhost:11434
│
│ (Đường hầm SSH)
▼
Máy chủ GPU: localhost:11434 (API Ollama)
3.3 Kiểm tra Kết nối API Ollama
Sau khi đường hầm SSH được thiết lập, bạn có thể xác minh kết nối bằng cách gửi một yêu cầu kiểm tra đến API Ollama.
Linux / macOS:
curl http://localhost:11434/api/chat -d "{\"model\":\"qwen3.5:9b\",\"messages\":[{\"role\":\"user\",\"content\":\"Hello!\"}]}"
Windows PowerShell:
curl.exe http://localhost:11434/api/chat -d '{"model":"qwen3.5:9b","messages":[{"role":"user","content":"Hello!"}]}'
Nếu kết nối hoạt động chính xác, API sẽ trả về một phản hồi JSON được tạo bởi mô hình LLM như hình dưới đây:

3.4 Kết nối qua Máy chủ Trung gian (Tùy chọn)
Trong một số môi trường, máy chủ GPU có thể nằm trong một mạng nội bộ bị hạn chế và không thể truy cập trực tiếp từ máy tính của người dùng. Trong trường hợp này, một máy chủ trung gian (bastion server) có thể được sử dụng để chuyển tiếp kết nối SSH.
Trên máy tính mục tiêu, chạy lệnh sau:
ssh -L localhost:11434:localhost:11434 -J @ llmService@
Điều này tạo ra đường dẫn kết nối sau:
Máy tính người dùng
│
▼
Máy chủ trung gian (Cổng SSH)
│
▼
Máy chủ GPU (Dịch vụ LLM Ollama)
Sau khi đường hầm được thiết lập, dịch vụ Ollama vẫn sẽ có thể truy cập cục bộ qua:
http://localhost:11434
4. Thiết lập OpenClaw trên Máy tính Người dùng
Tất cả các cấu hình trong phần này nên được thực hiện trên máy tính hoặc laptop nơi tác nhân OpenClaw sẽ được cài đặt.
4.1 Cài đặt Phụ thuộc Node.js
OpenClaw yêu cầu Node.js phiên bản 22 trở lên. Do đó, bước đầu tiên là cài đặt Node.js trên máy tính/laptop của người dùng. Tải xuống trình cài đặt từ trang web chính thức: https://nodejs.org/en/download
Cài đặt gói phù hợp dựa trên hệ điều hành của bạn (Windows, Linux, hoặc macOS) và sau khi cài đặt, xác minh rằng Node.js đã được cài đặt đúng cách:
node -v
npm -v
4.2 Cài đặt Trợ lý AI OpenClaw
Tiếp theo, cài đặt OpenClaw bằng cách làm theo hướng dẫn cài đặt chính thức: https://docs.openclaw.ai/start/getting-started
Đối với môi trường Linux, macOS hoặc WSL, việc cài đặt có thể được thực hiện bằng lệnh sau:
curl -fsSL https://openclaw.ai/install.sh | bash
4.3 Bỏ qua Cấu hình Mô hình Đám mây OpenClaw
Trong quá trình cài đặt, OpenClaw sẽ hỏi bạn có muốn cấu hình các nhà cung cấp mô hình hoặc tích hợp dịch vụ bên ngoài cho các kỹ năng hay không. Vì việc triển khai sử dụng một LLM được lưu trữ cục bộ thông qua Ollama, các cấu hình dựa trên đám mây này có thể được bỏ qua.
Ví dụ cấu hình cài đặt:
◇ Cấu hình kỹ năng ngay bây giờ? (được khuyến nghị)
│ Có
│
◇ Cài đặt các phụ thuộc kỹ năng còn thiếu
│ Bỏ qua bây giờ
│
◇ Đặt GOOGLE_PLACES_API_KEY cho goplaces?
│ Không
│
◇ Đặt GEMINI_API_KEY cho nano-banana-pro?
│ Không
│
◇ Đặt NOTION_API_KEY cho notion?
│ Không
│
◇ Đặt OPENAI_API_KEY cho openai-image-gen?
│ Không
│
◇ Đặt OPENAI_API_KEY cho openai-whisper-api?
│ Không
│
◇ Đặt ELEVENLABS_API_KEY cho sag?
│ Không
Sau khi cài đặt hoàn tất, hãy chạy trình hướng dẫn khởi tạo:
openclaw onboard --install-daemon
4.4 Cấu hình OpenClaw để sử dụng Mô hình Ollama cục bộ
Tiếp theo, sửa đổi tệp cấu hình OpenClaw để nó sử dụng dịch vụ Ollama được chuyển tiếp từ máy chủ GPU.
Chỉnh sửa tệp cấu hình:
~/.openclaw/openclaw.json
Thêm cấu hình nhà cung cấp Ollama như hình dưới đây.
Lưu ý rằng điểm cuối API Ollama gốc (http://localhost:11434) nên được sử dụng thay vì điểm cuối tương thích OpenAI /v1. Ví dụ cấu hình (sử dụng mô hình Qwen3.5 35B):
{
"models": {
"providers": {
"ollama": {
"baseUrl": "http://localhost:11434",
"apiKey": "ollama-local",
"api": "ollama-chat",
"models": [
{
"id": "ollama/qwen3.5:35b",
"name": "qwen3.5:35b",
"reasoning": false,
"input": ["text"],
"cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
"contextWindow": 128000,
"maxTokens": 8000
}
]
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "ollama/qwen3.5:35b"
}
}
}
}
Sau khi lưu tệp cấu hình, khởi động lại dịch vụ cổng OpenClaw để áp dụng các cài đặt mới:
openclaw gateway restart
Để xác minh rằng OpenClaw có thể truy cập đúng mô hình Ollama, hãy chạy:
openclaw doctor --fix
# Hoặc liệt kê tất cả các mô hình được nhận dạng
openclaw models list
Sau đó, bạn có thể khởi chạy bảng điều khiển OpenClaw:
openclaw dashboardHệ thống sẽ tạo một URL dashboard chứa mã thông báo xác thực như hiển thị bên dưới:
◇ Bạn muốn khởi tạo bot của mình như thế nào?
│ Mở giao diện Web UI
│
◇ Dashboard đã sẵn sàng ────────────────────────────────────────────────────────────────╮
│ │
│ Liên kết Dashboard (có token): │
│ http://127.0.0.1:18789/#token= │
│ Sao chép/dán URL này vào trình duyệt trên máy này để điều khiển OpenClaw. │
│ Không phát hiện GUI. Mở từ máy tính của bạn: │
│ ssh -N -L 18789:127.0.0.1:18789 [email protected] │
│ Sau đó mở: │
│ http://localhost:18789/ │
│ http://localhost:18789/#token= │
│ Docs: │
│ https://docs.openclaw.ai/gateway/remote │
│ https://docs.openclaw.ai/web/control-ui
Mở URL này trong trình duyệt của bạn để truy cập giao diện web của OpenClaw với token:
http://127.0.0.1:18789/#token=
Nếu máy chủ OpenClaw không có giao diện đồ họa, bạn có thể truy cập dashboard bằng cách sử dụng chuyển tiếp cổng SSH:
ssh -N -L 18789:127.0.0.1:18789 @
Sau đó mở URL sau trên máy tính cục bộ của bạn: http://localhost:18789 và bạn sẽ thấy trang dashboard của OpenClaw:

Nếu "chỉ báo sức khỏe" ở đầu dashboard hiển thị màu xanh lá cây, hệ thống đã sẵn sàng để sử dụng.
4.5 Tùy chọn: Tích hợp OpenClaw với Telegram
Để điều khiển OpenClaw từ xa, bạn có thể tích hợp nó với Telegram.
Đầu tiên, mở Telegram và bắt đầu trò chuyện với @BotFather , Chạy /newbot (hoặc /mybots) và Sao chép token (trông giống 123456:ABC...) như hiển thị bên dưới:

Sao chép token này và thêm nó vào tệp cấu hình của OpenClaw ~/.openclaw/openclaw.json như hiển thị bên dưới:

Sau khi cập nhật cấu hình, hãy gửi tin nhắn cho bot. Ban đầu, bot sẽ không phản hồi vì thiết bị phải được ghép nối. Bạn sẽ nhận được ví dụ truy cập chưa được cấu hình như bên dưới:

Và trên máy chủ OpenClaw của bạn, bạn sẽ thấy tin nhắn của mình đang chờ phê duyệt như hiển thị bên dưới:

Để phê duyệt kết nối, hãy chạy các lệnh sau trên máy chủ OpenClaw:
openclaw pairing list telegram
openclaw pairing approve telegram
Sau khi phê duyệt mã ghép nối, bot Telegram sẽ có thể giao tiếp với agent OpenClaw của bạn và gán tác vụ từ xa. Sau đó, bạn có thể bắt đầu sử dụng Telegram để gán tác vụ cho OpenClaw của mình như hiển thị bên dưới:

Sau khi hoàn thành các bước này, agent OpenClaw đang chạy trên máy tính của người dùng sẽ được kết nối với dịch vụ LLM được lưu trữ trên GPU và có thể được điều khiển thông qua web dashboard hoặc Telegram.
Để xem tóm tắt ngắn gọn về video, vui lòng tham khảo video bên dưới:
https://youtu.be/8_kwmuFvwBo?si=ie8u9N63tJThpY0L
Thanks for spending time to check the article detail, if you have any question and suggestion or find any program bug, please feel free to message me. Many thanks if you can give some comments and share any of the improvement advice so we can make our work better ~
--------------------------------
chỉnh sửa lần cuối bởi LiuYuancheng ([email protected]) by 15/03/20256nếu bạn có bất kỳ vấn đề nào, vui lòng gửi tin nhắn cho tôi.
Thanks for sharing. We are testing this on BillionVerify.com