Deploy Multiple OpenClaw AI Assistants Cluster With Local GPU Running Qwen3.5 or DeepSeek-r1

English 简体中文 繁体中文 Tiếng Việt
Summary

This guide details deploying a distributed cluster of OpenClaw AI assistants by leveraging locally hosted open-source LLMs, such as Qwen 3.5 or DeepSeek-R1, on a single GPU-enabled server or gaming laptop. The approach aims to significantly reduce cloud AI token costs by centralizing LLM inference services via Ollama. Key steps involve setting up Ollama and compatible models on the GPU server, then securely exposing this service to remote OpenClaw agent nodes using SSH port forwarding. Finally, OpenClaw agents are installed on client machines and configured to utilize the local Ollama endpoint, with an optional integration for remote control via Telegram. This architecture enables multiple agents to efficiently share a powerful, cost-effective LLM backend.

專案設計目的 : 在本文中,我將分享如何設計和部署一個分散式多個 OpenClaw AI 助理叢集,該叢集連接到一個或兩個在單一 GPU 伺服器或遊戲筆記型電腦上本地託管的 LLM。這樣就無需依賴基於雲端的 AI API。我使用了 `Qwen 3.5` 或 `DeepSeek-R1` 等開源模型為多個 OpenClaw 代理提供推論服務,從而降低了雲端 AI token 成本並比較了不同 LLM 模型的效能。

在這個 AI 助理叢集系統中,GPU 伺服器充當集中式 AI 推理引擎,而分散式代理(運行 OpenClaw 的電腦透過網路與 LLM 伺服器通訊)執行任務、收集系統資訊並與模型互動以進行決策。本文涵蓋以下三個部分:

  • 在 GPU 伺服器或遊戲筆記型電腦/電腦上設定開源 LLM 模型。
  • 配置並公開 LLM 推論服務,以便遠端 OpenClaw 節點可以存取。
  • 在目標電腦或筆記型電腦上部署 OpenClaw 代理並將其連接到集中式 LLM 服務。
# Author:      Yuancheng Liu
# Created:     2026/03/10
# Version:     v_0.0.2
# Copyright:   Copyright (c) 2026 LiuYuancheng
# License:     MIT License

1. 介紹

在這個專案中,「OpenClaw-cluster」的設計將 LLM 推論服務與代理執行節點分離。內部網路中的 GPU 伺服器或遊戲筆記型電腦透過 `Ollama` 框架託管 LLM 模型,該框架為運行開源模型提供了輕量級的本地 API 服務。因此,多個運行 OpenClaw 代理的電腦或筆記型電腦連接到這個集中式 LLM 服務以執行推理和任務。

1.1 摘要與背景 

在過去的一個月裡,個人 AI 助理 [OpenClaw](https://openclaw.ai/) 迅速成為最受討論的開源 AI 專案之一。其人氣的迅速提升催生了圍繞該生態系統的一波新服務和業務。例如,在中國,許多個人和組織現在提供安裝/解除安裝服務、遠端部署支援以及關於如何有效使用 OpenClaw 的兒童培訓課程。一些公司甚至推銷預裝了 OpenClaw 和本地大型語言模型的「一體式 OpenClaw 機器/筆記型電腦」。而騰訊等主要科技公司也開始提供相關的 OpenClaw 部署服務: 

OpenClaw 迅速普及的關鍵原因之一是其基於「技能」的架構,該架構使代理在執行任務時能夠動態呼叫多個工具和推理步驟。雖然這種設計顯著增強了 AI 助理的智慧和自動化能力,但它也大幅增加了 LLM API 呼叫的次數。因此,token 消耗可能比傳統的單提示 AI 代理高出數十甚至數百倍。如果您不需要執行複雜任務,並且擁有 GPU 伺服器或工作站(例如 Nvidia GB10 Spark)或配備 RTX-series 40-50XX 顯示卡的遊戲筆記型電腦,您可以將 OpenClaw 連接到開源 LLM,例如 Qwen 3.5DeepSeek‑R1,在這些本地機器上運行以節省成本,特別是當您在不同設備上運行多個 OpenClaw 代理時。

1.2 系統架構

整個系統遵循分散式代理 + 集中式推論架構,如下圖所示。因此,它允許單一 GPU 伺服器同時支援多個 OpenClaw 代理,形成一個輕量級的 AI 代理叢集,同時保持硬體和雲端成本低廉。

該架構包括四個層次:

  • LLM 主機層 : GPU 伺服器或 AI/遊戲筆記型電腦透過 Ollama 託管開源 LLM 模型。

  • 網路存取層 : 透過路由器、閘道器或跳板機的 SSH 埠轉發提供安全存取。

  • 代理層 : 多個 OpenClaw 代理在使用者筆記型電腦或電腦上運行,並透過轉發埠發送 LLM 請求。

  • 使用者互動層 : 使用者透過其本地系統或訊息平台(例如行動應用程式)與代理互動。

為了提高安全性並避免將 LLM 服務直接暴露給公共網路,該架構使用 SSH 埠轉發。Ollama 推論服務在本地埠 11434 上運行,此埠透過 SSH(埠 22)安全地轉發到授權的 OpenClaw 節點。因此,透過這種方法:

  • LLM API 不會直接暴露給網路。

  • 只有擁有有效 SSH 帳戶的經過身份驗證的使用者才能存取模型服務。

  • 外部使用者可以透過閘道器、路由器或跳板機連接。

  • 透過在 GPU 伺服器上啟用或禁用使用者帳戶,可以輕鬆管理存取控制。


2. 在 GPU 上設定 OpenClaw 相容的開源 LLM

本節中的所有配置都應在GPU 伺服器上執行,該伺服器將託管大型語言模型 (LLM)。

為了在本地運行 OpenClaw 而不依賴雲端 API,我們首先需要部署一個相容的開源 LLM。在本地管理和運行 LLM 最簡單的方法之一是使用Ollama,它提供了一個輕量級的運行時,用於透過簡單的命令列介面下載、管理和服務開源 LLM。

2.1 在 GPU 伺服器上安裝 Ollama

要在您的 GPU 伺服器上安裝 Ollama。您可以從官方頁面下載:https://ollama.com/download/linux

對於大多數 Linux 系統,可以使用以下命令完成安裝:

curl -fsSL https://ollama.com/install.sh | sh

安裝後,驗證服務是否正常運行並啟動服務:

ollama --version
ollama serve

Ollama 將公開一個本地 API 端點(localhost 預設埠 11434),OpenClaw 代理稍後可以連接到該端點。

2.2 拉取 OpenClaw 相容的開源模型

只要提供工具呼叫和推理能力,OpenClaw 就支援多種開源 LLM。透過 Ollama,使用者可以根據其可用的 GPU 資源輕鬆部署各種模型。

以下是與 OpenClaw 相容的常用模型參考表:

模型名稱 參數大小 最佳使用案例 上下文視窗 推薦硬體
GLM-5 744B (MoE) 複雜偵錯與多步驟編碼 200K 企業級 (A100/H100) 或雲端 API
GPT-OSS-120B 120B 高風險推理與資料隱私 128K 雙 RTX 6000 / Mac Studio (Ultra)
DeepSeek-V3.2 671B (MoE) 通用高速代理任務 128K 雲端 API / 多 GPU 伺服器
Kimi-K2.5 1T (MoE) 視覺 + 文字(多模態代理任務) 1M 雲端 API / 8x H100
Qwen 3.5 (32B) 32B 高階消費級 GPU 的最佳平衡 128K RTX 4090 (24GB VRAM)
Llama 4 Maverick 70B 可靠的日常助理與工具呼叫 128K Mac Studio / 多 RTX 3090
Qwen 3.5 (14B) 14B 入門級本地代理任務 64K RTX 3060/4070 (12GB+ VRAM)
MiMo-V2-Flash ~30B (Active) 超快速「思考」與長時間研究 256K RTX 4080/4090

您也可以直接從 Ollama 模型儲存庫瀏覽相容模型。在 Ollama 網站上,檢查「Application」標籤以驗證模型是否支援 OpenClaw 工具呼叫功能,如下所示:

2.3 下載 LLM 模型

在本次實驗中,GPU 伺服器配備了 RTX 3060 和 A5000 GPU。因此,選擇了兩個模型:

  • Qwen3.5-35B-A3B-FP8 用於高品質推理

  • DeepSeek-R1-Tool-Calling-14B 用於輕量級工具呼叫任務

拉取並運行 Qwen3.5-35B-A3B-FP8,使用以下命令:

ollama pull qwen3.5:35b
ollama run qwen3.5:35b

拉取並運行 deepseek-r1-tool-calling:14b 模型,使用以下命令:

ollama pull MFDoom/deepseek-r1-tool-calling:14b
ollama run deepseek-r1-tool-calling:14b

模型下載完成後,Ollama 將在首次透過 API 呼叫時自動載入它們。

2.4 將模型作為背景服務運行(可選)

安裝後,Ollama 服務通常在背景運行。當 API 請求發送到 Ollama 端點時,所需的模型將自動載入到 GPU 記憶體中。第一個 API 請求可能需要更長時間,因為模型必須初始化。為了減少這種延遲,您可以將模型配置為作為持久服務運行。

在 Linux 系統上,可以建立一個簡單的 systemd 服務來保持模型載入,如下例所示:

[Unit]
Description=ollamaQwen35B_service
After=network.target
[Service]
ExecStart=ollama run qwen3.5:35b
WorkingDirectory=/home//ollama
User=root
Restart=always
RestartSec=5
StandardOutput=null
StandardError=null
[Install]
WantedBy=multi-user.target

然後將檔案 ollamaQwen35B_service.service 複製到 /etc/systemd/system 目錄並啟動服務:

sudo systemctl start ollamaQwen35B_service

完成此步驟後,GPU 伺服器將託管一個本地運行的 LLM 推論服務。


3. 將 Ollama LLM 服務轉發到使用者電腦

本節中的所有配置都應在將安裝 OpenClaw 代理的電腦或筆記型電腦上執行。

為了避免將 Ollama API 直接暴露給網路(這可能會引入安全風險),我們可以使用 SSH 埠轉發將服務安全地隧道傳輸到本地機器,這樣運行在使用者筆記型電腦或工作站上的 OpenClaw 代理就可以像 LLM 服務在本地運行一樣與其互動。

為了安全和存取控制,建議在 GPU 伺服器上建立一個專用使用者帳戶,該帳戶僅用於轉發 LLM 服務流量,例如我建立了一個普通使用者 llmService 在 GPU 上。

3.1 建立 SSH 埠轉發隧道

在將運行 OpenClaw 的目標電腦或筆記型電腦上,執行以下 SSH 命令以在本地機器和 GPU 伺服器之間建立隧道。

如果兩台機器位於相同的子網路或內部網路中,請運行:

ssh -L localhost:11434:localhost:11434 llmService@

此命令建立一個安全隧道,映射:

本地電腦:   localhost:11434
        │
        │ (SSH 隧道)
        ▼
GPU 伺服器:       localhost:11434 (Ollama API)

3.3 測試 Ollama API 連接

建立 SSH 隧道後,您可以透過向 Ollama API 發送測試請求來驗證連接。

Linux / macOS:

curl http://localhost:11434/api/chat -d "{\"model\":\"qwen3.5:9b\",\"messages\":[{\"role\":\"user\",\"content\":\"Hello!\"}]}"

Windows PowerShell:

curl.exe http://localhost:11434/api/chat -d '{"model":"qwen3.5:9b","messages":[{"role":"user","content":"Hello!"}]}'

如果連接正常工作,API 將返回由 LLM 模型生成的 JSON 回應,如下所示:

3.4 透過跳板機連接(可選)

在某些環境中,GPU 伺服器可能位於受限制的內部網路中,無法從使用者電腦直接存取。在這種情況下,可以使用跳板機(堡壘伺服器)來轉發 SSH 連接。

在目標電腦上,運行以下命令:

ssh -L localhost:11434:localhost:11434 -J @ llmService@

這會建立以下連接路徑:

使用者電腦
      │
      ▼
跳板機 (SSH 閘道器)
      │
      ▼
GPU 伺服器 (Ollama LLM 服務)

隧道建立後,Ollama 服務仍可透過以下方式在本地存取:

http://localhost:11434

4. 在使用者電腦上設定 OpenClaw

本節中的所有配置都應在將安裝 OpenClaw 代理的電腦或筆記型電腦上執行。

4.1 安裝依賴項 Node.js

OpenClaw 需要 Node.js 版本 22 或更高。因此,第一步是在使用者電腦/筆記型電腦上安裝 Node.js。從官方網站下載安裝程式: https://nodejs.org/en/download

根據您的作業系統(Windows、Linux 或 macOS)安裝適當的套件,安裝後驗證 Node.js 是否正確安裝:

node -v
npm -v

4.2 安裝 OpenClaw AI 助理

接下來,按照官方安裝指南安裝 OpenClaw: https://docs.openclaw.ai/start/getting-started

對於 Linux、macOS 或 WSL 環境,可以使用以下命令執行安裝:

curl -fsSL https://openclaw.ai/install.sh | bash

4.3 跳過 OpenClaw 雲端模型配置

在安裝過程中,OpenClaw 將詢問您是否要為技能配置模型提供者或外部服務整合。由於部署透過 Ollama 使用本地託管的 LLM,因此可以跳過這些基於雲端的配置。

◇  現在配置技能?(推薦)
│  是
│
◇  安裝缺少的技能依賴項
│  暫時跳過
│
◇  為 goplaces 設定 GOOGLE_PLACES_API_KEY?
│  否
│
◇  為 nano-banana-pro 設定 GEMINI_API_KEY?
│  否
│
◇  為 notion 設定 NOTION_API_KEY?
│  否
│
◇  為 openai-image-gen 設定 OPENAI_API_KEY?
│  否
│
◇  為 openai-whisper-api 設定 OPENAI_API_KEY?
│  否
│
◇  為 sag 設定 ELEVENLABS_API_KEY?
│  否

安裝完成後,運行引導精靈:

openclaw onboard --install-daemon

4.4 配置 OpenClaw 以使用本地 Ollama 模型

接下來,修改 OpenClaw 配置檔案,使其使用從 GPU 伺服器轉發的 Ollama 服務。

編輯配置檔案:

~/.openclaw/openclaw.json

如下所示添加 Ollama 提供者配置。

請注意,應使用原生的 Ollama API 端點(http://localhost:11434)而不是與 OpenAI 相容的 /v1 端點。範例配置(使用 Qwen3.5 35B 模型):

{
  "models": {
    "providers": {
      "ollama": {
        "baseUrl": "http://localhost:11434",
        "apiKey": "ollama-local",
        "api": "ollama-chat",
        "models": [
          {
            "id": "ollama/qwen3.5:35b",
            "name": "qwen3.5:35b",
            "reasoning": false,
            "input": ["text"],
            "cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
            "contextWindow": 128000,
            "maxTokens": 8000
          }
        ]
      }
    }
  },
  "agents": {
    "defaults": {
      "model": {
        "primary": "ollama/qwen3.5:35b"
      }
    }
  }
}

儲存配置檔案後,重新啟動 OpenClaw 閘道服務以應用新設定:

openclaw gateway restart

為了驗證 OpenClaw 是否能正確存取 Ollama 模型,請運行:

openclaw doctor --fix
# 或列出所有識別出的模型
openclaw models list

然後您現在可以啟動 OpenClaw 儀表板:

openclaw dashboard

系統將生成一個包含認證令牌的儀表板 URL,如下所示:

◇  您希望如何啟動您的機器人?
│  開啟 Web UI
│
◇  儀表板已就緒 ────────────────────────────────────────────────────────────────╮
│                                                                                  │
│  儀表板連結(含 token):                                                    │
│  http://127.0.0.1:18789/#token=  │
│  在此機器的瀏覽器中複製/貼上此 URL 以控制 OpenClaw。                           │
│  未偵測到 GUI。從您的電腦開啟:                                       │
│  ssh -N -L 18789:127.0.0.1:18789 [email protected]                               │
│  然後開啟:                                                                      │
│  http://localhost:18789/                                                         │
│  http://localhost:18789/#token= │
│  文件:                                                                           │
│  https://docs.openclaw.ai/gateway/remote                                         │
│  https://docs.openclaw.ai/web/control-ui  

在您的瀏覽器中開啟此 URL,以使用 token 存取 OpenClaw 網頁介面:

http://127.0.0.1:18789/#token=

如果 OpenClaw 主機沒有圖形介面,您可以使用 SSH 連接埠轉發來存取儀表板:

ssh -N -L 18789:127.0.0.1:18789 @

然後在您的本機電腦上開啟以下 URL: http://localhost:18789,您將看到 OpenClaw 儀表板頁面:

如果儀表板頂部的「健康指示器」顯示綠色,則系統已準備就緒可供使用。

4.5 選用:整合 OpenClaw 與 Telegram

若要遠端控制 OpenClaw,您可以將其與 Telegram 整合。

首先,開啟 Telegram 並與 @BotFather 開始聊天,執行 /newbot (或 /mybots) 並複製 token (看起來像 123456:ABC...),如下所示:

複製此 token 並將其新增至 OpenClaw 設定檔 ~/.openclaw/openclaw.json,如下所示:

更新設定後,向 bot 發送訊息。最初,bot 不會回應,因為裝置必須進行配對。您將看到以下存取未設定的範例:

在您的 OpenClaw 伺服器中,您將看到您的訊息正在等待審批,如下所示:

若要批准連線,請在 OpenClaw 主機上執行以下指令:

openclaw pairing list telegram
openclaw pairing approve telegram 

批准配對碼後,Telegram bot 將能夠與您的 OpenClaw agent 通訊並遠端分配任務。然後您可以開始使用 Telegram 向您的 OpenClaw 分配任務,如下所示:

完成這些步驟後,在使用者電腦上運行的 OpenClaw agent 將連接到 GPU 託管的 LLM 服務,並可透過網頁儀表板或 Telegram 進行控制。

有關影片的簡短摘要,請參考以下影片:

https://youtu.be/8_kwmuFvwBo?si=ie8u9N63tJThpY0L

Thanks for spending time to check the article detail, if you have any question and suggestion or find any program bug, please feel free to message me. Many thanks if you can give some comments and share any of the improvement advice so we can make our work better ~

--------------------------------

最後編輯者:LiuYuancheng ([email protected]) 於 15/03/20256。如果您有任何問題,請傳送訊息給我。

 

 

 

 

  RELATED

No related programming articles found. Browse all programming tutorials and articles.

  COMMENT

1
Leo
Mar 17, 2026 at 10:43 pm

Thanks for sharing. We are testing this on BillionVerify.com