
项目设计目的 : 在本文中,我将分享一个分布式多 OpenClaw AI 助手集群的设计和部署,该集群连接到一个或两个本地托管的大型语言模型 (LLMs),这些模型运行在一台支持 GPU 的服务器或游戏笔记本电脑上。我没有依赖使用基于云的 AI API,而是使用了 `Qwen 3.5` 或 `DeepSeek-R1` 等开源模型为多个 OpenClaw 代理提供推理服务,从而降低了云端 AI token 成本并比较了不同 LLM 模型的性能。
在这个 AI 助手集群系统中,GPU 服务器充当集中式 AI 推理引擎,而分布式代理(运行 OpenClaw 的计算机通过网络与 LLM 服务器通信)执行任务、收集系统信息并与模型交互以进行决策。本文涵盖以下三个部分:
- 在 GPU 服务器或游戏笔记本电脑/计算机上设置开源 LLM 模型。
- 配置并暴露 LLM 推理服务,以便远程 OpenClaw 节点可以访问它。
- 在目标计算机或笔记本电脑上部署 OpenClaw 代理,并将其连接到集中式 LLM 服务。
# 作者: Yuancheng Liu
# 创建日期: 2026/03/10
# 版本: v_0.0.2
# 版权所有: Copyright (c) 2026 LiuYuancheng
# 许可证: MIT License
1. 引言
在这个项目中,“OpenClaw-cluster”的设计将 LLM 推理服务与代理执行节点分离。内部网络中的一台支持 GPU 的服务器或游戏笔记本电脑通过 `Ollama` 框架托管 LLM 模型,该框架提供了一个轻量级本地 API 服务,用于运行开源模型。因此,多台运行 OpenClaw 代理的计算机或笔记本电脑连接到这个集中式 LLM 服务以执行推理和任务。
1.1 摘要与背景
在过去的一个月里,个人 AI 助手 [OpenClaw](https://openclaw.ai/) 迅速成为最受讨论的开源 AI 项目之一。其迅速普及引发了围绕其生态系统的新服务和业务浪潮。例如在中国,许多个人和组织现在提供安装/卸载服务、远程部署支持以及关于如何有效使用 OpenClaw 的儿童培训课程。一些公司甚至销售预装 OpenClaw 和本地大型语言模型的“一体化 OpenClaw 机器/笔记本电脑”。腾讯等主要科技公司也已开始提供相关的 OpenClaw 部署服务:

OpenClaw 迅速普及的关键原因之一是其基于“技能”的架构,该架构使代理能够在执行任务时动态调用多个工具和推理步骤。虽然这种设计显著增强了 AI 助手的智能和自动化能力,但它也极大地增加了 LLM API 调用次数。因此,token 消耗可能比传统的单提示 AI 代理高出数十甚至数百倍。如果您不需要执行复杂的任务,并且拥有一台 GPU 服务器或工作站(例如 Nvidia GB10 Spark)或配备 RTX 系列 40-50XX 显卡的游戏笔记本电脑,您可以将您的 OpenClaw 连接到运行在这些本地机器上的开源 LLM,例如 Qwen 3.5 或 DeepSeek‑R1,以节省成本,尤其是在您有多个 OpenClaw 代理运行在不同设备上时。
1.2 系统架构
整个系统遵循分布式代理 + 集中式推理架构,如下图所示。它允许单个 GPU 服务器同时支持多个 OpenClaw 代理,形成一个轻量级 AI 代理集群,同时保持硬件和云成本低廉。

该架构包括四个层:
-
LLM 主机层 : GPU 服务器或 AI/游戏笔记本电脑通过 Ollama 托管开源 LLM 模型。
-
网络访问层 : 通过路由器、网关或跳板机进行 SSH 端口转发提供安全访问。
-
代理层 : 多个 OpenClaw 代理在用户笔记本电脑或计算机上运行,并通过转发端口发送 LLM 请求。
-
用户交互层 : 用户通过其本地系统或消息平台(例如移动应用程序)与代理进行交互。
为了提高安全性并避免将 LLM 服务直接暴露到公共网络,该架构使用 SSH 端口转发。Ollama 推理服务在本地端口 11434 上运行,此端口通过 SSH(端口 22)安全地转发到授权的 OpenClaw 节点。因此,通过这种方法:
-
LLM API 不直接暴露在网络中。
-
只有拥有有效 SSH 账户的认证用户才能访问模型服务
-
外部用户可以通过网关、路由器或跳板机连接。
-
通过在 GPU 服务器上启用或禁用用户账户,可以轻松管理访问控制。
2. 在 GPU 上设置 OpenClaw 兼容的开源 LLM
本节中的所有配置都应在 GPU 服务器上执行,该服务器将托管大型语言模型 (LLM)。
要在本地运行 OpenClaw 而不依赖云 API,我们首先需要部署一个兼容的开源 LLM。在本地管理和运行 LLM 的最简单方法之一是使用 Ollama,它提供了一个轻量级运行时,通过简单的命令行界面下载、管理和提供开源 LLM 服务。
2.1 在 GPU 服务器上安装 Ollama
要在您的 GPU 服务器上安装 Ollama。您可以从官方页面下载:https://ollama.com/download/linux
对于大多数 Linux 系统,可以使用以下命令完成安装:
curl -fsSL https://ollama.com/install.sh | sh
安装后,验证服务是否正常运行并启动服务:
ollama --version
ollama serve
Ollama 将暴露一个本地 API 端点(localhost 默认端口11434),OpenClaw 代理稍后可以连接到该端点。
2.2 拉取 OpenClaw 兼容的开源模型
OpenClaw 支持多种开源 LLM,只要它们提供工具调用和推理能力。通过 Ollama,用户可以根据其可用的 GPU 资源轻松部署各种模型。
以下是与 OpenClaw 兼容的常用模型参考表:
| 模型名称 | 参数大小 | 最佳用例 | 上下文窗口 | 推荐硬件 |
|---|---|---|---|---|
| GLM-5 | 744B (MoE) | 复杂调试和多步编码 | 200K | 企业级 (A100/H100) 或云 API |
| GPT-OSS-120B | 120B | 高风险推理和数据隐私 | 128K | 双 RTX 6000 / Mac Studio (Ultra) |
| DeepSeek-V3.2 | 671B (MoE) | 通用高速代理任务 | 128K | 云 API / 多 GPU 服务器 |
| Kimi-K2.5 | 1T (MoE) | 视觉 + 文本(多模态代理任务) | 1M | 云 API / 8x H100 |
| Qwen 3.5 (32B) | 32B | 高端消费级 GPU 的最佳平衡 | 128K | RTX 4090 (24GB 显存) |
| Llama 4 Maverick | 70B | 可靠的日常助手和工具调用 | 128K | Mac Studio / 多 RTX 3090 |
| Qwen 3.5 (14B) | 14B | 入门级本地代理任务 | 64K | RTX 3060/4070 (12GB+ 显存) |
| MiMo-V2-Flash | ~30B (Active) | 超快速“思考”和长期研究 | 256K | RTX 4080/4090 |
您也可以直接从 Ollama 模型仓库浏览兼容模型。在 Ollama 网站上,检查“Application”标签以验证模型是否支持 OpenClaw 工具调用功能,如下图所示:

2.3 下载 LLM 模型
在本实验中,GPU 服务器配备了 RTX 3060 和 A5000 GPU。因此,选择了两个模型:
-
Qwen3.5-35B-A3B-FP8 用于高质量推理
-
DeepSeek-R1-Tool-Calling-14B 用于轻量级工具调用任务
使用以下命令拉取并运行 Qwen3.5-35B-A3B-FP8:
ollama pull qwen3.5:35b
ollama run qwen3.5:35b
使用以下命令拉取并运行 deepseek-r1-tool-calling:14b 模型:
ollama pull MFDoom/deepseek-r1-tool-calling:14b
ollama run deepseek-r1-tool-calling:14b
模型下载完成后,Ollama 将在首次通过 API 调用时自动加载它们。
2.4 将模型作为后台服务运行(可选)
安装后,Ollama 服务通常在后台运行。当 API 请求发送到 Ollama 端点时,所需的模型将自动加载到 GPU 内存中。第一个 API 请求可能需要更长时间,因为模型必须进行初始化。为了减少这种延迟,您可以将模型配置为作为持久服务运行。
在 Linux 系统上,可以创建一个简单的 systemd 服务来保持模型加载,示例如下:
[Unit]
描述=ollamaQwen35B_service
在=network.target之后
[Service]
ExecStart=ollama run qwen3.5:35b
工作目录=/home//ollama
用户=root
重启=always
重启间隔=5
标准输出=null
标准错误=null
[Install]
被=multi-user.target需要
然后将文件ollamaQwen35B_service.service复制到/etc/systemd/system目录并启动服务:
sudo systemctl start ollamaQwen35B_service
完成此步骤后,GPU 服务器将托管一个本地运行的 LLM 推理服务。
3. 将 Ollama LLM 服务转发到用户计算机
本节中的所有配置都应在将安装 OpenClaw 代理的计算机或笔记本电脑上执行。
与其将 Ollama API 直接暴露到网络(这可能会带来安全风险),我们可以使用 SSH 端口转发将服务安全地隧道传输到本地机器,这样,运行在用户笔记本电脑或工作站上的 OpenClaw 代理就可以像在本地运行一样与 LLM 服务进行交互。
为了安全和访问控制,建议在 GPU 服务器上创建一个专用用户账户,该账户仅用于转发 LLM 服务流量,例如,我创建了一个普通用户llmService在 GPU 上。
3.1 创建 SSH 端口转发隧道
在将运行 OpenClaw 的目标计算机或笔记本电脑上,执行以下 SSH 命令以在本地机器和 GPU 服务器之间创建隧道。
如果两台机器位于同一子网或内部网络中,请运行:
ssh -L localhost:11434:localhost:11434 llmService@
此命令创建一个安全的隧道,映射:
本地计算机: localhost:11434
│
│ (SSH 隧道)
▼
GPU 服务器: localhost:11434 (Ollama API)
3.3 测试 Ollama API 连接
SSH 隧道建立后,您可以通过向 Ollama API 发送测试请求来验证连接。
Linux / macOS:
curl http://localhost:11434/api/chat -d "{\"model\":\"qwen3.5:9b\",\"messages\":[{\"role\":\"user\",\"content\":\"Hello!\"}]}"
Windows PowerShell:
curl.exe http://localhost:11434/api/chat -d '{"model":"qwen3.5:9b","messages":[{"role":"user","content":"Hello!"}]}'
如果连接正常工作,API 将返回由 LLM 模型生成的 JSON 响应,如下图所示:

3.4 通过跳板机连接(可选)
在某些环境中,GPU 服务器可能位于受限的内部网络中,无法从用户计算机直接访问。在这种情况下,可以使用跳板机(堡垒机)来中继 SSH 连接。
在目标计算机上,运行以下命令:
ssh -L localhost:11434:localhost:11434 -J @ llmService@
这将创建以下连接路径:
用户计算机
│
▼
跳板机 (SSH 网关)
│
▼
GPU 服务器 (Ollama LLM 服务)
隧道建立后,Ollama 服务仍可通过以下方式在本地访问:
http://localhost:11434
4. 在用户计算机上设置 OpenClaw
本节中的所有配置都应在将安装 OpenClaw 代理的计算机或笔记本电脑上执行。
4.1 安装依赖 Node.js
OpenClaw 需要Node.js22 或更高版本。因此,第一步是在用户计算机/笔记本电脑上安装 Node.js。从官方网站下载安装程序:https://nodejs.org/en/download
根据您的操作系统(Windows、Linux 或 macOS)安装相应的软件包,安装后验证 Node.js 是否正确安装:
node -v
npm -v
4.2 安装 OpenClaw AI 助手
接下来,按照官方安装指南安装 OpenClaw:https://docs.openclaw.ai/start/getting-started
对于 Linux、macOS 或 WSL 环境,可以使用以下命令执行安装:
curl -fsSL https://openclaw.ai/install.sh | bash
4.3 跳过 OpenClaw 云模型配置
在安装过程中,OpenClaw 将询问您是否要为技能配置模型提供商或外部服务集成。由于部署使用通过 Ollama 本地托管的 LLM,因此可以跳过这些基于云的配置。
安装配置示例:
◇ 现在配置技能?(推荐)
│ 是
│
◇ 安装缺失的技能依赖项
│ 暂时跳过
│
◇ 为 goplaces 设置 GOOGLE_PLACES_API_KEY?
│ 否
│
◇ 为 nano-banana-pro 设置 GEMINI_API_KEY?
│ 否
│
◇ 为 notion 设置 NOTION_API_KEY?
│ 否
│
◇ 为 openai-image-gen 设置 OPENAI_API_KEY?
│ 否
│
◇ 为 openai-whisper-api 设置 OPENAI_API_KEY?
│ 否
│
◇ 为 sag 设置 ELEVENLABS_API_KEY?
│ 否
安装完成后,运行引导向导:
openclaw onboard --install-daemon
4.4 配置 OpenClaw 使用本地 Ollama 模型
接下来,修改 OpenClaw 配置文件,使其使用从 GPU 服务器转发的 Ollama 服务。
编辑配置文件:
~/.openclaw/openclaw.json
添加 Ollama 提供商配置,如下所示。
请注意,应使用原生的 Ollama API 端点(http://localhost:11434),而不是 OpenAI 兼容的/v1端点。配置示例(使用 Qwen3.5 35B 模型):
{
"models": {
"providers": {
"ollama": {
"baseUrl": "http://localhost:11434",
"apiKey": "ollama-local",
"api": "ollama-chat",
"models": [
{
"id": "ollama/qwen3.5:35b",
"name": "qwen3.5:35b",
"reasoning": false,
"input": ["text"],
"cost": { "input": 0, "output": 0, "cacheRead": 0, "cacheWrite": 0 },
"contextWindow": 128000,
"maxTokens": 8000
}
]
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "ollama/qwen3.5:35b"
}
}
}
}
保存配置文件后,重启 OpenClaw 网关服务以应用新设置:
openclaw gateway restart
要验证 OpenClaw 是否能正确访问 Ollama 模型,请运行:
openclaw doctor --fix
# 或列出所有识别到的模型
openclaw models list
然后您现在可以启动 OpenClaw 控制面板:
openclaw dashboard系统将生成一个包含认证令牌的仪表盘URL,如下所示:
◇ 您想如何启动您的机器人?
│ 打开 Web UI
│
◇ 仪表盘已就绪 ────────────────────────────────────────────────────────────────╮
│ │
│ 仪表盘链接(含令牌): │
│ http://127.0.0.1:18789/#token= (将您的令牌记录到文件中) │
│ 在此机器上的浏览器中复制/粘贴此URL以控制 OpenClaw。 │
│ 未检测到图形界面。从您的计算机打开: │
│ ssh -N -L 18789:127.0.0.1:18789 [email protected] │
│ 然后打开: │
│ http://localhost:18789/ │
│ http://localhost:18789/#token= │
│ 文档: │
│ https://docs.openclaw.ai/gateway/remote │
│ https://docs.openclaw.ai/web/control-ui
在浏览器中打开此URL,使用令牌访问 OpenClaw Web 界面:
http://127.0.0.1:18789/#token=
如果 OpenClaw 主机没有图形界面,您可以使用 SSH 端口转发访问仪表盘:
ssh -N -L 18789:127.0.0.1:18789 @
然后,在您的本地计算机上打开以下URL: http://localhost:18789 ,您将看到 OpenClaw 仪表盘页面:

如果仪表盘顶部的“健康指示器”显示绿色,则系统已准备就绪。
4.5 可选:将 OpenClaw 与 Telegram 集成
要远程控制 OpenClaw,您可以将其与 Telegram 集成。
首先,打开 Telegram 并与 @BotFather 开始聊天,运行 /newbot (或 /mybots) 并复制令牌(看起来像 123456:ABC...),如下所示:

复制此令牌并将其添加到 OpenClaw 配置文件 ~/.openclaw/openclaw.json 中,如下所示:

更新配置后,向机器人发送一条消息。最初,机器人不会响应,因为设备必须进行配对。您将看到以下“未配置访问”示例:

在您的 OpenClaw 服务器中,您将看到您的消息正在等待批准,如下所示:

要批准连接,请在 OpenClaw 主机上运行以下命令:
openclaw pairing list telegram
openclaw pairing approve telegram
批准配对码后,Telegram 机器人将能够与您的 OpenClaw 代理通信并远程分配任务。然后,您可以开始使用 Telegram 向您的 OpenClaw 分配任务,如下所示:

完成这些步骤后,在用户计算机上运行的 OpenClaw 代理将连接到 GPU 托管的 LLM 服务,并可以通过 Web 仪表盘或 Telegram 进行控制。
有关视频的简短摘要,请参考以下视频:
https://youtu.be/8_kwmuFvwBo?si=ie8u9N63tJThpY0L
Thanks for spending time to check the article detail, if you have any question and suggestion or find any program bug, please feel free to message me. Many thanks if you can give some comments and share any of the improvement advice so we can make our work better ~
--------------------------------
最后编辑:LiuYuancheng ([email protected]),日期:2025年3月15日。如果您有任何问题,请给我留言。
Thanks for sharing. We are testing this on BillionVerify.com