基于 OpenClaw(龙虾)+ Ollama + ComfyUI | RTX 5060 8G 笔记本实测可跑
~文末有完整部署操作手册~
在银行、政企、军工等验收现场,测试工程师最怕两件事:
一是数据不能出网,云端大模型直接被挡在门外;
二是全是重复体力活——写用例、造数据、审截图、出报告;
本文给你一套纯本地、断网可用、数据不出机的 AI 工作流:用 OpenClaw(龙虾)当调度中枢,Ollama 跑语言/代码模型,ComfyUI 跑图像引擎
微信公众号二维码图片引自微信公众号,扫码关注阅读原文
本地离线 AI 工作流:断网环境也能用的“测试副驾”

一、为什么测试工程师更需要“本地 AI”

先设想一个典型的工作日:

早上收到一份三十页的需求规格,你要逐条拆成测试用例;中午要为接口压测准备两百条边界数据;下午对着验收环境里几十张界面截图,肉眼核对有没有错位和溢出;下班前还要把本周缺陷统计写成验收报告。这些事技术含量不低,但重复、机械、且都发生在不能联网的内网机器上——你没法把需求文档贴进网页版 ChatGPT,也不能把截图传到任何云服务

验收环境通常划了两条红线:数据不出网、环境隔离(纯局域网或无外网)。这直接把 ChatGPT、文心、通义这类云端大模型排除在外——它们既要联网,又要把你的需求文档、测试数据、截图传到厂商服务器

而测试工程师的日常,恰恰是大量“可结构化”的重复劳动:

这些活儿,本地 AI 全都能接,而且因为跑在本机,天然满足“数据不出网”的硬约束。下图把云端 AI 和本地离线 AI 在测试场景下做个对比:

维度
云端大模型
本地离线 AI(本文方案)
数据合规
要传数据上云,验收红线不允许
数据全程不出本机 ✅
网络依赖
必须联网
断网/局域网可用 ✅
使用成本
按量付费 / 订阅
一次性部署,零边际成本
响应速度
受网络与限流影响
本机推理,稳定可控
可对接脚本
基本不能碰你的测试环境
可直连本机脚本/日志/文件 ✅

一句话:云端 AI 在验收现场“不能用”,本地 AI 是“必须用”。本文的目标,就是把这套能用的东西搭起来,并落到 6 个具体提效场景上


二、方案总览:三件套 + 一个“总指挥”

整套方案由三个角色组成,分工极清晰:

角色
软件
干什么
总指挥(调度中枢)
OpenClaw / 龙虾
听懂你的自然语言指令,判断该派给谁,并把结果拼回给你
语言 / 代码大脑
Ollama + Qwen 系列
聊天、写用例、做分析、写代码(在显卡/内存里跑)
图像 / 视频引擎
ComfyUI + SDXL / CogVideoX
文生图(封面、截图、信息图)、可选文生视频
微信公众号二维码图片引自微信公众号,扫码关注阅读原文
龙虾居中调度:左接语言/代码模型,右接图像/视频引擎,下接本机测试资产

把这套结构落到你的测试机上是这样的:左边 Ollama 里住着三个语言/代码模型,负责“想”和“写”;右边 ComfyUI 住着图像/视频引擎,负责“画”和“做”;下方是你的本机测试资产——脚本、日志、用例、截图。龙虾站在中间,根据你说的话把任务分发出去,再把结果收回来。你不需要知道哪个模型在跑,只要知道“我能一句话把活派出去”。

核心理念:单条指令自动路由

你不需要记任何命令。你说“画一只戴墨镜的猫”,龙虾判断这是图像任务,转给 ComfyUI;你说“帮我写个去重函数”,转给代码模型;你说“总结这段技术文档”,用通用模型处理。对你而言就是“说一句话”。这套路由不是靠你手动切换 App,而是龙虾在听懂意图后自动完成的——这也是它区别于“自己开三个软件来回切”的核心价值。

微信公众号二维码图片引自微信公众号,扫码关注阅读原文
按任务类型自动路由:你说什么,龙虾就派给对应的引擎
为什么这套天然适配测试?因为龙虾能直连本机:读你的需求文档、跑你的测试脚本、抓你的日志、存你的截图。所有数据都在你自己机器上转,合规无压力;而云端模型连你的内网环境都碰不到,更别说帮你跑脚本、读日志了。

三、部署前提:轻量硬件也能跑

本文所有步骤在作者真实机器上验证思路可行:

部件
规格
对部署的影响
CPU
AMD R9 8940HX
带动本地推理与前后处理绰绰有余
内存
32G DDR5
可容纳 14B 代码模型的部分卸载层
显卡
RTX 5060 笔记本 8G 显存
核心瓶颈:一次只能从容容纳 1 个大模型
系统
Windows 11
全程在 PowerShell 中操作

这台机器不是什么高端工作站,就是一台普通性能向的笔记本。换句话说,如果你手上是近两年的主流游戏本或设计本(独显 + 16G 以上内存),基本都能照抄本文;配置更弱时,把模型换成更小的 7B/4B 版本即可,思路完全通用。

离线资源清单(下载一次,用后即离线)
资源
用途
获取地址
Ollama(Windows 安装包)
本地运行语言/代码模型
https://ollama.com/download
Qwen 三个模型
通用/代码/轻量
装好 Ollama 后用 pull 自动下载
ComfyUI 桌面版
图像/视频引擎
https://www.comfy.org/download
SDXL 1.0 模型
文生图基础模型
huggingface.co/stabilityai/stable-diffusion-xl-base-1.0(国内镜像 hf-mirror.com)
OpenClaw(龙虾)
调度中枢
PowerShell 执行 iwr -useb https://openclaw.ai/install.ps1 | iex

⚠ 注意模型名称以真实 tag为准。你最初列的 “Qwen3.5-顶点Instruct” 是家族底层命名,在 Ollama 里要用它的标签(tag)来拉取。正确对应关系:Qwen3.5-9B-Instruct → qwen3.5:9b(约 6.6GB,可完整进 8G 显存);Qwen2.5-Coder-14B-Instruct → qwen2.5-coder:14b(约 9GB,8G 显存放不下,会部分卸载到内存);Qwen2.5-7B-Instruct → qwen2.5:7b(约 4.4GB,可完整进显存)。

先记住一个硬约束:8G 显存同时只能从容装一个模型。这是后面“显存智能调度”章节要重点解决的,也是本方案在笔记本上能跑顺的关键。


四、三步极简搭建(工程师可复制版)
Step 1 装 Ollama + 拉三个模型

Ollama 是本地跑大模型最简单的入口,它把模型管理、服务暴露、显存调度都打包好了,你只需要一条 pull 命令就能把模型拉到本地。对测试工程师来说,它最大的价值是:一次装好,之后所有“说句话就让 AI 干活”的能力都建立在它之上。

  1. 到 ollama.com/download 下载 OllamaSetup.exe,双击安装。装完任务栏出现羊驼图标,代表服务已后台运行。
  2. 限制 Ollama“同时只加载 1 个模型”,避免两个模型抢显存(8G 卡的命门):
  3. 逐条拉取三个模型(下载时间看网速,耐心等):
  4. 验证:ollama list 应看到 3 个模型;ollama run qwen3.5:9b "你好" 能对话即成功。
# 限制同时只加载 1 个模型(重启 Ollama / 电脑后生效)setx OLLAMA_MAX_LOADED_MODELS 1# 拉取三个模型ollama pull qwen3.5:9bollama pull qwen2.5-coder:14bollama pull qwen2.5:7b
Step 2 装 ComfyUI + SDXL

ComfyUI 是本地图像生成的“工作流引擎”,它把文生图拆成可视化的节点链路,你可以像搭积木一样拼出自己的出图流程。对测试工程师,它的价值在于:封面图、信息图、界面示意图都能在本机几秒钟生成,不用再开设计软件或求人作图。

Step 3 配 OpenClaw(龙虾)

在 PowerShell 一行装好:

iwr -useb https://openclaw.ai/install.ps1 | iexopenclaw --versionopenclaw doctor
OpenClaw 是这套方案的“大脑”。它不自己干活,而是理解你的意图,再把任务分派给 Ollama 或 ComfyUI,最后把结果拼回给你。配置文件是 JSON5(支持注释),路径在 C:\Users\你的用户名\.openclaw\openclaw.json。下面是提炼后的关键片段(完整版见文末附录):
{  agents: {    defaults: {      model: { primary: "ollama/qwen3.5:9b", fallbacks: ["ollama/qwen2.5:7b"] },      models: {        "ollama/qwen3.5:9b":        { params: { num_ctx:16384, thinking:false, keep_alive:"5m" } },        "ollama/qwen2.5-coder:14b": { params: { num_ctx:16384, thinking:false, keep_alive:"5m" } },        "ollama/qwen2.5:7b":        { params: { num_ctx:8192,  thinking:false, keep_alive:"5m" } }      },      experimental: { localModelLean: true },   // 去掉占资源工具,让本地模型更瘦      timeoutSeconds: 300,                       // 本地冷启动慢,给足超时      imageGenerationModel: { primary: "comfy/workflow" }    }  },  models: {    providers: {      ollama: {        enabled: true,        baseUrl: "http://127.0.0.1:11434",   // 用原生 API,不要加 /v1        apiKey: "ollama-local",               // 本地占位即可        models: {          "qwen3.5:9b":        { aliases:["qwen3.5-9b-instruct"] },          "qwen2.5-coder:14b": { aliases:["qwen2.5-coder-14b-instruct"] },          "qwen2.5:7b":        { aliases:["qwen2.5-7b-instruct"] }        }      }    }  },  plugins: {    entries: {      comfy: { enabled:true, config: {        mode:"local", baseUrl:"http://127.0.0.1:8188",        image:{ workflowPath:"C:/ComfyUI/SDXL-workflow.json", promptNodeId:"6", outputNodeId:"9" }      }}    }  }}
💡 提示 baseUrl 用原生 http://127.0.0.1:11434,不要加 /v1,否则工具调用不稳定;keep_alive:5m 让模型闲 5 分钟自动从显存卸下,把位子让给画图引擎;thinking:false 关掉 Qwen 思考循环,避免生成长推理卡死。
单指令如何自动路由
你的一句话
龙虾调用的引擎
“帮我写篇技术文章”
Ollama qwen3.5:9b(通用大脑)
“画一张赛博朋克城市”
ComfyUI(SDXL)
“用 Python 写个爬虫”
默认 qwen3.5:9b 起草,可切到代码模型
“把这个 CSV 做月销趋势图”
龙虾分析 + 调 ComfyUI / 本机 Python 出图
“做个 5 秒产品宣传视频”
ComfyUI(CogVideoX,可选)

三个语言模型之间,默认由 qwen3.5:9b 统一当大脑;遇到重代码任务,聊天里说“切换到代码模型”或输入 /model ollama/qwen2.5-coder:14b 临时换将。真正的“跨引擎自动路由”发生在文字 vs 图像 vs 视频 vs 本机执行之间——这正是龙虾的价值。它像一个经验丰富的小组长,拿到一个混合任务(比如“读这份报告,画张配图,再总结成三段话”),会自己拆成“先分析、再出图、最后汇总”,并把每一步派给最合适的引擎,最后把结果拼成你能直接用的成品

验证:openclaw doctor 检查配置合法;openclaw models list --provider comfy 确认 ComfyUI 已接入;在聊天窗口说句“你好”,龙虾应用本机 qwen3.5:9b 回复你,全程不联网

如果一切正常,你已经拥有一个“断网可用的 AI 助手”。接下来真正的功夫在调校:把你的测试脚本目录、日志格式、常用出图风格逐步告诉龙虾,让它从“通用助手”长成“你的专属测试副驾”。这一过程不需要重装任何东西,只是不断地在对话里沉淀习惯

💡 提示 OpenClaw 配置是“严格校验”的:有个不认识的字段就拒绝启动。如果报错某字段未知(例如你版本未支持 localModelLean),删掉那行再试,跑 openclaw doctor 看原因


五、显存智能调度:8G 卡的命门

笔记本RTX 5060只有8G显存。qwen3.5:9b约占6.6G,SDXL出图约占 5~7G。两者若同时满载,必然显存溢出、程序崩溃。所以原则是:同一时刻,显卡上只留一个“重型”模型

微信公众号二维码图片引自微信公众号,扫码关注阅读原文
8G 显存错峰调度:对话先占显存,画图前ollama stop释放,再交给ComfyUI,空闲自动回收
Ollama 侧
OpenClaw 侧
最稳妥的节奏

用一个真实例子串起来:你说“帮我想三个公众号选题”,龙虾用 qwen3.5:9b 在显存里跑,返回结果;接着你说“顺手给第一个选题画张封面图”,龙虾先 ollama stop 释放语言模型显存,再调 ComfyUI(SDXL) 出图;图生成完毕,显存里只剩 ComfyUI 的临时占用,几分钟后 keep_alive 超时,全部回归空闲,等下一次指令。整个过程你只说了两句话,调度全交给龙虾

  1. 先聊天/写代码(Ollama 占显存)→ 要画图前,先 ollama stop 把语言模型卸下;
  2. 再让龙虾调 ComfyUI(SDXL) 出图;
  3. 图出完,显存里只剩 ComfyUI 临时占用;几分钟后 keep_alive 超时,全部回归空闲。

💡 提示 如果你经常“边聊边画”,把 keep_alive 调更短(如 1m),切换更顺;代价是每次对话要重新加载模型、首字稍慢。按手感权衡

六、测试工程师的 6 个提效场景(核心)

下面六个场景,你都可以直接对龙虾说(前提是 SDXL 工作流已配置好)。这是本文落到实处的部分。它们覆盖了一个测试工程师从“需求”到“验收报告”的完整链路:前两步是输入侧的用例与数据,中间两步是执行侧(脚本、截图),最后两步是输出侧(报告与文档)。你会发现,原本分散在一天里的几种工具切换,被收敛成“连续说几句话”

场景 1 需求文档 → 测试用例自动生成

把需求文本贴给龙虾:“根据以下需求,输出一份登录模块的测试用例,覆盖正常/异常/边界,用表格呈现”。它会用 qwen3.5:9b 结构化输出,直接对齐功能点,省去你逐条拆解

龙虾:根据下面需求生成测试用例表,列【用例编号/标题/前置条件/步骤/预期结果/类型】。需求要点:用户登录支持手机号+密码;连续 5 次失败锁定 10 分钟;验证码 60 秒刷新。
场景 2 测试数据批量构造 / 脱敏样例

“生成 50 条用户注册测试数据,字段含手机号、身份证(脱敏)、邮箱,边界值包含空值、超长、特殊字符”。本地生成,敏感样例不离开机器。对验收里要造“看起来真实但不能是真隐私”的数据尤其有用

场景 3 自动化脚本辅助编写

遇到重代码任务,切到 qwen2.5-coder:14b:“用 Python + pytest 写一个调用 /api/login 的接口测试,断言状态码和响应字段”。模型在本地跑,代码不触网。你拿到的不是“标准答案”,而是可改可跑的脚手架,省掉样板代码时间

龙虾:切到代码模型,写一个 pytest 用例:POST /api/login,入参 {"phone":"138...","pwd":"...",断言 200 且返回 token 字段非空;错误密码断言 401。
场景 4 界面/截图智能分析(验收刚需)

qwen3.5 是多模态模型,能读图。把界面截图贴给龙虾:“这张验收截图里有没有明显的 UI 缺陷?比如对齐错位、文字溢出、按钮遮挡”。它会给出缺陷清单,帮你把“肉眼遍历”变成“AI 初筛 + 人工复核”。在批量验收几十个页面时,这一步能省下大量重复眼球劳动

场景 5 缺陷报告 + 趋势图自动生成

“桌面有 sales.csv(上月销售数据)。帮我:①算总销售额和环比;②列 Top3 品类;③画一张月度趋势折线图。结果整理成带图的小报告”。龙虾会读 CSV、用本机 Python 统计、出图、拼成报告——全程数据不出本机

你(龙虾):读 C:\验收\sales.csv,按月份汇总销售额,算环比,列出 Top3 品类,用 ComfyUI 出一张趋势折线图,最后把文字结论和图拼成一个验收小报告.md。
场景 6 验收文档一键产出

“写一篇《本地部署 AI 的 5 个误区》验收说明(约 2500 字),再配一张信息图风格的封面(清爽配色、5 个小图标)”。文章与封面一气呵成。验收文档最耗时的“起头”和“配图”两步,被一句话解决

微信公众号二维码图片引自微信公众号,扫码关注阅读原文
端到端流水线:一句话串起“需求→用例→数据→脚本→截图分析→报告”六个环节
场景
用到的引擎
一句话指令示例
用例生成
Ollama qwen3.5:9b
“根据以下需求输出登录模块测试用例表”
数据构造
Ollama qwen3.5:9b
“生成 50 条脱敏注册测试数据,含边界值”
脚本编写
qwen2.5-coder:14b
“写 pytest 调用 /api/login 的接口测试”
截图分析
qwen3.5(多模态)
“这张验收截图有哪些 UI 缺陷?”
报告+趋势图
分析 + ComfyUI 出图
“读 sales.csv,算环比并画月度趋势图”
验收文档
Ollama + ComfyUI
“写 2500 字说明并配信息图封面”

把这六个场景串起来看,你会发现它们不是孤立的功能演示,而是一条完整的“需求 → 用例 → 数据 → 脚本 → 截图分析 → 报告”流水线。过去这条线要靠你开着四五个软件、在不同窗口间反复复制粘贴;现在,它收敛成你和龙虾之间连续的一段对话。这才是本地 AI 对测试工程师真正的意义:不是某个单点变快,而是整条链路被压扁了


七、断网 / 局域网验收落地建议

八、排错速查

本地部署最怕“卡在某个不知道为什么的步骤”。下面把作者踩过、读者大概率也会遇到的几个坑列成速查表,照着对号入座即可,不必从头再来。

现象
可能原因
处理
龙虾连不上 Ollama
Ollama 没起或 baseUrl 错
确认羊驼图标在;ollama list 验证;检查 baseUrl 是否 127.0.0.1:11434(不要 /v1)
显存爆 / 黑屏 / OOM
8G 被多个模型占满
先 ollama stop 释放;生成图前关掉对话模型;给 ComfyUI 开 lowvram
工具调用不生效
个别 Qwen 版本工具支持不稳
配 params.supportsTools:false 退回文本解析;或换 qwen2.5:7b
模型首次很慢 / 超时
冷启动加载权重
配置 timeoutSeconds:300;耐心等首次
画图一直转圈
ComfyUI 没起 / 工作流路径错
浏览器开 127.0.0.1:8188 确认;核对 workflowPath 与节点 ID

常用命令一页纸:

# Ollamaollama pull qwen3.5:9b / qwen2.5-coder:14b / qwen2.5:7bollama list            # 查看已装模型ollama ps              # 正在运行的模型ollama stop qwen3.5:9b # 立刻释放显存给画图# OpenClaw(龙虾)openclaw doctor                      # 检查配置openclaw models list --provider comfy# 确认 ComfyUI 接入openclaw gateway install             # 注册开机自启

九、结语

断网不是 AI 用不起来的理由。把 Ollama、ComfyUI、OpenClaw 三件套在本地串起来,你就有了一个数据不出机、断网也能用、一句话派活的测试副驾。从“写用例、造数据、审截图、出报告”这些重复劳动里腾出手脚,把精力留给真正需要人判断的验收决策上。

有人会问:本地部署是不是很折腾?确实要花一个下午把环境搭起来,但搭好之后是“零边际成本”的——不用再为每次调用付费,不用担心数据外泄,也不用被限流。对一个长期和验收环境打交道的测试工程师,这笔一次性投入,回报率相当可观。

部署细节、完整 openclaw.json 与命令速查,可参考作者此前发布的《个人本地离线 AI 全套部署手册》(同机验证通过)。先把三件套装起来,今晚就能让龙虾帮你写第一份用例。下一步,可以把它接到你日常的真实项目里:把测试脚本目录交给龙虾读取,把验收截图目录交给它分析——那一刻,它才真正从“演示”变成“生产力”。

公众号后台私信发送:“离线AI”即可获取实操手册