Wednesday, October 7, 2026

在Windows上安装部署Docker、FastFlowLM 和 Open WebUI运行本地AI大模型(仅限AMD处理器)

如果你的电脑CPU的NPU算力在40TOPS以上,内存至少32GB,那么你可以在本地比较流畅的运行体验轻量级AI模型(3B-4B)和中量级AI模型(8B-9B)。

以AMD 锐龙 AI 9 H 465处理器、Windows 11操作系统的笔记本电脑为例,整个流程可以概括为:装好 Docker 环境 → 用 FastFlowLM 解锁 NPU → 用 Docker 跑起 Open WebUI → 把两者连起来。

提示:FastFlowLM(FLM)是专为 AMD Ryzen AI NPU 设计的推理引擎,无法用于Intel处理器的NPU。

安装部署Docker、FastFlowLM 和 Open WebUI

第一步:安装 Docker Desktop

FastFlowLM 需要直接访问硬件(NPU),所以它不能跑在 Docker 里,而是装在 Windows 宿主机上。Docker 只负责跑 Open WebUI。

1、下载安装:去 Docker 官网下载 Docker Desktop for Windows 的安装程序。

2、安装方式:推荐用按用户安装(无需管理员权限)。在 PowerShell 里运行(先 cd 到安装包所在目录):

Start-Process 'Docker Desktop Installer.exe' -Wait -ArgumentList 'install', '--user'

如果提示需要管理员权限,可以改用带 install 参数的普通安装。

3、启动并接受协议:装完后手动打开 Docker Desktop,接受服务协议,等左下角鲸鱼图标变绿(表示引擎已就绪)。

系统要求:Windows 11(或 Win10 22H2+),需开启 WSL 2 或 Hyper-V。

第二步:安装 FastFlowLM(宿主机侧)

这是调用你锐龙 AI 9H 465 NPU 的核心。

1、确认驱动:去设备管理器或任务管理器检查 NPU 驱动版本,必须 ≥ 32.0.203.311。

2、下载安装:从 FastFlowLM 官网下载 flm-setup.msi 并安装。安装时如果弹出“Windows protected your PC”,点“More info” → “Run anyway”。

3、拉取一个模型做测试:打开 PowerShell,跑一个轻量模型验证环境:

flm pull qwen3.5:4b

然后启动服务器模式(保持窗口开着):

flm serve qwen3.5:4b

看到 API 监听在 http://127.0.0.1:52625 就成功了。

第三步:用 Docker 部署 Open WebUI

这里用 docker run 直接跑,配置已经帮你调好了关键参数。

打开 PowerShell,执行这条命令:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data -e WEBUI_SECRET_KEY=your-secret-key -e WEBUI_AUTH=false -e OPENAI_API_BASE_URL=http://host.docker.internal:52625/v1 -e OPENAI_API_KEY=dummy -e OLLAMA_BASE_URL= -e ENABLE_TITLE_GENERATION=false -e ENABLE_FOLLOW_UP_GENERATION=false --name open-webui --restart always ghcr.io/open-webui/open-webui:main

关键参数解释:

–add-host=host.docker.internal:host-gateway:让容器能访问宿主机上的 FastFlowLM。

WEBUI_AUTH=false:关闭登录验证,单人使用更省事。

OPENAI_API_BASE_URL:直接指向 FastFlowLM 的 API 地址。因为容器里不能用 127.0.0.1,所以用 host.docker.internal 代替。

关掉几个自动生成功能,能显著降低 NPU 的无效负载,响应更快。

第四步:验证连接

打开浏览器访问 http://localhost:3000。

应该能直接看到聊天界面(因为关了登录)。

在左上角模型选择器里,应该能看到 qwen3.5:4b。选中它,随便发句话试试。

如果模型列表是空的,去 Admin Settings → Connections 检查那个 OpenAI 连接是否显示为“已连接”。如果 FastFlowLM 的 PowerShell 窗口关了,连接就会断,重新 flm serve 一下即可。

如果你以后想换更大的模型(比如 8B),不需要动 Docker 里的任何配置。只需要在 PowerShell 里 Ctrl+C 停掉当前的 flm serve,然后用新模型名重新启动(比如 flm serve deepseek-r1-0528:8b)。Open WebUI 会自动从 FastFlowLM 刷新模型列表,你在网页上刷新一下就能看到新模型了。

FastFlowLM 主流可选模型

Qwen 系列 (文本/推理/视觉)

Qwen3.6-35B-A3B(MoE)(智能体编程):qwen3.6-moe:35b-a3b

Qwen3.8-27B(本地运行的巨无霸):qwen3.8-mtp:27b

Qwen3.5 系列(本地主流通用模型):qwen3.5:9b / :4b / :2b / :0.8b

Qwen3-VL-4B(视觉专精):qwen3vl-it:4b

DeepSeek 系列 (推理)

DeepSeek-R1-0528-Qwen3-8B:deepseek-r1-0528:8b

LFM 系列 (轻量/特定格式)

LFM2.5(速度最快、内存占用最低的模型):lfm2.5-it:1.2b (指令) / lfm2.5-tk:1.2b (思考)

专用与工具模型

翻译 (Hy-MT2):hy-mt2:1.8b

语音转写 (Whisper):Whisper-V3-Turbo

模型大小建议(基于 32GB 内存)

轻量级(3B-4B):最稳妥,推荐首选。这类模型在 NPU 上运行非常流畅,能效极高,适合日常对话、总结和基础翻译。FastFlowLM 官方测试显示,Llama 3.2-3B 在 NPU 上能跑到 66 tokens/s,体验丝滑。像 Qwen3-4B 也支持超长上下文(256k tokens)。追求最佳能效与流畅度:优先从 3B 或 4B 的模型开始(如 Qwen3-4B、Llama-3.2-3B)。

中量级(8B-9B):能力更强,速度依然可用。这是质量和速度的甜点区。有评测显示,在这类平台上运行 DeepSeek-R1-8B 可以达到 11.63 tokens/s 左右,完全能应付文档问答、代码辅助等复杂任务。更专业的 Qwen3.5-9B 微调版也能在这类 NPU 上稳定运行。追求更强的理解与推理能力:直接上 8B 或 9B 的模型(如 DeepSeek-R1-8B、Qwen3.5-9B)。

重量级(14B-32B):可以尝试,但需依赖混合推理。如果你需要更强的逻辑能力,可以尝试更大的模型。实测在类似平台上跑 14B 模型速度约 48 tokens/s,而 32B 模型则会降到 18-22 tokens/s。注意,大模型可能无法完全塞进 NPU,系统会自动将部分计算分流到 GPU。

Leave a Reply

Your email address will not be published. Required fields are marked *

This site uses Akismet to reduce spam. Learn how your comment data is processed.