Wednesday, October 7, 2026

在Windows上安装部署LM Studio运行本地AI大模型

如果你的电脑CPU的NPU算力在40TOPS以上,内存至少16GB,那么你可以在本地比较流畅的运行体验轻量级AI模型(3B-4B),而中量级AI模型(8B-9B)仅是勉强可用。

以英特尔Core Ultra 5 226V处理器、Windows 11操作系统的笔记本电脑为例,使用LM Studio部署AI模型运行环境。

提示:LM Studio同时支持AMD Ryzen AI NPU和Intel处理器的NPU。

安装部署LM Studio

第一步:下载与安装 LM Studio

1、访问官网:打开 LM Studio 官网(https://lmstudio.ai/)下载 Windows 版本安装包。

2、安装:双击下载的 .exe 文件,按照提示完成安装。

第二步:基础设置(可选)

首次启动后,建议先点击右下角的齿轮图标,在“General”里将语言改为简体中文,方便后续操作。

第三步:搜索并下载模型

LM Studio 内置了模型搜索功能,可以直接下载 GGUF 格式的量化模型。

1、进入搜索:点击左侧边栏的放大镜图标(Discover 页面)。

2、精准搜索:在搜索框输入 lmstudio-community/Qwen3.5-9B-GGUF 或 Qwen3.5-9B-GGUF 或 GLM-4-9B-0414。

3、选择版本:在搜索结果中,找到 Q4_K_M 量化版本(适合 16GB 内存设备)。点击右侧的 Download 按钮开始下载。

模型选择建议:针对英特尔Core Ultra 5 226V(16GB 内存),下载时建议选 Q4_K_M 量化版本,在质量和内存占用上比较平衡。如果加载后觉得系统内存有点紧张,也可以退一步选更小的 Q4_K_S。

第四步:加载模型并开始对话

下载完成后,模型会出现在“我的模型”(My Models)列表中。

1、加载模型:点击左侧的聊天图标(Chat),在顶部的“选择模型”下拉框中,选中刚刚下载的 Qwen3.5-9B(Q4_K_M)。

2、硬件加速(关键):模型加载时,留意右侧的设置面板。确保 GPU Offload 选项被启用(滑块调至最大),这样它才会尝试调用你的 Intel Arc 130V 核显进行加速。

3、开始聊天:模型加载完成后,就可以在底部的输入框里提问了。

LM Studio 主流可选模型

Qwen 系列(首选,针对中文场景优化)

Qwen3.5-9B:Qwen3.5-9B-GGUF

GLM 系列(中文社区强推)

GLM-4-9B:GLM-4-9B-0414

Gemma系列(特定 OCR 场景)

Gemma-4-E4B:gemma-4-E4B-it GGUF

针对英特尔Core Ultra 5 226V(16GB 内存),搜索到结果后建议优先选 QAT 版本,如果看到 google/gemma-4-e4b-qat 或类似带 QAT 字样的,优先下载它。这是官方用“量化感知训练”优化的版本,画质损失更小,且内存占用(最低 6GB)很适合你的设备。如果没有 QAT 版,选 Q4_K_M(文件约 5.3GB)即可,这是通用性最好的量化格式 。

DeepSeek系列(特定 OCR 场景)

DeepSeek-R1-Distill(如 1.5B、7B、8B、14B 等)

针对英特尔Core Ultra 5 226V(16GB 内存),优先考虑蒸馏版。搜索结果中带有 DeepSeek-R1-Distill 字样的,是经过蒸馏的小尺寸版本,对硬件更友好。下载时选择 Q4_K_M 量化,能在质量和内存占用间取得比较好的平衡。7B 或 8B 的蒸馏版是比较稳妥的起点。

Leave a Reply

Your email address will not be published. Required fields are marked *

This site uses Akismet to reduce spam. Learn how your comment data is processed.