如果你的电脑CPU的NPU算力在40TOPS以上,内存至少16GB,那么你可以在本地比较流畅的运行体验轻量级AI模型(3B-4B),而中量级AI模型(8B-9B)仅是勉强可用。
以英特尔Core Ultra 5 226V处理器、Windows 11操作系统的笔记本电脑为例,使用LM Studio部署AI模型运行环境。
提示:LM Studio同时支持AMD Ryzen AI NPU和Intel处理器的NPU。
安装部署LM Studio
第一步:下载与安装 LM Studio
1、访问官网:打开 LM Studio 官网(https://lmstudio.ai/)下载 Windows 版本安装包。
2、安装:双击下载的 .exe 文件,按照提示完成安装。
第二步:基础设置(可选)
首次启动后,建议先点击右下角的齿轮图标,在“General”里将语言改为简体中文,方便后续操作。
第三步:搜索并下载模型
LM Studio 内置了模型搜索功能,可以直接下载 GGUF 格式的量化模型。
1、进入搜索:点击左侧边栏的放大镜图标(Discover 页面)。
2、精准搜索:在搜索框输入 lmstudio-community/Qwen3.5-9B-GGUF 或 Qwen3.5-9B-GGUF 或 GLM-4-9B-0414。
3、选择版本:在搜索结果中,找到 Q4_K_M 量化版本(适合 16GB 内存设备)。点击右侧的 Download 按钮开始下载。
模型选择建议:针对英特尔Core Ultra 5 226V(16GB 内存),下载时建议选 Q4_K_M 量化版本,在质量和内存占用上比较平衡。如果加载后觉得系统内存有点紧张,也可以退一步选更小的 Q4_K_S。
第四步:加载模型并开始对话
下载完成后,模型会出现在“我的模型”(My Models)列表中。
1、加载模型:点击左侧的聊天图标(Chat),在顶部的“选择模型”下拉框中,选中刚刚下载的 Qwen3.5-9B(Q4_K_M)。
2、硬件加速(关键):模型加载时,留意右侧的设置面板。确保 GPU Offload 选项被启用(滑块调至最大),这样它才会尝试调用你的 Intel Arc 130V 核显进行加速。
3、开始聊天:模型加载完成后,就可以在底部的输入框里提问了。
LM Studio 主流可选模型
Qwen 系列(首选,针对中文场景优化)
Qwen3.5-9B:Qwen3.5-9B-GGUF
GLM 系列(中文社区强推)
GLM-4-9B:GLM-4-9B-0414
Gemma系列(特定 OCR 场景)
Gemma-4-E4B:gemma-4-E4B-it GGUF
针对英特尔Core Ultra 5 226V(16GB 内存),搜索到结果后建议优先选 QAT 版本,如果看到 google/gemma-4-e4b-qat 或类似带 QAT 字样的,优先下载它。这是官方用“量化感知训练”优化的版本,画质损失更小,且内存占用(最低 6GB)很适合你的设备。如果没有 QAT 版,选 Q4_K_M(文件约 5.3GB)即可,这是通用性最好的量化格式 。
DeepSeek系列(特定 OCR 场景)
DeepSeek-R1-Distill(如 1.5B、7B、8B、14B 等)
针对英特尔Core Ultra 5 226V(16GB 内存),优先考虑蒸馏版。搜索结果中带有 DeepSeek-R1-Distill 字样的,是经过蒸馏的小尺寸版本,对硬件更友好。下载时选择 Q4_K_M 量化,能在质量和内存占用间取得比较好的平衡。7B 或 8B 的蒸馏版是比较稳妥的起点。
乔大海个人网站 https://qiaodahai.com/