中文指南 · Qwen 通义千问

在你的 Mac 上本地运行 Qwen(通义千问)

Qwen 是本地编程最常跑的那个开源权重家族——而它的每一档,从 2 GB 的 4B 到 122B 旗舰,都能跑在 Apple Silicon 上。下面是适配你内存的尺寸,和启动它的那一条命令。

中国大陆网络说明。rapid-mlx 引擎与安装脚本由我们自己的 CDN(rapidmlx.com)提供,大陆可直连;模型权重托管在 Hugging Face,需切到镜像下载,见下方第三步

60 秒上手

$ curl -fsSL https://rapidmlx.com/install.sh | bash
$ rapid-mlx serve qwen3.5-4b-4bit

这是一个标准的 OpenAI 兼容服务,跑在 http://localhost:8000。首次运行会下载权重,之后启动只需几秒——无需注册、无需 API key,什么都不出你的 Mac。

哪个尺寸适配你的 Mac

下表是权重在磁盘上(以及载入后大致在统一内存中)占用的大小。给上下文窗口和 macOS 本身留出余量。

你的 Macserve 这个权重说明
8 GBqwen3.5-4b-4bit2.0 GB最小的「真 Qwen」。轻问答与小改动很跟手。
16 GBqwen3.5-9b-4bit4.5 GB16 GB 的舒适选择,还有余量留长上下文。
16 GB(进取)qwen3.6-27b-ud-3bit10.1 GB当代 27B 压到 3-bit。很紧——记得关掉 Chrome 标签页。
24 GBqwen3.6-27b-4bit13.5 GB当代 dense 27B,完整 4-bit 质量。
32 GBqwen3.6-35b-4bit17.5 GB甜点档:MoE 速度、大模型质量,还有余量处理长文件。
48–64 GBqwen3.6-35b-8bit35 GB8-bit 的 35B——正是我们发版 CI 用来 gate 的那个模型。
64 GB+qwen3.5-122b-mxfp461 GB旗舰。122B-A10B MoE,mxfp4 量化。

不确定自己属于哪一档?用在线选型器选你的机型,直接看哪些模型放得下、跑多快。

工具调用开箱即用

serve 会为每个 Qwen 别名自动配好对话模板和工具调用解析器,语法约束的工具调用默认开启——所以函数调用返回的是合法 JSON,而不是「几乎能解析」的一段话。这是无聊但关键的部分:Qwen-on-your-Mac 无需任何胶水代码就能接进期待 OpenAI 语义的工具。

接入你的编辑器或 Agent

服务说的是 OpenAI 协议,任何带「自定义 base URL」的工具都能用:

做本地编程与 agent 工作,内存够就上 qwen3.6-35b-8bit;这几档都走同一个端点,切换只是一条命令。

第三步(大陆用户必读):模型下载走 HF 镜像

模型权重托管在 Hugging Face,大陆无法直连。启动前设置一个环境变量,切换到社区维护的镜像 hf-mirror.com 即可,模型文件与官方仓库一致:

$ export HF_ENDPOINT=https://hf-mirror.com

想长期生效,把这一行加进 ~/.zshrc。之后正常 rapid-mlx serve,下载会自动走镜像。

常见问题

能在 Mac 上本地运行 Qwen 吗?

可以。qwen3.5-4b-4bit 只占 2 GB,8 GB 的 Mac 就能跑;16 GB 用 qwen3.5-9b-4bit,24 GB 可上当代 27B,32 GB 及以上跑 MoE 的 35B。全部原生跑在 Apple Silicon 上。

本地跑 Qwen 真的免费又私密吗?

权重开源、rapid-mlx 是 Apache 2.0,推理完全在你的 Mac 上进行——没有帐号、没有按 token 计费,你的提示词和代码从不离开本机。唯一成本是权重占的磁盘和你本来就在用的电。

Qwen 3.5 和 3.6 怎么选?

3.6 是当代,同尺寸下质量更好、MoE 档解码快,优先选它(27B / 35B);3.5 覆盖最小档(4B / 9B)和 122B 旗舰。两代都用同一条 serve 命令,按内存挑档即可。

接下来