在你的 Mac 上本地运行 Qwen(通义千问)
Qwen 是本地编程最常跑的那个开源权重家族——而它的每一档,从 2 GB 的 4B 到 122B 旗舰,都能跑在 Apple Silicon 上。下面是适配你内存的尺寸,和启动它的那一条命令。
rapidmlx.com)提供,大陆可直连;模型权重托管在 Hugging Face,需切到镜像下载,见下方第三步。60 秒上手
$ curl -fsSL https://rapidmlx.com/install.sh | bash
$ rapid-mlx serve qwen3.5-4b-4bit
这是一个标准的 OpenAI 兼容服务,跑在 http://localhost:8000。首次运行会下载权重,之后启动只需几秒——无需注册、无需 API key,什么都不出你的 Mac。
哪个尺寸适配你的 Mac
下表是权重在磁盘上(以及载入后大致在统一内存中)占用的大小。给上下文窗口和 macOS 本身留出余量。
| 你的 Mac | serve 这个 | 权重 | 说明 |
|---|---|---|---|
| 8 GB | qwen3.5-4b-4bit | 2.0 GB | 最小的「真 Qwen」。轻问答与小改动很跟手。 |
| 16 GB | qwen3.5-9b-4bit | 4.5 GB | 16 GB 的舒适选择,还有余量留长上下文。 |
| 16 GB(进取) | qwen3.6-27b-ud-3bit | 10.1 GB | 当代 27B 压到 3-bit。很紧——记得关掉 Chrome 标签页。 |
| 24 GB | qwen3.6-27b-4bit | 13.5 GB | 当代 dense 27B,完整 4-bit 质量。 |
| 32 GB | qwen3.6-35b-4bit | 17.5 GB | 甜点档:MoE 速度、大模型质量,还有余量处理长文件。 |
| 48–64 GB | qwen3.6-35b-8bit | 35 GB | 8-bit 的 35B——正是我们发版 CI 用来 gate 的那个模型。 |
| 64 GB+ | qwen3.5-122b-mxfp4 | 61 GB | 旗舰。122B-A10B MoE,mxfp4 量化。 |
不确定自己属于哪一档?用在线选型器选你的机型,直接看哪些模型放得下、跑多快。
工具调用开箱即用
serve 会为每个 Qwen 别名自动配好对话模板和工具调用解析器,语法约束的工具调用默认开启——所以函数调用返回的是合法 JSON,而不是「几乎能解析」的一段话。这是无聊但关键的部分:Qwen-on-your-Mac 无需任何胶水代码就能接进期待 OpenAI 语义的工具。
接入你的编辑器或 Agent
服务说的是 OpenAI 协议,任何带「自定义 base URL」的工具都能用:
- Claude Code——让 CLI agent 完全在本地跑你的 Qwen(英文教程)。
- Cursor——chat、Ctrl-K、composer 指向
http://localhost:8000/v1(英文教程)。 - Codex CLI 与 Aider——都说同一套 OpenAI 兼容端点。
做本地编程与 agent 工作,内存够就上 qwen3.6-35b-8bit;这几档都走同一个端点,切换只是一条命令。
第三步(大陆用户必读):模型下载走 HF 镜像
模型权重托管在 Hugging Face,大陆无法直连。启动前设置一个环境变量,切换到社区维护的镜像 hf-mirror.com 即可,模型文件与官方仓库一致:
$ export HF_ENDPOINT=https://hf-mirror.com
想长期生效,把这一行加进 ~/.zshrc。之后正常 rapid-mlx serve,下载会自动走镜像。
常见问题
能在 Mac 上本地运行 Qwen 吗?
可以。qwen3.5-4b-4bit 只占 2 GB,8 GB 的 Mac 就能跑;16 GB 用 qwen3.5-9b-4bit,24 GB 可上当代 27B,32 GB 及以上跑 MoE 的 35B。全部原生跑在 Apple Silicon 上。
本地跑 Qwen 真的免费又私密吗?
权重开源、rapid-mlx 是 Apache 2.0,推理完全在你的 Mac 上进行——没有帐号、没有按 token 计费,你的提示词和代码从不离开本机。唯一成本是权重占的磁盘和你本来就在用的电。
Qwen 3.5 和 3.6 怎么选?
3.6 是当代,同尺寸下质量更好、MoE 档解码快,优先选它(27B / 35B);3.5 覆盖最小档(4B / 9B)和 122B 旗舰。两代都用同一条 serve 命令,按内存挑档即可。