在你的 Mac 上本地运行 DeepSeek
DeepSeek 是把强推理带到本机的开源权重家族——从 8 GB MacBook Air 上跑得动的 R1 蒸馏模型,到 Studio 级的 V4-Flash 旗舰,思维链在标准 OpenAI 协议上单独流式返回。下面是适配你内存的尺寸,和启动它的那一条命令。
rapidmlx.com)提供,大陆可直连;模型权重托管在 Hugging Face,需切到镜像下载,见下方第三步。60 秒上手
$ curl -fsSL https://rapidmlx.com/install.sh | bash
$ rapid-mlx serve deepseek-r1-8b-4bit
这是一个标准的 OpenAI 兼容服务,跑在 http://localhost:8000。首次运行会下载权重,之后启动只需几秒——无需注册、无需 API key,什么都不出你的 Mac。
哪个尺寸适配你的 Mac
下表是权重在磁盘上(以及载入后大致在统一内存中)占用的大小。给上下文窗口和 macOS 本身留出余量。
| 你的 Mac | serve 这个 | 权重 | 说明 |
|---|---|---|---|
| 8 GB | deepseek-r1-8b-4bit | 4.0 GB | R1 推理蒸馏到 8B——入门 Air 上就能一步步思考。 |
| 16 GB | deepseek-coder-v2-lite-16b-4bit | 8.0 GB | MoE 编程模型——大模型的编码能力、快速解码。 |
| 24 GB | deepseek-r1-32b-4bit | 16.0 GB | R1 蒸馏到 32B——推理明显更强。 |
| 128 GB+ | deepseek-v4-flash-2bit | 89.9 GB | 旗舰的 2-bit 版本——面向 Studio 级统一内存。 |
| 192 GB+ | deepseek-v4-flash-4bit | 141 GB | V4-Flash 的 4-bit,当你有足够内存时。 |
不确定自己属于哪一档?用在线选型器选你的机型,直接看哪些模型放得下、跑多快。
推理与工具调用开箱即用
serve 会为每个 DeepSeek 别名自动配好对话模板、工具调用解析器和推理解析器,语法约束的工具调用默认开启——所以函数调用返回的是合法 JSON,而不是「几乎能解析」的一段话。R1 的思维链以 reasoning_content 在标准 OpenAI 协议上单独流式返回,客户端拿到的是一个干净的答案、思考过程被拆开。
接入你的编辑器或 Agent
服务说的是 OpenAI 协议,任何带「自定义 base URL」的工具都能用:
- Claude Code——让 CLI agent 完全在本地跑你的 DeepSeek(英文教程)。
- Cursor——chat、Ctrl-K、composer 指向
http://localhost:8000/v1(英文教程)。 - Codex CLI 与 Aider——都说同一套 OpenAI 兼容端点。
第三步(大陆用户必读):模型下载走 HF 镜像
模型权重托管在 Hugging Face,大陆无法直连。启动前设置一个环境变量,切换到社区维护的镜像 hf-mirror.com 即可,模型文件与官方仓库一致:
$ export HF_ENDPOINT=https://hf-mirror.com
想长期生效,把这一行加进 ~/.zshrc。之后正常 rapid-mlx serve,下载会自动走镜像。
常见问题
能在 Mac 上本地运行 DeepSeek 吗?
可以。deepseek-r1-8b-4bit 只占 4 GB,8 GB 的 Air 就能跑 R1 推理;16 GB 可以上 Coder-V2-Lite 编程模型,24 GB 可跑 R1 蒸馏的 32B。全部原生跑在 Apple Silicon 上。
本地跑 DeepSeek 真的免费又私密吗?
权重开源、rapid-mlx 是 Apache 2.0,推理完全在你的 Mac 上进行——没有帐号、没有按 token 计费,你的提示词和代码从不离开本机。唯一成本是权重占的磁盘和你本来就在用的电。
它和网页版 DeepSeek 有什么不同?
本地版完全离线、可控、可接入本地工具链;代价是你用的是开源权重版本(R1 / Coder / V4-Flash),受你 Mac 内存约束。对隐私敏感或需要断网工作的场景,本地是更合适的选择。