在你的 Mac 上本地运行大语言模型
rapid-mlx 是 Apple Silicon 上的本地大模型推理引擎,Apache 2.0 开源。一条命令或一个桌面 App,模型完全在本机运行——无需注册帐号、无需云端服务、按量计费为零,代码和数据不出你的 Mac。
rapidmlx.com / dl.rapidmlx.com)提供,
大陆可直连下载,不经过 GitHub。节点在海外,速度取决于运营商出口——
通常"能稳定下载",但请勿期待国内 CDN 的速度。模型权重的下载走
Hugging Face 社区镜像,见下文第三步。
两种方式,同一个引擎
桌面 App GUI
点开即用:选模型、开始对话,无需终端和配置。已签名并通过 macOS 公证。大陆点击下方按钮会自动从 dl.rapidmlx.com 镜像下载。
下载没反应或跳到了 GitHub?用镜像直链(dl.rapidmlx.com)——挂代理时地区判断可能失误,这个链接始终走大陆可直连的镜像。
终端 & 服务器 CLI
在 localhost 上起一个 OpenAI 兼容服务——Cursor、Claude Code、Aider 以及任何支持 OpenAI API 的工具都能直接接入。
系统要求
- 芯片
- Apple Silicon——M1 或更新
- macOS
- 14(Sonoma)或更新
- Python
- 3.10+——缺失会自动安装
- 内存
- 按你的内存挑模型——在线选型器 →
第一步:安装引擎
推荐一条命令安装(脚本会自动准备隔离的 Python 环境,不动系统 Python,无需 sudo):
$ curl -fsSL https://rapidmlx.com/install.sh | bash
如果你已有 Python 3.10+ 环境且 PyPI 官方源较慢,可以直接用清华镜像源安装:
$ pip install rapid-mlx -i https://pypi.tuna.tsinghua.edu.cn/simple
Homebrew 用户也可以 brew install rapid-mlx(已进入 homebrew/core,无需第三方 tap)。
第二步:启动一个模型
# 首次运行会自动下载模型权重 $ rapid-mlx serve qwen3.5-4b-4bit ⚡ serving on http://localhost:8000/v1
这是一个 OpenAI 兼容端点。把 Cursor、Claude Code、Aider 或任何 OpenAI
客户端指向 http://localhost:8000/v1,就在本地跑起来了。
第三步(大陆用户必读):模型下载走 HF 镜像
模型权重托管在 Hugging Face,大陆无法直连。启动前设置一个环境变量,
切换到社区维护的缓存镜像 hf-mirror.com 即可,模型文件与官方仓库一致:
$ export HF_ENDPOINT=https://hf-mirror.com
想长期生效,把这一行加进 ~/.zshrc。之后正常
rapid-mlx serve,下载会自动走镜像。
常见问题
数据会离开我的电脑吗?
不会。推理完全在本机进行,没有帐号系统、没有云端转发。遥测默认关闭, 首次运行时明确询问、可拒绝(详见仓库的 PRIVACY.md)。
免费吗?
引擎 Apache 2.0 开源,桌面 App 免费下载,没有订阅和按量计费。
该选哪个模型?
取决于内存:8 GB 的 Mac 从小模型起步,16 GB 以上可以跑主流开源模型。 用选型器选你的机型,直接看哪些模型放得下、跑多快。