← 返回 8秒笔记 8秒笔记

NOTES · 期刊

苹果笔记本永久免费跑2840亿参数的Deepseek v4模型

发布于 2026/08/27 10:52 · 更新于 2026/08/27 11:24

苹果笔记本永久免费跑2840亿参数的Deepseek v4模型

QUOTE

2840亿参数的Deepseek大模型, 塞进一台笔记本 ,免费跑,不限量。Redis之父亲手写的「专属高速公路」。

—— 一个被API账单伤到的小登登

科技圈炸了,Deepseek成为苹果笔记本上的永久免费神卡。

Redis之父antirez搞的一个项目,叫ds4。这哥们把DeepSeek V4 Flash这个2840亿参数的大家伙,塞进了苹果笔记本里。是的,就是你桌上那台MacBook,不需要A100,不需要买云服务器,免费跑,不限量。

01

THE STORY

Redis之父出手,做了个什么

项目叫DwarfStar,GitHub上叫ds4, 二十多万星 了。

这不是那种在llama.cpp上套个壳的「优化」,而是他用 C语言和苹果的Metal API 从头写的一套引擎。整个项目就几个文件,清清爽爽,没有一堆框架依赖。它不打算兼容所有模型,就专攻一件事——让DeepSeek V4 Flash在Mac上跑得流畅。

而且他是用 GPT-5.5 辅助写的代码。他自己在README里说得很直白:不接受AI辅助写代码的人,这个项目不适合你。这哥们是真的实诚。

02

TECH

怎么把2840亿参数塞进笔记本的

284B参数的模型,FP16精度下需要284GB内存,这得买服务器。但ds4用了三招,硬是把它塞进了128GB的MacBook。

非对称量化。 不是一股脑全压到2-bit。MoE模型里那些每次推理不常用的"候补专家"层,用2-bit狠压;但共享专家层、路由层、投影层这些关键路径,保持Q8精度。相当于把公司里不常开的部门放小隔间,核心团队保留大办公室。这样 模型体积省了60GB ,但推理质量没怎么掉。

KV缓存扔到SSD。 大模型做长对话,最吃内存的就是这个KV缓存。ds4把它写到硬盘上,下次重启直接加载,不用重新计算。 1M token的上下文 也是这么搞的——你硬盘多大,它就能写多大。

纯Metal路径。 直接调用苹果GPU,没有中间层。就是针对Apple Silicon写的,不考虑N卡,不考虑AMD,就咬死一个平台往死里优化。

03

BENCHMARK

真实跑起来什么样

我翻了很多实测数据,单说128GB MacBook Pro的表现:

58.5

prefill t/s

26.7

生成 t/s

1M

token上下文

什么概念呢?每秒26个token,大概一秒钟蹦出十几个汉字。跟云端API比确实慢,但写代码、改bug、做代码审查,这个速度完全够用。最关键是 不用联网,不用交费,不限量调用 。

512GB Mac Studio就更猛了,生成速度36.8 token/s,预填充飙到468 token/s。YC CEO Garry Tan都在推特上说正在下载体验。

04

FLAWS

说说真实槽点

不能光说好话,我用下来有几个不爽的地方。

 只支持Apple Silicon

你如果用的是Intel Mac,或者Windows本,这事跟你没关系。ds4就是写给苹果用户的。

 128GB内存是起步价

虽然官方说96GB也能跑,但要流畅体验,128GB以上比较稳。这门槛其实不低,MacBook Pro选配到128GB加的钱够买一台PC了。

 只专注一个模型

虽然现在也兼容了GLM 5.2,但核心还是V4 Flash。如果DeepSeek下个版本换了架构,这玩意可能就废了。antirez自己也说了,这是一条窄路,赌的就是这一代模型。

 需要编译一下

不是app store下载就能用的,要git clone、make、下载模型,有一定动手门槛。不过对于程序员来说,也就是敲几行命令的事。

或者直接让你的agent代劳吧

05

WHO

谁值得试试

我觉得有三类人可以搞:

 重度AI用户

每天跟Claude Code、opencode打交道的。本地跑之后,再也不用担心API额度用完,随便调,随便试。

 数据敏感型项目

代码不能上传到云端的。本地跑,数据不出门,安全感拉满。

 折腾型玩家

就想体验一下「284B模型在笔记本上跑」是什么感觉,这种技术上的爽感,懂的都懂。

至于轻度用户,偶尔用用ChatGPT就够了,没必要折腾这个。它还不是一个「双击安装」的产品,但方向对了。

∞

THE END

最大的意义

antirez在README里写了一段话,我觉得说得特别好。他说本地推理应该把三件事一起做好—— 一个带HTTP API的推理引擎,一份专门针对这个引擎优化的模型文件,一套对接编码agent的测试验证 。不是把组件拼起来,是把整条链路当产品来设计。

如果这条路走通了,以后每个模型发布,社区里就会有人跳出来做专属引擎、专属量化、专属agent接入。你不用买昂贵的服务器,笔记本就够了。 AI像水电一样,打开就有,不按量收费 。

128GB以上的苹果用户可以试着搞一下

Github:https://github.com/antirez/ds4


原文地址:https://mp.weixin.qq.com/s/YD0HQDoDHED2_7aSgnc0RA