2.78万亿参数Kimi K3跑在MacBook Pro上:四块SSD流式喂专家权重,稳定输出每秒1个token

AI 画家正在创作中

一个名为deltafin的开源项目在9月9日冲上Hacker News前列,作者展示的成果听上去像是在挑战物理常识:把2.78万亿参数的Kimi K3模型跑在一台笔记本电脑上。这台机器是配备128GB内存的M5 Max MacBook Pro,模型的专家权重约1.45TB,远超内存容量,因此权重根本没有常驻内存,而是在推理过程中从磁盘持续流式读入。项目作者在评论区主动把前提条件和局限一次讲清,这种坦白反而让实测数据更具参考价值。

一层16个专家,每次读16个17.5MB文件

实现方式在工程上颇为朴素。专家权重被切分为一个文件对应一个(层,专家)组合,单文件17.5MB,保持Kimi官方发布的MXFP4精度不做二次量化;每一层有896个专家,实际推理时只需读取其中16个。读取走的是pread配合F_NOCACHE,绕过系统缓存直接命中磁盘。常驻内存的只有约50GB的注意力主干,这部分被量化为int8,作者明确标注这一项按上游定义属于非权重精确。存储侧是三台雷雳5硬盘盒加机器内置SSD,共四块盘并行供数。

性能数据分两面看。稳定输出速度在512token长度下为每秒1.00个token,128token时为1.13个,开关草稿模型对给定磁盘布局下的输出结果是token级一致的。真正难看的是首token时间:512token的提示需要大约6.3分钟才能吐出第一个字。作者把原因归结为预填充阶段的读取放大——为一个1.4TB的模型实际读了约9TB数据,属于调度缺陷,修复方案已在计划中。

盘数与吞吐并非线性关系

项目给出的多盘扩展曲线是这份工作最有价值的部分:一块盘约为四块盘性能的52%,两块盘约73%,三块盘约90%。收益逐盘递减的原因在于作者所称的屏障模型——某一层必须等到16次读取中最慢的那一次完成才能推进,因此瓶颈由尾部延迟而非平均带宽决定。这个结论与平台无关,作者指出上游引擎已有支持专家流式读取的CUDA路径,同样的屏障效应会在N卡方案上复现,差别在于50GB的常驻主干在苹果统一内存里可以自然容纳,而独立显卡需要塞进显存或一并流式读取。

评论区最先出现的是实用性质疑,有人算了一笔账:作者那条数字密集的说明本身接近一千个token,按每秒一个token的速度需要将近17分钟才能生成完。作者的回应把使用场景讲得很具体——这套配置不是给聊天用的,而是给无人值守的定时任务:他每天、每周、每月末用它跑账目复核,让模型逐项核对数字、标出无法对账的部分并起草报告。另一名开发者补充了同类实践,每天早上花30到40分钟自动生成报告,转成PDF后推送到Telegram。

本地跑满血模型的现实意义

支持这类实验的声音同样集中。有人指出Hacker News的传统本就是欣赏那些为了验证可行性而做的粗糙尝试,神经网络自己也曾长期处在有趣但没用的评价区间。更实质的论据在于选择权:能在本地跑的是完整的2.8万亿参数模型而非裁剪版,且数据完全不出本机,对财务复核这类涉密任务而言,速度慢是可接受的代价。

技术趋势层面,评论中提到近期开源模型正在系统性地降低对显存的依赖,例如有模型自带可直接从SSD或内存读取的大型查找表,4bit量化后约60GB即可加载。推理过程对存储只有读取没有写入,理论上可以把所有可用带宽都吃满。deltafin的价值不在于当下的每秒一个token,而在于它把瓶颈量化成了可优化的具体数字:尾部读延迟、预填充读取放大、常驻主干体积。这三项各自都有明确的改进路径,而它们决定了消费级硬件与万亿参数模型之间那道门槛还能被削掉多少。