Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

DeepSeek V4, PR merged into llama.cpp !

把要靠机房显卡才喂得饱的前沿模型,搬进一台摆在桌上的机器里,几个月前还更像一句愿望。6 月 29 日,DeepSeek V4 让这件事有了第一个能上手的版本。 想在自己电脑上跑大模型,过去卡住人的往往不是算力,而是显存不够。对话或文档一长,模型要随时记住的上下文越堆越多,这部分缓存随长度线性膨胀,很快就把一张消费级显卡撑爆。算得动一句话,却记不住一整篇,这正是端侧大模型反复碰壁的地方。 转机来自 llama.cpp。这是目前最广用的本地推理项目,正是它让大模型能在普通个人电脑甚至 Mac 上落地,是端侧这条路的事实标准。这次 V4 的两个变体 Flash 和 Pro 被合并进它的主线,意味着以后用 llama.cpp 的人不必自己改代码,直接拉下来就能跑 V4,而不再是只能看论文干着急。 V4 原本难塞进小机器,症结也在那份吃显存的注意力缓存上,它的解法是把注意力分两层往下压。第一层 CSA 是把注意力稀疏化,思路有点像做会议纪要:每 4 个 token 压成 1 个,只在最近 8 个 token 的范围里保留完整细节,更远的内容用压缩后的摘要顶上。第二层 HCA 压得更狠,压缩比高到 128 比 1,相当于把上百个 token 的内容压进一个槽位。两层叠下来,显存压力被实打实地削掉一大块,一份本来面向机房的模型才有机会跑在桌面设备上。 而且这不只是论文里的数字。已经有人把它跑在 DGX Spark 上——这是英伟达推的一台桌面级 AI 设备,搭载代号 GB10 的芯片,定位就是把数据中心级的推理能力缩到一个人能摆在工位上的体积。模型侧的压缩和硬件侧的小型化在这里第一次接上了头:一边把显存需求往下压,一边把可用算力往桌面推,两头相向而行,前沿模型的可及性门槛才真正开始松动。 不过现在能说的只是“跑通”,离“跑好”还有距离。压缩比拉到 128 比 1 必然要丢信息,模型在长文本下还稳不稳、精度掉多少,目前都没有成规模的实测数字摆出来。对一直被显存挡在前沿模型门外、又愿意自己折腾本地部署的人,这是个值得动手试一把的信号;但要不要把它放进真正干活的流程里,恐怕得等更多人把长文本那一关替你趟过之后,再下判断也不迟。