Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

v0.24.0

vLLM 发布了 v0.24.0,官方称是本季度改动最大的社区版本,攒了 571 个 commit、256 位贡献者,其中 77 个是头回参与的新面孔。对多数使用者来说,这一版真正值得看的有两块:一批冲着 DeepSeek-V4 的性能优化,和一处影响面更广、平时容易被划过去的默认值改动。 先说 vLLM 是什么。你想把一个大模型架在服务器上、对外稳定地接请求,就得有一层专门管批处理、显存和调度的软件,vLLM 就是眼下用得最多的那一类开源推理框架,不少公司的推理服务底座就是它。所以它每动一次,牵连的不是某一家,而是一大片跟着它跑生产的人。 这一版围着 DeepSeek-V4 做了几处优化,单看都挺热闹。模型吐出第一个字之前那段等待,业内叫首 token 延迟(TTFT),新上的 FlashInfer 稀疏索引缓存把它压下去 2% 到 4%,体感上就是回应快那么一丁点;模型读完你那段输入的预填充阶段(prefill)改成分块来排,端到端吞吐加约 4%;另外还有一个让整个集群协同去算 topK(每步从词表里挑出概率最高的若干候选)的计算内核。问题是,这些数字都停在个位数,而且主要冲着 V4 这一个模型,换个模型基本沾不上。 真正改变面更宽的是另一条:Model Runner V2 这一版正式支持量化模型,而且默认就开着。量化说白了是把模型从高精度压到低精度跑,精度上让一点,显存占用跟着降下来——一张原本塞不下的卡,压完可能就够了。这件事以前不是不能做,而是得自己找开关、配参数,踩不少坑;现在它变成了开箱即用的默认行为。 把一个过去要老手手动折腾的优化,设成所有人拿到就生效的默认,这个动作本身比那几个百分点更有信号意义。它等于框架把“低精度部署”从专家才碰的选项,挪进了基础设施的标配层。对一个被大量生产环境当底座的项目来说,默认值往哪边倒,往往就决定了大多数人实际怎么跑模型,因为多数人根本不会去改默认。 所以这次升级的看点是分层的:盯着 DeepSeek-V4 的人,拿到的是几处个位数的提速,顺手而已;而显存一直不够、早想跑量化版却嫌配置麻烦的人,这一版才算真正帮上忙。需要留神的是,默认开启也意味着把更多判断交给了框架的默认配置,真要上生产,自己那套模型在量化下到底掉不掉点、长文本里稳不稳,还是得先测一遍再信。