推理基础设施迎来两条大线索。KernelFlume 将 LLM 推理节点解耦为权重节点(Projection/FFN)与无权重注意力节点(KV 分区),不复制全量权重即可弹性扩缩注意力容量,H100 实测降本 61%,接入廉价异构硬件后最高可省 80-85%。vLLM v0.24.0 同步落地(571 commits,256 贡献者),DeepSeek-V4 获 TTFT/吞吐双优化,MRv2 支持量化模型,新增 DiffusionGemma 和 MiniMax-M3。
具身感知出现关键数据点:TacGen 证明单靠扩视觉容量对触觉相关任务收益仅 4.5%,V+T 对比对齐使 TACTO 操控成功率从 0.246 跃至 0.979,且可用纯视觉输入合成触觉 latent 跳过传感器依赖。DeepSeek V4 同日并入 llama.cpp,双模式压缩注意力(CSA/HCA)在 DGX Spark 上 IQ2_XXS 量化达 148 tok/s 预填充、6 tok/s 生成。
商业层:Chatbot Arena 商业化 8 个月 ARR 过亿美元(1 月时 3000 万),估值 17 亿,AI 评测正在成为独立商业层。安全层:Mozilla 0DIN 演示 DNS 运行时载荷攻击——恶意代码不落仓库,Claude Code 因自动执行安装脚本被拿走完整 Shell 权限。
类别 全部 🏗️ 基建 4 🧠 模型 4 🦾 具身 3 💰 商业 3 ⚡ 推理 1 🛡️ 安全 1 🤖 智能体 1 🔧 工具 1
来源 全部 arxiv-cs-dc 3 arxiv-cs-ro 3 techcrunch-ai 3 the-decoder 2 gh-vllm 1 reddit-localllama 1 mcp-registry 1 x-_akhaliq 1 claude-code-releases 1 nvidia-blog 1 reddit-machinelearning 1
日报18
1
🏗️ 基建
想让长上下文 agent 跑得更快,过去的扩容办法很笨:要给注意力加算力,就得把整份模型权重再复制一份,哪怕你真正缺的只是放 KV 缓存的地方。问题恰恰在这里——agent 对话越长,KV 缓存随上下文线性膨胀、把显存吃满,可它跟固定不变的权重计算本是两码事。新的 arXiv 论文 KernelFlume 把推理节点拆成两类:一类只算权重(Projection 和 FFN 核),另一类不带权重、专门持有 KV 分区做注意力,两边经 UCX 端点通信,路由切换压在 token 边界内、不额外加延迟。于是注意力容量能按每个请求的状态单独弹性伸缩,不必再陪复制全套权重。对做长对话 agent 的人来说,显存终于能花在刀刃上。不过它只在 Llama-3.1-8B 上验证了动态负载,更大模型是否一样省还没答案。
2
🦾 具身
让机器人去拧瓶盖、把零件插进孔里,光靠摄像头常差最后一口气:接触到没有、有没有打滑,光看看不出来。TacGen 盯的就是这个缺口。研究者在一个叫 TACTO 的触觉仿真测试台上发现,单把视觉编码器做大、容量往上堆,操控成功率的差距也只能填平 4.5%,剩下的怎么扩视觉都补不回来。换个思路:用对比学习把视觉和触觉两路信号拉到同一特征空间对齐(骨干用 DINOv2),成功率从 0.246 拉到 0.979,剩余 95.5% 几乎补满。对做抓取、装配这类接触密集任务的人来说,触觉不是锦上添花,而是表征里省不掉的一维。实用的一步是用残差 MLP 把 RGB 特征投进触觉空间,推理时不装真触觉传感器也能用。只是这些都还没上真机验证。
3
⚡ 推理
如果你正用 vLLM 跑 DeepSeek-V4,v0.24.0 值得升一下。vLLM 是眼下主流的开源推理框架,很多公司的推理服务就架在它上面;官方称这是本季度改动最大的一版,571 个 commit、256 位贡献者。给 V4 的优化有三处:稀疏索引加了缓存,把首 token 延迟(TTFT,从发请求到吐出第一个字)压低 2-4%;处理输入的预填充阶段(prefill)改了分块,端到端吞吐涨约 4%;还有一个让多卡协同挑候选的 topK 计算核——都是个位数、且只对 V4 生效。另一条更普适:Model Runner V2 正式支持量化模型并默认开启,量化就是把模型压到低精度换显存,以前得手动配、现在开箱即用,显存吃紧的人值得顺手看一眼。
4
💰 商业
一个起家于学术圈、免费给大模型排座次的榜单,凭什么估到 17 亿美元?答案是 Chatbot Arena(原 LMSYS)——就是那个让人类盲投票、两两对比挑出更强模型的天梯榜,几乎每次新模型发布都拿它的名次说事。它把全行业的信任变现:2025 年 9 月推出商业服务,按消费量向模型开发商和企业卖 AI Evaluations(模型评测),底气是积累的超过 100 万条真实人类投票。增长不算慢,年化经常性收入(ARR)从今年 1 月的 3000 万美元涨到今天的 1 亿;资本端累计融资 2.5 亿,单是 A 轮就拿了 1.5 亿。值得注意的是,一个靠'中立'立身的榜单一旦开始向被评测方收钱,它的公信力还撑不撑得住,才是这门生意比数字更难回答的问题。
5
🛡️ 安全
你让 Claude Code 跑通一个仓库,它装依赖时报错,于是自己读报错、自动执行修复脚本,几秒后你的机器就被陌生人拿到了命令行控制权。这是 Mozilla 0DIN 红队近期演示的攻击链,目前还是概念验证,不是已在野爆发的事故。要命的是恶意代码从头到尾没落进任何文件:安装脚本一执行,它通过 DNS 记录实时从外部拉取载荷,随即建立反向 shell,也就是攻击者反向连回你的机器、握住完整 shell 权限和凭证。文件里始终干净,靠读文件内容的静态扫描器和 AI 代码审查于是全都查不到。对习惯让 agent 自动装包、自动跑脚本的开发者,真正棘手的是整条链没有哪一环看着像攻击。
6
🧠 模型
一台叫 DGX Spark 的桌面级 AI 设备(NVIDIA GB10)上,DeepSeek V4 已经能本地跑起来了。让它成立的是 llama.cpp,目前最广用的本地推理项目,能让大模型在个人电脑甚至 Mac 上落地;6 月 29 日它的主线合并了 V4 的 Flash 和 Pro 两个变体,以后用 llama.cpp 的人能直接拉来跑。V4 难本地跑,难在长上下文太吃显存,它的办法是把注意力做两层压缩:CSA 每 4 个 token 压成 1、只保留 8 个 token 的滑动窗口,HCA 压得更狠,压缩比高达 128 比 1,显存压力随之降下来。对想在自己机器上跑前沿模型、又被显存卡住的人,这是个能上手的信号。不过目前只是跑通,实际精度和长文本下的稳定性还得等更多实测。
7
🦾 具身
想让机器人学会倒水、把杯子挂上杯架,常规做法是在那台机器人上遥操作采几百条演示,换台结构不同的就得重来;拿人做事的视频直接教又隔着一层,人手和机械爪长得不一样,照搬会走样。Human2Any 换了个思路:不去记"手怎么动",只从人类视频里提取物体之间的互动规律,比如杯子倒水时的相对角度,这层本就跟谁在操作无关;换到具体机器人身上,再交给它自己算"这条手臂够不够得着、这东西抓不抓得住",两部分拼起来才生成动作。靠这个拆分,同一套先验在没采过目标机器人任何演示的前提下,既跑通了 Franka 桌面机械臂的几类倒水挂杯活,也迁到了会移动的 RBY-1 人形机器人上。对被"换个本体就得重采数据"拖累的模仿学习者,这方向很省事。只是论文没给成功率和基线对比,验证任务也寥寥几个,更杂乱的场景是否还稳,暂时无从判断。
8
🦾 具身
现在能"看图、听指令、直接动手"的机器人模型 VLA,有个尴尬短板:它继承了大视觉语言模型的看和推理,却几乎感觉不到手上使了多大劲——拧瓶盖、插插头这类活儿,摄像头看不出有没有打滑、夹得紧不紧。TAP-VLA 不给模型加触觉模块,而是把触觉画进它本来就在看的画面里:用带摄像头的触觉传感器测出接触面往哪个方向在滑,再把这些力换成一支支箭头,叠在机器人的 RGB 视角上。触觉于是以"图里多出来的箭头"这种模型早认识的形式进入,不改网络结构,也不用另攒稀缺的触觉数据。四个精细接触任务上,它成功率做到 78%,只用视觉微调的版本不到 50%,另一些把触觉硬拼进模型的做法在部分任务上和瞎猜差不多。对做机器人操作、又不想为触觉从头训大模型的人,好处是复用了现成的视觉语言底子;只是眼下只有四个任务,更杂的场景稳不稳还得看。
9
🏗️ 基建
把 DeepSeek-R1 这种 6710 亿参数的模型跑起来,单卡根本装不下,得切开摊到多张卡甚至几台机器上。它是"混合专家"结构:每层塞着一大批专家子网络,一个词只激活其中几个,用到谁事先不知道,推理时就得频繁把对应专家的权重跨设备搬过来,最慢那台一拖,整体就慢下来。问题是有些专家对结果几乎没贡献,占的内存和搬运带宽却和关键专家一样多,纯属陪跑。CAEE 先用一套轻量成本模型把这些"低贡献又高开销"的专家挑出来剪掉,再配一个不额外搬数据的补偿机制,把它们那点贡献近似补回,在 R1 671B 上端到端延迟降 8% 到 18%,精度掉不到 1%。对只能靠多机拼一个满血大模型对外服务的团队,这是省调度成本的软优化,不用换硬件。不过论文只报了延迟和精度两个数,哪种设备组合省得最多,还得照自己的部署实测。
10
🏗️ 基建
把大模型推理拆着跑,如今是不少生产系统的默认做法:处理你输入那段提示词的 prefill 阶段吃的是算力,逐字往外蹦回答的 decode 阶段吃的是显存带宽,两者需求相反,于是分到不同机器、配不同硬件。这篇论文更像给这套拆分画一张设计地图,把纠缠在一起的决策拆成四条轴——用什么加速器、算成几位精度、机器间怎么互联、那份叫 KV 的中间缓存归谁存。核心结论有点反直觉:精度不该全系统一刀切,而要按角色分开定,因为同一种低位格式在 prefill 和 decode 两边缓解的瓶颈根本不是一回事,这边省算力、那边省带宽。对正在攒推理集群、纠结要不要整机统一量化的工程团队来说,这给了个"分而治之"的判断框架。不过全文基于工业部署观察和源码走读得出,没有配套跑分,具体能提速多少得自己上手量。
11
🤖 智能体
给 AI agent 装的技能一多就有个隐形开销:每个技能的说明都得先塞进模型上下文,还没干活就烧掉一批 token,也挤占了本就有限的窗口。刚上架官方 MCP 注册表(Anthropic 牵头的 agent 工具接口标准)的 DejaVu 想绕开这步,把技能目录下到本地,用它自称的亚毫秒级本地检索先挑出该用哪个,只有选中的那个才真正加载,官方叫它零 token 发现开销。据其说明,定价每月 6.67 美元不限量,投稿技能的人分七成。对天天给 Claude、Cursor 配一堆工具、又被上下文和账单卡着的人,这是个新选项。不过它自称"首个技能市场层抽象"站不太住:同类市场今年已冒出好几家,DejaVu 的目录和服务端还都闭源、技能库都没填满,仓库目前还打不开,背后是家给牙医、水管工做竞品监控的小 SaaS。
12
💰 商业
用大白话就能生成整个应用、不用手写代码的平台 Base44,正做一件同行还没做的事:自己训练底层大模型。这类"vibe coding"公司过去清一色租 OpenAI、Anthropic 的顶级模型来跑,最核心的能力握在别人手上,护城河一直被市场追问。它的新模型 Base1 用平台上"数千万次真实用户交互"训练,把延迟、成本、效率攥回手里,创始人说目标是让它最终比 Claude Opus 这类通用模型更快、更便宜。底气来自增长:去年 6 月被 Wix 以 8000 万美元收购时才成立半年、8 个人,如今年化收入已过 1.5 亿美元。对同样靠调别人 API 起家的 AI 创业者,这是"自建模型换长期壁垒"的公开押注。不过 Base1 能否真追平顶级模型还没数据,而且它仍落后于年化 5 亿美元的对手 Lovable。
13
💰 商业
做 AI 代码编辑器的 Cursor(母公司 Anysphere)出了个手机 App,用途窄却实在。如今的 AI 编程助手早不只是补全,而是能自己在后台跑完一整个任务(改 bug、写模块),一跑几分钟甚至更久,人只偶尔看一眼、给个方向。可这类"后台 agent"过去只能守在电脑前盯,这 App 就把它搬上手机:既能直接派新任务,也能接手桌面端起的 agent,随时纠偏、按停或放行,但不让你在小屏上写代码,只当监工。它算是主流代码编辑器里第一个专门为此做界面的,但方向不孤单:Anthropic、OpenAI 早给自家编程工具做了手机入口。对习惯把活儿丢给 agent、自己去开会或通勤的人,这补上了"人不在电脑前那几小时"的盲区。至于手机上瞄一眼够不够看住一个自主 agent,还得用起来才知道。
14
🧠 模型
美国政府新设的设计机构 National Design Studio 把一个叫 Rampart 的小工具开源到模型托管平台 Hugging Face,白宫 AI 政策负责人转发称,这是美国政府发布的第一个模型。它做的事很实在:你把文字发给云端大模型之前,先在自己浏览器里跑一遍,把姓名、电话、社保号、信用卡号挑出来换成 [人名1] 这样的占位符,敏感信息压根不出本机。模型只有 14.7MB、约 1850 万参数,处理一句话在 CPU 上 6.6 毫秒,快到无感;覆盖英语到荷兰语等 7 种拉丁字母语言、17 类实体,私密词召回率 98.42%。对天天往 ChatGPT 粘公司文档又怕泄密的人,这是块能嵌进网页、不靠服务器的现成挡板。只是它对非拉丁名字召回仅 14%,中日韩、阿拉伯名字基本挡不住,也能被零宽字符绕过。
15
🧠 模型
Meta 给内部工程师下禁令:不许用 Claude Code 和 Codex 两款 AI 编程助手。理由不是怕泄密,而是怕自家在做的编程模型 MetaCode 被'喂'进对手的东西。蒸馏就是拿一个模型的输出去训练另一个,等于隔着接口偷学对方本事;工程师用 Claude 生成的代码一旦混进 MetaCode 训练数据,Meta 就踩了 Anthropic、OpenAI 服务条款里'不得用我们的输出造竞品'那条线。内部备忘录措辞很重,称这可能引发与合作方的'严重升级'。这不是个案:Anthropic 指控阿里巴巴搞了已知规模最大的一次蒸馏,马斯克四月也承认 xAI 部分蒸馏过 OpenAI。对既用 AI 写代码、又自研模型的公司来说,真正麻烦的是这条边界几乎无法监管:代码一旦进训练管线,谁也说不清哪段是'学'来的。
16
🔧 工具
Claude Code 2.1.196 混在一长串修复里,有条安全补丁值得单拎:洞在 claude mcp list、get 这种"看看装了啥"的只读命令上。它靠 MCP 协议接外部工具,每接一个能力就在你机器上跑起一个叫 server 的小程序,而装了哪些、谁批过,都写进随仓库一起提交的配置里。过去这俩命令为列状态会逐个启动 server,于是不可信仓库只要在自带配置里替声明的 server 提前盖章,你 clone 下来敲句 list,别人埋的程序就跑起来了——看一眼等于执行。新版把它断开:列举不再启动 server,不可信目录标成"⏸ 待批准"。对习惯 clone 陌生仓库顺手开 Claude Code 的人,"只读命令会执行代码"这盲区最该记一笔。同版还捎带组织默认模型、可读会话名、可点击附件几处改动。
17
🏗️ 基建
Anthropic 的 Claude 模型现在可以直接在微软 Azure 的 Foundry 平台上部署,底层跑在英伟达 GB300 Blackwell Ultra 上,这是当前最新一代的数据中心 AI 芯片,用的是 72 块 GPU 连成一个机柜、对外当一台机器使的 NVL72 配置。所谓“正式可用”,是从小范围预览转成所有付费企业都能开通。看点在参与方的组合:Claude 是 OpenAI 的直接竞品,而微软又是 OpenAI 最大的出资方,如今对手的旗舰模型就跑在微软自家云上、配英伟达最新的卡。对那些想给业务搭自动化 agent、又只认最强模型加最新硬件的企业来说,这条路现在通了。不过通稿只给了“可用”两个字,跑分、延迟和价格一个数字都没放,真值不值还得等实测。
18
🧠 模型
Cerebras 的推理 API 排队现在基本排到没头,原因是 OpenAI 一纸约 200 亿美元的大单把它未来几年的产能几乎包圆了。Cerebras 靠一整块晶圆那么大的芯片做推理,卖点就是快:同一个开源模型在它这儿吐字能冲到每秒一两千个 token,是普通 GPU 推理的好几倍,专门服务要求即时响应的实时应用。而 OpenAI 签的合同覆盖 750 兆瓦算力、一路锁到 2028 年,等于把货架先搬空,散客的排队号因此变得遥遥无期。对那些本来就冲着这份速度、指望稳定拿到每秒一两千 token 的初创团队来说,这条路暂时走不通,要么退回更慢的方案,要么另找供应商。值得注意的是,这目前还是社区里的说法,Cerebras 没公开承认小客户被挤出,产能会不会随着数据中心扩建缓过来,也还没有答案。