Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

2026-06-23 · 周二

今天是研究密集的一天,最集中的两条线一是 agent 编排,二是推理系统的效率与可靠性。Sakana 放出 Fugu 系列编排者模型,把临场设计多模型协作方案训练成模型自身的能力;Ai2 联合华盛顿大学开源 TMax,给出训练终端 agent 的完整强化学习配方与一个 9B 模型,连权重、数据和训练 rollout 一并摊开。 推理与系统层面扎堆出新:Keyless Attention 直接删掉 key 投影、把 KV cache 精确砍半且质量基本不掉;HEAL 定位并缓解 16-bit 推理跨 GPU 不可复现的根因;另有自适应 KV 缓存(命中率最高 +10.8%)、面向实时语音的 LiveServe 与面向 MoE 的解耦异步服务 ASAP。 安全与对齐同样热闹:分级语言模型(TLM)想让一套开源权重按密钥分出公开与私有两档能力;SpliceLeak 揭出非前缀 KV 缓存融合的侧信道风险;另有针对 agent 工具调用的防护工作。 具身与产品侧,阿里 Vesta 主打通用具身推理,配合 VLA 解耦与机器人自我改进等论文;网易有道开源 Confucius4-TTS,1.3B、Apache 协议,主打 14 语种零参考文本的跨语种声音克隆。

级别
视角
类别
来源
日报20
1
🧠模型

Sakana Fugu Technical Report

Sakana 发布了 Fugu 系列「编排者」模型,思路是把不同厂商各有所长的大模型拼成一个更强的整体。和直接做一个全能模型不同,Fugu 本身是被训练出来读懂用户问题、再临场设计出一套智能体脚手架(agentic scaffold)的语言模型——它决定调哪些 LLM、怎么组队协作,从而拿到超过任何单个模型的表现。团队放出两个版本:Fugu 兼顾性能与延迟、面向日常使用,Fugu-Ultra 则在最难的问题上优先答案质量。论文称在 SWE-Bench Pro、Terminal Bench、LiveCodeBench、GPQA-Diamond、Humanity's Last Exam、CharXiv Reasoning 一系列硬基准上,相对其他可公开获取的模型达到 SOTA;训练涵盖大规模微调、进化算法与强化学习。值得注意的是,技术报告摘要并未给出任何具体分数,孰强孰弱还得等完整数据与第三方复现。
2
🤖智能体

Ai2/UW TMax: 开源 RL 终端 agent 配方与 Qwen3.5-9B 终端 agent

Ai2 联合华盛顿大学放出了 TMax,一套训练终端 agent 的开源强化学习配方,连带一个基于 Qwen3.5 的 9B 终端 agent。所谓终端 agent,就是能在命令行里自己敲命令、跑脚本、读报错、改文件来完成任务的模型。他们用一种叫 DPPO 的强化学习算法,在 OpenThoughts 的 TMax-15k 数据上训练,该数据集含 14600 个可交互的 RL 环境。结果上,TMax-9B 在 Terminal Bench 2.0 拿到 27.2%,是 10B 以下最强的开源权重模型,并逼近闭源的 Claude Haiku 4.5(29.8%);在更轻量的 Terminal Bench Lite 上达到 53.0%,领跑作者自己的各项消融。比模型本身更值得看的是它把权重、数据乃至训练过程中的 RL rollout 全部开放,相当于把一条从零做终端 agent 的可复现路径摆上了桌面。
3
📦产品

网易有道开源 Confucius4-TTS:14 语种零参考文本跨语种语音克隆(1.3B,Apache)

网易有道把"子曰4.0"体系里的语音合成引擎 Confucius4-TTS 开源了,1.3B 参数、Apache 协议、完整 54G 权重可本地离线部署、商用无限制。它最受关注的卖点是跨语种零样本声音克隆:你上传一段中文音频,模型就能用同一音色流利说出日语、英语等共 14 种语言(中、英、日、韩、德、法、西、印尼、意、泰、葡、俄、马来、越南),且声称不依赖参考文本即可完成,号称全球首个做到这点。官方自报数据是 3 秒极速克隆、与原声相似度超过 85%、克隆任务准确度 97%,并支持从参考音频里提取情感标签做语调韵律的跨语种迁移。对做数字人、跨境内容、智能教育的团队,这是一个可以下载到本地、不受 API 约束的国产开源选项,值得关注它跨语种发音是否真如宣传般地道。
4
🎛️后训练

Keyless Attention: Value-Space Routing and Value-Only Caching

长上下文推理最贵的一笔账是 KV cache:每个 token 都要存下 key 和 value 两份缓存,显存和访存随上下文线性膨胀。这篇 Keyless Attention 的做法很直接——把 key 投影整个删掉,注意力只在 query 和 value 上运算,于是缓存里只剩 value 一份,KV cache 的显存和访存开销精确减半 50%,而解码吞吐与标准注意力持平甚至更快。作者把它放进一个统一视角:标准注意力是注意力双线性形式的"深度 2"分解,Keyless 则是同一族里的"深度 m"实例,在 m=3 时用一个值空间路由矩阵替掉原来的 key 投影,让投影矩阵数量和标准注意力一样多。在 GPT-2 280M、GPT-2 557M、Pythia 410M、Qwen2 1.5B、Llama 3.2 1B 这 5 个模型、4 种架构上,困惑度有 4 个模型持平或更优;GPT-2 557M 的下游零样本测试在 5 个常识推理基准里赢了 4 个。一句话:少存一半缓存,质量基本没掉。
5
🦾具身

Vesta: A Generalist Embodied Reasoning Model

机器人要在开放环境里干活,通常得把定位、空间推理、导航、长程规划交给一串各管一段的专家模型拼起来,算力贵不说,一个环节出错还会沿着链条层层放大。Vesta 走的是另一条路:把这些能力全部塞进一个统一的具身基座模型里。它靠两样东西支撑——一套规模庞大、专门为培养空间感而整理的多模态语料,以及一个简单的多模态记忆机制,让模型能在很长的时间跨度上把前后信息串起来推理。效果上,Vesta 在多个基准上平均超过各项单任务 SOTA 专家模型 20% 以上,甚至比"每个子任务都挑最强专家"拼成的集成还高 10% 以上;在那些需要记忆和推理的真实机器人任务上,任务成功率提升超过 35%。一个通才打赢一群专才,这正是它值得看的地方:单一模型不只是可行的省事方案,可能本来就是更好的方案。
6
🛡️安全

Toward Open Weight Models Without Risks: Separating Public and Private Capabilities in LLMs

开源权重模型让科研和部署都受益,但有个绕不开的矛盾:权重一旦公开,就很难再控制谁能用到其中的敏感能力。现在的两条路都别扭——发布前把危险能力压掉,既挡不住越狱、又为了防少数人牺牲了所有人的能力;改用闭源服务加监控和 API 权限,又和开源本身冲突。这篇提出分级语言模型(Tiered Language Models, TLM):同一套发布出去的权重,支持多个能力档位。默认公开配置下它就是个普通 LLM;而一把紧凑的密钥会指定对一小撮参数的置换,在同一份权重上诱导出另一张计算图,解锁额外能力。训练上是从零同时预训练公开与带密钥两套配置,再用私有数据微调带密钥那套、并加正则保持公开行为不变。摘要未给出两档之间的具体能力差异数字。
7
🛡️安全

Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning

当你的 agent 接入一堆外部工具时,攻击面就不止 prompt injection 了。这篇论文盯上一种叫"跨工具描述投毒"的新威胁:攻击者篡改某个工具的描述(也就是规划器能看到的工具元数据),就能把 agent 的执行轨迹带偏——哪怕被投毒的那个工具自始至终都没被真正调用。作者先验证现有的 prompt-injection 防御搬过来基本失效,原因在于被投毒的描述会一直留在规划上下文里、跨多个步骤持续施加影响。据此他们提出 Tool-Guard,核心是一种叫"隔离式规划"的系统级机制:一旦某个工具调用被判定为偏离意图或可疑,就把它丢进一个隔离列表,切断它对后续工具选择的继续影响,同时这个工具仍能被用来支撑任务、不至于直接废掉。原文摘要在此处截断,未给出具体的检出率或防御成功率数字。
8
🛡️安全

Agent-Assisted Side-Channel Attacks on Non-Prefix KV Cache in RAG

为了让长上下文、多租户推理更快,现在的大模型服务普遍用 RAG 加非前缀 KV cache 融合——把不同请求里能复用的缓存块拼起来。这篇指出,正是这种拼接埋了隐患。过去的 KV 缓存侧信道攻击要求严格的线性前缀对齐,碰到 RAG 里每个用户各带私有前缀就失效了;而作者发现,按 chunk 调度内存、对齐融合不相邻缓存块的那套确定性微架构机制,会泄露一段连续的 Step-Wave 时序信号。据此他们做出 SpliceLeak,号称首个针对非前缀 KV cache 融合的端到端侧信道攻击:先把隐藏私有 prompt 的确切长度指纹化,再通过制造边界碰撞逐 token 还原出语义内容,并在生产级的 vLLM + LMCache 组合上做了验证。摘要未给出具体的内容提取准确率。
9
🎛️后训练

Test-Time Training with Next-Token Prediction (TTT-NTP)

语言模型训练靠的是"预测下一个 token"这个自监督信号,而推理时你喂进去的每个 prompt token 其实也携带着同样的信号——TTT-NTP 这篇工作就是问:能不能把这个信号直接拿来当"测试时训练"的内循环目标,让已经发布的长上下文模型在读 prompt 的当下顺手微调一下自己。它是一种 drop-in 的快权重(fast-weight)自适应方法,监督目标用的是模型自身"下一个上下文隐藏状态",每次写入存的是对那个下一位置上下文状态的逐点线性投影,因此和支撑下一 token 预测的那条因果计算路径对齐。最大的卖点是不用重新设计 backbone,能直接套到现成的预训练 checkpoint 上。论文在 Llama-3.1-8B、Mistral-7B、Qwen3-4B/0.6B 上做了验证:RULER 长上下文平均有几个点的提升,LongBench-v2 真实长文 QA 上 Llama 提升约 5.6,同时常识与知识能力基本不掉。对想给已部署长上下文模型免重训提一手长文能力的人,这是个低门槛的思路。
10
推理

LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs

实时语音对话模型现在能让用户边说边听、随时打断,但底层的推理服务系统还在沿用为吞吐量设计的老调度和 LRU 缓存策略,对"用户实际听到了哪里、什么时候打断"一无所知,结果是大量算力浪费在用户根本没听到的 token 上,下一轮要用的缓存也被提前清掉。LiveServe 这篇工作把音频播放进度、说话活动、打断(barge-in)这些交互事件直接暴露给服务流水线:调度器优先处理首段音频和快播完的会话、并限制超出播放前沿的生成,KV 管理器改用按"下次使用时机"决定淘汰、并在用户说话时预加载下一轮可能要用的缓存。在 vLLM-Omni 上对两个 Omni-LM 与混合负载实测,P90 音频首包时延平均降到 1/1.55(最高 2.21 倍),完成请求吞吐量平均提升 1.15 倍(最高 1.56 倍)。对做实时语音 serving 的团队,这是把"交互语义"接进推理调度的一个实在切口。
11
🏗️基建

ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill

大模型用 MoE 架构省算力,但上线服务时碰到一个老大难:现在主流做法是注意力层用数据并行(DP)、专家层用专家并行(EP)混在一起跑,这就要求两类阶段之间频繁做全局同步。在线请求的到达速率和序列长度本来就忽高忽低,同步点一卡,整条流水线就跟着停摆,首 token 延迟(TTFT)和吞吐都被拖累。来自华为方向的 ASAP 把注意力阶段和 MoE 阶段拆开(disaggregate),做成完全异步的执行流水线,靠一套异步通信原语加上调度与执行层面的四项协同优化,把这些全局同步屏障拆掉。论文专门针对 prefill(预填充,即处理完整输入提示的阶段)做优化,在昇腾 CloudMatrix384 超节点上验证,相比此前最好的同步服务方案,满足 SLO 的 prefill 吞吐提升约 90%。
12
🧠模型

Demystifying Numerical Instability in LLM Inference (HEAL)

大模型进了金融、医疗、法律这种关键场景后,同样输入每次输出都一样成了硬要求。大家用贪心解码消掉算法上的随机性,可现实里只要用 16-bit 精度,换一块不同型号的 GPU,输出还是会大幅跑偏。这篇用 SASS 级的底层 profiling 把根因挖了出来:问题出在 kernel 边界做精度下采样(downcast)时引入的截断误差。想靠全程 FP32 来保复现又太贵——绕开 16-bit 加速硬件拖慢算力,把 KV cache 也升到高精度则显存直接翻倍。于是他们提出 HEAL:识别到浮点格式对 Q/K/V 张量其实没用满位宽,改用 INT16 量化在不扩大 KV cache 的前提下稳住数值、逼近 FP32 的可复现性。摘要未给出具体的复现率提升数字。
13
🤖智能体

Darwin Mobile Agent: A Roadmap for Self-Evolution

手机 GUI 操作是个理想的强化学习训练场:环境复杂、状态无穷,但真要在上面大规模训 agent,卡点一直在数据采集——一台真机一次只能跑一条交互轨迹,慢且贵。Darwin Mobile Agent 是一套开源基础设施,把移动 GUI 当成比 agent 自身复杂得多的"大世界"代理,靠跨多个并行云手机实例的异步 agent-环境回路把采样吞吐量提上来,绕开这个瓶颈。作者顺着"苦涩的教训"思路,主张尽量移除人类先验、让能力从交互中自然涌现,并给出一份分阶段路线图,要在自演化 agent 的三根支柱——任务课程、结果验证、记忆管理上逐步去掉人工设计。这篇论文先验证了路线图的第一阶段也就是 GUI 域内策略优化的稳定性与可扩展性,是工程基座加方法蓝图,原文未给出具体基准分数。
14
🤖智能体

ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents

多步 agent 的强化学习长期卡在一个老问题上:标量奖励只能告诉模型这条轨迹成没成功,却说不清哪一步做对、哪一步做错。后来出现的 rubric 奖励用自然语言写评判标准,可解释性好了,但既有做法只在整条轨迹层面打分,而且把打分器固定成一个闭源裁判模型,结果步级的功劳分配仍然没解决、裁判本身也一成不变。ARCO 的思路是让一个同尺寸模型 μ 与策略共享主干并长出两个头:一个生成头逐步产出评判标准,一个打分头预测在这些标准下的步级奖励;再用一条轨迹分解约束把所有步级奖励之和绑回终局结果,于是不需要人工标注每一步就能做信用分配。μ 和策略在同策略数据上联合更新,让评判标准和打分函数在参数层面一起进化。作者在 HotpotQA、2WikiMultiHopQA、MuSiQue 三个多跳问答基准、两个开源底座上测,称每个设置的最佳 EM 都刷新了,超过 outcome、rubric、process 三类奖励基线。原文未给出具体 EM 数值。
15
📊评测

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

现在大家普遍用 LLM-as-a-judge(让一个模型去给另一个 agent 的多步轨迹打分、挑错)来替代人工评测,因为人工标一条 agent 轨迹动辄要几小时。但这些自动评判本身靠不靠谱,长期没人系统量过。Counsel 是首个面向 agentic 任务的元评测公开数据集:它收集开源 LLM 评判模型在 tau-bench(客服 agent)和 DA-Code(编码 agent)两个基准上对轨迹做的过程级批评,再请人类对这些批评做元评测——逐条针对被标出的错误判定属于"命中"、"位置对但理由差"还是"根本不该标"三类,标注者之间达到 Krippendorff's alpha 0.78 的可靠一致性。换句话说,它给"评判者本身有多准"提供了一份带人类标签的尺子,把自动批评按"错误位置是否对、给出的理由是否站得住"分层。对依赖 LLM 评判来做评测或筛训练数据的人,这是一个能用来校准、暴露自动评判盲区的基础资源。
16
🎛️后训练

Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior

多 LLM 协作系统(互相评审、辩论、当裁判)有没有用,前提是这些模型面对同样输入时真能产生可测量的行为差异。此前的离线研究给出的经验法则是"每个模型家族各选一个"来保证多样性,理由是模型给同家族的输出打分时会偏袒自家。这篇论文在真实部署用的交互式多模型场景里检验这条法则,结论相反:决定对话行为的是 post-training 配方,而不是模型家族。作者用一份 94 万条对话链、11 个 checkpoint 的语料,加上一份 160 万条链、同一 base 的 Llama 析因实验来验证。在他们选定的核心指标 hedging(措辞回避/留余地的倾向)上,一个经 reasoning 蒸馏的 Llama checkpoint,仅仅因为对话伙伴换成了同 base 的不同 checkpoint,hedging 就漂移 18%,这一幅度超过了受控子集里任何跨家族的 hedging 差距。换句话说,给多模型评审团选成员,光看家族标签是不够的。
17
🗂️数据

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

数据清洗一直是被动的:靠启发式规则或通用 VLM 给原始数据打标,又贵又机械,还挖不出数据里的深层流程逻辑。DataClaw0 把数据处理本身当成一种可学习的能力来训,提出"agentic data tailoring"——让模型主动按下游意图去精炼和重组多模态数据,而不是套一遍固定规则。它的 DataClaw0-9B 模型用 SFT 加 GRPO 训练,并设计了一条两阶段流水线:先做生成式语义合成,再把合成结果锚定到确定性的 Factual Anchors,以此压住自由生成容易跑偏的问题,产出覆盖五个物理与数字域的大规模数据集。团队还顺手建了 DataClaw0-val,自称是首个专门衡量数据精炼能力的基准。对做数据工程和 post-training 的人,这条提供了把"数据处理"显式优化成一种模型技能的思路,不过原文摘要未给出具体得分,实际效果还要看完整结果。
18
🦾具身

Decoupling Declarative from Procedural in VLA (w²VLA)

机器人领域有个老毛病:照着某个物体的示教学会的动作策略,换个没见过的物体往往就崩。研究者把这归因于现在主流的 VLA(视觉-语言-动作模型)没把两类知识分开——一类是"声明性知识",即概念和物体语义这种"是什么";另一类是"程序性知识",即"怎么做"。两者在参数里混成一团,导致策略对微小的空间、语义、任务变化都很脆弱,零样本迁移到新物体受限。这篇论文提出 w²VLA,重构了 VLA 的信息流来强行解耦这两类知识:不再像以往那样把 VLM 编码器吐出的全部多模态 token 一股脑塞进一个庞大不透明的动作专家,而是以组合化、可解释的方式,用视觉、空间和技能信息分别去调制机器人的状态序列。作者称这带来了对不相似、未见过物体的零样本技能迁移能力。需要说清的是,原文摘要没有给出统一的量化主指标,具体成功率和对比数字得看正文。
19
🦾具身

Robot Self-Improvement via Human-Video Dynamics Models (DGAC)

机器人怎么从自己的失败里变强,一直是具身学习的硬骨头:人类视频提供了海量"被动观察",但能否用它来评价、纠正、改进机器人自己的尝试,此前并不清楚。DGAC 给出一条路径——先从人类视频里学到一套跨本体通用的动作、动力学与价值表征,这些表征不绑定具体机器人,再用它们以免训练的方式把"失败状态"变成纠错监督:每次失败都成为一次查询,让学到的模型提出并排序可纠正的动作,把失败转化为下一轮策略更新的信号。作者在 7 个真实操作任务(含移动操作与定臂操作两种本体)上验证,让机器人能从自身 rollout 与失败中自主改进。免训练、跨本体、用人类视频当先验,是它区别于常规模仿学习的三个点;具体的统一成功率数字原文未在所给材料中给出。
20
推理

Recency/Frequency Adaptive KV Caching for Large Language Model Serving

KV 缓存是给大模型推理提速的关键,但线上请求又多又杂,缓存很难命中得好。现在主流的淘汰策略是 LRU(最近最少使用),问题在于多个互不相关的请求会互相把对方的缓存冲掉。这篇的做法是引入自适应缓存:在最近用到和高频用到的 KV 块之间动态分配缓存空间,而不是一刀切只看最近。评测显示,在合成的文档问答负载上,相比朴素 vLLM,KV 缓存命中率最高提升 10.8%、首 token 延迟(TTFT)最高降低 12.6%;在真实对话负载上则分别是 2.1% 和 2.0%。方法也能推广到批量推理,作者称结果具有清晰的可解释性,并能较好适配多样化负载。