Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

2026-06-26 · 周五

非自回归路线今天集中发力:iLLaDA 把掩码扩散语言模型从零训练到 8B 规模,在 BBH、MATH、HumanEval 等多项基准上大幅甩开前代 LLaDA,第一次证明扩散范式能在 LLM 量级上和自回归正面竞争。 更激进的是 Un-0,干脆抛开神经网络,用一套模拟的 Kuramoto 耦合振荡器系统生成图像,322M 参数在 ImageNet 64×64 上做到 FID 6.74,解码器只占一成参数——如果方向成立,指向的是另一条计算硬件路径。 agent 与工程侧也有硬料:OpenAI 罕见地公开内部 Codex 使用量,自 2025 年 11 月以来 Research 方向输出 token 中位数涨了 56 倍、Engineering 涨 27 倍,coding agent 正从工具变成默认工作方式。 训练与安全方法层同样热闹:循环语言模型被指出存在隐状态'读出盲区',越狱研究依赖的自动 ASR 评判器被 596 条人工标注实测出严重不可靠,连维基百科上一小群志愿者的编辑都被证明能系统性地左右大模型的价值取向。

级别
视角
类别
来源
日报21
1
🧠模型

iLLaDA:8B 掩码扩散语言模型,从零训练的非自回归范式

iLLaDA 是首个从零训练到 8B 规模的掩码扩散语言模型(masked diffusion,一种用并行去噪取代逐 token 自回归生成的范式),全程用全双向注意力、坚持掩码扩散目标贯穿预训练和 SFT。它吃了 12 万亿 token 预训练加 250 亿指令微调 token,base 版相对前代 LLaDA 在 BBH 上 +21.6、ARC-Challenge +14.9,指令版在 MATH +14.5、HumanEval +16.5。权重和代码已在 GitHub 开源。这是扩散范式第一次在 LLM 量级上拿出能和自回归正面竞争的成绩单,对一直押注自回归的人是个需要重新评估的信号。
2
📦产品

Un-0:用耦合振荡器生成图像,不用神经网络的新范式

Un-0 干脆不用神经网络做图像生成——它用一套模拟的 Kuramoto 耦合振荡器系统(一组相互耦合、会自发同步的物理振子)替代 transformer/diffusion 骨架。322M 参数、16384 个振荡器,在 ImageNet 64×64 上做到 FID 6.74(衡量生成图像与真实分布距离的指标,越低越好),其中解码器只占约 12% 参数。模型权重、训练代码和消融实验全部开源。这是第一次用物理系统而非神经网络做出有竞争力的图像生成——如果方向能继续扩展,它指向的不只是一个新模型,而可能是一条不同于 GPU 的 AI 计算硬件路径。
3
🤖智能体

OpenAI 披露内部 Codex 使用量爆发:Research 56×、Engineering 27×

OpenAI 罕见地公开了自家组织内部的 Codex 使用数据:自 2025 年 11 月以来,内部 Codex 输出 token 中位数在 Research 方向涨了 56 倍、Customer Support 32 倍、Engineering 27 倍、Legal 13 倍。数据出自 OpenAI 经济研究报告《How Agents Are Transforming Work》,反映的是组织内部使用而非外部产品销量。这是头部实验室第一次公开自家 agent 采用的硬数据——56 倍的增长说明 coding agent 已经从'偶尔用一下的工具'变成了某些岗位的默认工作方式,对判断 agent 真实落地程度比任何厂商宣传都更有参考价值。
4
🎛️后训练

循环语言模型的'读出盲区':密集监督不够用

这篇指出循环语言模型(looped language models,把隐状态反复送回自身做多轮计算的架构)的一个根本盲点:训练时用的密集逐层交叉熵,只监督到'读出'(readout)暴露给预测的那部分变量,剩下大量隐状态完全不受控制,作者称之为'读出盲区'。后果很具体——标准训练下 44M 和 129M 参数的循环 transformer,隐状态范数会飙到数千甚至上万。他们提出 scale-visible 读出加范数惩罚的方案,在匹配推理深度下拿到更低困惑度。如果你在做循环 transformer 或权重共享模型,这篇说明标准密集监督看不到隐状态的失控,值得警惕。
5
🧠模型

你的越狱评判器可靠吗?596 条人工标注揭露自动 ASR 的校准与鲁棒性问题

几乎每篇越狱/提示注入论文都会报一个攻击成功率(ASR),而这个数字不是人打的,是自动评判器(一个安全分类器或被 prompt 来打分的聊天模型)给的——但这个评判器本身很少被检验。这篇就去检验了它:用 596 条 HarmBench 人工标注做对照,发现只要给有害文本套一层良性包装、不改实质内容,就能让 LLM 评判器在 57% 到 100% 的情况下翻转判定;不同评判器对同一条响应给出的 ASR 还差异巨大。这是对安全研究的元评估——如果评判尺子本身不可靠,所有基于 ASR 的攻击/防御对比都需要重新审视。
6
🧠模型

Small edits, large models: How Wikipedia advocacy shapes LLM values

一小群志愿者光靠编辑维基百科,就能系统性地改变主流大模型谈论某个话题的方式——这篇用动物福利做了实证。关键机制在于维基百科几乎进入了每一个主流模型的训练集,而且权重通常高于普通网络爬取文本。研究对象是一个叫 Pro-Animal Wikipedians(PAW)的倡导者群体,他们往相关词条里添加有据可查的动物福利内容,结果可以测量地影响了多个 LLM 在该话题上的表达倾向。这件事的意义远超动物福利本身:它揭示了训练数据上游存在一个低成本、可被有组织群体利用的价值观注入通道,对数据治理和模型对齐都是值得正视的攻击面/影响面。
7
🧠模型

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE 想修的是长程 LLM agent 训练里一个隐蔽但根本的毛病。逐步分组式 RL(stepwise group-based RL)是训练长程 agent 的热门做法,它不用学习一个 critic,而是复用多条采样 rollout 来估计局部优势——好处是省事。但它有个被忽视的前提:所有分组相对的估计都默认'被比较的那些步骤在信用分配上是等价的',而这在真实 agent 任务里往往不成立。BiPACE 引入双模拟(bisimulation)引导的策略优化,配合动作反事实估计(action counterfactual estimation)来纠正这个等价性假设。如果你在用 group-based RL 训练多步 agent,这篇指出的是信用分配地基上的裂缝。
8
🧠模型

BitNet Text Embeddings

BITEMBED 把 LLM 文本嵌入压到 1.58 比特(BitNet 量化,权重只取 -1/0/+1 三值),目标是砍掉大规模检索索引在推理、存储和带宽上的成本。背景是:基于 LLM 的嵌入器大幅提升了检索和语义表示质量,但代价高——大骨干模型拖慢嵌入推理,高维全精度向量又给大规模索引带来沉重的存储和带宽负担。BITEMBED 用极低比特表示同时压这两头。对做 RAG、向量检索、大规模语义索引的人,这是一条把高质量 LLM 嵌入往低成本部署推的路线,值得关注它在多大压缩比下还能保住检索质量。
9
🧠模型

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

现有工具使用基准基本都默认工具环境是干净、稳定、可信的,但真实部署里工具会超时、报错、返回脏数据。这篇推出一个新基准,专门在'工具环境不可靠'的设定下压测工具调用 agent,把这个被忽视的维度补上。背景是 LLM 越来越多被当作 agent 部署,通过调用外部工具来完成任务,而近期工具基准虽然在任务复杂度上越做越难,却仍假设工具本身靠谱。对做 agent、function calling、生产环境工具集成的人,这关乎一个现实问题:你的 agent 在工具不靠谱时是会优雅降级,还是会崩——这篇提供了系统化衡量它的标尺。
10
🤖智能体

TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

TRUSTMEM 要解决的是 LLM agent 长期记忆的可信问题。现有记忆 agent 靠生成的写入、修改、删除操作主动更新一块外部记忆,但这些操作可能漏掉重要信息、损坏已有记忆、或注入不可信内容——记忆越用越脏。TRUSTMEM 学习一套'可信的记忆整合'(trustworthy memory consolidation)机制,让这些写改删操作在更新长期记忆时避免遗漏、污染和不可信信息注入。背景是 LLM agent 依赖长期记忆来支撑超出上下文窗口的持续交互和个性化服务。对做有记忆的 agent、个人助理、长会话产品的人,这关乎一个实际痛点:记忆系统会不会随着时间自我腐化。
11
🛡️安全

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

这是一篇关于'AI 生成安全代码'的系统化综述(SoK,systematization of knowledge),回答一个核心问题:今天的模型和编码 agent 在生成安全代码上到底能做到什么、还在哪里失败、什么能推动这个领域前进。它横跨了 prompting、微调、强化学习和 agentic workflow 等多类已有方法,把分散的研究梳理成一张地图。背景是 AI 写代码越来越普遍,而'AI 写出来的代码安不安全'是个绕不开的安全问题。对做 AI 编码工具、安全工程、把 coding agent 往生产推的人,这篇提供了一份现状盘点和待解问题清单,适合快速建立对这个子领域的全局认知。
12
🧠模型

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

机制可解释性有个核心愿景叫可控性:如果我们知道某个行为在模型激活里的表示位置,就应该能去修改它。但这背后藏着一个未经检验的前提——'检测某行为的方向'和'控制该行为的方向'是同一个、或至少很接近。这篇用几何方法去测这个前提,结论很反直觉:完美的检测可以和失败的操控并存。也就是说,你能精准地'读出'模型在想什么,却未必能靠同一个方向去'改写'它。对做 interpretability、表示工程、激活引导(steering)的人,这篇直接挑战了'看得见就改得动'这个被默认的等式,是个需要重新校准预期的发现。
13
🧠模型

Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One

这篇给出一个干净到近乎冷酷的结论:语言模型的记忆,可能比没有记忆更糟。给模型一段'保留了错误结论、却丢掉了背后推理过程'的记忆,它会把这个过时的错值当成自信的答案直接吐出来;而给同一个模型一段空记忆,它反而会选择弃答(abstain)。作者在七个模型上验证,这个方向从不反转,是一条没有模型能破的 kill condition(必然失败条件)。这对所有给 agent 加记忆/缓存的人是个直接警告:不完整的记忆不是'聊胜于无',而是主动制造自信的错误——有损记忆比空记忆更危险,重评(reclaim evaluation)记忆质量是绕不开的事。
14
🔧工具

0.142.2

OpenAI Codex 发布 0.142.2,最值得注意的一项是:MCP 工具现在默认启用工具搜索(tool search),在支持的场景下改善工具发现,同时保留对旧模型和旧 provider 的兼容。另一项是 macOS 上的认证客户端在开启 respect_system_proxy 后,可以遵循系统代理、PAC 和 WPAD 设置。背景是随着 MCP 工具集越接越多,把所有工具一股脑塞进上下文既贵又稀释注意力,按需搜索工具成了规模化的必要手段。对在用 Codex、接了大量 MCP 工具、或在企业代理网络下工作的人,这两项都是实打实的体验改善。
15
🧠模型

Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

Dustin 要打通的是推测解码(speculative decoding)在长上下文、多 batch 场景下的一个具体瓶颈:验证阶段被 KV cache 加载主导,拖慢了整体延迟。推测解码本来能提升吞吐——用小模型先草拟一串 token,大模型一次性并行验证——但在这个场景下,验证时要加载的 KV cache 太大成了新瓶颈,而现有压缩方法在这里都失灵:静态淘汰因为'重要性会漂移'而掉精度,动态方法又有别的问题。Dustin 把草稿增强的稀疏验证(draft-augmented sparse verification)和推测解码结合,专攻这个验证瓶颈。对做长上下文推理、推理加速的人,这是一条针对性的提速路线。
16
🧠模型

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA 想解决用 RL 对齐开放式任务(如创意写作)的老大难问题:奖励信号不可靠。RL 在数学、代码这类有客观对错的任务上很成功,但搬到创意写作这类开放式任务就难——常用的 LLM-as-a-judge 奖励模型有风格偏见和位置不一致(同样的内容,换个位置或措辞,打分就变),导致监督不稳定。OPERA 的做法是把'让 LLM 当裁判'换成一个客观的、基于困惑度(perplexity)的 RL 信号,绕开裁判的风格偏见和位置不一致,从而稳定开放式任务的对齐。对做 post-training、创意/开放式生成对齐的人,这是一条用客观信号替代主观裁判的思路。
17
🛡️安全

Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing

这篇要更准确地测出 LLM 做 Web 渗透测试到底有多强。现有的端到端黑盒评测有个大问题:早期侦察(reconnaissance)一旦失败,会掩盖 agent 其实具备的漏洞利用(exploitation)能力——错误层层级联,最后测出来的低分分不清是'不会侦察'还是'不会利用'。作者提出一个两阶段解耦的基准,把侦察和利用拆开分别测,从而剥离侦察失败的干扰,量出 LLM 真实的渗透测试能力边界。对做 AI 安全、攻防自动化、把 LLM 用于授权渗透评估的人,这提供了一把更干净的能力标尺,结论也更可信。
18
🦾具身

BFMTrack: Latent Sequence Optimization for Physics-Based Motion Tracking with Behavioral Foundation Models

BFMTrack 把行为基础模型(Behavioral Foundation Models, BFM,一类把大量物理上可行的行为组织进一个隐空间、用于通用角色控制的模型)从'静态目标'扩展到'时序精确的动作跟踪'。背景是:BFM 在时间无关的任务上很强,比如到达某个目标位置、按状态奖励优化,但它们天生不擅长需要精确跟随一整段时序动作的任务。BFMTrack 的做法是在 BFM 的隐空间里做隐序列优化(latent sequence optimization),找到一串隐变量让物理角色精确复现给定的参考动作。对做物理仿真角色控制、人形/运动控制的人,这是把通用行为先验用到精确动作模仿上的一条路线。
19
🦾具身

RGB: RL Guided Whole-Body MPPI for Humanoid Control

RGB(RL Guided whole-Body MPPI)把强化学习和采样式最优控制结合起来做人形机器人的全身控制。痛点是:深度 RL 能学出鲁棒的稳定性,但它的行为和训练目标、命令接口绑得太死,想加一个新的反馈目标就得重训,很僵。RGB 的做法是把 RL 学到的策略当作采样先验,去引导 whole-body MPPI(一种基于采样的模型预测控制方法),这样既保留 RL 的鲁棒性,又能在不重训 RL 策略的前提下灵活加入新的反馈目标。对做人形/腿足机器人、接触丰富环境下全身控制的人,这是一条兼顾鲁棒与灵活的控制框架思路。
20
🧠模型

Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints

这篇记录了一个在生产 agent 系统里可复现的现象,作者称为'约束税'(constraint tax):当工具调用(tool calling)和 JSON Schema 结构化输出约束同时开启时,多个开源权重 LLM 的工具调用能力会被抑制。背景是工具调用和结构化输出是现代 agent 系统的两大核心能力,但它们在'同时启用'这个联合部署条件下的相互作用此前研究不足。这篇正是把这个被忽视的交互问题摆上台面,并指出它是可复现的、跨多个开源模型出现的。对做 agent 工程、同时依赖 function calling 和结构化输出的人,这是一个实打实的踩坑预警。
21
🧠模型

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

LBR(Local Branch Routing,局部分支路由)是一个可训练的 token 级测试时扩展(test-time scaling,在推理时多花算力来提升推理质量)框架,想绕开现有方法的一个两难。背景是:测试时扩展能提升语言模型的推理能力,但现有路子各有硬伤——长链式思维(long chain-of-thought)采样是单线程的,跑不出并行;而句子级或解法级的搜索又计算昂贵、难以端到端训练。LBR 把扩展下沉到 token 级别,做局部的分支路由,试图同时避开'单线程'和'昂贵且难训'这两头。对做推理增强、test-time scaling、reasoning 模型的人,这是一条在更细粒度上做测试时扩展的新思路。