Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

2026-06-25 · 周四

今天最重的一条来自硬件:OpenAI 联手博通发布首款自研推理芯片 Jalapeño,9 个月走完一个周期,瞄准 2026 年底吉瓦级部署,微软预计吃下首批四成产能——前沿实验室开始把算力命脉攥进自己手里,能效数字仍为自报、待验证。 模型与能力侧多点开花:谷歌把 computer use 做成 Gemini 3.5 Flash 的原生内置工具,覆盖浏览器、移动端和桌面端的智能体;Mistral OCR 4 称盲测 72% 胜率、支持 170 种语言;Krea 2 开源 12B 文生图基础模型挤进文生图榜前十;NVIDIA 用 NVFP4 4-bit 量化 MiniMax-M3(428B MoE、百万上下文),显存砍半而 GPQA Diamond 几乎不掉点。 商业格局在重排:高通收购 AI 基础设施创业公司 Modular(Mojo 语言 / MAX 推理引擎);Anthropic 推出 Claude Tag,在 Slack 里 @Claude 派活,并称内部产品团队 65% 的代码已由其生成;周鸿祎在 ISC.AI 2026 发布对标 Anthropic Mythos 的漏洞挖掘智能体「图龙锋」,称累计挖洞 3432 个。 研究侧密度同样高:Qwen-AgentWorld 推出首个能模拟智能体环境的语言世界模型并配套 AgentWorldBench;NatureBench 发现最强智能体仅在 17.8% 的科研任务上超越已发表 SOTA;SHERLOC 把代码故障定位做到 SWE-Bench Lite 84.33% acc@1;Zyphra 拟合出持续训练中可塑性丧失的 scaling law。 具身长尾里,World Value Model 把世界模型与价值估计结合成通用机器人价值模型,并提出多本体的 Suboptimal-Value-Bench。

级别
视角
类别
来源
日报20
1
🏗️基建

OpenAI and Broadcom unveil 'Jalapeño' custom LLM-inference chip

OpenAI 和博通联合发布了自研推理芯片 Jalapeño——这是 OpenAI 第一颗专为大模型推理设计、用来跑已训练好模型的定制 ASIC,目标是降低对英伟达 GPU 的依赖、压低推理成本。它从设计到流片只用了 9 个月,OpenAI 称这是其所知最快的高性能芯片开发周期,过程中还用自家模型辅助设计。计划于 2026 年底首次以「吉瓦级」规模部署,微软据传已同意包下首批产量的 40%。制造和网络由博通负责,板卡与整机集成由 Celestica 承担。OpenAI 自报每瓦性能「显著优于」当前最先进硬件,但官方明确说这些数字尚未最终敲定、应谨慎看待。对关注推理成本和算力供应格局的人,这是又一家头部实验室自己造芯的明确信号。
2
🤖智能体

Computer use in Gemini 3.5 Flash

Google 把 computer use(让模型看屏幕、推理、然后真去操作界面的能力)做成了 Gemini 3.5 Flash 的原生内置工具。变化的核心在"内置":此前这是一个独立的 Gemini 2.5 computer use 模型,要专门去调;现在它并进了主打速度与成本的主力快模型,开发者常规调用就能用上。能力覆盖浏览器、移动端和桌面三端——很多现有方案只围着浏览器转,三端齐全意味着能搭的 agent 种类更广。Google 称这是它在 agentic 操作电脑任务上迄今最好的表现,博客也放了一张 OSWorld-Ver 基准图,但正文没给出可读的具体分数;延迟、价格也未披露。能力通过 Gemini API、Gemini Enterprise Agent Platform 开放,另有 Browserbase 托管的 demo 可试。对做自动化 agent 的团队,这是个实在信号:computer-use 正从需特意接入的旁路能力,变成主流模型的标配。HN 170 分、103 条评论。
3
🧠模型

Qwen-AgentWorld: Language World Models for General Agents

通义团队发布 Qwen-AgentWorld,号称是首个能模拟 agentic 环境的「语言世界模型」。世界模型的作用是根据当前观察和动作预测环境接下来会怎么变,是智能体做推理和规划的核心机制;过去这类模型多用在游戏或视频生成,这次把它用语言模型来做、专门服务通用 agent。团队放出 35B-A3B 和 397B-A17B 两档 MoE 模型(激活参数分别约 3B 和 17B),覆盖 7 个域,靠超过 1000 万条真实环境交互轨迹经 CPT、SFT、RL 三段训练而成,并通过长链思维推理来模拟状态转移。同时发布配套评测 AgentWorldBench,由 5 个前沿模型在 9 个既有基准上的真实交互构建。论文称用它做 world-model 预热训练后,下游 7 个 agentic 基准都有提升。对做 agent、RL 环境和规划的人,这是一个把「环境模拟」从专用仿真器转向语言模型的方向性尝试。
4
💰商业

Qualcomm to Acquire Modular

据 Reuters 6 月 24 日报道,高通将收购 AI 基础设施创业公司 Modular——也就是做 Mojo 编程语言和 MAX 推理引擎的那家公司。Mojo 主打"既有 Python 的写法、又能压榨硬件性能",MAX 则是一套要在多种芯片上跑统一推理的软件栈,二者都瞄着模型部署这层最痛的成本与可移植性问题。对做 serving、做端侧部署的人,这条值得看:高通过去是手机芯片厂,靠这笔交易把一支编译器和推理软件的团队收进来,意图很明显是补上"硬件之上缺一层好用软件栈"的短板,往数据中心和边缘 AI 推理市场延伸。这条目前在 Hacker News 上 139 分、36 条讨论;具体收购金额报道摘要里未给出。
5
📦产品

Mistral releases OCR 4, claims 72% win rate in blind tests

Mistral 在 6 月 24 日发布了新一代文档识别模型 OCR 4,专门把 PDF、Word、PowerPoint 这类文档里的文字和版面结构抽取出来。官方给出的核心成绩是一场盲测:在 600 多份文档上,独立评审在 72% 的情况下更偏好 OCR 4 的结果,而非其他参与对比的模型——不过文章没有点名具体对手,也没给出基准的数值分数。它支持 170 种语言,并能在抽取时做块级分类(区分标题、表格、公式、签名等元素),还为每个词、每一页输出置信度。价格为每千页 4 美元,批处理模式 2 美元,仅通过 Mistral API、Mistral Studio 和微软 Foundry 提供,没有开源权重。对要把文档喂进 RAG 或处理流水线的团队,这是一个新的现成选项,但 72% 属于厂商自报的盲测胜率,真实差距仍需第三方验证。
6
📦产品

Krea 2: SOTA open-weights 12B image model

Krea 2 是一款开源权重的文生图基础模型,发布了两个变体:K2 Raw 是未经蒸馏的基座,留给做微调和后训练研究的人;K2 Turbo 经过引导与时间步蒸馏,专攻少步快速出图。它在 Artificial Analysis 的文生图榜单上进入前十,在独立实验室出品的模型里排第二——这意味着权重可下载、可自部署的开放阵营,在闭源大厂之外又拿出了一个接近第一梯队的选项。架构上它采用扩散 Transformer(DiT),文图共享注意力权重,文本侧用 Qwen 3 VL 编码器,权重以宽松协议放上了 Hugging Face 和 GitHub。对想把图像生成跑在自己机器上、或在开放底座上继续研究的人,这是当下少见的一个高排名开放选择。需要注意榜单名次是第三方评测,但参数规模等细节技术报告本身着墨不多。
7
🧠模型

NVIDIA releases NVFP4-quantized MiniMax-M3 (428B MoE, 1M context) on Hugging Face

NVIDIA 在 Hugging Face 上放出了 MiniMax-M3 的 NVFP4 4-bit 量化版。原模型是个 428B 总参、每 token 只激活约 23B 的多模态 MoE,带 100 万 token 上下文;NVFP4 把权重压到 4-bit 后,相比 FP8 磁盘和显存占用再省约一半,专门针对 Blackwell 架构 GPU 跑。值得看的是精度几乎没掉:GPQA Diamond 从 FP8 的 92.53 只降到 91.92,其余几项基准(AA-LCR、τ²-Telecom、MMMU-Pro、SciCode)的落差也都在一个点上下。换句话说,一个超大上下文的多模态大模型被压到能在更少显卡上部署,代价小到几乎可以忽略——这正是想本地或低成本跑长上下文模型的人会关心的一步。
8
🤖智能体

SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation

当 agent 把任务拆成几十上百步、还多 agent 协作时,它的执行轨迹会长到塞不进任何模型的上下文窗口,出了错想定位是哪一步、哪个 agent 的锅就很难。现有做法是把整条轨迹一股脑灌进 LLM 上下文里读,结果注意力被稀释、轨迹一超长就直接失效。SAFARI 换了思路:不再线性加载全文,而是给模型配一套工具箱(按需读取、检索轨迹片段)加一块持久的短期记忆(STM,做跨轮推理),把诊断准确率和上下文长度解耦开。效果上,1M token 预算下在 Who&When 数据集超 SOTA 20%,25K 预算下在 TRAIL GAIA 子集超 19%;最关键的是,当故障点位于模型原生上下文 5 倍之外、传统方法已完全失效时,它仍保住 0.58 precision。论文发在 ICML 2026 的 AIWILD workshop。
9
☁️MaaS

New on OpenRouter: Sakana Fugu Ultra

Sakana AI 把新模型 Fugu Ultra 挂上了 OpenRouter,它走的不是"再训一个更大的基座"路线,而是一个学出来的多智能体编排系统:模型本身负责把任务路由到一个可热插拔的底层模型池,必要时还会递归调用自己的实例,主打复杂多步推理、编程与 agentic 工作流的答案质量。规格上给到 1M token 上下文,仅支持文本输入输出,定价为输入 $5、输出 $30 每百万 token,并支持可配置的推理强度、工具调用与内置网络搜索。要注意编排过程本身消耗的 token 会按普通输入/输出 token 计费,单价不低意味着实际花费取决于它内部调度的轮数。OpenRouter 标注该模型由单一供应商托管、不参与二次路由,发布日期为 6 月 24 日。原文未给出任何基准分数,性能到底如何还无从对照。
10
📊评测

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

NatureBench 提出了一个用来逼问"AI 编程智能体能不能做真科学发现、而不只是复现"的基准:90 个任务全部从 Nature 系列同行评议论文里蒸馏出来,覆盖多个学科,并用 NatureGym 流水线为每个任务自动搭出标准化的容器环境,专治此前同类基准环境零散、结果不可信的老毛病。在禁止联网搜索的严格协议下评测十种前沿智能体配置,最强的一个也只在 17.8% 的任务上(g>0.1 标准)超过论文已发表的 SOTA。作者还分析了智能体到底是怎么"过关"的,发现它们多半是把科学问题翻译成自己熟悉的监督预测任务,而非真正做出方法创新;失败也主要栽在选错方法和算力预算不够,而不是没读懂任务。基准、流水线和带维护方复现的公开榜单一并放出。
11
🎛️后训练

AsyncOPD: How Stale Can On-Policy Distillation Be?

on-policy 蒸馏(OPD)正成为大模型后训练的关键手段:让学生模型在自己生成的 rollout 上训练、由 teacher 反馈来引导。但和强化学习一样,它卡在同一个系统瓶颈上——推理类任务里 rollout 生成会吃掉大半训练时间。异步流水线能把 rollout 生成和参数更新解耦来提速,代价是引入 stale(陈旧策略)数据。这篇 AsyncOPD 是首个系统研究 OPD 中 stale 数据影响的工作。核心发现是 KL 方向决定了陈旧数据的危害:teacher 加权的前向 KL 对 stale rollout 更鲁棒,而 student 加权的反向 KL 很脆弱;针对脆弱情形,作者提出在 learner 端用当前学生重算反向 KL 信号这一更简单的办法,效果反而胜过照搬异步 RL 的稳定化方法。最终其异步流水线相比严格同步训练拿到 1.6 到 3.8 倍吞吐提升,且精度相当,代码已开源。
12
🧠模型

RaDaR: a 32B reasoning LLM for rare disease diagnosis (randomized AI physician-assistance trial)

罕见病的难点不在没有模型,而在专科经验太稀缺、诊断往往拖很久。一个团队开源了 RaDaR,一个 320 亿参数的推理模型,专门做罕见病诊断,用 49170 例真实病例加 104666 例合成病例做了强化推理训练。规模不大却很能打:在公开基准和四家外部验证中心上,它压过了包括 6710 亿参数 DeepSeek-R1 在内的所有受测开源模型。更有意思的是临床向的两组验证——回顾性队列里,它在 61.06% 的病例中比医生记录的临床怀疑更早锁定最终诊断,平均提前约 1.87 个月;随机对照的医生辅助试验里,用它辅助比仅靠网络检索把医生的罕见病诊断准确率拉高了 21.44 个百分点。对关注医疗 AI 落地、小模型蒸馏和长尾领域数据稀缺问题的人,这条值得看。
13
🎛️后训练

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

仓库级 coding agent 有个隐形成本:动手改代码前,光是定位 bug 藏在哪就要花掉近一半预算。SHERLOC 针对这一步提出一个免训练(training-free)的故障定位框架,不微调、不靠多 agent 编排,只用一个推理 LLM 加上轻量仓库工具和自我纠错机制。论文报告它在多个模型规模上达到定位 SOTA:SWE-Bench Lite 上 accuracy@1 为 84.33%,SWE-Bench Verified 上 recall@1 为 81.27%;在约 30B 参数下就能与其他 agentic 方法打平甚至超过。更关键的是落点——把它产出的位置和诊断结论注入修复 agent 后,SWE-Bench Verified 平均解决率提升 5.95 个百分点,同时定位 token 降 36.7%、总 token 降 23.1%。它的主张不只是定位更准,而是把定位从"给文件路径"升级成"给可执行的诊断上下文",对正被定位成本拖累的 coding agent 团队是个务实的新选项。数字均为论文自报,待第三方复现。
14
🎛️后训练

Zyphra derives a scaling law for plasticity loss in continually trained LLMs

Zyphra 发布了它在持续学习(continual learning)方向的第一项工作,研究一个绕不开的老问题:大模型能不能持续从新数据里学下去、而不是越训越"僵"。它们盯住的拦路虎叫"可塑性损失"(plasticity loss)——模型在长期持续训练中逐渐丧失再学习新东西的能力,最终进入一种"刚性"状态,新数据喂进去也学不动。Zyphra 的核心贡献是为这种刚性"开始出现"的临界点拟合出了一条 scaling law,相当于给"模型还能学多久"画出一条可外推的曲线。这件事之所以值得看,是因为不少人把持续学习视为通往递归自我改进(RSI)乃至 AGI 的一条路径,而可塑性损失正是第一道门槛——能把它的发生规律量化,意味着可以预测、进而尝试推迟这个临界点。需要说明:原文(推特线程摘要)只给了 scaling law 这个框架性表述,未披露具体数值、模型规模或实验设置。
15
📦产品

Claude Tag embeds Anthropic's AI in Slack, already writes 65 percent of internal code

Anthropic 推出 Claude Tag,把自家 AI 塞进了团队日常用的 Slack:在任意频道里 @Claude 并丢给它一个任务,它就接活去做,而不是另开一个独立的对话窗口或 IDE。官方给出的一个数字是,这套工具在 Anthropic 内部已经生成了产品团队 65% 的代码。值得看的点在于交付形态变了——AI 协作从"切换到专门工具里提问"挪进了团队既有的沟通流,工作分派和给同事派活用的是同一个 @ 动作,门槛和心智负担都更低。不过这条来自二手报道、且 65% 是公司自报的内部数字,缺少口径说明(比如统计的是行数还是合并的提交、是否经人工修改),具体怎么算、对外何时开放、定价如何,现有素材都未给出。
16
🦾具身

World Value Models for Robotic Manipulation

机器人策略要从海量、质量参差的数据里学好,关键是有一个能判断"这条轨迹好不好、任务推进了多少"的通用价值模型。这篇论文指出,现有机器人价值模型大多搭在视觉语言模型(VLM)骨干上,而 VLM 主要在静态或时间稀疏的画面上预训练,缺乏价值估计真正需要的时序理解能力。作者据此把世界模型(world model)与价值估计结合,提出通用价值模型 WVM——世界模型天生擅长时序建模和对未来的规划,正好补上这块短板,能更准地给出任务进度、用来评估数据质量。论文称 WVM 在标准基准上的 Value-Order Correlation(VOC,价值排序相关性)取得 SOTA;并新提出多本体基准 Suboptimal-Value-Bench,含 800 条次优轨迹和人工逐帧标注,用来补足只含专家数据的现有评测。原文未给出具体数值,但报告 WVM 在该基准上同样保持 SOTA,并在仿真与真机的策略学习中提升了操作表现。
17
推理

CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

长上下文推理现在卡的不是算力而是显存——KV cache 随上下文线性膨胀,把模型部署在小显存硬件上的成本居高不下。常见做法是给所有注意力头的 token 打个启发式分数、留高分丢低分,但这忽略了不同注意力头分工不同,容易把关键 token 误删、拖垮效果。CompressKV 换了个思路:先找出真正负责"检索"的那批注意力头(论文称 Semantic Retrieval Heads,SRH,它们专盯提示词的开头、结尾以及中段语义关键的证据),只用这些头来决定哪些 token 的 KV 该保留;同时按各层离线估出的驱逐误差,把缓存预算分层分配。论文在 LongBench 和 Needle-in-a-Haystack 上验证,称在各档内存预算下都持续优于现有 KV-cache 驱逐方法,代码已开源。对做长文本 serving、想压显存又不想掉精度的团队,这是一个针对 GQA 模型的较实在的新选项。
18
📊评测

DeepSWE: contamination-free benchmark for frontier coding models

DeepSWE 是一个开源、号称"无污染"的编程能力基准,专门用来测今天的前沿 coding agent 在真实软件工程任务上到底行不行。它的核心卖点是任务全部从零手写,而不是从现有的 commit 或 PR 改编而来——这样可以确保没有哪个模型在预训练阶段见过答案,从根上规避了基准被"刷过"的污染问题。任务覆盖 91 个代码仓库、5 种语言(TypeScript、Go、Python、JavaScript、Rust),共 113 道题。难度也更贴近实战:提示词长度只有 SWE-bench Pro 的约一半,但解题所需的代码量是后者的 5.5 倍、输出 token 约 2 倍,更考验长链路工程能力。验证环节由人工编写、只看软件的可观察行为是否正确,而不抠具体实现细节。对关心 coding 模型真实水平、又苦于公开基准被污染的人,这是个值得留意的新评测。
19
🧠模型

Baidu releases Unlimited-OCR demo on Hugging Face

百度放出了一个叫 Unlimited-OCR 的模型,并在 Hugging Face Spaces 上挂了可直接试玩的公开 demo。它主打长文档转录:号称能一次处理 40 多页、且保持上下文不断裂,也就是不用把长文档切成一页页分别识别再人工拼回去。规格上走的是 MoE 路线,总参数 3B、每次推理只激活 500M,意味着算力开销远小于参数量看上去的规模。对要把扫描件、PDF、长报告批量转成文本的场景,这是一个体量很小、又能直接上手试的新选项。消息于 2026-06-23/24 经 @_akhaliq 转发披露。原文未给出基准分数、支持语言和授权协议等更细的信息。
20
💰商业

周鸿祎ISC宣布打造中国版Mythos,360联手信创巨头发起“磐石之盾”安全协作计划

在6月24日开幕的ISC.AI 2026上,360创始人周鸿祎发布了两款AI安全能力:漏洞自动化挖掘智能体"图龙锋",以及网络安全自动化防御系统"仪天阵",并把"图龙锋"对标Anthropic受限对外的最强模型Mythos,称之为中国版Mythos。360给出的成绩是"图龙锋"已累计挖掘漏洞3432个、其中监管确认105个,多个被定义为高危,覆盖开源代码、操作系统、办公软件和AI智能体平台等场景。同期360联合统信、麒麟、飞腾、海光、山石网科等首批信创与安全厂商发起"磐石之盾"安全协作计划。周鸿祎的核心判断是:AI让漏洞挖掘变得更快、更便宜、更规模化,过去靠"漏洞难找"维持的攻防平衡正在被改写,中国安全行业需要自己的Mythos——自己的漏洞自己先看见、先修补。