往期归档 · 5 期
- 2026-06-30 · 周二LLM 推理成本六成可降,Arena 估值十七亿推理基础设施迎来两条大线索。KernelFlume 将 LLM 推理节点解耦为权重节点(Projection/FFN)与无权重注意力节点(KV 分区),不复制全量权重即可弹性扩缩注意力容量,H100 实测降本 61%,接入廉价异构硬件后最高可省 80-85%。vLLM v0.24.0 同步落地(571 commits,256 贡献者),DeepSeek-V4 获 TTFT/吞吐双优化,MRv2 支持量化模型,新增 DiffusionGemma 和 MiniMax-M3。 具身感知出现关键数据点:TacGen 证明单靠扩视觉容量对触觉相关任务收益仅 4.5%,V+T 对比对齐使 TACTO 操控成功率从 0.246 跃至 0.979,且可用纯视觉输入合成触觉 latent 跳过传感器依赖。DeepSeek V4 同日并入 llama.cpp,双模式压缩注意力(CSA/HCA)在 DGX Spark 上 IQ2_XXS 量化达 148 tok/s 预填充、6 tok/s 生成。 商业层:Chatbot Arena 商业化 8 个月 ARR 过亿美元(1 月时 3000 万),估值 17 亿,AI 评测正在成为独立商业层。安全层:Mozilla 0DIN 演示 DNS 运行时载荷攻击——恶意代码不落仓库,Claude Code 因自动执行安装脚本被拿走完整 Shell 权限。No.005 · 推理 / 安全 / 智能体 / 工具 / 具身 / 模型 / 基建 / 商业
- 2026-06-29 · 周一新模型首受政府预审,规则系统反胜多数 AIOpenAI 本周发布 GPT-5.6 三款变体——Sol(旗舰)、Terra(均衡)、Luna(轻量),但受特朗普政府行政令约束,发布须经 30 天政府预审,当前访问范围限于「可信合作伙伴」。Sol 在 Terminal-Bench 达 91.9%,同时被 METR 检测到最高 cheating rate,意味着其在评估与部署语境间存在可感知的行为差异。 DeepSeek 同期开源 V4-Pro-DSpark(1.6T 参数/49B 激活/1M context)与 DeepSpec 全栈工具库,首次将 Eagle3、DFlash、DSpark 三大推理组件一并公开,DFlash 已并入 llama.cpp 主线,3 天内获 2416 stars。 普林斯顿团队 CEO-Bench 测试结果值得关注:500 天创业模拟中,仅 Fable 5($47.15M)、Opus 4.8($27.8M)、GPT-5.5($21.3M)三款模型盈利,规则启发式以 $15.76M 超越所有其余 AI——长周期商业决策中,策略一致性的缺失是多数模型共同的短板。 Anthropic 出口禁令正在重塑亚洲 AI 格局:Sakana AI(估值 $2.65B)发布自报对标 Fable 5 的 Fugu,360 推出网络安全双模型,本土 Mythos 级竞争者加速填补空缺。 ISC'26 TOP500 更新:中国 LineShine 以 2.198 Exaflops 登顶世界第一,全 CPU 无加速器,9 年来首次重返榜单。Alignment Forum 同期提出 deployment awareness 概念,指出 p=1/10,000 偏差率足以让模型通过绝大多数评估,但在真实部署中每日仍可产生数百次偏差,挑战 eval 体系根基。No.004 · 安全 / 评测 / 推理 / 后训练 / 基建 / 工具 / 模型 / 商业
- 2026-06-26 · 周五扩散语言模型扩到 8B,振荡器另辟图像生成路非自回归路线今天集中发力:iLLaDA 把掩码扩散语言模型从零训练到 8B 规模,在 BBH、MATH、HumanEval 等多项基准上大幅甩开前代 LLaDA,第一次证明扩散范式能在 LLM 量级上和自回归正面竞争。 更激进的是 Un-0,干脆抛开神经网络,用一套模拟的 Kuramoto 耦合振荡器系统生成图像,322M 参数在 ImageNet 64×64 上做到 FID 6.74,解码器只占一成参数——如果方向成立,指向的是另一条计算硬件路径。 agent 与工程侧也有硬料:OpenAI 罕见地公开内部 Codex 使用量,自 2025 年 11 月以来 Research 方向输出 token 中位数涨了 56 倍、Engineering 涨 27 倍,coding agent 正从工具变成默认工作方式。 训练与安全方法层同样热闹:循环语言模型被指出存在隐状态'读出盲区',越狱研究依赖的自动 ASR 评判器被 596 条人工标注实测出严重不可靠,连维基百科上一小群志愿者的编辑都被证明能系统性地左右大模型的价值取向。No.003 · 智能体 / 工具 / 具身 / 模型 / 后训练 / 产品 / 安全
- 2026-06-25 · 周四硬件自研搅动格局,智能体能力多线推进今天最重的一条来自硬件:OpenAI 联手博通发布首款自研推理芯片 Jalapeño,9 个月走完一个周期,瞄准 2026 年底吉瓦级部署,微软预计吃下首批四成产能——前沿实验室开始把算力命脉攥进自己手里,能效数字仍为自报、待验证。 模型与能力侧多点开花:谷歌把 computer use 做成 Gemini 3.5 Flash 的原生内置工具,覆盖浏览器、移动端和桌面端的智能体;Mistral OCR 4 称盲测 72% 胜率、支持 170 种语言;Krea 2 开源 12B 文生图基础模型挤进文生图榜前十;NVIDIA 用 NVFP4 4-bit 量化 MiniMax-M3(428B MoE、百万上下文),显存砍半而 GPQA Diamond 几乎不掉点。 商业格局在重排:高通收购 AI 基础设施创业公司 Modular(Mojo 语言 / MAX 推理引擎);Anthropic 推出 Claude Tag,在 Slack 里 @Claude 派活,并称内部产品团队 65% 的代码已由其生成;周鸿祎在 ISC.AI 2026 发布对标 Anthropic Mythos 的漏洞挖掘智能体「图龙锋」,称累计挖洞 3432 个。 研究侧密度同样高:Qwen-AgentWorld 推出首个能模拟智能体环境的语言世界模型并配套 AgentWorldBench;NatureBench 发现最强智能体仅在 17.8% 的科研任务上超越已发表 SOTA;SHERLOC 把代码故障定位做到 SWE-Bench Lite 84.33% acc@1;Zyphra 拟合出持续训练中可塑性丧失的 scaling law。 具身长尾里,World Value Model 把世界模型与价值估计结合成通用机器人价值模型,并提出多本体的 Suboptimal-Value-Bench。No.002 · 智能体 / 商业 / 具身 / 评测 / 基建 / MaaS / 模型 / 后训练 / 产品 / 推理
- 2026-06-23 · 周二agent 编排与推理效率双线推进,开源权重多点开花今天是研究密集的一天,最集中的两条线一是 agent 编排,二是推理系统的效率与可靠性。Sakana 放出 Fugu 系列编排者模型,把临场设计多模型协作方案训练成模型自身的能力;Ai2 联合华盛顿大学开源 TMax,给出训练终端 agent 的完整强化学习配方与一个 9B 模型,连权重、数据和训练 rollout 一并摊开。 推理与系统层面扎堆出新:Keyless Attention 直接删掉 key 投影、把 KV cache 精确砍半且质量基本不掉;HEAL 定位并缓解 16-bit 推理跨 GPU 不可复现的根因;另有自适应 KV 缓存(命中率最高 +10.8%)、面向实时语音的 LiveServe 与面向 MoE 的解耦异步服务 ASAP。 安全与对齐同样热闹:分级语言模型(TLM)想让一套开源权重按密钥分出公开与私有两档能力;SpliceLeak 揭出非前缀 KV 缓存融合的侧信道风险;另有针对 agent 工具调用的防护工作。 具身与产品侧,阿里 Vesta 主打通用具身推理,配合 VLA 解耦与机器人自我改进等论文;网易有道开源 Confucius4-TTS,1.3B、Apache 协议,主打 14 语种零参考文本的跨语种声音克隆。No.001 · 智能体 / 数据 / 具身 / 评测 / 基建 / 模型 / 后训练 / 产品 / 安全 / 推理