2026-06-25 · 🤖 智能体← 本期
Computer use in Gemini 3.5 Flash

如果你在做"让模型替人点鼠标、填表单、跑流程"这类 computer-use agent,这条直接关系到你的技术选型。Google 宣布把 computer use(让模型看屏幕、推理、然后真的去操作界面的能力)做成了 Gemini 3.5 Flash 的原生内置工具。变化的核心在"内置"两个字:在此之前,这套能力是一个独立的 Gemini 2.5 computer use 模型,你要专门去调它;现在它收进了主力的 Flash 模型里,成为模型自带的一个工具,开发者在常规调用里就能用上。
为什么"下沉进 Flash"是关键,需要给不熟这条线的人补一句背景。在大厂的命名里,Flash 通常是主打速度与成本的那一档模型,是跑量、跑高频任务的主力。把 computer-use 这种本来需要单独一个模型承载的能力,并进这样一档快模型,等于把"操作电脑"从一个需要特意接入的旁路能力,变成了主流程里随手可用的一环——对要规模化跑 agent 的团队,这通常意味着接入更简单、调用路径更短。
能力的覆盖面也值得说清。按官方说法,这套 computer use 能"看见、推理并在浏览器、移动端和桌面环境中采取行动"。三端齐全这点不小:很多现有的 computer-use 方案是围绕浏览器做的,能直接覆盖到 mobile 和 desktop,意味着可以搭的 agent 种类更广,不只是网页自动化。
性能方面,必须诚实标注。Google 称这代表它"在 agentic 操作电脑任务上迄今最好的表现",博客里也确实放了一张基准图,标注是 Gemini 3.5 的 OSWorld-Ver(OSWorld 是业界常用的、衡量模型在真实操作系统环境里完成任务能力的基准)。但关键在于:博客正文没有给出可读的具体分数——图是有的,数字没落到文字里。所以"最好表现"目前是官方表述加一张图,第三方可复核的量化结果原文未给出,真实水平如何还得等能对照的评测。
落到可用性:这套能力通过 Gemini API(带专门的 computer use 文档)、Gemini Enterprise Agent Platform 开放,另外还有一个由 Browserbase 托管的演示环境可以试。对想动手验证的人,门槛不高——有 API、有文档、有现成 demo。
要看的保留也清楚。其一,最该关心的硬指标——OSWorld 的具体分数、和别家 computer-use 方案的横向对比——原文都没给,"agentic 最佳"暂时只能当官方说法看。其二,延迟、价格这些决定能不能规模化跑的因素,博客同样没有披露,而这恰恰是 computer-use agent 落地最敏感的两项成本。即便如此,能力从独立模型并进主力快模型、并且一上来就跨浏览器/移动/桌面三端,这个方向本身对做自动化 agent 的团队是个实在的信号:这类能力正在变成主流模型的标配,而不是需要特意绕路接入的专门件。(HN 讨论 170 分、103 条评论。)