AI Tools
教程8 分钟2026年3月18日作者:AIGCDev

Claude Computer Use 教程(2026):浏览器与表格任务的安全工作流

快速答案

值得试,但前提是你把 Claude computer use 当成“受监督的操作员”,而不是“无人值守的员工”。截至 2026-03-18,Anthropic 表示 Claude Sonnet 4.6 在 computer use 上有明显提升;官方 API 文档仍然把这项能力标为 beta;官方建议依然是专用 VM 或容器、最小权限、域名 allowlist,以及对关键动作保留人工确认。

真正的价值,不是“让 Claude 接管整台桌面”,而是让它处理那些重复性的浏览器和表格步骤,比如打开 web app、找到正确标签页、在字段之间抄值、检查表格,以及先替你起草下一步动作,再由你决定是否确认。

2026-03-18 发生了什么变化

Anthropic 在 2026-03-18 发布了 Claude Sonnet 4.6,并表示模型在 coding、agent planning、长上下文推理和 computer use 上都有提升。同一天,Anthropic 也宣布收购 Vercept,明确表示要继续推进 Claude 的 computer use 能力。

接下来会有更多团队测试 AI 模型到底能不能真的点击真实软件。更需要先回答的是:现在哪些任务已经窄到可以自动化,哪些动作仍然必须在关键节点由人接手。

Claude Computer Use 现在到底变了什么

真正需要在工作流设计前搞清楚的是这些点:

  • Claude Sonnet 4.6 是 Anthropic 当前最新的 Sonnet 模型,Anthropic 表示价格仍是每 100 万输入 token 3 美元、每 100 万输出 token 15 美元。
  • Anthropic 表示 Sonnet 4.6 在 beta 中支持 1M token 上下文窗口。
  • Anthropic 表示 Sonnet 4.6 在 computer use 上有明显提升,并引用了 OSWorld 的进展。
  • Anthropic 当前的 computer use 文档仍然把该能力标为 beta。
  • 对 Sonnet 4.6,文档列出的 beta header 是 computer-use-2025-11-24,工具版本是 computer_20251124
  • Anthropic 文档说明 computer use beta 不适用于 Zero Data Retention。

这些信息足以说明这项功能值得试,但远不足以说明你应该把主力机器、密码管理器,或者金融与法律动作的最终批准权交给它。

只有任务长这样时,才该用 Claude Computer Use

只有当下面条件同时成立时才适合:

  • 任务发生在浏览器或桌面应用里,而且没有可靠 API。
  • 步骤足够重复,你能在开始前把流程描述清楚。
  • 错误很容易被发现,也容易回滚。
  • 你能在最后一步之前停下来,由自己审核结果。

适合的任务:

  • 把 CRM 页面里的字段整理进表格
  • 检查多标签 web 表单里缺失的字段
  • 把发票元数据抄到审核表里
  • 浏览内部工具并起草一段状态总结
  • 比较表格中的多行数据并标出异常供人工复核

不适合的任务:

  • 代替你输入密码或 2FA 验证码
  • 批准付款、采购或合同条款
  • 删除生产系统里的记录
  • 向客户发送不可撤销的消息
  • 在没有人工检查点的前提下处理医疗、法律或 HR 操作

一套更安全的工作流

第一步:把 Claude 放进低风险环境

Anthropic 的官方文档明确建议使用专用虚拟机或容器,并尽量降低权限。这里最好按字面执行。

最低配置规则:

  • 使用单独的浏览器 profile
  • 不要登录那些你不会交给外包人员的账号
  • 只开放当前任务真正需要的网站和文件
  • 全程保持一个人类在旁边看着运行

如果你无法隔离运行环境,那这个任务就不该用 computer use。

第二步:把任务压缩成一个具体结果

不要让 Claude “负责运营”或“处理我的后台”。要给它一个很窄的终点。

可直接复制的提示词:

You are helping with a supervised browser task.

Goal:
Check the web form for missing fields and write a short review note.

Rules:
- Do not submit the form.
- Do not click any button that sends, pays, agrees, deletes, or confirms.
- If a page asks for login, 2FA, payment, terms acceptance, or a final submission, stop and ask me.
- Work only on these domains: [list domains]
- At the end, return:
  1. missing fields
  2. suspicious values
  3. the exact next action for me to review

这段提示词故意写得很“无聊”,因为停止规则越具体,页面一变化时,模型就越不容易开始即兴发挥。

第三步:在第一下点击前给它一个 preflight checklist

在它真的开始操作页面前,先让它复述自己要做什么。

可直接复制的提示词块:

Before taking action, answer with:
- target site
- intended outcome
- actions you are allowed to take
- actions you are not allowed to take
- when you must stop for human approval

If any of those are unclear, ask before proceeding.

这一步主要用来拦住一个常见失败模式:模型还没锁定边界,就已经开始点页面。

第四步:不要只让它点页面,也让它做审查和准备

早期最有价值的用法,不只是导航本身,而是“导航 + 结构化审查”。

一个更稳的模式是:

  1. 打开页面
  2. 检查相关字段或行
  3. 提取差异与缺失项
  4. 起草修复建议或下一步动作
  5. 停下来等你确认

这个模式的好处是,一次运行能同时给你两样东西:当前状态的观察结果,以及下一步建议。

第五步:最后一步永远由人来做

Anthropic 文档明确说,凡是会带来真实世界后果的动作,都应由用户确认,包括接受 cookies、完成金融交易、同意条款等。把这条当成所有严肃流程的基线规则就对了。

一个在实务里很稳的审批规则是:

  • Claude 可以检查
  • Claude 可以起草
  • Claude 可以准备
  • 你来提交

只靠这一条规则,就能去掉绝大多数“这一下点下去能不能信”的焦虑。

一个现实可用的表格工作流

Anthropic 自己在 Sonnet 4.6 的示例里,就提到了浏览复杂表格。更实用的落地方式,是让 Claude 做“发现问题”,而不是“默默改表”。

可以这样给任务:

Open the spreadsheet and review rows 2-150.

Check for:
- missing owner values
- dates earlier than 2026-01-01
- duplicate company names
- totals that do not match the status column

Do not edit the sheet.
Return a markdown table with:
- row number
- issue found
- proposed correction
- confidence: high, medium, or low

这类任务有效,是因为:

  • 范围明确
  • 输出格式明确
  • 模型被要求做检查,不是静默修改
  • 你可以逐行核对结果

最大风险仍然是 Prompt Injection

Anthropic 文档明确提醒,computer use 有独特风险,尤其是页面或图片中的指令可能覆盖用户原始意图,或诱导模型犯错。Anthropic 也提到,平台现在会运行分类器,在截图中检测到潜在 prompt injection 时,引导模型请求确认。

这当然有帮助,但不是放松警惕的理由。

更稳的底线规则应该是:

  • 每次运行都做域名 allowlist
  • 避免开放式浏览
  • 敏感标签页保持关闭
  • 不要让一个任务漂移到无关网站
  • 只要页面涉及同意、资金、凭证或不可逆动作,就停下

如果一个工作流必须访问大量未知网站,那 Claude computer use 仍然不是默认首选。

快速决策表

情况 该不该用 Claude computer use 原因
多步骤 web 表单检查,最后由人工提交 可以 导航重复、检查成本低、人工检查点清晰
表格 QA 与异常排查 可以 很适合受监督的审查型任务
在两个内部工具间复制值 看情况 只有目标动作可回滚且全程受监督时才适合
支付发票或批准报销 不可以 真实世界后果太高
浏览未知网站采集信息 不可以 prompt injection 和页面变化风险仍然太高
密码输入或账户恢复 不可以 凭证与认证流程应保留给人

FAQ

使用 computer use 一定要 Claude Sonnet 4.6 吗?

你需要使用兼容的 Claude 模型和对应工具版本。截至 2026-03-18,Anthropic 文档列出的 Sonnet 4.6 对应工具是 computer_20251124,对应 beta header 是 computer-use-2025-11-24

Claude computer use 已经适合无人值守的后台自动化了吗?

还不适合。官方文档依然把它标为 beta,并建议强隔离、最小权限,以及对高影响动作保留人工确认。更安全的默认做法仍然是“受监督自动化 + 明确停止点”。

最适合拿来测试的第一类工作流是什么?

先从审查型任务开始,范围要短,成功标准要明显,比如找表单里缺失的字段,或标出表格中可疑的行。如果任务涉及金钱、权限或法律确认,就不要把最后一步交给模型。

最终结论

Claude computer use 现在已经值得拿来测试一些边界清晰的办公室工作流,因为 Anthropic 最新一代模型让这项能力比一年前更实用了。但真正有效的模式依然是“受约束自动化”:隔离环境、小任务、明确停止规则,以及所有关键动作都由人批准。

只要按这个方式使用,Claude 确实可以帮你减少浏览器和表格里的重复劳动,而不至于把一项 beta 能力硬用成原本可以避免的风险。

核验说明

已于 2026-03-18 核验。对照 Anthropic 官方 Sonnet 4.6 发布说明确认模型发布日期、1M token beta 上下文窗口,以及每 100 万 token 3 / 15 美元的定价:https://www.anthropic.com/news/claude-sonnet-4-6。对照 Anthropic 官方 Vercept 收购公告确认其围绕 computer use 的产品方向与 OSWorld 相关表述:https://www.anthropic.com/news/acquires-vercept。对照 Anthropic 官方 computer use 文档确认 beta 状态、兼容工具版本、beta header、Zero Data Retention 限制,以及围绕 VM、最小权限、allowlist 和人工确认的安全建议:https://platform.claude.com/docs/en/agents-and-tools/tool-use/computer-use-tool。对照 Anthropic 官方定价页确认当前 Claude 价格背景:https://claude.com/pricing.

claudecomputer-usebrowser-automationspreadsheetsai-agentsprompt-injection