快速答案
值得试,但前提是你把 Claude computer use 当成“受监督的操作员”,而不是“无人值守的员工”。截至 2026-03-18,Anthropic 表示 Claude Sonnet 4.6 在 computer use 上有明显提升;官方 API 文档仍然把这项能力标为 beta;官方建议依然是专用 VM 或容器、最小权限、域名 allowlist,以及对关键动作保留人工确认。
真正的价值,不是“让 Claude 接管整台桌面”,而是让它处理那些重复性的浏览器和表格步骤,比如打开 web app、找到正确标签页、在字段之间抄值、检查表格,以及先替你起草下一步动作,再由你决定是否确认。
2026-03-18 发生了什么变化
Anthropic 在 2026-03-18 发布了 Claude Sonnet 4.6,并表示模型在 coding、agent planning、长上下文推理和 computer use 上都有提升。同一天,Anthropic 也宣布收购 Vercept,明确表示要继续推进 Claude 的 computer use 能力。
接下来会有更多团队测试 AI 模型到底能不能真的点击真实软件。更需要先回答的是:现在哪些任务已经窄到可以自动化,哪些动作仍然必须在关键节点由人接手。
Claude Computer Use 现在到底变了什么
真正需要在工作流设计前搞清楚的是这些点:
- Claude Sonnet 4.6 是 Anthropic 当前最新的 Sonnet 模型,Anthropic 表示价格仍是每 100 万输入 token 3 美元、每 100 万输出 token 15 美元。
- Anthropic 表示 Sonnet 4.6 在 beta 中支持 1M token 上下文窗口。
- Anthropic 表示 Sonnet 4.6 在 computer use 上有明显提升,并引用了 OSWorld 的进展。
- Anthropic 当前的 computer use 文档仍然把该能力标为 beta。
- 对 Sonnet 4.6,文档列出的 beta header 是
computer-use-2025-11-24,工具版本是computer_20251124。 - Anthropic 文档说明 computer use beta 不适用于 Zero Data Retention。
这些信息足以说明这项功能值得试,但远不足以说明你应该把主力机器、密码管理器,或者金融与法律动作的最终批准权交给它。
只有任务长这样时,才该用 Claude Computer Use
只有当下面条件同时成立时才适合:
- 任务发生在浏览器或桌面应用里,而且没有可靠 API。
- 步骤足够重复,你能在开始前把流程描述清楚。
- 错误很容易被发现,也容易回滚。
- 你能在最后一步之前停下来,由自己审核结果。
适合的任务:
- 把 CRM 页面里的字段整理进表格
- 检查多标签 web 表单里缺失的字段
- 把发票元数据抄到审核表里
- 浏览内部工具并起草一段状态总结
- 比较表格中的多行数据并标出异常供人工复核
不适合的任务:
- 代替你输入密码或 2FA 验证码
- 批准付款、采购或合同条款
- 删除生产系统里的记录
- 向客户发送不可撤销的消息
- 在没有人工检查点的前提下处理医疗、法律或 HR 操作
一套更安全的工作流
第一步:把 Claude 放进低风险环境
Anthropic 的官方文档明确建议使用专用虚拟机或容器,并尽量降低权限。这里最好按字面执行。
最低配置规则:
- 使用单独的浏览器 profile
- 不要登录那些你不会交给外包人员的账号
- 只开放当前任务真正需要的网站和文件
- 全程保持一个人类在旁边看着运行
如果你无法隔离运行环境,那这个任务就不该用 computer use。
第二步:把任务压缩成一个具体结果
不要让 Claude “负责运营”或“处理我的后台”。要给它一个很窄的终点。
可直接复制的提示词:
You are helping with a supervised browser task.
Goal:
Check the web form for missing fields and write a short review note.
Rules:
- Do not submit the form.
- Do not click any button that sends, pays, agrees, deletes, or confirms.
- If a page asks for login, 2FA, payment, terms acceptance, or a final submission, stop and ask me.
- Work only on these domains: [list domains]
- At the end, return:
1. missing fields
2. suspicious values
3. the exact next action for me to review
这段提示词故意写得很“无聊”,因为停止规则越具体,页面一变化时,模型就越不容易开始即兴发挥。
第三步:在第一下点击前给它一个 preflight checklist
在它真的开始操作页面前,先让它复述自己要做什么。
可直接复制的提示词块:
Before taking action, answer with:
- target site
- intended outcome
- actions you are allowed to take
- actions you are not allowed to take
- when you must stop for human approval
If any of those are unclear, ask before proceeding.
这一步主要用来拦住一个常见失败模式:模型还没锁定边界,就已经开始点页面。
第四步:不要只让它点页面,也让它做审查和准备
早期最有价值的用法,不只是导航本身,而是“导航 + 结构化审查”。
一个更稳的模式是:
- 打开页面
- 检查相关字段或行
- 提取差异与缺失项
- 起草修复建议或下一步动作
- 停下来等你确认
这个模式的好处是,一次运行能同时给你两样东西:当前状态的观察结果,以及下一步建议。
第五步:最后一步永远由人来做
Anthropic 文档明确说,凡是会带来真实世界后果的动作,都应由用户确认,包括接受 cookies、完成金融交易、同意条款等。把这条当成所有严肃流程的基线规则就对了。
一个在实务里很稳的审批规则是:
- Claude 可以检查
- Claude 可以起草
- Claude 可以准备
- 你来提交
只靠这一条规则,就能去掉绝大多数“这一下点下去能不能信”的焦虑。
一个现实可用的表格工作流
Anthropic 自己在 Sonnet 4.6 的示例里,就提到了浏览复杂表格。更实用的落地方式,是让 Claude 做“发现问题”,而不是“默默改表”。
可以这样给任务:
Open the spreadsheet and review rows 2-150.
Check for:
- missing owner values
- dates earlier than 2026-01-01
- duplicate company names
- totals that do not match the status column
Do not edit the sheet.
Return a markdown table with:
- row number
- issue found
- proposed correction
- confidence: high, medium, or low
这类任务有效,是因为:
- 范围明确
- 输出格式明确
- 模型被要求做检查,不是静默修改
- 你可以逐行核对结果
最大风险仍然是 Prompt Injection
Anthropic 文档明确提醒,computer use 有独特风险,尤其是页面或图片中的指令可能覆盖用户原始意图,或诱导模型犯错。Anthropic 也提到,平台现在会运行分类器,在截图中检测到潜在 prompt injection 时,引导模型请求确认。
这当然有帮助,但不是放松警惕的理由。
更稳的底线规则应该是:
- 每次运行都做域名 allowlist
- 避免开放式浏览
- 敏感标签页保持关闭
- 不要让一个任务漂移到无关网站
- 只要页面涉及同意、资金、凭证或不可逆动作,就停下
如果一个工作流必须访问大量未知网站,那 Claude computer use 仍然不是默认首选。
快速决策表
| 情况 | 该不该用 Claude computer use | 原因 |
|---|---|---|
| 多步骤 web 表单检查,最后由人工提交 | 可以 | 导航重复、检查成本低、人工检查点清晰 |
| 表格 QA 与异常排查 | 可以 | 很适合受监督的审查型任务 |
| 在两个内部工具间复制值 | 看情况 | 只有目标动作可回滚且全程受监督时才适合 |
| 支付发票或批准报销 | 不可以 | 真实世界后果太高 |
| 浏览未知网站采集信息 | 不可以 | prompt injection 和页面变化风险仍然太高 |
| 密码输入或账户恢复 | 不可以 | 凭证与认证流程应保留给人 |
FAQ
使用 computer use 一定要 Claude Sonnet 4.6 吗?
你需要使用兼容的 Claude 模型和对应工具版本。截至 2026-03-18,Anthropic 文档列出的 Sonnet 4.6 对应工具是 computer_20251124,对应 beta header 是 computer-use-2025-11-24。
Claude computer use 已经适合无人值守的后台自动化了吗?
还不适合。官方文档依然把它标为 beta,并建议强隔离、最小权限,以及对高影响动作保留人工确认。更安全的默认做法仍然是“受监督自动化 + 明确停止点”。
最适合拿来测试的第一类工作流是什么?
先从审查型任务开始,范围要短,成功标准要明显,比如找表单里缺失的字段,或标出表格中可疑的行。如果任务涉及金钱、权限或法律确认,就不要把最后一步交给模型。
最终结论
Claude computer use 现在已经值得拿来测试一些边界清晰的办公室工作流,因为 Anthropic 最新一代模型让这项能力比一年前更实用了。但真正有效的模式依然是“受约束自动化”:隔离环境、小任务、明确停止规则,以及所有关键动作都由人批准。
只要按这个方式使用,Claude 确实可以帮你减少浏览器和表格里的重复劳动,而不至于把一项 beta 能力硬用成原本可以避免的风险。
核验说明
已于 2026-03-18 核验。对照 Anthropic 官方 Sonnet 4.6 发布说明确认模型发布日期、1M token beta 上下文窗口,以及每 100 万 token 3 / 15 美元的定价:https://www.anthropic.com/news/claude-sonnet-4-6。对照 Anthropic 官方 Vercept 收购公告确认其围绕 computer use 的产品方向与 OSWorld 相关表述:https://www.anthropic.com/news/acquires-vercept。对照 Anthropic 官方 computer use 文档确认 beta 状态、兼容工具版本、beta header、Zero Data Retention 限制,以及围绕 VM、最小权限、allowlist 和人工确认的安全建议:https://platform.claude.com/docs/en/agents-and-tools/tool-use/computer-use-tool。对照 Anthropic 官方定价页确认当前 Claude 价格背景:https://claude.com/pricing.