Codex 浏览器自动化:网页操作与工具调用
2026-08-22 14:22:55阅读 2
大多数人对 Codex 的印象停留在"写代码",但它还有一个容易被忽略的能力:操作浏览器、干网页上的活。从抓数据、填表单到完整网页任务,Codex 正在从"编程 agent"变成"电脑工作流 agent"。
先澄清:Codex 的"浏览器能力"是什么
Codex 的浏览器相关能力分两类(官方文档确认):
| 能力 | 是什么 | 典型场景 |
|---|---|---|
| 浏览器(Browser) | 让 agent 操作真实浏览器 | 打开网页、点击、填表、抓取内容 |
| 计算机操作(Computer Use) | 操作整个电脑界面 | 桌面应用、跨应用工作流 |
注意:这些能力的可用范围取决于入口和配置——CLI、IDE、桌面 App、云端环境的能力不完全一样,而且涉及权限控制(详见权限与安全篇)。
浏览器能帮你干什么
抓取与整理:
打开这个页面,把表格数据抓下来,整理成 CSV。表单与操作:
登录测试环境,创建一个新项目,填好基础信息。网页调研:
搜索这几个关键词,汇总前 5 条结果的要点。配合工作流:浏览器能力常和 MCP 外部工具搭配——网页数据 → 代码处理 → 输出结果(详见MCP 集成篇)。
和普通"爬虫"的区别
Codex 不是机械爬虫,它理解网页内容和任务意图:
- 爬虫:按规则抓指定元素
- Codex:理解"把表格整理成 CSV"这个意图,自己决定抓哪、怎么整理
这也意味着它的操作更像"人用浏览器",而不是"脚本跑页面"。
三个实际注意点
- 登录态与凭据——涉及登录的页面,凭据处理要小心(走权限管理,别把密码写进提示词)
- 权限边界——浏览器操作同样受权限控制,别默认全放开
- 云端 vs 本地——云端环境里浏览器跑在隔离环境,行为更可控;本地则要留意它对真实浏览器的操作范围
常见问题
| 问题 | 解答 |
|---|---|
| Codex 能点我电脑上任何应用吗? | 那是 Computer Use 范畴,能力与配置相关,别默认都有 |
| 抓数据会被反爬吗? | 看目标站点;合规使用,别用于绕过限制 |
| 浏览器操作需要额外配置吗? | 看入口和权限设置,复杂场景要调权限 |
一句话总结
浏览器能力让 Codex 从"改代码的"变成"能上网干活的"。 但能力越大,权限越要管好——先把安全边界想清楚,再让它在网页上撒欢。
接下来读什么
---
← 上一篇:3.3 远程开发 | 下一篇:4.1 AGENTS.md 项目指令 →
↑ 返回 教程总目录



