WebBrain 是一款免费的开源浏览器扩展,为你的浏览器带来 AI 代理能力。阅读页面、提取数据、自动化网页任务 —— 使用你选择的 LLM。专有浏览器 AI 插件的可自托管替代品。
看看 WebBrain 如何阅读页面、提取数据并自动化浏览器任务。
一个功能齐全的 AI 代理,驻扎在浏览器侧边栏,能理解任何网页。
读懂任何网页 —— 文章、文档、仪表板、表单。对当前页面内容提问并立即获得答案。
代你点击、输入、滚动、导航,并与页面交互。用自然语言指令自动化重复性任务。
执行重要操作前会先询问;默认使用只读的询问模式。
从任何页面提取结构化数据 —— 表格、列表、链接、表单。导出产品目录、搜索结果或任何页面内容。支持 PDF。
兼容本地 llama.cpp、OpenAI、Claude 和 OpenRouter。使用你偏好的模型 —— 或用本地 AI 完全离线运行。
你的数据依然属于你。配合本地 LLM 零数据泄露。无遥测、无追踪、无需账号。完全开源。
自动上下文管理防止 token 溢出。智能裁剪对话历史并限制工具输出,让会话顺畅不中断。
用一个快速的纯文本模型做规划,再配一个专门的视觉模型读取截图。比用一个庞大的多模态模型做所有事情更便宜也更快。
可选的纯文本自述 —— 姓名、工作邮箱、公司、一个一次性密码 —— 让代理无需每次询问即可轻松完成低风险注册表单。默认关闭,全部在本地存储。
默认关闭。仅存储在你的浏览器本地,绝不发送给 WebBrain。
在推理页面之前关闭常见框架的同意横幅(OneTrust、Cookiebot、Didomi、Quantcast)。检测到付费墙会如实告知,而不是编造文章内容或尝试绕过。
Plug in a CapSolver API key and the agent will auto-solve reCAPTCHA v2/v3, hCaptcha, and Cloudflare Turnstile when they block a step — instead of stopping to ask. Off by default, BYO key, no captcha service is shipped or contacted unless you turn it on.
默认关闭。自带密钥——除非你启用,否则不会联系任何验证码服务。
插件提供 English、Español、Français、Türkçe 和 中文 五种语言。首次使用时自动检测浏览器语言;随时可通过侧边栏中的地球图标切换。本站也相应本地化。
截图在离开你的机器之前会先按比例缩放并迭代 JPEG 压缩,让图像 token 保持很小。智能上下文裁剪和工具输出上限让云端费用可预测 —— 长会话不会出现意外支出。
连接任何 OpenAI 兼容 API,或运行一个本地模型。随时在扩展设置中切换提供商。
支持 Chrome、Edge 和 Firefox。免费、开源、无需账号。
Manifest V3 · Chrome 116+ · 同时适用于 Brave、Opera、Vivaldi 等 Chromium 兼容浏览器。
Manifest V3 · Windows 10/11 · 需要 Windows 上的 Microsoft Edge。
将 Claude Code、Codex、Cursor、OpenCode 或任意 stdio MCP 客户端连接到已登录的 Chromium 标签页。WebBrain 将任务级权限关卡保留在浏览器中,现在也能返回结构化 JSON。
无需导出 Cookie、无头登录或重放凭据。本地服务器会把任务交给 Chrome、Edge、Brave、Opera 或 Vivaldi 中的 WebBrain。MCP 桥接不支持 Firefox。
WebBrain 位于浏览器原生 AI 插件与完整代理框架之间。以下是它的定位。
| 特性 | WebBrain | Chrome 中的 Claude |
|---|---|---|
| 开源 | MIT 许可 | 闭源 |
| 价格 | 永久免费 | 需要 Claude Pro(20 美元/月) |
| 本地 LLM 支持 | llama.cpp、Ollama | 否 —— 仅限 Claude |
| 多提供商 | All OpenAI-compatible endpoints | 仅限 Claude |
| Chrome | 是(MV3) | 是 |
| Firefox | 是(MV2) | 否 |
| 侧边栏 UI | 是 | 是 |
| 完全离线 | 是(使用本地 LLM) | 否 —— 需要云端 |
| 可自托管 | 是 | 否 |
| 维度 | WebBrain | OpenClaw / Browser-Use / 等 |
|---|---|---|
| 是什么? | 浏览器扩展(面向终端用户的工具) | 代理框架 / SDK(面向开发者的工具) |
| 目标用户 | 任何人 —— 无需编码 | 构建自动化的开发者 |
| 安装 | 一键浏览器安装 | 需要 Python/Docker 环境 |
| 界面 | 内置侧边栏聊天 | 无 UI —— 仅代码或 API |
| 浏览器控制 | Content script(轻量) | CDP / Playwright(完全控制) |
| 多标签工作流 | 按标签独立会话 | 可编程多标签编排 |
| 无头模式 | 否 —— 在你的浏览器中运行 | 是 —— 无头自动化 |
| 可扩展性 | 添加自定义 LLM 提供商 | 完整 Python SDK、自定义工具 |
| 最适合 | 日常浏览的 AI 助手 | 自动化抓取 / 测试流水线 |
WebBrain 是面向终端用户的浏览器扩展,适合希望在浏览时有 AI 助手陪伴的人。像 OpenClaw 这样的代理框架则是开发者用来构建自动化浏览器流水线的工具。不同工具适合不同工作 —— 两者可以并用。
是的。WebBrain 提供类似的 AI 浏览器代理能力 —— 阅读页面、提取数据、点击按钮、填写表单并自动化多步骤工作流。与需要 Claude Pro 订阅且仅支持 Anthropic 模型的专有 Claude 插件不同,WebBrain 完全免费、开源(MIT 许可),并支持多个 LLM 提供商,包括完全在你的机器上运行的本地模型。
WebBrain Cloud 目前为每个设备配置文件每月 5 美元,暂时比 Claude Pro 便宜得多。当前用量在公平使用政策下不限量:正常个人使用没问题,但不允许滥用、自动化刷量、转售或异常高流量使用。
订阅绑定到扩展为该浏览器 + 操作系统 GUID 生成的设备标识符,而不是用户账户。如果你重置扩展存储、删除浏览器配置文件、重新安装浏览器、更换浏览器/操作系统或丢失设备而导致该标识符丢失,我们无法找回或转移,也不会因此退款。
你可以在插件设置页的账户区域通过管理账单按钮订阅或管理账单。若要手动取消,请用结账时使用的邮箱地址给我们发邮件。
Cloud Sync 是面向有效 WebBrain Cloud 订阅用户的可选功能。它会同步你的 WebBrain 记忆、个人资料自动填充文本,以及受支持的提供商配置(包括 API 密钥)。它不会同步聊天记录、浏览器历史、页面截图,或旧版 OAuth 访问令牌与刷新令牌。
浏览器会在上传前使用你选择的密码对同步保险库进行加密。WebBrain Cloud 只存储加密后的保险库;无法读取你的记忆、个人资料文本、提供商设置或 API 密钥,也无法帮你找回同步密码。
邮箱字段用于 WebBrain Cloud 的 magic-link 账单/订阅身份验证,不是账户密码。如果界面在 Cloud Sync 中提示更改密码,指的是同步加密密码,而不是 WebBrain 账户密码。
如果你忘记了同步密码,旧的加密云端保险库将无法解密。你可以重置云端保险库,并从仍保留本地数据的设备重新上传一份新的加密副本。
它们属于不同类别的工具。WebBrain 是浏览器扩展 —— 你在 Chrome 或 Firefox 中安装它,并在侧边栏中与它对话,无需编码。OpenClaw 和 Browser-Use 等框架是面向开发者的 SDK,用 Python 构建自动化浏览器流水线,通常使用无头浏览器和 CDP。换句话说:WebBrain 用于日常浏览时的 AI 助手;代理框架用于构建抓取机器人和测试自动化。你可以同时使用 —— 二者互补。
可以。WebBrain 的默认提供商是 llama.cpp,它在你的电脑上运行本地 AI 模型。无需 API 密钥,AI 无需互联网,数据不会离开你的机器。下载一个 GGUF 模型,启动 llama-server,你就拥有了一个完全私有的 AI 浏览器代理。你也可以通过 OpenAI 兼容端点使用 Ollama。
WebBrain 支持四类提供商:llama.cpp(任意本地 GGUF 模型)、OpenAI(GPT-4o、GPT-4 等)、Claude(通过原生 API 使用 Claude Opus、Sonnet、Haiku)以及 OpenRouter(访问多家提供商的 100 多种模型)。任何 OpenAI 兼容的 API 端点都能工作,因此你也可以使用 Together AI、Groq、Mistral 等服务,或任何提供 OpenAI 兼容接口的本地服务器。
截至 2026 年 4 月 21 日,最推荐的是 Qwen 3.6 35B。原因:在我们的视觉基准测试中(vision-model-shootout),它在截图理解方面超过了 Gemma 4,同时对本地推理仍然可行。
在消费级 GPU 上,RTX 5090 是理想选择;RTX 4090 通常可借助 Intel/Qwen3.6-35B-A3B-int4-AutoRound 的 INT4 AutoRound 量化运行。
追求最高速度时,推荐使用 vLLM 提供服务。示例命令:
python -u -m vllm.entrypoints.openai.api_server --model Intel/Qwen3.6-35B-A3B-int4-AutoRound --served-model-name qwen3.6-35b --quantization auto --dtype bfloat16 --max-model-len 65536 --max-num-batched-tokens 32768 --max-num-seqs 4 --host 0.0.0.0 --port 8000 --gpu-memory-utilization 0.92 --enable-prefix-caching --enable-chunked-prefill --limit-mm-per-prompt '{"image": 4, "video": 1}' --mm-processor-cache-type shm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --trust-remote-code --allowed-origins '["*"]' --speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.6-35B-A3B-DFlash", "num_speculative_tokens": 15}' --attention-backend flash_attn
DFlash 推测解码是可选项。
如果你的 LLM 服务器在本地网络中的另一台机器上(例如 http://192.168.1.x:8000),除非服务器发送 CORS 头,否则 Chrome 会拦截该请求。解决方案因服务器而异:
vLLM:启动时添加 --allowed-origins '["*"]'(值必须是 JSON 列表)。
Ollama:启动前设置环境变量 OLLAMA_ORIGINS=*。
llama.cpp:默认启用 CORS,无需更改。
如果你的服务器运行在 localhost(与浏览器同一台机器),通常不需要 CORS。该问题仅影响本地网络上跨机器的连接。请确保 WebBrain 设置中的基础 URL 以 /v1 结尾(例如 http://192.168.1.47:8000/v1)。 例外:从浏览器扩展使用 Ollama 时仍可能需要 OLLAMA_ORIGINS;请参见下方的 Ollama FAQ。
较新的 Ollama 版本即使运行在同一台机器上,也可能拒绝来自浏览器扩展来源的请求。扩展会发送类似 chrome-extension://... 或 moz-extension://... 的 Origin,如果未允许这些来源,Ollama 可能返回 403。
先退出任何已经占用 11434 端口的 Ollama 桌面应用,然后用以下命令之一启动 Ollama:
OLLAMA_ORIGINS="*" ollama serveOLLAMA_ORIGINS="chrome-extension://*,moz-extension://*" ollama serve
将 WebBrain 的 Ollama Base URL 保持为 http://localhost:11434/v1。终端中的 curl 检查即使没有这个设置也可能正常工作,因为它们不会发送浏览器扩展来源。
能。WebBrain 同时提供 Chrome 版(使用 sidePanel API 的 Manifest V3)和 Firefox 版(使用 sidebar_action 的 Manifest V2)。两个版本功能一致。Firefox 版本可以作为临时附加组件用于开发,也可以发布到 addons.mozilla.org 进行永久安装。
可以 —— Firefox 的侧边栏默认显示在左侧,但你可以把它切换到右侧。在侧边栏标题栏上右键点击,选择「将侧边栏移到右侧」(也可以从菜单栏走「查看 → 侧边栏 → 将侧边栏移到右侧」)。重启后位置保持不变。Chrome 的 sidePanel 默认在右侧,且无法由用户从面板本身移动。
有。Vivaldi Web Panel 会屏蔽 confirm()、alert() 和 prompt() 等原生 JavaScript 对话框。WebBrain 的询问、执行和开发模式切换已不再依赖这些对话框,但少数次要操作仍然依赖。
录制: 暂时不要在 Vivaldi 中使用 /record。如果录制失败,Vivaldi 可能会隐藏错误提示,因而不会显示任何说明。
设置、历史记录、跟踪记录和 Ollama 交接: 这些页面也包含原生对话框,但 WebBrain 通常会在普通标签页中打开它们,因此可以正常工作。如果你手动把其中某个页面放进 Web Panel,请先在普通标签页中打开它,再使用依赖对话框的操作。
WebBrain 有三种模式。询问模式(默认)只读,无法修改页面内容。执行模式可进行点击、输入和导航等浏览器操作,开发模式则增加页面调试工具。会产生后果的操作默认需要批准;如果关闭该权限门控,WebBrain 会显示明显的警告横幅。你可以随时通过「停止」按钮停止代理。扩展源代码在 GitHub 上完全开放供审计。
为了可靠地在页面上执行操作,WebBrain 通过标准的 chrome.debugger 扩展 API 使用 Chrome DevTools Protocol(CDP)——这也是触发 Chrome「WebBrain started debugging this browser」横幅的原因。CDP 让代理能够以现代网站真正接受的可信输入事件进行点击和输入;从 content script 派发的合成事件会被许多网站、Web Components 以及由框架控制的输入字段拒绝。WebBrain 也借此为视觉回退捕获像素级精确的截图,并访问 content script 看不到的跨域 iframe 和 shadow DOM。
只读的询问模式不需要 CDP——页面和无障碍树的读取都通过普通的 content script 完成。需要它的是执行模式的可靠性和跨域操作;而在 Manifest V3 扩展中,没有任何无需调试器的 API 能提供可信输入。WebBrain 仅在某个操作需要时才按标签页附加调试器,而且整个扩展都是开源的,你可以审计会话究竟做了什么。CDP 很强大,因此我们把它的影响范围当作需要约束的东西(按需附加、读取不经过它),进一步收紧它已列入我们的安全路线图。
这些批准提示是为了保护你的安全。即使在你信任的网站上,恶意行为者也可能伪造 LLM 指令或注入内容,试图让代理代表你执行你不会同意的操作。因此,WebBrain 在执行有后果的操作之前始终需要你的批准。如果你仍然不想经过这些提示,也可以关闭它们:打开侧边插件,点击标题栏中的齿轮图标,进入 settings.html 的 Permissions 标签页,然后关闭 Ask before consequential actions 选项。
打开任意网页,打开 WebBrain 侧边栏,用自然语言提问:「提取本页面所有产品名称和价格」、「获取本页面所有邮箱地址」或「用要点总结这篇文章」。AI 代理会读取页面内容、理解结构并返回提取的数据。对于更复杂的抓取,切换到执行模式,代理可以在页面间导航、点击分页按钮,并在多个页面上聚合数据。
默认情况下,WebBrain 对任何会创建、修改、删除、发送、提交、发布或购买的操作,始终通过可见界面进行。它会导航到页面、填写表单、点击按钮 —— 完全像你一样操作。它拒绝在后台通过 fetch() 直接调用 REST/GraphQL 端点进行变更。这是刻意设计:API 操作是不可见的(你看不到发送了什么),通常需要你可能未配置的单独认证令牌,而且相比于一次可见的误点击,影响范围大得多。UI-first 意味着一切都在屏幕上、在你平时的浏览器会话中、并且可中断。
对于读取数据 —— 获取 README、查找议题、跨站比价、检查状态页 —— WebBrain 会自由地通过 fetch_url 和 research_url 工具发送后台 HTTP 请求。读取不等于操作;它不会改变远程服务上的任何东西,因此不存在同样的安全顾虑。
如果你希望在某个具体任务上允许 API 变更,请在消息开头输入 /allow-api(可以后跟一段简短的任务描述)。这个按会话生效的覆盖会让 WebBrain 在界面确实失败或不可用时回退到 API 端点,但只要界面可用仍优先使用界面。覆盖启用期间,输入区上方会显示一枚置顶徽章,重置会话后该标志会清除。
可以。WebBrain 的只读网络工具 —— fetch_url 和 research_url —— 也作为独立的 LM Studio 插件发布在 webbrain/web-tools。用 lms clone webbrain/web-tools 安装,然后在任意 LM Studio 聊天里开启 —— 任何支持工具调用的模型都能调用这两个工具,你不需要安装浏览器扩展。纯 Node,无 headless 浏览器。源码:lmstudio-plugin/。
大多数时候可以——尤其是在 Ask 模式下处理“总结此页面”之类的只读请求时。WebBrain 工作期间,你可以继续滚动。
什么时候不适合滚动? 自动截图反映的是标签页当前的视口。WebBrain 在 Act 或 Dev 模式下主动检查可见内容或与其交互时,滚动可能会移走目标或改变模型看到的内容。请先让该步骤完成再滚动;除此之外,你可以继续使用页面。
可以。从 27.0.0 起,除非确实需要前台访问,否则 WebBrain 在基于 Chromium 的浏览器和 Firefox 中都不会抢占焦点。任务会继续绑定到启动时的标签页,因此你可以放心地在另一个标签页中工作。
如果某个极少见的步骤需要将原标签页置于前台,WebBrain 可能会短暂聚焦该标签页。WebBrain 正在其中执行操作时,请避免在同一标签页点击或输入。
个人资料自动填写是 设置 → 个人资料 中的可选功能。你输入一段简短的自述 —— 姓名、工作邮箱、公司以及用于低风险注册的一次性密码 —— 然后将其打开。启用后,WebBrain 会将这段文本附加到代理的系统提示中,这样它就能无需每次询问即可填写注册表单。
该文本以明文保存在浏览器的本地存储中。它不会被传送到 WebBrain 项目,但会在每一轮作为系统提示的一部分发送给你配置的 LLM 提供商。默认关闭。
不要在此放置重要账户的密码(Google、Apple、iCloud、银行、公司 SSO、主邮箱)。这些账户应启用 2FA,而且本就不该交给代理。预期用途是你在订阅通讯和免费试用注册时反复使用的一次性密码。
不能——它只是降低了暴露风险,并不是保证。启用后(设置 → 多模态 → 截图打码,默认关闭),WebBrain 会在每张截图发送给视觉模型之前,对表单字段以及看起来像邮箱地址或电话号码的文本进行打码。检测完全在你的设备上通过 DOM 启发式方法运行;不会额外传输任何内容。
这是尽力而为且失败开放(fail-open)的处理。如果检测器无法在某个页面上运行——例如刚导航完成之后、在 PDF 查看器中,或在受限的浏览器页面上——截图仍会以未打码的原样发送,而不会中止你的任务。DOM 启发式方法看不到的内容(canvas 上绘制的文字、图片中的个人信息、不常见的组件)同样可能被遗漏。而且该设置只覆盖截图:发送给模型的页面文本不会被它打码。
若需要完全的视觉隐私,请使用本地模型。使用 llama.cpp 或 Ollama 等离线提供方时,截图和页面文本永远不会离开你的设备,因此从一开始就没有需要打码的内容——这是唯一能保证隐私的配置。参见上文的"我能完全离线使用 WebBrain 吗?"。
没有能运行支持视觉的本地模型的设备?一个不错的折中方案是:用一个体积小的本地模型负责规划和工具调用(轻量到普通 CPU/GPU 也能胜任),再搭配一个云端提供方负责视觉子调用,同时开启截图打码。这样你的对话和页面文本仍留在本地,而每一张发往云端视觉的截图都已先对表单字段和检测到的邮箱/电话进行了打码——在不需要完整本地视觉模型硬件的情况下减少了云端暴露。请在设置 → 视觉中配置这种拆分(参见上文的"WebBrain 如何控制云端 LLM 的账单?")。
Cookie 横幅:WebBrain 能识别常见框架(OneTrust、Cookiebot、Didomi、Quantcast、Google Funding Choices、TrustArc)的同意横幅,并在对页面进行推理之前将其关闭。当「全部拒绝」/「拒绝非必要」/「仅必要」清晰可见时优先选择这些选项;否则会退而点击「全部接受」,而不是陷入「管理偏好」的迷宫。
付费墙:WebBrain 会如实报告付费墙,并告诉你它实际看到了什么(标题、副标题、开头几段)。它不会尝试绕过付费墙 —— 不使用 archive.today、12ft.io、不清除 Cookie、不禁用 JS、不使用阅读模式小技巧。如果你想要完整文章,请使用订阅登录,或请 WebBrain 搜索同一报道的免费报道。
截至 7.0.0 版本, 还不支持。dry-run 模式已在路线图中, 后续会提供。
三个独立的层:
节省 token 的截图。在任何图像离开你的机器之前,WebBrain 会先缩放它(短边封顶,保持宽高比),然后迭代 JPEG 压缩直到适配每轮的图像 token 预算。一张 2000×1200 的截图,在 GPT-4o 上原本大约要花 1500 个输入 token,可被压缩到约 300–500 个 token,对页面阅读任务来说没有实际损失。实现位于 _fitImageDimensions,并有覆盖预算计算的单元测试。
智能上下文裁剪。对话历史、工具输出和内联 DOM 转储都会按每轮加以限制,当活跃模型的上下文窗口接近占满时,会从最早的内容开始裁剪。你不会看到一次运行因为一次 read_page 返回了一篇长篇大论,就从 1 万 token 悄悄膨胀到 10 万。
专用视觉模型。将便宜的文本模型(如 GPT-4o-mini)用于规划和工具调用,再配一个专门的视觉模型(如 GPT-4o)只用于截图,这样你不必在每一轮都支付多模态模型的价格。可在 设置 → 视觉 中配置。
结果:与云端提供商的长会话保持可预测。如需完全控制,请使用本地 llama.cpp —— 每 token 成本为零。
当然可以!WebBrain 采用 MIT 许可,欢迎贡献。请查看 GitHub 仓库 了解议题、功能请求和贡献指南。